PatronusAI/speedrunbench
Viewer • Updated • 63 • 234 • 5
LLM Evaluation
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis