PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents Paper • 2609.40285 • Published 9 days ago • 22
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents Paper • 2609.40325 • Published 9 days ago • 103
EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery Paper • 2609.40340 • Published 9 days ago • 110
Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence Paper • 2609.35432 • Published 11 days ago • 109
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents Paper • 2609.39982 • Published 9 days ago • 118
LEGO-Anything: Coding Agents for 3D Scene Reconstruction Paper • 2609.36380 • Published 11 days ago • 139
Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL Paper • 2609.32577 • Published 13 days ago • 133
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks Paper • 2609.38288 • Published 10 days ago • 142
YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality Paper • 2609.33757 • Published 12 days ago • 250
False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents Paper • 2609.39102 • Published 9 days ago • 676
Raven: The Harness of Harnesses for Composable Agentic Intelligence Paper • 2609.33439 • Published 12 days ago • 569
Skill-based Agentic Evaluation for Real-time Data Science Tasks Paper • 2609.16487 • Published 24 days ago • 2
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds Paper • 2609.30199 • Published 15 days ago • 30
JEPA-Anything: Learning Predictive Models across Different Worlds Paper • 2609.20800 • Published 22 days ago • 78
Language Models that Play Chess and Explain Their Moves Paper • 2610.03695 • Published 7 days ago • 36
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research Paper • 2610.02202 • Published 8 days ago • 13
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs Paper • 2609.31590 • Published 14 days ago • 13
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning Paper • 2609.38147 • Published 10 days ago • 1