Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction Paper • 2607.20911 • Published 4 days ago • 20
Running 57 Don't Train the Model, Evolve the Harness 🌿 57 Evolving an agent's harness, not its model, on Harvey's LAB
DSWorld: A Data Science World Model for Efficient Autonomous Agents Paper • 2607.15901 • Published 10 days ago • 12
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning Paper • 2607.14777 • Published 11 days ago • 101
DrugGen 2: A disease-aware language model for enhancing drug discovery Paper • 2607.08404 • Published 18 days ago • 20
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL Paper • 2607.04412 • Published 22 days ago • 35
RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies Paper • 2607.04434 • Published 20 days ago • 15
SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use Paper • 2607.01874 • Published 25 days ago • 22
AgenticDataBench: A Comprehensive Benchmark for Data Agents Paper • 2607.01647 • Published 25 days ago • 37
AutoTrainess: Teaching Language Models to Improve Language Models Autonomously Paper • 2606.31551 • Published 27 days ago • 24
Evolution Fine-Tuning Collection Internalizing Discovery Capability into LLM • 10 items • Updated 25 days ago