HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 3 days ago • 28
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 3 days ago • 75
SKILL-KD: Contrastive Skill Distillation for LLM Agents Paper • 2607.28048 • Published 5 days ago • 10
GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks Paper • 2608.03764 • Published 5 days ago • 24
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Paper • 2608.05139 • Published 4 days ago • 25
OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents Paper • 2608.05013 • Published 5 days ago • 32
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Paper • 2608.05102 • Published 4 days ago • 63
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? Paper • 2608.03874 • Published 5 days ago • 13
ExplainBench: Evaluating Code Explanations from Agents Paper • 2607.26451 • Published 11 days ago • 13
SkillJack: Persistent Skill Backdoors in Self-Evolving Agents Paper • 2608.03509 • Published 5 days ago • 22
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents Paper • 2608.04003 • Published 5 days ago • 31
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations Paper • 2607.28956 • Published 9 days ago • 94
Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures Paper • 2607.28802 • Published 10 days ago • 10
SWE-Touch: Benchmarking Coding Agents When Users Touch the Code Paper • 2608.02499 • Published 6 days ago • 24
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation Paper • 2608.02287 • Published 6 days ago • 30
Progressive Agent Skill Generation via Reinforcement Learning Paper • 2608.01678 • Published 6 days ago • 58
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Paper • 2608.01964 • Published 6 days ago • 159
Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale Paper • 2607.28074 • Published 10 days ago • 13
Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability Paper • 2607.26637 • Published 11 days ago • 13