On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 6 days ago • 150
Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation Paper • 2609.38024 • Published 5 days ago • 45
World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 3 days ago • 70
Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States Paper • 2610.01415 • Published 3 days ago • 77