On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 8 days ago • 181
Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation Paper • 2609.38024 • Published 7 days ago • 58
World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 5 days ago • 78
Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States Paper • 2610.01415 • Published 5 days ago • 85