On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 6 days ago • 146
When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents Paper • 2609.32520 • Published 8 days ago • 14
Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes Paper • 2610.02117 • Published 3 days ago • 14
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation Paper • 2609.39687 • Published 4 days ago • 13