Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 5 days ago • 213
Act First, Reason Later: Accelerating On-Policy Distillation for Multi-Turn Agents via Reference-Conditioned Inverse Dynamics Paper • 2609.36608 • Published 2 days ago • 6
PMOPD: Task Ordering, Cycling, and Parameter-Update Subspace Protection in Multi-Teacher On-Policy Distillation Paper • 2609.34605 • Published 3 days ago • 5
Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning Paper • 2608.19669 • Published 2 days ago • 5