On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 8 days ago • 180
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation Paper • 2609.39687 • Published 6 days ago • 16
Video Generation Models: A Survey of Post-Training and Alignment Paper • 2610.00812 • Published 6 days ago • 56
GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis Paper • 2609.38923 • Published 6 days ago • 147
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning Paper • 2609.36820 • Published 7 days ago • 32
Beyond the Current Scene: Event-Referential Grasping with Active View Selection Paper • 2609.39375 • Published 6 days ago • 48