Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective Paper • 2610.03185 • Published 7 days ago • 29
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published Sep 3 • 188