The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation Paper • 2609.36484 • Published 4 days ago • 338
False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents Paper • 2609.39102 • Published 3 days ago • 256
Running on CPU Upgrade Featured 3.32k The Smol Training Playbook 📚 3.32k The secrets to building world-class LLMs
Edge0/Audio8-ASR-Infinite Automatic Speech Recognition • 4B • Updated 8 days ago • 36.8k • 2.31k