Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening Paper • 2609.18708 • Published 19 days ago • 84
Negative Self-Distillation: Learning to Reason by Avoiding Flaws Paper • 2609.11699 • Published 25 days ago • 37
NSD: Negative Self-Distillation Collection Best NSD checkpoints for Qwen3 (1.7B, 4B, 8B). Online NSD supervised, MATH dataset. • 3 items • Updated Aug 8 • 2
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories Paper • 2605.21468 • Published May 20 • 51