Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 23 days ago • 101
Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs Paper • 2609.02548 • Published 24 days ago • 1