RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 11 days ago • 57
PaperGym: Rubric-Centered Evolution for Research-Plan Generation Paper • 2608.31119 • Published 28 days ago • 33
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning Paper • 2603.15611 • Published Mar 16 • 11