RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 7 days ago • 56
PaperGym: Rubric-Centered Evolution for Research-Plan Generation Paper • 2608.31119 • Published 24 days ago • 33
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning Paper • 2603.15611 • Published Mar 16 • 11
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning Paper • 2603.15611 • Published Mar 16 • 11