M2RL Collection The SFT+RL+OPD model weights of paper "To mix or to merge: Toward multi-domain reinforcement learning for large language models" • 8 items • Updated 24 days ago • 2
AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing Paper • 2609.08936 • Published 24 days ago • 166
StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability? Paper • 2609.00787 • Published about 1 month ago • 19
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments Paper • 2609.04148 • Published 29 days ago • 248
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 29 days ago • 104
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 29 days ago • 104
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments Paper • 2608.14441 • Published Aug 14 • 29
NVIDIA Nemotron v3 Collection Open, Production-ready Enterprise Models • 33 items • Updated Aug 14 • 378
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design Paper • 2608.10299 • Published Aug 10 • 138
Qwen-AgentWorld: Language World Models for General Agents Paper • 2606.24597 • Published Jun 23 • 167
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses Paper • 2608.12307 • Published Aug 12 • 118
Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization Paper • 2607.10169 • Published Jul 11 • 14
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published Jul 8 • 144
ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration Paper • 2605.03042 • Published May 4 • 153
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic Paper • 2511.12159 • Published Nov 15, 2025
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes Paper • 2603.25562 • Published Mar 26 • 18
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes Paper • 2603.25562 • Published Mar 26 • 18