SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published 1 day ago • 10
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space Paper • 2607.25675 • Published 8 days ago • 65
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization Paper • 2607.25659 • Published 8 days ago • 83