SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper โข 2608.03092 โข Published 4 days ago โข 10
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization Paper โข 2607.25659 โข Published 11 days ago โข 83