$T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training
Paper • 2609.32791 • Published • 1
None defined yet.
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
Draft-KV: Learning Useful Latent Communication Between Language Models