LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers Paper • 2608.06867 • Published Aug 7 • 114
What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems Paper • 2608.07565 • Published Aug 3 • 29
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published Aug 4 • 9
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing Paper • 2601.17814 • Published Jan 25
Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs Paper • 2404.10160 • Published Apr 15, 2024
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment Paper • 2503.18991 • Published Mar 23, 2025
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent Paper • 2608.03979 • Published Aug 4 • 54
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published Aug 4 • 9
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System Paper • 2607.27380 • Published Jul 29 • 75
CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition Paper • 2607.25294 • Published Jul 28 • 47