SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published 1 day ago • 10
Running Agents Featured 255 PaddleOCR-VL Online Demo 📈 255 Extract text, tables, formulas, and charts from images