Rubric Rewards from Item Response Theory
Paper • 2609.35646 • Published • 20
LLM, VLM, Inference Optimization, AI4Math, Watermarking
CPPO: Contrastive Perception for Vision Language Policy Optimization
From Segments to Scenes: Temporal Understanding in Autonomous Driving via Vision-Language Model