CAST: Game Solvers as Turn-Level Teachers for LLM Agents Paper • 2607.25308 • Published 3 days ago • 27
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization Paper • 2607.25659 • Published 3 days ago • 73
A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning Paper • 2510.15444 • Published Oct 17, 2025 • 151
Singular Value Few-shot Adaptation of Vision-Language Models Paper • 2509.03740 • Published Sep 3, 2025 • 3