RenderRank: Learning to Rerank Text with Compressed Visual Tokens Paper • 2609.35069 • Published 5 days ago • 7
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 30 days ago • 104
ProcessBench: Identifying Process Errors in Mathematical Reasoning Paper • 2412.06559 • Published Dec 9, 2024 • 87