Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 12 days ago • 11
From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation Paper • 2610.02179 • Published 5 days ago • 10
Can Computation from Earlier Problems Help LLMs Solve New Ones? Paper • 2609.39394 • Published 6 days ago • 8
RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 5 days ago • 250
Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models Paper • 2609.39820 • Published 6 days ago • 13
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research Paper • 2610.02202 • Published 5 days ago • 12
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 8 days ago • 182