RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 6 days ago • 262
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 13 days ago • 11
Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers Paper • 2608.26762 • Published 11 days ago • 16
From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation Paper • 2610.02179 • Published 6 days ago • 11
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 11 days ago • 323
WorldAttention: An Efficient Attention Architecture for Interactive Video World Models Paper • 2609.34606 • Published 9 days ago • 49
LongLive-Plug: Once-for-All Distillation for Video Generation Paper • 2609.38154 • Published 8 days ago • 41