RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 5 days ago • 257
Tail-Influence Sampling for CVaR Policy Evaluation Paper • 2609.38096 • Published 7 days ago • 21
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 12 days ago • 11
QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models Paper • 2609.26425 • Published 8 days ago • 12
A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review Paper • 2609.39027 • Published 6 days ago • 73
Hierarchical Continuous Diffusion Language Models Paper • 2610.02193 • Published 5 days ago • 82
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 8 days ago • 185