VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering Paper • 2609.19879 • Published 15 days ago • 33
deepseek-ai/DeepSeek-V4.1-Flash Image-Text-to-Text • 763B • Updated about 10 hours ago • 748k • • 3.96k
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 23 days ago • 29
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness Paper • 2609.08183 • Published 24 days ago • 327
Using Grounded Theory for Agent Behavior Analysis at Scale Paper • 2608.30391 • Published Aug 31 • 19