RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation Paper • 2609.16900 • Published 11 days ago • 48
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 17 days ago • 29
Agentic Visual Generation: From Generative Models to Agentic Control Paper • 2609.06758 • Published 20 days ago • 34