PACT: Can Enterprise AI Assistants Be Trusted Under Pressure? Paper • 2609.18605 • Published 14 days ago • 41
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 21 days ago • 29
BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference Paper • 2609.04971 • Published 26 days ago • 43
Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale Invariance Paper • 2609.02373 • Published 28 days ago • 14
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes Paper • 2609.03796 • Published 27 days ago • 186
Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses Paper • 2608.08466 • Published Aug 9 • 14
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation Paper • 2608.17426 • Published Aug 18 • 161
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL Paper • 2608.17253 • Published Aug 19 • 100
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 286
Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing Paper • 2608.11660 • Published Aug 12 • 11
SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries Paper • 2608.05604 • Published Aug 6 • 81
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 266
Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents Paper • 2608.08389 • Published Aug 9 • 11
RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance Paper • 2608.09853 • Published Aug 10 • 16
From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models Paper • 2608.06020 • Published Aug 6 • 36
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published Aug 6 • 47