TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Paper • 2607.27205 • Published 1 day ago • 93
Length Penalties Make Chain-of-Thought Less Monitorable Paper • 2607.09786 • Published 22 days ago • 11
Unified Audio Intelligence Without Regressing on Text Intelligence Paper • 2607.05196 • Published 24 days ago • 23
TurboServe: Serving Streaming Video Generation Efficiently and Economically Paper • 2606.19271 • Published Jun 17 • 37
iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning Paper • 2605.31096 • Published May 29 • 7
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer Paper • 2605.30940 • Published May 29 • 38
PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers Paper • 2605.26730 • Published May 27 • 17
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players Paper • 2605.28816 • Published May 27 • 433