Tetris3D: 3D Scene Generation With Objects That Fit Together Paper • 2610.10539 • Published 4 days ago • 44
GRACE: Generation-aware latent compression for efficient video generation Paper • 2610.10524 • Published 4 days ago • 76
Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction Paper • 2610.12299 • Published 3 days ago • 51
World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 10 days ago • 89
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents Paper • 2609.39982 • Published 11 days ago • 120
Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering Paper • 2609.38177 • Published 12 days ago • 74
MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation Paper • 2606.26087 • Published Jun 24 • 37
Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time Paper • 2606.15631 • Published Jun 14 • 17
Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization Paper • 2606.11180 • Published Jun 9 • 36