Latent-Identity Tuning in Text-to-Image Personalization Models Paper • 2607.11885 • Published 19 days ago • 14
Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation Paper • 2606.30054 • Published Jun 29 • 4
Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models Paper • 2606.11324 • Published Jun 9 • 172
YoCausal: How Far is Video Generation from World Model? A Causality Perspective Paper • 2605.30346 • Published May 28 • 56
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)? Paper • 2605.30557 • Published May 28 • 12