Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models Paper • 2609.34972 • Published 5 days ago • 30
WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models Paper • 2605.25077 • Published May 24 • 22