HumanCLAW: Can Vision-Language Models Act Through a Body? Paper • 2607.27180 • Published 4 days ago • 70
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence Paper • 2606.14777 • Published Jun 10 • 216
Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation Paper • 2512.03040 • Published Dec 2, 2025 • 7
Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds Paper • 2511.08892 • Published Nov 12, 2025 • 219
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling Paper • 2507.05240 • Published Jul 7, 2025 • 49