HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement Paper • 2607.18217 • Published 10 days ago • 59
Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models Paper • 2606.25041 • Published Jun 23 • 120
Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly? Paper • 2606.26428 • Published Jun 24 • 17
SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation Paper • 2606.28276 • Published Jun 26 • 15
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History Paper • 2606.08671 • Published Jun 23 • 46
PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation Paper • 2606.28128 • Published Jun 26 • 53
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents Paper • 2607.02255 • Published 28 days ago • 67
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Paper • 2607.06559 • Published 23 days ago • 95
PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation Paper • 2607.02515 • Published 28 days ago • 19
Attending to Multimodal Generation One Token at a Time Paper • 2607.03738 • Published 26 days ago • 10
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation Paper • 2607.06558 • Published 23 days ago • 79
Latent-Identity Tuning in Text-to-Image Personalization Models Paper • 2607.11885 • Published 17 days ago • 14
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model Paper • 2607.11643 • Published 17 days ago • 44
4D Human-Scene Reconstruction from Low-Overlap Captures Paper • 2607.09125 • Published 20 days ago • 53
VideoMDM: Towards 3D Human Motion Generation From 2D Supervision Paper • 2606.13364 • Published Jun 11 • 20
Representation Forcing for Bottleneck-Free Unified Multimodal Models Paper • 2605.31604 • Published May 29 • 63
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning Paper • 2605.28774 • Published May 27 • 93