AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs Paper • 2609.31590 • Published 5 days ago • 8
InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data Paper • 2609.31394 • Published 5 days ago • 18
Game Arena: Strategic LLM Evaluation in Competitive Environments Paper • 2609.31473 • Published 5 days ago • 8
PUBG Ally: A Conversational Embodied Agent as an AI Teammate Paper • 2609.29837 • Published 6 days ago • 23
World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal Paper • 2609.29964 • Published 6 days ago • 14
WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation Paper • 2609.30221 • Published 6 days ago • 45
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds Paper • 2609.30199 • Published 6 days ago • 23
Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms Paper • 2609.27321 • Published 7 days ago • 22
InternW0: A Foundational Physical World Model for Efficient Real-World Interactions Paper • 2609.27656 • Published 7 days ago • 14
Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings Paper • 2609.25165 • Published 9 days ago • 75
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay Paper • 2609.25001 • Published 9 days ago • 130
RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents Paper • 2609.22000 • Published 12 days ago • 79
OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation Paper • 2609.22069 • Published 12 days ago • 37
MintAct: A Unified Visual Agent for Digital Environments Paper • 2609.22083 • Published 12 days ago • 35
When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation Paper • 2609.20942 • Published 13 days ago • 9
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression Paper • 2609.19969 • Published 13 days ago • 190