In-Context Learning for Robots: Methods and Applications Paper • 2609.36012 • Published 3 days ago • 214
StoryEngine: A State-Grounded Agentic Framework for Video Storytelling Paper • 2609.33627 • Published 4 days ago • 11
Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents Paper • 2607.11433 • Published 7 days ago • 7
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses Paper • 2608.24876 • Published Aug 25 • 31
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Paper • 2608.27456 • Published Aug 27 • 88
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill Paper • 2608.11924 • Published Aug 12 • 110
EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments Paper • 2606.13681 • Published Jun 11 • 146
MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft Paper • 2605.30931 • Published May 29 • 10
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist Paper • 2511.08521 • Published Nov 11, 2025 • 39
On Path to Multimodal Generalist: General-Level and General-Bench Paper • 2505.04620 • Published May 7, 2025 • 84
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization Paper • 2503.23377 • Published Mar 30, 2025 • 57
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation Paper • 2503.24379 • Published Mar 31, 2025 • 76