ViQ: Text-Aligned Visual Quantized Representations at Any Resolution Paper • 2606.27313 • Published Jun 25 • 38
MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism Paper • 2606.07512 • Published Jun 5 • 40
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents Paper • 2604.07430 • Published Apr 8 • 181
UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference Image Paper • 2411.16106 • Published Nov 25, 2024 • 2