RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning Paper • 2610.09455 • Published 1 day ago • 17
PointWAM: 3D World Action Modeling for Dexterous Robotic Manipulation Paper • 2610.02840 • Published 6 days ago • 58
Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps Paper • 2603.23023 • Published Mar 24 • 22