Key models for robotic computer vision, object grounding, 3D reconstruction, and sim-to-real transfer
-
nvidia/LocateAnything-3B
Image-Text-to-Text • 4B • Updated • 1.25M • 2.79k -
facebook/dinov2-large
Image Feature Extraction • 0.3B • Updated • 1.05M • 115 -
microsoft/Florence-2-large
Image-Text-to-Text • 0.8B • Updated • 788k • 1.84k -
facebook/sam2-hiera-large
Mask Generation • 0.2B • Updated • 18k • 140