multimodal
updated
Image-Text-to-Text
• 2B • Updated • 1.96M
• 1.44k
Qwen/Qwen2.5-VL-7B-Instruct
Image-Text-to-Text
• 8B • Updated • 6.21M
• • 1.72k
google/gemma-3-27b-it-qat-q4_0-gguf
Image-Text-to-Text
• 27B • Updated • 397
• 405
google/paligemma2-3b-mix-224
Image-Text-to-Text
• 3B • Updated • 20.8k
• 60
HuggingFaceTB/SmolVLM2-256M-Video-Instruct
Image-Text-to-Text
• 0.3B • Updated • 41.6k
• 115
unsloth/Qwen2.5-VL-3B-Instruct-GGUF
Image-Text-to-Text
• 3B • Updated • 18.1k
• 30
Image-Text-to-Text
• 0.9B • Updated • 113k
• 85
14B • Updated • 1.94k
• 104
FastVLM: Efficient Vision Encoding for Vision Language Models
Paper
• 2412.13303
• Published • 77
Feature Extraction
• 0.9B • Updated • 99.3k
• 343
Qwen/Qwen3-VL-4B-Instruct
Image-Text-to-Text
• 4B • Updated • 3.32M
• • 482
PaddlePaddle/PaddleOCR-VL
Image-Text-to-Text
• 1.0B • Updated • 8.22k
• 1.66k
Image-Text-to-Text
• 3B • Updated • 430
• 117
Viewer
• Updated • 1.19k • 290
• 50
nvidia/NVIDIA-Nemotron-Parse-v1.2
Image-Text-to-Text
• 0.9B • Updated • 59.6k
• 71