File size: 100,157 Bytes
84c6e00 688bb88 84c6e00 88c467f 3fb5031 88c467f 917313f 688bb88 917313f 84c6e00 917313f 4bfd033 8ef427b 4bfd033 917313f 4bfd033 edbe732 4bfd033 688bb88 917313f 8ef427b 917313f 688bb88 8ef427b 2767eb4 688bb88 4bfd033 2767eb4 8ef427b 2767eb4 688bb88 4bfd033 2767eb4 8ef427b 2767eb4 688bb88 4bfd033 688bb88 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 148 149 150 151 152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 169 170 171 172 173 174 175 176 177 178 179 180 181 182 183 184 185 186 187 188 189 190 191 192 193 194 195 196 197 198 199 200 201 202 203 204 205 206 207 208 209 210 211 212 213 214 215 216 217 218 219 220 221 222 223 224 225 226 227 228 229 230 231 232 233 234 235 236 237 238 239 240 241 242 243 244 245 246 247 248 249 250 251 252 253 254 255 256 257 258 259 260 261 262 263 264 265 266 267 268 269 270 271 272 273 274 275 276 277 278 279 280 281 282 283 284 285 286 287 | ---
tags:
- vision-encoder-evaluation
- multimodal
- visual-tokenizer-benchmark
- checkpoints
- arxiv:2610.05413
---
<h1 align="center">A Strong Baseline for Evaluating Vision Encoders<br>in Multimodal Large Language Models</h1>
<p align="center">
Yilin Yang<sup>1,*</sup> ·
Jun-Tao Tang<sup>2,*</sup> ·
Kengyi Wang<sup>3</sup> ·
Siyuan Su<sup>3</sup> ·
Gaoyong Luo<sup>4</sup> ·
Mingda Chen<sup>1,†</sup>
</p>
<p align="center">
<sup>1</sup>School of Artificial Intelligence, Shanghai Jiao Tong University<br>
<sup>2</sup>Nanjing University ·
<sup>3</sup>Fudan University ·
<sup>4</sup>Independent Researcher<br>
<sup>*</sup>Equal contribution. <sup>†</sup>Corresponding author.
</p>
<p align="center">
<a href="https://arxiv.org/abs/2610.05413"><img src="https://img.shields.io/badge/arXiv-2610.05413-b31b1b" alt="Paper: arXiv 2610.05413"></a>
<a href="https://arxiv.org/pdf/2610.05413"><img src="https://img.shields.io/badge/Paper-PDF-red" alt="Paper PDF"></a>
<a href="https://github.com/JuntaoTang/MLLM-VisionEncoder-Eval"><img src="https://img.shields.io/badge/GitHub-Code-181717?logo=github" alt="GitHub code"></a>
<a href="https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main"><img src="https://img.shields.io/badge/Model_Zoo-Checkpoints-FFD21E" alt="Model zoo checkpoints"></a>
<a href="#citation"><img src="https://img.shields.io/badge/Citation-BibTeX-blue" alt="BibTeX citation"></a>
</p>
# Overview
This repository hosts the downstream MLLM checkpoints accompanying **[A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models](https://arxiv.org/abs/2610.05413)**.
# Model Zoo
This Model Zoo covers the **70 visual encoders used in our paper**: **43 language-supervised**, **22 self-supervised**, and **5 discrete** tokenizers.
The current release provides both pretraining and finetuning checkpoints for all **65 continuous vision encoders** with each of the three main language backbones.
## Training data
- **Pretrain Data — LCS-558K:** the image–text alignment dataset from [LLaVA-Pretrain](https://huggingface.co/datasets/liuhaotian/LLaVA-Pretrain), using `blip_laion_cc_sbu_558k.json`. This dataset is used for MLLM projector training.
- **Finetuning Data — LLaVA-v1.5 mix665k (filtered):** the [LLaVA-v1.5 instruction mixture](https://huggingface.co/datasets/liuhaotian/LLaVA-Instruct-150K/blob/main/llava_v1_5_mix665k.json), using `llava_v1_5_mix665k_drop_ge8kchars.json`. The training configuration removes 395 examples with at least 8,000 characters of conversation text.
## Downloads
- `Encoder weights` links to the original upstream vision encoder or visual tokenizer. Each encoder name links to its model or project page. Use these frozen encoder weights together with the corresponding Stage 1 projector or Stage 2 MLLM checkpoint, preserving the architecture, feature layer and preprocessing specified by that run's `config.json`.
- For Hugging Face models, retain the associated configuration and processor files. **Web-SSL MAE 3B** has sharded weights; its link opens the complete model repository.
- **DINOv3** requires acceptance of the upstream model's terms and authentication. The **RAEv2 DINOv3-L (k=7)** entry uses the same DINOv3-L/16 backbone with the project's k=7 intermediate-layer readout; its download is the backbone used to construct that representation.
- `projector` downloads the pretraining `mm_projector.bin`;
- `finetuned` opens the finetuned checkpoint directory, including model weights, configuration, and language-tokenizer files. The frozen vision encoder must be supplied separately using the matching architecture and weights recorded in `config.json`. Pretraining projector weights alone are not instruction-tuned MLLMs.
### [Qwen/Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct)
| Base LLM | Vision Encoder / Tokenizer | Encoder weights | Stage 1 Pretrained weights | Stage 2 Finetuned weights |
| --- | --- | --- | --- | --- |
| Qwen2.5-1.5B-Instruct | [PE-Core-G/14 (448)](https://huggingface.co/facebook/PE-Core-G14-448) | [encoder](https://huggingface.co/facebook/PE-Core-G14-448/resolve/main/PE-Core-G14-448.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/pe_core_g14_448/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/pe_core_g14_448/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-G/14 (378)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_bigG14_378px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_g14_378/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_g14_378/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-G/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_bigG14_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_g14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_g14_224/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-2.5B ViT-G/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/G14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_g14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_g14_224_2.5b/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-G/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_g-opt16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_g16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_g16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-G/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_g-opt16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_g16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_g16_256/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-H/14 (378)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_h14_378px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_h14_378/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_h14_378/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-2.5B ViT-H/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/h14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_h14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_h14_224_2.5b/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-v1.2 ViT-H/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/h14_v1.2_altogether.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_h14_224_v1.2/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_h14_224_v1.2/finetune) |
| Qwen2.5-1.5B-Instruct | [OpenAI CLIP ViT-L/14 (224)](https://huggingface.co/openai/clip-vit-large-patch14) | [encoder](https://huggingface.co/openai/clip-vit-large-patch14/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/clip_openai__l14/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/clip_openai__l14/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_l14_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_l14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_l14_224/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-2.5B ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/l14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_l14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_l14_224_2.5b/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-400M ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/l14_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_l14_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_l14_224_400m/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 So400m/l14 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m14_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_sm14_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_sm14_384/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 So400m/l14 (224)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m14_224.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_sm14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_sm14_224/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 So400m/l16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_sm16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_sm16_512/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 So400m/l16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_sm16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_sm16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 So400m/l16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_sm16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_sm16_256/finetune) |
| Qwen2.5-1.5B-Instruct | [PE-Lang-L/14 (448)](https://huggingface.co/facebook/PE-Lang-L14-448) | [encoder](https://huggingface.co/facebook/PE-Lang-L14-448/resolve/main/PE-Lang-L14-448.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/pe_lang_l14_448/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/pe_lang_l14_448/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-L/16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_l16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_l16_512/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-L/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_l16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_l16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-L/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_l16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_l16_256/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-M/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_m16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_m16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-M/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_m16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_m16_224/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2-mT5 ViT-M/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_m16_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_m16_224_mt5/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-B/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_b16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_b16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_b16_224/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-B/32 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_b32_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_b32_384/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_b32_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_b32_224/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2-mT5 ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_b32_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_b32_224_mt5/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-2.5B ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b16_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_b16_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_b16_224_2.5b/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-2.5B ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b32_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_b32_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_b32_224_2.5b/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-400M ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b16_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_b16_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_b16_224_400m/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP-400M ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b32_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc1_b32_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc1_b32_224_400m/finetune) |
| Qwen2.5-1.5B-Instruct | [PE-Core-B/16 (224)](https://huggingface.co/facebook/PE-Core-B16-224) | [encoder](https://huggingface.co/facebook/PE-Core-B16-224/resolve/main/PE-Core-B16-224.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/pe_core_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/pe_core_b16_224/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-B/16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_b16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_b16_512/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-B/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_b16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_b16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-B/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_b16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_b16_256/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-B/16 (224)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_224.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_b16_224/finetune) |
| Qwen2.5-1.5B-Instruct | [SigLIP2 ViT-B/32 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b32_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/siglip2_b32_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/siglip2_b32_256/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-S/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_s16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_s16_384/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2 ViT-S/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_s16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_s16_224/finetune) |
| Qwen2.5-1.5B-Instruct | [MetaCLIP 2-mT5 ViT-S/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/mc2_s16_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/mc2_s16_224_mt5/finetune) |
| Qwen2.5-1.5B-Instruct | [Web-SSL MAE 3B (224)](https://huggingface.co/facebook/webssl-mae3b-full2b-224) | [encoder files](https://huggingface.co/facebook/webssl-mae3b-full2b-224) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/webssl_mae3b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/webssl_mae3b_full2b_224/finetune) |
| Qwen2.5-1.5B-Instruct | [DINOv2 ViT-G/14](https://huggingface.co/facebook/dinov2-giant) | [encoder](https://huggingface.co/facebook/dinov2-giant/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dinov2_giant/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dinov2_giant/finetune) |
| Qwen2.5-1.5B-Instruct | [Web-SSL DINO 1B (224)](https://huggingface.co/facebook/webssl-dino1b-full2b-224) | [encoder files](https://huggingface.co/facebook/webssl-dino1b-full2b-224) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/webssl_dino1b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/webssl_dino1b_full2b_224/finetune) |
| Qwen2.5-1.5B-Instruct | [Web-SSL MAE 1B (224)](https://huggingface.co/facebook/webssl-mae1b-full2b-224) | [encoder](https://huggingface.co/facebook/webssl-mae1b-full2b-224/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/webssl_mae1b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/webssl_mae1b_full2b_224/finetune) |
| Qwen2.5-1.5B-Instruct | [Pixio ViT-H/16](https://huggingface.co/facebook/pixio-vith16) | [encoder](https://huggingface.co/facebook/pixio-vith16/resolve/main/pixio_vith16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/pixio_vith16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/pixio_vith16/finetune) |
| Qwen2.5-1.5B-Instruct | [I-JEPA ViT-H/14](https://github.com/facebookresearch/ijepa) | [encoder](https://dl.fbaipublicfiles.com/ijepa/IN1K-vit.h.14-300e.pth.tar) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/ijepa_vith14/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/ijepa_vith14/finetune) |
| Qwen2.5-1.5B-Instruct | [DINOv2 ViT-L/14](https://huggingface.co/facebook/dinov2-large) | [encoder](https://huggingface.co/facebook/dinov2-large/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dinov2_large/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dinov2_large/finetune) |
| Qwen2.5-1.5B-Instruct | [DINOv3 ViT-L/16](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m) | [encoder](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dinov3_vitl16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dinov3_vitl16/finetune) |
| Qwen2.5-1.5B-Instruct | [Pixio ViT-L/16](https://huggingface.co/facebook/pixio-vitl16) | [encoder](https://huggingface.co/facebook/pixio-vitl16/resolve/main/pixio_vitl16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/pixio_vitl16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/pixio_vitl16/finetune) |
| Qwen2.5-1.5B-Instruct | [RAEv2 DINOv3-L (k=7)](https://github.com/nanovisionx/RAEv2) | [DINOv3 backbone](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/raev2_dinov3l_k7/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/raev2_dinov3l_k7/finetune) |
| Qwen2.5-1.5B-Instruct | [Web-SSL MAE 300M (224)](https://huggingface.co/facebook/webssl-mae300m-full2b-224) | [encoder](https://huggingface.co/facebook/webssl-mae300m-full2b-224/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/webssl_mae300m_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/webssl_mae300m_full2b_224/finetune) |
| Qwen2.5-1.5B-Instruct | [EUPE ConvNeXt-B](https://huggingface.co/facebook/EUPE-ConvNeXt-B) | [encoder](https://huggingface.co/facebook/EUPE-ConvNeXt-B/resolve/main/EUPE-ConvNeXt-B.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/eupe_convnext_b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/eupe_convnext_b/finetune) |
| Qwen2.5-1.5B-Instruct | [DINOv2 ViT-B/14](https://huggingface.co/facebook/dinov2-base) | [encoder](https://huggingface.co/facebook/dinov2-base/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dinov2_base/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dinov2_base/finetune) |
| Qwen2.5-1.5B-Instruct | [DINO ViT-B/8](https://huggingface.co/facebook/dino-vitb8) | [encoder](https://huggingface.co/facebook/dino-vitb8/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dino_vitb8/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dino_vitb8/finetune) |
| Qwen2.5-1.5B-Instruct | [DINO ViT-B/16](https://huggingface.co/facebook/dino-vitb16) | [encoder](https://huggingface.co/facebook/dino-vitb16/resolve/main/pytorch_model.bin?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dino_vitb16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dino_vitb16/finetune) |
| Qwen2.5-1.5B-Instruct | [EUPE ViT-B](https://huggingface.co/facebook/EUPE-ViT-B) | [encoder](https://huggingface.co/facebook/EUPE-ViT-B/resolve/main/EUPE-ViT-B.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/eupe_vit_b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/eupe_vit_b/finetune) |
| Qwen2.5-1.5B-Instruct | [Pixio ViT-B/16](https://huggingface.co/facebook/pixio-vitb16) | [encoder](https://huggingface.co/facebook/pixio-vitb16/resolve/main/pixio_vitb16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/pixio_vitb16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/pixio_vitb16/finetune) |
| Qwen2.5-1.5B-Instruct | [DINOv2 ViT-S/14](https://huggingface.co/facebook/dinov2-small) | [encoder](https://huggingface.co/facebook/dinov2-small/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dinov2_small/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dinov2_small/finetune) |
| Qwen2.5-1.5B-Instruct | [DINO ViT-S/16](https://huggingface.co/facebook/dino-vits16) | [encoder](https://huggingface.co/facebook/dino-vits16/resolve/main/pytorch_model.bin?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dino_vits16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dino_vits16/finetune) |
| Qwen2.5-1.5B-Instruct | [EUPE ViT-S](https://huggingface.co/facebook/EUPE-ViT-S) | [encoder](https://huggingface.co/facebook/EUPE-ViT-S/resolve/main/EUPE-ViT-S.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/eupe_vit_s/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/eupe_vit_s/finetune) |
| Qwen2.5-1.5B-Instruct | [DINO ViT-S/8](https://huggingface.co/facebook/dino-vits8) | [encoder](https://huggingface.co/facebook/dino-vits8/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/dino_vits8/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/dino_vits8/finetune) |
| Qwen2.5-1.5B-Instruct | [EUPE ViT-T](https://huggingface.co/facebook/EUPE-ViT-T) | [encoder](https://huggingface.co/facebook/EUPE-ViT-T/resolve/main/EUPE-ViT-T.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen25/eupe_vit_t/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen25/eupe_vit_t/finetune) |
### [Qwen3-1.7B](https://huggingface.co/Qwen/Qwen3-1.7B)
| Base LLM | Vision Encoder / Tokenizer | Encoder weights | Stage 1 Pretrained weights | Stage 2 Finetuned weights |
| --- | --- | --- | --- | --- |
| Qwen3-1.7B | [PE-Core-G/14 (448)](https://huggingface.co/facebook/PE-Core-G14-448) | [encoder](https://huggingface.co/facebook/PE-Core-G14-448/resolve/main/PE-Core-G14-448.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/pe_core_g14_448/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/pe_core_g14_448/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-G/14 (378)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_bigG14_378px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_g14_378/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_g14_378/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-G/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_bigG14_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_g14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_g14_224/finetune) |
| Qwen3-1.7B | [MetaCLIP-2.5B ViT-G/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/G14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_g14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_g14_224_2.5b/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-G/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_g-opt16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_g16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_g16_384/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-G/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_g-opt16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_g16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_g16_256/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-H/14 (378)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_h14_378px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_h14_378/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_h14_378/finetune) |
| Qwen3-1.7B | [MetaCLIP-2.5B ViT-H/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/h14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_h14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_h14_224_2.5b/finetune) |
| Qwen3-1.7B | [MetaCLIP-v1.2 ViT-H/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/h14_v1.2_altogether.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_h14_224_v1.2/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_h14_224_v1.2/finetune) |
| Qwen3-1.7B | [OpenAI CLIP ViT-L/14 (224)](https://huggingface.co/openai/clip-vit-large-patch14) | [encoder](https://huggingface.co/openai/clip-vit-large-patch14/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/clip_openai__l14/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/clip_openai__l14/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_l14_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_l14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_l14_224/finetune) |
| Qwen3-1.7B | [MetaCLIP-2.5B ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/l14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_l14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_l14_224_2.5b/finetune) |
| Qwen3-1.7B | [MetaCLIP-400M ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/l14_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_l14_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_l14_224_400m/finetune) |
| Qwen3-1.7B | [SigLIP2 So400m/l14 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m14_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_sm14_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_sm14_384/finetune) |
| Qwen3-1.7B | [SigLIP2 So400m/l14 (224)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m14_224.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_sm14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_sm14_224/finetune) |
| Qwen3-1.7B | [SigLIP2 So400m/l16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_sm16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_sm16_512/finetune) |
| Qwen3-1.7B | [SigLIP2 So400m/l16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_sm16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_sm16_384/finetune) |
| Qwen3-1.7B | [SigLIP2 So400m/l16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_sm16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_sm16_256/finetune) |
| Qwen3-1.7B | [PE-Lang-L/14 (448)](https://huggingface.co/facebook/PE-Lang-L14-448) | [encoder](https://huggingface.co/facebook/PE-Lang-L14-448/resolve/main/PE-Lang-L14-448.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/pe_lang_l14_448/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/pe_lang_l14_448/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-L/16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_l16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_l16_512/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-L/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_l16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_l16_384/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-L/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_l16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_l16_256/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-M/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_m16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_m16_384/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-M/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_m16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_m16_224/finetune) |
| Qwen3-1.7B | [MetaCLIP 2-mT5 ViT-M/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_m16_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_m16_224_mt5/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-B/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_b16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_b16_384/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_b16_224/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-B/32 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_b32_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_b32_384/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_b32_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_b32_224/finetune) |
| Qwen3-1.7B | [MetaCLIP 2-mT5 ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_b32_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_b32_224_mt5/finetune) |
| Qwen3-1.7B | [MetaCLIP-2.5B ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b16_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_b16_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_b16_224_2.5b/finetune) |
| Qwen3-1.7B | [MetaCLIP-2.5B ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b32_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_b32_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_b32_224_2.5b/finetune) |
| Qwen3-1.7B | [MetaCLIP-400M ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b16_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_b16_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_b16_224_400m/finetune) |
| Qwen3-1.7B | [MetaCLIP-400M ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b32_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc1_b32_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc1_b32_224_400m/finetune) |
| Qwen3-1.7B | [PE-Core-B/16 (224)](https://huggingface.co/facebook/PE-Core-B16-224) | [encoder](https://huggingface.co/facebook/PE-Core-B16-224/resolve/main/PE-Core-B16-224.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/pe_core_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/pe_core_b16_224/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-B/16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_b16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_b16_512/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-B/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_b16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_b16_384/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-B/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_b16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_b16_256/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-B/16 (224)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_224.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_b16_224/finetune) |
| Qwen3-1.7B | [SigLIP2 ViT-B/32 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b32_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/siglip2_b32_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/siglip2_b32_256/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-S/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_s16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_s16_384/finetune) |
| Qwen3-1.7B | [MetaCLIP 2 ViT-S/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_s16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_s16_224/finetune) |
| Qwen3-1.7B | [MetaCLIP 2-mT5 ViT-S/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/mc2_s16_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/mc2_s16_224_mt5/finetune) |
| Qwen3-1.7B | [Web-SSL MAE 3B (224)](https://huggingface.co/facebook/webssl-mae3b-full2b-224) | [encoder files](https://huggingface.co/facebook/webssl-mae3b-full2b-224) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/webssl_mae3b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/webssl_mae3b_full2b_224/finetune) |
| Qwen3-1.7B | [DINOv2 ViT-G/14](https://huggingface.co/facebook/dinov2-giant) | [encoder](https://huggingface.co/facebook/dinov2-giant/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dinov2_giant/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dinov2_giant/finetune) |
| Qwen3-1.7B | [Web-SSL DINO 1B (224)](https://huggingface.co/facebook/webssl-dino1b-full2b-224) | [encoder files](https://huggingface.co/facebook/webssl-dino1b-full2b-224) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/webssl_dino1b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/webssl_dino1b_full2b_224/finetune) |
| Qwen3-1.7B | [Web-SSL MAE 1B (224)](https://huggingface.co/facebook/webssl-mae1b-full2b-224) | [encoder](https://huggingface.co/facebook/webssl-mae1b-full2b-224/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/webssl_mae1b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/webssl_mae1b_full2b_224/finetune) |
| Qwen3-1.7B | [Pixio ViT-H/16](https://huggingface.co/facebook/pixio-vith16) | [encoder](https://huggingface.co/facebook/pixio-vith16/resolve/main/pixio_vith16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/pixio_vith16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/pixio_vith16/finetune) |
| Qwen3-1.7B | [I-JEPA ViT-H/14](https://github.com/facebookresearch/ijepa) | [encoder](https://dl.fbaipublicfiles.com/ijepa/IN1K-vit.h.14-300e.pth.tar) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/ijepa_vith14/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/ijepa_vith14/finetune) |
| Qwen3-1.7B | [DINOv2 ViT-L/14](https://huggingface.co/facebook/dinov2-large) | [encoder](https://huggingface.co/facebook/dinov2-large/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dinov2_large/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dinov2_large/finetune) |
| Qwen3-1.7B | [DINOv3 ViT-L/16](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m) | [encoder](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dinov3_vitl16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dinov3_vitl16/finetune) |
| Qwen3-1.7B | [Pixio ViT-L/16](https://huggingface.co/facebook/pixio-vitl16) | [encoder](https://huggingface.co/facebook/pixio-vitl16/resolve/main/pixio_vitl16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/pixio_vitl16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/pixio_vitl16/finetune) |
| Qwen3-1.7B | [RAEv2 DINOv3-L (k=7)](https://github.com/nanovisionx/RAEv2) | [DINOv3 backbone](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/raev2_dinov3l_k7/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/raev2_dinov3l_k7/finetune) |
| Qwen3-1.7B | [Web-SSL MAE 300M (224)](https://huggingface.co/facebook/webssl-mae300m-full2b-224) | [encoder](https://huggingface.co/facebook/webssl-mae300m-full2b-224/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/webssl_mae300m_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/webssl_mae300m_full2b_224/finetune) |
| Qwen3-1.7B | [EUPE ConvNeXt-B](https://huggingface.co/facebook/EUPE-ConvNeXt-B) | [encoder](https://huggingface.co/facebook/EUPE-ConvNeXt-B/resolve/main/EUPE-ConvNeXt-B.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/eupe_convnext_b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/eupe_convnext_b/finetune) |
| Qwen3-1.7B | [DINOv2 ViT-B/14](https://huggingface.co/facebook/dinov2-base) | [encoder](https://huggingface.co/facebook/dinov2-base/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dinov2_base/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dinov2_base/finetune) |
| Qwen3-1.7B | [DINO ViT-B/8](https://huggingface.co/facebook/dino-vitb8) | [encoder](https://huggingface.co/facebook/dino-vitb8/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dino_vitb8/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dino_vitb8/finetune) |
| Qwen3-1.7B | [DINO ViT-B/16](https://huggingface.co/facebook/dino-vitb16) | [encoder](https://huggingface.co/facebook/dino-vitb16/resolve/main/pytorch_model.bin?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dino_vitb16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dino_vitb16/finetune) |
| Qwen3-1.7B | [EUPE ViT-B](https://huggingface.co/facebook/EUPE-ViT-B) | [encoder](https://huggingface.co/facebook/EUPE-ViT-B/resolve/main/EUPE-ViT-B.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/eupe_vit_b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/eupe_vit_b/finetune) |
| Qwen3-1.7B | [Pixio ViT-B/16](https://huggingface.co/facebook/pixio-vitb16) | [encoder](https://huggingface.co/facebook/pixio-vitb16/resolve/main/pixio_vitb16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/pixio_vitb16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/pixio_vitb16/finetune) |
| Qwen3-1.7B | [DINOv2 ViT-S/14](https://huggingface.co/facebook/dinov2-small) | [encoder](https://huggingface.co/facebook/dinov2-small/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dinov2_small/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dinov2_small/finetune) |
| Qwen3-1.7B | [DINO ViT-S/16](https://huggingface.co/facebook/dino-vits16) | [encoder](https://huggingface.co/facebook/dino-vits16/resolve/main/pytorch_model.bin?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dino_vits16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dino_vits16/finetune) |
| Qwen3-1.7B | [EUPE ViT-S](https://huggingface.co/facebook/EUPE-ViT-S) | [encoder](https://huggingface.co/facebook/EUPE-ViT-S/resolve/main/EUPE-ViT-S.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/eupe_vit_s/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/eupe_vit_s/finetune) |
| Qwen3-1.7B | [DINO ViT-S/8](https://huggingface.co/facebook/dino-vits8) | [encoder](https://huggingface.co/facebook/dino-vits8/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/dino_vits8/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/dino_vits8/finetune) |
| Qwen3-1.7B | [EUPE ViT-T](https://huggingface.co/facebook/EUPE-ViT-T) | [encoder](https://huggingface.co/facebook/EUPE-ViT-T/resolve/main/EUPE-ViT-T.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/qwen3/eupe_vit_t/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/qwen3/eupe_vit_t/finetune) |
### [SmolLM2-1.7B-Instruct](https://huggingface.co/HuggingFaceTB/SmolLM2-1.7B-Instruct)
| Base LLM | Vision Encoder / Tokenizer | Encoder weights | Stage 1 Pretrained weights | Stage 2 Finetuned weights |
| --- | --- | --- | --- | --- |
| SmolLM2-1.7B-Instruct | [PE-Core-G/14 (448)](https://huggingface.co/facebook/PE-Core-G14-448) | [encoder](https://huggingface.co/facebook/PE-Core-G14-448/resolve/main/PE-Core-G14-448.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/pe_core_g14_448/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/pe_core_g14_448/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-G/14 (378)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_bigG14_378px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_g14_378/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_g14_378/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-G/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_bigG14_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_g14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_g14_224/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-2.5B ViT-G/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/G14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_g14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_g14_224_2.5b/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-G/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_g-opt16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_g16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_g16_384/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-G/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_g-opt16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_g16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_g16_256/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-H/14 (378)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_h14_378px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_h14_378/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_h14_378/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-2.5B ViT-H/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/h14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_h14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_h14_224_2.5b/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-v1.2 ViT-H/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/h14_v1.2_altogether.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_h14_224_v1.2/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_h14_224_v1.2/finetune) |
| SmolLM2-1.7B-Instruct | [OpenAI CLIP ViT-L/14 (224)](https://huggingface.co/openai/clip-vit-large-patch14) | [encoder](https://huggingface.co/openai/clip-vit-large-patch14/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/clip_openai__l14/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/clip_openai__l14/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_l14_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_l14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_l14_224/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-2.5B ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/l14_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_l14_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_l14_224_2.5b/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-400M ViT-L/14 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/l14_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_l14_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_l14_224_400m/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 So400m/l14 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m14_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_sm14_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_sm14_384/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 So400m/l14 (224)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m14_224.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_sm14_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_sm14_224/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 So400m/l16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_sm16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_sm16_512/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 So400m/l16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_sm16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_sm16_384/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 So400m/l16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_so400m16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_sm16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_sm16_256/finetune) |
| SmolLM2-1.7B-Instruct | [PE-Lang-L/14 (448)](https://huggingface.co/facebook/PE-Lang-L14-448) | [encoder](https://huggingface.co/facebook/PE-Lang-L14-448/resolve/main/PE-Lang-L14-448.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/pe_lang_l14_448/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/pe_lang_l14_448/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-L/16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_l16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_l16_512/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-L/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_l16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_l16_384/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-L/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_l16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_l16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_l16_256/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-M/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_m16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_m16_384/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-M/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_m16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_m16_224/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2-mT5 ViT-M/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_m16_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_m16_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_m16_224_mt5/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-B/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_b16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_b16_384/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_b16_224/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-B/32 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_b32_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_b32_384/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_b32_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_b32_224/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2-mT5 ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_b32_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_b32_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_b32_224_mt5/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-2.5B ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b16_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_b16_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_b16_224_2.5b/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-2.5B ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b32_fullcc2.5b.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_b32_224_2.5b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_b32_224_2.5b/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-400M ViT-B/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b16_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_b16_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_b16_224_400m/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP-400M ViT-B/32 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/b32_400m.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc1_b32_224_400m/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc1_b32_224_400m/finetune) |
| SmolLM2-1.7B-Instruct | [PE-Core-B/16 (224)](https://huggingface.co/facebook/PE-Core-B16-224) | [encoder](https://huggingface.co/facebook/PE-Core-B16-224/resolve/main/PE-Core-B16-224.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/pe_core_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/pe_core_b16_224/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-B/16 (512)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_512.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_b16_512/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_b16_512/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-B/16 (384)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_384.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_b16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_b16_384/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-B/16 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_b16_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_b16_256/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-B/16 (224)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b16_224.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_b16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_b16_224/finetune) |
| SmolLM2-1.7B-Instruct | [SigLIP2 ViT-B/32 (256)](https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/image_text/README_siglip2.md) | [encoder](https://storage.googleapis.com/big_vision/siglip2/siglip2_b32_256.npz) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/siglip2_b32_256/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/siglip2_b32_256/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-S/16 (384)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_384px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_s16_384/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_s16_384/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2 ViT-S/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_224px_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_s16_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_s16_224/finetune) |
| SmolLM2-1.7B-Instruct | [MetaCLIP 2-mT5 ViT-S/16 (224)](https://github.com/facebookresearch/MetaCLIP#pre-trained-models) | [encoder](https://dl.fbaipublicfiles.com/MMPT/metaclip/metaclip2_s16_224px_mt5_worldwide.pt) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/mc2_s16_224_mt5/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/mc2_s16_224_mt5/finetune) |
| SmolLM2-1.7B-Instruct | [Web-SSL MAE 3B (224)](https://huggingface.co/facebook/webssl-mae3b-full2b-224) | [encoder files](https://huggingface.co/facebook/webssl-mae3b-full2b-224) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/webssl_mae3b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/webssl_mae3b_full2b_224/finetune) |
| SmolLM2-1.7B-Instruct | [DINOv2 ViT-G/14](https://huggingface.co/facebook/dinov2-giant) | [encoder](https://huggingface.co/facebook/dinov2-giant/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dinov2_giant/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dinov2_giant/finetune) |
| SmolLM2-1.7B-Instruct | [Web-SSL DINO 1B (224)](https://huggingface.co/facebook/webssl-dino1b-full2b-224) | [encoder files](https://huggingface.co/facebook/webssl-dino1b-full2b-224) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/webssl_dino1b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/webssl_dino1b_full2b_224/finetune) |
| SmolLM2-1.7B-Instruct | [Web-SSL MAE 1B (224)](https://huggingface.co/facebook/webssl-mae1b-full2b-224) | [encoder](https://huggingface.co/facebook/webssl-mae1b-full2b-224/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/webssl_mae1b_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/webssl_mae1b_full2b_224/finetune) |
| SmolLM2-1.7B-Instruct | [Pixio ViT-H/16](https://huggingface.co/facebook/pixio-vith16) | [encoder](https://huggingface.co/facebook/pixio-vith16/resolve/main/pixio_vith16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/pixio_vith16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/pixio_vith16/finetune) |
| SmolLM2-1.7B-Instruct | [I-JEPA ViT-H/14](https://github.com/facebookresearch/ijepa) | [encoder](https://dl.fbaipublicfiles.com/ijepa/IN1K-vit.h.14-300e.pth.tar) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/ijepa_vith14/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/ijepa_vith14/finetune) |
| SmolLM2-1.7B-Instruct | [DINOv2 ViT-L/14](https://huggingface.co/facebook/dinov2-large) | [encoder](https://huggingface.co/facebook/dinov2-large/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dinov2_large/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dinov2_large/finetune) |
| SmolLM2-1.7B-Instruct | [DINOv3 ViT-L/16](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m) | [encoder](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dinov3_vitl16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dinov3_vitl16/finetune) |
| SmolLM2-1.7B-Instruct | [Pixio ViT-L/16](https://huggingface.co/facebook/pixio-vitl16) | [encoder](https://huggingface.co/facebook/pixio-vitl16/resolve/main/pixio_vitl16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/pixio_vitl16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/pixio_vitl16/finetune) |
| SmolLM2-1.7B-Instruct | [RAEv2 DINOv3-L (k=7)](https://github.com/nanovisionx/RAEv2) | [DINOv3 backbone](https://huggingface.co/facebook/dinov3-vitl16-pretrain-lvd1689m/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/raev2_dinov3l_k7/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/raev2_dinov3l_k7/finetune) |
| SmolLM2-1.7B-Instruct | [Web-SSL MAE 300M (224)](https://huggingface.co/facebook/webssl-mae300m-full2b-224) | [encoder](https://huggingface.co/facebook/webssl-mae300m-full2b-224/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/webssl_mae300m_full2b_224/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/webssl_mae300m_full2b_224/finetune) |
| SmolLM2-1.7B-Instruct | [EUPE ConvNeXt-B](https://huggingface.co/facebook/EUPE-ConvNeXt-B) | [encoder](https://huggingface.co/facebook/EUPE-ConvNeXt-B/resolve/main/EUPE-ConvNeXt-B.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/eupe_convnext_b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/eupe_convnext_b/finetune) |
| SmolLM2-1.7B-Instruct | [DINOv2 ViT-B/14](https://huggingface.co/facebook/dinov2-base) | [encoder](https://huggingface.co/facebook/dinov2-base/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dinov2_base/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dinov2_base/finetune) |
| SmolLM2-1.7B-Instruct | [DINO ViT-B/8](https://huggingface.co/facebook/dino-vitb8) | [encoder](https://huggingface.co/facebook/dino-vitb8/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dino_vitb8/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dino_vitb8/finetune) |
| SmolLM2-1.7B-Instruct | [DINO ViT-B/16](https://huggingface.co/facebook/dino-vitb16) | [encoder](https://huggingface.co/facebook/dino-vitb16/resolve/main/pytorch_model.bin?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dino_vitb16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dino_vitb16/finetune) |
| SmolLM2-1.7B-Instruct | [EUPE ViT-B](https://huggingface.co/facebook/EUPE-ViT-B) | [encoder](https://huggingface.co/facebook/EUPE-ViT-B/resolve/main/EUPE-ViT-B.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/eupe_vit_b/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/eupe_vit_b/finetune) |
| SmolLM2-1.7B-Instruct | [Pixio ViT-B/16](https://huggingface.co/facebook/pixio-vitb16) | [encoder](https://huggingface.co/facebook/pixio-vitb16/resolve/main/pixio_vitb16.pth?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/pixio_vitb16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/pixio_vitb16/finetune) |
| SmolLM2-1.7B-Instruct | [DINOv2 ViT-S/14](https://huggingface.co/facebook/dinov2-small) | [encoder](https://huggingface.co/facebook/dinov2-small/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dinov2_small/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dinov2_small/finetune) |
| SmolLM2-1.7B-Instruct | [DINO ViT-S/16](https://huggingface.co/facebook/dino-vits16) | [encoder](https://huggingface.co/facebook/dino-vits16/resolve/main/pytorch_model.bin?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dino_vits16/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dino_vits16/finetune) |
| SmolLM2-1.7B-Instruct | [EUPE ViT-S](https://huggingface.co/facebook/EUPE-ViT-S) | [encoder](https://huggingface.co/facebook/EUPE-ViT-S/resolve/main/EUPE-ViT-S.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/eupe_vit_s/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/eupe_vit_s/finetune) |
| SmolLM2-1.7B-Instruct | [DINO ViT-S/8](https://huggingface.co/facebook/dino-vits8) | [encoder](https://huggingface.co/facebook/dino-vits8/resolve/main/model.safetensors?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/dino_vits8/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/dino_vits8/finetune) |
| SmolLM2-1.7B-Instruct | [EUPE ViT-T](https://huggingface.co/facebook/EUPE-ViT-T) | [encoder](https://huggingface.co/facebook/EUPE-ViT-T/resolve/main/EUPE-ViT-T.pt?download=true) | [projector](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/resolve/main/continuous/smollm2/eupe_vit_t/pretrain/mm_projector.bin) | [finetuned](https://huggingface.co/336labs/VisionEncoder-to-MLLM-ModelZoo/tree/main/continuous/smollm2/eupe_vit_t/finetune) |
## Citation
If you use RAVEL or this model zoo, please cite:
```bibtex
@misc{yang2026strong,
title={A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models},
author={Yang, Yilin and Tang, Jun-Tao and Wang, Kengyi and Su, Siyuan and Luo, Gaoyong and Chen, Mingda},
year={2026},
eprint={2610.05413},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2610.05413}
}
```
|