A Strong Baseline for Evaluating Vision Encoders
in Multimodal Large Language Models

Yilin Yang1,*  ·  Jun-Tao Tang2,*  ·  Kengyi Wang3 ·  Siyuan Su3  ·  Gaoyong Luo4  ·  Mingda Chen1,†

1School of Artificial Intelligence, Shanghai Jiao Tong University
2Nanjing University  ·  3Fudan University  ·  4Independent Researcher
*Equal contribution.   †Corresponding author.

Paper: arXiv 2610.05413 Paper PDF GitHub code Model zoo checkpoints BibTeX citation

Overview

This repository hosts the downstream MLLM evaluation checkpoints accompanying A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models.

The study evaluates 70 vision encoders with three main language backbones. The released checkpoints are organized by language backbone, vision encoder and training stage; links to the original frozen encoder weights appear alongside the corresponding MLLM weights below.

Model Zoo

This Model Zoo covers the 70 visual tokenizers used in our paper: 43 language-supervised, 22 self-supervised, and 5 discrete tokenizers. The current release provides both pretraining and finetuning checkpoints for all 65 continuous tokenizers with each of the three main language backbones, plus 2 Qwen3-1.7B-Base runs. The 5 discrete tokenizers are listed separately with their checkpoint availability.

Training data and checkpoint types

  • Pretrain Data — LCS-558K: the image–text alignment dataset from LLaVA-Pretrain, using blip_laion_cc_sbu_558k.json. This dataset is used for MLLM projector training.
  • Finetuning Data — LLaVA-v1.5 mix665k (filtered): the LLaVA-v1.5 instruction mixture, using llava_v1_5_mix665k_drop_ge8kchars.json. The training configuration removes 395 examples with at least 8,000 characters of conversation text.
  • Download: projector downloads the pretraining mm_projector.bin; finetuned opens the finetuned checkpoint directory, including model weights, configuration, and language-tokenizer files. The frozen vision encoder must be supplied separately using the matching architecture and weights recorded in config.json. Pretraining projector weights alone are not instruction-tuned MLLMs.

Vision encoder downloads

The Encoder weights column links to the original upstream vision encoder or visual tokenizer. Each encoder name links to its model or project page. Use these frozen encoder weights together with the corresponding Stage 1 projector or Stage 2 MLLM checkpoint, preserving the architecture, feature layer and preprocessing specified by that run's config.json.

  • For Hugging Face models, retain the associated configuration and processor files. Web-SSL MAE 3B has sharded weights; its link opens the complete model repository.
  • DINOv3 requires acceptance of the upstream model's terms and authentication. The RAEv2 DINOv3-L (k=7) entry uses the same DINOv3-L/16 backbone with the project's k=7 intermediate-layer readout; its download is the backbone used to construct that representation.
  • TokLIP-S/L require both the encoder checkpoint and the linked VQ checkpoint. For UniAR and VILA-U, retain the config files alongside the weights in the respective bsq_encoder/ and vision_tower/ directories.

Qwen2.5-1.5B-Instruct

Base LLM: Qwen/Qwen2.5-1.5B-Instruct. 65 tokenizers, each with pretraining and finetuning checkpoints.

Base LLM Vision Encoder / Tokenizer Encoder weights Stage 1 Pretrained weights Stage 2 Finetuned weights
Qwen2.5-1.5B-Instruct PE-Core-G/14 (448) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-G/14 (378) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-G/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-G/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-G/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-G/16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-H/14 (378) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-H/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-v1.2 ViT-H/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct OpenAI CLIP ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-400M ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l14 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l16 (512) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct PE-Lang-L/14 (448) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-L/16 (512) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-L/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-L/16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-M/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-M/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2-mT5 ViT-M/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/32 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2-mT5 ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-400M ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-400M ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct PE-Core-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (512) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/32 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-S/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-S/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2-mT5 ViT-S/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL MAE 3B (224) encoder files projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-G/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL DINO 1B (224) encoder files projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL MAE 1B (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct Pixio ViT-H/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct I-JEPA ViT-H/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-L/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv3 ViT-L/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct Pixio ViT-L/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct RAEv2 DINOv3-L (k=7) DINOv3 backbone projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL MAE 300M (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ConvNeXt-B encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-B/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-B/8 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-B/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ViT-B encoder projector finetuned
Qwen2.5-1.5B-Instruct Pixio ViT-B/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-S/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-S/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ViT-S encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-S/8 encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ViT-T encoder projector finetuned

Qwen3-1.7B

Base LLM: Qwen/Qwen3-1.7B. 65 tokenizers, each with pretraining and finetuning checkpoints.

Base LLM Vision Encoder / Tokenizer Encoder weights Stage 1 Pretrained weights Stage 2 Finetuned weights
Qwen3-1.7B PE-Core-G/14 (448) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-G/14 (378) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-G/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-G/14 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-G/16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-G/16 (256) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-H/14 (378) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-H/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-v1.2 ViT-H/14 (224) encoder projector finetuned
Qwen3-1.7B OpenAI CLIP ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-400M ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l14 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l14 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l16 (512) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l16 (256) encoder projector finetuned
Qwen3-1.7B PE-Lang-L/14 (448) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-L/16 (512) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-L/16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-L/16 (256) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-M/16 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-M/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2-mT5 ViT-M/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/16 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/32 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2-mT5 ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-400M ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-400M ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B PE-Core-B/16 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (512) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (256) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/32 (256) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-S/16 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-S/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2-mT5 ViT-S/16 (224) encoder projector finetuned
Qwen3-1.7B Web-SSL MAE 3B (224) encoder files projector finetuned
Qwen3-1.7B DINOv2 ViT-G/14 encoder projector finetuned
Qwen3-1.7B Web-SSL DINO 1B (224) encoder files projector finetuned
Qwen3-1.7B Web-SSL MAE 1B (224) encoder projector finetuned
Qwen3-1.7B Pixio ViT-H/16 encoder projector finetuned
Qwen3-1.7B I-JEPA ViT-H/14 encoder projector finetuned
Qwen3-1.7B DINOv2 ViT-L/14 encoder projector finetuned
Qwen3-1.7B DINOv3 ViT-L/16 encoder projector finetuned
Qwen3-1.7B Pixio ViT-L/16 encoder projector finetuned
Qwen3-1.7B RAEv2 DINOv3-L (k=7) DINOv3 backbone projector finetuned
Qwen3-1.7B Web-SSL MAE 300M (224) encoder projector finetuned
Qwen3-1.7B EUPE ConvNeXt-B encoder projector finetuned
Qwen3-1.7B DINOv2 ViT-B/14 encoder projector finetuned
Qwen3-1.7B DINO ViT-B/8 encoder projector finetuned
Qwen3-1.7B DINO ViT-B/16 encoder projector finetuned
Qwen3-1.7B EUPE ViT-B encoder projector finetuned
Qwen3-1.7B Pixio ViT-B/16 encoder projector finetuned
Qwen3-1.7B DINOv2 ViT-S/14 encoder projector finetuned
Qwen3-1.7B DINO ViT-S/16 encoder projector finetuned
Qwen3-1.7B EUPE ViT-S encoder projector finetuned
Qwen3-1.7B DINO ViT-S/8 encoder projector finetuned
Qwen3-1.7B EUPE ViT-T encoder projector finetuned

SmolLM2-1.7B-Instruct

Base LLM: HuggingFaceTB/SmolLM2-1.7B-Instruct. 65 tokenizers, each with pretraining and finetuning checkpoints.

Base LLM Vision Encoder / Tokenizer Encoder weights Stage 1 Pretrained weights Stage 2 Finetuned weights
SmolLM2-1.7B-Instruct PE-Core-G/14 (448) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-G/14 (378) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-G/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-G/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-G/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-G/16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-H/14 (378) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-H/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-v1.2 ViT-H/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct OpenAI CLIP ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-400M ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l14 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l16 (512) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct PE-Lang-L/14 (448) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-L/16 (512) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-L/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-L/16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-M/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-M/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2-mT5 ViT-M/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/32 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2-mT5 ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-400M ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-400M ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct PE-Core-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (512) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/32 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-S/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-S/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2-mT5 ViT-S/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct Web-SSL MAE 3B (224) encoder files projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-G/14 encoder projector finetuned
SmolLM2-1.7B-Instruct Web-SSL DINO 1B (224) encoder files projector finetuned
SmolLM2-1.7B-Instruct Web-SSL MAE 1B (224) encoder projector finetuned
SmolLM2-1.7B-Instruct Pixio ViT-H/16 encoder projector finetuned
SmolLM2-1.7B-Instruct I-JEPA ViT-H/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-L/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv3 ViT-L/16 encoder projector finetuned
SmolLM2-1.7B-Instruct Pixio ViT-L/16 encoder projector finetuned
SmolLM2-1.7B-Instruct RAEv2 DINOv3-L (k=7) DINOv3 backbone projector finetuned
SmolLM2-1.7B-Instruct Web-SSL MAE 300M (224) encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ConvNeXt-B encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-B/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-B/8 encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-B/16 encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ViT-B encoder projector finetuned
SmolLM2-1.7B-Instruct Pixio ViT-B/16 encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-S/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-S/16 encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ViT-S encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-S/8 encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ViT-T encoder projector finetuned

Discrete tokenizers in the paper

Vision Tokenizer Encoder weights MLLM checkpoint availability
UniTok-Attn (256) encoder Not released in this repository
UniAR-BSQ encoder Not released in this repository
TokLIP-L (384) encoder · VQ Not released in this repository
TokLIP-S (256) encoder · VQ Not released in this repository
VILA-U (256) encoder Not released in this repository

Download

from huggingface_hub import snapshot_download

snapshot_download(
    repo_id="336labs/VisionEncoder-to-MLLM-ModelZoo",
    allow_patterns=["continuous/qwen3base/**", "FILES.json", "README.md"],
    local_dir="VisionEncoder-to-MLLM-ModelZoo",
)

Choose the needed language-backbone group and vision-encoder run. Each run retains its original weights, configuration, tokenizer files, and available training metadata. Check the configuration in that subdirectory for the corresponding architecture.

Citation

If you use RAVEL or this model zoo, please cite:

@misc{yang2026strong,
  title={A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models},
  author={Yang, Yilin and Tang, Jun-Tao and Wang, Kengyi and Su, Siyuan and Luo, Gaoyong and Chen, Mingda},
  year={2026},
  eprint={2610.05413},
  archivePrefix={arXiv},
  primaryClass={cs.CV},
  url={https://arxiv.org/abs/2610.05413}
}
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Paper for 336labs/VisionEncoder-to-MLLM-ModelZoo