Download Vision Encoder (Required)
This model requires an additional vision encoder siglip2-base-p32-256-ve
git lfs install
# from HuggingFace
git clone https://huggingface.co/jingyaogong/siglip2-base-p32-256-ve
# or from ModelScope
git clone https://modelscope.cn/models/gongjy/siglip2-base-p32-256-ve
Directory Structure
model/
βββ siglip2-base-p32-256-ve/ # Vision Encoder (Required)
β βββ config.json
β βββ model.safetensors # ~180MB, float16
β βββ preprocessor_config.json
βββ model_minimind.py # LLM structure
βββ model_vlm.py # VLM structure
βββ tokenizer.json
βββ tokenizer_config.json