| ## Download Vision Encoder (Required) | |
| This model requires an additional vision encoder `siglip2-base-p32-256-ve` | |
| ```bash | |
| git lfs install | |
| # from HuggingFace | |
| git clone https://huggingface.co/jingyaogong/siglip2-base-p32-256-ve | |
| # or from ModelScope | |
| git clone https://modelscope.cn/models/gongjy/siglip2-base-p32-256-ve | |
| ``` | |
| Directory Structure | |
| ``` | |
| model/ | |
| βββ siglip2-base-p32-256-ve/ # Vision Encoder (Required) | |
| β βββ config.json | |
| β βββ model.safetensors # ~180MB, float16 | |
| β βββ preprocessor_config.json | |
| βββ model_minimind.py # LLM structure | |
| βββ model_vlm.py # VLM structure | |
| βββ tokenizer.json | |
| βββ tokenizer_config.json | |
| ``` |