Commit History

Document split KV quant + cache-reuse env vars
abde511
verified

Leon4gr45 commited on

Split K/V cache quant, 16K ctx, cache-reuse, generation smoke test
4548f4e
verified

Leon4gr45 commited on

safety: cap threads at CPU_THREADS_MAX (default 2) to prevent oversubscription if detection over-reports
911ccc5
verified

Leon4gr45 commited on

feat: cgroup-aware vCPU auto-detection (respects container CPU limit; no CPU_THREADS env needed)
eb5a9f7
verified

Leon4gr45 commited on

Delete list_models.py with huggingface_hub
2073253
verified

Leon4gr45 commited on

Delete download_model.py with huggingface_hub
3bbdc74
verified

Leon4gr45 commited on

port verified llama.cpp CPU proxy: LFM2.5-VL-1.6B vision via mmproj, native OpenAI multimodal API, prebuilt binary
4baaa2f
verified

Leon4gr45 commited on

Update Dockerfile
0add691
verified

Leon4gr45 commited on

Update app.py
1aecc68
verified

Leon4gr45 commited on

Update app.py
2a7a917
verified

Leon4gr45 commited on

Update app.py
6947e38
verified

Leon4gr45 commited on

Update app.py
dcfb6cb
verified

Leon4gr45 commited on

Update app.py
8b44be5
verified

Leon4gr45 commited on

Update Dockerfile
7e2c73d
verified

Leon4gr45 commited on

Create download_model.py
302a3ec
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
f3a62ee
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
36fcbf8
verified

Leon4gr45 commited on

initial commit
8c345e4
verified

Leon4gr45 commited on