Add pinned GLM-5.3 1-GPU entrypoint
Browse files- entrypoint.sh +32 -0
entrypoint.sh
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
#!/usr/bin/env bash
|
| 2 |
+
set -euo pipefail
|
| 3 |
+
|
| 4 |
+
readonly VLLM_ROOT="/usr/local/lib/python3.12/dist-packages/vllm"
|
| 5 |
+
readonly MODEL_REPOSITORY="tacos4me/GLM-5.3-Flash-NVFP4-FP8ATTN-512K"
|
| 6 |
+
readonly MODEL_REVISION="fd5efd8c534f6170fa9b4143ec57e0eed6faf842"
|
| 7 |
+
|
| 8 |
+
cp /repository/serving/kda.py "$VLLM_ROOT/models/glm5next/nvidia/kda.py"
|
| 9 |
+
cp /repository/serving/model.py "$VLLM_ROOT/models/glm5next/nvidia/model.py"
|
| 10 |
+
cp /repository/serving/modelopt.py "$VLLM_ROOT/model_executor/layers/quantization/modelopt.py"
|
| 11 |
+
cp /repository/serving/configs/*.json "$VLLM_ROOT/model_executor/layers/quantization/utils/configs/"
|
| 12 |
+
|
| 13 |
+
exec python3 -m vllm.entrypoints.openai.api_server \
|
| 14 |
+
--model "$MODEL_REPOSITORY" \
|
| 15 |
+
--revision "$MODEL_REVISION" \
|
| 16 |
+
--served-model-name awai-network/basho \
|
| 17 |
+
--host 0.0.0.0 \
|
| 18 |
+
--port 8000 \
|
| 19 |
+
--tensor-parallel-size 1 \
|
| 20 |
+
--cpu-offload-gb 90 \
|
| 21 |
+
--max-model-len 16384 \
|
| 22 |
+
--max-num-seqs 1 \
|
| 23 |
+
--max-num-batched-tokens 1024 \
|
| 24 |
+
--kv-cache-dtype fp8 \
|
| 25 |
+
--gpu-memory-utilization 0.95 \
|
| 26 |
+
--swap-space 4 \
|
| 27 |
+
--limit-mm-per-prompt '{"image":0,"video":0}' \
|
| 28 |
+
--trust-remote-code \
|
| 29 |
+
--enforce-eager \
|
| 30 |
+
--enable-auto-tool-choice \
|
| 31 |
+
--tool-call-parser glm47 \
|
| 32 |
+
--reasoning-parser glm45
|