com-junkawasaki commited on
Commit
7b4ba28
·
verified ·
1 Parent(s): 22a59ea

Add pinned GLM-5.3 1-GPU entrypoint

Browse files
Files changed (1) hide show
  1. entrypoint.sh +32 -0
entrypoint.sh ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ #!/usr/bin/env bash
2
+ set -euo pipefail
3
+
4
+ readonly VLLM_ROOT="/usr/local/lib/python3.12/dist-packages/vllm"
5
+ readonly MODEL_REPOSITORY="tacos4me/GLM-5.3-Flash-NVFP4-FP8ATTN-512K"
6
+ readonly MODEL_REVISION="fd5efd8c534f6170fa9b4143ec57e0eed6faf842"
7
+
8
+ cp /repository/serving/kda.py "$VLLM_ROOT/models/glm5next/nvidia/kda.py"
9
+ cp /repository/serving/model.py "$VLLM_ROOT/models/glm5next/nvidia/model.py"
10
+ cp /repository/serving/modelopt.py "$VLLM_ROOT/model_executor/layers/quantization/modelopt.py"
11
+ cp /repository/serving/configs/*.json "$VLLM_ROOT/model_executor/layers/quantization/utils/configs/"
12
+
13
+ exec python3 -m vllm.entrypoints.openai.api_server \
14
+ --model "$MODEL_REPOSITORY" \
15
+ --revision "$MODEL_REVISION" \
16
+ --served-model-name awai-network/basho \
17
+ --host 0.0.0.0 \
18
+ --port 8000 \
19
+ --tensor-parallel-size 1 \
20
+ --cpu-offload-gb 90 \
21
+ --max-model-len 16384 \
22
+ --max-num-seqs 1 \
23
+ --max-num-batched-tokens 1024 \
24
+ --kv-cache-dtype fp8 \
25
+ --gpu-memory-utilization 0.95 \
26
+ --swap-space 4 \
27
+ --limit-mm-per-prompt '{"image":0,"video":0}' \
28
+ --trust-remote-code \
29
+ --enforce-eager \
30
+ --enable-auto-tool-choice \
31
+ --tool-call-parser glm47 \
32
+ --reasoning-parser glm45