File size: 847 Bytes
cd6775d
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
#!/bin/bash
# ① 监督式(vLLM 方案,替代 LLaMA-Factory)。端口 50001,LoRA 注册名为 "supervised"。
# 需要 RAGQA_LLAMA_MODEL + RAGQA_LLAMA_LORA_SUPERVISED。客户端 model 名用 "supervised"。
export CUDA_VISIBLE_DEVICES=${CUDA_VISIBLE_DEVICES:-0,1,2,3}
: "${RAGQA_LLAMA_MODEL:?请设置 RAGQA_LLAMA_MODEL}"
: "${RAGQA_LLAMA_LORA_SUPERVISED:?请设置 RAGQA_LLAMA_LORA_SUPERVISED}"
python -m vllm.entrypoints.openai.api_server \
  --model "$RAGQA_LLAMA_MODEL" \
  --tensor_parallel_size "${RAGQA_TP_SIZE:-4}" \
  --gpu_memory_utilization 0.6 \
  --port 50001 --max-num-seqs 256 --max-model-len 4096 \
  --use-v2-block-manager --disable-log-requests \
  --enable-lora --max-lora-rank 64 \
  --lora-modules "{\"name\": \"supervised\", \"path\": \"$RAGQA_LLAMA_LORA_SUPERVISED\", \"base_model_name\": \"$RAGQA_LLAMA_MODEL\"}"