File size: 847 Bytes
cd6775d | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 | #!/bin/bash
# ① 监督式(vLLM 方案,替代 LLaMA-Factory)。端口 50001,LoRA 注册名为 "supervised"。
# 需要 RAGQA_LLAMA_MODEL + RAGQA_LLAMA_LORA_SUPERVISED。客户端 model 名用 "supervised"。
export CUDA_VISIBLE_DEVICES=${CUDA_VISIBLE_DEVICES:-0,1,2,3}
: "${RAGQA_LLAMA_MODEL:?请设置 RAGQA_LLAMA_MODEL}"
: "${RAGQA_LLAMA_LORA_SUPERVISED:?请设置 RAGQA_LLAMA_LORA_SUPERVISED}"
python -m vllm.entrypoints.openai.api_server \
--model "$RAGQA_LLAMA_MODEL" \
--tensor_parallel_size "${RAGQA_TP_SIZE:-4}" \
--gpu_memory_utilization 0.6 \
--port 50001 --max-num-seqs 256 --max-model-len 4096 \
--use-v2-block-manager --disable-log-requests \
--enable-lora --max-lora-rank 64 \
--lora-modules "{\"name\": \"supervised\", \"path\": \"$RAGQA_LLAMA_LORA_SUPERVISED\", \"base_model_name\": \"$RAGQA_LLAMA_MODEL\"}"
|