File size: 891 Bytes
cd6775d | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 | #!/bin/bash
# [ragqa] vLLM OpenAI 兼容服务(端口 50001):Llama 基座 + 监督式分解 LoRA
# 需要环境变量:RAGQA_LLAMA_MODEL(基座目录);RAGQA_LLAMA_LORA_SUPERVISED(监督式 LoRA,可选)
export CUDA_VISIBLE_DEVICES=${CUDA_VISIBLE_DEVICES:-0,1,2,3}
: "${RAGQA_LLAMA_MODEL:?请先设置 RAGQA_LLAMA_MODEL 指向 Llama-3.1-8B-Instruct 目录}"
ARGS=(
--model "$RAGQA_LLAMA_MODEL"
--tensor_parallel_size "${RAGQA_TP_SIZE:-4}"
--gpu_memory_utilization 0.6
--port 50001
--max-num-seqs 256
--max-model-len 4096
--use-v2-block-manager
--disable-log-requests
)
if [ -n "$RAGQA_LLAMA_LORA_SUPERVISED" ]; then
ARGS+=(--enable-lora --max-lora-rank 64
--lora-modules "{\"name\": \"supervised\", \"path\": \"$RAGQA_LLAMA_LORA_SUPERVISED\", \"base_model_name\": \"$RAGQA_LLAMA_MODEL\"}")
fi
python -m vllm.entrypoints.openai.api_server "${ARGS[@]}"
|