vllm-qwen3.8-27b
注意要双卡
新建一个终端:
CUDA_VISIBLE_DEVICES=0,1 \
vllm serve /model/ModelScope/Qwen/Qwen3.8-27B-FP8 \
--served-model-name qwen3.8-27b \
--host 0.0.0.0 \
--port 8000 \
-tp 2 \
--max-model-len 32768 \
--gpu-memory-utilization 0.90 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
保持该终端运行。
再新建一个终端:
open-webui serve --host 0.0.0.0 --port 8080
保持该终端运行。
浏览器打开 Open WebUI,网址为 ip:8080,也可在实例列表->更多操作->配置开放端口 处看到对应8080端口的链接。
Open WebUI的账号密码:
首次对话回复时间较长,耐心等待