0一键部署 Qwen3.8-27B(千问3.8) 大模型推理服务,开箱即用、开机自启动。
py312)创建实例(使用本镜像):
compshare instance create \
--region cn-wlcb --zone cn-wlcb-01 \
--gpu H20 --count 1 --cpu 16 --memory 240GiB \
--image <本镜像ID> --image-source custom \
--disk 100GiB --charge Postpay --yes
等待自动启动:实例创建后,supervisor 会自动拉起 vLLM 服务并加载模型(约 5-10 分钟,无需登录操作)。
开放端口:在控制台防火墙放行 8000 端口。
调用 API:见下方"环境验证代码"。
模型说明: 模型权重通过共享存储
/model/ModelScope/Qwen/Qwen3.8-27B自动挂载,不占用镜像体积;若新实例无此挂载,需先将模型下载至该路径。
⚠️ 安全提示: 下方 API Key 为镜像内置的默认演示 Key,仅用于本地快速验证。正式对外开放服务前,务必修改为自己的 Key(修改步骤见「常见问题 Q1」)。
# 方式一:curl 验证
curl http://<公网IP>:8000/v1/models \
-H "Authorization: Bearer sk-3sdrins_O6gsSBu4_stRG2iDT5n3v762MFBizemhlwg"
# 方式二:OpenAI SDK(Python)
from openai import OpenAI
client = OpenAI(
base_url="http://<公网IP>:8000/v1",
api_key="sk-3sdrins_O6gsSBu4_stRG2iDT5n3v762MFBizemhlwg",
)
resp = client.chat.completions.create(
model="Qwen3.8-27B",
messages=[{"role": "user", "content": "你好,1+1 等于几?"}],
max_tokens=256,
)
print(resp.choices[0].message.content)
预期返回模型正常回答(如"1+1 等于 2")即环境配置成功。
| 项目 | 值 |
|---|---|
| 模型 | Qwen3.8-27B(BF16,51.75 GiB) |
| 最大上下文 | 256K(262144 tokens) |
| 并发上限 | 128 路 |
| 服务端口 | 8000(OpenAI 兼容) |
| API 鉴权 | 已开启(默认 key 为 demo 用途,正式使用需修改) |
| 函数调用 | 已开启(qwen3_xml parser) |
| 思考等级 | xhigh(默认)/ medium / low |
# 控制思考等级(三选一)
resp = client.chat.completions.create(
model="Qwen3.8-27B",
messages=[{"role": "user", "content": "9.11 和 9.9 哪个大?"}],
extra_body={"reasoning_effort": "low"}, # xhigh / medium / low
)
# 函数调用
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "获取城市天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
},
}]
resp = client.chat.completions.create(
model="Qwen3.8-27B",
messages=[{"role": "user", "content": "北京天气怎么样?"}],
tools=tools,
tool_choice="auto",
)
print(resp.choices[0].message.tool_calls)
Q1:API 返回 401 未授权?如何修改默认 API Key?
A1: 服务已开启鉴权,请求需携带 Authorization: Bearer <api-key> 头。
⚠️ 重要: 镜像内置的默认 Key(
sk-3sdrins_O6gsSBu4_...)仅为演示用途。任何获取本镜像的人都能看到该 Key,正式对外开放服务前必须更换,否则任何人都可盗用你的 GPU 资源。
修改 API Key 步骤:
生成新 Key(登录实例执行,或本地执行):
python3 -c "import secrets; print('sk-' + secrets.token_urlsafe(32))"
编辑 supervisor 配置:
vi /etc/supervisor/conf.d/vllm.conf
找到 --api-key sk-3sdrins_O6gsSBu4_stRG2iDT5n3v762MFBizemhlwg,替换为你生成的新 Key。
重启 vLLM 服务使配置生效:
supervisorctl restart vllm
等待约 2 分钟服务重新就绪(supervisorctl status 显示 RUNNING)。
验证:旧 Key 应返回 401,新 Key 应返回 200:
curl -o /dev/null -w "%{http_code}" -H "Authorization: Bearer <旧Key>" http://localhost:8000/v1/models # 期望 401
curl -o /dev/null -w "%{http_code}" -H "Authorization: Bearer <新Key>" http://localhost:8000/v1/models # 期望 200
Q2:公网 8000 端口无法访问? A2: 需在 CompShare 控制台的防火墙/安全组中放行 8000 端口(uhost 实例不支持 CLI 自定义端口映射)。
Q3:创建实例后服务没自动启动?
A3: 登录实例执行 supervisorctl status 查看 vllm 状态;首次加载模型约需 4-5 分钟,属正常现象。日志位于 /var/log/vllm.log。
Q4:模型权重在哪?占用镜像空间吗?
A4: 模型位于共享存储 /model/ModelScope/Qwen/Qwen3.8-27B(约 52GB),不占用镜像体积(镜像约 40GB)。若实例无该挂载,需自行下载模型到对应路径。
Q5:如何关闭思考(加速简单问答)?
A5: 请求时传 extra_body={"enable_thinking": False},或使用较低思考等级 reasoning_effort: "low"。

支持自启动