烛龙 Zhulong — Qwen3.8-27B 开箱即用推理镜像 内置 Qwen3.8-27B(27.3B 参数,Q4_K_XL 量化,已含视觉能力)
本镜像预装了完整的 Qwen3.8-27B 大模型推理服务
模型为 thinking(思考型)模型:回答中附带
reasoning_content思考过程字段。

等实例显示运行中后进去JupyterLab

打开终端(Terminal),输入
qwen-start
等待启动完成。
图例:


从图上位置取得API Key
如果后续需要重新查看 API Key,可以在终端执行:
qwen-key --show
也可以查看首次启动日志:
cat /var/log/qwen/first-start.log
⚠️ API Key 相当于服务访问密码,请妥善保管。若发生泄露,可执行
qwen-key --random重新生成。
返回实例列表,点击 Qwen3.8 对应的访问入口。

进入页面后,填写刚刚获取的 API Key。

配置完成后即可开始使用。
如果需要通过第三方客户端或 API 调用模型,可使用以下配置:
https://公网映射地址/v1(见下方说明)sk- 开头)qwen3.8-27bBase URL 说明:以云平台的端口映射规则为准。以本平台为例,实例公网入口形如:
https://8000-你的实例ID.pod.compshare.cn/v1
即在平台控制台复制 8000 端口对应的公网访问地址,末尾加 /v1。
GET /v1/models、POST /v1/chat/completions(兼容 OpenAI 格式,支持流式 stream:true)chat/completions 的 content 中可混合 text 与 image_url(支持 URL 或 base64)curl https://你的公网地址/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-你的KEY" \
-d '{"model":"qwen3.8-27b",
"messages":[{"role":"user","content":"你好"}]}'
curl https://你的公网地址/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-你的KEY" \
-d '{"model":"qwen3.8-27b",
"messages":[{"role":"user","content":[
{"type":"text","text":"描述这张图片"},
{"type":"image_url","image_url":{"url":"https://example.com/pic.jpg"}}]}]}'
from openai import OpenAI
client = OpenAI(
base_url="https://你的公网地址/v1",
api_key="sk-你的KEY",
)
resp = client.chat.completions.create(
model="qwen3.8-27b",
messages=[{"role": "user", "content": "你好,介绍一下你自己"}],
max_tokens=1024,
)
print(resp.choices[0].message.content)
⚠️ max_tokens 请给足(建议 ≥1024):本模型是思考型模型,思考过程也消耗 token,设太小会出现
content为空的情况。主流客户端(Cherry Studio、OpenWebUI、NextChat 等)会自动处理思考字段,无需额外配置。
所有命令在服务器任意目录直接执行,无需关心安装路径。
qwen-start —— 启动服务(Key 为空时自动生成并显示一次;防重复启动;带健康检查)qwen-stop —— 停止服务qwen-restart —— 重启服务qwen-status —— 查看运行状态(PID、GPU 显存、内存、当前配置)qwen-log —— 跟踪日志(qwen-log 100 看最近 100 行,q 退出跟踪)qwen-key —— 交互式修改 Key(输入不回显,二次确认)qwen-key --random —— 随机生成新 Key 并立即生效(服务运行中会自动重启)qwen-key --show —— 显示当前 Keyqwen-config —— 查看当前配置qwen-test —— 一键自检(health / models / chat 三项,显示耗时与速度)用 qwen-config 修改,服务运行中会自动重启生效:
qwen-config context 32768 # 缩小上下文(省显存,可选 4096~131072)
qwen-config kv q4 # KV Cache 降为 q4_0(省显存,质量略降)
qwen-config mtp off # 关闭 MTP(省显存,速度降到约 45 tok/s)
qwen-config vision off # 关闭图像理解(省约 1GB 显存)
qwen-config mtp on # 重新开启 MTP
显存参考(RTX 4090 24GB):
端口修改:编辑 /etc/qwen/qwen.env 中的 QWEN_PORT= 后执行 qwen-restart。注意云平台公网映射按 8000 端口配置,改端口会导致公网无法访问,不建议修改。