优云智算
控制台
立即注册

烛龙Qwen3.8-27B

烛龙 Zhulong — Qwen3.8-27B 开箱即用推理镜像 内置 Qwen3.8-27B(27.3B 参数,Q4_K_XL 量化,已含视觉能力)

镜像大小
48 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-09-01

运行环境

框架版本
-13.2
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系
+1

Qwen3.8-27B 推理服务镜像 · 使用文档

本镜像预装了完整的 Qwen3.8-27B 大模型推理服务


一、镜像内容

  • 模型:Qwen3.8-27B(Apache-2.0,27.3B 参数,256K 训练上下文)
  • 量化:Q4_K_XL 动态量化,单文件约 16.2 GB
  • 视觉:支持图像理解(多模态投影器已内置)
  • 加速:MTP 投机解码默认开启,生成速度约 75 tok/s(关闭约 45 tok/s)
  • 后端:llama.cpp v0.3.0,原生 CUDA,全层 GPU offload
  • 适用硬件:NVIDIA RTX 4090 24GB(32/48/64GB 内存主机均可)
  • 显存占用:约 21.0 GiB / 24 GiB(64K 上下文 + MTP + 视觉全开)
  • API:OpenAI Compatible,端口 8000,强制 API Key 鉴权

模型为 thinking(思考型)模型:回答中附带 reasoning_content 思考过程字段。


二、快速开始

1. 启动实例

PastedGraphic8_.png

2. 启动 Qwen 服务

等实例显示运行中后进去JupyterLab

PastedGraphic7_.png

打开终端(Terminal),输入

qwen-start

等待启动完成。

图例:

PastedGraphic9_.pngPastedGraphic10_.png

从图上位置取得API Key

如果后续需要重新查看 API Key,可以在终端执行:

qwen-key --show

也可以查看首次启动日志:

cat /var/log/qwen/first-start.log

⚠️ API Key 相当于服务访问密码,请妥善保管。若发生泄露,可执行 qwen-key --random 重新生成。

3. 打开Qwen3.8

返回实例列表,点击 Qwen3.8 对应的访问入口。

PastedGraphic7_.png

进入页面后,填写刚刚获取的 ​API Key​。

PastedGraphic11_.png

配置完成后即可开始使用。

4. 配置客户端

如果需要通过第三方客户端或 API 调用模型,可使用以下配置:

  • Base URLhttps://公网映射地址/v1(见下方说明)
  • API Key:上一步得到的 Key(sk- 开头)
  • Modelqwen3.8-27b

Base URL 说明:以云平台的端口映射规则为准。以本平台为例,实例公网入口形如:

https://8000-你的实例ID.pod.compshare.cn/v1

即在平台控制台复制 8000 端口对应的公网访问地址,末尾加 /v1


三、API 规格

  • 端点:GET /v1/modelsPOST /v1/chat/completions(兼容 OpenAI 格式,支持流式 stream:true
  • 上下文长度:65536 tokens
  • 视觉输入:chat/completionscontent 中可混合 textimage_url(支持 URL 或 base64)

文本请求示例(curl)

curl https://你的公网地址/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-你的KEY" \
  -d '{"model":"qwen3.8-27b",
       "messages":[{"role":"user","content":"你好"}]}'

图像理解示例

curl https://你的公网地址/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-你的KEY" \
  -d '{"model":"qwen3.8-27b",
       "messages":[{"role":"user","content":[
         {"type":"text","text":"描述这张图片"},
         {"type":"image_url","image_url":{"url":"https://example.com/pic.jpg"}}]}]}'

Python(OpenAI SDK)示例

from openai import OpenAI

client = OpenAI(
    base_url="https://你的公网地址/v1",
    api_key="sk-你的KEY",
)

resp = client.chat.completions.create(
    model="qwen3.8-27b",
    messages=[{"role": "user", "content": "你好,介绍一下你自己"}],
    max_tokens=1024,
)
print(resp.choices[0].message.content)

⚠️ max_tokens 请给足(建议 ≥1024):本模型是思考型模型,思考过程也消耗 token,设太小会出现 content 为空的情况。主流客户端(Cherry Studio、OpenWebUI、NextChat 等)会自动处理思考字段,无需额外配置。


四、管理命令

所有命令在服务器任意目录直接执行,无需关心安装路径。

  • qwen-start —— 启动服务(Key 为空时自动生成并显示一次;防重复启动;带健康检查)
  • qwen-stop —— 停止服务
  • qwen-restart —— 重启服务
  • qwen-status —— 查看运行状态(PID、GPU 显存、内存、当前配置)
  • qwen-log —— 跟踪日志(qwen-log 100 看最近 100 行,q 退出跟踪)
  • qwen-key —— 交互式修改 Key(输入不回显,二次确认)
  • qwen-key --random —— 随机生成新 Key 并立即生效(服务运行中会自动重启)
  • qwen-key --show —— 显示当前 Key
  • qwen-config —— 查看当前配置
  • qwen-test —— 一键自检(health / models / chat 三项,显示耗时与速度)

五、常用配置调整

qwen-config 修改,服务运行中会自动重启生效

qwen-config context 32768    # 缩小上下文(省显存,可选 4096~131072)
qwen-config kv q4            # KV Cache 降为 q4_0(省显存,质量略降)
qwen-config mtp off          # 关闭 MTP(省显存,速度降到约 45 tok/s)
qwen-config vision off       # 关闭图像理解(省约 1GB 显存)
qwen-config mtp on           # 重新开启 MTP

显存参考(RTX 4090 24GB):

  • 默认(64K + q8 KV + MTP + 视觉):约 21.0 GiB
  • 关 MTP:约 18.7 GiB
  • 32K 上下文 + 默认其他:约 18.7 GiB(启动时更低)

端口修改:编辑 /etc/qwen/qwen.env 中的 QWEN_PORT= 后执行 qwen-restart。注意云平台公网映射按 8000 端口配置,改端口会导致公网无法访问,不建议修改。


六、性能参考(RTX 4090 实测)

  • 长文本生成(MTP 开,默认):约 75 tok/s
  • 长文本生成(MTP 关):约 45 tok/s
  • Prompt 处理:约 2500 tok/s
  • MTP 验收率:约 0.5(平均每步接受 2.5 个 token)
0 个镜像 · 被使用 0
版本日志
v1.0最新
2026-09-01
烛龙 Zhulong — Qwen3.8-27B 开箱即用推理镜像内置 Qwen3.8-27B(27.3B 参数,Q4_K_XL 量化,已含视觉能力)
评分
0.0
暂无评分
我的评分
未评分
烛龙Qwen3.8-27B一键部署 | 优云智算