优云智算
控制台
立即注册
0.01元/时

VLLM-Qwen3.8-27B

单卡5090部署Qwen3.8-27B:NVFP4+DFlash2投机采样+CUDA Graph,160K上下文,单流206tok/s,开机自启,兼容pi/Claude Code

镜像大小
44 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-08-30

运行环境

框架版本
CUDA-13.2
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
RTX50系

🚀 镜像介绍

一张消费级 RTX 5090,跑出 27B 大模型的极限速度。

本镜像基于 vLLM 0.27.1 + 社区 DFlash2 overlay 补丁深度调优,把 Qwen3.8-27B(NVFP4 量化)在单张 5090 上跑到了:

单流 206 tok/s · 🚀 4 并发聚合 848 tok/s · 📚 160K 超长上下文 · ⏱️ 开机 6 分钟自动就绪

预装模型为社区微调版 sakamakismile/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-NVFP4(需机型所在可用区的公共模型盘支持,推荐上海二A/二B),无需下载、开箱即用。

✨ 功能特性

  • 🔥 DFlash2 K7 投机采样:block-diffusion 草稿模型,7 token/步验证,代码场景接受率 55%+
  • 📉 CUDA Graph 全开:显式 KV pin 显存预算方案,突破单卡 5090 "必须 enforce-eager" 的限制
  • 📚 160K 上下文:fp8 KV cache,KV 池 178,700 tokens,长文档/RAG 无压力
  • 🧠 思考模式可控:支持 enable_thinking 开关和 reasoning_effort 档位(low/medium/xhigh)
  • 🔧 Agent Ready:工具调用(qwen3_coder parser)开箱即用,已兼容 Claude Code 协议
  • ⚡ 秒级启动:所有 JIT 编译缓存(torch.compile / flashinfer / CUDA graph)已持久化在镜像里
  • 🤖 内置 pi agent:预装预配置,SSH 进去直接 pi 就能对话
  • 💰 极致性价比:按量 ~¥2.6/小时,关机即停 GPU 计费

📖 使用教程

1. 创建实例

选择本镜像,GPU 选 RTX 5090(1 卡),建议 14C/64G/200G 磁盘起步。上海二A/二B 均可(模型在公共数据盘)。

2. 等待服务就绪(约 6 分钟)

镜像已配置开机自启动,vLLM 服务会自动拉起:

# 确认服务状态(返回模型列表即就绪)
curl -s http://localhost:8000/v1/models

3. 调用 API(OpenAI 兼容)

curl -s http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-27b-nvfp4-dflash2",
    "messages": [{"role": "user", "content": "你好"}],
    "max_tokens": 512
  }'

4. 接入 Claude Code(可选)

在平台控制台开放 8000 端口到外网后,本机执行:

export ANTHROPIC_BASE_URL="https://8000-<实例ID>-s1.pod.compshare.cn"
export ANTHROPIC_AUTH_TOKEN="EMPTY"
export ANTHROPIC_MODEL="qwen3.8-27b-nvfp4-dflash2"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-27b-nvfp4-dflash2"
claude

5. 使用内置 pi agent(可选)

SSH 进实例直接运行:

pi --model local-vllm/qwen3.8-27b-nvfp4-dflash2

🧪 环境验证

实测环境:RTX 5090 32GB / 14C / 64G 内存 / vLLM 0.27.1 / torch 2.13 / flashinfer 0.6.16

场景吞吐说明
单流(c1)206 tok/s代码生成,1536 tokens 输出
2 并发聚合441 tok/s每流 232 tok/s
4 并发聚合848 tok/s每流 222 tok/s
首 token 延迟~450 msTTFT

对比基线:同卡同模型不开优化只有 7 tok/s —— 本镜像提速约 29 倍

❓ 常见问题

Q:开机后多久能用? A:约 6 分钟。首次在新机器上启动需做少量 JIT 编译,之后镜像内缓存直接命中。

Q:为什么上下文是 160K 而不是模型原生的 262K? A:262K 需要 NVFP4 KV cache,但该路径在 SM120(5090)上依赖一个尚未合入上游的 flashinfer 补丁,会导致输出污染。为了输出正确性,当前版本采用 fp8 KV(160K)。追求极致长文的玩家可自行编译补丁版 flashinfer。

Q:模型能换吗? A:可以。启动脚本在 /root/serve-replica.sh,把 MODEL= 改成任意 Qwen3.5 架构的 NVFP4 checkpoint 即可;改完 bash /root/kill-vllm.sh && nohup bash /root/serve-replica.sh & 重启服务。

Q:怎么关闭/开启思考模式? A:请求里加 "chat_template_kwargs": {"enable_thinking": false} 关闭思考;{"reasoning_effort": "low"} 降低思考强度。

Q:关机后还收费吗? A:GPU/CPU 费用停止,仅收取磁盘费(约 ¥0.07/小时)。彻底不用请删除实例。

Q:对外暴露端口安全吗? A:vLLM 默认无鉴权,开放公网端口后任何人可调用。建议用完即关,或自行加反向代理鉴权。

完成搭建记录(含微信群交流): https://k19y8unwmu.feishu.cn/wiki/GbI2wwprKioFAPkgzA6cwlmtnOF

0 个镜像 · 被使用 0
版本日志
v1.0最新
2026-08-30
单卡5090部署Qwen3.8-27B:NVFP4+DFlash2投机采样+CUDA Graph,160K上下文,单流206tok/s,开机自启,兼容pi/Claude Code
评分
0.0
暂无评分
我的评分
未评分
VLLM-Qwen3.8-27B一键部署 | 优云智算