单卡5090部署Qwen3.8-27B:NVFP4+DFlash2投机采样+CUDA Graph,160K上下文,单流206tok/s,开机自启,兼容pi/Claude Code
一张消费级 RTX 5090,跑出 27B 大模型的极限速度。
本镜像基于 vLLM 0.27.1 + 社区 DFlash2 overlay 补丁深度调优,把 Qwen3.8-27B(NVFP4 量化)在单张 5090 上跑到了:
⚡ 单流 206 tok/s · 🚀 4 并发聚合 848 tok/s · 📚 160K 超长上下文 · ⏱️ 开机 6 分钟自动就绪
预装模型为社区微调版 sakamakismile/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-NVFP4(需机型所在可用区的公共模型盘支持,推荐上海二A/二B),无需下载、开箱即用。
enable_thinking 开关和 reasoning_effort 档位(low/medium/xhigh)pi 就能对话选择本镜像,GPU 选 RTX 5090(1 卡),建议 14C/64G/200G 磁盘起步。上海二A/二B 均可(模型在公共数据盘)。
镜像已配置开机自启动,vLLM 服务会自动拉起:
# 确认服务状态(返回模型列表即就绪)
curl -s http://localhost:8000/v1/models
curl -s http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b-nvfp4-dflash2",
"messages": [{"role": "user", "content": "你好"}],
"max_tokens": 512
}'
在平台控制台开放 8000 端口到外网后,本机执行:
export ANTHROPIC_BASE_URL="https://8000-<实例ID>-s1.pod.compshare.cn"
export ANTHROPIC_AUTH_TOKEN="EMPTY"
export ANTHROPIC_MODEL="qwen3.8-27b-nvfp4-dflash2"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-27b-nvfp4-dflash2"
claude
SSH 进实例直接运行:
pi --model local-vllm/qwen3.8-27b-nvfp4-dflash2
实测环境:RTX 5090 32GB / 14C / 64G 内存 / vLLM 0.27.1 / torch 2.13 / flashinfer 0.6.16
| 场景 | 吞吐 | 说明 |
|---|---|---|
| 单流(c1) | 206 tok/s | 代码生成,1536 tokens 输出 |
| 2 并发聚合 | 441 tok/s | 每流 232 tok/s |
| 4 并发聚合 | 848 tok/s | 每流 222 tok/s |
| 首 token 延迟 | ~450 ms | TTFT |
对比基线:同卡同模型不开优化只有 7 tok/s —— 本镜像提速约 29 倍。
Q:开机后多久能用? A:约 6 分钟。首次在新机器上启动需做少量 JIT 编译,之后镜像内缓存直接命中。
Q:为什么上下文是 160K 而不是模型原生的 262K? A:262K 需要 NVFP4 KV cache,但该路径在 SM120(5090)上依赖一个尚未合入上游的 flashinfer 补丁,会导致输出污染。为了输出正确性,当前版本采用 fp8 KV(160K)。追求极致长文的玩家可自行编译补丁版 flashinfer。
Q:模型能换吗?
A:可以。启动脚本在 /root/serve-replica.sh,把 MODEL= 改成任意 Qwen3.5 架构的 NVFP4 checkpoint 即可;改完 bash /root/kill-vllm.sh && nohup bash /root/serve-replica.sh & 重启服务。
Q:怎么关闭/开启思考模式?
A:请求里加 "chat_template_kwargs": {"enable_thinking": false} 关闭思考;{"reasoning_effort": "low"} 降低思考强度。
Q:关机后还收费吗? A:GPU/CPU 费用停止,仅收取磁盘费(约 ¥0.07/小时)。彻底不用请删除实例。
Q:对外暴露端口安全吗? A:vLLM 默认无鉴权,开放公网端口后任何人可调用。建议用完即关,或自行加反向代理鉴权。
完成搭建记录(含微信群交流): https://k19y8unwmu.feishu.cn/wiki/GbI2wwprKioFAPkgzA6cwlmtnOF