优云智算
控制台
立即注册
推荐

SGLang-Qwen3.8-27B-NVFP4

SGLang + Qwen3.8-27B-NVFP4 +Dflash2 + Pi Web Agent 一体镜像:启动后 5 分钟内推理服务可以用,Pi web 直接体验

镜像大小
56 GB
当前版本
v4.0
累计部署
87
累计运行
107 h
最近更新
2026-08-25

运行环境

框架版本
-0.5.15
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
RTX50系

SGLang + Qwen3.8-27B-NVFP4 + DFlash2 + 双卡 DP + Pi Web 一体镜像 (v4.0)

开箱即用的极速 LLM 推理 + AI Agent 网页控制台一体镜像。v4.0 核心升级:双卡数据并行 + GPU 自动识别 + 一键双模型切换,双卡聚合吞吐实测 930 tok/s

  • SGLang(含 DFlash2 overlay patch)部署 Qwen3.8-27B-NVFP4 + DFlash2 草稿模型
  • 双卡自动并行:检测到 2 张 5090 自动以 DP2 双副本启动,无需任何配置
  • 一键模型切换switch_model.sh 在 RadixArk 原版与 AEON 社区版之间秒切
  • Pi Web(AI Agent 网页控制台)自动启动,开箱即用

✨ v4.0 更新内容

  • 🚀 双卡 DP 数据并行:5090 无 NVLink,TP 走 PCIe 拖慢 decode;本镜像每卡部署完整副本(DP2),聚合吞吐线性提升,2×5090 实测输出峰值 930 tok/s(总吞吐 4652 tok/s)
  • 🧠 GPU 数量自动识别:开机自启脚本自动 nvidia-smi 检测卡数——1 卡走单卡低延迟配置(90-134 tok/s),2 卡+自动切 DP2 吞吐配置,换卡型/重启完全无感
  • 🔁 一键模型切换/root/switch_model.sh 支持 aeon / radix / status / stop / start / restart,supervisor 托管,切换即生效,开机自启沿用最后选择
  • 🆕 内置 AEON 社区版(Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-NVFP4):同架构 NVFP4 量化,与 DFlash2 投机解码实测兼容,accept len 最高 5.31(接受率 62%)
  • 🧮 双卡显存极限调优:目标+草稿双 mamba 状态池精确配比(~230MB/条)、多模态 IPC 换 CPU 通道省 1GB、mem-fraction 静态池调至 0.95,27B 主模型 + 草稿模型 × 2 副本全塞进 2×32GB
  • 📊 内置压测脚本/root/bench_dp2*.sh 一键复测并发吞吐曲线

🎯 实测性能(RTX 5090)

部署配置单流解码聚合输出吞吐
v3.0 单卡SGLang + DFlash2 + torch.compile90-134 tok/s
v4.0 单卡同 v3(自动识别,配置不变)90-134 tok/s
v4.0 双卡 AEONDP2 + DFlash2128 tok/s784 tok/s @8并发 → 930 tok/s 峰值
  • 双卡有效并发 8(每卡 4,mamba 状态池上限),更高并发排队不劣化 TPOT(7.6ms 恒定)
  • TTFT:~0.35s|上下文:262,144 tokens|总吞吐峰值 4652 tok/s

📋 环境

组件版本
GPURTX 5090 单卡或双卡(需 RTX 50 系/Blackwell 架构
SGLang0.5.17 + DFlash2 overlay patch
目标模型Qwen3.8-27B-NVFP4(共享盘)/ Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-NVFP4(共享盘)
草稿模型Qwen3.8-27B-DFlash2(内置本地盘)
Pi Web@agegr/pi-web(Next.js)

🚀 快速开始

创建实例时选择本镜像(5090 单卡或双卡均可),启动后单卡约 3-4 分钟、双卡约 5 分钟全部就绪。

端口提示:创建后如需外网访问,先开放端口:

compshare instance ports update <实例ID> --http 8888 --http 30000 --http 30141 --tcp 23 --yes

一键模型切换

/root/switch_model.sh status    # 查看当前模型/服务状态
/root/switch_model.sh aeon      # 切到 AEON 社区版(qwen3.8-aeon)
/root/switch_model.sh radix     # 切回 RadixArk 原版(qwen3.8-27b)

切换自动重启生效(约 3-5 分钟),开机自启沿用最后选择,GPU 卡数自动适配。

SGLang API(OpenAI 兼容)

实例内

curl http://127.0.0.1:30000/v1/chat/completions
  -H "Content-Type: application/json"
  -d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}],"max_tokens":100}'

外网入口

https://30000-<实例ID>-s1.pod.compshare.cn/v1/chat/completions

支持 /v1/chat/completions/v1/models、流式输出、工具调用、思考模式。

Pi Web Agent 界面

https://30141-<你的实例ID>-s1.pod.compshare.cn
账号:pi    密码:PiWeb2026

已配置好连接本地 SGLang 模型,直接开始对话。

🔐 安全说明

  • Pi Web 默认密码沿用 v3,建议部署后修改(/root/run-pi-web.sh 中修改后 supervisorctl restart pi-web
  • 镜像已清理:SSH 密钥、shell 历史、Pi Web 历史会话

🛠 服务管理

supervisorctl status                    # 查看所有服务
/root/switch_model.sh restart          # 重启推理服务
/root/switch_model.sh stop             # 停止推理服务
tail -f /var/log/supervisor/sglang.err.log   # 推理日志

📁 关键路径

  • 启动调度器:/root/sglang_auto.sh(GPU 数 × 模型 二维自动分发)
  • 切换脚本:/root/switch_model.sh|当前选择:/root/active_model
  • 启动脚本:/root/start_sglang_dflash2.sh(RadixArk 单卡)、/root/start_sglang_dp2.sh(RadixArk 双卡)、/root/start_sglang_aeon.sh(AEON 单卡)、 /root/start_sglang_dp2_aeon.sh(AEON 双卡)
  • DFlash2 草稿模型:/root/models/Qwen3.8-27B-DFlash2
  • torch.compile 缓存:/root/.cache/torch_inductor(持久化,重启免编译)
  • 压测脚本:/root/bench_dp2.sh/root/bench_dp2_aeon.sh

💡 注意事项

  1. GPU 要求:需 RTX 50 系/Blackwell(NVFP4 硬件支持);内核缓存针对 5090(sm120)预编译,其他卡型首次启动会重编译
  2. 双卡并发:双卡 DP2 有效并发 8(mamba 状态池上限),排队请求 TPOT 不劣化;追求更多真并发可减小 --speculative-num-draft-tokens 换 mamba 槽位
  3. 性能波动:投机解码加速与内容可预测性相关(代码/格式化内容提速更明显),输出质量始终无损
  4. AEON 版说明:AEON 为社区去审查微调版,请遵守当地法规并自行评估适用性;切换回原版一条命令即可
  5. 调参:编辑对应启动脚本后 supervisorctl restart sglang;不要同时开 --enable-torch-compile 与 decode CUDA graph 大 bs 组合(详见 SGLang issue #35777)

🙏 致谢

📄 License

  • 软件:Apache-2.0|模型:Qwen3.8-27B-NVFP4 + DFlash2 + AEON(Apache-2.0)
0 个镜像 · 被使用 87
版本日志
v4.0最新
2026-08-25
## ✨ v4.0 更新内容 * 🚀 **双卡 DP 数据并行**:5090 无 NVLink,TP 走 PCIe 拖慢 decode;本镜像每卡部署完整副本(DP2),聚合吞吐线性提升,2×5090 实测输出峰值 **930 tok/s**(总吞吐 4652 tok/s) * 🧠 **GPU 数量自动识别**:开机自启脚本自动 `nvidia-smi` 检测卡数——1 卡走单卡低延迟配置(90-134 tok/s),2 卡+自动切 DP2 吞吐配置,换卡型/重启完全无感 * 🔁 **一键模型切换**:`/root/switch_model.sh` 支持 `aeon / radix / status / stop / start / restart`,supervisor 托管,切换即生效,**开机自启沿用最后选择** * 🆕 **内置 AEON 社区版**(Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-NVFP4):同架构 NVFP4 量化,与 DFlash2 投机解码实测兼容,accept len 最高 5.31(接受率 62%) * 🧮 **双卡显存极限调优**:目标+草稿双 mamba 状态池精确配比(~230MB/条)、多模态 IPC 换 CPU 通道省 1GB、mem-fraction 静态池调至 0.95,27B 主模型 + 草稿模型 × 2 副本全塞进 2×32GB * 📊 **内置压测脚本**:`/root/bench_dp2*.sh` 一键复测并发吞吐曲线
v3.0
2026-08-21
把整套环境(SGLang 0.5.17 + patch + DFlash2 草稿模型 + 持久化编译缓存 + supervisor 自启动)打包成 v3.0 镜像,并用全新实例做了端到端验证: - ✅ 开机到模型可用:约 3 分 40 秒(全自动,编译缓存持久化的功劳) - ✅ 内网 benchmark:106.6 tok/s - ✅ 外网 API 直连可用(开放 30000 端口即可) - ✅ DFlash2 投机解码生效(accept len 3.0)
v2.0
2026-08-20
v2.0:修复启动慢(内核缓存自动修复,秒级启动);新增 Pi Web Agent 界面(30141 端口自动启动,开箱即用)
评分
0.0
暂无评分
我的评分
未评分
SGLang-Qwen3.8-27B-NVFP4一键部署 | 优云智算