优云智算
控制台
立即注册

SGLang-Qwen3.8-27B-NVFP4

SGLang + Qwen3.8-27B-NVFP4 + Pi Web Agent 一体镜像:秒级启动(修复 nvcc 重编译)、开机自启 SGLang API(30000)与 Pi Web(30141)、实测单流 53 tok/s / 4 并发 202 tok/s。Pi Web 已预配置本地模型,部署即用。

镜像大小
50 GB
当前版本
v2.0
累计部署
0
累计运行
0 h
最近更新
2026-08-20

运行环境

框架版本
-0.5.15
CUDA版本
13.2
应用
-
支持卡型
RTX50系RTX40系

SGLang + Qwen3.8-27B-NVFP4 + Pi Web 一体镜像

开箱即用的 LLM 推理 + AI Agent Web 界面一体镜像:

  • SGLang v0.5.15 部署 Qwen3.8-27B-NVFP4,启动即提供 OpenAI 兼容 API
  • Pi Web(AI Agent 网页控制台)自动启动,开箱即用

✨ 特性

  • 🚀 秒级启动:内置 RTX 5090(sm120)FlashInfer/Triton 内核编译缓存 + 启动时自动修复缓存时间戳,彻底避免首次启动数十分钟的 nvcc JIT 编译
  • 🤖 Pi Web Agent 界面:开机自动启动,https://30141-<实例ID>-s1.pod.compshare.cn 直接访问
    • 默认账号:pi / PiWeb2026
    • 已预配置连接本地 SGLang(qwen3.8-27b 模型),开箱即用
  • 🔓 OpenAI 兼容 API/v1/chat/completions/v1/models、流式输出、工具调用
  • 🧠 推理优化:FlashInfer 后端、chunked prefill、CUDA graph、Qwen3 reasoning/tool parser
  • 🎯 实测性能(RTX 5090 单卡):
    • 单流解码:~53 tok/s
    • 4 并发总吞吐:~202 tok/s
    • TTFT:~0.17s

📋 环境

组件版本
GPURTX 5090(32GB 显存)
SGLang0.5.15.post1
模型Qwen3.8-27B-NVFP4(~14GB)
Pi Web@agegr/pi-web(Next.js)

🚀 快速开始

创建实例时选择本镜像(5090 单卡),启动后约 2-3 分钟全部就绪:

Pi Web Agent 界面

https://30141-<你的实例ID>-s1.pod.compshare.cn
账号:pi    密码:PiWeb2026

直接开始对话,Pi Web 已配置好连接本地 SGLang 模型。

SGLang API

curl http://127.0.0.1:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}],"max_tokens":100}'

# 外网入口
# https://30000-<实例ID>-s1.pod.compshare.cn/v1/chat/completions

其他入口

  • JupyterLab: https://8888-<实例ID>-s1.pod.compshare.cn
  • FileBrowser: https://8889-<实例ID>-s1.pod.compshare.cn

🔐 安全说明

  • Pi Web 默认密码 PiWeb2026,建议部署后修改:
    # 修改密码(重启后生效)
    sed -i 's/PiWeb2026/你的新密码/' /root/run-pi-web.sh
    supervisorctl restart pi-web
    
  • 镜像已清理:SSH 密钥、shell 历史、Pi Web 历史会话

🛠 服务管理

supervisorctl status            # 查看所有服务
supervisorctl restart sglang    # 重启推理服务
supervisorctl restart pi-web    # 重启 Pi Web
tail -f /var/log/supervisor/sglang.out.log

📁 关键路径

  • SGLang 启动:/root/start_sglang.sh(含缓存修复逻辑)
  • Pi Web 启动:/root/run-pi-web.sh(自动生成实例域名)
  • 模型:/model/ModelScope/RadixArk/Qwen3.8-27B-NVFP4(共享盘)
  • 基准测试:/root/sglang_bench.py

💡 注意事项

  1. GPU 匹配:内核缓存针对 RTX 5090(sm120)预编译,其他 GPU 首次启动会重新编译
  2. 模型来源:目标模型位于共享盘,所有 CompShare 实例自动可用
  3. Pi Web 密码:默认 PiWeb2026,部署后请修改

📄 License

  • 软件:Apache-2.0 | 模型:Qwen3.8-27B-NVFP4(Apache-2.0)
0 个镜像 · 被使用 0
版本日志
v2.0最新
08-20
v2.0:修复启动慢(内核缓存自动修复,秒级启动);新增 Pi Web Agent 界面(30141 端口自动启动,开箱即用)
评分
0.0
暂无评分
我的评分
未评分