SGLang + Qwen3.8-27B-NVFP4 + Pi Web Agent 一体镜像:秒级启动(修复 nvcc 重编译)、开机自启 SGLang API(30000)与 Pi Web(30141)、实测单流 53 tok/s / 4 并发 202 tok/s。Pi Web 已预配置本地模型,部署即用。
开箱即用的 LLM 推理 + AI Agent Web 界面一体镜像:
https://30141-<实例ID>-s1.pod.compshare.cn 直接访问
pi / PiWeb2026/v1/chat/completions、/v1/models、流式输出、工具调用| 组件 | 版本 |
|---|---|
| GPU | RTX 5090(32GB 显存) |
| SGLang | 0.5.15.post1 |
| 模型 | Qwen3.8-27B-NVFP4(~14GB) |
| Pi Web | @agegr/pi-web(Next.js) |
创建实例时选择本镜像(5090 单卡),启动后约 2-3 分钟全部就绪:
https://30141-<你的实例ID>-s1.pod.compshare.cn
账号:pi 密码:PiWeb2026
直接开始对话,Pi Web 已配置好连接本地 SGLang 模型。
curl http://127.0.0.1:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}],"max_tokens":100}'
# 外网入口
# https://30000-<实例ID>-s1.pod.compshare.cn/v1/chat/completions
https://8888-<实例ID>-s1.pod.compshare.cnhttps://8889-<实例ID>-s1.pod.compshare.cnPiWeb2026,建议部署后修改:
# 修改密码(重启后生效)
sed -i 's/PiWeb2026/你的新密码/' /root/run-pi-web.sh
supervisorctl restart pi-web
supervisorctl status # 查看所有服务
supervisorctl restart sglang # 重启推理服务
supervisorctl restart pi-web # 重启 Pi Web
tail -f /var/log/supervisor/sglang.out.log
/root/start_sglang.sh(含缓存修复逻辑)/root/run-pi-web.sh(自动生成实例域名)/model/ModelScope/RadixArk/Qwen3.8-27B-NVFP4(共享盘)/root/sglang_bench.pyPiWeb2026,部署后请修改