优云智算
控制台
立即注册

A800·122B私有大模型API

开箱即用的 122B 大模型私有 API:Qwen3.5-122B Q4 量化 + 2 路 256K 超长上下文 + OpenAI 兼容接口 + Web 实时监控面板,开机自启零配置。

镜像大小
120 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-09-17

运行环境

框架版本
PyTorch-2.13.0
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
A800

A800 · 122B 私有大模型 API 镜像

一台 A800 80G 开机即得一个 122B 参数的私有 LLM 服务, OpenAI 协议兼容,含 Web 实时监控,全程零部署。

镜像包含

  • 模型:Huihui-Qwen3.5-122B-A10B(Q4_K_M 量化,70GB,纯文本)
  • 推理引擎:llama.cpp(SM80 针对 A800 编译,实测生成 73 tokens/s)
  • 并发:2 卡槽 × 256K 上下文(总计 512K tokens,KV cache q8_0)
  • API 网关:Nginx 双入口(80 明文 + 443 HTTPS 自签证书),Bearer Key 鉴权
  • Web 监控:llama-lens 面板,实时查看卡槽占用、生成速度、显存、请求日志
  • 开机自启:平台 /start.d 机制,开机自动等待 GPU 并加载(冷启动约 5 分钟)

快速开始

  1. 购买 A800 实例开机,等待约 5 分钟模型自动加载完成
  2. 获取 API Key:cat /root/llm/122b-api.key
  3. 调用(推荐 80 明文入口,工具兼容性最好):
curl http://<你的实例IP>/v1/chat/completions \
  -H "Authorization: Bearer <你的Key>" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-pro-v4","messages":[{"role":"user","content":"你好"}]}'
  1. 浏览器打开 http://<你的实例IP>/ 查看实时监控面板

客户端接入

  • OpenAI SDK / 各种套壳应用:Base URL 填 http://<IP>/v1,模型 deepseek-pro-v4
  • New API / one-api 网关:渠道 Base URL 填 http://<IP>
  • 关闭思考链(本模型默认带思考):请求加 "chat_template_kwargs":{"enable_thinking":false}

常用配置

  • 启动参数:/root/llm/122b.env(上下文/并发,改完执行 pkill -f llama-server 后守护会在 30 秒内自动用新配置重启; 注意 env 在守护启动时读取,稳妥做法是同时重启 /start.d/122b.sh
  • 可切换形态(显存不变):2×256K 长文本 ↔ 4×128K 高并发,改 env 里 PARALLEL=4 即可
  • 服务日志:/start.d/log/122b.log
  • 模型目录:/root/llm/models/

注意事项

  • 建议开机后立即修改自己的 SSH 密码并更换 API Key(镜像内含公版 Key)
  • 443 入口为自签证书,客户端需跳过验证(或直接用 80 明文入口)
  • 无卡模式开机不加载模型,插卡重启后自动恢复服务
  • 本镜像为纯文本推理(未含视觉模型,80G 显存优先留给 256K 长上下文)
0 个镜像 · 被使用 0
版本日志
v1.0最新
2026-09-16
开箱即用的 122B 大模型私有 API:Qwen3.5-122B Q4 量化 + 2 路 256K 超长上下文 + OpenAI 兼容接口 + Web 实时监控面板,开机自启零配置。
评分
0.0
暂无评分
我的评分
未评分
A800·122B私有大模型API一键部署 | 优云智算