优云智算
控制台
立即注册
2元/时

122B大模型API一键部署

▎ 开箱即用的 122B 大模型私有 API:Qwen3.5-122B Q4 量化 + 4 路并发 256K 上下文 + OpenAI 兼容公网接口 + Web 监控,开机自启。

镜像大小
120 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-09-16

运行环境

框架版本
PyTorch-2.13.0
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
H20A100

H20 · 122B 私有大模型 API 镜像

一台 H20(97GB 显存)开箱即得一个 122B 参数的私有 LLM 服务, OpenAI 接口兼容,无需任何部署操作。

镜像包含

  • 模型:Qwen3.5-122B-A10B(Q4_K_M 量化,74GB,多模态,支持视觉理解)
  • 推理引擎:llama.cpp(CUDA SM90 针对性编译)
  • 并发:4 卡槽 × 256K 上下文(总计 1M tokens,KV cache q8_0)
  • 公网 API:Nginx HTTPS 反代,OpenAI 兼容 /v1/chat/completions
  • Web 监控:llama-lens 面板(端口 8000),实时查看卡槽、速度、显存
  • 开机自启:平台 /start.d 机制,无卡模式开机自动等待 GPU 后拉起

快速开始

  1. 购买带 H20 GPU 的实例开机,模型自动加载(约 2~3 分钟)
  2. 查看本机 API Key:cat /root/llm/122b-api.key
  3. 调用(证书为自签,客户端需跳过验证):
curl -k https://<你的实例IP>/v1/chat/completions \
  -H "Authorization: Bearer <你的Key>" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-pro-v4","messages":[{"role":"user","content":"你好"}]}'
  1. 浏览器打开 http://<你的实例IP>:8000 查看监控面板

常用配置

  • 启动参数:/root/llm/122b.env(上下文/并发/KV 量化,改完需重启守护脚本)
  • 服务日志:/root/llm/122b-server.log
  • 模型目录:/root/llm/models/
  • 关闭思考链:请求中加 "chat_template_kwargs":{"enable_thinking":false}

注意事项

  • 建议开机后重置自己的 API Key 并重签自签证书(镜像内含公版证书)
  • 无卡模式(关机省钱)不加载模型,重新插卡开机自动恢复服务
0 个镜像 · 被使用 0
版本日志
v1.0最新
2026-09-16
▎ 开箱即用的 122B 大模型私有 API:Qwen3.5-122B Q4 量化 + 4 路并发 256K 上下文 + OpenAI 兼容公网接口 + Web 监控,开机自启。
评分
0.0
暂无评分
我的评分
未评分
122B大模型API一键部署一键部署 | 优云智算