▎ 开箱即用的 122B 大模型私有 API:Qwen3.5-122B Q4 量化 + 4 路并发 256K 上下文 + OpenAI 兼容公网接口 + Web 监控,开机自启。
一台 H20(97GB 显存)开箱即得一个 122B 参数的私有 LLM 服务, OpenAI 接口兼容,无需任何部署操作。
/v1/chat/completionscat /root/llm/122b-api.keycurl -k https://<你的实例IP>/v1/chat/completions \
-H "Authorization: Bearer <你的Key>" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-pro-v4","messages":[{"role":"user","content":"你好"}]}'
http://<你的实例IP>:8000 查看监控面板/root/llm/122b.env(上下文/并发/KV 量化,改完需重启守护脚本)/root/llm/122b-server.log/root/llm/models/"chat_template_kwargs":{"enable_thinking":false}