开箱即用的 122B 大模型私有 API:Qwen3.5-122B Q4 量化 + 2 路 256K 超长上下文 + OpenAI 兼容接口 + Web 实时监控面板,开机自启零配置。
一台 A800 80G 开机即得一个 122B 参数的私有 LLM 服务, OpenAI 协议兼容,含 Web 实时监控,全程零部署。
cat /root/llm/122b-api.keycurl http://<你的实例IP>/v1/chat/completions \
-H "Authorization: Bearer <你的Key>" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-pro-v4","messages":[{"role":"user","content":"你好"}]}'
http://<你的实例IP>/ 查看实时监控面板http://<IP>/v1,模型 deepseek-pro-v4http://<IP>"chat_template_kwargs":{"enable_thinking":false}/root/llm/122b.env(上下文/并发,改完执行
pkill -f llama-server 后守护会在 30 秒内自动用新配置重启;
注意 env 在守护启动时读取,稳妥做法是同时重启 /start.d/122b.sh)PARALLEL=4 即可/start.d/log/122b.log/root/llm/models/