破限量化GGUF版Q4量化版本24gb显存推荐40系显卡24gb及以上运行




【插入一个小广告 给需要做ai视频,图片,短剧等多一个选择】:
✅主打廉价稳定模型中转站推荐:https://vip.kegeai.top
✅搞到一个国际版的在线sd2.0模型1.x元十五秒,也支持API调用
✅GPT模型编程模型推荐:
✅如果你需要满血得的GPT模型
✅请大胆尝试:https://ai.aiaiai001.com/
✅GPT pro号池最低0.3x倍率节省90%+费用
✅pro 100+单个用户最高并发 满血使用
在线图片、视频生成网站哈基米AI聚合平台:https://link8.lk888.ai/
✅杀疯了!!!在线sd2.5模型最低6毛钱一秒!!!
✅ai大模型:gpt,claude,gemini,deepseek...数百种主流模型
✅最新图片模型:gpt-image2,香蕉2,香蕉pro,即梦,豆包,万相...
✅最新视频模型:sd2,快乐马,grok,veo3,sora2,vidu,可灵...
✅并发高,收费合理(价格优先速度优先)
以上模型均支持API,龙虾CLI接入,web浏览器在线使用!
企业高并发AIGC接口无限画布平台: https://api.api4me.xyz
✅ gpt-image2.5 几分钱特价中!
✅ gpt-image2/香蕉低至几分钱一张
✅性价比sd2 sd2-fast sd2-mini过真人脸在线生成
✅MiniMax H3
✅veo3-fast视频几毛八秒
✅更多特价AI模型接入中
技术微信:312088415
咨询问题前请注意:
1.先说明哪个镜像,发镜像链接和名称,例如:
千问图像2.1最新模型量化版破限工作流大集合
2.先拿到运行报错的log日志或者截图:
没有上面的信息我也没有办法帮到你的,因为镜像比较多,我不清楚你问的哪个镜像的
感谢使用!感谢理解! 感谢支持!
本手册面向第一次使用的用户,介绍如何启动、访问和使用部署在 RTX 4090 上的
Ornith-1.5-35B-A3B-CRACK-Q4_K_M.gguf 大语言模型服务,涵盖主要功能介绍与常见问题解答。
| 项目 | 说明 |
|---|---|
| 模型 | Ornith-1.5-35B-A3B(MoE 混合架构,35B 总参 / 3B 激活,带 SSM/Mamba 循环注意力层) |
| 量化 | Q4_K_M(GGUF,文件约 20.2 GiB) |
| 推理引擎 | llama-server(llama.cpp,内置 Web UI) |
| 上下文长度 | 128K(131072 tokens),最多同时支持约 15 个并发会话 |
| 显存占用 | 约 23.4 GB / 24.6 GB(RTX 4090) |
| 访问地址 | http://<服务器IP>:7860/ |
| API Key | sk-test12345678 |
注意:GPU 已被本服务占用约 23.4 GB。在启动本模型前,必须先停止运行在 7860 端口的其他模型,否则会因显存不足或端口冲突而失败(详见第 5 章 FQA)。
所有启动 / 停止操作都通过同一个脚本完成,无需记忆复杂命令。
在服务器终端执行:
bash /root/llama.cpp/start_app.sh start
脚本会自动:
0.0.0.0:7860,等待就绪后输出:Starting llama-server on 0.0.0.0:7860 ...
Ready. Web UI: http://0.0.0.0:7860/
API key required: sk-test12345678
看到 Ready. 即表示启动成功。
在你自己的电脑浏览器中打开:
http://<服务器IP>:7860/
首次进入时浏览器会要求输入 API Key,填入 sk-test12345678 即可开始对话。
若服务器与浏览器在同一台机器上,直接访问
http://127.0.0.1:7860/。
在输入框中打字提问,回车发送即可。右上角设置区可以调整:
Ornith-1.5-35B-A3B-CRACK-Q4_K_M.gguf;| 操作 | 命令 |
|---|---|
| 启动服务 | bash /root/llama.cpp/start_app.sh start |
| 停止服务 | bash /root/llama.cpp/start_app.sh stop |
| 查看状态 | bash /root/llama.cpp/start_app.sh status |
| 重启服务 | bash /root/llama.cpp/start_app.sh restart |
配置集中在
/root/llama.cpp/start_app.sh(上下文长度、端口、API Key 等),普通使用无需修改。日志输出在/root/llama-server.log,出问题时排查用。
llama-server 已交由 supervisord 托管(/etc/supervisor/conf.d/llama-server.conf):
autostart=true,服务器一开机模型自动加载;autorestart=false + startretries=0,加载失败(如显存不足)会停在 FATAL,不会反复拉起。日常管理用 supervisor 命令:
| 操作 | 命令 |
|---|---|
| 查看状态 | supervisorctl status llama-server |
| 停止服务 | supervisorctl stop llama-server |
| 启动服务 | supervisorctl start llama-server |
| 重启服务 | supervisorctl restart llama-server |
服务运行日志:/var/log/supervisor/llama-server-stdout.log —— 出问题优先看这里。
start_app.sh的手动 start/stop/status 命令仍然有效,适合不通过 supervisor 的临时场景;两种方式切勿同时使用(会造成端口/显存冲突)。
浏览器访问即得,支持:
服务同时提供 OpenAI 兼容的 HTTP 接口,可对接各类客户端(如 Open WebUI、ChatBox、本地脚本等)。
请求头需携带:Authorization: Bearer sk-test12345678
与本地 llama-server(同机 127.0.0.1)使用时无需认证,也可指定 API Key 走同一套鉴权。
常用端点(http://<服务器IP>:7860):
POST /v1/chat/completions # 对话补全
GET /health # 健康检查,返回 ok 表示服务正常
GET /v1/models # 查询当前加载的模型
curl 示例:
curl http://127.0.0.1:7860/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"Ornith-1.5-35B-A3B-CRACK-Q4_K_M","messages":[{"role":"user","content":"你好"}]}'
原因:7860 端口或显存被其他模型占用(例如 Xing4.0-29B)。
解决:
bash /root/llama.cpp/start_app.sh stop
停掉旧服务后再 start。若仍不成功,用 nvidia-smi 查看 vram 占用并手动结束占用进程。
首次访问需输入 API Key:sk-test12345678。若提示 Ready. 后仍无法访问,请确认防火墙放行 TCP 端口 7860,且访问的是正确的服务器 IP。
无需。模型文件 /root/models/Ornith-1.5-35B-A3B-CRACK-Q4_K_M.gguf 已部署就绪,直接 start 即可。如需校验,可在 huggingface 仓库核对 SHA 与文件大小(约 20.2 GiB)。
不建议。实测 256K 需要约 5.1 GB KV 缓存,加上权重会超过 24 GB 显存导致 OOM;128K 是当前稳定上限。
bash /root/llama.cpp/start_app.sh status
curl http://127.0.0.1:7860/health # 期望输出 ok
tail -f /root/llama-server.log
模型官方提供配套视觉适配器(mmproj-*.gguf),但本期部署未启用,仅支持纯文本输入。
# 常用三连
bash /root/llama.cpp/start_app.sh status # 1. 看状态
bash /root/llama.cpp/start_app.sh start # 2. 启动
bash /root/llama.cpp/start_app.sh stop # 3. 停止(换模型前必须做)
Web UI:http://<服务器IP>:7860/ · API Key:sk-test12345678
