优云智算
控制台
立即注册

ornith-1.5-35B破限Q4版

破限量化GGUF版Q4量化版本24gb显存推荐40系显卡24gb及以上运行

镜像大小
60 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-09-23

运行环境

框架版本
CUDA-13.2
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系
+10

Ornith-1.5 35B大模型

访问密码: sk-test12345678

支持openai格式 本地 codex和gpt桌面版调用

具体看下面手册或者视频教程

  • 在编码基准上击败同等规模的 Qwen3.6
  • SWE-bench Verified 79 分,使用标准 35B 模型。
  • 262K 上下文。
  • RTX 4090:158 tok/s

破限量化GGUF版Q4量化版本24gb显存推荐40系显卡24gb及以上运行

已经开机自动运行

开机需要加载模型大概3-5分钟 然后打开SD-webUI

image.png

看到webui这个 Loading Model 需要继续等待

image.png

使用视频教程:

image.png

image.png


  • 【插入一个小广告 给需要做ai视频,图片,短剧等多一个选择】:

  • ✅主打廉价稳定模型中转站推荐:https://vip.kegeai.top

  • ✅搞到一个国际版的在线sd2.0模型1.x元十五秒,也支持API调用

  • ✅使用地址:https://wy6688.token6688.com/‬

  • ✅GPT模型编程模型推荐:

  • ✅如果你需要满血得的GPT模型

  • ✅请大胆尝试:https://ai.aiaiai001.com/

  • ✅GPT pro号池最低0.3x倍率节省90%+费用

  • ✅pro 100+单个用户最高并发 满血使用

  • 在线图片、视频生成网站哈基米AI聚合平台:https://link8.lk888.ai/

  • ✅杀疯了!!!在线sd2.5模型最低6毛钱一秒!!!

  • ✅ai大模型:gpt,claude,gemini,deepseek...数百种主流模型

  • ✅最新图片模型:gpt-image2,香蕉2,香蕉pro,即梦,豆包,万相...

  • ✅最新视频模型:sd2,快乐马,grok,veo3,sora2,vidu,可灵...

  • ✅并发高,收费合理(价格优先速度优先)

  • 以上模型均支持API,龙虾CLI接入,web浏览器在线使用!

  • 企业高并发AIGC接口无限画布平台: https://api.api4me.xyz

  • ✅ gpt-image2.5 几分钱特价中!

  • ✅ gpt-image2/香蕉低至几分钱一张

  • ✅性价比sd2 sd2-fast sd2-mini过真人脸在线生成

  • ✅MiniMax H3

  • ✅veo3-fast视频几毛八秒

  • ✅更多特价AI模型接入中

  • 技术微信:312088415



  • 咨询问题前请注意:

  • 1.先说明哪个镜像,发镜像链接和名称,例如:

  • 千问图像2.1最新模型量化版破限工作流大集合

  • 2.先拿到运行报错的log日志或者截图:

  • 没有上面的信息我也没有办法帮到你的,因为镜像比较多,我不清楚你问的哪个镜像的

  • 感谢使用!感谢理解! 感谢支持!


Ornith-1.5-35B-A3B 用户使用手册

本手册面向第一次使用的用户,介绍如何启动、访问和使用部署在 RTX 4090 上的 Ornith-1.5-35B-A3B-CRACK-Q4_K_M.gguf 大语言模型服务,涵盖主要功能介绍与常见问题解答。


1. 环境概览

项目说明
模型Ornith-1.5-35B-A3B(MoE 混合架构,35B 总参 / 3B 激活,带 SSM/Mamba 循环注意力层)
量化Q4_K_M(GGUF,文件约 20.2 GiB)
推理引擎llama-server(llama.cpp,内置 Web UI)
上下文长度128K(131072 tokens),最多同时支持约 15 个并发会话
显存占用约 23.4 GB / 24.6 GB(RTX 4090)
访问地址http://<服务器IP>:7860/
API Keysk-test12345678

注意:GPU 已被本服务占用约 23.4 GB。在启动本模型前,必须先停止运行在 7860 端口的其他模型,否则会因显存不足或端口冲突而失败(详见第 5 章 FQA)。


2. 快速上手(三步启动)

所有启动 / 停止操作都通过同一个脚本完成,无需记忆复杂命令。

2.1 启动服务

在服务器终端执行:

bash /root/llama.cpp/start_app.sh start

脚本会自动:

  1. 加载模型(首次加载约需 1–2 分钟);
  2. 监听 0.0.0.0:7860,等待就绪后输出:
Starting llama-server on 0.0.0.0:7860 ...
Ready. Web UI: http://0.0.0.0:7860/
API key required: sk-test12345678

看到 Ready. 即表示启动成功。

2.2 进入对话界面

你自己的电脑浏览器中打开:

http://<服务器IP>:7860/

首次进入时浏览器会要求输入 API Key,填入 sk-test12345678 即可开始对话。

若服务器与浏览器在同一台机器上,直接访问 http://127.0.0.1:7860/

2.3 开始对话

在输入框中打字提问,回车发送即可。右上角设置区可以调整:

  • Model:默认即为 Ornith-1.5-35B-A3B-CRACK-Q4_K_M.gguf
  • Max tokens / Context:最大可拉到 128K 上下文;
  • Top P / Temperature:控制回答的随机性与发散程度。

3. 服务管理常用命令

操作命令
启动服务bash /root/llama.cpp/start_app.sh start
停止服务bash /root/llama.cpp/start_app.sh stop
查看状态bash /root/llama.cpp/start_app.sh status
重启服务bash /root/llama.cpp/start_app.sh restart

配置集中在 /root/llama.cpp/start_app.sh(上下文长度、端口、API Key 等),普通使用无需修改。日志输出在 /root/llama-server.log,出问题时排查用。

3.1 开机自启(推荐方式:supervisord 托管)

llama-server 已交由 supervisord 托管(/etc/supervisor/conf.d/llama-server.conf):

  • 开机自动运行autostart=true,服务器一开机模型自动加载;
  • 启动失败不自动重启autorestart=false + startretries=0,加载失败(如显存不足)会停在 FATAL,不会反复拉起。

日常管理用 supervisor 命令:

操作命令
查看状态supervisorctl status llama-server
停止服务supervisorctl stop llama-server
启动服务supervisorctl start llama-server
重启服务supervisorctl restart llama-server

服务运行日志:/var/log/supervisor/llama-server-stdout.log —— 出问题优先看这里。

start_app.sh 的手动 start/stop/status 命令仍然有效,适合不通过 supervisor 的临时场景;两种方式切勿同时使用(会造成端口/显存冲突)。


4. 主要功能介绍

4.1 Web 对话界面(内置)

浏览器访问即得,支持:

  • 多轮连续对话、上下文记忆;
  • 无限流/流式输出切换;
  • 多会话并行(最多约 15 个独立对话);
  • 参数实时调节(Temperature、Top P、上下文窗口长度等)。

4.2 OpenAI 兼容 API

服务同时提供 OpenAI 兼容的 HTTP 接口,可对接各类客户端(如 Open WebUI、ChatBox、本地脚本等)。 请求头需携带:Authorization: Bearer sk-test12345678

与本地 llama-server(同机 127.0.0.1)使用时无需认证,也可指定 API Key 走同一套鉴权。

常用端点(http://<服务器IP>:7860):

POST /v1/chat/completions      # 对话补全
GET  /health                    # 健康检查,返回 ok 表示服务正常
GET  /v1/models                 # 查询当前加载的模型

curl 示例:

curl http://127.0.0.1:7860/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"Ornith-1.5-35B-A3B-CRACK-Q4_K_M","messages":[{"role":"user","content":"你好"}]}'

4.3 模型特点

  • 超长上下文(128K):适合一次性投喂长文档、代码库片段或整本书进行问答;
  • 低显存占用:得益于 Mamba/SSM 混合结构,KV 缓存不随上下文线性膨胀(仅约 20KB/token),128K 上下文也只需 ~2.6 GB 显存;
  • MoE 高效推理:虽然总参 35B,每次推理仅激活约 3B 参数,速度与显存表现接近小模型。

5. 常见问题(FAQ)

Q1:启动失败 / 端口被占用 / 显存不足(OOM)

原因:7860 端口或显存被其他模型占用(例如 Xing4.0-29B)。 解决

bash /root/llama.cpp/start_app.sh stop

停掉旧服务后再 start。若仍不成功,用 nvidia-smi 查看 vram 占用并手动结束占用进程。

Q2:浏览器打开网页一直在加载 / 要求输入密钥?

首次访问需输入 API Key:sk-test12345678。若提示 Ready. 后仍无法访问,请确认防火墙放行 TCP 端口 7860,且访问的是正确的服务器 IP。

Q3:回答"卡住"或过慢?

  • 128K 上下文是上限,接近上限时生成变慢属正常;
  • 同一时间并发的会话越多(上限约 15),单个响应越慢;
  • 显存剩余很少(~0.7 GB),不建议加大上下文或同时开过多会话。

Q4:下载的模型是否完整 / 要不要自己装模型?

无需。模型文件 /root/models/Ornith-1.5-35B-A3B-CRACK-Q4_K_M.gguf 已部署就绪,直接 start 即可。如需校验,可在 huggingface 仓库核对 SHA 与文件大小(约 20.2 GiB)。

Q5:能把上下文开到 256K 吗?

不建议。实测 256K 需要约 5.1 GB KV 缓存,加上权重会超过 24 GB 显存导致 OOM;128K 是当前稳定上限。

Q6:怎么查看服务是否正常?

bash /root/llama.cpp/start_app.sh status
curl http://127.0.0.1:7860/health   # 期望输出 ok

Q7:日志在哪里看?

tail -f /root/llama-server.log

Q8:这个模型支持图片/视觉输入吗?

模型官方提供配套视觉适配器(mmproj-*.gguf),但本期部署未启用,仅支持纯文本输入。


6. 快速参考卡

# 常用三连
bash /root/llama.cpp/start_app.sh status   # 1. 看状态
bash /root/llama.cpp/start_app.sh start    # 2. 启动
bash /root/llama.cpp/start_app.sh stop     # 3. 停止(换模型前必须做)

Web UI:http://<服务器IP>:7860/ · API Key:sk-test12345678

0 个镜像 · 被使用 0
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.0最新
2026-09-23
破限量化GGUF版Q4量化版本24gb显存推荐40系显卡24gb及以上运行
评分
0.0
暂无评分
我的评分
未评分
ornith-1.5-35B破限Q4版一键部署 | 优云智算