优云智算
控制台
立即注册

Qwen3.8-Flash-Next

已去审查Strata是一个面向消费级硬件的本地 AI 推理项目,一键部署 Qwen3.8-Flash-Next,并通过本地 OpenAI/Anthropic 兼容 API 提供高性能推理与图像输入

镜像大小
300 GB
当前版本
v1.1
累计部署
0 次
累计运行
0 h
最近更新
2026-10-08

运行环境

框架版本
PyTorch-2.13.0
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系
+10

已去审查Strata:一个面向消费级硬件的本地 AI 推理项目 能一键部署 Qwen3.8-Flash-Next

webui登录账号为:admin 密码:admin

  • APi密钥: afef2b4024bf036ced4421fa529dcd26d9e6d503a7f93f96

关于去审查的使用:

⚠️ 核心红线:请严格遵守法律法规

本版本虽然 移除了前置的人工或自动化内容审查(Censorship-Free) ,给予了用户最高级别的自由度与隐私空间,但 “免审查”绝不等于“法外之地” 。

  • 属地与跨境合规 :您在使用本系统时,必须严格遵守您****所在国家/地区以及本系统服务器托管地的法律法规。
  • 禁止违法犯罪行为 :严禁利用本系统生成、传播、储存或协助任何涉及以下内容的信息:
    1. 危害国家安全、煽动恐怖主义或破坏社会稳定的言论。
    2. 涉及儿童色情(CSAM)、性剥削或虐待儿童的任何内容(对此类行为零容忍)。
    3. 欺诈、网络攻击、非法窃取隐私或制造恶意软件的指令。
    4. 煽动暴力、严重人身威胁或协助其他现实犯罪的行为。

⚖️ 责任自负原则

  • 行为即责任 :本版本完全基于“用户自主管控”原则运行。系统不再对您的输入和输出进行干预。因此, 您对自身的一切操作行为及产生的后果承担100%的完全法律责任 。
  • 第三方侵权 :请勿利用本系统侵犯他人的著作权、商标权、商业秘密或个人隐私。

💡 风险提示

  • 无过滤输出风险 :由于关闭了安全审查机制,系统可能会输出包含冒犯性、偏见、不准确或具有误导性的信息。请您在参考相关输出时,务必保持独立理性的思考与核实。

关于strata这个项目:

  • Qwen3.8-Flash-Next 这两天在 外网上直接冲上趋势了,原因是真有点离谱:
  • 1250 亿参数的大模型,稀疏 MoE 架构,每次推理只激活 60 亿参数。
  • 有人做了个叫 Strata 的一键安装包,家用游戏 PC 就能跑起来,GitHub 两天涨了 2800 多 star。
  • 以前都说 125B 这种体量得上服务器,这条铁律算是被打破了。有实测从 25 tok/s 干到 50+ tok/s
  • 已经有人做了硬件性价比表:Strata 加持下 Mac 全线落败,N 卡加大内存赢麻了。
  • 本地跑等于零 API 费加数据不出门,普通人是真能动手玩了。

项目地址:


交流加群

bug反馈可以加入科哥专属群交流➕ 广告勿进!

描述图片内容
  • 已经设置开机自动运行【模型完全加载运行需要7分钟左右,请耐心等待模型加载完成】

  • 运行截图webUI:

  • 搭建了 open-webui 调用api 方便大家可视化使用 image.png

image.png

  • 免审查内容: image.png

image.png

image.png

  • 理解图片能力:

image.png

image.png

  • 显存使用情况: image.png

image.png

image.png


  • 【插入一个小广告 给需要做ai视频,图片,短剧等多一个选择】:

  • ✅主打廉价稳定模型中转站推荐:https://vip.kegeai.top

  • ✅推荐一个在线AIGC生成的平台:支持无限画布,智能体,API接口,3D导演台等

  • ✅功能趋于libTV,关键是模型众多,价格美丽!

  • ✅国内外模型全部具备,aigc创多不可多得

  • ✅使用地址:https://wy6688.token6688.com/‬

  • ✅GPT模型编程模型推荐:

  • ✅如果你需要满血得的GPT模型

  • ✅请大胆尝试:https://ai.aiaiai001.com/

  • ✅GPT pro号池最低0.3x倍率节省90%+费用

  • ✅pro 100+单个用户最高并发 满血使用

  • 在线图片、视频生成网站哈基米AI聚合平台:https://link8.lk888.ai/

  • ✅杀疯了!!!在线sd2.5模型最低6毛钱一秒!!!

  • ✅ai大模型:gpt,claude,gemini,deepseek...数百种主流模型

  • ✅最新图片模型:gpt-image2,香蕉2,香蕉pro,即梦,豆包,万相...

  • ✅最新视频模型:sd2,快乐马,grok,veo3,sora2,vidu,可灵...

  • ✅并发高,收费合理(价格优先速度优先)

  • 以上模型均支持API,龙虾CLI接入,web浏览器在线使用!

  • 企业高并发AIGC接口无限画布平台: https://api.api4me.xyz

  • ✅ gpt-image2.5 几分钱特价中!

  • ✅ gpt-image2/香蕉低至几分钱一张

  • ✅性价比sd2 sd2-fast sd2-mini过真人脸在线生成

  • ✅MiniMax H3

  • ✅veo3-fast视频几毛八秒

  • ✅更多特价AI模型接入中

  • 技术微信:312088415



  • 咨询问题前请注意:

  • 1.先说明哪个镜像,发镜像链接和名称,例如:

  • 千问图像2.1最新模型量化版破限工作流大集合

  • 2.先拿到运行报错的log日志或者截图:

  • 没有上面的信息我也没有办法帮到你的,因为镜像比较多,我不清楚你问的哪个镜像的

  • 感谢使用!感谢理解! 感谢支持!


Strata 用户使用手册

这台电脑上的 Strata:模型 Qwen3.8-Flash-Next(1250 亿参数,MoE),跑在本地一张 RTX 4090 24GB + 系统内存 上。 网页界面在 **http://127.0.0.1:8080/**(局域网 http://<本机IP>:8080/),前端聊天套件 Open WebUI 在 **http://127.0.0.1:7860/**。 所有数据和模型都在本机,聊天内容不会上传到任何服务器。


目录

  1. Strata 是什么
  2. 快速开始:从启动到第一次对话
  3. 网页应用三大标签页
  4. 采样与思考设置(Sampling 抽屉)
  5. 用 API 接入你自己的应用(OpenAI / Anthropic)
  6. 图片识别
  7. Open WebUI 前端与文件对话(RAG)
  8. 模型、启动与日常管理
  9. 数据与隐私
  10. 常见问题 FAQ
  11. 速查表

1. Strata 是什么

Strata 是在普通电脑上运行大模型(Qwen3.8-Flash-Next)的免费开源引擎。它把模型拆开散到整台电脑上:

  • 显卡(VRAM):放最常用的专家(experts);
  • 系统内存(RAM):放全部 24576 个专家(本机 IQ3_S 约占 55 GB);
  • SSD:放一张大的查找表。

因此你不需要服务器,就能在桌面电脑上跑一个很聪明的全量大模型。它支持:

  • 聊天 / 写作 / 编程 / 看图(安装时选了“Images”则支持图片输入);
  • 128K 长上下文(本机 IQ3_S 支持 131072 tokens);
  • OpenAI、Anthropic、OpenAI Responses 三种 API,可以接入任何兼容客户端;
  • 思考模式(reasoning):可调 off / low / medium / high;
  • Open WebUI:带文件对话(RAG)的现代化聊天前端。

关于速度(官方在 RTX 5070 12GB 上测得,你(RTX 4090 24GB)会明显更快,官方估算 24GB 卡约每秒 100–140 token):

型号写回答读提示
Q2_094 tok/s2650 tok/s
IQ2_XS79 tok/s2090 tok/s
IQ3_XXS62 tok/s1750 tok/s
IQ3_S(默认)53 tok/s1620 tok/s
Coder(IQ1_M)55 tok/s2180 tok/s

2. 快速开始:从启动到第一次对话

第 1 步:启动

在项目根目录运行一键启动脚本(Linux):

cd /root/Strata
./start_app.sh            # 默认启动 IQ3_S(最聪明的全量档)+ Open WebUI,监听 0.0.0.0

它会自动按顺序做这几件事:

  1. 释放端口:检测并结束占用 8080(Strata)与 7860(Open WebUI)的旧进程(先优雅终止,等不到再强制);
  2. 清理显存:结束其它占用 GPU 的程序,保证模型独占显卡;
  3. 拉起 Open WebUI 前台套件(日志 logs/openwebui.log);
  4. 加载模型:载入约 55 GB 专家到内存并锁定一部分给 GPU,然后监听 0.0.0.0:8080,再用配置好的 API key 保护 /v1/* API。

第 2 步:等待就绪(耐心!)

加载模型需要 1–3 分钟(本机实测约 3.5 分钟)。期间屏幕会提示:

“loading the experts into RAM (about 55 GB) and locking part of them for the GPU. YOUR PC CAN BE SLOW OR STOP RESPONDING FOR 1-3 MINUTES NOW - this is normal.”

电脑卡顿、风扇狂转是正常的,不要关窗口、不要重启。看到服务打印出类似 listening on 0.0.0.0:8080 或浏览器自动弹出页面,就绪了。

检查是否就绪(返回 "status": "ok" 即就绪):

curl -s http://127.0.0.1:8080/health

第 3 步:打开界面,开始对话

页面底部输入框直接打字回车,就是一次对话。模型会流式逐字显示回答。

如果用的是局域网/外网地址且服务开了 API key,请在 About → API key 输入 key(存在 data/api_key.txt,见速查表),否则网页无法调用 /v1 接口。


3. 网页应用三大标签页

页面顶部有 Chat(聊天)/ Monitor(监控)/ About(信息) 三个标签。

3.1 Chat —— 聊天

  • 输入框:底部输入,右侧 Picture 按钮上传图片(需要模型支持视觉,见第 6 节)。
  • 流式输出:回答实时逐字出现;先显示的灰色部分是模型的思考过程,回答正文在下方。
  • 思考折叠:“Show thinking”开关控制思考过程是否展开。
  • 右上角按钮:
    • New chat:清空当前对话开新对话(可“Undo”撤销);
    • 导出:把当前对话导出为 Markdown;
    • Sampling:打开采样设置抽屉(见第 4 节);
    • 会话槽:可把当前对话**保存(park)**到服务端、稍后恢复,也可在长上下文之间切换。
  • 对话历史保存在当前浏览器(localStorage),换个浏览器/设备看不到;需要换设备继续就用会话槽或 API。

3.2 Monitor —— 实时监控

不打断对话即可观察模型和电脑状态:

  • GPU/CPU/内存:显存占用、RAM、GPU 温度;
  • 当前回答:进度、速度(tokens/s)、已读/已写 token;
  • 专家缓存:显存里缓存了多少个专家(越多越快);
  • 对话缓存:服务端“停靠”的对话槽;
  • 最近请求:最近 12 条请求的明细表(token 数、复用、速度、耗时),可“Show all”。

3.3 About —— 信息与设置

  • Engine / Hardware:模型名、引擎版本、上下文长度、KV 缓存、显存里的专家数、图像开关;GPU/CPU/RAM 一览。
  • API:一键复制的 OpenAI base URL(http://<host>:8080/v1)、Anthropic base URL(http://<host>:8080)和 Model name。
  • API key:填上后这个浏览器对 /v1/* 的所有请求都会带上,只保存在当前浏览器。
  • Model settings:编辑运行配置里的一小部分键(并行数、显存预留等),下次启动生效;
  • Unload / Load:立刻把模型从显卡卸下(把显存还给别的程序)或提前加载;/v1/vram 可动态调整为其它程序预留的显存。

4. 采样与思考设置(Sampling 抽屉)

点聊天页右上角的 Sampling 按钮,可对本次对话调整这些参数(部分参数也会影响 API 客户端,见第 5 节):

设置作用常用建议
Thinking(思考力度)Off / Low / Medium / High。High 最适合难题,Off 最快。日常用 Medium;写代码长任务用 High;简单问答 Off
Temperature(温度)0–1.5,随机性。0 = 总是最可能的词(确定性、可复现)。创意写作 0.8–1.0;代码/事实 0–0.3
Top-p / Top-k只从概率最高的候选里采样,数值越小越保守。一般保持默认
Max tokens回答最长生成多少 token;留空 = 一直写到自己认为结束。留空最省心
Seed固定随机种子,配合 Temperature=0 可复现同一回答。留空 = 随机
Show thinking回答时是否展开显示思考过程。默认开
Use tools from MCP让模型调用已配置的 MCP 服务器工具(如果有)。有 MCP 服务器时开
Use for other apps too把当前采样设置设为所有 API 客户端的默认值(客户端自己设了的不受影响)。想统一行为时开

点 Apply 生效,Reset 恢复默认。

注意:Thinking 只在网页/兼容客户端与模型的“思考”机制配合时才有效;API 客户端通过 reasoning_effort 参数控制(见下)。


5. 用 API 接入你自己的应用(OpenAI / Anthropic)

Strata 同时提供三种 API。任何“OpenAI 兼容”客户端都把 base URL 填 http://<host>:8080/v1;Anthropic 客户端填 http://<host>:8080。模型名固定(本机):qwen3.8-flash-next-iq3_s(API 里填错了也没关系,/v1/models 会列出)。

当服务开了 API key 时,所有 /v1/* 请求都要带 key(网页会在 About 里记住,不影响网页本身)。

5.1 OpenAI 兼容:/v1/chat/completions

KEY="$(cat /root/Strata/data/api_key.txt)"
curl -s http://127.0.0.1:8080/v1/chat/completions \
  -H "Authorization: Bearer $KEY" -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next-iq3_s",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user",   "content": "用一句话介绍你自己"}
    ]
  }'

常用可选参数(与官方 OpenAI 一致):

  • "stream": true → 流式返回;
  • "reasoning_effort": "off" | "low" | "medium" | "high"(不传 = 按服务器默认);
  • "max_tokens":限制回答长度;
  • "temperature"、"top_p"、"seed" 等采样参数。

接入示例:

  • Cherry Studio / Chatbox / NextChat 等桌面客户端:新增“OpenAI 兼容”提供商,base URL http://127.0.0.1:8080/v1,API key 填 data/api_key.txt 里的值,模型名写 qwen3.8-flash-next-iq3_s;
  • OpenAI Python SDK:
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8080/v1", api_key="<写在data/api_key.txt里的key>")
r = client.chat.completions.create(
    model="qwen3.8-flash-next-iq3_s",
    messages=[{"role": "user", "content": "写一首关于秋天的诗"}],
    reasoning_effort="medium",
)
print(r.choices[0].message.content)

5.2 Anthropic 兼容:/v1/messages

KEY="$(cat /root/Strata/data/api_key.txt)"
curl -s http://127.0.0.1:8080/v1/messages \
  -H "x-api-key: $KEY" -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next-iq3_s",
    "max_tokens": 1024,
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
  • 思考由 "thinking": {"type": "enabled", "budget_tokens": N} 控制(Strata 自动把 budget 映射成 low/medium/high 档);
  • 令牌数统计:POST /v1/messages/count_tokens。

Claude Code 接入:

export ANTHROPIC_BASE_URL="http://127.0.0.1:8080"
export ANTHROPIC_AUTH_TOKEN="$(cat /root/Strata/data/api_key.txt)"

5.3 OpenAI Responses API:/v1/responses

Codex CLI 等使用 Responses API 的客户端,base URL 填 http://127.0.0.1:8080/v1 即可。注意:服务端是无状态的,/v1/responses/<id>(retrieve / delete / cancel)会返回 404——客户端必须每次发送完整对话,这是设计如此。

5.4 运行控制端点

端点作用
GET /health就绪/模型/是否开 key(无需鉴权)
GET /v1/models模型列表
POST /v1/unload立刻把模型卸下,把显存/内存还给系统(回答间隙用)
POST /v1/load提前把模型加载好
GET /status、/metrics运行状态 / 最近请求统计

6. 图片识别

如果安装时对“Images?”选了 Yes(本机默认模型支持视觉),就可以:

  • 网页聊天:点输入框旁的 Picture 上传图片(每张 ≤ 20 MB;JPEG/PNG/BMP/GIF 直接可用),发送时图片会伴随文字一起被读取;
  • API 客户端:用 OpenAI 格式在消息里加图片:
curl -s http://127.0.0.1:8080/v1/chat/completions \
  -H "Authorization: Bearer $(cat /root/Strata/data/api_key.txt)" -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next-iq3_s",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "这张图里有什么?"},
        {"type": "image_url", "image_url": {"url": "data:image/png;base64,<base64内容>"}}
      ]
    }]
  }'

读图会慢一些(视觉编码器要单独跑)。图片开关在 About 页能看到(Images: on/off)。


7. Open WebUI 前端与文件对话(RAG)

./start_app.sh 会顺带启动 Open WebUI(监听 0.0.0.0:7860),它是一个现代聊天前端:支持账号体系、多会话管理、Markdown/代码块、语音、以及上传文件后对文件内容提问(RAG)。

7.1 首次使用

  1. 浏览器打开 http://127.0.0.1:7860/(局域网:http://<本机IP>:7860/);
  2. 首次访问会要求注册管理员账号(本项目允许注册——注册谁就是谁,数据都存在本机 /root/open-webui/data);
  3. 注册后自动登录。

7.2 与 Strata 的连接

Open WebUI 启动时已通过环境变量自动接好 Strata(内置 OpenAI 提供商,URL http://127.0.0.1:8080/v1 + 同一个 API key)。正常情况下:

  1. 打开右上角模型选择器,应能看到 qwen3.8-flash-next-iq3_s;
  2. 直接对话即可,与 Strata 网页效果相同(思考、流式都在)。

若列表为空,手动配置:

  1. 进入 Admin Panel(管理员面板) → Settings → Connections → OpenAI API Connections → Manage Connections;
  2. URL 填 http://127.0.0.1:8080/v1,API Key 填 data/api_key.txt 里的值;
  3. 保存后刷新。

注意:必须先启动 Strata(8080)再开 Open WebUI,否则直觉上它“连不上”。start_app.sh 已保证顺序;如果中途 Strata 重启过,去 7860 页面点一下刷新重连即可。

7.3 文件对话(RAG)

上传文件(把文件拖进输入框或点加号)后有两种用法:

  • 文档(PDF/Word/文本等):默认会走 RAG——Open WebUI 先用本地 embedding 模型把文件向量化存入本机(首次会自动下载 embedding 模型,约一分钟,需联网),之后你对“这份文档”提问,模型会基于文件内容回答;
  • 图片:会作为图片直接送给模型理解。

首次上传文件时若提示 embedding 下载出错,一般是网络问题:保持默认设置,过一会儿重试一次即可下载完成(数据只存在本机 /root/.cache/huggingface)。


8. 模型、启动与日常管理

8.1 本机装了哪些模型

启动名说明内存占用特点
Q2_0全能档,压缩最狠约 38 GB最快,质量“不错”
IQ2_XS全能档约 39 GB快,质量更好(官方推荐中庸之选)
IQ3_XXS全能档约 47 GB更慢,质量“很好”
IQ3_S(默认)全能档最大约 55 GB最慢,质量最好(官方测试对标完整模型)
Coder编程特化(IQ1_M)约 30 GB写代码快而好,但中文/通用能力弱

都是同一个模型的不同压缩档:越小越快,越大越聪明。64GB 内存可以全装下(IQ3_S 需要别同时开太多程序)。

8.2 常用管理命令

cd /root/Strata

./start_app.sh                     # 启动默认模型 IQ3_S + Open WebUI(自动释放端口、清显存、配 key)
./start_app.sh IQ2_XS              # 换另一个模型(自动重启 Strata;Open WebUI 自动跟随)
RUN_OWUI=0 ./start_app.sh          # 只启动 Strata,不起/不杀 Open WebUI
OWUI_PORT=9090 ./start_app.sh      # 把 Open WebUI 放到别的端口
HOST=127.0.0.1 ./start_app.sh      # 仅本机访问(不强制 API key)
PORTS="8080 8090" ./start_app.sh   # 多个 Strata 端口时
STRATA_API_KEY=mykey ./start_app.sh  # 用自定义 key(不写进文件)
./run-iq3_s.sh                     # 只启动 Strata(不做端口/显存清理,适合已配好时)

日常最常用的就是:

./start_app.sh          # 起服务(之后浏览器开着就能用)
./start_app.sh <标签>    # 换模型

8.3 停止服务

  • 前台运行:直接 Ctrl+C;
  • 接管了端口:下次 ./start_app.sh 会自动先停掉旧的再启动,无需手动;
  • 手动停:pkill -f 'serve/server.py' 停 Strata;pkill -f 'open-webui serve' 停 Open WebUI。

8.4 日志在哪

服务日志
Strata 引擎/root/Strata/strata-iq3_s.log(当前模型的 .log)
Strata 服务输出启动它的终端 / 重定向文件
Open WebUI/root/Strata/logs/openwebui.log

9. 数据与隐私

  • 模型本体:/root/Strata/models/(GGUF 文件与查找表)——只在本地,绝不上传;
  • 网页聊天记录:存在浏览器本地存储(localStorage),清除浏览器数据即清空;服务端不保存对话;
  • Open WebUI:账号与文档向量库存在 /root/open-webui/data,embedding 模型在 /root/.cache/huggingface——全部本机;
  • API key:/root/Strata/data/api_key.txt(权限 600),或环境变量 STRATA_API_KEY;
  • 只要不把 8080 / 7860 暴露到公网(或暴露时加 key),数据不会离开你的电脑。

10. 常见问题 FAQ

Q1. 启动时电脑卡死/很慢,是不是坏了? 正常。启动要把约 55 GB 专家读进内存并给显卡锁 VRAM,1–3 分钟(本机实测约 3.5 分钟)。等打印“listening… on 0.0.0.0:8080”就位。超过 10 分钟还卡,可能是可用内存不足:关掉大程序,或换小模型(IQ2_XS / Q2_0)。

Q2. 提示 8080 端口被占用? 说明 Strata 或别的程序已在跑。用 ./start_app.sh 会自动释放旧 Strata 的端口;若不是 Strata 占的,先找到并关闭那个程序。

Q3. 我访问 http://127.0.0.1:8080/health 返回 api_key: true,但调用 /v1 得到 401? 服务开了 API key。网页:到 About → API key 填入 data/api_key.txt 里的值;代码/命令行:加请求头 Authorization: Bearer <key>(或 x-api-key: <key>)。

Q4. 局域网/别的设备打不开网页?

  • 确认启动时打印的是 --host 0.0.0.0(./start_app.sh 默认就是);
  • 确认局域网 IP(hostname -I 第一个),记错地址也打不开;
  • 检查防火墙是否放行 8080 / 7860(Linux:firewall-cmd --add-port=8080/tcp 或 ufw 同理);
  • 手机等设备要和这台电脑在同一个网段。

Q5. 回答很慢,硬盘灯一直闪? 可用内存不足,模型一部分专家要从 SSD 现读。关掉浏览器等大程序,或换 IQ2_XS / Q2_0 等更小的档。

Q6. 网页里没有 Picture 按钮 / 提示 Pictures off? 该模型在安装时没有启用视觉。About 页可看 Images: on/off;本机默认模型(IQ3_S 等)为 on。图片大于 20 MB 也会提示。

Q7. 回答写到一半就停了? 网页里 Max tokens 留空即可(不限制);设了 Max tokens 就到数量截断。

Q8. 我想让模型“不思考”/“多思考”? 网页 Chat 的 Sampling 抽屉里 Thinking:Off=不思考(最快)、High=深入思考。API 用 reasoning_effort: "off" / "low" / "medium" / "high"。

Q9. Open WebUI 里选不到模型 / 提示连接失败?

  • 先确认 Strata 已就绪(8080):curl http://127.0.0.1:8080/health 返回 "status":"ok";
  • Open WebUI 内置连接已配置好;若被手动改乱,按 7.2 重新填 URL http://127.0.0.1:8080/v1 + key;
  • Strata 刚重启时,去 7860 页面刷新一下。

Q10. 上传文件回答不了内容 / embedding 一直在转? 首用 RAG 需要下载 embedding 模型(约 90MB,一次性)。保持默认“自动更新”设置,网络好时重试即可;文件内容只在本机。

Q11. 怎么换模型? cd /root/Strata && ./start_app.sh IQ2_XS(或 Q2_0 / IQ3_XXS / IQ3_S / coder)。脚本会自动停旧的、换新的并重启 Open WebUI。

Q12. 我想把显存让给游戏/别的程序? Strata 空闲时在 About → Unload(或 POST /v1/unload)把模型卸下;要用时 Load(或发第一个请求会自动加载)。

Q13. /v1/responses 的 retrieve/cancel 返回 404? 正常:Strata 无状态,不保存 responses 记录,客户端每次发完整对话。(OpenAI 惯例如此做也兼容客户端。)

Q14. Coder 模型中文回答怪怪的? Coder 去掉了非代码专家,中文/通用能力弱。中文日常用 Q2_0 / IQ2_XS / IQ3_S。

Q15. 换过 setup / 运行过 run-*.sh 后,怎么确保是“对外+带 key”的配置? run-*.sh 是 setup 生成的,重跑 setup 会还原成仅本机。统一用 ./start_app.sh(自动 0.0.0.0 + key)即可。

Q16. 忘记 API key 在哪? /root/Strata/data/api_key.txt。要是想换一个,直接改这个文件(或设 STRATA_API_KEY),重启服务生效。

Q17. 这台机器能同时处理几个请求? 默认一次只答一个,其他排队等。需要并行在运行配置里设 "parallel": 2(上限视脚本而定),多个请求可同时解码,但单请求速度会下降。

Q18. 我需要把 8080 暴露到公网使用,安全吗? ./start_app.sh 默认就是 0.0.0.0 + 自动 API key(写进 data/api_key.txt),这是相对安全的做法。仍然建议:不要把未加 key 的服务直接暴露公网;真要对公网开放,优先用反向代理 + key,或 SSH 隧道,并确认防火墙只放行需要的端口。


11. 速查表

项值
Strata 网页 / APIhttp://127.0.0.1:8080/(局域网 http://<本机IP>:8080/)
OpenAI base URLhttp://127.0.0.1:8080/v1
Anthropic base URLhttp://127.0.0.1:8080
模型名qwen3.8-flash-next-iq3_s(还有 IQ2_XS / IQ3_XXS / Q2_0 / coder 各档)
上下文长度131072 tokens(IQ3_S)
API key/root/Strata/data/api_key.txt 或 $STRATA_API_KEY
Open WebUIhttp://127.0.0.1:7860/(首次访问注册管理员)
启动命令cd /root/Strata && ./start_app.sh
换模型./start_app.sh IQ2_XS / Q2_0 / IQ3_XXS / coder
就绪检查curl -s http://127.0.0.1:8080/health
Strata 日志/root/Strata/strata-iq3_s.log
Open WebUI 日志/root/Strata/logs/openwebui.log
模型文件/root/Strata/models/
Open WebUI 数据/root/open-webui/data
网页记录浏览器 localStorage(服务端无状态)

祝使用愉快。如遇问题优先看本文档 FAQ;更细节的引擎原理见项目内 docs/DETAILS.md、docs/MODELS.md。

0 个镜像 · 被使用 0 次
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.1最新
2026-10-08
已去审查Strata是一个面向消费级硬件的本地 AI 推理项目,一键部署 Qwen3.8-Flash-Next,并通过本地 OpenAI/Anthropic 兼容 API 提供高性能推理与图像输入
v1.0
2026-10-07
去审查Strata是一个面向消费级硬件的本地 AI 推理项目,能一键部署 Qwen3.8-Flash-Next,并通过本地 OpenAI/Anthropic 兼容 API 提供高性能推理与图像输入支持
评分
0.0
暂无评分
我的评分
未评分
Qwen3.8-Flash-Next一键部署 | 优云智算