已去审查Strata是一个面向消费级硬件的本地 AI 推理项目,一键部署 Qwen3.8-Flash-Next,并通过本地 OpenAI/Anthropic 兼容 API 提供高性能推理与图像输入
⚠️ 核心红线:请严格遵守法律法规
本版本虽然 移除了前置的人工或自动化内容审查(Censorship-Free) ,给予了用户最高级别的自由度与隐私空间,但 “免审查”绝不等于“法外之地” 。
⚖️ 责任自负原则
💡 风险提示
bug反馈可以加入科哥专属群交流➕ 广告勿进!
已经设置开机自动运行【模型完全加载运行需要7分钟左右,请耐心等待模型加载完成】
运行截图webUI:
搭建了 open-webui 调用api 方便大家可视化使用










【插入一个小广告 给需要做ai视频,图片,短剧等多一个选择】:
✅主打廉价稳定模型中转站推荐:https://vip.kegeai.top
✅推荐一个在线AIGC生成的平台:支持无限画布,智能体,API接口,3D导演台等
✅功能趋于libTV,关键是模型众多,价格美丽!
✅国内外模型全部具备,aigc创多不可多得
✅GPT模型编程模型推荐:
✅如果你需要满血得的GPT模型
✅请大胆尝试:https://ai.aiaiai001.com/
✅GPT pro号池最低0.3x倍率节省90%+费用
✅pro 100+单个用户最高并发 满血使用
在线图片、视频生成网站哈基米AI聚合平台:https://link8.lk888.ai/
✅杀疯了!!!在线sd2.5模型最低6毛钱一秒!!!
✅ai大模型:gpt,claude,gemini,deepseek...数百种主流模型
✅最新图片模型:gpt-image2,香蕉2,香蕉pro,即梦,豆包,万相...
✅最新视频模型:sd2,快乐马,grok,veo3,sora2,vidu,可灵...
✅并发高,收费合理(价格优先速度优先)
以上模型均支持API,龙虾CLI接入,web浏览器在线使用!
企业高并发AIGC接口无限画布平台: https://api.api4me.xyz
✅ gpt-image2.5 几分钱特价中!
✅ gpt-image2/香蕉低至几分钱一张
✅性价比sd2 sd2-fast sd2-mini过真人脸在线生成
✅MiniMax H3
✅veo3-fast视频几毛八秒
✅更多特价AI模型接入中
技术微信:312088415
咨询问题前请注意:
1.先说明哪个镜像,发镜像链接和名称,例如:
千问图像2.1最新模型量化版破限工作流大集合
2.先拿到运行报错的log日志或者截图:
没有上面的信息我也没有办法帮到你的,因为镜像比较多,我不清楚你问的哪个镜像的
感谢使用!感谢理解! 感谢支持!
这台电脑上的 Strata:模型 Qwen3.8-Flash-Next(1250 亿参数,MoE),跑在本地一张 RTX 4090 24GB + 系统内存 上。 网页界面在 **http://127.0.0.1:8080/**(局域网 http://<本机IP>:8080/),前端聊天套件 Open WebUI 在 **http://127.0.0.1:7860/**。 所有数据和模型都在本机,聊天内容不会上传到任何服务器。
Strata 是在普通电脑上运行大模型(Qwen3.8-Flash-Next)的免费开源引擎。它把模型拆开散到整台电脑上:
因此你不需要服务器,就能在桌面电脑上跑一个很聪明的全量大模型。它支持:
关于速度(官方在 RTX 5070 12GB 上测得,你(RTX 4090 24GB)会明显更快,官方估算 24GB 卡约每秒 100–140 token):
型号 写回答 读提示 Q2_0 94 tok/s 2650 tok/s IQ2_XS 79 tok/s 2090 tok/s IQ3_XXS 62 tok/s 1750 tok/s IQ3_S(默认) 53 tok/s 1620 tok/s Coder(IQ1_M) 55 tok/s 2180 tok/s
在项目根目录运行一键启动脚本(Linux):
cd /root/Strata
./start_app.sh # 默认启动 IQ3_S(最聪明的全量档)+ Open WebUI,监听 0.0.0.0
它会自动按顺序做这几件事:
logs/openwebui.log);0.0.0.0:8080,再用配置好的 API key 保护 /v1/* API。加载模型需要 1–3 分钟(本机实测约 3.5 分钟)。期间屏幕会提示:
“loading the experts into RAM (about 55 GB) and locking part of them for the GPU. YOUR PC CAN BE SLOW OR STOP RESPONDING FOR 1-3 MINUTES NOW - this is normal.”
电脑卡顿、风扇狂转是正常的,不要关窗口、不要重启。看到服务打印出类似 listening on 0.0.0.0:8080 或浏览器自动弹出页面,就绪了。
检查是否就绪(返回 "status": "ok" 即就绪):
curl -s http://127.0.0.1:8080/health
http://<eth0 IP>:8080/ 会打印出来)页面底部输入框直接打字回车,就是一次对话。模型会流式逐字显示回答。
如果用的是局域网/外网地址且服务开了 API key,请在 About → API key 输入 key(存在 data/api_key.txt,见速查表),否则网页无法调用 /v1 接口。
页面顶部有 Chat(聊天)/ Monitor(监控)/ About(信息) 三个标签。
不打断对话即可观察模型和电脑状态:
http://<host>:8080/v1)、Anthropic base URL(http://<host>:8080)和 Model name。/v1/* 的所有请求都会带上,只保存在当前浏览器。/v1/vram 可动态调整为其它程序预留的显存。点聊天页右上角的 Sampling 按钮,可对本次对话调整这些参数(部分参数也会影响 API 客户端,见第 5 节):
| 设置 | 作用 | 常用建议 |
|---|---|---|
| Thinking(思考力度) | Off / Low / Medium / High。High 最适合难题,Off 最快。 | 日常用 Medium;写代码长任务用 High;简单问答 Off |
| Temperature(温度) | 0–1.5,随机性。0 = 总是最可能的词(确定性、可复现)。 | 创意写作 0.8–1.0;代码/事实 0–0.3 |
| Top-p / Top-k | 只从概率最高的候选里采样,数值越小越保守。 | 一般保持默认 |
| Max tokens | 回答最长生成多少 token;留空 = 一直写到自己认为结束。 | 留空最省心 |
| Seed | 固定随机种子,配合 Temperature=0 可复现同一回答。 | 留空 = 随机 |
| Show thinking | 回答时是否展开显示思考过程。 | 默认开 |
| Use tools from MCP | 让模型调用已配置的 MCP 服务器工具(如果有)。 | 有 MCP 服务器时开 |
| Use for other apps too | 把当前采样设置设为所有 API 客户端的默认值(客户端自己设了的不受影响)。 | 想统一行为时开 |
点 Apply 生效,Reset 恢复默认。
注意:Thinking 只在网页/兼容客户端与模型的“思考”机制配合时才有效;API 客户端通过
reasoning_effort参数控制(见下)。
Strata 同时提供三种 API。任何“OpenAI 兼容”客户端都把 base URL 填 http://<host>:8080/v1;Anthropic 客户端填 http://<host>:8080。模型名固定(本机):qwen3.8-flash-next-iq3_s(API 里填错了也没关系,/v1/models 会列出)。
当服务开了 API key 时,所有 /v1/* 请求都要带 key(网页会在 About 里记住,不影响网页本身)。
/v1/chat/completionsKEY="$(cat /root/Strata/data/api_key.txt)"
curl -s http://127.0.0.1:8080/v1/chat/completions \
-H "Authorization: Bearer $KEY" -H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next-iq3_s",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "用一句话介绍你自己"}
]
}'
常用可选参数(与官方 OpenAI 一致):
"stream": true → 流式返回;"reasoning_effort": "off" | "low" | "medium" | "high"(不传 = 按服务器默认);"max_tokens":限制回答长度;"temperature"、"top_p"、"seed" 等采样参数。接入示例:
http://127.0.0.1:8080/v1,API key 填 data/api_key.txt 里的值,模型名写 qwen3.8-flash-next-iq3_s;from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8080/v1", api_key="<写在data/api_key.txt里的key>")
r = client.chat.completions.create(
model="qwen3.8-flash-next-iq3_s",
messages=[{"role": "user", "content": "写一首关于秋天的诗"}],
reasoning_effort="medium",
)
print(r.choices[0].message.content)
/v1/messagesKEY="$(cat /root/Strata/data/api_key.txt)"
curl -s http://127.0.0.1:8080/v1/messages \
-H "x-api-key: $KEY" -H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next-iq3_s",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Hello!"}]
}'
"thinking": {"type": "enabled", "budget_tokens": N} 控制(Strata 自动把 budget 映射成 low/medium/high 档);POST /v1/messages/count_tokens。Claude Code 接入:
export ANTHROPIC_BASE_URL="http://127.0.0.1:8080"
export ANTHROPIC_AUTH_TOKEN="$(cat /root/Strata/data/api_key.txt)"
/v1/responsesCodex CLI 等使用 Responses API 的客户端,base URL 填 http://127.0.0.1:8080/v1 即可。注意:服务端是无状态的,/v1/responses/<id>(retrieve / delete / cancel)会返回 404——客户端必须每次发送完整对话,这是设计如此。
| 端点 | 作用 |
|---|---|
GET /health | 就绪/模型/是否开 key(无需鉴权) |
GET /v1/models | 模型列表 |
POST /v1/unload | 立刻把模型卸下,把显存/内存还给系统(回答间隙用) |
POST /v1/load | 提前把模型加载好 |
GET /status、/metrics | 运行状态 / 最近请求统计 |
如果安装时对“Images?”选了 Yes(本机默认模型支持视觉),就可以:
curl -s http://127.0.0.1:8080/v1/chat/completions \
-H "Authorization: Bearer $(cat /root/Strata/data/api_key.txt)" -H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next-iq3_s",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "这张图里有什么?"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,<base64内容>"}}
]
}]
}'
读图会慢一些(视觉编码器要单独跑)。图片开关在 About 页能看到(Images: on/off)。
./start_app.sh 会顺带启动 Open WebUI(监听 0.0.0.0:7860),它是一个现代聊天前端:支持账号体系、多会话管理、Markdown/代码块、语音、以及上传文件后对文件内容提问(RAG)。
http://<本机IP>:7860/);/root/open-webui/data);Open WebUI 启动时已通过环境变量自动接好 Strata(内置 OpenAI 提供商,URL http://127.0.0.1:8080/v1 + 同一个 API key)。正常情况下:
qwen3.8-flash-next-iq3_s;若列表为空,手动配置:
http://127.0.0.1:8080/v1,API Key 填 data/api_key.txt 里的值;注意:必须先启动 Strata(8080)再开 Open WebUI,否则直觉上它“连不上”。
start_app.sh已保证顺序;如果中途 Strata 重启过,去 7860 页面点一下刷新重连即可。
上传文件(把文件拖进输入框或点加号)后有两种用法:
首次上传文件时若提示 embedding 下载出错,一般是网络问题:保持默认设置,过一会儿重试一次即可下载完成(数据只存在本机
/root/.cache/huggingface)。
| 启动名 | 说明 | 内存占用 | 特点 |
|---|---|---|---|
Q2_0 | 全能档,压缩最狠 | 约 38 GB | 最快,质量“不错” |
IQ2_XS | 全能档 | 约 39 GB | 快,质量更好(官方推荐中庸之选) |
IQ3_XXS | 全能档 | 约 47 GB | 更慢,质量“很好” |
IQ3_S(默认) | 全能档最大 | 约 55 GB | 最慢,质量最好(官方测试对标完整模型) |
Coder | 编程特化(IQ1_M) | 约 30 GB | 写代码快而好,但中文/通用能力弱 |
都是同一个模型的不同压缩档:越小越快,越大越聪明。64GB 内存可以全装下(IQ3_S 需要别同时开太多程序)。
cd /root/Strata
./start_app.sh # 启动默认模型 IQ3_S + Open WebUI(自动释放端口、清显存、配 key)
./start_app.sh IQ2_XS # 换另一个模型(自动重启 Strata;Open WebUI 自动跟随)
RUN_OWUI=0 ./start_app.sh # 只启动 Strata,不起/不杀 Open WebUI
OWUI_PORT=9090 ./start_app.sh # 把 Open WebUI 放到别的端口
HOST=127.0.0.1 ./start_app.sh # 仅本机访问(不强制 API key)
PORTS="8080 8090" ./start_app.sh # 多个 Strata 端口时
STRATA_API_KEY=mykey ./start_app.sh # 用自定义 key(不写进文件)
./run-iq3_s.sh # 只启动 Strata(不做端口/显存清理,适合已配好时)
日常最常用的就是:
./start_app.sh # 起服务(之后浏览器开着就能用)
./start_app.sh <标签> # 换模型
Ctrl+C;./start_app.sh 会自动先停掉旧的再启动,无需手动;pkill -f 'serve/server.py' 停 Strata;pkill -f 'open-webui serve' 停 Open WebUI。| 服务 | 日志 |
|---|---|
| Strata 引擎 | /root/Strata/strata-iq3_s.log(当前模型的 .log) |
| Strata 服务输出 | 启动它的终端 / 重定向文件 |
| Open WebUI | /root/Strata/logs/openwebui.log |
/root/Strata/models/(GGUF 文件与查找表)——只在本地,绝不上传;/root/open-webui/data,embedding 模型在 /root/.cache/huggingface——全部本机;/root/Strata/data/api_key.txt(权限 600),或环境变量 STRATA_API_KEY;Q1. 启动时电脑卡死/很慢,是不是坏了? 正常。启动要把约 55 GB 专家读进内存并给显卡锁 VRAM,1–3 分钟(本机实测约 3.5 分钟)。等打印“listening… on 0.0.0.0:8080”就位。超过 10 分钟还卡,可能是可用内存不足:关掉大程序,或换小模型(IQ2_XS / Q2_0)。
Q2. 提示 8080 端口被占用?
说明 Strata 或别的程序已在跑。用 ./start_app.sh 会自动释放旧 Strata 的端口;若不是 Strata 占的,先找到并关闭那个程序。
Q3. 我访问 http://127.0.0.1:8080/health 返回 api_key: true,但调用 /v1 得到 401?
服务开了 API key。网页:到 About → API key 填入 data/api_key.txt 里的值;代码/命令行:加请求头 Authorization: Bearer <key>(或 x-api-key: <key>)。
Q4. 局域网/别的设备打不开网页?
--host 0.0.0.0(./start_app.sh 默认就是);hostname -I 第一个),记错地址也打不开;firewall-cmd --add-port=8080/tcp 或 ufw 同理);Q5. 回答很慢,硬盘灯一直闪?
可用内存不足,模型一部分专家要从 SSD 现读。关掉浏览器等大程序,或换 IQ2_XS / Q2_0 等更小的档。
Q6. 网页里没有 Picture 按钮 / 提示 Pictures off? 该模型在安装时没有启用视觉。About 页可看 Images: on/off;本机默认模型(IQ3_S 等)为 on。图片大于 20 MB 也会提示。
Q7. 回答写到一半就停了? 网页里 Max tokens 留空即可(不限制);设了 Max tokens 就到数量截断。
Q8. 我想让模型“不思考”/“多思考”?
网页 Chat 的 Sampling 抽屉里 Thinking:Off=不思考(最快)、High=深入思考。API 用 reasoning_effort: "off" / "low" / "medium" / "high"。
Q9. Open WebUI 里选不到模型 / 提示连接失败?
curl http://127.0.0.1:8080/health 返回 "status":"ok";http://127.0.0.1:8080/v1 + key;Q10. 上传文件回答不了内容 / embedding 一直在转? 首用 RAG 需要下载 embedding 模型(约 90MB,一次性)。保持默认“自动更新”设置,网络好时重试即可;文件内容只在本机。
Q11. 怎么换模型?
cd /root/Strata && ./start_app.sh IQ2_XS(或 Q2_0 / IQ3_XXS / IQ3_S / coder)。脚本会自动停旧的、换新的并重启 Open WebUI。
Q12. 我想把显存让给游戏/别的程序?
Strata 空闲时在 About → Unload(或 POST /v1/unload)把模型卸下;要用时 Load(或发第一个请求会自动加载)。
Q13. /v1/responses 的 retrieve/cancel 返回 404? 正常:Strata 无状态,不保存 responses 记录,客户端每次发完整对话。(OpenAI 惯例如此做也兼容客户端。)
Q14. Coder 模型中文回答怪怪的? Coder 去掉了非代码专家,中文/通用能力弱。中文日常用 Q2_0 / IQ2_XS / IQ3_S。
Q15. 换过 setup / 运行过 run-*.sh 后,怎么确保是“对外+带 key”的配置?
run-*.sh 是 setup 生成的,重跑 setup 会还原成仅本机。统一用 ./start_app.sh(自动 0.0.0.0 + key)即可。
Q16. 忘记 API key 在哪?
/root/Strata/data/api_key.txt。要是想换一个,直接改这个文件(或设 STRATA_API_KEY),重启服务生效。
Q17. 这台机器能同时处理几个请求?
默认一次只答一个,其他排队等。需要并行在运行配置里设 "parallel": 2(上限视脚本而定),多个请求可同时解码,但单请求速度会下降。
Q18. 我需要把 8080 暴露到公网使用,安全吗?
./start_app.sh 默认就是 0.0.0.0 + 自动 API key(写进 data/api_key.txt),这是相对安全的做法。仍然建议:不要把未加 key 的服务直接暴露公网;真要对公网开放,优先用反向代理 + key,或 SSH 隧道,并确认防火墙只放行需要的端口。
| 项 | 值 |
|---|---|
| Strata 网页 / API | http://127.0.0.1:8080/(局域网 http://<本机IP>:8080/) |
| OpenAI base URL | http://127.0.0.1:8080/v1 |
| Anthropic base URL | http://127.0.0.1:8080 |
| 模型名 | qwen3.8-flash-next-iq3_s(还有 IQ2_XS / IQ3_XXS / Q2_0 / coder 各档) |
| 上下文长度 | 131072 tokens(IQ3_S) |
| API key | /root/Strata/data/api_key.txt 或 $STRATA_API_KEY |
| Open WebUI | http://127.0.0.1:7860/(首次访问注册管理员) |
| 启动命令 | cd /root/Strata && ./start_app.sh |
| 换模型 | ./start_app.sh IQ2_XS / Q2_0 / IQ3_XXS / coder |
| 就绪检查 | curl -s http://127.0.0.1:8080/health |
| Strata 日志 | /root/Strata/strata-iq3_s.log |
| Open WebUI 日志 | /root/Strata/logs/openwebui.log |
| 模型文件 | /root/Strata/models/ |
| Open WebUI 数据 | /root/open-webui/data |
| 网页记录 | 浏览器 localStorage(服务端无状态) |
祝使用愉快。如遇问题优先看本文档 FAQ;更细节的引擎原理见项目内 docs/DETAILS.md、docs/MODELS.md。
