优云智算
控制台
立即注册

324国家语言21种地方方言

FireRed TTS3声音克隆声音设计24国家语言21种中国地方方言来自小红书团队

镜像大小
80 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-08-31

运行环境

框架版本
PyTorch-2.13.0
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系
+10

FireRed TTS3声音克隆声音设计24国家语言21种中国地方方言webUI来自小红书团队开源模型

交流加群

bug反馈可以加入科哥专属群交流➕ 广告勿进!

描述图片内容
  • 已经设置开机运行 首次开机 1-2分钟

webui运行界面截图:

image.png

image.png

image.png


  • 【插入一个小广告 给需要做ai视频漫画短剧ai香蕉🍌出图朋友多一个选择】:

  • ✅搞到一个国际版的在线sd2.0模型1.x左右元十五秒,也支持API调用

  • ✅使用地址:https://wy6688.token6688.com‬

  • ✅GPT模型编程模型推荐:

  • ✅如果你需要原汁原味的GPT模型和编程需求

  • ✅请大胆尝试:https://ai.aiaiai001.com

  • ✅plus 0.1x倍率 pro 0.2x倍率节省90%+费用

  • ✅pro 100+单个用户最高并发 满血使用

  • 技术微信:312088415

企业高并发AIGC接口无限画布平台: https://api.api4me.xyz

  • ✅ gpt-image2/香蕉低至几分钱一张
  • ✅超性价比sd2过真人脸在线生成
  • ✅MiniMax H3低至1块多
  • ✅veo3-fast视频四毛八秒

FireRedTTS3 WebUI 用户使用手册

本手册面向普通使用者:从启动到出音频,一步步说明怎么用,包含各功能详解、常用参数与常见问题。 不含安装/搭建步骤(环境搭建另有交接文档 HANDOFF.md 与开发文档 AGENTS.md)。


1. 这是什么

FireRedTTS3 WebUI 是一套 Web 端语音工具,基于 FireRedTTS3 模型,打开浏览器即可使用,无需写代码。它有两种模型能力:

  • FireRedTTS3(Base):零样本语音克隆——给一段"参考音频",就能用它的声音念出任意文本。
  • FireRedTTS3-Instruct(Instruct):一个模型打通四件事——
    • 语音克隆(与 Base 同一效果的另一条通路)
    • 音色设计:不用任何参考音频,用一句话描述你想要的嗓音
    • 语义编辑:把一段音频里的词改掉 / 插入 / 删除
    • 声学编辑:调整一段音频的语速、音高、音量

支持中、英、日、韩、西、法、俄、阿、土、印尼、葡、意、荷、越、德、乌、泰、波、罗、希腊、捷克、芬兰、印地语等 24 种语言,以及上海话、粤语、四川话、山东话等 21 种中国方言(详见 §3.2 语种)。


2. 启动 WebUI

前置:模型文件已在 models/ 目录下(含 ASR 转写模型 models/asr/),机器有 NVIDIA GPU 且已按项目要求装好依赖。

在项目根目录执行(一键启动,会自动清理端口占用与显存残留进程):

bash start_app.sh

看到输出 启动 FireRedTTS3 WebUI(端口 7860) 后,在浏览器打开:

http://localhost:7860

局域网内其他设备访问:把 localhost 换成这台电脑的局域网 IP(如 http://10.248.68.101:7860)。

启动是秒开的——模型采用懒加载,打开页面时基本不占显存,真正加载发生在你第一次点击合成/识别时(见 FAQ)。


3. 界面总览

页面顶部是蓝色渐变横幅(FireRedTTS3 WebUI,含版权声明)。下方有 5 个标签页

标签页用途需要参考音频?
语音克隆(Base)用参考音频的音色念新文本
语音克隆(Instruct)同上(另一条实现通路)
音色设计用语言描述凭空设计一种嗓音
语义编辑改词 / 插入 / 删除(内容级)
声学编辑调语速 / 音高 / 音量(声学级)

每个标签页都有"高级参数"折叠区,参数说明见 §4。


4. 功能详解与逐步操作

4.1 语音克隆(Base / Instruct 两个 Tab 用法相同)

目标:用参考音频里那个人的声音,朗读你给的文本。

步骤:

  1. 上传参考音频:点「参考音频(上传)」的录音图标旁的“上传文件”,选择一段目标音色的音频(建议 3~15 秒、人声清晰、带点语气更佳)。
  2. 自动识别文本:上传后页面会自动用语音识别(Whisper)把音频内容转写出来,填入「参考音频文本转写」框——会慢一点点(首次还会加载识别模型),转写错了直接手动改就行。
  3. 填待合成文本:在「待合成文本」里输入想让 TA 说的话,支持多句/长文(会自动拆句逐句生成并拼接)。
  4. 选语种:默认「自动(推荐)」。若合成结果出现方言/口音调错、多语混排不准,可手动指定(§3.2)。
  5. 点「开始合成」:等待生成;右侧会出现播放器,下方「状态」显示保存路径。

Base 与 Instruct 的区别:两者核心效果一致,Instruct 是同一套指令模型的分支。日常克隆随便用哪个都行;如果在意风格细节的稳定性,可两个都试,选满意的。切换这两个 Tab 共用一套参数与保存目录。

手册示例:参考音频说“人工智能正在改变我们生活的方方面面”,你就能让它用同样声音说“今天天气很好,我们一起去公园散步吧”。

4.2 音色设计

目标:不需要任何参考音频,光凭一句中文描述凭空生成一种新嗓音。

步骤:

  1. 在「音色描述」里写清楚你想要的嗓音,写具体点效果更好。默认示例:

    一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮。

  2. 在「待合成文本」填要念的内容,点「开始合成」。
  3. 完成后除音频外,页面会多显示一个**「语音规划(CoT)」**:这是模型先写出的声音属性规划(性别/年龄/语速/音色等),可以帮你判断这一版“设计成了什么”。

描述技巧:把"性别、年龄、情绪、语速、音色质感"都点出来,例如:

一位 40 岁左右的沉稳男声,低沉有磁性,语速偏慢,适合播新闻。

4.3 语义编辑

目标:把一段音频的内容改掉——换词、插入、删除、改句子。

步骤:

  1. 上传要编辑的音频。
  2. 在「编辑指令」用英文指令描述改动(模型按训练模板工作,英文指令最稳),例如:
    • Replace '人工智能' with '大数据'. (把"人工智能"换成"大数据")
    • Delete the phrase '为人们带来更多便利'. (删除某一段)
    • Insert '稍微' after the character at index 5. (在第 5 个字后面插入)
  3. 点「开始编辑」。完成后「重写文本」会显示模型认为编辑后完整内容(便于校验改对没有)。

指令里的原文/目标词尽量和音频实际内容一致;换的词建议保持字数相近,效果更自然。

4.4 声学编辑

目标:不改内容,只改"怎么读"——语速、音高、音量。同样上传音频 + 填英文指令。

属性指令模板取值范围
语速adjust the speed to XX ∈ [0.5, 2.0],步长 0.1(1.5 就是放慢到原来的 1.5 倍时长)
音高shift the pitch by N step(s)N ∈ {-6,…,−1, 1,…,+6}(整数音阶)
音量adjust the volume to XX ∈ [0.3, 2.0]

示例:adjust the speed to 0.5x(放慢到一半)——这也是默认填入的示例,直接点「开始编辑」即可体验。


3.2(附)语种选择

「语种」下拉共 46 项:

  • 自动(推荐):默认项,自动判定文本语种并调用对应音素/前端,绝大多数情况用它即可
  • 24 种语言:Chinese、English、Cantonese、Japanese、Korean、Spanish、French、Russian、Arabic、Turkish、Indonesian、Portuguese、Italian、Dutch、Vietnamese、German、Ukrainian、Thai、Polish、Romanian、Greek、Czech、Finnish、Hindi
  • 21 种中国方言:ZH_Anhui、ZH_Fujian、ZH_Gansu、ZH_Guizhou、ZH_Hebei、ZH_Henan、ZH_Hubei、ZH_Hunan、ZH_Jiangxi、ZH_Liaoning、ZH_Minnan、ZH_Ningxia、ZH_Shaanxi、ZH_Shandong、ZH_Shanghai、ZH_Shanxi、ZH_Sichuan、ZH_Tianjin、ZH_Wenzhou、ZH_Wu、ZH_Yunnan

需要带方言口音的克隆/合成时,手动选对应 ZH_* 项更容易出效果。


5. 高级参数(每个 Tab 的高级参数折叠区)

参数默认值(克隆 Tab / 设计·编辑 Tab)含义与调法
随机种子 seed1234 / 2(音色设计)固定种子 = 同输入可复现同结果。想"换个随机风格"就把数字改一下再生成
DiT 采样步数 n_timesteps10数值越大音质越精细但越慢。一般 1020;追求速度 58,追求极致质量 20~30
推理 CFG inference_cfg2.0(克隆)/ 1.2(设计·编辑)越大越"用力跟随"参考音频或指令。克隆想更像参考声音可上探到 3,太大(>4)会发干失真;编辑类保持 1.2 附近最自然

所有 Tab 滚动到"高级参数"才看得到。「开始合成/开始编辑」按钮就在高级参数下方。


6. 结果与文件

  • 每次生成,页面音频播放器会显示结果,可播放、可点右上角下载。
  • 同时文件会保存到项目目录 outputs/ 下,文件名 outputs_年月日时分秒.wav;同一秒内多次生成会自动追加 _1_2 后缀以区分。状态框会显示完整的保存路径。
  • Base 克隆与 Instruct 克隆共用同一路径,两类模型切换生成时不会互相覆盖旧文件。

7. 常见问题 FAQ

Q1:打开网页后没反应 / 第一次点“开始合成”等了很久? 正常。模型是懒加载:启动时不占显存,第一次推理才把模型装进显存(克隆/编辑约 15GB、识别约 4GB),首次加载需要几十秒到 1 分钟+;之后同一类的操作就不用再重新加载。耐心等首次,别反复点按钮。

Q2:为什么我点了两个任务,结果没同时跑? 显存互斥设计:ASR 识别、Base 克隆、Instruct 三个模型轮流进入显存(加载新的会自动卸载旧的),以保证 GPU 24GB 不爆。所以任务严格串行,一次只出一个结果。

Q3:参考音频的转写文本能自动识别吗?填错会怎样? 能。「参考音频文本转写」在你上传音频后自动填充(Whisper 识别)。识别结果要核对——文本内容必须与音频实际内容一致,这是克隆效果的核心;粉错会明显劣化声音相似度甚至出怪声。内容确定但个别字转写有出入,手动改正即可。

Q4:支持哪些音频格式? wav、mp3、flac、ogg、m4a 等常见格式都支持(解码基于 ffmpeg)。单声道/双声道均可,参考音频建议采样率 16k~48k 的清晰人声。

Q5:参考音频多长合适? 3~15 秒为宜:太短(<2 秒)信息不足更像不准,太长(>30 秒)耗时翻倍且可能引入杂音。尽量选目标人物纯净、无环境噪声的片段。

Q6:待合成文本很长会怎样? 会自动按句拆分逐句生成再拼接,长文也能出。耗时随文本长度线性增长,句间会做交叉淡入淡出过渡。单句超过约 300 字建议手动分段分次生成。

Q7:语种要手动选吗? 一般不用,自动判定很可靠。多语混排、带方言、或 auto 判错时才手动指定对应项(§3.2)。

Q8:想换个效果重新生成,怎么操作? 两种方式:① 改「随机种子」,得到同一文本的不同随机风格;② 改参考音频或文本本身。想让结果可复现(比如做对比实验),固定种子不换。

Q9:生成能跨标签页吗?克隆的声音能拿去做编辑吗? 可以。克隆 Tab 生成的结果音频文件在 outputs/,编辑 Tab 可以直接上传那个 wav 继续加工。

Q10:报错“请上传参考音频” / “未能识别出音频文本内容”? 上传操作没生效或转写结果为空:确认已选中音频文件(上传框里有文件名/波形),音频里确实有人声、时长≥1 秒。编辑类 Tab 同理需要先上传「输入音频」。

Q11:怎么让别人也能访问(外网)? 页面已绑定全部网卡(0.0.0.0),局域网内 http://本机IP:7860 即可访问。互联网访问需要在云平台做端口映射/安全组放行,或借助 SSH 反向隧道等(属部署范畴,本项目仓库不含该配置)。

Q12:版权如何要求? 页面顶部版权声明(科哥 webUI 二次开发)请勿删除;项目承诺开源但需保留版权信息,二次分发也请保留页面署名。

Q13:声学/语义编辑指令不会写怎么办? 直接照 §4.3 / §4.4 模板抄改。语义编辑最常用是 Replace '原词' with '新词'.;声学编辑最常用是 adjust the speed to X。指令用英文最稳。

Q14:哪里能看到更底层的东西(纯代码调用)? 公共 API 与参数全在 fireredtts3/core.py,推理冒烟演示在 tests/test_inference.pypython tests/test_inference.py all),WebUI 逻辑在 webui.py。WebUI 已暴露 5 个后端接口(on_base_clone、on_instruct_tts、on_voice_design、on_semantic_edit、on_acoustic_edit)与 1 个转写接口(/transcribe),可供二次开发调用。

0 个镜像 · 被使用 0
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.0最新
2026-08-31
FireRed TTS3声音克隆声音设计24国家语言21种中国地方方言来自小红书团队
评分
0.0
暂无评分
我的评分
未评分
324国家语言21种地方方言一键部署 | 优云智算