FireRed TTS3声音克隆声音设计24国家语言21种中国地方方言来自小红书团队
bug反馈可以加入科哥专属群交流➕ 广告勿进!



【插入一个小广告 给需要做ai视频漫画短剧ai香蕉🍌出图朋友多一个选择】:
✅搞到一个国际版的在线sd2.0模型1.x左右元十五秒,也支持API调用
✅GPT模型编程模型推荐:
✅如果你需要原汁原味的GPT模型和编程需求
✅请大胆尝试:https://ai.aiaiai001.com
✅plus 0.1x倍率 pro 0.2x倍率节省90%+费用
✅pro 100+单个用户最高并发 满血使用
技术微信:312088415
企业高并发AIGC接口无限画布平台: https://api.api4me.xyz
本手册面向普通使用者:从启动到出音频,一步步说明怎么用,包含各功能详解、常用参数与常见问题。 不含安装/搭建步骤(环境搭建另有交接文档 HANDOFF.md 与开发文档 AGENTS.md)。
FireRedTTS3 WebUI 是一套 Web 端语音工具,基于 FireRedTTS3 模型,打开浏览器即可使用,无需写代码。它有两种模型能力:
支持中、英、日、韩、西、法、俄、阿、土、印尼、葡、意、荷、越、德、乌、泰、波、罗、希腊、捷克、芬兰、印地语等 24 种语言,以及上海话、粤语、四川话、山东话等 21 种中国方言(详见 §3.2 语种)。
前置:模型文件已在 models/ 目录下(含 ASR 转写模型 models/asr/),机器有 NVIDIA GPU 且已按项目要求装好依赖。
在项目根目录执行(一键启动,会自动清理端口占用与显存残留进程):
bash start_app.sh
看到输出 启动 FireRedTTS3 WebUI(端口 7860) 后,在浏览器打开:
http://localhost:7860
局域网内其他设备访问:把
localhost换成这台电脑的局域网 IP(如http://10.248.68.101:7860)。
启动是秒开的——模型采用懒加载,打开页面时基本不占显存,真正加载发生在你第一次点击合成/识别时(见 FAQ)。
页面顶部是蓝色渐变横幅(FireRedTTS3 WebUI,含版权声明)。下方有 5 个标签页:
| 标签页 | 用途 | 需要参考音频? |
|---|---|---|
| 语音克隆(Base) | 用参考音频的音色念新文本 | 是 |
| 语音克隆(Instruct) | 同上(另一条实现通路) | 是 |
| 音色设计 | 用语言描述凭空设计一种嗓音 | 否 |
| 语义编辑 | 改词 / 插入 / 删除(内容级) | 是 |
| 声学编辑 | 调语速 / 音高 / 音量(声学级) | 是 |
每个标签页都有"高级参数"折叠区,参数说明见 §4。
目标:用参考音频里那个人的声音,朗读你给的文本。
步骤:
Base 与 Instruct 的区别:两者核心效果一致,Instruct 是同一套指令模型的分支。日常克隆随便用哪个都行;如果在意风格细节的稳定性,可两个都试,选满意的。切换这两个 Tab 共用一套参数与保存目录。
手册示例:参考音频说“人工智能正在改变我们生活的方方面面”,你就能让它用同样声音说“今天天气很好,我们一起去公园散步吧”。
目标:不需要任何参考音频,光凭一句中文描述凭空生成一种新嗓音。
步骤:
一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮。
描述技巧:把"性别、年龄、情绪、语速、音色质感"都点出来,例如:
一位 40 岁左右的沉稳男声,低沉有磁性,语速偏慢,适合播新闻。
目标:把一段音频的内容改掉——换词、插入、删除、改句子。
步骤:
Replace '人工智能' with '大数据'. (把"人工智能"换成"大数据")Delete the phrase '为人们带来更多便利'. (删除某一段)Insert '稍微' after the character at index 5. (在第 5 个字后面插入)指令里的原文/目标词尽量和音频实际内容一致;换的词建议保持字数相近,效果更自然。
目标:不改内容,只改"怎么读"——语速、音高、音量。同样上传音频 + 填英文指令。
| 属性 | 指令模板 | 取值范围 |
|---|---|---|
| 语速 | adjust the speed to X | X ∈ [0.5, 2.0],步长 0.1(1.5 就是放慢到原来的 1.5 倍时长) |
| 音高 | shift the pitch by N step(s) | N ∈ {-6,…,−1, 1,…,+6}(整数音阶) |
| 音量 | adjust the volume to X | X ∈ [0.3, 2.0] |
示例:adjust the speed to 0.5x(放慢到一半)——这也是默认填入的示例,直接点「开始编辑」即可体验。
「语种」下拉共 46 项:
自动(推荐):默认项,自动判定文本语种并调用对应音素/前端,绝大多数情况用它即可需要带方言口音的克隆/合成时,手动选对应 ZH_* 项更容易出效果。
| 参数 | 默认值(克隆 Tab / 设计·编辑 Tab) | 含义与调法 |
|---|---|---|
| 随机种子 seed | 1234 / 2(音色设计) | 固定种子 = 同输入可复现同结果。想"换个随机风格"就把数字改一下再生成 |
| DiT 采样步数 n_timesteps | 10 | 数值越大音质越精细但越慢。一般 10 |
| 推理 CFG inference_cfg | 2.0(克隆)/ 1.2(设计·编辑) | 越大越"用力跟随"参考音频或指令。克隆想更像参考声音可上探到 3,太大(>4)会发干失真;编辑类保持 1.2 附近最自然 |
所有 Tab 滚动到"高级参数"才看得到。「开始合成/开始编辑」按钮就在高级参数下方。
outputs/ 下,文件名 outputs_年月日时分秒.wav;同一秒内多次生成会自动追加 _1、_2 后缀以区分。状态框会显示完整的保存路径。Q1:打开网页后没反应 / 第一次点“开始合成”等了很久? 正常。模型是懒加载:启动时不占显存,第一次推理才把模型装进显存(克隆/编辑约 15GB、识别约 4GB),首次加载需要几十秒到 1 分钟+;之后同一类的操作就不用再重新加载。耐心等首次,别反复点按钮。
Q2:为什么我点了两个任务,结果没同时跑? 显存互斥设计:ASR 识别、Base 克隆、Instruct 三个模型轮流进入显存(加载新的会自动卸载旧的),以保证 GPU 24GB 不爆。所以任务严格串行,一次只出一个结果。
Q3:参考音频的转写文本能自动识别吗?填错会怎样? 能。「参考音频文本转写」在你上传音频后自动填充(Whisper 识别)。识别结果要核对——文本内容必须与音频实际内容一致,这是克隆效果的核心;粉错会明显劣化声音相似度甚至出怪声。内容确定但个别字转写有出入,手动改正即可。
Q4:支持哪些音频格式? wav、mp3、flac、ogg、m4a 等常见格式都支持(解码基于 ffmpeg)。单声道/双声道均可,参考音频建议采样率 16k~48k 的清晰人声。
Q5:参考音频多长合适? 3~15 秒为宜:太短(<2 秒)信息不足更像不准,太长(>30 秒)耗时翻倍且可能引入杂音。尽量选目标人物纯净、无环境噪声的片段。
Q6:待合成文本很长会怎样? 会自动按句拆分逐句生成再拼接,长文也能出。耗时随文本长度线性增长,句间会做交叉淡入淡出过渡。单句超过约 300 字建议手动分段分次生成。
Q7:语种要手动选吗? 一般不用,自动判定很可靠。多语混排、带方言、或 auto 判错时才手动指定对应项(§3.2)。
Q8:想换个效果重新生成,怎么操作? 两种方式:① 改「随机种子」,得到同一文本的不同随机风格;② 改参考音频或文本本身。想让结果可复现(比如做对比实验),固定种子不换。
Q9:生成能跨标签页吗?克隆的声音能拿去做编辑吗?
可以。克隆 Tab 生成的结果音频文件在 outputs/,编辑 Tab 可以直接上传那个 wav 继续加工。
Q10:报错“请上传参考音频” / “未能识别出音频文本内容”? 上传操作没生效或转写结果为空:确认已选中音频文件(上传框里有文件名/波形),音频里确实有人声、时长≥1 秒。编辑类 Tab 同理需要先上传「输入音频」。
Q11:怎么让别人也能访问(外网)?
页面已绑定全部网卡(0.0.0.0),局域网内 http://本机IP:7860 即可访问。互联网访问需要在云平台做端口映射/安全组放行,或借助 SSH 反向隧道等(属部署范畴,本项目仓库不含该配置)。
Q12:版权如何要求? 页面顶部版权声明(科哥 webUI 二次开发)请勿删除;项目承诺开源但需保留版权信息,二次分发也请保留页面署名。
Q13:声学/语义编辑指令不会写怎么办?
直接照 §4.3 / §4.4 模板抄改。语义编辑最常用是 Replace '原词' with '新词'.;声学编辑最常用是 adjust the speed to X。指令用英文最稳。
Q14:哪里能看到更底层的东西(纯代码调用)?
公共 API 与参数全在 fireredtts3/core.py,推理冒烟演示在 tests/test_inference.py(python tests/test_inference.py all),WebUI 逻辑在 webui.py。WebUI 已暴露 5 个后端接口(on_base_clone、on_instruct_tts、on_voice_design、on_semantic_edit、on_acoustic_edit)与 1 个转写接口(/transcribe),可供二次开发调用。