优云智算
控制台
立即注册

小红书 FireRedTTS3 语音克隆

小红书开源的 FireRedTTS3 零样本声音克隆,一句话「声音设计」,不需要任何参考音频,指令式语音编辑,改稿不用重录,在 Seed-TTS-eval 的克隆准确率和说话人相似度都拿了最好成绩。

镜像大小
80 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-08-28

运行环境

框架版本
PyTorch-2.13.0
CUDA版本
13.2
应用
JupyterLab: 8888
支持卡型
V100SRTX50系
+3

镜像简介

  • 小红书 FireRed 团队开源的一体化语音生成 + 编辑模型。零样本声音克隆,覆盖 24 种语言 + 21 种中文方言。 只要 5–20 秒参考音频就能复刻音色,读任意文本。方言尤其亮眼——四川话、上海话、闽南话、粤语、东北话等都能克隆,做本地化/接地气内容有天然优势。
  • 一句话「声音设计」,不需要任何参考音频。 你只用文字描述(性别、年龄、音色、情绪、语速、口音),模型先写一份"音色方案"再合成。适合造虚拟人设专属音色,彻底告别真人录音。
  • 指令式语音编辑,改稿不用重录。 语义编辑能在保持原音色的前提下对录音增/删/改个别词;声学编辑能改语速/音调/音量。口播说错几个字,直接替换那几个字就行。

配置方法

  1. 该镜像初始化后,需要等待服务启动,大概 3 分钟左右。
  2. 启动后点击按钮 “YZY启动器” 或者 “9000” 直接访问服务。
  3. 首次生成加载模型比较耗时。
  4. 服务运行日志查询,可以输入命令 tail -f /start.d/log/*
  5. 输出目录: /root/FireRedTTS3/outputs,也可以可直接在生成页面下载。

视频教程

详细步骤,可在 哔哩哔哩 余子越Talk 博主页面搜索 FireRedTTS3 观看视频教程!

相关链接

效果截图

云.jpg

常见问题

0 个镜像 · 被使用 0
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.0最新
2026-08-28
小红书开源的 FireRedTTS3 零样本声音克隆,一句话「声音设计」,不需要任何参考音频,指令式语音编辑,改稿不用重录,在 Seed-TTS-eval 的克隆准确率和说话人相似度都拿了最好成绩。
评分
0.0
暂无评分
我的评分
未评分
小红书 FireRedTTS3 语音克隆一键部署 | 优云智算