优云智算
控制台
立即注册

小米AI语音OmniVoice,支持 600+ 种语言的先进文本转语音模型,支持声音设计,万字长文不在话下,生成速度超越所有的TTS模型!

单阶段扩散语言模型;双向 Transformer;非自回归。两项关键设计:全码本随机掩蔽策略提升训练效率;首次在非自回归 TTS 中有效利用大语言模型作为预训练参数

镜像大小
40 GB
当前版本
v1.0
累计部署
90
累计运行
292 h
最近更新
2026-07-25

运行环境

框架版本
PyTorch-2.0
CUDA版本
12.8
应用
JupyterLab: 8888
支持卡型
3080Ti3090
+4

镜像名称

小米AI语音OmniVoice,声音克隆,支持声音设计,TTS,声音克隆

镜像简介

  • 小米AI语音OmniVoice,支持 600+ 种语言的先进文本转语音模型,支持声音设计,万字长文不在话下,生成速度超越所有的TTS模型!
  • 速度和语种覆盖的双料怪物。0.8B 参数,采用单阶段扩散语言模型 + 双向 Transformer 的非自回归架构,直接从文字映射到声学 token,是目前最简单的非自回归 TTS 之一。首次实现 600 种以上语言的语音克隆支持,训练集覆盖 646 种语种、58.1 万小时。PyTorch 推理可达 40 倍实时,中文 WER 低至 0.84%。

配置方法

  1. 该镜像初始化后,需要等待服务启动,大概 3 分钟左右。
  2. 启动后点击按钮 “YZY启动器” 或者 “9000” 直接访问服务。
  3. 首次生成加载模型比较耗时。
  4. 服务运行日志查询,可以输入命令 tail -f /start.d/log/*
  5. 输出目录:/root/OmniVoice/outputs

视频教程

详细步骤,可在 哔哩哔哩 余子越Talk 博主页面搜索 小米 OmniVoice 观看视频教程!

相关链接

效果截图

小米TTS云端.jpg

常见问题

0 个镜像 · 被使用 90
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.0最新
2026-07-25
评分
0.0
暂无评分
我的评分
未评分
小米AI语音OmniVoice,支持 600+ 种语言的先进文本转语音模型,支持声音设计,万字长文不在话下,生成速度超越所有的TTS模型!一键部署 | 优云智算