微软开源VibeVoice ASR TTS集合webui语音到文本 文本到语音模型 二次卡发构建by科哥
本镜像基于微软开源的VibeVoice模型,集成了ASR语音识别与TTS语音合成功能,并配备了友好的WebUI界面。用户可通过该工具实现语音到文本的精准转换,以及高质量文本到语音的生成。适用于语音助手开发、多语种内容创作、无障碍服务及语音交互系统等场景,提供高效、便捷的一站式语音AI解决方案。



VibeVoice ASR & TTS 是一个集成了语音识别(ASR)和语音合成(TTS)功能的 WebUI 系统。
核心功能:
访问地址: http://localhost:7860
./start_app.sh
启动后,在浏览器中访问 http://localhost:7860
系统支持三种方式提供音频:
上传或录制完成后,音频会自动显示在 "媒体预览" 区域:
在 "Whisper 模型" 下拉框中选择识别模型:
| 模型 | 特点 | 推荐场景 |
|---|---|---|
| base | 轻量快速 | 快速测试、实时识别 |
| small | 平衡性能 | 日常使用(推荐) |
💡 提示: 下拉框只显示已下载的模型。如需使用其他模型,请先下载。
点击 "高级配置" 展开更多选项:
⚠️ 注意: 一般情况下使用默认设置即可,无需调整高级参数。
点击 "转录" 按钮开始识别。
识别过程中会显示进度,完成后结果会显示在输出区域。
系统提供四种输出方式:
✅ 提升识别准确率的建议:
在 "选择模型" 下拉框中选择 TTS 模型:
| 模型 | 特点 |
|---|---|
| 0.5B (Realtime) | 实时合成,速度快(推荐) |
在 "输入文本" 框中输入要合成的文字:
示例文本:
你好,这是一段测试文本。
Hello, this is a test.
"声音克隆(可选)" 功能目前处于开发中状态:
点击 "开始合成" 按钮。
合成过程:
合成完成后:
"状态" 区域会显示:
✅ 获得更好音质的建议:
解决方法:
解决方法:
可能原因:
解决方法:
可能原因:
解决方法:
建议方法:
ASR(语音识别):
TTS(语音合成):
浏览器标准快捷键:
Ctrl + C: 复制识别结果Ctrl + V: 粘贴文本到输入框Space: 播放/暂停音频如需处理多个文件:
💡 提示: 未来版本可能支持批量处理功能。
⚠️ 重要提示:
outputs/ 目录推荐配置:
如遇到问题:
README.md 了解技术细节todo.md 了解已知问题欢迎提供使用反馈和改进建议。
webUI 二次开发 by 科哥 | 微信:312088415 公众号:科哥玩AI
承诺永远开源使用,但需要保留版权信息!
文档版本: 1.0.0 最后更新: 2026-01-22