智谱开源的AI文本转语音模型支持声音克隆GLM-TTS 语音合成系统 二次开发构建by科哥
本镜像基于智谱开源的GLM-TTS模型二次开发,提供高质量的文本转语音服务,并支持个性化的声音克隆功能。用户可通过少量样本快速复制特定音色,生成高度拟真的合成语音。适用于虚拟助手配音、有声内容创作、个性化语音生成等场景,为语音合成应用提供灵活、高效的本地化解决方案。
ps -ef |grep python
kill -9 pid
cd /root && bash run.sh
🎵 零样本语音克隆 · 情感表达 · 音素级控制
webUI二次开发by 科哥 微信:312088415
方式一:使用启动脚本(推荐)
cd /root/GLM-TTS
bash start_app.sh
方式二:直接运行
cd /root/GLM-TTS
python app.py
启动后,在浏览器中打开:http://localhost:7860
✅ 说明:
start_app.sh会自动使用 py312 虚拟环境,无需手动激活
点击「⚙️ 高级设置」展开:
| 参数 | 说明 | 推荐值 |
|---|---|---|
| 采样率 | 24kHz(快速)/ 32kHz(高质量) | 24000 |
| 随机种子 | 固定种子可复现结果 | 42 |
| 启用 KV Cache | 加速长文本生成 | ✅ 开启 |
| 采样方法 | ras(随机)/ greedy(贪心)/ topk | ras |
@outputs/ 目录@outputs/
└── tts_20251212_113000.wav # 自动命名(时间戳)
创建 JSONL 格式文件(每行一个 JSON 对象):
{"prompt_text": "这是第一段参考文本", "prompt_audio": "examples/prompt/audio1.wav", "input_text": "要合成的第一段文本", "output_name": "output_001"}
{"prompt_text": "这是第二段参考文本", "prompt_audio": "examples/prompt/audio2.wav", "input_text": "要合成的第二段文本", "output_name": "output_002"}
字段说明:
prompt_text:参考音频对应的文本(可选)prompt_audio:参考音频路径(必填)input_text:要合成的文本(必填)output_name:输出文件名(可选,默认 output_0001)@outputs/batch(可修改)@outputs/batch/
├── output_001.wav
├── output_002.wav
└── ...
用途:精确控制多音字和生僻字的发音
使用方法:
# 命令行模式
python glmtts_inference.py --data=example_zh --exp_name=_test --use_cache --phoneme
配置文件:configs/G2P_replace_dict.jsonl
特点:
Token Rate:25 tokens/sec(固定)
方法:通过参考音频的情感来控制生成音频的情感
✅ 推荐:
❌ 避免:
A: 自动保存在 @outputs/ 目录下
@outputs/tts_时间戳.wav@outputs/batch/文件名.wavA:
A:
A:
A: 点击「🧹 清理显存」按钮,系统会自动释放模型占用的显存
A:
A:
实际速度取决于 GPU 性能和文本复杂度
测试阶段
批量生产
质量检查
如有问题或建议,请联系:
科哥 微信:312088415
webUI二次开发by 科哥 微信:312088415
基于 GLM-TTS 开源项目:https://github.com/zai-org/GLM-TTS


最后更新:2025-12-19