可控且富有情感表达的零样本TTS
GLM-TTS 是一个基于大型语言模型的文本到语音(TTS)合成系统,支持零样本语音克隆和流式推理。该系统采用两阶段架构:首先使用 LLM 生成语音标记序列,然后使用 Flow 模型将标记转换为高质量音频波形。通过引入多奖励强化学习框架,GLM-TTS 能够生成更具表现力和情感色彩的语音,显著提升传统 TTS 系统的表现力。