IndexTTS2.5最强AI音频工作台 支持音色克隆| 语气克隆|多角色对话|方言|多语言|批量生成
启动实例后,打开平台提供的 9000 端口访问地址。页面显示启动提示时,请等待环境检查完成,随后进入工作台。
首次生成需要加载模型,耗时较长,后续使用相同模型生成会更快。

上传的参考音频可以保存为常用音色,方便下次直接选择。
在「情感控制方式」中选择:
勾选 批量生成,使用空行分隔文本,每段会生成一个独立音频:
欢迎来到知元AI音频工作台。
这是第二段需要生成的配音内容。
感谢收听,我们下期再见。
点击生成后,任务依次执行。可在顶部 任务中心 查看进度,请勿重复点击提交。
进入 多角色配音,按以下格式填写文本:
[小知]: 欢迎来到我们的音频工作台。
[小元]: 我们可以使用不同的声音进行对话。
在角色设置中填写相同的角色名,为每个角色选择参考音色,然后生成对话音频。
进入 字幕配音,上传 .srt 字幕文件,选择音色并生成。程序会逐条生成语音,对齐字幕时间轴。
进入 音色训练,按照页面顺序完成:
输入中文名称 → 上传素材 → 音频切分 → 识别转录 → 检查文本 → 提取特征 → 开始训练。
训练完成后,返回克隆配音页面,刷新说话人模型列表,选择对应名称使用。
进入 生成结果,搜索或选择作品,查看配音文本、试听并下载音频。启用中文字幕生成后,可在输出目录中找到对应字幕文件。
顶部 系统状态 可查看 CPU、内存、GPU 和显存占用情况。