Skip to Content
MiniMax H3 文档音频生成

音频生成

音频生成适合制作视频旁白、产品口播、通知播报或故事朗读。支持选择音色、调整语速和情绪,以及使用授权录音克隆音色。生成的音频可作为视频创作的参考素材。

开始前

登录优云智算控制台 并进入 MiniMax H3 模块,确认可用积分足够。需要克隆音色时,准备本人或已获授权的清晰人声录音。

输入文字并选择音色

  1. 在左侧选择 音频,在输入框填写要朗读的文字,最多 2000 个字符,包含标点和空白。
  2. 单击底部音色按钮,进入 音色库。试听并选择 官方 音色,或在 我的克隆 中选择已保存的音色。
  3. 按需选择中文、英文、日文、西班牙语或阿拉伯语,并在 0.5~2.0 倍范围内调整语速。

音频工作台:输入文字、音色、情绪、语速和发音设置

音色库中的官方音色与我的克隆

克隆自己的音色

在 音色库 → 我的克隆 中,单击 克隆我的音色,按页面提示上传参考录音、填写音色名称并保存。保存后,在 我的克隆 中选择该音色。

上传前请检查参考录音:支持 WAV、MP3、FLAC、OGG、M4A;单个文件不超过 15 MiB;时长为 0.5~15 秒;文件扩展名应与实际格式一致。建议只保留一位说话人的清晰人声,避免背景音乐和明显噪声。

在我的克隆中管理自定义音色

设置情绪与读音

单击情绪设置按钮,选择情绪模式:

模式用途
自动判断根据文本内容判断情绪
跟随原音参考所选音色的原始情绪
自定义描述用文字描述情绪,如“平静、舒缓”
精细控制分别调整各项情绪参数

情绪强度 调整情绪的表现程度,不用于调节音量。需要检查效果时,先生成一段短文本;此类生成任务同样消耗积分。

音频情绪模式与情绪强度设置

遇到多音字、品牌名或专有名词读错时,单击 发音设置,添加词语及期望读音。例如,将正文中的“4090”设置为“四零九零”。保存后,系统在生成时应用读音规则;同一个词只能设置一种读法。

为多音字和专有名词设置特殊读音

生成与下载

  1. 核对正文、音色、语言、情绪、语速和预计积分,单击 生成语音。
  2. 在 最近生成 试听结果。查询完整记录时,进入 任务 → 音频任务。
  3. 任务完成后,下载 WAV 文件。生成的音频也会保存在 资产 中。

音频须与图片或视频一起用于视频生成的全能参考,不能单独作为视频参考素材。操作方法参见任务与资产管理。

音频按正文中的计费字符数计算积分,汉字、字母和数字计费,标点和空白不计费。输入长度上限与计费字符数不同:标点和空白虽然不计费,仍占用 2000 字符的输入限额。提交任务前,页面会显示预计积分。详情参见积分与计费。

请及时下载需要保留的音频。通过程序创建和查询语音任务,参见IndexTTS 2.5 文生语音 API 。

Last updated on