Minimax-H3在线comfy整合多工作流使用和indextts2.5数字人
B站开源的语音克隆模型 IndexTTS2.5,支持情感克隆,本次镜像已与 ComfyUI 打通,可直接用于制作数字人对口型视频。
📦 镜像已更新:新增 Viggle 角色替换、VDN 加速、去模糊加速、二采放大、light2v LoRA 数字人等最新工作流,全部整合进同一个云端镜像,详见文末「新增工作流」章节。
# 1. 部署 3090 实例
# 2. 打开 Jupyter Lab
# 3. 复制粘贴 Config 启动指令并运行
# 4. 复制粘贴 IndexTTS Web UI 启动指令并运行
# 5. 分别打开 Web UI 和 ComfyUI
情感控制三种模式:
| 模式 | 说明 | 推荐度 |
|---|---|---|
| 参考音频(默认) | 用同一段参考音频同时作为音色和情感参考 | ⭐ 推荐 |
| 独立情感音频 | 单独上传一段音频专门作为情感参考 | 可选 |
| 情感矢量 | 手动调整开心/生气/惊讶/冷静等参数数值 | 可选,较繁琐 |
文本情感控制: 界面还提供了实验性的文本控制情感功能,效果一般,不推荐使用。
语速调整(Duration):
语言选择: 二次元相关内容常用日语;数字人内容常用中文。
output 文件夹打开 Config UI 后可使用以下工作流:
| 工作流 | 用途 |
|---|---|
| 长时长视频 | 使用 Context Motion 节点,可生成 1 分钟以上长视频 |
| 数字人对口型 | 基于 vrgame 节点,上传参考图 + 克隆音频,自动生成对口型视频 |
数字人工作流操作:
⚠️ 如遇到节点报错提示 Catch 相关节点:直接删除即可,现在已用 LoRA 替代,无需该节点
也可用同样流程做图生视频 / 文生视频,上传克隆音频后可自由组合,制作各类视频内容。
打开 Config 后,点击 workflow 侧栏即可看到全部新增工作流。
专门用于视频角色替换(基于全量微调,效果不错),官方文档详细讲解了长视频替换的接法。
使用方式:
⚠️ 重要限制:Viggle 不支持真人转二次元替换 —— 作者实测:真人视频用二次元角色替换会直接输出原视频,不生效。
真人 → 二次元角色替换怎么办? 改用「多参考生图 + 二采放大」工作流:
也可以直接用第一个演示工作流(三人替换案例),按 Ctrl+B 关掉多余部分即可做单图视频替换。该视频同时可作为深度图等其他用途的参考。
长视频替换: 在普通工作流末尾接入 Window Condition + Chunk Simple 节点即可实现连续生成,具体接法参考 Viggle 官方文档。
一种新的混合注意力加速方式,目标是在提速的同时尽量保持原模型画质。
⚠️ 官方测试基于 B200 显卡;显存/内存紧张的机器(如 3090)用这个加速达不到官方演示效果,不建议使用 作者实测后感觉效果一般,跟此前的加速方案(Sage/SOL/H3 Cache)相比区别不大
以上工作流均已加入云端镜像,本地带不起的可以直接用云端体验。