优云智算
控制台
立即注册

Minimax-H3在线comfy整合使用

Minimax-H3在线comfy整合多工作流使用和indextts2.5数字人

镜像大小
120 GB
当前版本
v4.0
累计部署
333
累计运行
692 h
最近更新
2026-09-09

运行环境

框架版本
PyTorch-2.9
CUDA版本
13
应用
JupyterLab: 8888
支持卡型
3090RTX50系
+10

IndexTTS2.5 语音克隆 + 数字人工作流(云端)

B站开源的语音克隆模型 IndexTTS2.5,支持情感克隆,本次镜像已与 ComfyUI 打通,可直接用于制作数字人对口型视频。

📦 镜像已更新:新增 Viggle 角色替换、VDN 加速、去模糊加速、二采放大、light2v LoRA 数字人等最新工作流,全部整合进同一个云端镜像,详见文末「新增工作流」章节。

新版特性

  • 新增支持:日语、西班牙语、阿拉伯语(此前 IndexTTS2 仅支持中文)
  • 情感克隆效果出色,语气和情感还原度高
  • 中文合成能力延续了 IndexTTS 系列一贯的高水准

环境要求

  • GPU:3090 即可完全带动(配合 LoRA 及其他优化后,无需更高配置)
  • 3080 Ti 12G 理论上也可尝试,但作者未实测,能否带动需自行验证
  • 平台:云端镜像已集成 Web UI + ComfyUI,所有近期工作流均已整合进同一镜像

快速开始(云端)

# 1. 部署 3090 实例
# 2. 打开 Jupyter Lab
# 3. 复制粘贴 Config 启动指令并运行
# 4. 复制粘贴 IndexTTS Web UI 启动指令并运行
# 5. 分别打开 Web UI 和 ComfyUI

使用流程

Step 1 — 语音克隆(Web UI)

  1. 打开官方 Web UI,可先点击示例试听效果
  2. 上传参考音频(作为音色 + 情感来源)
  3. 输入要合成的文本
  4. 点击生成,克隆语音

情感控制三种模式:

模式说明推荐度
参考音频(默认)用同一段参考音频同时作为音色和情感参考⭐ 推荐
独立情感音频单独上传一段音频专门作为情感参考可选
情感矢量手动调整开心/生气/惊讶/冷静等参数数值可选,较繁琐

文本情感控制: 界面还提供了实验性的文本控制情感功能,效果一般,不推荐使用

语速调整(Duration):

  • 数值 <1(如 0.5)→ 加速
  • 数值 >1(如 2)→ 减速
  • 示例:12 秒音频设为 0.5 倍速后变为 6 秒

语言选择: 二次元相关内容常用日语;数字人内容常用中文。

Step 2 — 获取合成结果

  1. 合成完成后,文件保存在 output 文件夹
  2. 下载到本地(推荐),或直接移动到 Config 目录供 ComfyUI 调用

Step 3 — ComfyUI 数字人 / 视频生成

打开 Config UI 后可使用以下工作流:

工作流用途
长时长视频使用 Context Motion 节点,可生成 1 分钟以上长视频
数字人对口型基于 vrgame 节点,上传参考图 + 克隆音频,自动生成对口型视频

数字人工作流操作:

  1. 提示词保持简单,如"图一的女人说话"
  2. 上传克隆好的音频
  3. 上传参考图片
  4. 设置时长
  5. 设置宽高比 / 分辨率(与原始 H3 参数一致,推荐 0.9 或 1

⚠️ 如遇到节点报错提示 Catch 相关节点:直接删除即可,现在已用 LoRA 替代,无需该节点

也可用同样流程做图生视频 / 文生视频,上传克隆音频后可自由组合,制作各类视频内容。

新增工作流(镜像已整合)

打开 Config 后,点击 workflow 侧栏即可看到全部新增工作流。

Viggle 角色替换

专门用于视频角色替换(基于全量微调,效果不错),官方文档详细讲解了长视频替换的接法。

使用方式:

  • 输入非常简单:只需 image + 视频,无提示词输入,默认自动放大
  • 所需节点在 Config 内可直接安装

⚠️ 重要限制:Viggle 不支持真人转二次元替换 —— 作者实测:真人视频用二次元角色替换会直接输出原视频,不生效。

真人 → 二次元角色替换怎么办? 改用「多参考生图 + 二采放大」工作流:

  1. REF video 节点拉出来
  2. 添加一个 Load Video 节点
  3. 上传视频即可

也可以直接用第一个演示工作流(三人替换案例),按 Ctrl+B 关掉多余部分即可做单图视频替换。该视频同时可作为深度图等其他用途的参考。

长视频替换: 在普通工作流末尾接入 Window Condition + Chunk Simple 节点即可实现连续生成,具体接法参考 Viggle 官方文档。

VDN 加速

一种新的混合注意力加速方式,目标是在提速的同时尽量保持原模型画质。

⚠️ 官方测试基于 B200 显卡;显存/内存紧张的机器(如 3090)用这个加速达不到官方演示效果,不建议使用 作者实测后感觉效果一般,跟此前的加速方案(Sage/SOL/H3 Cache)相比区别不大

其他新增节点

  • 去模糊加速(Deblur)
  • 二采放大(多采放大 / Latent 二次采样)
  • light2v LoRA 数字人 — 最新数字人 LoRA,效果进一步优化

以上工作流均已加入云端镜像,本地带不起的可以直接用云端体验。

说明

  • 云端镜像已一键打包好 Web UI + ComfyUI + 全部近期工作流,打开即可使用
  • 本地使用需自行安装部署,或查找社区整合包
0 个镜像 · 被使用 333
版本日志
v4.0最新
2026-09-09
v3.0
2026-08-19
v2.0
2026-08-12
评分
0.0
暂无评分
我的评分
未评分
Minimax-H3在线comfy整合使用一键部署 | 优云智算