优云智算
控制台
立即注册
Minimax-H3的Lora训练和Comfy整合包
Minimax-H3的Lora训练和Comfy整合包
star0
0/小时
v1.0
最新

H3 LoRA 训练 — Musubi Tuner(云端)

使用 Musubi Tuner(Akane 版本,非Kohya 版)在云端训练 H3 视频模型 LoRA,支持角色 LoRA 和风格 LoRA。

环境要求

  • GPU:推荐 50 系显卡 或 48G 显存
    • 素材以图片为主 → 4090 即可
    • 素材以视频为主(数量多、时长长)→ 推荐 50系 / 48G
  • 显存占用较高,务必云端使用

快速开始(云端)

# 1. 选择镜像,部署 GPU 实例(推荐 4090 / 50系 / 48G)
# 2. 打开 Jupyter Lab,复制启动指令粘贴运行
# 3. 打开确定 UI(Musubi Tuner UI)

镜像内已预装 H3 系列加速 LoRA 及主要工作流,训练完成的 LoRA 可直接放入 Comfy 里测试效果。

创建项目

  1. 点击 新项目 创建,可选择 High / Low 模式(Low 模式使用 4-bit 精度),本教程使用默认 Regular
  2. 也可以加载已有配置:在 Musubi Tuner → Project 中找到对应 JSON 文件,复制路径粘贴,路径开头需加 / 确保是绝对路径

数据集配置

视频训练集(进阶)

  • 支持多个 dataset 同时配置不同分辨率和帧数(如 768×512 / 22帧,512×320 / 56~90帧)
  • H3 模型最高支持 15 秒视频,训练时可用到 243~290+ 帧
  • 支持 Video / Image / Audio 三种数据源;视频自带音频时直接选 Video 即可

图片训练集(角色 LoRA,推荐新手)

  1. 添加 Dataset,选择 Video Director 路径(即数据集文件夹路径)
  2. 建议把图片放进 dataset 文件夹,方便复制路径
  3. 新建文件夹,上传角色图片,打标方式参考此前角色 LoRA 教程
  4. 复制路径粘贴到 Path 栏,开头加 / 转为绝对路径
  5. 类型选择 Image(json file 栏留空,除非打标文件在单独文件夹)
  6. 分辨率:768×512
  7. 帧数:图片训练填 1
  8. Repeat:图片较少建议 3,图片较多可设为 1

关键参数

训练类型

  • FL2A:单图训练(本教程使用)
  • REF:多参考图训练,显存占用比首尾帧文生图更高,需要更高配置显卡

模型路径 — INT8 量化

  • 24G 显存建议开启 INT8
  • 路径下选择**未剪枝(un-pruned)**版本,而非剪枝版本,泛化性更好
  • 也可以不改路径,选择 online(在线量化),约 1~2 分钟自动转换完成

LoRA Rank

  • 官方推荐从 16 开始(社区常用 16 或 32)
  • 32 可用但训练难度更高,泛化性更强

学习率

  • 默认 0.0001(1e-4)
  • 可根据需求调整(如 0.00005 = 5e-5),不确定具体换算可以直接问 AI

优化器

  • 使用 8bit(无需用 fp32 全精度,显存占用更低)

训练步数

  • 最大步数设置:10000(仅作为上限,不代表要跑满)
  • 风格 LoRA 一般 5000 步左右成型
  • 角色 LoRA 通常更快,1000 步左右即可看到效果
  • 最终以采样效果和 Loss 曲线判断,觉得满意直接停止即可

采样设置(⚠️ 重要)

  • Simple at First 务必开启:作者提醒,若不开启初次采样,可能训练 200+ 步后在第一次采样时突然爆显存,导致中间检查点未保存、被迫从头重跑,浪费时间
  • 角色 LoRA 采样间隔推荐 250 步(视频采样很慢,间隔不宜太密)
  • 采样提示词(Simple Prompts)在 Project 文件夹内可自行编辑,格式包含:提示词 / 宽度 / 高度 / 帧数 / 种子
  • 采样分辨率建议 864×480(480P),避免用 1K 分辨率导致爆显存(尤其 10 秒左右视频)

Block to Swap(显存交换)

  • 官方推荐:4090(24G)训练时设为 48
  • 若显存更大(如 48G),可调低,如设为 15
  • 需要根据自己机器实际测试:本教程测试 15 会爆显存,20 也会爆,35 勉强够,最终取中间值 42 较稳妥

梯度检查点(Gradient Checkpointing)

  • 建议开启

训练监控

启动训练后会先进行 latent / text encode 缓存(通常需要 5~10 分钟)。也可以先把所有数据集配置好,一键全部启动,效率更高。之后正式进入 training 阶段。

视频素材帧数要求

视频训练集帧数必须符合 17 + 5n 的格式(模型底层限制),例如 12 帧、39 帧等;视频帧率固定为 24fps

@梦影Erislia
镜像信息
已使用0
运行时长
0 H
镜像大小
50GB
最后更新时间
2026-08-14
支持卡型
RTX40系RTX50系48G RTX40系A800H20A100
+6
框架版本
PyTorch-12.9
CUDA版本
13
应用
JupyterLab: 8888
版本
v1.0
2026-08-14
PyTorch:12.9 | CUDA:13 | 大小:50.00GB
logo

隶属于优刻得科技股份有限公司

股票代码:688158

优刻得是中立、安全的云计算服务平台