H3 LoRA 训练 — Musubi Tuner(云端)
使用 Musubi Tuner(Akane 版本,非Kohya 版)在云端训练 H3 视频模型 LoRA,支持角色 LoRA 和风格 LoRA。
环境要求
- GPU:推荐 50 系显卡 或 48G 显存
- 素材以图片为主 → 4090 即可
- 素材以视频为主(数量多、时长长)→ 推荐 50系 / 48G
- 显存占用较高,务必云端使用
快速开始(云端)
镜像内已预装 H3 系列加速 LoRA 及主要工作流,训练完成的 LoRA 可直接放入 Comfy 里测试效果。
创建项目
- 点击 新项目 创建,可选择 High / Low 模式(Low 模式使用 4-bit 精度),本教程使用默认 Regular
- 也可以加载已有配置:在 Musubi Tuner → Project 中找到对应 JSON 文件,复制路径粘贴,路径开头需加
/ 确保是绝对路径
数据集配置
视频训练集(进阶)
- 支持多个 dataset 同时配置不同分辨率和帧数(如 768×512 / 22帧,512×320 / 56~90帧)
- H3 模型最高支持 15 秒视频,训练时可用到 243~290+ 帧
- 支持 Video / Image / Audio 三种数据源;视频自带音频时直接选 Video 即可
图片训练集(角色 LoRA,推荐新手)
- 添加 Dataset,选择 Video Director 路径(即数据集文件夹路径)
- 建议把图片放进
dataset 文件夹,方便复制路径
- 新建文件夹,上传角色图片,打标方式参考此前角色 LoRA 教程
- 复制路径粘贴到 Path 栏,开头加
/ 转为绝对路径
- 类型选择 Image(json file 栏留空,除非打标文件在单独文件夹)
- 分辨率:768×512
- 帧数:图片训练填 1
- Repeat:图片较少建议 3,图片较多可设为 1
关键参数
训练类型
- FL2A:单图训练(本教程使用)
- REF:多参考图训练,显存占用比首尾帧文生图更高,需要更高配置显卡
模型路径 — INT8 量化
- 24G 显存建议开启 INT8
- 路径下选择**未剪枝(un-pruned)**版本,而非剪枝版本,泛化性更好
- 也可以不改路径,选择 online(在线量化),约 1~2 分钟自动转换完成
LoRA Rank
- 官方推荐从 16 开始(社区常用 16 或 32)
- 32 可用但训练难度更高,泛化性更强
学习率
- 默认 0.0001(1e-4)
- 可根据需求调整(如 0.00005 = 5e-5),不确定具体换算可以直接问 AI
优化器
- 使用 8bit(无需用 fp32 全精度,显存占用更低)
训练步数
- 最大步数设置:10000(仅作为上限,不代表要跑满)
- 风格 LoRA 一般 5000 步左右成型
- 角色 LoRA 通常更快,1000 步左右即可看到效果
- 最终以采样效果和 Loss 曲线判断,觉得满意直接停止即可
采样设置(⚠️ 重要)
- Simple at First 务必开启:作者提醒,若不开启初次采样,可能训练 200+ 步后在第一次采样时突然爆显存,导致中间检查点未保存、被迫从头重跑,浪费时间
- 角色 LoRA 采样间隔推荐 250 步(视频采样很慢,间隔不宜太密)
- 采样提示词(Simple Prompts)在 Project 文件夹内可自行编辑,格式包含:提示词 / 宽度 / 高度 / 帧数 / 种子
- 采样分辨率建议 864×480(480P),避免用 1K 分辨率导致爆显存(尤其 10 秒左右视频)
Block to Swap(显存交换)
- 官方推荐:4090(24G)训练时设为 48
- 若显存更大(如 48G),可调低,如设为 15
- 需要根据自己机器实际测试:本教程测试 15 会爆显存,20 也会爆,35 勉强够,最终取中间值 42 较稳妥
梯度检查点(Gradient Checkpointing)
训练监控
启动训练后会先进行 latent / text encode 缓存(通常需要 5~10 分钟)。也可以先把所有数据集配置好,一键全部启动,效率更高。之后正式进入 training 阶段。
视频素材帧数要求
视频训练集帧数必须符合 17 + 5n 的格式(模型底层限制),例如 12 帧、39 帧等;视频帧率固定为 24fps。