使用 AI Toolkit 训练 MiniMax H3 视频模型 LoRA,训练速度非常快(图片训练约 1.98 it/s),1000 步左右角色特征已基本还原。
与上一期用 Musubi Tuner 训练 H3 不同,本期使用 AI Toolkit,两者可根据习惯选择。
环境要求
- GPU:推荐 48G 的 4090 或 32G 的 5090
- ⚠️ 不推荐 24G 显卡:采样阶段显存会飙升,24G 大概率直接爆显存
- 显存占用参考(图片训练):16G ~ 32G,视频训练占用会更高
快速开始(云端)
镜像内置 Config 可直接用于测试 LoRA 效果(支持出图 / 出视频)。可以直接复制已有的训练 Job 作为预设起点,注意作者预设基于图片训练集,如果用视频训练集需要相应调整参数。
数据集配置
- 添加 Dataset,输入名称
- 把图片或视频拖入对应文件夹(也可以在 Dataset 页面内直接拖拽上传)
触发词:如果打标时已包含触发词可以不填,否则手动设置。
LoRA Rank
保存与显存交换
| 参数 | 说明 |
|---|
| 保存间隔 | 每 250 步保存一次,最多保留 10 个检查点 |
| Offloading | 报显存不足时调大(最高可到 100);不报错则可调小或直接关闭 |
优化器
推荐使用 Automagic(社区反馈效果较好),会自适应调整学习率,确保训练过程中学习率始终处于较优区间。
训练步数
- 角色 LoRA:3000 步
- 风格 LoRA:10000 步
Adapter(重要)
⚠️ 保持使用官方默认的 Training Adapter,不要切换成 Guidance 模式 —— 官方帖子说明 Adapter 模式效果明显优于默认 Guidance 模式。
视频训练注意事项
若使用视频训练集:
- 帧数格式:必须符合 17n + 5 的格式(模型底层限制)
- 帧率:固定为 24 fps(与上面的帧数格式要求是两回事,注意区分)
- Auto Frame:开启后自动识别视频帧数,无需手动填写;关闭则默认按 1 处理(图片训练用 1 即可)
- 需要 图生视频(Image to Video) 或 Audio 功能时手动开启对应开关
- 训练带音频素材时,推荐同时打开 Normalizer(音频均衡化),社区反馈效果更好
分辨率 / 帧数取舍策略
- 高帧数训练(显存压力大)→ 用低分辨率(如 256×512)
- 低帧数训练,如 1 帧或 33 帧(显存压力小)→ 可以用高分辨率
采样设置
- 默认分辨率 480P
- 不建议跳过初次采样:可以直观看到训练效果变化趋势
- 采样提示词可自定义,支持添加参考图,也可设置采样视频帧数(如 243 帧 = 10 秒)
速度与显存说明
- 图片训练总体速度非常快,主要耗时在采样阶段(每次采样跑 2 次视频,相对较慢)
- 采样时显存会明显飙升,这也是为什么不推荐 24G 显卡的原因
- 云端大显存机器可以顺畅训练;本地配置足够也可以使用一键安装包自行部署