优云智算
控制台
立即注册

SOTA级音频驱动数字人-LongCat-Video-Avatar

实现身份永续、动作自然的数字人生成

镜像大小
120 GB
当前版本
v3.0
累计部署
82
累计运行
87 h
最近更新
2025-12-22

运行环境

框架版本
PyTorch-12.8
CUDA版本
12.8
应用
JupyterLab: 8888
支持卡型
48G RTX40系RTX50系
+5

LongCat-Video-Avatar

镜像使用教程

1.创建实例

租用可选的机器

image

2.启动后点击JupyterLab

image

3.ComfyUI路径下打开Terminal

image

复制启动命令并运行

source myenv/bin/activate && python main.py --listen 0.0.0.0 --port 8188

image

4.点击ComfyUI启动进入

image

5.点击左侧文件夹,选择想要运行的工作流

image

欢迎加入AI-KSK镜像使用交流群

image

AAI-KSK认证作者
个人主页
0 个镜像 · 被使用 82
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v3.0最新
12-22
在图生视频对口型工作流基础上增加文生视频对口型工作流,劣化问题解决,LongCat-Video-Avatar 通过 解耦无条件引导、参考跳跃注意力​ 与 跨块潜在特征拼接​ 三项核心技术,分别突破长视频生成中“无声静默”“动作僵硬”与“身份漂移”三大技术壁垒,实现音频驱动数字人的身份永续、动作自然与长时序稳定生成。
v2.0
12-21
在图生视频对口型工作流基础上增加文生视频对口型工作流,LongCat-Video-Avatar 通过 解耦无条件引导、参考跳跃注意力​ 与 跨块潜在特征拼接​ 三项核心技术,分别突破长视频生成中“无声静默”“动作僵硬”与“身份漂移”三大技术壁垒,实现音频驱动数字人的身份永续、动作自然与长时序稳定生成。
v1.0
12-20
LongCat-Video-Avatar 通过 解耦无条件引导、参考跳跃注意力​ 与 跨块潜在特征拼接​ 三项核心技术,分别突破长视频生成中“无声静默”“动作僵硬”与“身份漂移”三大技术壁垒,实现音频驱动数字人的身份永续、动作自然与长时序稳定生成。
评分
0.0
暂无评分
我的评分
未评分