Wan‑Animate‑2:通义万象开源端到端实时AI角色动画生成框架

AI新闻 97ai
61

简介

Wan‑Animate‑2是由阿里Wan‑Video(通义万象)团队开源的端到端角色动画生成模型,基于Diffusion Transformer架构,实现参考图像+驱动视频完成人物动作迁移,同时推出蒸馏轻量化版本,可实现实时角色动画输出。该项目完整开放推理代码与模型权重,支持本地部署推理、Gradio网页交互,允许二次开发与商用,无需姿态估计、骨骼提取等中间处理环节,直接完成角色动画生成。

Wan-Animate-2(图1)

Wan‑Animate‑2是什么

Wan‑Animate‑2是一套端到端AI角色动画生成框架,核心能力是输入一张人物参考图像,搭配一段动作驱动视频,复刻驱动视频的肢体、表情运动,生成保持人物身份特征的动画视频。

项目分为Base高质量版本与Distillation蒸馏轻量化版本,蒸馏版本经过模型蒸馏压缩,仅需10步采样,能够实现24fps实时流式动画输出。区别于传统角色动画方案,模型摒弃姿态提取器,使用DiT扩散Transformer作为主干网络,搭配自研时序与注意力机制,解决人物身份丢失、肢体崩坏、时序错位等行业常见问题。

功能特色

  1. 动作精准迁移:直接学习驱动视频运动信息,复刻肢体动作、面部表情,减少手部畸变、肢体扭曲伪影。

  2. 强身份保留能力:Sparse‑Ref Attention稀疏参考注意力机制,锁定参考图人物五官、外形特征,生成视频人物形象不易崩坏。

  3. 镜头视角解耦控制:借助文本提示独立控制画面镜头视角,生成视频镜头可不跟随驱动视频镜头变化。

  4. 双模型版本选择:Base版本追求高清画质,Distillation蒸馏版本主打快速采样、实时推理。

  5. 多部署形态:支持原生脚本推理、Diffusers调用、本地Gradio网页UI,云端可直接运行Demo。

  6. 宽松开源协议:Apache 2.0协议,权重、推理代码全部开源,支持商用二次开发。

技术细节

  1. **主干网络Diffusion Transformer(DiT)**:采用端到端架构,取消姿态估计、OpenPose等中间模块,输入参考图、驱动视频、提示词直接输出视频,减少中间环节带来的误差累积。

  2. Time‑Align RoPE时序位置编码:对齐参考图像、驱动视频、生成输出视频之间的时序特征,解决人物动作时序错位、画面闪烁。

  3. Sparse‑Ref Attention稀疏参考注意力:只对参考素材关键Token执行注意力运算,在保证人物身份不丢失的前提下降低算力开销。

  4. 双分支网络结构:噪声去噪分支负责视频生成,参考分支专门处理参考图像与参考视频特征,两条分支并行运算。

  5. 模型蒸馏加速方案:Distillation蒸馏模型做知识蒸馏,采样步数压缩至10步,关闭CFG引导,Euler采样器,达成24fps实时流式动画输出。

  6. 提示词处理逻辑:官方建议借助大模型生成标准化提示,提示分为人物外观、背景场景两个模块,仅客观描述外观与环境,不在提示词写入动作、情绪类描述。

应用场景

  • 数字人动画制作:单张数字人图片,搭配动作视频驱动,快速产出短视频数字人表演素材。

  • AI短剧角色生成:短剧IP角色静态图,复用现成动作模板,批量生成角色演绎片段。

  • 虚拟主播素材预生成:制作虚拟形象动作片段,用于短视频剪辑内容。

  • 游戏、二次元素材:二次元人物图做动作迁移,产出动画片段。

  • 科研二次开发:角色动画方向算法研究、模型微调二次开发。

Wan-Animate-2(图2)

使用方法

硬件环境要求

版本 最低硬件 推荐硬件
Base基础版720P推理 24G显存显卡 8×A800
Distillation蒸馏版480P实时推理 16G显存显卡 2×A800

软件依赖:Python3.11,PyTorch2.7.0+CUDA12.6,flash‑attn以及项目requirements.txt依赖包。

部署步骤

  1. 克隆项目仓库到本地,执行可编辑安装pip install -e .安装项目。

  2. 下载Base或者Distillation版本权重,支持HuggingFace、ModelScope下载,放置到权重目录。

  3. 输入素材准备:人物参考图像PNG格式、动作驱动MP4视频;使用大模型生成规范提示词,只写人物外观和场景。

  4. 运行方式:

    • 脚本推理:调用infer目录下推理脚本,选择对应yaml配置文件,执行推理生成视频。

    • Gradio网页:运行项目内置Gradio启动脚本,本地浏览器打开可视化界面上传素材生成。

    • Diffusers调用:使用项目提供Pipeline代码,标准Diffusers接口调用生成MP4视频。

  5. ModelScope云端Demo,无需本地显卡,网页端直接测试效果。

竞品对比

选取行业内同类型开源角色动画项目做对比:

项目名称 开源状态 核心架构 实时能力 身份保留特点 是否去除姿态中间模块
Wan‑Animate‑2 完全开源,权重开放 DiT端到端架构 蒸馏版支持24fps实时输出 Sparse‑Ref Attention,身份稳定性强 ✅取消姿态提取中间环节
AnimateDiff 开源,依赖运动模块 基于SD扩散模型 不支持实时,采样步数多 容易出现人物换脸、身份漂移 ❌依赖运动模块,需要参考运动信息处理
LivePortrait 开源 基于特征对齐、运动编码 低分辨率可快速推理 面部效果优秀,全身动作效果弱 ❌依赖面部关键点提取

常见问题解答

Q:运行Wan‑Animate‑2最低需要多大显存?

A:蒸馏版本480P推理最低需要16G显存显卡,Base版本720P高清推理建议24G及以上显存,高分辨率720P想要流畅运行推荐多卡A800。显存不足可以降低输出分辨率,减少生成帧数。

Q:蒸馏版本为什么要关闭CFG引导系数?

A:蒸馏模型经过专门知识蒸馏训练,训练阶段没有使用CFG分类器引导,开启CFG会造成画面崩坏,官方要求蒸馏版本CFG scale固定设置1.0,搭配Euler采样器。

Q:提示词写动作描述为什么效果变差?

A:该模型动作全部来自驱动视频,提示词仅控制人物外观、场景背景,动作、情绪描述不会生效,还会干扰生成结果,因此提示词只写客观外观与环境。

Q:ComfyUI插件什么时候可用?

A:仓库Todo标记ComfyUI插件还在开发集成,当前版本暂未提供,后续更新会发布,现阶段只支持原生脚本、Gradio、Diffusers调用。

Q:可以直接商用吗?

A:项目代码遵循Apache2.0协议,权重公开可用,允许商用二次开发,使用需要遵守协议约束,注意输入输出素材版权。

Q:生成视频人物面部频繁崩坏怎么处理?

A:优先使用清晰度高、正面完整的参考PNG图像;选用Base版本提升画质;降低生成分辨率,同时检查提示词不要添加多余修饰词汇。

相关链接

总结

Wan‑Animate‑2是通义万象团队推出的开源端到端AI角色动画方案,依托自研时序编码与稀疏注意力机制,摆脱传统姿态提取中间流程,同时提供高质量基础模型和可实现24fps输出的蒸馏实时版本,兼顾生成画质与推理速度,多部署方式适配个人开发者、科研人员以及商业项目二次开发,为AI角色动作迁移提供完整可落地的开源实现。

打赏
THE END
作者头像
97ai
我不是在训练模型,而是在与未来的自己对话。