Wan‑Animate‑2:通义万象开源端到端实时AI角色动画生成框架
简介
Wan‑Animate‑2是由阿里Wan‑Video(通义万象)团队开源的端到端角色动画生成模型,基于Diffusion Transformer架构,实现参考图像+驱动视频完成人物动作迁移,同时推出蒸馏轻量化版本,可实现实时角色动画输出。该项目完整开放推理代码与模型权重,支持本地部署推理、Gradio网页交互,允许二次开发与商用,无需姿态估计、骨骼提取等中间处理环节,直接完成角色动画生成。

Wan‑Animate‑2是什么
Wan‑Animate‑2是一套端到端AI角色动画生成框架,核心能力是输入一张人物参考图像,搭配一段动作驱动视频,复刻驱动视频的肢体、表情运动,生成保持人物身份特征的动画视频。
项目分为Base高质量版本与Distillation蒸馏轻量化版本,蒸馏版本经过模型蒸馏压缩,仅需10步采样,能够实现24fps实时流式动画输出。区别于传统角色动画方案,模型摒弃姿态提取器,使用DiT扩散Transformer作为主干网络,搭配自研时序与注意力机制,解决人物身份丢失、肢体崩坏、时序错位等行业常见问题。
功能特色
动作精准迁移:直接学习驱动视频运动信息,复刻肢体动作、面部表情,减少手部畸变、肢体扭曲伪影。
强身份保留能力:Sparse‑Ref Attention稀疏参考注意力机制,锁定参考图人物五官、外形特征,生成视频人物形象不易崩坏。
镜头视角解耦控制:借助文本提示独立控制画面镜头视角,生成视频镜头可不跟随驱动视频镜头变化。
双模型版本选择:Base版本追求高清画质,Distillation蒸馏版本主打快速采样、实时推理。
多部署形态:支持原生脚本推理、Diffusers调用、本地Gradio网页UI,云端可直接运行Demo。
宽松开源协议:Apache 2.0协议,权重、推理代码全部开源,支持商用二次开发。
技术细节
**主干网络Diffusion Transformer(DiT)**:采用端到端架构,取消姿态估计、OpenPose等中间模块,输入参考图、驱动视频、提示词直接输出视频,减少中间环节带来的误差累积。
Time‑Align RoPE时序位置编码:对齐参考图像、驱动视频、生成输出视频之间的时序特征,解决人物动作时序错位、画面闪烁。
Sparse‑Ref Attention稀疏参考注意力:只对参考素材关键Token执行注意力运算,在保证人物身份不丢失的前提下降低算力开销。
双分支网络结构:噪声去噪分支负责视频生成,参考分支专门处理参考图像与参考视频特征,两条分支并行运算。
模型蒸馏加速方案:Distillation蒸馏模型做知识蒸馏,采样步数压缩至10步,关闭CFG引导,Euler采样器,达成24fps实时流式动画输出。
提示词处理逻辑:官方建议借助大模型生成标准化提示,提示分为人物外观、背景场景两个模块,仅客观描述外观与环境,不在提示词写入动作、情绪类描述。
应用场景
数字人动画制作:单张数字人图片,搭配动作视频驱动,快速产出短视频数字人表演素材。
AI短剧角色生成:短剧IP角色静态图,复用现成动作模板,批量生成角色演绎片段。
虚拟主播素材预生成:制作虚拟形象动作片段,用于短视频剪辑内容。
游戏、二次元素材:二次元人物图做动作迁移,产出动画片段。
科研二次开发:角色动画方向算法研究、模型微调二次开发。

使用方法
硬件环境要求
| 版本 | 最低硬件 | 推荐硬件 |
|---|---|---|
| Base基础版720P推理 | 24G显存显卡 | 8×A800 |
| Distillation蒸馏版480P实时推理 | 16G显存显卡 | 2×A800 |
软件依赖:Python3.11,PyTorch2.7.0+CUDA12.6,flash‑attn以及项目requirements.txt依赖包。
部署步骤
克隆项目仓库到本地,执行可编辑安装
pip install -e .安装项目。下载Base或者Distillation版本权重,支持HuggingFace、ModelScope下载,放置到权重目录。
输入素材准备:人物参考图像PNG格式、动作驱动MP4视频;使用大模型生成规范提示词,只写人物外观和场景。
运行方式:
脚本推理:调用infer目录下推理脚本,选择对应yaml配置文件,执行推理生成视频。
Gradio网页:运行项目内置Gradio启动脚本,本地浏览器打开可视化界面上传素材生成。
Diffusers调用:使用项目提供Pipeline代码,标准Diffusers接口调用生成MP4视频。
ModelScope云端Demo,无需本地显卡,网页端直接测试效果。
竞品对比
选取行业内同类型开源角色动画项目做对比:
| 项目名称 | 开源状态 | 核心架构 | 实时能力 | 身份保留特点 | 是否去除姿态中间模块 |
|---|---|---|---|---|---|
| Wan‑Animate‑2 | 完全开源,权重开放 | DiT端到端架构 | 蒸馏版支持24fps实时输出 | Sparse‑Ref Attention,身份稳定性强 | ✅取消姿态提取中间环节 |
| AnimateDiff | 开源,依赖运动模块 | 基于SD扩散模型 | 不支持实时,采样步数多 | 容易出现人物换脸、身份漂移 | ❌依赖运动模块,需要参考运动信息处理 |
| LivePortrait | 开源 | 基于特征对齐、运动编码 | 低分辨率可快速推理 | 面部效果优秀,全身动作效果弱 | ❌依赖面部关键点提取 |
常见问题解答
Q:运行Wan‑Animate‑2最低需要多大显存?
A:蒸馏版本480P推理最低需要16G显存显卡,Base版本720P高清推理建议24G及以上显存,高分辨率720P想要流畅运行推荐多卡A800。显存不足可以降低输出分辨率,减少生成帧数。
Q:蒸馏版本为什么要关闭CFG引导系数?
A:蒸馏模型经过专门知识蒸馏训练,训练阶段没有使用CFG分类器引导,开启CFG会造成画面崩坏,官方要求蒸馏版本CFG scale固定设置1.0,搭配Euler采样器。
Q:提示词写动作描述为什么效果变差?
A:该模型动作全部来自驱动视频,提示词仅控制人物外观、场景背景,动作、情绪描述不会生效,还会干扰生成结果,因此提示词只写客观外观与环境。
Q:ComfyUI插件什么时候可用?
A:仓库Todo标记ComfyUI插件还在开发集成,当前版本暂未提供,后续更新会发布,现阶段只支持原生脚本、Gradio、Diffusers调用。
Q:可以直接商用吗?
A:项目代码遵循Apache2.0协议,权重公开可用,允许商用二次开发,使用需要遵守协议约束,注意输入输出素材版权。
Q:生成视频人物面部频繁崩坏怎么处理?
A:优先使用清晰度高、正面完整的参考PNG图像;选用Base版本提升画质;降低生成分辨率,同时检查提示词不要添加多余修饰词汇。
相关链接
ModelScope:https://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
arXiv技术论文:https://arxiv.org/pdf/2608.06009
在线体验Demo:https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
总结
Wan‑Animate‑2是通义万象团队推出的开源端到端AI角色动画方案,依托自研时序编码与稀疏注意力机制,摆脱传统姿态提取中间流程,同时提供高质量基础模型和可实现24fps输出的蒸馏实时版本,兼顾生成画质与推理速度,多部署方式适配个人开发者、科研人员以及商业项目二次开发,为AI角色动作迁移提供完整可落地的开源实现。
版权及免责申明:本文由@97ai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/wan-animate-2.html

