InstructAV2AV:智源北大联合开源的指令驱动端到端音视频联合编辑框架
一、InstructAV2AV是什么
InstructAV2AV是由智源研究院与北京大学团队联合推出的开源端到端音视频联合编辑框架,该框架实现文本指令直接完成音视频同步编辑,无需手动绘制掩码、无需分开处理画面与音频,支持对已有视频做画面修改、台词改写、物体增删、音色身份保留等编辑操作,配套开源专属训练数据集InsAVE‑80K,同时开放推理、微调训练全套代码,本地部署即可完成音视频协同编辑任务。
传统AI视频编辑工具大多只处理画面,音频需要后期单独剪辑替换,极易出现音画错位;部分方案需要用户手动框选编辑区域,操作门槛高。
InstructAV2AV是面向已有视频的指令式音视频联合编辑开源模型框架。输入原始视频+自然语言编辑指令,模型会同时修改视频画面以及对应的音频内容,自动维持背景环境音效,实现音画同步变化。项目提供多套预训练微调权重,支持人脸身份、人声音色做解耦控制,开发者可基于提供的数据集继续二次微调适配自有业务场景。

二、功能特色
文本指令驱动音视频同步编辑:仅使用自然语言指令,同时改动画面与对应音频,避免画面改完再手动替换音频,保证音画时序对齐。
无需手动掩码标注:不需要框选、涂抹编辑对象,开放世界视频直接输入即可执行编辑,降低使用门槛。
多维度解耦控制能力:人脸身份、人声音色、人物台词、画面物体可以独立控制,支持保留人脸改声音、保留音色改长相,人脸声音全部保留仅修改台词等组合编辑。
多样化编辑任务支持:支持通用画面修改、物体插入、物体移除、身份克隆、音色克隆、台词改写等多种编辑任务。
全链路开源交付:推理代码、Gradio网页Demo、训练脚本、大规模配对音视频编辑数据集全部开源,支持本地推理与二次微调训练。
背景信息自动保留:编辑目标对象时,自动保留无关的背景画面、环境噪音、背景音效,不会全盘重生成整个视频。
三、技术细节
底座依赖
项目基于Ovi音视频融合骨干网络,视频生成部分复用Wan2.2‑TI2V‑5B组件,音频编解码依靠MMAudio声码器与音频VAE,实现视频潜空间与音频潜空间对齐融合。
数据集 InsAVE‑80K
InsAVE‑80K是专门为音视频编辑构建的大规模配对数据集,托管于Hugging Face。每条样本包含原始视频、原始音频、编辑后音视频、编辑指令,格式支持JSONL、CSV,用于模型微调与效果评测。
预训练权重分组
项目提供6套面向不同任务的微调权重,存放于ckpts目录:
| 权重名称 | 核心能力 | 适用任务 |
|---|---|---|
| general | 通用音视频编辑 | 修改场景、人物外观、动作、台词、音效 |
| insertion | 物体插入 | 向视频增加物体并生成配套对应音频 |
| removal | 物体移除 | 删除画面物体,同步抹除物体关联声音 |
| clone_id | 人脸身份保留 | 保持人物长相,修改音色、台词、画面内容 |
| clone_voice | 音色保留 | 维持原有音色,更换人物形象、改写台词 |
| clone_id_voice | 人脸+音色双保留 | 样貌声音不变,仅修改人物台词内容 |
运行实现
推理:支持命令行脚本
edit.py批量处理,也可运行demo.py启动Gradio网页交互界面;使用<S>文本<E>标记人物台词,完成台词精准替换,支持导入外部音频替换原视频音轨。训练:使用Accelerate+DeepSpeed ZeRO‑2多卡训练方案,配置文件位于
ovi/configs/train/train_av_edit.yaml,支持音视频联合训练、仅视频训练、仅音频训练三种模式。环境基础:Python3.10、CUDA12.1,依赖PyTorch2.6.0、FlashAttention。
四、应用场景
短视频二次创作:已有实拍视频,通过文本指令改写人物台词、替换人物形象,同步更新音频,快速产出改编短视频素材。
影视素材粗编辑:对片段做物体增删、画面风格修改,同时处理配音音效,减少后期剪辑工序。
AI短剧制作:保留演员人脸或者音色,修改台词内容,快速生成多版本剧情片段。
内容数据生产:基于InsAVE‑80K数据集,二次微调模型,构建垂直领域音视频编辑数据集。
科研实验:音视频联合生成、多模态编辑方向算法复现、对比实验、算法迭代开发。
五、使用方法
1. 环境准备
克隆GitHub仓库,创建conda虚拟环境,安装项目依赖,适配CUDA12.1环境。
git clone https://github.com/suimuc/InstructAV2AV cd InstructAV2AV pip install -r requirements.txt python setup.py install
2. 权重下载
使用huggingface‑cli下载预训练权重,放置本地ckpts文件夹,同时下载Wan2.2、MMAudio底层依赖权重。
3. 推理运行
命令行批量推理:执行
scripts/edit.py,传入源视频路径、编辑指令,选择对应任务权重,输出编辑后的音视频文件。网页可视化Demo:运行
python scripts/demo.py,启动Gradio本地网页,上传视频,填写编辑指令,界面可视化完成编辑。
4. 模型微调
修改训练yaml配置文件,配置数据集路径、权重路径、输出目录,使用DeepSpeed多卡启动scripts/train.py执行微调,可按需选择音视频联合/单模态训练模式。
六、竞品对比
选取2个同赛道音视频编辑方案做对比,聚焦已有视频编辑能力:
| 项目 | InstructAV2AV | MMAudio(单独音频生成) | Runway Gen‑3 Edit |
|---|---|---|---|
| 开源状态 | 完全开源,本地部署 | 开源音频模块,无完整视频编辑链路 | 闭源云端API |
| 编辑方式 | 文本指令,无需掩码 | 仅音频生成,需要外部视频编辑工具 | 文本+掩码,画面编辑,音频需单独处理 |
| 音视频协同 | 画面音频同步联合修改 | 只处理音频,音画对齐需要外部逻辑 | 画面编辑,音频独立生成 |
| 身份音色解耦 | 支持人脸、音色独立控制 | 不支持人脸身份控制 | 不提供解耦控制能力 |
| 配套数据集 | 开源InsAVE‑80K配对数据集 | 无配套编辑数据集 | 不公开训练数据 |
| 部署方式 | 本地GPU部署 | 本地部署音频部分 | 仅云端网页调用 |
七、常见问题解答
Q:运行推理最低需要什么显卡配置?
A:官方没有给出最小显存阈值,该项目属于大模型音视频联合方案,建议使用24GB及以上显存的NVIDIA显卡,显存不足会出现OOM,可开启梯度检查点降低显存占用。
Q:权重下载失败如何处理?
A:检查huggingface‑cli工具版本,网络不佳可手动访问Hugging Face项目页面手动下载权重,完整放置到ckpts对应子目录,核对文件夹命名与配置文件路径保持一致。
Q:为什么编辑后音画依然出现不同步?
A:优先选择匹配任务的权重,台词编辑务必使用<S>内容<E>标记格式;源视频画面抖动剧烈、人物动作复杂时模型对齐效果会下降,可以补充更详细的文本编辑指令提升效果。
Q:可以直接用CPU运行推理吗?
A:不建议,模型体量较大,CPU推理速度极慢,几乎不具备实用价值,必须使用NVIDIA CUDA显卡。
Q:InsAVE‑80K数据集可以直接用于商业训练吗?
A:项目代码协议为Apache‑2.0,数据集使用约束参考Hugging Face数据集主页说明,商用前需要自行确认数据集版权合规性。
Q:可以只修改音频不改动画面吗?
A:可以,输入指令明确要求保持画面不变,搭配clone_id_voice权重,模型优先只更新音频台词部分。
八、相关链接
论文arXiv地址:https://arxiv.org/abs/2605.18467
Hugging Face数据集:https://huggingface.co/datasets/suimu/InsAVE-80K
Hugging Face模型库:https://huggingface.co/suimu/InstructAV2AV
九、总结
InstructAV2AV填补了开源领域端到端指令式音视频联合编辑的空白,依托配套的InsAVE‑80K数据集与多组任务微调权重,实现自然语言驱动下画面与音频协同修改,支持人脸和音色的解耦控制,整套代码可本地部署、可二次微调,为短视频创作、短剧素材加工、多模态算法科研提供完整可落地的开源技术方案。
版权及免责申明:本文由@dotaai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/instructav2av.html

