JoyAI‑Video‑Edit:京东开源的实时流式AI视频编辑系统

AI新闻 97ai
61

一、JoyAI‑Video‑Edit是什么

JoyAI‑Video‑Edit 是京东开源的实时开放式流式因果视频编辑系统,开源协议为 Apache 2.0。

不同于传统AI视频工具需要等待完整视频文件完成全量生成再输出,该项目采用因果流式生成范式,只依赖已生成的历史帧,不读取未来帧画面,支持普通视频文件、直播流做逐帧实时编辑处理,突破视频时长限制,实现边播放边编辑输出,720P分辨率下可做到近实时推理输出,提供可本地部署的Web交互界面与推理部署代码,配套对应的预训练模型权重与技术论文,面向科研与二次开发使用。

JoyAI-Video-Edit(图1)

二、功能特色

  1. 流式因果实时视频编辑:不受视频总时长约束,支持本地视频、直播流输入,逐帧处理,无需等待全部视频预处理完成即可输出结果。

  2. 多模态指令驱动编辑:支持自然语言文本指令编辑,同时支持参考图引导视频编辑(RV2V),以图片作为风格、物体、人物参考来修改视频内容。

  3. 丰富的视频修改能力:全局风格迁移、背景替换、画面内物体增加/删除/替换、人物服饰与形象修改、画面局部内容改写。

  4. 端到端高帧率推理:经过蒸馏、KV缓存、推理调度多重优化,720×1280分辨率可达30.19FPS端到端推理速度,实现高吞吐实时输出。

  5. 本地可私有化部署:提供完整部署脚本、Web前端交互页面,支持本地GPU环境部署,数据无需上传第三方云端。

三、技术细节

整体为16B参数自回归扩散多模态模型,由三大核心组件共同构成:MLLM条件编码器、因果视频VAE、MMDiT扩散Transformer。

  • MLLM条件编码器:负责解析文本提示词、参考图像,把用户编辑指令转化为模型可识别的条件特征。

  • 因果视频VAE:因果约束的视频编解码器,完成视频帧压缩与重建,适配流式逐帧输出,降低时序漂移问题。

  • MMDiT扩散Transformer:多模态扩散Transformer主干网络,基于历史帧条件自回归生成下一帧视频画面。

推理侧多重加速手段:自回归分布匹配蒸馏、长时序优化、受限KV缓存推理、部署调度优化,用来降低画面闪烁、时序漂移,提升帧率。
外部依赖组件:MiMo‑VL、ONNX检测器;模型权重分为DiT主干权重、VAE权重两部分,需要从HuggingFace获取权重放到指定目录。
开发语言:Python为主,搭配前端HTML,提供shell部署脚本;开源协议Apache 2.0,科研、商业二次开发均可使用。

JoyAI-Video-Edit(图2)

四、应用场景

  1. 直播实时画面改写:电商直播场景实时替换背景、修改商品展示效果、实时调整主播服饰画面,直播流一边推送一边AI编辑输出。

  2. 短视频内容生产:长短视频批量风格转换、局部物体修改,不用分段剪辑,直接流式处理完整长素材。

  3. 影视/短视频现场预调:实拍素材实时做画面效果预览修改,快速验证后期修改创意。

  4. 仿真数据集生成:生成连续时序AI视频,为机器人、视觉算法提供仿真训练视频素材。

  5. 个人本地AI视频创作:私有化部署,本地GPU完成视频编辑,素材不上云,保护内容隐私。

五、使用方法

环境准备

  1. 使用Conda创建Python3.10运行环境,安装requirements.txt声明全部Python依赖。

  2. 从HuggingFace下载项目配套预训练权重,放置路径:deploy/deps/checkpoints/JoyAI‑Video‑Edit/,准备MiMo‑VL、ONNX检测器外部依赖。

启动服务

  1. 进入仓库deploy目录,执行项目提供部署启动脚本。

  2. 默认本地访问地址 http://localhost:8080;如需局域网/外网访问,修改绑定地址为0.0.0.0,可自定义GPU设备、服务端口。

  3. Web界面选择输入源:上传本地视频或者接入直播流;输入文本提示词/上传参考图,提交即可实时流式输出编辑后的视频。

硬件提示:原始版本对显卡显存要求较高,官方后续计划做消费级显卡适配。

六、竞品对比

项目名称 核心范式 流式实时处理 参考图引导编辑 本地私有化WebUI 开源协议
JoyAI‑Video‑Edit 因果流式自回归扩散 ✅支持直播流、长视频逐帧实时编辑 ✅支持RV2V参考图引导 ✅内置Web部署界面 Apache 2.0
Open‑Sora Plan 全局扩散,片段式生成 ❌片段生成,不支持直播流流式输入 ✅参考图生成短视频片段 ✅WebUI Apache 2.0
VideoCrafter2 分段视频扩散生成 ❌固定片段长度离线生成 部分支持图片引导 ✅WebUI Apache 2.0

说明:Open‑Sora Plan、VideoCrafter2属于片段式离线视频生成,先生成完整片段再输出,不能处理无限长直播流;JoyAI‑Video‑Edit主打因果流式,面向持续输入的视频流场景。

JoyAI-Video-Edit(图3)

七、常见问题解答

Q:JoyAI‑Video‑Edit可以直接在消费级RTX显卡上面直接跑吗?

A:当前正式开源版本权重显存需求较高,更偏向服务器级GPU环境运行;官方TODO计划后续做消费级显卡适配,降低硬件门槛。

Q:是否支持完全离线部署,素材不上传到公有云?

A:可以,全部模型权重下载到本地,服务本地启动,视频输入输出全部在本机完成,无强制云端上传逻辑。

Q:模型权重在哪里获取?仓库里面是否自带权重文件?

A:GitHub仓库只存放代码、部署脚本,不包含模型权重,权重需要前往HuggingFace对应项目页面下载,放到指定checkpoints目录。

Q:可以拿来做商业产品二次开发吗?

A:项目使用Apache 2.0开源协议,允许商业二次开发,遵循协议声明即可。

Q:支持输入哪些视频源?

A:支持本地上传视频文件,也支持接入直播流作为输入源,做实时流式编辑。

Q:为什么生成视频会出现画面闪烁、物体漂移?

A:因果流式生成天然存在时序漂移挑战,项目已经做蒸馏、KV缓存等手段缓解,复杂编辑场景依然会存在少量闪烁,属于该技术方向共性问题。

八、相关链接

九、总结

JoyAI‑Video‑Edit是京东推出的一套面向流式场景的开源因果AI视频编辑系统,打破传统AI视频工具片段式离线生成的局限,将自回归扩散架构应用于逐帧实时视频编辑,兼顾文本、参考图多模态编辑指令,支持普通视频与直播流两类输入源,同时提供可落地的私有化部署方案,为直播处理、短视频生产、仿真数据集构建等场景提供一套可二次开发的底层技术底座。

打赏
THE END
作者头像
97ai
我不是在训练模型,而是在与未来的自己对话。