JoyAI‑Video‑Edit:京东开源的实时流式AI视频编辑系统
一、JoyAI‑Video‑Edit是什么
JoyAI‑Video‑Edit 是京东开源的实时开放式流式因果视频编辑系统,开源协议为 Apache 2.0。
不同于传统AI视频工具需要等待完整视频文件完成全量生成再输出,该项目采用因果流式生成范式,只依赖已生成的历史帧,不读取未来帧画面,支持普通视频文件、直播流做逐帧实时编辑处理,突破视频时长限制,实现边播放边编辑输出,720P分辨率下可做到近实时推理输出,提供可本地部署的Web交互界面与推理部署代码,配套对应的预训练模型权重与技术论文,面向科研与二次开发使用。

二、功能特色
流式因果实时视频编辑:不受视频总时长约束,支持本地视频、直播流输入,逐帧处理,无需等待全部视频预处理完成即可输出结果。
多模态指令驱动编辑:支持自然语言文本指令编辑,同时支持参考图引导视频编辑(RV2V),以图片作为风格、物体、人物参考来修改视频内容。
丰富的视频修改能力:全局风格迁移、背景替换、画面内物体增加/删除/替换、人物服饰与形象修改、画面局部内容改写。
端到端高帧率推理:经过蒸馏、KV缓存、推理调度多重优化,720×1280分辨率可达30.19FPS端到端推理速度,实现高吞吐实时输出。
本地可私有化部署:提供完整部署脚本、Web前端交互页面,支持本地GPU环境部署,数据无需上传第三方云端。
三、技术细节
整体为16B参数自回归扩散多模态模型,由三大核心组件共同构成:MLLM条件编码器、因果视频VAE、MMDiT扩散Transformer。
MLLM条件编码器:负责解析文本提示词、参考图像,把用户编辑指令转化为模型可识别的条件特征。
因果视频VAE:因果约束的视频编解码器,完成视频帧压缩与重建,适配流式逐帧输出,降低时序漂移问题。
MMDiT扩散Transformer:多模态扩散Transformer主干网络,基于历史帧条件自回归生成下一帧视频画面。
推理侧多重加速手段:自回归分布匹配蒸馏、长时序优化、受限KV缓存推理、部署调度优化,用来降低画面闪烁、时序漂移,提升帧率。
外部依赖组件:MiMo‑VL、ONNX检测器;模型权重分为DiT主干权重、VAE权重两部分,需要从HuggingFace获取权重放到指定目录。
开发语言:Python为主,搭配前端HTML,提供shell部署脚本;开源协议Apache 2.0,科研、商业二次开发均可使用。

四、应用场景
直播实时画面改写:电商直播场景实时替换背景、修改商品展示效果、实时调整主播服饰画面,直播流一边推送一边AI编辑输出。
短视频内容生产:长短视频批量风格转换、局部物体修改,不用分段剪辑,直接流式处理完整长素材。
影视/短视频现场预调:实拍素材实时做画面效果预览修改,快速验证后期修改创意。
仿真数据集生成:生成连续时序AI视频,为机器人、视觉算法提供仿真训练视频素材。
个人本地AI视频创作:私有化部署,本地GPU完成视频编辑,素材不上云,保护内容隐私。
五、使用方法
环境准备
使用Conda创建Python3.10运行环境,安装
requirements.txt声明全部Python依赖。从HuggingFace下载项目配套预训练权重,放置路径:
deploy/deps/checkpoints/JoyAI‑Video‑Edit/,准备MiMo‑VL、ONNX检测器外部依赖。
启动服务
进入仓库
deploy目录,执行项目提供部署启动脚本。默认本地访问地址
http://localhost:8080;如需局域网/外网访问,修改绑定地址为0.0.0.0,可自定义GPU设备、服务端口。Web界面选择输入源:上传本地视频或者接入直播流;输入文本提示词/上传参考图,提交即可实时流式输出编辑后的视频。
硬件提示:原始版本对显卡显存要求较高,官方后续计划做消费级显卡适配。
六、竞品对比
| 项目名称 | 核心范式 | 流式实时处理 | 参考图引导编辑 | 本地私有化WebUI | 开源协议 |
|---|---|---|---|---|---|
| JoyAI‑Video‑Edit | 因果流式自回归扩散 | ✅支持直播流、长视频逐帧实时编辑 | ✅支持RV2V参考图引导 | ✅内置Web部署界面 | Apache 2.0 |
| Open‑Sora Plan | 全局扩散,片段式生成 | ❌片段生成,不支持直播流流式输入 | ✅参考图生成短视频片段 | ✅WebUI | Apache 2.0 |
| VideoCrafter2 | 分段视频扩散生成 | ❌固定片段长度离线生成 | 部分支持图片引导 | ✅WebUI | Apache 2.0 |
说明:Open‑Sora Plan、VideoCrafter2属于片段式离线视频生成,先生成完整片段再输出,不能处理无限长直播流;JoyAI‑Video‑Edit主打因果流式,面向持续输入的视频流场景。

七、常见问题解答
Q:JoyAI‑Video‑Edit可以直接在消费级RTX显卡上面直接跑吗?
A:当前正式开源版本权重显存需求较高,更偏向服务器级GPU环境运行;官方TODO计划后续做消费级显卡适配,降低硬件门槛。
Q:是否支持完全离线部署,素材不上传到公有云?
A:可以,全部模型权重下载到本地,服务本地启动,视频输入输出全部在本机完成,无强制云端上传逻辑。
Q:模型权重在哪里获取?仓库里面是否自带权重文件?
A:GitHub仓库只存放代码、部署脚本,不包含模型权重,权重需要前往HuggingFace对应项目页面下载,放到指定checkpoints目录。
Q:可以拿来做商业产品二次开发吗?
A:项目使用Apache 2.0开源协议,允许商业二次开发,遵循协议声明即可。
Q:支持输入哪些视频源?
A:支持本地上传视频文件,也支持接入直播流作为输入源,做实时流式编辑。
Q:为什么生成视频会出现画面闪烁、物体漂移?
A:因果流式生成天然存在时序漂移挑战,项目已经做蒸馏、KV缓存等手段缓解,复杂编辑场景依然会存在少量闪烁,属于该技术方向共性问题。
八、相关链接
技术论文arXiv地址:https://arxiv.org/pdf/2608.03974
HuggingFace模型库:https://huggingface.co/jdopensource/JoyAI-Video-Edit
九、总结
JoyAI‑Video‑Edit是京东推出的一套面向流式场景的开源因果AI视频编辑系统,打破传统AI视频工具片段式离线生成的局限,将自回归扩散架构应用于逐帧实时视频编辑,兼顾文本、参考图多模态编辑指令,支持普通视频与直播流两类输入源,同时提供可落地的私有化部署方案,为直播处理、短视频生产、仿真数据集构建等场景提供一套可二次开发的底层技术底座。
版权及免责申明:本文由@97ai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/joyai-video-edit.html

