UniWorld-View:大联合兔展智能等开源的单输入通用4D世界新视角生成模型

AI新闻 人工智能研究所
61

一、UniWorld-View是什么

UniWorld-View 是北大联合兔展智能等开源的单输入通用4D世界新视角生成模型,依托视频扩散架构,仅依靠单张图片、普通短视频作为输入,即可重建完整三维场景,并生成任意自定义相机轨迹下的全新视角画面,是当前WorldScore评测榜单SOTA(最优)开源多视角生成项目,开源协议为Apache 2.0,全部代码基于Python开发,配套Gradio可视化网页、批量推理脚本、国产昇腾NPU适配分支,兼顾学术研究与本地落地使用。

该模型区别于传统NeRF、3D高斯重建方案,无需多张多角度拍摄素材,普通用户随手拍摄的生活照片、手机短视频均可作为输入,同时融合深度估计、实例分割、动态视频扩散、相机位姿预测多模块,统一实现静态场景、动态人物物体的4D动态视角生成。

二、功能特色

  1. 极简输入门槛
    无需专业摄影设备、多视角素材,单张图片、单目短视频二选一即可完成场景重建与新视角渲染,降低3D视觉创作素材成本。

  2. 自由可控相机轨迹生成
    支持自定义环绕、推拉、平移、旋转等任意相机运动路径,精准控制相机位姿,输出连贯无畸变的动态视角视频。

  3. 静态/动态场景双兼容
    同时适配静物、建筑等静态场景与人、动物、流体等动态运动物体,支持4D时序动态重建(recon分支专属能力)。

  4. 多硬件平台适配
    原生支持NVIDIA GPU推理,提供独立npu分支适配国产昇腾NPU算力,满足国产算力部署需求。

  5. 开箱即用可视化工具
    内置Gradio网页交互Demo,本地浏览器可视化操作,无需编写代码;配套Shell一键脚本,支持批量批量视频推理。

  6. 完整配套预训练权重生态
    内置自动化权重下载脚本,主干模型、深度模型SAM2、BLIP2图文理解、Video-Depth-Anything、Wan2.1-VACE全套模型一键拉取。

UniWorld-View(图1)

三、技术细节

3.1 整体架构

UniWorld-View采用场景重建前置模块 + 视频扩散视角生成主干双阶段架构:

  1. 前置重建模块:

    • 深度估计:调用Video-Depth-Anything提取单目素材稠密深度图;

    • 实例分割:SAM2完成物体掩码区分,分离前景主体与背景;

    • 相机位姿预测:轻量化位姿解算网络,预估输入素材原始相机参数;

    • 4D时序编码:针对视频输入增加时间维度编码,记录物体运动轨迹。

  2. 扩散生成主干:
    基于Wan2.1-VACE视频扩散底座改造,将三维空间坐标、自定义相机参数作为条件嵌入扩散UNet,把视角偏移量转化为视频生成条件,实现跨视角画面连贯生成,解决传统扩散模型视角抖动、物体形变崩坏问题。

3.2 分支技术区分

  • main主分支:通用图文/短视频视角生成,面向普通用户推理;

  • recon分支:强化4D动态时序重建,适合动态人物、运动物体高精度创作;

  • npu分支:算子适配昇腾NPU,重构CUDA扩展逻辑,适配国产算力设备。

3.3 环境与编译依赖

  • 运行环境:Python3.10、PyTorch 2.4.0+CUDA12.1;

  • 编译组件:PyTorch3D源码编译、CUDA nvcc C++扩展(vipe视觉处理库);

  • 辅助模型:BLIP2图文对齐、SAM2分割、深度预估模型协同辅助场景理解。

3.4 硬件推理门槛

最低显存需求40GB,推荐60GB及以上A100、RTX 6000等专业GPU,低显存显卡易出现画面截断、显存溢出报错。

四、应用场景

  1. 短视频影视创作
    自媒体、短视频创作者用单张场景图生成环绕运镜视频,无需专业3D建模软件,快速产出航拍、环绕镜头素材。

  2. 虚拟数字人/虚拟场景
    单张数字人图片生成360°环绕展示视角,用于虚拟直播、数字人展厅素材制作。

  3. 建筑/室内设计展示
    室内效果图、建筑外景单图生成漫游视频,房产、设计行业快速制作全景漫游宣传片。

  4. 学术计算机视觉研究
    4D重建、新视图合成、视频扩散方向科研实验,提供开源可复现SOTA基线模型。

  5. 国产AI算力落地测试
    npu分支适配昇腾设备,企业用于国产算力平台多模态视觉模型部署验证。

  6. 游戏素材快速生成
    游戏原画、场景概念图一键生成多角度动态预览镜头,缩短游戏美术制作周期。

五、使用方法

5.1 仓库克隆与环境准备

  1. 拉取项目代码,同步外部依赖库

git clone https://github.com/PKU-YuanGroup/UniWorld-View.git
cd UniWorld-View
  1. 配置conda虚拟环境,安装基础依赖,编译PyTorch3D与vipe CUDA扩展

  2. 执行权重下载脚本,自动下载全部预训练模型至checkpoints文件夹

bash download_weights.sh

5.2 网页可视化Demo(零代码推荐)

执行启动脚本,本地打开浏览器访问可视化界面

bash run_app.sh

默认地址:127.0.0.1:7860,添加环境变量可开放公网远程访问。

5.3 批量命令行推理

批量处理图片/短视频素材,自定义相机轨迹参数,批量输出视角视频

bash run_infer.sh

可前置指定GPU卡号,多显卡并行推理加速。

5.4 分支切换使用

  • 动态4D重建:切换至recon分支

  • 昇腾NPU部署:切换至npu分支,配套国产算力编译脚本

六、竞品对比

选取2款同赛道开源新视角生成模型,从输入、算力、动态支持、可视化、国产适配维度对比:

对比维度 UniWorld-View(PKU-YuanGroup) ViewCrafter GS-DiT
素材输入 单图/单目短视频双支持 仅单张图片 多视角图片序列
动态场景支持 支持4D动态物体重建 仅静态场景 动态效果差,易形变
可视化工具 内置Gradio网页,一键启动 无原生可视化界面 仅命令行运行
国产算力适配 独立npu分支适配昇腾NPU 仅支持NVIDIA GPU 仅支持NVIDIA GPU
榜单性能 WorldScore榜单第一SOTA 中等水平 中等水平
使用门槛 一键脚本,全自动权重下载 需手动下载多个模型权重 需要多张多角度拍摄素材

七、常见问题解答

Q:运行代码时出现CUDA out of memory显存溢出报错怎么办?

A:该模型最低推荐40GB显存,显存不足可降低生成视频分辨率、缩短输出视频帧数,或更换60GB以上专业GPU;也可拆分素材分批推理,减少单次并行生成数量。

Q:npu分支部署昇腾设备失败,编译vipe扩展报错?

A:npu分支需要配套对应版本CANN驱动,编译前切换昇腾专属编译环境,关闭CUDA相关依赖,重新执行分支内配套编译脚本。

Q:输入短视频生成视角画面出现人物扭曲、物体崩坏?

A:优先切换recon动态重建分支,同时保证输入视频主体清晰、无大幅度遮挡,复杂运动流体、高速运动物体生成效果会自然下降,属于模型固有局限。

Q:权重下载脚本执行失败,模型文件缺失?

A:检查网络连通性,脚本默认从Hugging Face拉取权重,国内网络可手动下载权重文件放入checkpoints对应目录,关闭自动下载参数运行推理。

Q:Gradio网页无法从外网访问,仅本地打开?

A:启动run_app.sh时添加开放公网环境参数,关闭本地IP限制,开放7860端口防火墙即可外网访问。

Q:是否支持Windows系统本地运行?

A:项目原生基于Linux开发,Windows可通过WSL2子系统搭建CUDA环境运行,原生Windows无适配脚本,推荐使用Ubuntu22.04系统。

八、相关链接

  1. GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View

  2. Hugging Face仓库:https://huggingface.co/Drexubery/UniView

九、总结

UniWorld-View作为北大联合兔展智能等开源的SOTA级通用世界新视角合成AI模型,凭借单图、短视频双输入的低素材门槛、静态动态场景兼容、原生可视化交互与国产算力适配等核心优势,兼顾学术科研与商用素材创作需求,完整配套一键部署脚本、全套预训练权重与多场景适配分支,是当前开源领域综合实用性最强的多视角视频生成工具之一。

打赏
THE END
作者头像
人工智能研究所
发现AI神器,探索AI技术!