UniWorld-View:大联合兔展智能等开源的单输入通用4D世界新视角生成模型
一、UniWorld-View是什么
UniWorld-View 是北大联合兔展智能等开源的单输入通用4D世界新视角生成模型,依托视频扩散架构,仅依靠单张图片、普通短视频作为输入,即可重建完整三维场景,并生成任意自定义相机轨迹下的全新视角画面,是当前WorldScore评测榜单SOTA(最优)开源多视角生成项目,开源协议为Apache 2.0,全部代码基于Python开发,配套Gradio可视化网页、批量推理脚本、国产昇腾NPU适配分支,兼顾学术研究与本地落地使用。
该模型区别于传统NeRF、3D高斯重建方案,无需多张多角度拍摄素材,普通用户随手拍摄的生活照片、手机短视频均可作为输入,同时融合深度估计、实例分割、动态视频扩散、相机位姿预测多模块,统一实现静态场景、动态人物物体的4D动态视角生成。
二、功能特色
极简输入门槛
无需专业摄影设备、多视角素材,单张图片、单目短视频二选一即可完成场景重建与新视角渲染,降低3D视觉创作素材成本。自由可控相机轨迹生成
支持自定义环绕、推拉、平移、旋转等任意相机运动路径,精准控制相机位姿,输出连贯无畸变的动态视角视频。静态/动态场景双兼容
同时适配静物、建筑等静态场景与人、动物、流体等动态运动物体,支持4D时序动态重建(recon分支专属能力)。多硬件平台适配
原生支持NVIDIA GPU推理,提供独立npu分支适配国产昇腾NPU算力,满足国产算力部署需求。开箱即用可视化工具
内置Gradio网页交互Demo,本地浏览器可视化操作,无需编写代码;配套Shell一键脚本,支持批量批量视频推理。完整配套预训练权重生态
内置自动化权重下载脚本,主干模型、深度模型SAM2、BLIP2图文理解、Video-Depth-Anything、Wan2.1-VACE全套模型一键拉取。

三、技术细节
3.1 整体架构
UniWorld-View采用场景重建前置模块 + 视频扩散视角生成主干双阶段架构:
前置重建模块:
深度估计:调用Video-Depth-Anything提取单目素材稠密深度图;
实例分割:SAM2完成物体掩码区分,分离前景主体与背景;
相机位姿预测:轻量化位姿解算网络,预估输入素材原始相机参数;
4D时序编码:针对视频输入增加时间维度编码,记录物体运动轨迹。
扩散生成主干:
基于Wan2.1-VACE视频扩散底座改造,将三维空间坐标、自定义相机参数作为条件嵌入扩散UNet,把视角偏移量转化为视频生成条件,实现跨视角画面连贯生成,解决传统扩散模型视角抖动、物体形变崩坏问题。
3.2 分支技术区分
main主分支:通用图文/短视频视角生成,面向普通用户推理;
recon分支:强化4D动态时序重建,适合动态人物、运动物体高精度创作;
npu分支:算子适配昇腾NPU,重构CUDA扩展逻辑,适配国产算力设备。
3.3 环境与编译依赖
运行环境:Python3.10、PyTorch 2.4.0+CUDA12.1;
编译组件:PyTorch3D源码编译、CUDA nvcc C++扩展(vipe视觉处理库);
辅助模型:BLIP2图文对齐、SAM2分割、深度预估模型协同辅助场景理解。
3.4 硬件推理门槛
最低显存需求40GB,推荐60GB及以上A100、RTX 6000等专业GPU,低显存显卡易出现画面截断、显存溢出报错。
四、应用场景
短视频影视创作
自媒体、短视频创作者用单张场景图生成环绕运镜视频,无需专业3D建模软件,快速产出航拍、环绕镜头素材。虚拟数字人/虚拟场景
单张数字人图片生成360°环绕展示视角,用于虚拟直播、数字人展厅素材制作。建筑/室内设计展示
室内效果图、建筑外景单图生成漫游视频,房产、设计行业快速制作全景漫游宣传片。学术计算机视觉研究
4D重建、新视图合成、视频扩散方向科研实验,提供开源可复现SOTA基线模型。国产AI算力落地测试
npu分支适配昇腾设备,企业用于国产算力平台多模态视觉模型部署验证。游戏素材快速生成
游戏原画、场景概念图一键生成多角度动态预览镜头,缩短游戏美术制作周期。
五、使用方法
5.1 仓库克隆与环境准备
拉取项目代码,同步外部依赖库
git clone https://github.com/PKU-YuanGroup/UniWorld-View.git cd UniWorld-View
配置conda虚拟环境,安装基础依赖,编译PyTorch3D与vipe CUDA扩展
执行权重下载脚本,自动下载全部预训练模型至checkpoints文件夹
bash download_weights.sh
5.2 网页可视化Demo(零代码推荐)
执行启动脚本,本地打开浏览器访问可视化界面
bash run_app.sh
默认地址:127.0.0.1:7860,添加环境变量可开放公网远程访问。
5.3 批量命令行推理
批量处理图片/短视频素材,自定义相机轨迹参数,批量输出视角视频
bash run_infer.sh
可前置指定GPU卡号,多显卡并行推理加速。
5.4 分支切换使用
动态4D重建:切换至recon分支
昇腾NPU部署:切换至npu分支,配套国产算力编译脚本
六、竞品对比
选取2款同赛道开源新视角生成模型,从输入、算力、动态支持、可视化、国产适配维度对比:
| 对比维度 | UniWorld-View(PKU-YuanGroup) | ViewCrafter | GS-DiT |
|---|---|---|---|
| 素材输入 | 单图/单目短视频双支持 | 仅单张图片 | 多视角图片序列 |
| 动态场景支持 | 支持4D动态物体重建 | 仅静态场景 | 动态效果差,易形变 |
| 可视化工具 | 内置Gradio网页,一键启动 | 无原生可视化界面 | 仅命令行运行 |
| 国产算力适配 | 独立npu分支适配昇腾NPU | 仅支持NVIDIA GPU | 仅支持NVIDIA GPU |
| 榜单性能 | WorldScore榜单第一SOTA | 中等水平 | 中等水平 |
| 使用门槛 | 一键脚本,全自动权重下载 | 需手动下载多个模型权重 | 需要多张多角度拍摄素材 |
七、常见问题解答
Q:运行代码时出现CUDA out of memory显存溢出报错怎么办?
A:该模型最低推荐40GB显存,显存不足可降低生成视频分辨率、缩短输出视频帧数,或更换60GB以上专业GPU;也可拆分素材分批推理,减少单次并行生成数量。
Q:npu分支部署昇腾设备失败,编译vipe扩展报错?
A:npu分支需要配套对应版本CANN驱动,编译前切换昇腾专属编译环境,关闭CUDA相关依赖,重新执行分支内配套编译脚本。
Q:输入短视频生成视角画面出现人物扭曲、物体崩坏?
A:优先切换recon动态重建分支,同时保证输入视频主体清晰、无大幅度遮挡,复杂运动流体、高速运动物体生成效果会自然下降,属于模型固有局限。
Q:权重下载脚本执行失败,模型文件缺失?
A:检查网络连通性,脚本默认从Hugging Face拉取权重,国内网络可手动下载权重文件放入checkpoints对应目录,关闭自动下载参数运行推理。
Q:Gradio网页无法从外网访问,仅本地打开?
A:启动run_app.sh时添加开放公网环境参数,关闭本地IP限制,开放7860端口防火墙即可外网访问。
Q:是否支持Windows系统本地运行?
A:项目原生基于Linux开发,Windows可通过WSL2子系统搭建CUDA环境运行,原生Windows无适配脚本,推荐使用Ubuntu22.04系统。
八、相关链接
Hugging Face仓库:https://huggingface.co/Drexubery/UniView
九、总结
UniWorld-View作为北大联合兔展智能等开源的SOTA级通用世界新视角合成AI模型,凭借单图、短视频双输入的低素材门槛、静态动态场景兼容、原生可视化交互与国产算力适配等核心优势,兼顾学术科研与商用素材创作需求,完整配套一键部署脚本、全套预训练权重与多场景适配分支,是当前开源领域综合实用性最强的多视角视频生成工具之一。
版权及免责申明:本文由@人工智能研究所原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/uniworld-view.html

