认识UniWorld-View
兔展智能联合北京大学、鹏城实验室推出了开源世界模型UniWorld-View,该模型登顶李飞飞团队 WorldScore 世界模型评测榜单。它能基于单张图片或一段视频,按照指定相机轨迹生成新视角画面,并以统一架构实现单图 3D 生成和视频 4D 生成。目前模型已适配国产昇腾算力,代码与权重均已开源。

UniWorld-View功能概览
- 单图新视角合成:多视角画面由单张图片生成,相机按指定路径运动,可完成推、拉、摇、移及 360° 环绕。
- 新视角动态视频合成:新视角动态视频以单目视频为基础生成,未拍摄空间由系统推断,时序保持一致。
- 统一生成框架:静态图像与动态视频的新视角生成任务,可由同一套模型和代码共同支持。
- 相机轨迹控制:大基线视角切换依靠相机位姿的精确控制实现。
UniWorld-View原理解析
- 点云渲染的遮挡感知:为解决点云渲染中的前景背景撕裂和背面漏光问题,模型提出法向过滤与双重投影机制。
- Double-Reprojection双重投影:被判定为遮挡区域的,是源画面投向目标视角后沿原路回投时无法返回的像素;这些像素逐帧累积成遮挡 mask,从而防止生成模型受到错误纹理误导。
- Normal-Filtering法向过滤:借助法向信息过滤背面点云,避免相机移动到物体背后时出现正面像素穿透泄漏。
- 几何与生成融合:目标视角条件图的获得,要先由几何模型构建 3D 点云并完成渲染;之后交给视频扩散模型生成,以同时保证画面质量和相机控制精度。

微信关注回复“开源”,加入开源AI项目交流群
UniWorld-View使用方法
- 环境准备:完成 GitHub 仓库克隆和 Python 环境配置,随后安装依赖。
- 模型下载:开源权重可在 Hugging Face 或 GitHub Release 下载。
- 数据输入:目标相机轨迹需要预先定义,源素材则使用单张图片或一段视频。
- 运行推理:指定视角的新画面或视频会由模型自动产出,前提是执行推理脚本。
- 昇腾部署:国产算力场景应依据官方文档适配昇腾 NPU,并完成推理加速。
UniWorld-View项目入口
- GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View
- HuggingFace模型库:https://huggingface.co/Drexubery/UniView
同类竞品与UniWorld-View对照
维度UniWorld-ViewWorldScape-0.2(MoE)
总分指标WorldScore静态 85.53 / 相机控制 97.72 / 3D 一致性 91.63均为第一;动态以 76.23 略占优势,其他维度则处于落后位置
技术路线视频扩散模型配合遮挡感知点云渲染MoE 架构生成路线
开源情况全开源代码与权重全开源情况未明确
国产算力昇腾已完成适配相关情况未提及
任务统一性单图 3D 和视频 4D由单模型覆盖世界生成为专注方向
UniWorld-View适用场景
- 影视与广告制作:实拍与三维重建成本可通过快速产出场景多机位预览来降低。
- 虚拟现实与游戏:可交互的 360° 环绕场景,可从单张概念图或视频生成。
- 自动驾驶及机器人仿真:视觉感知与路径规划模型训练所需的数据,可通过构建真实世界的新视角内容获得。
- 文化遗产数字化:先以单图/单视频方式采集文物或古建筑,再将其制作为环绕视角数字化展示。
- 电商与房地产:用户沉浸感可借助多角度展示内容增强,其素材来自单张商品图或房间视频。