忘记密码?
其他方式登录

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

2026年8月18日

详细介绍

机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。

OVOW:从单目视频出发,恢复实例级 4D Mesh 世界,并将其送入物理仿真

OVOW 的突破不只是 “重建得像”,而是输出可编辑、可碰撞的实例级 Mesh:刚体记录真实尺度与逐帧 6-DoF 位姿,非刚体保留拓扑一致的时序形变。对象因此能被单独移动、删除或替换。

Image-to-3D Reconstruction:每组左侧为输入图像,右侧为 OVOW 恢复的实例级 3D Mesh 场景。系统能够在单图条件下恢复独立对象、完整几何与空间布局。图片来源:OVOW 论文 Figure 5 / 项目主页。

整条流水线不另训专用大模型,而是串联视觉基础模型,依次完成场景理解、几何与运动恢复、物理组装。

OVOW 方法总览(阶段 1–3):从视频中的对象发现与运动分类出发,分别恢复静态/刚体 Mesh、可变形 Mesh 序列、真实尺度与逐帧运动

OVOW 以实例 Mesh 为底座,将整体轨迹与局部形变分开,因而能同时处理车辆、飞机等刚体,以及飞鹰、北极熊等非刚体。

动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示

动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示

动态 GIF:左侧为野外飞鹰视频,右侧为 OVOW 恢复的拓扑一致非刚性 4D Mesh。画面来自 OVOW 项目主页官方演示

动态 GIF:左侧为机场多对象视频,右侧为 OVOW 恢复的实例级刚体 Mesh 场景。飞机、摆渡车与航站楼被分别重建。画面来自 OVOW 项目主页官方演示

动态 GIF:左侧为包含北极熊及多个物体的视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示

可仿真的关键,是改变初始条件后,场景仍能产生新结果。

动态 GIF:OVOW 项目主页“Simulation and Editing”中的 Toy-Car Tabletop I。重建得到的黑色越野车、哑铃、花盆与桌面资产在新的初始状态下发生碰撞、倾倒与位移

动态 GIF:Toy-Car Tabletop II。花盆位于车辆前方,哑铃与书本采用新的初始位置;在重力与接触作用下,各实例产生与案例一不同的碰撞和位移

动态 GIF:Toy-Car Tabletop III。哑铃、花盆、书本与黑色越野车被重新组合,由同一组重建资产生成第三套倾倒、滑动与碰撞过程

团队构建了各含 120 个场景的静态与动态基准,每个场景含 3–5 个对象,并提供 Mesh、轨迹、相机、深度和分割真值。

对 Physical AI 而言,RGB 像素只是入口。策略训练真正需要的是对象边界、几何、尺度、轨迹,以及接触和支撑等能够被执行的状态。OVOW 把视频变成实例级 4D Mesh,再由仿真器改变布局、目标和外力,从同一段观测扩展出多组反事实交互轨迹。

作者团队来自清华大学、中国科学技术大学、SparcAI、香港理工大学、电子科技大学、南洋理工大学,关注三维视觉、动态场景理解与具身智能。Junhao Chen 与 Boran Zhang 为共同一作,Yufei Wang 为通讯作者。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论