由慕尼黑工业大学和HUAWEI的研究者提出的研究「OneCanvas: 3D Scene Understanding via Panoramic Reprojection」已公开,该研究将从多个视角拍摄的图像转换为单一全景表示,并几乎原样利用现有的Vision-Language Model(VLM)来实现高级3D空间理解!
OneCanvas: 3D Scene Understanding via Panoramic Reprojection
视觉-语言模型(VLM)中面向3D场景理解的现有方法,要么依赖复杂且模型特定的几何编码器来实现空间推理,要么需要大量训练资源。与此不同,OneCanvas将来自所有视图的patch特征汇聚到单一的等矩柱投影全景画布中。每个patch都会利用其深度和相机姿态,非投影变换到3D世界坐标系中,然后根据从画布原点观察该点得到的连续经度和纬度坐标进行放置。整个过程不进行像素网格栅格化,也不进行视图间聚合。
patch的度量坐标3D位置嵌入会被添加到其特征中,从而在把世界坐标压缩为角度型画布坐标时恢复丢失的深度信息。这使得所有帧的patch能够共享同一个空间坐标系,无需后端融合或大规模架构改动。预训练的VLM会将这种表示当作普通图像来处理。由于画布可以围绕任意关注姿态进行布局,这种表示可直接支持从特定视角出发的情境推理,这正是机器人和具身AI中的常见需求。
借助这种表示方式,还可以引入空间预训练课程。通过将从真实图像中提取的对象patch特征,程序化地放置到空画布上的任意3D空间位置,可以即时生成覆盖广泛空间推理任务的监督学习,并通过控制回答分布来减少空间推理中的捷径。OneCanvas在SQA3D和VSI-Bench上达到了最先进的精度,并且在SPBench的分布外数据上也表现出泛化能力。而且,与表现最好的竞争方法相比,其训练所需计算资源减少了一个数量级。
- 将从多个摄像头图像中获取的特征,分别复原到3D空间中的位置
- 转换为经度、纬度信息,并布局到一张全天球全景图上
- 为各个特征附加其所在方向以及距离信息
- 不仅学习外观,还预训练位置关系,从而降低训练成本
这相当实用,感觉很不错!!未来应用应该会很广泛的方案。
目前代码显示为Coming Soon。
请务必查看一下!
链接
OneCanvas: 3D Scene Understanding via Panoramic Reprojection
OneCanvas: 3D Scene Understanding via Panoramic Reprojection
https://baranowskibrt.github.io/onecanvas/