Meta研究员探索用posed RGB video进行对象检测、关联和映射
研究人员在名为《ODAM: Object Detection Association and Mapping using Posed RGB Video》的论文中探索了一种利用姿态RGB视频进行对象检测、关联和映射的方法。他们关注对象语义重建和对象映射之间的空间,并使用3D bounding volume表示对象。然而,使用仅有RGB视频定位对象并估计其范围的任务存在挑战,包括深度比例模糊性和多视图约束的缺乏。因此,研究人员提出了ODAM框架,结合了深度学习前端和多视图优化后端,旨在解决来自posed RGB video的3D对象映射问题。ODAM的关键在于基于超二次曲面的多视图优化和attention-based的图形神经网络。研究人员使用ScanNet和Scan2CAD评估了ODAM的性能,结果显示ODAM是目前在复杂室内场景中性能最好的纯RGB-only系统。他们还指出了常用的3D bounding volume表示的局限性,并提出了一种改进的超二次曲面优化方法。总体来说,ODAM在在线3D对象映射领域做出了三方面的贡献。