Meta研究优化AR/VR环境的物品对象视觉可视化查找
在这项研究中,研究人员提出了一种基于转换器的模型CocoFormer,用于解决自中心视觉查询定位的问题。他们注意到现有的方法存在数据集和任务偏见的问题,并通过扩展有限的注释和动态丢弃对象建议来解决这些问题。CocoFormer模型引入了一个条件投影层,通过将查询对象转换应用于候选proposal特征,生成与查询相关的embeddings。然后,使用多头注意力层来操作这些转换,以充分利用全局情景。实验结果显示,CocoFormer在2D和3D配置中取得了更好的查询定位性能,并在Ego4D的挑战中成为VQ2D和VQ3D任务的前两名,并在FSD检测任务中达到了最新的性能水平。总的来说,这项研究通过改进自中心查询检测,提出了一种有效的方法来解决自中心视觉查询定位的问题。