Meta提出一种全新的环境感知音频生成模型AV-LDM
美国得克萨斯大学奥斯汀分校和Meta提出了一种新的环境感知音频生成模型AV-LDM,用于将动作声音从背景环境声音中分离出来。他们通过训练模型使用检索增强生成,在无声视频中生成与视觉内容匹配的音频。研究人员使用自中心视频数据集Ego4D和EPIC-KITCHENS进行训练和评估,并引入了Ego4D-Sounds。实验结果表明,该模型优于现有方法,并能够控制环境声音的产生。
该研究还指出,现有的动作声音生成方法无法区分动作声音和环境声音,导致在测试时无法控制地产生环境声音或幻觉。为了解决这个问题,研究团队通过在训练期间使用来自不同时间戳的音频片段,将模型的注意力集中在从视觉框架中学习动作线索并生成动作声音上。
虽然该模型的训练数据并非为自中心视频量身定制,但使用自中心视频数据集有提供近距离视图和带有时间戳的叙述的优势。
总的来说,该研究拓宽了有关训练来源的范围,并在生成人类行为声音方面取得了较好的效果。在未来的研究中,团队计划探索将音频生成模型转用于合成图像输入,并应用于VR游戏等领域。