由 DFKI、Max Planck、Snap Inc. 等研究团队打造的 AI 技术「DuetGen」登场,只需输入音乐,即可自动生成两人配对同步的交互式舞蹈场景。它还能自然再现音乐与角色之间的互动。该技术于 SIGGRAPH 2025 发布。
DuetGen: Music Driven Two-Person Dance Generation via Hierarchical Masked Modeling
「DuetGen」是根据音乐生成二人舞蹈的最新 AI 模型。它通过两阶段的 token 生成模型,输出伙伴之间相互联动并与音乐同步的舞蹈动作。通过分阶段建模高层语义信息与细微动作,实现自然且真实的舞蹈场景。
- 多阶段动作生成:首先用 VQ‑VAE 将二人的动作转换为从粗到细的 token,再从音乐中生成。
- 层级式掩码 Transformer:通过 2 阶段 Transformer 补全生成高、低层 token。在保持与音乐对应关系以及二人动作关系的同时生成动作。
- 信息整合式设计:以统一方式处理二人的动作,自然再现姿态与相互作用。
用户调研也证明,在动作真实感、音乐同步性、双向协调性方面,其性能优于以往方法
单人动作相关技术已经层出不穷,不过接下来像这样涉及多人的动作生成,应该也会越来越多地出现稳定的方案吧(实际上已经有很多了)。
代码尚未公开。技术详情请查看项目页面!
链接
DuetGen