Insider Insider
3dnchu 尚无浏览 2 分钟阅读

MDM: Human Motion Diffusion Model – 可从文本生成和合成人物动作的技术登场!

可从文本生成和合成人物动作的技术「MDM: Human Motion Diffusion Model」登场!

2022/10/07 – 已在 Github 上公开代码,因此追加了链接

MDM: Human Motion Diffusion Model

https://guytevet.github.io/mdm-page/static/figures/MDM-page.mp4

生成自然且富有表现力的人类动作是计算机动画的圣地。然而,由于动作具有多样性,以及人类对其感知的敏感性和精确描绘的困难,这成为一个艰难的课题。因此,当前的生成方案要么质量较低,要么表现力有限。扩散模型在其他领域已经显著展现出生成能力,由于其多对多的性质,是面向人类动作的有前景候选,但往往会消耗大量资源且难以控制。本文介绍了将无分类器的基于扩散的生成模型谨慎地适配到人体动作领域的 Motion Diffusion Model (MDM)。MDM 是结合了动作生成文献见解的、基于 Transformer 的模型。一个值得注意的设计选择是在每个扩散步骤中预测样本而不是噪声。这样可以更容易地利用动作位置和速度方面已有的几何损失,例如脚部接触损失。正如我们所示,MDM 是一种通用方法,能够支持不同的条件模式和不同的生成任务。我们表明,该模型可用轻量级资源进行训练,同时在文本到动作和动作到动作的主要基准上取得最先进的结果。

MDM 框架采用了可支持各种条件输入的通用设计。在本报告中,我们介绍了三个任务:文本到动作、动作到动作以及无条件生成。MDM 以一种在多样性和保真度之间进行权衡的无分类器方法进行训练,并且可以从同一模型中采样有条件和无条件结果。在文本到动作转换中,它在 HumanML3D 和 KIT 基准上取得了最先进的结果,并能够生成一致的动作。此外,用户研究结果显示,人类评估者有 42% 的概率更偏好生成的动作而非真实动作。在 Action-to-Motion 方面,尽管 MDM 并非为此任务特别设计,但在 HumanAct12 和 UESTC 基准上仍表现优于最先进技术。

目前仅公开论文,源码显示为 Comming Soon。于 2022 年 10 月 7 日已在 Github 上公开源码。非常期待这项技术今后会如何发展。如果未来还能通过文本指定布局等内容,似乎就能仅靠文本制作类似 3D 剧的东西了。

链接

Human Motion Diffusion Model

GuyTevet/motion-diffusion-model: The official PyTorch implementation of the paper “Human Motion Diffusion Model”

Screenshot of guytevet.github.io