NVIDIA Spatial Intelligence Lab (SIL) 开发的、使用700小时光学动作捕捉数据训练的动作扩散模型「Kimodo(kinematic motion diffusion)」已发布!可以从文本等生成人体和机器人的动作!
Kimodo: Scaling Controllable Human Motion Generation
在机器人学、仿真以及娱乐领域的应用中,高质量的人体动作数据正变得越来越重要。近期的生成模型通过文本提示或针对姿态的运动学约束等直观输入,成为可用于人体动作合成的有前景的数据来源。然而,由于公开动作捕捉(mocap)数据集规模较小,这些模型的动作质量、控制精度以及泛化能力一直受到限制。本研究提出 Kimodo,这是一种富有表现力且控制性很强的运动学动作扩散模型,使用700小时光学动作捕捉数据进行训练。该模型可通过文本,以及全身关键帧、稀疏关节位置与旋转、2D 途经点和高密度 2D 路径等综合运动学约束轻松控制,同时生成高质量动作。这一切通过精心设计的动作表示,以及将根部和身体预测解耦以尽量减少动作伪影、同时支持灵活条件约束的两阶段去噪架构得以实现。利用大规模动作捕捉数据集进行的实验,验证了主要设计决策的合理性,并分析了数据集规模和模型规模扩展对性能的影响。
- 从文本生成动作:Kimodo 可通过文本指令进行直观操作,并生成多样化的动作。
- 全身约束:模型可以对运动施加运动学姿态约束。例如,可以固定特定帧中的全身关节位置。约束会以红色骨架可视化。
- 末端执行器约束:对于手和脚(末端执行器)的各种组合,也可以通过关节的位置和旋转进行约束。在这些视频中,以红色显示的部分为受约束的关节。
- 根部约束:角色的整体移动可以通过 2D 途经点和高密度路径进行控制。借助我们平滑的根部动作表示,可以在保持自然骨盆运动的同时,忠实地跟随直线和曲线路径。
这个看起来也很不错呢。
项目页面、Github 上公开了代码,以及演示页面。
请务必查看一下!
链接
Kimodo: Scaling Controllable Human Motion Generation
Github