由卡内基梅隆大学和马克斯·普朗克智能系统研究所等研究者提出的『WHAM:Reconstructing World-grounded Humans with Accurate 3D Motion』技术备受关注。这是一种从视频中构建人物运动的技术。
WHAM:Reconstructing World-grounded Humans with Accurate 3D Motion
虽然从视频中估计人类的3D运动已经迅速进步,但当前方法仍然存在若干重要限制。第一,大多数方法都是在相机坐标系中估计人物。第二,在全局坐标系中估计人物的先行研究,往往假设地面是平坦的,因此会出现脚滑。第三,精度最高的方法依赖计算成本高昂的优化流程,限制了其用于离线应用。最后,现有基于视频的方法,与单帧方法相比,精度惊人地更低。我们使用 WHAM(World-grounded Humans with Accurate Motion)来解决这些限制。WHAM 能够从视频中在全局坐标系下精确且高效地重建3D人体运动。WHAM 通过使用动作捕捉数据学习将2D关键点序列提升到3D,并将其与视频特征融合,以整合运动上下文和视觉信息。WHAM 还利用从 SLAM 方法推定的相机角速度,与人体运动一起估计身体的全局轨迹。WHAM 将其与考虑接触的轨迹精修方法结合,使其能够捕捉如上下楼梯等多种条件下的人体运动。WHAM 在多个真实环境基准上,超越了现有所有3D人体运动重建方法。代码可用于研究目的。
看起来精度也相当不错。这类技术的革新速度真是快……。代码也已经公开,并且还能在 GoogleColab 上试用。实际尝试的人也已经零星出现了。
从视频中提取运动相关的服务已经陆续出现,但像这样把新技术放到手边实际运行并验证,也很不错。
顺带一提,Blender 插件 CEB 4D Humans 也已经第一时间发布了支持这项 WHAM 技术的更新。
CEB 4D Humans 1.0 Beta – 由 CEB Studios 提供的可导入「4D Humans」的 Blender 插件在最新更新中也支持了「WHAM」技术!
请务必看看!
链接
WHAM
Github
WHAM.ipynb – Colaboratory