Insider Insider
3dnchu 尚无浏览 2 分钟阅读

SMPLer-X:扩展富有表现力的人体姿态和形状估计 – 实现比以往更高质量的结果!从单目摄像头视频中检测人物姿态的技术!NeurIPS 2023!

由南洋理工大学 S-Lab、SenseTime Research、上海 AI 研究所、东京大学、国际数字经济学院(IDEA)的研究人员开发的,从单目摄像头视频中检测人物动作的技术『SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation』的代码已公开。NeurIPS 2023 论文

SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation

富有表现力的人体姿态和形状估计(Scaling Up Expressive Human Pose and Shape Estimation:EHPS)将身体、手部、面部的动作捕捉整合在一起,具有许多应用前景。尽管取得了令人鼓舞的进展,当前最先进的方法仍然在很大程度上依赖于有限的训练数据集。本研究调查了 EHPS 的规模化,并以 ViT-Huge 为骨干网络,利用来自多样化数据源的最多 4.5M 个实例进行训练,迈向首个通用基础模型(命名为 SMPLer-X)。借助大数据和大规模模型,SMPLer-X 在多种测试基准上表现出高性能,并在未知环境中展现出出色的可迁移性。

1) 关于数据规模化,对 32 个 EHPS 数据集进行了系统性调查,覆盖了单一数据集训练模型无法处理的广泛场景。更重要的是,利用广泛基准测试过程中获得的见解,优化训练方案,并通过选择能够大幅提升 EHPS 能力的数据集来实现性能飞跃。

2) 关于模型规模化,利用视觉变换器研究 EHPS 中模型规模的缩放规律。此外,通过我们的微调策略,将 SMPLer-X 转变为专用模型,从而实现进一步的性能提升。特别是,我们的基础模型 SMPLer-X 在 AGORA(107.2mm NMVE)、UBody(57.4mm PVE)、EgoBody(63.6mm PVE)、EHF(62.3mm PVE,未进行微调)等 7 个基准上,始终取得最先进的结果。

这类技术真是层出不穷呢。今后品质也会不断提升吧。
[SMPLer-X] 目前已在 Github 上公开代码。有兴趣的话请去看看!

链接

SMPLer-X

Screenshot of caizhongang.github.io