Insider Insider
3dnchu 尚无浏览 2 分钟阅读

MimicMotion:基于置信感知姿态引导的高质量人体运动视频生成——让一张人物参考图动起来的技术!相比以往技术更稳定的新框架登场!还有 ComfyUI 版!

Tencent 和上海交通大学的研究者推出了让一张人物参考图动起来的技术「MimicMotion:基于置信感知姿态引导的高质量人体运动视频生成」。据称可获得比以往技术更稳定的结果。

MimicMotion:基于置信感知姿态引导的高质量人体运动视频生成

近年来,生成式人工智能在图像生成领域取得了重大进展,并催生了各种应用。然而,视频生成在可控性、视频长度、细节丰富度等多个方面仍然面临巨大挑战,阻碍了该技术的应用与普及。本研究提出了一个名为 MimicMotion 的可控视频生成框架。与传统方法相比,我们的方法具有以下几个特点。第一,通过置信感知姿态引导,可以实现时间上的平滑性,从而借助大规模训练数据提升模型的鲁棒性。第二,基于姿态置信度的区域损失增幅,可以显著缓解图像失真。最后,为了生成更长且平滑的视频,我们提出了渐进式潜在融合策略。借此可以在可接受的资源消耗下生成任意长度的视频。广泛的实验和用户研究表明,MimicMotion 在多个方面都较传统方法有显著提升。

MimicMotion 集成了图像到视频扩散模型与新的置信感知姿态引导。该模型可学习的组件由时空 U-Net 和用于引入姿态序列作为条件的 PoseNet 组成。置信感知姿态引导的主要特点如下:1)姿态序列附加关键点置信度分数,模型可根据分数自适应调整姿态引导的影响力。2)高置信度区域在损失函数中赋予更大权重,以增强其在训练中的影响。

只需一张图片就能轻松让其动起来的技术此前也出现过很多,但现在已经相当稳定了。到了这个水平,似乎会有很多用武之地。
「MimicMotion」的代码也已公开,并且还提供了面向 ComfyUI 的版本,应该可以很方便地导入使用。请务必去看看!

链接

MimicMotion

Github

ComfyUI

arxiv

Screenshot of tencent.github.io

Screenshot of github.com

Screenshot of github.com

Screenshot of arxiv.org