来自 Meta Reality Labs、多伦多大学、Vector Institute 和加州大学伯克利分校研究者的「Pippo: High-Resolution Multi-View Humans from a Single Image」是一项能从一张人物照片生成多个角度高分辨率图像的技术!
Pippo: High-Resolution Multi-View Humans from a Single Image

Pippo 是一个 1K 多视角扩散变换器:
- 在无标题的 3B 人类图像上预训练。
- 使用 2.5K 工作室拍摄数据进行训练
- 通过 ControlMLP 进行像素对齐控制
- 通过注意力偏置,在推理时生成 5 倍以上的视角
- 更优的 3D 评估指标 —— 重投影误差
Pippo 是一种能够从随手拍摄的一张照片生成人物 1K 分辨率密集回环视频的生成模型。Pippo 是一个多视角扩散变换器,不需要输入图像的拟合参数化模型或相机参数等附加输入。Pippo 在无标题的 3B 人类图像上进行预训练,并在工作室拍摄的人类数据上进行多视角中间训练和后训练。中间训练中,为了快速吸收工作室数据集,以低分辨率去噪多个(最多 48 个)视角,并使用浅层 MLP 对目标相机进行粗略编码。后训练中,以更高分辨率对较少视角进行去噪,并使用像素对齐控制(如 Spatial anchor 和 Plucker rays 等)实现 3D 一致生成。推理时,提出一种注意力偏置技术,使 Pippo 能够同时生成比训练中见过的视角多 5 倍以上的视角。最后,引入一种改进的指标来评估多视角生成的 3D 一致性,并表明 Pippo 在单张图像多视角人体生成方面超越了现有研究。
哇,真厉害……看起来是很有很多应用前景的技术。
详情请查看项目页面和 Github!
链接
项目页面
Github