由 Google Research 团队等提出,使用文本到图像的扩散模型,通过构建 NeRF(Neural Radiance Field),无需 3D 数据即可生成 3D 形状的技术「DreamFusion」已经登场。
2022年10月7日 – 添加日语解说视频
DreamFusion
很高兴宣布 DreamFusion,我们用于 Text-to-3D 的新方法!https://t.co/4xI2VHcoQW
我们使用预训练的文本到图像扩散模型,从零开始优化一个 NeRF。不需要 3D 数据!
与以下出色团队联合完成 @BenMildenhall @ajayj_ @jon_barron#dreamfusion pic.twitter.com/YeG0zaFxuu
— Ben Poole (@poolio) September 29, 2022
近年来,在文本到图像的合成方面,基于数十亿图像与文本对训练的扩散模型取得了飞跃性进展。要将这种方法应用于 3D 合成,需要大规模标注 3D 资源数据集以及用于 3D 数据去噪的高效架构,但这两者目前都不存在。本研究为回避这些限制,使用预训练的二维文本到图像扩散模型来执行文本到三维合成。本研究引入了基于概率密度蒸馏的损失,使得可将二维扩散模型作为参数化图像生成器优化的预训练模型使用。利用该损失,通过梯度下降优化随机初始化的三维模型(Neural Radiance Field: NeRF),使得从随机角度渲染出的二维图像损失降低。其结果是,可以从任意角度查看给定文本的 3D 模型,使用任意光照进行照明,并合成到任意 3D 环境中。本方法无需 3D 学习数据,也无需修改图像扩散模型,展示了预训练图像扩散模型的有效性。
给定字幕后,DreamFusion 使用名为 Imagen 的文本到图像生成模型来优化 3D 场景。我们提出 Score Distillation Sampling (SDS),这是一种通过最小化损失函数从扩散模型生成样本的方法。只要能够以可微方式映射回图像,SDS 就可以在任意参数空间中优化样本,例如 3D 空间。为了定义这种可微映射,我们使用类似 Neural Radiance Fields(NeRF)的 3D 场景参数化。SDS 单独使用时也能生成合理的场景外观,但 DreamFusion 额外加入了正则化与优化策略来改善几何结构。其结果是,学习到的 NeRF 具有高质量的法线、表面形状与深度,并且作为一个连贯的整体,可以通过 Lambert 着色模型重新照明。
- 从文本生成 3D
- 生成样本画廊:DreamFusion: Text-to-3D using 2D Diffusion
- 生成物是 NeRF 模型,因此可使用 marching cubes 算法转换为 3D 网格
DreamFusion 日语解说视频
真是进入了一个惊人的时代。如今连简单的东西,甚至可能都不需要建模了。
今后如何活用这类素材,似乎会变得越来越重要。论文已经公开,不过项目可能还未公开?令人期待。请务必查看网站。