由中国清华大学发布的、可从文本生成3D模型和NeRF的技术『ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation』已公开。
ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation

通过蒸馏预训练的大规模文本-图像扩散模型,评分蒸馏采样(SDS)在文本-3D生成中备受期待,但也存在过饱和、过平滑、低多样性等问题。本研究提出将3D参数建模为随机变量,而不是像SDS那样的常数,并提出一种用于解释和处理文本-3D生成中上述问题的、基于粒子的原理性变分框架——变分评分蒸馏(VSD)。SDS是VSD的一个特例,并且我们表明,无论CFG权重过小还是过大,都会产生较差的样本。相比之下,VSD作为扩散模型的祖先采样,在各种CFG权重下都能良好工作,并在通用CFG权重(即7.5)下同时提升多样性和样本质量。此外,我们还提出了文本到3D设计空间中的多项改进,例如蒸馏时间表和密度初始化。这些与蒸馏算法正交,但尚未得到充分研究。在我们命名为ProlificDreamer的方法中,可以生成具有高渲染分辨率(512×512)以及丰富结构和复杂效果(例如烟雾或滴落)的高保真NeRF。此外,从NeRF初始化并通过VSD微调的网格,呈现出精细且照片级真实的效果。
已经没什么好惊讶的了!这类技术大概会一路发展到极限吧!
关于详细信息和论文,请查看项目页面!
链接
ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation