Google Research推出了可从文本提示生成视频的技术“Imagen Video”!
Imagen Video
很高兴宣布 Imagen Video,我们新的文本条件视频扩散模型,可生成 1280×768 24fps HD 视频! #ImagenVideohttps://t.co/JWj3L7MpBU
与 @wchan212 @Chitwan_Saharia @jaywhang_ @RuiqiGao @agritsenko @dpkingma @poolio @mo_norouzi @fleet_dj @TimSalimans pic.twitter.com/eN81LqZW7I— Jonathan Ho (@hojonathanho) October 5, 2022
我们宣布 Imagen Video,这是一个基于视频扩散模型级联的文本条件视频生成系统。
给定文本提示,Imagen Video 通过基础视频生成模型以及一系列交错的空间和时间视频超分辨率模型生成高分辨率视频。
我们说明了如何将系统扩展为高分辨率文本到视频模型,包括在特定分辨率下选择完全卷积的时间和空间超分辨率模型、扩散模型的 v 参数化选择等设计决策。
此外,我们回顾了先前关于基于扩散的图像生成研究的见解,并将其迁移到视频生成设置中。
最后,为了实现快速且高质量的采样,我们将渐进式蒸馏应用于视频模型,并结合无分类器引导。
我们发现,Imagen Video 不仅能够生成高保真视频,还具有高度可控性和世界知识。
它还具备理解 3D 对象,以及生成各种艺术风格的多样化视频和文本动画的能力。
样本请查看 imagen.research.google/video。
如果只是稍微做一些素材合成,现在似乎已经可以不用亲自动手就能制作素材了。
目前可以查看样本视频和论文 PDF。真是一个了不起的时代……。
链接
顺带一提,文本生成图像的“Imagen”技术也已经公开。