Meta AI发布了可从文本提示生成视频的技术“Make-A-Video”。
Make-A-Video
We’re pleased to introduce Make-A-Video, our latest in #GenerativeAI research! With just a few words, this state-of-the-art AI system generates high-quality videos from text prompts.
Have an idea you want to see? Reply w/ your prompt using #MetaAI and we’ll share more results. pic.twitter.com/q8zjiwLBjb
— Meta AI (@MetaAI) September 29, 2022
Make-A-Video的研究基于近年来在文本到图像生成技术方面取得的进展,这些技术旨在实现从文本到视频的生成。该系统使用带有说明文字的图像,学习世界看起来是什么样子,以及通常如何被描述。同时,它还利用无标签视频学习世界的运动。基于这些数据,Make-A-Video只需少量文字或一行文本,就能生成富有奇思妙想、独一无二的视频,激发你的想象力。
官方页面
我们提出了Make-A-Video,这是一种将Text-to-Image(T2I)生成领域近年来的惊人进展直接转换为Text-to-Video(T2V)的方法。我们的直觉很简单:通过文本和图像配对数据,学习世界看起来是什么样子,以及如何被描述;
这样,Make-A-Video就能从文本与图像配对中学习世界的样子及其描述,并从无监督视频片段中学习世界的运动。Make-A-Video具有
(1)可以加速T2V模型的训练(无需从头学习视觉表征和多模态表征)
(2)能够从无监督视频片段中学习世界的运动,不需要文本和视频的配对数据,
(3)生成的视频继承了当今图像生成模型所具有的广度(美学感的多样性、幻想性的描绘等)
这三大优势。
我们设计了一种简单而有效的方法,用于构建新的、有效的空间-时间模块,以用于T2I模型。首先,将完整的时间U-Net和注意力张量分解,并在空间和时间上进行近似。接着,通过视频解码器、插值模型以及两个超分辨率模型,设计出一个空间时间管线,可生成高分辨率和高帧率的视频,从而实现除T2V之外的各种应用。在空间和时间分辨率、文本一致性、质量等所有方面,Make-A-Video无论在定性还是定量上,都可谓在文本到视频生成领域树立了新的最先进水平。论文
这又来了一个很厉害的东西。“Make-A-Video”目前仅公开了论文。
如果你想关注后续动向,请务必查看网站。