OpenAI发布了新的文本转视频AI模型『Sora』。
OpenAI Sora
从文本生成视频
Sora是一种AI模型,可以根据文本指令创建真实且富有想象力的场景。Sora是扩散模型,从类似静止噪声的视频开始生成,并在多个阶段中逐步去噪转换。
Sora既可以一次性生成整个视频,也可以延长已生成的视频使其更长。通过一次向模型提供大量帧的预判,解决了即使主体短暂离开视野后也能保持不变这一棘手问题。
与GPT模型一样,Sora使用Transformer架构,并展现出优秀的扩展性能。
Sora将视频和图像表示为称为patch的小型数据单元集合,每个patch就像GPT中的token一样。通过统一数据的表示方式,可以让扩散Transformer在比以往更广泛的视觉数据上进行训练,涵盖不同时间、分辨率和宽高比。
Sora基于DALL-E和GPT模型的过往研究。此外,它采用了DALL-E 3中采用的recaption技术(为视觉训练数据生成非常详细的说明性标题的技术)。因此,该模型能够更忠实地遵循生成视频中的用户文本指令。
此外,除了仅根据文本指令生成视频外,它还可以从现有静止图像生成视频,能够将图像内容的细节准确地动画化。它还可以扩展现有视频,或补全缺失的帧。详情请参阅技术报告。
Sora是能够理解并模拟现实世界的模型基础,我们认为它将成为实现AGI的重要里程碑。
Introducing Sora, our text-to-video model.
Sora can create videos of up to 60 seconds featuring highly detailed scenes, complex camera motion, and multiple characters with vibrant emotions. https://t.co/7j2JN27M3W
Prompt: “Beautiful, snowy… pic.twitter.com/ruTEWn87vf
— OpenAI (@OpenAI) February 15, 2024
感觉视频生成也已经超过了一定的质量门槛。进化速度真快啊。
目前看来应该只是发布而已?很期待今后会如何发展。
话说AI相关技术正不断逼近实用水平……从2D图像、视频一路发展,接下来会是3D吗……
链接
Sora