由CSM(Common Sense Machines)推出,可通过图像、行为、文本控制的神经仿真引擎「CommonSim-1」登场!
CommonSim-1
在生成式AI中,需要将多样的人类经验和文化压缩进大规模模型中。事实上,最近的大规模生成模型(Dall-E 2、StableDiffusion、Imagen、Make-A-Scene等)已经取得了从零开始创造全新图像的惊人成果。在这样的趋势下,AI系统自然会进一步进化,创建一种新类别的模拟器,让它们学会生成3D模型、长周期视频以及高效动作。由于神经渲染、扩散模型以及注意力架构的最新进步,这些技术正变得可行。
Common Sense Machines构建了名为CommonSim-1的神经仿真引擎。用户和机器人不再需要花费数周时间创建内容或操作复杂工具,而是通过图像、动作和文本与CommonSim-1交互。借助这些接口,只需拍照或用文本描述场景,就能创建现实世界的数字复制品,或想象新的世界。今天我们正在预览这些模型功能。我们非常期待开发者、创作者、研究人员以及其他人会创造出什么样的作品。
- CommonSim-1:从经验中成长并适应的模拟器:新的仿真引擎需要新的界面。不是使用专用工具,而是通过图像、语言和动作来操作。提供让任何人都能访问模型的移动端和网页界面,以及工具插件和REST API

- 视频生成:仅凭1帧图像和一系列动作(摄像机或身体动作)即可生成高分辨率视频(512×512)
如果有合适的数据,可训练同一架构以解决跨多种实施形态(摄像机、机器人、汽车等)的任务。
- 3D内容生成:上传物体视频并在云端处理。
可轻松导出为通用3D文件格式(obj, usdz, blend, glTF等)或Neural Radiance Fields(NeRF)
- 可将这些3D资产导入现有3D引擎中进行场景合成和渲染。通过混合渲染器(当前支持Blender,未来将支持更多),可将NeRF与传统3D资产进行合成
神经语言是描述图像中状况的强大手段。例如,如果你有一个椅子的3D模型,并试图在全新的环境中渲染它,想获得令人满意的结果通常需要数天到数周。文本到图像模型可以自动化这一过程。使用CommonSim-1生成的网格或NeRF,只要在文本提示中输入自然语言描述,就可以无限生成新的混合场景。
这些内容生成机制具备足够的精度和灵活性,可用于创建自动标注的合成数据,并训练感知系统。
这里介绍了一个用于检测、分割和6自由度姿态跟踪的端到端视觉系统示例。该系统是在完全没有使用人类注释数据或人类创建模型的情况下训练的。我们已在食品杂货店、仓库、工厂、实验室、医疗场所等对象上测试了这些系统。
3DCG制作的根本似乎要改变了……
目前可以注册应用程序、API、检查点和代码的抢先体验。感兴趣的话请务必查看。
链接
Generating 3D Worlds with CommonSim-1 – CSM
We have built CommonSim-1, a neural simulation engine controlled by images, actions and text. This is a new era in generative AI where simulators will grow and adapt with experience. Read on for more and sign up for early access to apps/API/open-source: https://t.co/txuM002cLc pic.twitter.com/FU07NvXrPd
— Common Sense Machines (@CSM_ai) October 17, 2022