李飞飞发布全球首个多模态世界模型Atlas:几张照片生成1分钟大片,像素级控制“子弹时间”

9.2 WorldLabs称,Atlas是一个多模态自回归扩散Transformer,从零开始预训练,原生处理文本图像视频相机位姿与3D深度信息,并在同一模型中完成世界生成重建和时空模拟

“AI教母”李飞飞创办的World Labs今日发布全球首个多模态世界模型Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在3D空间中重建。

360截图20260902135900

Atlas的核心突破在于将“相机位姿参数”作为原生输入。过去用AI生成视频,运镜只能通过文字描述“镜头缓慢左移”让模型“猜”,结果不可控。Atlas则可以直接输入坐标,指定任意摄像机位置和角度。用户只需提供1到6张普通照片并设定运镜轨迹,Atlas就能生成最长1分钟、1440p分辨率的连贯视频,画面空间几何保持一致。

World Labs称,Atlas是一个多模态自回归扩散Transformer,从零开始预训练,原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一模型中完成世界生成、重建和时空模拟。

该模型具备四大核心能力:相机控制生成——以像素级精度从单张或多张图像生成最长1分钟的1440p视频;空间重建——基于1至25张输入图像重建真实场景,输出新视角图像帧或点云、3D高斯泼溅等显式三维结果,在DTU、ETH3D等公开数据集上取得最优成绩(AbsRel误差25.3×10⁻³),优于专门训练的3D重建模型;时空模拟——从输入视频中建模空间与时间,可重新构图视频增强视觉效果,也可为机器人提供Real-to-Sim仿真环境。仅需24帧手机拍摄画面即可重建大型环境,并生成机器人视角的RGB和深度数据,用于导航和操作训练。

评测数据显示,Atlas在相机控制生成任务上,对人类评审的胜率分别为:对比MiniMax H3达75%,对比Gemini Omni Flash达81%,对比阿里HappyHorse 1.1达86%,对比FLUX 3达93%,对比字节Seedance 2.5达94%。

如果说传统视频生成模型是“提示词抽卡”,Atlas就是“导演椅上的取景器”。它不跟其他人比“谁生成的画面更炫”,而是提供了一个完全不同维度的能力——把相机控制权还给创作者,让AI根据精确的几何指令生成世界。当大模型开始理解空间而不只是文字时,“世界模型”这个被讨论了多年的概念,才第一次有了看得见摸得着的产品形态。

https://www.worldlabs.ai/blog/atlas