2026 年 9 月 1 日,李飞飞联合创立的 World Labs 发布了世界模型 Atlas。以往的视频模型只能预测下一帧的平面像素。Atlas 是一个原生的多模态自回归扩散 Transformer。系统打破时序预测限制,将多模态信息统一到了一个共享的空间上下文中。
图:Atlas 发布页主视觉。(来源:World Labs 官方)
单图长出三维世界:空间位置改写预测逻辑
把空间位置变成生成的第一等条件,是架构的核心突破。官方早期演示中,用户仅需输入一张玩具机器人的正面图像。Atlas 并非在 2D 平面上猜测边缘,而是直接给图像分配了一个 3D 坐标。这就形成了一种带有物理锚点的空间上下文(spatial context)。
有了坐标约束,模型直接生成了机器人的背面视角,并推断出玩具旁边应该有一片草地。单张图像从此不再是一段死板的像素阵列,而是一颗能长出完整三维世界的种子。以往生成模型在镜头翻转时容易结构崩塌。在有 3D 锚点的架构里,这变成了一道简单的坐标系换算题。
重建误差降至 8.6,通用模型跨界压倒专用方案
在传统评测中,通用模型在细分场景通常不及垂直调优的专用系统。Atlas 扭转了这个局面。根据官方公布的三维重建基准数据,Atlas 的绝对相对误差(AbsRel)平均得分达到了 8.6。
对比之下,1BD 模型的误差为 9.7,Pi3X 为 11.1,Depth Anything 3 则是 11.9。一个未做后处理优化的通用架构,在主流评测中压倒了顶尖的专用开源项目。
| 数据集 | Atlas | Pi3X | VGGT-Ω | 1BD | Depth Anything 3 | MapAnything |
|---|---|---|---|---|---|---|
| DTU | 8.6 | 11.1 | 16.2 | 9.7 | 11.9 | 18.2 |
| ETH3D | 60.0 | 60.2 | 74.8 | 101.4 | 93.3 | 115.3 |
| KITTI | 6.5 | 13.3 | 17.5 | 10.5 | 11.3 | 20.2 |
| NRGBD | 37.8 | 39.3 | 44.4 | 45.2 | 50.8 | 47.4 |
| 7-Scenes | 42.4 | 42.4 | 47.0 | 40.2 | 55.1 | 60.8 |
| T&T | 12.4 | 15.7 | 17.4 | 36.6 | 29.0 | 37.0 |
| ScanNet | 8.6 | 11.1 | 16.2 | 9.7 | 11.9 | 18.2 |
| 平均 | 8.6 | 11.1 | 16.2 | 9.7 | 11.9 | 18.2 |
表格数据揭示了工程层面的红利。系统原生理解了三维几何特征,工业界不再需要昂贵的激光雷达或密集多目相机。给它 1 到几十张零散图片,系统就能在输出新视角画面的同时生成显式三维结构。自动驾驶的数据建模成本即将大幅下降。
输入层接管 1440p 相机几何控制,摒弃自然语言试错
在相机控制任务上,Atlas 表现出了具体的工程可用性。用户可以提供 1 到 6 张参考图片,并手动输入一条三维相机轨迹。系统会严格跟随路径,直接渲染出最高 1440p 分辨率、长达 1 分钟的连贯视频。
图:官方演示「单图输入、任意视角生成」示例帧。(来源:World Labs Atlas 博客)
官方发布了中世纪村庄(medieval-village)演示场景。少量的村庄图像叠加上一段运镜轨迹,模型重构出了一个没有视觉断层的小世界。相机的几何参数被升格为原生基础输入类型,直接替代了那些需要反复碰运气的语言指令。
图:单张输入图生长出的洞窟庭院世界,画面左上角显示「Convert to Gaussians」,系统直接输出可漫游的 3D 高斯场景。(来源:World Labs Atlas 官方演示视频)
图:哥特式地下书房场景的漫游视角,悬挑石床下是瀑布深渊,左侧为输入图像、右侧为转换后的 3D 世界。(来源:World Labs Atlas 官方演示视频)
图:编辑器视角下的奇幻夜景小屋,蓝色曲线即手动指定的相机漫游路径,画面带网格线与高斯渲染噪点。(来源:World Labs Atlas 官方演示视频)
过去开发视频生成流,工程师需要微调提示词来控制镜头,耗费大量算力资源。现在用户只要把两张毫无关联的照片放在 3D 坐标系两端,模型就会依据坐标约束自动生成过渡门廊。模型在空间维度完成了画面的插值过渡,把控制权从预测黑盒交还给了数据输入。
时空模拟支持机器人仿真测试场
李飞飞团队在 World Labs 成立初期收购了 SceniX。此次 Atlas 在时空模拟上的表现证实了其产品意图。模型能够联合建模空间与时间维度。接收现实视频后,系统在对画面进行重新构图的同时保留了真实的物理交互逻辑。
系统能通过简单文本或图像构建高保真孪生环境。机器人的动作规划因此获得了一个低成本沙盒。官方演示展示了「稀疏真实数据采集」流程:消费级手机、平板和运动相机架在标定板旁,仅凭两三台普通设备就能完成多视角采集。未来的自动驾驶系统不需要全部在真实世界里试错,虚拟空间中由单图扩展出的街景足以成为强化学习的训练土壤。
图:官方机器人仿真演示帧——稀疏多视角采集真实场景后,Atlas 在重建的仿真环境中复现操作任务。(来源:World Labs Atlas 官方演示视频)
开发团队确认了尺度定律在该架构下的有效性。增加预训练算力投入时,模型的生成表现呈现出持续上升趋势。扩大算力规模,系统的空间理解深度就能继续提升,这给产品的商用落地划定了清晰的算力投资预期。
空间智能告别不可量化的演示期
近两年的生成式工具充斥着华丽的演示视频。但它们大多难以作为严肃的基础设施投入生产。核心障碍在于其画面缺乏物理层面的空间一致性。Atlas 用一套共享空间上下文机制在底层修复了这个缺陷。
系统在权威重建榜单上交出了超越专用架构的数据,能够把真实图片和坐标结合生成连贯世界。技术叙事的重心已经发生转移,模型直接在推演物理世界的几何运行规律。在这个节点上,空间智能越过了定性体验的边界,成为了一套工程层面可评估的确定性基础设施。
参考链接:
- World Labs 官方博客
- Marble 产品页
- Hacker News 社区讨论