21CTO导读:当地时间9月1号,“AI教母”李飞飞旗下World Labs发布新一代世界模型Atlas。
由著名AI科学家、“AI教母”——李飞飞创办的World Labs在9月1号正式发布了新一代世界模型Atlas,这是一款从零开始预训练的「多模态模型」,可原生处理文字、图像、视频与3D四种形态。
World Labs表示,Atlas将驱动未来版本的Marble及其他产品,标志着空间智能技术迈入新阶段。
关于World Labs
World Labs是由李飞飞、Justin Johnson、Christoph Lassner与Ben Mildenhall于2024年共同创立,
其定位为空间智能公司,专注于打造前沿世界模型,以让AI能够感知、生成、推理并与3D世界互动。
今年2月份,该公司完成10亿美元新一轮融资,估值约50亿美元。
Atlas的能力
Atlas具备四大核心能力,分别为相机控制生成、空间重建、时空模拟与图像生成。
其中,相机控制生成指的是用户可像导演一样直接指定镜头位置与角度,Atlas便能根据1到6张参考图像,生成最长1分钟、1440p解析度的视频影片,画面不仅与原始图像一致,还能补足照片中看不到的区域。
在空间重建上,Atlas可处理1张到数十张,甚至超过100张的输入图像。输入的照片越多,模型掌握的信息就越完整,重建结果也越接近真实场景;反之,若仅输入2至3张照片,Atlas则会运用其丰富的世界知识,「脑补」出未拍摄到的部分,适合快速生成与概念设计。
第三项能力是时空模拟。Atlas能同时理解空间结构与时间变化。例如传统拍摄「子弹时间」效果需要在场景周围架设数十台专业摄影机同步拍摄,成本极高;Atlas仅需3到5台普通手机从不同角度拍摄同一场景,便能重建出完整的3D空间,让用户自由定格时间、从任意角度重新观看画面。
Atlas亦可根据文字提示生成高品质图片与360°全景图,能处理复杂指令、精准呈现文字,支持多种视觉风格,从写实到插画皆可胜任。
核心设计与架构
Atlas核心架构是「multimodal autoregressive diffusion transformer」——这个术语拆开来看,autoregressive 意味着它像 LLM 一样逐个 token 生成,diffusion 意味着这些 token 通过扩散模型解码为像素。
它被设计为空间脉络(Spatial Context),所有输入的内容,不管是文字、图像、影片或是3D,都会被整合到一个共享的3D空间,每张图像和深度图都被锚定在3D空间中的具体位置。
Atlas根据此一脉络生成后续内容,在3D空间中与已见信息保持连贯一致,并能推想视野之外的景象。
基准测试数据
官方给出自己的 benchmark 数字很让人兴奋。
在人类评分偏好测试中,Atlas 对主流模型全面领先:Flux 3 93% 的人选 Atlas,Seedance 2.5 是 94%,Gemini Omni Flash 是 81%。3D 重建的绝对相对误差 8.6,低于 Pi3X(11.1)和 VGGT-Ω 1B(9.7)。
第三方人类评审盲测显示,Atlas于相机控制生成任务上对各主流模型的胜率均超过七成五,最高达94%。在3D重建任务上,Atlas于多个标准基准测试中的平均误差仅8.6×10⁻³,优于多款专门为3D重建训练的开源模型,展现出通用模型的强大实力。
结语
World Labs 联合创始人 Justin Johnson 对这款「世界模型」做了一番解释。他将此类系统分成三级:渲染器、模拟器、规划器。Atlas 目前「介于渲染器和模拟器之间」——能够生成高质量 3D 视图,但还不能模拟物理交互。
这个定位很坦诚,和那些经常说「AGI 已经来了」公司的叙事风格完全不同。
World Labs的首款商用产品Marble于2025年11月推出。最新的Atlas 目前还没有全面开放,只向少数合作伙伴提供 Early Access。
作者:场长
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。