前腳友商還在為你追我趕生成幾秒鐘的「電子榨菜
」影片卷到頭禿;後腳李飛飛
創辦的 World Labs
微微一笑,把桌子掀了——
」影片卷到頭禿;後腳李飛飛
創辦的 World Labs
微微一笑,把桌子掀了——就在剛剛,全球首個多模態世界模型
Atlas
正式登場!
Atlas
正式登場!
官方部落格🔗 https://www.worldlabs.ai/blog/atlas
按照官方定義,Atlas 是一款面向空間智能
的 omni world model,從零開始完成預訓練,可以原生處理文本、圖像、影片、相機位姿與 3D 深度資訊,並在同一套模型中完成世界生成、空間重建
和時空模擬。
的 omni world model,從零開始完成預訓練,可以原生處理文本、圖像、影片、相機位姿與 3D 深度資訊,並在同一套模型中完成世界生成、空間重建
和時空模擬。
先來看最直觀的炸場操作:
Camera Controlled Generation(相機控制生成
)。
)。以前大家玩影片生成模型,多少有點玄學抽獎。我們在 Prompt 框裡卑微敲下:「鏡頭緩慢向左拉升、繞著人物微仰角旋轉」,回車之後全憑老天保佑。

對比之下,Atlas 的做法是:直接把「相機位姿參數」當作底層原生輸入。
你要什麼角度、什麼軌跡、走多快?
直接給坐標!
只要丟進去 1 到 6 張普通照片,定好運鏡軌跡,Atlas 就能生成最長達 1 分鐘、1440p 解析度 的大片。
畫面不崩,空間幾何絲滑一致,堪稱外掛級運鏡。

更誇張的是它的空間「腦補力」。
輸入一張只拍到機器人正面的照片?Atlas 能把人家背影完完整整腦補出來;

給一張泳池邊角照?它靠著腦子裡的「世界常識」,默默幫你把隔壁沒拍到的草坪和遠山給修好了。

從官方放出的 Demo 來看,Atlas 在鏡頭運動和空間一致性上確實比普通影片生成模型更進一大步。
不過,鏡頭一旦進入原圖沒有拍到的區域,Atlas 實際上仍然需要依賴模型先驗去猜,視角跨度越大、生成路徑越長,局部幾何漂移、物體形狀變化和紋理閃爍也越容易暴露出來。
換句話說,它生成的更像是一個視覺上合理的三維世界,未必就是原來那個世界的精確數字復刻。
而種種操作的背後,也繞不開一個名為 Spatial Context(空間上下文
)的行業術語。
)的行業術語。大語言模型看上文接下文,Atlas 則是給每張圖片綁死三維坐標和深度,在腦子裡搭出一個帶軸網的房間。
說得更直白一點,Atlas 很多能力的底層,其實都繞不開多視角合成
。
。
它會把來自不同角度、不同機位的圖片和影片,一起塞進同一個三維空間裡,先判斷它們彼此之間的相對位置,再補足沒拍到的區域,繼續生成新的視角。
單張圖輸入時,它更多依賴模型先驗去「腦補」世界;輸入視角一旦變多,它就更像是在做一次帶空間約束的多視角融合,把零散畫面慢慢拼成一個連續、可漫遊的三維場景。
甚至你隨便抓兩張八竿子打不著的照片往空間裡一扔,Atlas 都能強行給你腦補出走廊、大門和房間,把倆場景無縫焊在一起。
導演系同學看到這裡,戰術沉默,緩緩打出一個問號:合著以後運鏡不用實拍,直接在電腦里「雲開機」就完事了?
除此之外,Atlas 還有第二張王牌:Spatial Reconstruction(空間重建)。
傳統的 3D 高斯潑濺(3D GS)或者點雲掃描,得扛著專業設備圍著目標轉幾十圈,拍幾百上千張照片,費錢又費腿。

但 Atlas 再次露出神秘的微笑:一邊去,哪來這麼多的規矩。

官方直接甩出了一個斯坦福大學 Main Quad 案例,只需把 2 到 25 張遊客視角的地面平拍照片塞進去,就能輕鬆還原草坪、拱廊以及紀念教堂外牆的全部細節。

鏡頭隨後直接拔地而起,來了一段上帝視角航拍的漫遊。
在 DTU、ETH3D、ScanNet 等一堆公開數據集上,專門測稀疏視角重建誤差(AbsRel ×10⁻³):Atlas 拿下了 25.3 的分數(分數越低越好)。
對比之下,Pi3X 是 28.7,Depth Anything 3 飆到 39.3,MapAnything 更是高達 47.7。

而且輸出直接對接點雲和 3D Gaussian Splatting,能無縫接進 World Labs 自家的 Marble 平台,高幀率即時渲染。
更絕的還有「子彈時間」式的 Reframing Video。
不用好萊塢幾百台相機的環形陣列,研究員拿三五個普通手機、運動相機隨手一架,塞進背包帶走;

拍一段日常打鬧,Atlas 就能在虛擬空間裡隨意切換視角,原地復刻《駭客任務》。

當然,李飛飛和她旗下的公司 World Labs 折騰這一大出,終極目標肯定不是為了跟好萊塢搶特效飯碗。她的星辰大海,是這代 AI 最大的痛點:
具身智能與機器人。
現在搞機器人訓練的朋友都知道,具身智能的最大痛點其實就是「虛擬訓練場不夠用」。
讓機器人真的去工廠、倉庫和家庭里反覆試錯,數據採集速度慢,成本也高;換到仿真環境裡訓練,又得先花大量人力搭建 3D 場景、材質、光照和物體。
業內甚至有一種估算,如果完全依靠傳統方式收集足夠規模的機器人訓練數據,最終成本可能達到 100 萬億美元的量級。
Atlas 給出的 Real to Sim 路線,相當於直接省掉了中間大量人工搭建仿真世界的工作。
拿手機拍兩段 24 幀的工廠或房間影片,餵給模型;Atlas 原地吐出一個高精度的 3D 物理空間,機器人就可以鑽進這個孿生空間裡瘋狂「跑圖」試錯。

甚至機器人走到哪,Atlas 就當場渲染出機載攝影機應該看到的 RGB 圖和深度圖。
機械臂碰一下剛性箱子、拉一下鉸鏈櫃門、捏一下軟體海綿,Atlas 統統能模擬出受力反饋。

只要錄一段真實現場,就能衍生出千萬種光照、擺放和障礙物條件。
技術底座上,World Labs 這次掏出了一套極其硬核的組合拳:
Multimodal Autoregressive Diffusion Transformer,多模態自回歸擴散 Transformer。

拆開來看,它兼采了當前兩大主流範式的長處:
Multimodal:原生融通文本、二維圖像、相機位姿與 3D 深度;
Autoregressive(自回歸):像語言模型預測下一個詞一樣,在時空序列中逐級預測新的空間狀態;
Diffusion(擴散機制):基於 Rectified Flow 逐步去噪,確保連續高維信號的畫質與幾何精度;
Transformer:以最成熟的矩陣乘法結構為底座,無縫適配現有大規模算力集群。
這套架構讓 Atlas 能夠同時享受到 LLM 領域的 KV Cache、分布式推理優化,以及擴散模型的採樣蒸餾與先驗引導。
在針對鏡頭運動控制的真人 Blind Test(盲測)里,戰況簡直是一場單方面的騎臉輸出:
面對 MiniMax H3,Atlas 勝率 75%;面對 Gemini Omni Flash,勝率 81%;面對 FLUX 3,勝率直接衝上 93%;面對 Seedance 2.5,勝率達到兇殘的 94%!

除了世界生成和空間重建,Atlas 還順帶具備了不錯的圖像生成能力。雖然這不是它的主攻方向,但複雜 Prompt、文字渲染,以及寫實、電影感、油畫、漫畫等多種風格,它都能處理。

更有意思的是,Atlas 還能直接根據文字或圖片生成 360° 全景圖。相比普通文生圖只要保證一個固定畫面成立,360° 場景還要處理前後左右的空間連續性,對模型的空間理解要求更高。
值得一提的是,除了性能,World Labs 在 Atlas 身上強調的另一個關鍵詞是 Scaling。
官方部落格提到,隨著參數量和計算力成倍上翻,模型展現出了類似大語言模型那種「突然開竅」的湧現能力。
暴力 Scaling 依然是版本答案。
目前 Atlas 已經向部分合作夥伴開放 Early Access,並將在未來成為 Marble 和 World Labs 其他產品的底層模型。

回過頭看,從二十年前奠基電腦視覺的 ImageNet,到斯坦福實驗室十年來深耕「視覺+機器人學習」,再到創辦 World Labs,李飛飛本質上是死磕同一條軌道。
ImageNet 解決的是「讓機器在像素中識別世界」,而她越來越關心的,是一個更難的問題:機器看見一張圖之後,究竟有沒有理解背後的三維空間,以及下一秒會發生什麼?
李飛飛曾把今天的大語言模型形容為「黑暗裡的文字高手」,能談論現實,卻缺少真正生活在現實中的經驗。

一個模型可以解釋杯子為什麼會從桌上掉下來,但機器人真要伸手拿杯子,還得知道杯子離桌邊多遠、手從哪個方向過去,以及碰到它以後整個場景會發生什麼變化。
Atlas 所代表的空間智能,某種程度上就是給已經十分發達的語言智能繼續加上一層關於幾何、物理、時間和行動的世界經驗。
LLM 把網際網路裡的知識交給了機器,世界模型接下來爭奪的,則可能是機器從數字世界走向現實世界的那張最真實的入場券。






