宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

中國科學院自動化研究所研究團隊教會AI「理解」物理世界的秘密——PhiZero如何用一套「物理語言」讓機器真正懂得萬物運動規律

2026年08月07日 首頁 » 熱門科技

這項由中國科學院自動化研究所(CASIA)國家模式識別實驗室主導完成的研究,以預印本形式於2026年7月30日發布在arXiv平台,論文編號為arXiv:2607.28624。有興趣深入探究技術細節的讀者,可以通過該編號在arXiv上查閱完整論文,項目主頁地址為Phi-Zero.github.io。

**一、從"看熱鬧"到"看門道"——AI影片模型一直缺少什麼?**

當你把一個玻璃杯推到桌子邊緣,即便閉上眼睛,你的大腦也能"預判"出它會摔碎的聲音、碎片散落的樣子,以及地板上留下的一灘液體。這種對物理世界運作規律的直覺理解,是人類自幼習得的寶貴能力,也是讓人類有別於機器的核心所在。

如今市面上已經有了許多令人嘆為觀止的影片生成模型,它們能把一張靜止的照片變成流動的影像,生成的畫面細膩逼真,乍看之下幾乎與真實錄像無異。然而這些模型有一個根深蒂固的缺陷——它們所掌握的,終究只是"像素層面的視覺規律",而非真正意義上的物理規律。用一個直白的例子來說:這類模型在生成"網球擊中橡皮鴨"的影片時,往往會讓畫面看起來很順滑,但那隻橡皮鴨可能紋絲不動,仿佛什麼都沒發生一樣。模型"知道"畫面應該漂亮,卻不"知道"被撞擊的物體應該飛出去。

正因如此,研究團隊拋出了一個頗具野心的問題:能不能設計一套專門用來描述物理世界變化規律的"語言",讓機器像人類一樣,先在這套語言裡"推理"物理過程,再把推理結果轉化為影片畫面?這個想法,就是PhiZero中國科學院自動化研究所研究團隊教會AI理解物理世界的秘密PhiZero如何用一套物理語言讓機器真正懂(讀作"Phi Zero")這一研究的出發點。

**二、人類的秘訣:先用語言想清楚,再動手做出來**

人類學會物理直覺的方式,和AI訓練的方式有一個本質區別。人類不是通過死記硬背每一次看到的物體運動來積累經驗的,而是從無數次觀察中提煉出抽象規律——"被推的東西會倒"、"水往低處流"、"火焰向上躥"——然後用語言把這些規律組織起來,以便在腦海中靈活推理新的場景。

自然語言是人類整理和表達知識的強大工具。正因如此,大型語言模型在文字世界裡如魚得水,能完成推理、寫作、編程等各種複雜任務。然而當目標從數字世界轉向物理世界時,自然語言就顯得太粗糙了。"球會飛出去"這五個字,根本無法精確描述球飛出的速度、軌跡、旋轉和碰撞後的形變——這些細節對於準確模擬物理過程至關重要。

研究團隊因此提出:既然自然語言太粗、像素太細,能不能在兩者之間找到一個"恰到好處"的中間層次?這個層次既足夠抽象,能捕捉跨越不同場景的通用運動規律,又足夠精細,能承載影片生成所需的物理細節。他們把這個中間層次稱為"物理語言中國科學院自動化研究所研究團隊教會AI理解物理世界的秘密PhiZero如何用一套物理語言讓機器真正懂"(Physical Language)。

**三、什麼是"物理語言"——給世界變化打上專屬標籤**

以配樂打比方,一首曲子的樂譜和樂器演奏錄音是兩種不同層次的東西。樂譜記錄的是抽象的音符和節奏結構,而不是具體的音色和音量細節;錄音則包含了所有可聽到的聲學資訊。如果你想把同一首曲子從鋼琴版改編成弦樂四重奏,只需要根據樂譜重新演奏,而不用"翻譯"整段錄音。物理語言扮演的角色,正類似於這張"樂譜"——它記錄的是物理變化的結構性資訊(這裡發生了一次碰撞、那裡有液體在擴散),而不是具體的視覺像素細節。

更準確地說,物理語言是一套從真實影片中自動學習到的**離散符號序列**。所謂"離散符號",可以理解為一個規模約25000個詞彙的特殊詞典里的詞條,每個詞條代表一種特定類型的世界狀態變化模式。一段4秒鐘的影片,會被壓縮成一串長度為256的符號序列,這串序列就是這段影片中物理變化過程的"摘要"。

這套語言完全由機器從大量無標註影片中自動習得,沒有人事先告訴模型什麼是"碰撞"或"倒塌",所有規律都是模型通過觀看和重建影片內容"悟"出來的。這與人類嬰兒通過反覆觀察身邊世界來建立物理直覺的過程,有著異曲同工之妙。

**四、PhiZero的工作流程:"先想清楚,再畫出來"**

PhiZero整體遵循一個簡潔優雅的兩步走邏輯,研究團隊稱之為"先推理,後渲染"(reason-then-render)。

第一步,給系統看一張當前世界的截圖,再配上一句人類指令(比如"把酒倒進玻璃杯"),系統先在物理語言的符號空間裡進行"推理",輸出一串描述未來變化過程的符號序列——這就好像一位劇本作家先寫好了接下來這場戲的動作說明。第二步,再把這串符號交給一個影片生成器,後者根據符號序列和初始截圖,將抽象的變化描述渲染成栩栩如生的未來影片畫面——這就像導演根據劇本調度演員、完成拍攝。

這種分離設計的好處在於:物理推理和視覺渲染被拆解成兩個獨立的任務,各司其職。物理推理模組只需要關心"事情該怎麼發展",不用操心畫面好不好看;視覺渲染模組只需要關心"如何把變化過程畫得漂亮",不用費力推斷物理規律。兩個模組相互配合,一個負責"想明白",一個負責"畫出來"。

**五、物理語言分詞器——把影片"翻譯"成符號**

PhiZero內部有兩個核心組件,分別承擔不同的職責。第一個組件叫做"物理語言分詞器"(Physical Language Tokenizer),它的任務是把影片翻譯成物理語言符號序列,同時學會如何根據符號序列重建影片。

分詞器的工作方式頗為精巧。給定一段影片,它首先用一個空間-時間編碼器把影片壓縮成一系列緊密相鄰的"狀態快照"。關鍵設計在於,系統不是一下子處理整段影片,而是專注於每兩幀相鄰狀態之間發生了什麼變化——就好像看連環畫時,你的注意力落在每兩幅畫之間那個"發生了什麼"的空檔上,而不是試圖一眼記住整本畫冊。負責提取這種變化資訊的結構叫做"過渡級Q-Former",它會同時看著前後兩幀的特徵,提取出一組代表這段變化的特徵向量。

提取完變化特徵之後,系統會把連續的特徵向量"量化"成離散的符號,就像把音樂中連續變化的音調歸併到有限個固定音符上。這裡使用的量化方法叫做有限標量量化(FSQ),它不需要單獨維護一個碼本,而是通過幾個維度的數值組合直接生成詞彙表,規模約為25000個符號。

在解碼端,系統借用了一個預訓練好的影片擴散模型(基於Wan2.2-5B)作為"畫筆"。這個擴散模型原本就具備很強的生成能力,能根據各種條件畫出逼真的影片畫面。PhiZero把物理語言符號序列作為條件餵給這個擴散模型,再加上第一幀的畫面作為場景參考,讓擴散模型據此重建未來的影片。這樣一來,物理語言符號只需要記錄"發生了什麼",至於場景的顏色、光線、質感等視覺細節,交給擴散模型的生成先驗來填充即可。

為了防止擴散模型在訓練初期偷懶——直接依賴加噪的目標幀來推測答案,而不認真學習物理語言——研究團隊設計了一個"純噪聲熱身"階段。在這個階段里,模型被刻意設置為只能從物理語言和第一幀出發來重建影片,中間幀全部替換為純噪聲,逼迫模型真正依賴物理語言符號來推斷未來變化,而不是走捷徑。

**六、物理語言推理器——教AI用符號"思考"未來**

第二個核心組件是"物理語言推理器"(Physical Language Reasoner)。如果說分詞器負責學會物理語言的"讀寫",那麼推理器的任務就是學會用這門語言"預測未來"。

推理器以一個預訓練好的視覺-語言模型(Qwen3-VL-4B)為基礎,在其原有的文字詞彙表之上,額外添加了25000個代表物理語言符號的特殊詞條。這就像給一個已經精通中英文的人,再教他一門新的"物理速記語",讓他能夠用這門速記語來記錄和推斷物理世界的變化。

推理器的工作方式是自回歸預測——每次生成下一個物理符號時,都參考當前已生成的所有符號、第一幀圖像以及用戶給出的動作意圖描述,像接龍遊戲一樣逐步補全完整的變化描述序列。訓練時,系統先用凍結的分詞器把訓練影片編碼成物理語言序列,再讓推理器學習如何從第一幀和動作描述出發,預測出正確的符號序列。

值得一提的是,訓練時給推理器看的文字描述,被刻意控制為只描述"高層次的動作意圖",比如"把杯子放到桌上",而不是詳細敘述整個變化過程。這是為了防止文字描述直接劇透答案,讓推理器真正學會從初始狀態和意圖出發推斷物理演化,而不是單純學習從文字描述到符號的"翻譯"。

**七、海量數據和循序漸進的訓練——給AI打好"物理童子功"**

為了讓這套系統真正學到有普適性的物理規律,而不是死記硬背特定場景的視覺規律,研究團隊構建了一個規模龐大且經過精心篩選的訓練數據集。

整個數據準備過程分為多個層級。團隊從網際網路上收集了約5萬小時的真實世界影片,經過去重和多輪質量過濾(去除有壓縮瑕疵、水印、畫質過差、鏡頭切換過頻的影片)之後,剩下約1萬小時的乾淨影片用於分詞器的大規模預訓練。在此基礎上,再疊加審美質量、運動幅度和狀態變化可觀測性的篩選,以及約1千小時的模擬仿真影片(來自各類物理仿真數據集),最終形成約500萬段4秒長的影片片段,用於分詞器的精細化微調階段。微調階段所用的仿真數據包括來自物理學研究的合成碰撞影片、流體仿真影片等多種類型,幫助模型學習在真實影片中較為罕見的特定物理現象。對於推理器,則進一步篩選出約100萬段運動豐富、物理交互明顯的影片片段用於專項微調。

訓練過程同樣遵循循序漸進的課程設計:分詞器先在低解析度(256×448)的短影片(1秒)上學習基礎的局部變化規律,再逐步過渡到2秒、4秒的影片,最後提升重建解析度至512×896並進行精細化調整。這種"由淺入深"的訓練策略,讓模型能夠先穩固地掌握短時間內的狀態變化,再嘗試理解更長時間跨度的物理演化。

**八、實驗結果——三類權威榜單上的表現**

研究團隊在多個權威評測基準上對PhiZero進行了系統性驗證,覆蓋了影片生成能力和影片理解能力兩大維度。

在影片生成方面,評測使用了三個專注於物理真實性的基準。Physics-IQ Verified是一個拍攝了66組真實物理實驗(如倒水、碰撞、燃燒等)的評測集,通過比較生成影片和真實影片在關鍵區域變化上的重疊程度來評分。PhiZero在綜合得分(IQ-Score)上達到41.2分,超越了包括Sora 2、Cosmos3-Super等商業模型在內的所有對比方法。PhyGround基準專注於固體力學、流體動力學和光學共13條物理定律的遵從情況,使用專門訓練的物理評判模型評分。PhiZero的物理得分(Physics Score)和綜合得分(Overall)均居所有參與對比方法之首,分別達到3.01和2.97。WorldModelBench從更宏觀的角度評估世界建模能力,涵蓋自動駕駛、機器人操作、人類活動等7個領域。PhiZero在物理一致性(Physics Adherence,4.88分)和總分(8.19分)上同樣排名第一。

在影片理解方面,評測採用了一種有趣的間接驗證方式:給模型看一對影片(一個符合物理規律,一個違背物理規律),讓模型判斷哪個更合理,依據是模型為哪段影片分配了更高的物理語言序列生成概率。IntPhys2基準評測直覺物理理解能力(如物體永久性、時空連續性等),PhiZero的總體準確率達到56.34%,超越GPT-4o、Gemini等大型多模態模型。LikePhys基準評測模型區分有效和無效物理場景的能力,PhiZero的平均錯誤率(41.7%,越低越好)低於Hunyuan-Video等強基線。YoCausal基準評測真實世界影片中的因果理解能力,PhiZero在綜合排名上位列第一。

除了與其他整體系統的比較,研究團隊還專門評測了分詞器本身的壓縮與重建能力。相比之下,Wan2.2 VAE(一個連續的視覺編碼器)在重建質量上最高,但需要44800個連續視覺標記;PhiZero的分詞器只用256個離散的物理語言符號,在所有高度壓縮方案中重建質量最好,在峰值信噪比(PSNR,28.9 dB)、結構相似性(SSIM,0.903)和感知距離(LPIPS,0.087)三項指標上均優於Video-LaVIT和VideoFlexTok等競爭方法。

**九、消融實驗——哪些設計真的有用?**

為了驗證PhiZero各設計選項的有效性,研究團隊進行了一系列對照實驗,逐一"拆掉"某個設計來觀察性能變化。

在分詞器設計上,去掉預訓練擴散解碼器(改用普通確定性解碼器)是影響最大的改動,三項重建指標均出現明顯下滑,證明擴散先驗對於從緊湊符號中恢復高質量視覺細節至關重要。去掉過渡級Q-Former(改用對整段影片全局提取特徵)也導致性能下降,驗證了對相鄰幀變化的局部建模確實更有利於捕捉物理過渡資訊。去掉純噪聲熱身階段同樣帶來一定程度的性能退化,說明這一機制確實有效地阻止了模型在訓練早期形成"走捷徑"的惰性。

在推理器設計上,實驗對比了以下幾種設定:直接用基礎模型Wan2.2-5B生成影片(得分21.2)、在此基礎上加入精心設計的文字提示來引導生成(得分26.6),以及PhiZero不使用仿真數據(得分37.7)、不使用兩階段訓練(得分39.2)和完整版(得分41.2)。這組數據清楚地表明,僅靠更好的文字描述無法彌補缺少物理語言的根本差距;仿真數據的引入切實提升了模型對物理合理變化的預測能力;而專項微調階段的"精練"訓練則在通用能力的基礎上進一步提升了物理精準度。

**十、物理語言的兩個迷人特性——可遷移性與語義結構**

在做完定量評測之後,研究團隊還深入分析了物理語言本身的兩個值得關注的內在特性。

第一個特性是可遷移性。研究人員做了一個簡潔的實驗:取出一段倒酒影片,用分詞器編碼出它的物理語言序列,然後把第一幀圖像替換成另一個場景(比如改變容器形狀、顏色或背景),再用同一串未改動的物理語言序列來生成新影片。結果表明,新生成的影片忠實保留了倒酒動作的流體擴散軌跡和運動韻律,儘管視覺外觀已經完全不同。這說明物理語言確實成功地把"變化方式"和"看起來像什麼"分開儲存了,運動規律不依附於外觀而存在。

第二個特性是語義結構。研究團隊提取了自動駕駛(nuScenes數據集)和機器人操作(AGI-Bot RealRobot數據集)兩個領域的影片,計算每段影片的物理語言特徵,然後用降維可視化方法觀察這些特徵在空間中的分布。在自動駕駛場景里,靜止不動的影片自然地聚集在一處,而左轉、右轉、直行的影片則沿著連續的弧形流形排列,就像一個方向盤的轉角示意圖。在機器人操作場景里,"向下移動並夾緊"、"向上移動並夾緊"、"向下移動並張開"、"橫掃"四種末端執行器動作分別形成緊密而獨立的簇,說明物理語言把不同的運動類型清晰區分開來了。這種自發湧現出來的語義組織結構,是物理語言真正捕捉到了運動內在規律的有力證據。

**十一、更廣泛的應用——從駕駛仿真到跨身體的動作搬運**

PhiZero的能力並不局限於生成符合物理規律的通用影片,其物理語言接口還為多種實際應用場景打開了可能性。

在可控世界模型方面,研究團隊將PhiZero適配到了自動駕駛(nuScenes)和機器人操作(AGI-Bot RealRobot)兩個領域。對於駕駛場景,系統接收預期的車輛行駛軌跡(以數字文本形式描述的時序坐標),通過推理器預測對應的物理語言序列,再渲染出未來的駕駛影片。系統能夠精細區分不同轉彎幅度和方向的駕駛場景,連"輕微右轉"和"急速右轉"這樣細微的差別也能體現在生成的影片裡。對於機器人操作場景,輸入的是機械臂各關節角度和末端執行器姿態的時序數值,系統同樣能夠準確還原對應的機器人動作影片,機械手抓握和放開物體的動作精度相當高。

在交互式世界模型方面,用戶可以用自然語言指令(如"向右轉動視角")來控制生成影片中的攝像機運動,系統通過滑動窗口的方式逐段生成更長的影片序列,實現連續交互式的場景探索體驗。

在零樣本跨身體動作遷移方面,物理語言可遷移性的潛力體現得最為直接。只需三步:拍攝一段人體運動影片,編碼為物理語言序列;用圖像編輯工具把第一幀里的人替換成目標機器人(宇樹G1人形機器人或Sharpa靈巧手);用相同的物理語言序列重新解碼,就可以得到機器人執行對應動作的影片,而且不需要任何人機配對訓練數據。同樣的思路也適用於仿真到現實的遷移:取出仿真環境裡的機器人操作影片,編碼其物理語言,把第一幀渲染成真實風格的照片,再用原來的物理語言序列重新解碼,就能生成"看起來是在真實廚房裡操作"的影片。

**十二、誠實面對局限性——研究團隊怎麼看自己的工作**

研究團隊在論文結尾坦率地指出了當前工作的幾個明確局限。物理語言目前是從數據中歸納出的經驗性表示,而非對物理定律的顯式符號化,所學符號尚未直接對應到人類可解釋的物理變量(如速度、質量、力)。由於訓練數據來自可影片拍攝的現實場景,對於觸覺交互、微觀粒子運動等在視覺上不可見或高度模糊的物理過程,模型的覆蓋能力自然受限。此外,當前實驗使用的模型規模和數據量,相對於整個物理世界的複雜多樣性而言仍屬有限,但目前取得的較好結果表明這條路徑具備進一步擴展的潛力。

展望未來,研究團隊認為物理語言在以下幾個方向具有延伸價值:作為視覺-語言大模型的中間推理層,改善時空理解能力;藉助從大量人類影片中提煉出的物理語言,以較低成本向機器人具身系統遷移運動技能;通過層級化或循環式預測,將當前固定4秒的生成窗口擴展到更長的時間跨度;以及通過更大的模型、更多的計算資源和更豐富的訓練數據進一步提升整體能力。

**十三、歸根結底——這項研究說明了什麼**

說到底,PhiZero這項研究回答的是一個樸素但深刻的問題:AI是否需要一套專屬的"語言"來理解物理世界,就像人類需要語言來組織和表達知識一樣?研究團隊給出的答案是肯定的,並且用一套完整的技術方案和豐富的實驗數據為此提供了支撐。

從實際效果來看,PhiZero在多個嚴苛的物理合理性評測上超越了參數量更大的商業影片模型,靠的並不是堆砌更多像素預測的計算量,而是在中間插入了一個顯式的物理推理環節。這種"先想後畫"的架構,讓模型有機會在生成像素之前先在符號層面"糾正"不合理的物理邏輯。

對於普通人而言,這項研究的潛在影響覆蓋相當廣泛的場景。在機器人領域,它意味著未來訓練家用機器人或工業機械臂時,可以更高效地利用人類日常活動的影片來遷移技能,而不必為每一種機器人身體結構單獨收集和標註大量配對數據。在自動駕駛領域,能夠理解物理規律的世界模型可以生成更貼近真實物理場景的仿真數據,降低真實路測的成本和風險。在科學教育和可視化領域,一個能夠生成物理合理交互影片的模型,具備成為強大教學演示工具的潛力。

這項研究的完整論文可通過arXiv編號2607.28624查閱,項目主頁Phi-Zero.github.io上也提供了更多可視化效果供參考。如果你對物理AI、影片生成或世界模型領域感興趣,這篇論文提出的"物理語言"框架值得認真研讀——它或許代表了讓AI真正理解物理世界的一個有效切入角度。

Q&A

Q1:PhiZero中的"物理語言"到底是什麼,和普通的文字描述有什麼區別?

A:物理語言是PhiZero自動從真實影片中學習到的一套離散符號系統,詞彙表約有25000個符號,一段4秒影片會被壓縮成256個符號的序列。它和文字描述的核心區別在於精細程度:文字描述只能給出"倒水"這樣的高層次概念,而物理語言能精確編碼液體擴散的具體軌跡和時序細節,足以支撐後續還原出物理合理的影片,同時比像素編碼緊湊得多。

Q2:PhiZero實現跨身體動作遷移需要配對的人機數據嗎?

A:不需要。PhiZero的動作遷移流程分為三步:先用分詞器把人體動作影片編碼成物理語言序列,再用圖像編輯工具把第一幀里的人替換成目標機器人,最後用原始的物理語言序列重新解碼生成機器人動作影片。整個過程不使用人機配對數據,因為物理語言編碼的是運動本身的結構,與外觀無關。

Q3:PhiZero和現有影片生成模型相比生成速度會不會慢很多?

A:PhiZero在生成流程中增加了物理語言推理這一額外步驟,理論上會有一定的時間開銷。然而由於物理語言序列長度僅為256個離散符號,自回歸預測過程相對輕量;更重要的是,壓縮後的物理語言大幅減少了擴散解碼階段需要條件化的資訊量,因此整體效率影響有限。論文並未單獨報告推理速度數據,具體延遲情況有待進一步披露。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新