這項由新加坡南洋理工大學S-Lab與香港中文大學聯合開展的研究,以預印本形式於2026年7月17日發布在arXiv平台,論文編號為arXiv:2507.16401。有興趣深入了解的讀者可通過該編號檢索完整論文。
**一道關於蘋果落地的問題,難倒了當今最先進的AI影片模型**
亞里士多德看到蘋果從樹上掉落,會說:"這是蘋果回歸大地的天性。"聽起來很有道理,但完全沒法用來預測蘋果明天、後天或一秒鐘後在哪裡。牛頓看到同一顆蘋果,卻抽出一張紙,寫下了 v = gt,然後用這個短短的公式推算出了月球繞地運行的軌道。兩個人都"看懂"了蘋果落地,但只有牛頓真正"理解"了背後的規律。
今天的AI影片模型,更像誰?
這正是南洋理工大學研究團隊想搞清楚的核心問題。他們創建了一個名為Apple-π(讀作"蘋果派")的評測體系,專門用來檢驗影片模型究竟是在憑直覺"猜"物理現象的樣子,還是真的掌握了物理定律並能用它推演未來的運動。結果令人深思:目前最好的影片模型,在這套考試里只拿到了0.473分(滿分1分),而有些模型甚至不到0.2分。
這項研究不是為了挑剔AI的短板而存在。它的真正目標,是給未來的"世界模型"研究畫出一張清晰的路線圖——告訴開發者,AI在物理理解上具體卡在了哪一步。
**一、為什麼現有的AI評測方式存在根本性缺陷**
在理解Apple-π的設計之前,有必要先聊聊一個長期被忽視的問題:我們過去評價影片AI的方式,其實只檢查了答案,從來沒檢查解題過程。
假設你讓一個學生做一道物理題,他交上來的答案確實是正確的,於是你給了滿分。但你不知道,他其實是靠蒙的,或者在題目旁邊見過類似的圖,憑感覺寫下了答案,完全沒有理解背後的物理定律。如果下次題目稍微變一變,他就徹底不會做了。
現有的影片物理能力評測,幾乎都處在這種"只看答案"的狀態。研究團隊梳理了市面上所有主要的相關評測,發現無論是面向文本生成影片的VideoPhy-2、PhyGenBench,還是面向圖像生成影片的Physics-IQ,抑或是多領域綜合評測的WorldModelBench,它們共同的局限在於:只評估模型最終輸出的影片"看起來"是否符合物理直覺,而從不追問模型是否真正調用了物理定律來生成這段影片。
這產生了一個嚴重的盲區。影片模型在海量網際網路影片上訓練,見過無數次蘋果落地、球體碰撞、斜面滑動,它完全有可能學會"蘋果落地時應該越來越快"這個視覺模式,卻對 h = 1/2 gt? 一無所知。一旦換一個不那麼"常見"的場景——比如在月球上扔一個圓錐——模型就會露餡。
Apple-π的核心貢獻,正是設計了一套能夠追問"解題過程"的評測協議,將物理推理分解為三個可以獨立檢驗的階段,讓我們第一次看清楚AI究竟在哪個環節出了問題。
**二、Orchard數據集:一片專門為考試準備的"物理蘋果園"**
要考查物理推理能力,首先需要一批高質量的物理影片題目。研究團隊為此建立了一個叫做Orchard(果園)的影片數據集,共包含400個精心設計的物理場景。
Orchard的構建原則與其他物理影片數據集有一個根本性的不同:它不是先找到各種物理影片、再給它們貼標籤,而是先確定要考查的物理定律,再圍繞這些定律專門製作或篩選影片。這就像出卷老師先定好考試大綱,再按大綱命題,而不是隨機翻課本找題目。
影片來源分為三類。其中243個來自NVIDIA Isaac Sim物理仿真引擎,這類影片的好處是物理參數完全可知,每一幀物體的位置、速度、加速度都有精確記錄,相當於"標準答案卷"。另有121個來自團隊在實驗室受控環境下自行拍攝的真實影片,在儘量隔離干擾因素的同時,引入了真實光照、材質等視覺細節。最後36個來自YouTube上的物理教育頻道,用於覆蓋前兩類無法涉及的多樣化場景。
為了保證評估的公平性,團隊對所有影片中的運動物體做了統一規範:只允許出現球體、正方體、圓柱體和圓錐體這四種幾何形狀。這個看似"奇怪"的限制,其實有很深的考量——不規則形狀或有語義含義的物體(比如一隻貓)很容易讓模型依賴"對這類物體的經驗知識"而非物理定律來作答,就像考試作弊一樣干擾評估結果。用純幾何體,相當於給所有選手穿上同款校服參加考試,排除了"認出題目"的干擾。
在內容上,Orchard覆蓋了經典力學中的十個任務,按照主導物理定律組織成三大支柱。第一個支柱是萬有引力定律,包含自由落體、拋體運動、斜面運動和彎道圓周運動,考查重力驅動下的各種軌跡。第二個支柱是動量守恆定律,包含完全彈性碰撞(碰後動能不損失)、完全非彈性碰撞(碰後合為一體)和部分非彈性碰撞(介於兩者之間),這三種情況用恢復係數e來區分,e=1是完全彈性,e=0是完全非彈性。第三個支柱是牛頓第一定律,包含靜止狀態和勻速直線運動,考查在合外力為零時物體的行為。
此外還有第四個類別:多定律組合。這類場景會把兩個或多個物理定律串聯起來,比如一個物體先沿斜面滑下,再飛出去做拋體運動,最後撞上另一個物體發生碰撞。這種場景用來檢驗模型能不能把不同定律銜接起來使用,就像考試里的綜合應用題。
每個場景都有詳細的物理參數記錄,以及經過三輪人工審核的標註資訊。研究團隊甚至為測量精度做了詳細規範:物體質量精確到0.01克,尺寸精確到0.05毫米,初速度精確到0.05米/秒。兩位標註員對關鍵欄位的獨立標註吻合度(Cohen's κ)普遍超過0.9,任務分類甚至達到了完美的1.0,說明數據質量極高。
**三、三段式推理協議:這場考試怎麼考、考什麼**
有了題目,還需要一套考試方式。Apple-π設計了一個三階段的評測協議,對應科學推理的三個層次:感知(Perception)、建模(Formulation)和推演(Deduction)。這三個階段形成一個遞進的鏈條,就像偵探破案——先要看清現場(感知),再要判斷嫌疑人用的什麼作案手法(建模),最後還要根據手法推斷出整個犯罪過程(推演)。
考試的輸入方式頗具匠心。每道題都給模型提供一張"資訊圖式的第一幀"——也就是在原始影片第一幀上疊加了物理參數標註的圖片,比如在球旁邊標註質量"m = 1.0 kg",在旁邊標註重力加速度"g = 9.8 m/s?",用箭頭標出初速度方向。這樣做是為了把"讀懂物理參數"這件事從考題本身中剝離出去,讓模型可以直接把精力用在推理上,而不是浪費在猜測"這個參數屬於哪個物體"的歧義解析上。
模型的輸出形式也統一為影片——無論被問哪種問題,模型都需要生成一段影片作為回答。這個設計來自"鏈式幀推理"的思路:影片的每一幀就像思維過程的每一步,生成影片相當於把推理過程"畫"出來,讓整個思維鏈條可見可查。
感知階段分為兩個子任務。第一個叫感知-文字,相當於考OCR能力:模型要把第一幀上標註的所有物理參數(數字、公式、箭頭標註)原封不動地"重現"在一張純白背景的圖片上,保持位置、字體、顏色完全一致。第二個叫感知-圖形,相當於考實例分割能力:模型要把與物理實驗相關的物體(球、方塊等)單獨隔離出來,放在純白背景上,去掉所有背景、地面和標註資訊。這兩個子任務合起來檢驗模型能不能正確識別出"這個場景里有什麼物理量"和"這些量屬於哪些物體"。
建模階段同樣分為兩個子任務。第一個叫建模-文字,考查模型對物理定律的符號掌握:給出四個備選公式,模型要選出正確的那個,同時在純白背景上寫出三行文字——選項字母、正確公式的符號形式、以及把公式中的符號替換成具體數值後的結果。四個選項的設計很有講究:一個是正確答案,一個是"迷惑選項"(與正確公式共用相同符號但不是正確定律),一個是"無關選項"(來自完全不同的力學分支),還有一個是"捏造選項"(看起來像物理公式但實際上不存在)。這樣的設計讓研究者能區分模型是真的選對了,還是只是因為"公式里有這些字母"就瞎選。第二個叫建模-圖形,要求模型預測場景在某個特定時刻t*的狀態——把每個物體畫在它該出現的位置,並且用橙色箭頭標出每個物體的瞬時速度方向,旁邊附上速度數值。
推演階段只有一個任務:給出帶標註的第一幀,生成一段完整的影片,展示整個物理場景的動態演化過程,從頭到尾都要符合物理定律的預測。這是三個階段里難度最高的,因為它不僅要求某一個時刻的狀態正確,而且要求整段運動軌跡在每一幀都保持物理一致性。
**四、評分體系:既有主觀評委,也有客觀儀器**
評分系統由兩套機制組成。一套是基於大模型評委(MLLM Judge)的主觀評分,另一套是基於物理定律的客觀度量。兩者結合,才能既評估"看起來好不好",也評估"物理上對不對"。
主觀評分部分使用Gemini 3 Flash作為評委,針對不同子任務設計了對應的評分細則。以感知-文字為例,評委會檢查18個維度,包括文字字體是否匹配、顏色是否一致、位置是否正確、內容有沒有錯別字或幻覺、背景是否乾淨的白色等等。以建模-文字為例,評委會檢查選項是否選對、公式符號是否正確書寫、數值替換是否準確、三行格式是否完整等11個維度。這些維度被分組聚合,每個子任務最終得到一個0到1之間的分數。
客觀度量部分則直接用數學公式對比模型輸出和物理預測的"標準答案"。對於感知-圖形和建模-圖形,用的是分割IoU——把模型輸出的物體區域和真實物體區域做交集與並集的比值,越接近1說明位置越準確。對於推演任務,則用了更豐富的一組指標:歸一化的PSNR(衡量像素級別的重建質量)、掩碼PSNR(只在物體區域計算,避免背景干擾)、空間IoU(衡量運動發生的空間區域是否正確,不管時間)、時空IoU(同時考察運動在哪裡和什麼時候發生)、加權空間IoU(衡量運動發生的頻率分布是否匹配),以及速度準確性(通過3D速度估計對比模型和物理定律預測的速度向量誤差)。
這六個客觀指標和MLLM主觀評分按比例合併,其中物理準確性相關指標占60%權重,視覺質量占20%,幀完整性占20%。這個權重分配清楚地表明:在Apple-π眼裡,"看起來好看"遠不如"物理上對"重要。
為了驗證評委評分的可靠性,研究團隊還用開源模型Qwen3-VL-30B作為交叉驗證評委,對七個代表性模型重新評分。兩個評委的皮爾遜相關係數在整體平均分上達到0.95,在建模-文字和推演上甚至高達0.99,說明排名結論是穩健的,不依賴於特定評委模型的選擇。
**五、大考放榜:11個模型的成績單**
研究團隊對11個代表性模型進行了全面評測,包括5個影片生成模型和6個統一理解-生成模型。每個模型在400道題、5個子任務、3次獨立嘗試上分別作答,總計6000次評估。
影片生成模型組包括:Wan2.2、HunyuanVideo-1.5、VBVR-Wan2.2、Seedance 2.0和Veo 3.1。統一理解-生成模型組包括:BAGEL、OmniGen2、SenseNova-U1-8B-MoT、SenseNova-U1-8B-MoT-Think、GPT Image 2和Nano Banana 2。
成績最令人矚目的差距,出現在影片生成模型和統一理解-生成模型之間。在影片生成模型里,Seedance 2.0是最好的,平均分0.473;Veo 3.1次之,0.313;VBVR-Wan2.2第三,0.373;而HunyuanVideo-1.5最低,只有0.177。相比之下,GPT Image 2拿到了0.704,Nano Banana 2拿到了0.699,比最好的影片模型高出將近50%。
這個差距說明了什麼?關鍵不在於誰生成的影片更"好看",而在於統一理解-生成模型具備明確的視覺理解能力——它們不只是生成畫面,而是先"看懂"再"畫出來"。感知和建模階段,GPT Image 2和Nano Banana 2的分數遠高於任何影片生成模型,說明這類模型在讀取物理參數、識別物體、選擇定律方面更有優勢。但值得注意的是,即便是這兩個最強的模型,在推演階段的得分也只在0.40左右——產生法律一致的時序運動,對所有模型來說都是最難的關卡。
VBVR-Wan2.2是個有趣的案例。它是在Wan2.2基礎上用影片推理數據集進行微調的版本,在感知-文字上拿到了0.923的超高分(僅次於GPT Image 2的0.921和Nano Banana 2的0.934),在感知-圖形上也表現不錯。這說明針對推理能力的專項訓練,可以顯著提升模型"讀標註、找物體"這類接口技能。但VBVR-Wan2.2在建模-文字上只有0.001,在推演上也只有0.201,說明讀懂題目和真正理解物理定律是兩件完全不同的事,前者的提升沒有自動遷移到後者。
**六、逐階段診斷:AI究竟在哪裡摔跤**
Apple-π三階段設計的最大價值,是能夠精確定位模型在推理鏈條的哪個環節出了問題,而不是只知道它"答錯了"。
從整體趨勢看,感知最容易,建模居中,推演最難。這個梯度在所有影片模型上都很一致。感知-文字平均分在影片模型里是0.561,感知-圖形是0.380,建模-文字驟降到0.168,建模-圖形是0.283,推演是0.196。越往後,分數越低。
在感知階段內部,感知-文字比感知-圖形容易。讀取標註文字(相當於OCR)比把物體從背景中分離出來(相當於目標檢測)要簡單。這符合直覺——識別數字和符號,模型見過大量訓練樣例;但精確勾勒出幾何體的輪廓並完全去掉背景,在技術上更有挑戰性。
建模階段的兩個子任務揭示了一個微妙的"選公式和用公式"之間的鴻溝。一個模型可以選出正確的公式(建模-文字),但在預測物體在特定時刻應該在哪個位置的時候(建模-圖形)卻不準確。這說明"知道用哪個公式"和"真的能用公式算出結果並把結果畫到正確位置"是兩種不同的能力。
推演階段的挑戰最為深刻。即便模型在前兩個階段都表現不錯,在推演上依然可能失手。因為推演要求模型不只是對某一個時刻做出正確預測,而是要在整段影片的每一幀都保持與物理定律一致——物體要有正確的加速度、碰撞要產生正確的速度變化、圓周運動要保持正確的軌跡曲率。視覺上流暢的影片完全可以在物理上是錯的,兩者並不等價。
定性分析進一步揭示了一類常見的失敗模式:標註語義綁定失敗。模型可以正確地把標註文字顯示出來(OCR成功),也可以正確地把物體輪廓分離出來(分割成功),但卻把一個標註的含義——比如初速度箭頭的方向——理解錯了。結果,物體從第一幀開始就往錯誤的方向運動,整個推演過程完全偏離正確軌跡。這揭示了一個深層問題:模型能"看到"標註,但不能理解標註所代表的物理含義。
另一類常見失敗則更基礎:模型根本沒有正確執行格式要求,比如把標註文字模糊成無法辨認的狀態,或者在應該顯示純白背景的地方混入了背景殘影,或者完全沒有在圖上畫出速度箭頭。這些錯誤甚至還沒到物理推理層面,就已經在"輸出正確格式"這件事上失敗了。
**七、跨定律和跨來源分析:兩個額外的弱點**
除了縱向的三階段分析,研究團隊還做了兩個橫向的切割:按物理定律分類和按影片來源分類。
在物理定律層面,多定律組合場景(Multi)的分數普遍低於任何單一定律場景。以最好的影片模型平均分為例,萬有引力相關任務得0.45,動量守恆相關任務得0.51,牛頓第一定律相關任務得0.49,而多定律組合只有0.39。這個下降不是因為多定律場景"更複雜"(雖然確實如此),更本質的原因在於:多定律場景需要把第一段物理過程的結果——物體的位置、速度方向、接觸狀態——作為第二段物理過程的初始條件。這個"狀態轉移"步驟對現有模型來說極具挑戰性。模型可以分別處理斜面運動和拋體運動,但當斜面末端的速度需要成為拋體初始速度時,模型往往無法完成這個銜接。
在影片來源層面,所有模型在仿真影片上的得分都高於真實影片,產生了一個"仿真到真實的遷移差距"(Sim-to-Real gap)。影片生成模型平均在仿真上得0.310,在真實影片上只有0.224;統一理解-生成模型在仿真上得0.564,在真實上得0.508。這個差距的根源不在於兩者的物理定律不同——重力在仿真里和現實里都是9.8米每秒平方——而在於真實影片引入了更複雜的光照、紋理、背景噪聲,讓模型在定位和追蹤物體時更容易出錯,進而影響物理推理的準確性。
這兩個橫向分析共同指向一個結論:現有影片模型在"法律串聯"和"視覺泛化"這兩個維度上都有明顯短板,而這兩個維度恰恰是真實世界物理理解所必須的。
**八、兩個方案驗證了協議設計的合理性**
為了確認考試方式本身不存在"泄題"或"刁難"的問題,研究團隊做了兩組對照實驗。
第一組叫"文字參數替代"實驗。把第一幀上的資訊圖式標註換成結構化文字(直接在提示詞裡寫"m = 1.0 kg, h = 2.0 m, g = 9.8 m/s?"等),而不是疊加在圖片上。結果,兩種方式下模型的得分差異極小,各子任務的分差幾乎都在±0.05以內。這說明Apple-π並不是靠"讓模型讀圖標註"來人為增加難度,資訊圖式標註的作用只是把物理量和視覺物體關聯起來,而不是作為物理推理的障礙。
第二組叫"精簡提示詞"實驗。把詳細的輸出格式說明去掉,改用簡短的任務描述。結果顯示,精簡提示詞對圖形類輸出任務(感知-圖形、建模-圖形)的負面影響最大,說明詳細提示詞主要起到規範答案格式的作用。建模-文字反而在精簡提示詞下有所提升,因為公式選擇這件事本身不需要複雜的格式規範。整體來說,精簡提示詞降低了平均分,但對推演任務幾乎沒有影響——推演的難點不在于格式,在於物理。
這兩組實驗共同證實了Apple-π的設計符合其初衷:它考查的是物理推理能力本身,而非標註讀取或格式遵循的技巧。
**九、這場考試的結論與未來路線圖**
說到底,Apple-π這場大考揭示了一個當前AI界普遍存在但很少被明確指出的問題:影片模型學到的物理知識,更多是"視覺模式"而非"物理定律"。它們知道蘋果落地時應該越來越快,但不知道為什麼越來越快,更不知道如果初速度是3米每秒、高度是5米、重力加速度是9.8,那麼0.8秒後蘋果在哪裡。
研究揭示的三個核心瓶頸相互關聯:從感知到建模到推演的逐級衰減,意味著每個階段的缺陷都會疊加到下一個階段;多定律狀態轉移的弱點,意味著模型處理複合場景的能力遠落後於處理單一場景的能力;仿真到真實的遷移差距,意味著即便是在物理上表現相對較好的模型,一旦換到真實世界的複雜視覺環境裡就會顯著退步。
統一理解-生成模型在感知和建模階段的顯著優勢,給出了一個方向性的提示:把"先理解、後生成"的架構引入未來的影片世界模型,可能比單純擴大影片生成模型的規模更有效。但即便是最好的統一理解-生成模型,在推演階段也只拿到0.40左右,說明產生時序上連貫的、物理準確的影片動態,是目前整個領域共同面對的核心難題。
Apple-π數據集、評測協議和評分代碼將公開發布,供研究社區使用。對於想深入了解每一個評測細節——包括完整的提示詞模板、指標計算公式、數據標註流程的讀者,原論文附錄部分有詳細的技術規範,可通過arXiv編號2507.16401找到完整版本。
物理規律統治了宇宙138億年,讓AI真正理解它們,看來還需要一些時間——但至少現在我們有了一把靠譜的尺子,知道距離終點還有多遠。
---
Q&A
Q1:Apple-π基準測試是用來衡量什麼的?
A:Apple-π是一套專門評估影片模型物理推理能力的評測體系,由新加坡南洋理工大學研究團隊開發。它不只檢查影片"看起來"是否符合物理直覺,而是將物理推理分解為感知、建模和推演三個階段,分別檢驗模型能否讀取物理參數、識別正確的物理定律以及生成符合該定律的完整運動軌跡,從而判斷模型究竟是憑視覺經驗"猜"出了結果,還是真正掌握了物理規律。
Q2:為什麼影片生成模型在Apple-π上表現遠不如統一理解-生成模型?
A:核心差距在於理解能力。影片生成模型主要從海量影片中學習"運動看起來像什麼",更擅長模仿視覺模式;而統一理解-生成模型具備先"看懂"再"生成"的能力,在讀取物理標註和選擇正確定律上更有優勢。不過,即便是最強的統一理解-生成模型GPT Image 2,在推演階段(生成全程物理準確的影片)得分也只有約0.40,說明時序上的物理一致性是所有模型面臨的共同難關。
Q3:Apple-π測試中所有模型在多定律組合場景上為何普遍失分?
A:多定律組合場景需要模型完成"狀態轉移"——把第一段物理過程結束時的位置、速度和方向,作為第二段物理過程的初始條件輸入。比如物體沿斜面滑到底部後飛出做拋體運動,斜面末端的速度必須準確傳遞給拋體運動的初始條件。現有模型可以分別處理斜面運動或拋體運動,但跨越定律邊界做狀態銜接的能力明顯不足,導致多定律場景得分普遍低於任何單一定律場景。






