宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

一個模型,學會了細胞、天氣、蛋白質和遊戲的共同語言

2026年10月02日 首頁 » 熱門科技

你有沒有想過,預測明天的天氣和預測一個病人未來會不會得糖尿病,本質上是同一件事?

聽起來有點荒謬。天氣是大氣壓、溫度、濕度這些物理量的博弈,病人的健康是基因、生活習慣、病史的糾纏。一個是流體力學,一個是生物醫學,隔著十萬八千里。但如果你換個角度看:這兩件事都是在問同一個問題,我現在看到的這些資訊,能不能推出接下來會發生什麼。

這正是這篇論文想要挑戰的地方。研究者們給出了一個大膽的判斷:不管是圖像、細胞、病歷、機器人控制、分子運動、物理場還是天氣,只要問題的本質是從已知推未知,就可以用同一套學習原理去解決。他們把這個框架叫做 JEPA-Anything,測試的領域跨了七個,從像素到病歷,從分子動力學到天氣預報,幾乎把能想到的"世界"都試了一遍。

這篇文章要講的,就是他們怎麼做到的,以及這件事為什麼值得你花十分鐘看完。

預測模型的老問題:一個筐子裝太多東西

先說說這件事難在哪。

在深度學習里,有一類模型叫世界模型,它的任務是構建一個內部狀態,用來預測這個世界接下來會怎樣。

世界模型:一種學習方法,讓模型建立對環境的內部表示,並用這個表示去預測未來會發生什麼,而不是直接對原始像素或數據做操作。

早期的世界模型思路很簡單粗暴,把觀察壓縮成一個隱藏狀態,然後用循環網路去預測下一步。後來出現了 DreamerV3 這樣的系統,證明了一套模型配置可以跑通很多種控制任務。但無論怎麼進化,這些模型骨子裡都在做同一件事:用一個目標向量,去代表要預測的整個狀態。

問題就出在這個"一個目標向量"上。

想像你要給一個箱子裝東西,箱子裡既要裝易碎的玻璃杯,也要裝沉重的鐵塊,還要塞進幾件衣服。如果你把它們全部混在一起隨便扔進去,會發生什麼?玻璃杯可能被鐵塊壓碎,衣服會占用大量空間卻起不到保護作用,最後打開箱子,你會發現那些真正重要、易碎的東西反而受損最嚴重。這不是因為箱子不夠大,而是因為你沒有給不同性質的物品分配不同的空間和保護方式。

這就是標準 JEPA 架構的困境。

聯合嵌入預測架構:一種自監督學習方法,用一個上下文編碼器總結已知資訊,一個目標編碼器定義要預測的狀態,再用一個預測器在這兩者之間建立映射關係,整個過程發生在抽象的表示空間裡,而不是原始像素空間。

當視覺場景里同時存在局部紋理和全局結構,或者一個系統里同時存在多個實體、多個變化尺度時,如果統統塞進一個目標嵌入向量,容易預測的、方差大的資訊會主導整個優化過程,而那些更微妙、更難學的結構就會被淹沒,甚至收到相互矛盾的梯度信號。研究團隊把這個問題精準地定義為預測容量分配問題:接口應該保持統一,但內部狀態需要被組織成多個互補的部分。

於是,JEPA-Anything 的核心創新登場了,一個叫正交預測因子分解的機制。

正交預測因子分解怎麼把"一個筐子"拆成"多個格子"

先解釋一下這個略顯拗口的名字。

正交預測因子分解(OPF):一種把預測目標拆解成多個互不重疊、各自獨立學習的子空間的方法,每個子空間配一個專屬的預測器,最後再把所有子空間的預測結果拼回一個完整的狀態。

具體是怎麼做的?論文裡給出了嚴格的數學構造,但我們可以用更直觀的方式理解。假設目標狀態是一個高維向量,研究者引入了 K 個可學習的投影矩陣,把這個高維向量切成 K 份,每一份交給一個專門的預測器去負責學習。這些投影矩陣之間要滿足兩個約束:每個投影矩陣內部的方向要相互獨立(不能自己內部就重複),不同投影矩陣之間也要儘量不重疊(不能你學的東西我也在學)。

這就好比一個公司招人,如果你招十個人來做同一件事,那和招一個人做沒有本質區別,浪費的是另外九個人的產出空間。真正高效的團隊分工,是讓每個人負責一塊互不重疊的業務,財務管財務,技術管技術,市場管市場,這樣十個人才能真正撐起十份工作量。如果不做這種正交約束會怎樣?論文裡專門做了一個對照實驗來驗證:用沒有約束的多頭預測器,和用正交約束的因子分解做對比。結果顯示,沒有約束的版本,不同預測頭之間的重疊度高達 0.455,而加了正交約束之後,這個重疊度直接降到了 5.18 乘以 10 的負 16 次方,幾乎為零。更關鍵的是矩陣的條件數,沒有約束的版本條件數高達 438.52,這意味著一旦預測有一點誤差,合成最終狀態時誤差會被放大四百多倍;而加了正交約束後,條件數只有 1.00005,幾乎不放大任何誤差。

條件數:衡量一個矩陣在計算過程中對輸入誤差的放大程度,數值越接近 1 越穩定,數值越大意味著誤差會被急劇放大。

這組數據說明了什麼?沒有約束的多預測頭看似也在"分工",但實際上大家都在搶同一片地,合成最終答案時這種混亂會讓誤差滾雪球式地放大。而正交約束強制每個預測器守好自己的一片陣地,合成過程反而變成了一個幾乎完美的、無損的加法。

除了正交性,研究者還加了兩道保險。第一道叫因子活躍度約束,防止某個格子長期"沒人幹活"變成擺設,保證每個子空間裡的坐標始終保持變化,不會退化成一個常數。第二道叫編碼器方差約束,直接給上下文編碼器一個反塌陷的梯度信號,防止整個表示空間坍縮成一團,失去區分能力。

這三重設計合起來,構成了論文裡說的完整訓練目標:原有領域的基礎損失,加上這套統一的因子分解損失。這也是這篇論文起名 Anything 的原因,不管你是處理圖像、細胞數據、病歷記錄還是分子軌跡,底層的這套因子分解引擎完全不用改,只需要換一個前端的適配器,把原始數據轉成統一的上下文-目標接口。

七個世界,一套引擎:實驗都測了什麼

理論講完了,接下來看實際效果。研究者設計了三組實驗,層層遞進。

第一組叫終端讀出,測試的是這個編碼器學到的表示本身夠不夠好用。第二組叫潛在世界動力學,測試預測出來的狀態能不能被反覆使用,支撐規劃和長程推演。第三組叫科學分析,測試從模型里提取出來的因子坐標,能不能反過來指導真實世界的科學發現。

先看第一組。在視覺領域,研究者用 MuJoCo 模擬場景做了一個組合視覺綁定測試,考察模型能不能同時記住"變化發生在哪裡"和"發生了什麼類型的變化",包括訓練時從沒見過的位置和操作組合。結果顯示,在 DINOv3 和 SigLIP2 兩種主流視覺骨幹網路上,JEPA-Anything 都在關鍵指標上超過了標準 JEPA,比如 DINOv3 上的網格恢復指標從 0.645 提升到 0.659,碰撞率從 0.426 降到了 0.417。

在生物學領域,單細胞測序數據的處理向來是個難題,因為原始的基因表達數據極度稀疏,如果直接做重建,模型會把大量精力浪費在處理噪聲和缺失值上,而不是學習真正有意義的細胞狀態。研究者在這個場景下對比了三個模型:傳統的 scGPT、加了 JEPA 思路但沒有因子分解的 Cell-JEPA,以及完整版的 JEPA-Anything。結果很清楚,JEPA-Anything 在 PBMC 細胞聚類任務上拿到了 0.8301 的最高分,在兩個基因擾動響應預測數據集(Adamson 和 Norman)上,皮爾遜相關係數分別達到 0.942 和 0.814,全部是三者中最高的。

再看臨床預測這一塊,這個任務的難度在於要同時預測超過 1000 種未來臨床事件,而且很多事件本身發生率極低,屬於典型的稀疏預測問題。研究團隊用超過 800000 份英國生物樣本庫的縱向病歷數據訓練模型,對比了包括隨機森林、XGBoost、Prophet 甚至 Qwen 系列大語言模型在內的一整排基線方法。最終排名榜上,JEPA-Anything 以 0.718 的平均 PRAUC 拿下第一,比標準 JEPA 高出一截,比排名靠後的隨機森林方法高出整整 0.116。

PRAUC:精確率-召回率曲線下面積,專門用來評估在正負樣本極度不平衡場景下模型的預測能力,數值越高越好。

第二組實驗的重點是長程推演的穩定性,這也是我認為整篇論文最能體現設計價值的部分。

在 CITRIS Interventional Pong 這個受控的桌球遊戲環境裡,研究者測試了一種特殊的場景:系統的某個因素被外部改變了,模型收到改變前的畫面和一個說明"發生了什麼改變"的標籤,任務是預測改變後的結果。這裡分成兩種難度,一種是單一因素被干預,這種模式在訓練時見過;另一種是多個因素同時被干預,而這種組合在訓練時完全沒出現過,只是每個單獨的干預類型都見過。後者考驗的是模型能不能像搭積木一樣,把學過的單個規則重新組合出一個從沒見過的新場景。

結果顯示,在單一干預的一步預測任務上,JEPA-Anything 把誤差從 0.009541 降到了 0.006218,降幅高達 34.83%。在組合干預場景下,誤差從 0.009441 降到 0.008223,降幅 12.90%。六步連續預測的誤差也從 0.009478 降到 0.008665,降幅 8.58%。

這個結果背後有個很關鍵的資訊:模型在沒見過的組合場景下依然能保持不錯的降幅,這說明它不是死記硬背了訓練集裡的完整干預模式,而是真的學會了每一種因素變化的獨立規則,能夠在新的場合把這些規則重新拼裝起來。這就像一個真正學會了樂理的人,即便從沒聽過某首具體的曲子,也能憑著對和弦、節奏、旋律走向的理解,大致預判接下來的音符走向,而不是靠死記硬背某首曲子的譜子。如果只是背譜子,遇到一首全新的曲子就完全沒法預測,但如果學的是規律,新曲子反而成了檢驗理解程度的最好機會。

在更大規模的動力學基準測試里,研究者橫跨了十個任務,涵蓋機器人操作、連續控制、偏微分方程模擬和天氣預報,對比了標準 JEPA 和 JEPA-Anything。結果是全部十個任務,JEPA-Anything 都取得了更好的表現。其中 Burgers 方程的預測誤差降幅最大,達到 39.7%,淺水方程緊隨其後,降幅 39.3%。

偏微分方程:描述連續變化系統(比如流體運動、熱傳導)的數學方程,在物理學和工程學中廣泛使用,是很多物理場模擬的基礎。

在長程滾動預測上,論文裡專門用 Burgers 方程做了一次極限測試,把模型一步步往前推演到第 100 步,同時還測試了訓練時沒出現過的高頻振盪場景(相當於分布外測試)。結果顯示,不管是常規測試還是分布外測試,JEPA-Anything 在第 20 步和第 50 步的誤差都持續更低,雖然優勢幅度隨著推演步數增加有所收窄,但依然保持領先。

分子動力學模擬是另一個特別能說明問題的場景。研究者用一種類似 TrajCast 的等變網路架構,在水、石英、撲熱息痛和苯這四個分子系統上進行了 100 步的自由自回歸滾動預測。所謂自回歸,就是模型的輸出會變成下一步的輸入,任何微小誤差都會像滾雪球一樣被不斷放大。這套測試對預測的穩定性要求極高。結果表明,JEPA-Anything 在全部四個系統上,一步預測誤差和 100 步累積誤差都是最低的。比如在撲熱息痛系統上,JEPA-Anything 的 100 步均方根位移誤差只有 1.776 埃,而沒有用 JEPA 預訓練的從頭訓練版本高達 3.155 埃,加了標準 JEPA 但沒有因子分解的版本也有 1.868 埃。

均方根位移:衡量分子模擬中原子實際位置和預測位置之間偏差的指標,數值越小說明預測越貼近真實軌跡,長時間累積後如果這個值持續攀升,說明模型的推演已經"跑偏"了。

在連續控制規劃實驗裡,結果則更有意思,也更真實。研究者在 Hopper、Walker2d 和 HalfCheetah 三個經典的機器人運動環境裡做測試,用一個交叉熵方法規劃器,讓模型在腦內模擬多條候選動作序列,選出預期回報最高的那條去執行。結果顯示,JEPA-Anything 在 Walker2d 和 HalfCheetah 上的平均回報都超過了標準 JEPA,但在 Hopper 上反而是標準 JEPA 更占優勢,差距約為 1.24。

論文沒有迴避這個不利結果,反而藉此做了一次深入的因子功能驗證。他們對 32 維的狀態空間做了四個因子的拆分,每個因子 8 維,然後用簡單的嶺回歸探測每個因子分別在預測什麼運動學變量。結果發現在 Hopper 環境裡,四個因子分別最擅長預測腳部角度、軀幹高度、軀幹角度和腿部角度,擬合優度分別是 0.294、0.347、0.424 和 0.310。接著他們做了一個更狠的測試,把某個因子替換成訓練集上的平均值,相當於人為剝奪這個因子攜帶的具體資訊,然後觀察 20 步滾動預測誤差和真實環境裡的控制回報會怎樣變化。結果是,不管遮蔽哪個因子,三個環境的滾動誤差都會上升,在 HalfCheetah 上,遮蔽第一或第三個因子,五個訓練種子裡全部出現回報下降,遮蔽第二或第四個因子,五個里有四個出現下降。

這組實驗最有價值的地方在於,它證明了這套因子分解不是一個花架子,四個因子全部處於活躍狀態,而且每一個都真實參與了最終的決策過程,拿掉任何一個都會實實在在地損害表現。這就好比一個樂隊裡的四個樂手,你可能覺得貝斯手的存在感最弱,但如果真把他從舞台上撤下去,整首曲子的節奏骨架立刻會鬆掉,觀眾未必能說清哪裡變了,但整體的聽感確實變差了。

第三組實驗,是我認為整篇論文裡最出圈的一部分,因為它跳出了純粹的數據指標,走進了真實的濕實驗室。

從模型的因子坐標到真實的抗癌實驗

這部分內容讀起來很像科幻小說的開頭,一個 AI 模型分析了一堆生物學數據里的因子坐標,給出了一個具體的干預建議,然後科學家們真的拿這個建議去做了實驗,而且結果是陽性的。

具體來說,研究團隊對多組學數據(轉錄組學、蛋白質組學、CRISPR 篩選數據)進行了因子級別的分析,模型提取出的因子坐標最終指向了一個候選干預方案:白介素 18 聯合 NT5E/CD73 阻斷。

白介素-18與CD73阻斷:白介素-18是一種免疫信號分子,能夠激活免疫細胞發起攻擊;CD73是腫瘤細胞常用來抑制免疫攻擊的一種蛋白酶,阻斷它可以解除腫瘤對免疫系統的"剎車"。兩者聯用相當於同時踩下"加速"和鬆開"剎車"。

這個組合建議隨後被送進了真實的實驗環境驗證,驗證的層級一層比一層嚴格。第一層是細胞共培養實驗,用肝癌細胞系 Huh7 和外周血單核細胞放在一起培養。第二層是患者來源的類器官模型,直接用真實肝癌患者的腫瘤組織培養出的三維細胞團塊進行測試。第三層是患者來源的腫瘤片段,比類器官更接近真實腫瘤的組織結構。第四層是免疫功能完整的小鼠模型,這是最接近真實臨床場景的驗證方式。

結果顯示,在三個不同患者的類器官樣本和三個腫瘤片段樣本里,白介素18加CD73阻斷的組合方案,在殺傷腫瘤細胞的效果上都是所有測試條件里最強的,同時還觀察到了免疫細胞活化水平的顯著提升。圖 8 里的柱狀圖清楚地展示了這一點,聯合治療組的柱子在幾乎每個患者樣本里都是最高的,而且是統計學顯著的那種高,不是誤差範圍內的波動。

這件事的意義在於,它證明了這套因子分解學到的坐標不只是數學上乾淨漂亮,而是真的攜帶了某種可以被真實世界驗證的生物學資訊。這就好比一個天氣預報模型,不僅預測出了明天會下雨,還準確說出了下雨的具體時間段和降雨量,而不是僅僅給出一個模糊的"可能有雨"。當然,論文也很克制地承認,正交因子本身並不能建立因果機制,這次成功更像是一次有價值的信號提示,而不是萬能的因果發現工具。

科學分析組的另一個案例,是從天體軌道的模擬數據里,不帶任何物理標籤地重新發現了克卜勒定律。

克卜勒定律:描述行星軌道運動規律的物理定律,其中一條指出行星繞轉周期的平方和軌道半長軸的立方成正比,換算成頻率的話,軌道頻率與半長軸的負三分之二次方成正比。

研究者用模擬的位置和速度軌跡數據訓練模型,不告訴模型任何物理公式,只是讓它去做純粹的預測任務。事後,他們對學到的因子坐標做頻譜分析,把提取出的頻率模式和軌道半長軸配對,結果擬合出的斜率是負 1.4991,擬合優度 R 方達到 0.9999999,幾乎完美貼合克卜勒定律給出的理論值負 1.5。

這個結果乍看有點不可思議,一個只是在做預測任務的模型,居然從數據里"重新發現"了三百多年前克卜勒總結出的物理規律,而且精度高到小數點後四位都對得上。但仔細想想,這恰恰印證了這篇論文最核心的主張:如果一個系統的動力學真的存在某種規律性,那麼一個學會了準確預測這個系統的模型,內部大概率已經隱含地編碼了這個規律,即便它自己"不知道"這叫克卜勒定律。

寫在後面

看完這篇論文,最觸動我的其實不是那些漂亮的實驗數字,而是那個克卜勒定律的意外發現。

一個原本只是為了做預測任務而訓練的模型,居然在無意中把三百多年前的物理定律重新推導了出來。這讓我想到一個問題:我們平時說的"理解"到底是什麼。如果一個系統能夠精確預測某個現象的所有細節,它算不算已經理解了這個現象背後的規律,即便它從沒被明確告知過這個規律的名字?

這篇論文裡還有一個細節我覺得值得單獨說一說,就是那個 Hopper 環境上因子分解反而輸給了標準方法的結果。很多論文遇到這種不利結果會想辦法繞過去,或者乾脆不提。但這篇論文沒有迴避,反而藉機做了一整套因子活躍度的診斷實驗,最後證明即便整體回報略遜,四個因子依然全部在真實地參與決策。這種誠實,某種程度上比那些一路碾壓的結果更讓人信服。

這篇論文留下的一個懸而未決的問題是,當因子的數量和維度需要針對每個具體領域手動調整的時候,這套統一框架的"統一性"到底還剩多少。如果每換一個領域都要重新調一遍超參數,那這套框架究竟是真正意義上的"萬能引擎",還是一套需要精心調校的"萬能模板"?這個問題,恐怕要留給後續研究去回答了。

Q&A

Q1:JEPA-Anything是什麼?

A:JEPA-Anything是一個跨領域的世界模型學習框架,核心思路是把預測目標拆解成多個互不重疊的正交因子,每個因子配一個專屬預測器,再合成為完整的狀態表示,同一套原理可以套用在視覺、生物、臨床、控制、分子、物理場和天氣七個不同領域。

Q2:正交預測因子分解相比標準JEPA有什麼優勢?

A:標準JEPA把所有預測目標塞進一個統一的目標向量,容易讓易學的資訊主導優化,弱結構被淹沒。正交預測因子分解把目標拆成多個獨立子空間分別學習,實驗顯示這能讓干預預測誤差降低34.8%,並在十個動力學任務上全部超過標準JEPA。

Q3:這篇論文提到的濕實驗室驗證具體做了什麼?

A:研究團隊從生物多組學數據的因子坐標中,分析出白介素18聯合CD73阻斷這一候選干預方案,隨後在細胞共培養、患者來源類器官、腫瘤片段和小鼠模型四個層級的真實實驗中驗證,結果顯示這一組合在抗腫瘤效果和免疫激活上均表現最強。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新