宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

東南大學、華東師範大學與香港科技大學聯手追問:AI科學家真的準備好了嗎?一張「能力體檢表」揭開大模型的科研短板

2026年07月24日 首頁 » 熱門科技

這項由東南大學、華東師範大學與香港科技大學聯合開展的研究,以預印本形式發表於2026年7月,論文編號為arXiv:2607.11079,有興趣深入了解的讀者可通過該編號查詢完整原文。

科學研究的核心,說白了就是"從數據里找答案"。一個醫生看完化驗單,要能判斷病人是否有炎症;一個氣象學家分析溫度數據,要能預測明天會不會下雨;一個生物學家測量了一百隻小鼠的體重,要能判斷某種藥物是否真的有效果。這些看似不同的工作,背後都在做同一件事:對數據進行科學分析,然後做出可靠的判斷。

近年來,以ChatGPT為代表的大型語言模型(也就是俗稱的"大模型"或"AI")正在越來越多地參與到科學研究過程中,從預測蛋白質結構到自動生成研究假設,AI的身影無處不在。那麼問題來了——這些AI在科學數據分析這件事上,到底做得怎麼樣?它們真的能像一個合格的科研助手那樣,讀懂數據、做出靠譜的判斷嗎?

研究團隊發現,目前學界對AI的"科學數據分析能力"的評測,幾乎都停留在考察"能不能跑出代碼"這個層面——也就是說,只要AI寫的程序能運行、能輸出結果,就算過關了。但這就好像考駕照只考"能不能發動汽車",卻不考"能不能安全駕駛到目的地"一樣,根本沒有測到最關鍵的能力。於是,這支團隊決定造一張真正的"科研能力體檢表",系統檢驗AI在六種不同類型的科學推理任務上究竟表現如何。這張體檢表,就是他們推出的SDABench基準測試。

一、為什麼現有的"考試卷"考不出真本事

現有的AI科學數據分析測試,大多是這樣設計的:給AI一個數據集,讓它寫代碼、跑分析、輸出結果,然後對比結果對不對。這類測試的問題在於,它混淆了"做對了計算"和"做了正確的科學判斷"這兩件事。

打個比方:你讓一個學生計算一組數據的平均值,他算對了,得了滿分。但如果他根本不知道為什麼要算平均值、在什麼情況下平均值不適用、算完平均值之後該怎麼解讀,那他其實並沒有真正掌握數據分析的能力。現有的測試,就是這種"只考算術、不考理解"的水平。

更麻煩的是,現有測試往往用一個總分來概括AI的表現,這就像用一個數字來評價一個人的健康狀況一樣——100分意味著什麼?是心肺功能很好但骨密度很差,還是整體均衡?根本看不出來。不同類型的科學分析任務,對AI提出的要求是截然不同的,一個總分掩蓋了所有的差異。

研究團隊認為,科學數據分析的目的不是"跑程序",而是支撐科學主張。而科學主張有好幾種不同的形態:描述現象(這堆數據長什麼樣)、探索規律(數據里有沒有什麼有趣的模式)、推斷結論(基於這個樣本,能對更大範圍做什麼判斷)、做出預測(根據已有數據,未來會發生什麼)、分析因果(改變某個變量,會不會導致另一個變量改變)、解釋機制(為什麼會出現這種現象,背後的原理是什麼)。這六種任務,對應著科學研究中六種截然不同的思維方式,當然應該分開來考察。

二、SDABench:一張真正的"科研能力體檢表"是怎麼造出來的

研究團隊基於麻省理工學院科學家Leek和Peng在《科學》雜誌上提出的六類數據分析問題框架,將其重新詮釋為六種科學發現能力,分別是:描述性分析(說清楚數據是什麼樣的)、探索性分析(在數據里尋找可能有意義的模式)、推斷性分析(用樣本數據對更大範圍的現象做出有量化不確定性的判斷)、預測性分析(用已知變量估計未知結果)、因果性分析(評估某種干預或變化對結果的影響)、機制性分析(用數據和領域知識解釋某個現象背後的運作過程)。

在學科領域上,SDABench覆蓋了生物學、化學、環境科學、地理學和物理學五個核心理工科方向。這樣的設計保證了測試不局限於某一個學科的特殊性,而是檢驗AI在廣泛科學場景下的通用推理能力。

整個基準測試由兩部分組成。第一部分叫SDA-Real,收錄了527道基於真實世界科學數據集的題目,數據來源涵蓋了多個已有的科學數據分析基準測試(如KramaBench、BLADE、DiscoveryBench、LLM-SRBench、QRData、SciTS、ScienceAgentBench),經過重新篩選和精心設計,只保留那些數據結構清晰、分析目標明確、答案可以通過程序驗證的高質量實例。第二部分叫SDA-Synth,包含6000道基於合成數據集的題目。

為什麼要有合成數據?因為真實科學數據集通常是為某一個特定研究設計的,往往只能支撐某幾種分析類型。如果每種分析任務都用不同的數據集,那分析起來就很難判斷AI表現的差異到底是題目難度不同造成的,還是AI能力本身的差異。合成數據集則可以在同一組數據上同時支撐全部六種分析任務,保證對比的公平性。

合成數據的生成過程相當嚴謹。研究團隊先讓GPT-4o提出候選科學場景(比如植物脅迫生理學、聚合動力學等),每個場景都明確指定了哪些變量是可測量的、單位是什麼、範圍是多少。然後為每個場景構建一個"語義有向無環圖"——這個圖的每個節點代表一個變量,邊代表變量之間的因果或函數關係。每個非源頭變量都有一個明確的數學機制(代數方程或微分方程),規定了它如何由其父變量決定。對於有因果關係的變量,還專門用一套叫做"內部標準化結構因果模型"的框架來精確刻畫干預效應是如何通過中間變量傳遞到目標變量的。整個數據集按照圖的拓撲順序生成,源頭變量隨機採樣,其他變量通過執行對應的數學機制計算得出,並加入了受控的測量噪聲。最終得到50個經過專家審核的合成數據集,每個領域10個,每個數據集支持全部6種分析類型。

題目的生成過程也有一套三階段流水線。第一階段,由一個由四個AI子智能體組成的流水線來構建題目模板:分類器把種子問題分配到對應領域和任務類型,提取器把具體的數據集相關實體替換成占位符生成通用模板,生成器把模板填入特定數據集的具體變量,驗證器負責排除邏輯矛盾、占位符未解析、答案泄漏等問題。第二階段,對每個模板實現一個確定性的答案推導程序,給定數據集和具體參數就能自動計算出標準答案,保證答案的客觀可驗證性。第三階段,為多選題生成干擾選項,干擾選項通過四種擾動策略生成:交換變量角色(擴散擾動)、修改某個局部參數(混淆擾動)、隨機採樣一個不同答案(隨機化擾動)、簡單數值變換(默認擾動)。這樣的設計讓干擾項看起來合理但實際錯誤,真正考驗AI是否走了正確的分析路徑而不是靠排除法碰運氣。

每道題同時提供兩種格式:多選題(四個選項里選一個)和開放題(直接給出答案)。多選題便於自動批量評測,開放題則更貼近真實科研場景,能反映AI的真實推理能力。多選題答對的概率下限是25%(隨機猜),開放題沒有這個"地板",所以研究團隊以開放題的得分作為主要評測指標,多選題作為輔助參考。

三、15個主流AI模型大考:誰厲害、誰在哪裡拉胯

研究團隊評測了15個代表性的大型語言模型,涵蓋了閉源商業模型和開源模型兩類。閉源模型包括GPT-5.4、GPT-5.4 mini、Claude Sonnet 4.6、Gemini 3.1 Pro和Gemini 3.1 Flash;開源模型包括DeepSeek東南大學華東師範大學與香港科技大學聯手追問AI科學家真的準備好了嗎一張能力體檢表揭開大模型的科研短板 V3.2、DeepSeek R1東南大學華東師範大學與香港科技大學聯手追問AI科學家真的準備好了嗎一張能力體檢表揭開大模型的科研短板、Qwen 3.5-397B-A17B、Qwen 3-235B-Instruct、Kimi K2.5、GLM 5、Llama 3.3-70B-Instruct和Llama 3.1-8B-Instruct。此外還對Llama 3.1-8B-Instruct進行了微調,形成兩個變體。所有模型都在零樣本設置下測試,即直接給題目,不提供任何示例。

從整體得分來看,最強的閉源模型GPT-5.4的開放題準確率為58.33%,Gemini 3.1 Pro以56.88%緊隨其後,Claude Sonnet 4.6為55.79%。經過任務針對性微調的小模型Llama 3.1-8B-Instruct,開放題準確率達到了55.33%,已經接近頂級大模型的水平,說明針對性訓練對小模型的幫助相當顯著。相比之下,Llama 3.1-8B-Instruct的原始版本開放題準確率只有5.04%,差距極為懸殊。

按任務類型細分,所有模型在描述性任務上表現最好,頂尖模型的準確率可以達到90%以上。畢竟,"描述數據樣本的基本特徵"這件事,主要就是匯總和總結,難度相對最低。然而,當任務換成推斷性分析(需要從樣本數據對更大範圍做出判斷)和因果性分析(需要評估干預效果)時,準確率明顯下降。探索性任務和預測性任務則出現了不同方向的困難:探索性任務要求在約束條件很弱的情況下搜索可能的規律,類似於在雜亂的房間裡尋找一件不知道放在哪裡的東西;預測性任務要求選擇合適的模式並將其應用到沒見過的情況,類似於學會了一道菜的做法後,用新食材做出同款口感。機制性任務則出現了有趣的"格式差異":給定多選項時,強模型能夠識別出合理的機制;但在開放題格式下,AI必須自己把變量、關係、中間步驟串聯成一個完整的因果鏈,這對現有AI來說相當困難。

按科學領域分析,環境科學的整體準確率最高,達到46.9%;生物學最低,只有39.2%。這個差距並不是因為AI"懂"環境科學多於生物學,而是因為環境科學數據中的變量往往是連續平滑的,趨勢比較直接;生物學數據則常常包含高維度的非線性交互作用,樣本外預測難度更大。地理學的問題出現在探索性分析(30.9%)和機制性分析(24.9%)上,因為地理數據需要從符號性數據中推斷出空間結構,這對AI來說是一個特殊的挑戰。

四、不只是"對不對":五層錯誤解剖刀找出AI卡在哪裡

研究團隊沒有滿足於只報告準確率,他們還開發了一套五階段錯誤分析框架,把AI的錯誤按照科學數據分析的執行流程逐層分類。這五類錯誤分別是:範圍錯誤(誤解了分析目標或任務邊界)、變量錯誤(選錯了分析變量)、方法錯誤(選了錯誤的分析方法或公式)、關係錯誤(對變量之間的關係——是否存在、方向、強度、結構——判斷有誤)、結論錯誤(最終推斷與前面的分析結果不一致或不被數據支持)。研究團隊對所有錯誤案例都標註了"第一個出錯的環節",然後計算每種錯誤類型的歸一化發生率。

按任務類型看,方法錯誤在預測性任務中最為突出,歸一化錯誤率高達37.7%,在推斷性任務(23.0%)和描述性任務(13.4%)中也相當常見,反映出AI在選擇合適的統計方法或正確實現公式方面存在系統性問題。關係錯誤則在機制性任務(32.1%)和探索性任務(29.9%)中最為集中——在這兩類任務里,"變量之間的關係結構"本身就是分析的目標,AI常常把噪聲當成信號,或者沒有足夠的機制知識來重建因果傳遞鏈。結論錯誤在推斷性任務中最多見(10.2%),反映出AI在處理不確定性時容易做出過於武斷的判斷。

按科學領域看,生物學的錯誤主要集中在方法層面(29.8%),AI能識別出相關實體,但會用通用統計方法替代領域專用的分析方法。化學(24.6%)和環境科學(27.0%)的主要問題是關係錯誤,因為這兩個領域的變量交互依賴於耦合過程、閾值效應或混雜因子,AI難以準確把握。地理學的範圍錯誤率最高(9.9%),說明AI經常誤解地理分析的分析目標。物理學的變量錯誤率最高(14.5%),AI能找到正確的公式,卻搞錯了哪個變量對應哪個物理量,或者忽視了單位和物理角色的約束。

按模型水平看,規律相當清晰:較小的基礎模型(如Llama 3.1-8B和Llama 3.3-70B)的變量錯誤率極高,常常超過30%,說明它們連"用哪些變量來回答這個問題"都搞不清楚。更強的模型把這類基礎性的定位錯誤大幅降低了,但錯誤的重心隨之轉移到了執行層面:DeepSeek R1、DeepSeek V3.2、Qwen 3.5和GPT-5.4主要被方法錯誤拖累,說明它們理解了要做什麼,但選錯了怎麼做;而Kimi K2.5、Claude Sonnet 4.6和Gemini 3.1 Pro方法錯誤率較低,但關係錯誤率較高,說明它們能夠執行正確的操作,但對變量之間關係的刻畫仍然不夠準確。

這個發現的含義相當深刻:隨著模型變強,錯誤並沒有消失,只是從早期階段(搞不清楚分析對象是什麼)轉移到了晚期階段(能找到正確對象,但分析過程和推斷結論仍然出錯)。這意味著,簡單地把模型做大、做強,並不能自動解決科學推理中最本質的難題。

五、多選題"陷阱"與合成數據的可靠性

研究團隊注意到一個有趣的現象:對於某些任務類型,給AI提供多選項反而會降低它的表現。以Kimi K2.5為例,在預測性任務的開放題上它表現正常,但在同樣內容的多選題上,準確率幾乎跌到隨機猜測的水平(25.75%)。這說明,看到選項之後,AI反而被選項的外觀特徵所干擾,開始做表面模式匹配,而不是老老實實走一遍分析流程。

相反,Llama 3.3-70B-Instruct在多選題的因果任務(24.00%)和探索性任務(23.50%)上也接近隨機水平,但原因完全不同——它根本就不會做這類分析,有沒有選項都救不了它。這兩種情況都說明,多選題格式有其誤導性:它既可能讓本來會做的AI因為"看選項"反而答錯,也可能讓本來不會做的AI因為"能猜"而虛報高分。這對大量依賴多選題評測AI能力的研究來說,是一個值得警惕的信號。

在真實數據集(SDA-Real)上的測試結果,與合成數據集上的規律總體吻合:描述性和推斷性任務相對較易,探索性和預測性任務相對較難。但真實數據也暴露了合成數據無法完全模擬的特點:真實數據集中的變量名往往是標準術語(如"溫度""濕度"),AI的預訓練知識與這些術語高度匹配,有時會讓機制性任務的表現虛高;而真實數據的模式更複雜、噪聲更多,探索性任務對此更敏感。研究團隊認為,正因為兩類數據各有側重、互為補充,所以SDABench同時保留了兩者。

六、這些發現對未來AI科學助手意味著什麼

研究團隊特別強調了一點:更強的模型並不是因為"知識不夠"才出錯,而是因為"知識用錯了地方"。它們能認出公式,能識別變量,但在需要選擇合適的假設檢驗方式、準確刻畫多變量之間的耦合關係、或者把中間推理步驟串聯成一個自洽結論時,仍然頻頻出錯。這三個方向——在不確定性下選擇假設、對變量交互關係進行關係推理、以及對中間推理結果進行逐步驗證——正是未來改進AI科學數據分析能力的關鍵突破口。

SDABench提供的這套"五階段流水線式錯誤分類"不僅是一個診斷工具,還可以直接用於指導AI的訓練課程設計:按照分析流水線的階段順序,針對每個階段的能力短板分階段施訓,而不是籠統地讓AI"多刷題"。

說到底,這項研究要傳達的核心資訊很簡單:AI在科學數據分析這件事上,還沒有真正"畢業"。它們能做好最基礎的"描述題",但在需要選對方法、理清關係、做出嚴謹推斷這些更深層的科學思維任務上,表現還差得遠。更重要的是,用一個籠統的"通過/不通過"來評價AI的科研能力,就像用"及格/不及格"來評價一個醫學生是否能獨立行醫一樣,遠遠不夠精確。SDABench提供了一種更像"體檢"而非"過關"的評測視角,讓我們能看清楚每一個具體的短板在哪裡。

對於普通人來說,這項研究意味著:當我們聽到"AI已經能做科學研究了"這樣的說法時,要多問一句——它能做哪種科學研究?描述數據樣本的特徵,它也許真的能做得不錯;但如果你需要它幫你判斷某種藥物是否真正有因果效果、或者解釋某個物理現象背後的運作機制,它給出的答案可能看起來很自信,實際卻並不可靠。學會區分AI能力的層次,比盲目信任或盲目拒絕都更明智。

有興趣進一步了解的讀者,可以通過arXiv編號2607.11079查閱完整論文,原文包含了所有模型的詳細評測數據、誤差分析圖表以及完整的基準構建方法說明。

Q&A

Q1:SDABench和現有AI科學數據分析測試有什麼本質區別?

A:現有測試主要考察AI能不能"跑出代碼、輸出結果",相當於只考學生會不會按計算器。SDABench則把科學數據分析拆解成六種能力——描述、探索、推斷、預測、因果、機制——分別測試,還有一套五階段錯誤分析框架,能精確定位AI在分析流程的哪個環節出了問題,而不是只給一個總分。

Q2:為什麼多選題格式有時候反而會讓AI表現更差?

A:多選題提供了現成的答案選項,有些AI看到選項後會做"表面模式匹配"——就是憑選項的樣子來猜,而不是老老實實地走一遍分析流程。SDABench的測試發現,Kimi K2.5在預測性任務的開放題上表現正常,但在同內容多選題上準確率近乎隨機猜測,說明顯式選項確實會干擾某些AI的正常推理過程。

Q3:目前最強的AI在科學數據分析上的準確率大概是多少?

A:以開放題為主要指標,當前最強的閉源模型GPT-5.4準確率為58.33%,Gemini 3.1 Pro為56.88%,Claude Sonnet 4.6為55.79%。經過針對性微調的小模型Llama 3.1-8B-Instruct也能達到55.33%。總體而言,開放式科學數據分析任務遠未被解決,尤其是預測、探索和機制性分析,仍然是所有模型的明顯短板。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新