宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當AI回答人口問題時,它其實在悄悄「說謊」——來自馬克斯·普朗克研究所的概率一致性測試

2026年07月28日 首頁 » 熱門科技

這項由馬克斯·普朗克智能系統研究所(德國蒂賓根)、蘇黎世聯邦理工學院(ETH Zürich)、ELLIS研究所及蒂賓根AI中心聯合開展的研究,以預印本形式發布於2026年7月16日,論文編號為arXiv:2607.15277v1,有興趣深入研究的讀者可通過該編號查閱完整論文。

每當我們向ChatGPT或Claude這類大型語言模型提問"美國人平均收入超過5萬美元的概率是多少",背後其實藏著一個很少有人追問的深層假設:這個模型給出的答案,真的是基於它所掌握的人口知識做出的可靠估計嗎?還是說,它只是按照某種說不清道不明的直覺隨口一說?

這支研究團隊決定認真追問這個問題,而他們發現的答案,出人意料地令人不安。

**一、一道數學常識題,難倒了頂級AI**

要理解這項研究的核心,先從一道小學數學題說起。假設你想知道班級里所有同學的平均身高,你有兩種方法。第一種是直接問老師"這個班平均身高是多少";第二種是先把學生按男女分成兩組,分別問兩組的平均身高,然後按人數比例加權平均得出全班數據。如果這兩種方法得到的答案一致,說明數據是自洽的。如果答案差距很大,那就說明哪裡出了問題。

這道題在數學上有一個正式名稱,叫做"全概率公式"(Law of Total Probability)。它的意思是:一個整體的概率,必須等於把整體按任何有效方式分割成若干部分後,各部分概率按比例加權求和的結果。這是概率論最基礎的公理之一,不是什麼高深理論,就像"1加1等於2"一樣不容置疑。

研究團隊的核心問題是:當AI模型被要求估計某個統計量時,它對"整體"的直接估計,和它對"各部分"的估計加權合併後得到的結果,會不會一致?

答案是:往往不一致,而且差距相當顯著。

**二、"分割-提問-合併":一套簡潔卻揭示深層問題的測試框架**

為了系統地檢驗這個問題,研究團隊設計了一套極為精巧的測試方案,可以用一個生活場景來理解它的運作方式。

假設你是一個偵探,要調查某城市居民的收入情況。你可以直接去市政府問:"這個城市裡有多少比例的人年收入超過5萬美元?"這是直接詢問整體。或者,你也可以先把居民按年齡分成兩組——工作年齡段(31至68歲)和非工作年齡段(其餘年齡)——分別調查這兩組的收入情況,然後按兩組人口比例合併結果。如果這個城市的數據是真實可靠的,兩種方式應該得到相同的答案。

研究團隊把這個邏輯應用到了AI身上,並且做得更加系統化。他們構建了一種叫做"二叉條件樹"(Binary Conditioning Tree)的結構,本質上就是一棵不斷細分人群的分類樹。樹的根節點是整體人群(比如"美國所有居民"),第一層按年齡分成兩組,第二層在每組內再按就業狀態分成兩組,第三層再按每周工作時長分組,如此往下,每深入一層人群就被切割得更加細碎具體。

他們使用的真實數據來自2024年美國社區調查(American Community Survey,簡稱ACS),這是美國最權威的人口調查之一,涵蓋380萬名受訪者的收入、就業、年齡等詳細資訊。這份數據既用來構建分割方案,也作為檢驗AI答案準確性的"標準答案"。

在每一個節點(即每一個人群分組),研究團隊都會向AI提供該人群的文字描述,例如"一位居住在美國、年齡在31到68歲之間、目前受僱或自雇的人",然後讓AI估計該人群中年收入超過某個門檻值的概率。這種通過文字描述來引導AI代入特定群體視角回答問題的方式,在AI研究領域被稱為"人物角色提示"(Persona Prompting)。

收集完所有節點的AI估計值後,團隊按照全概率公式,從底層節點往上逐層加權合併,重建出整體人群的估計概率。然後,他們把這個重建值與AI對整體人群的直接估計值加以比較,同時也與真實的ACS統計數據進行比對。

**三、"宏觀謬誤":越細越准,越粗越差**

測試結果揭示了一個令人驚訝的規律,研究團隊給它起了一個專門的名字:宏觀謬誤(The Macro Fallacy)。

所謂宏觀謬誤,說的是這樣一種現象:當AI被要求直接估計整體人群的某個統計量時,它給出的答案往往比從更細分的子群體估計中加權合併得到的答案準確度更低。換句話說,你直接問它"全國人怎樣",不如先問它"年輕人怎樣、中年人怎樣、老年人怎樣",再把三個答案按比例拼起來。後者反而更接近真實情況。

這就好比偵探破案的邏輯:與其籠統地猜"案子是怎麼發生的",不如逐一盤問每一個證人,把每個人的陳述拼成完整的案情還原。AI在面對宏觀整體問題時,似乎會陷入某種模糊的"概括印象",而當它被迫聚焦於具體的子群體時,反而能調動更準確的知識。

這個規律在研究中得到了相當一致的驗證。團隊在不同收入門檻(從100美元到8萬美元,跨越了7個檔位)、不同AI模型(包括GPT-5.4、GPT-4o mini、Claude Opus、Claude Sonnet、Gemini 3.1 Pro等多款頂級商用模型)、以及二叉樹的不同深度層次上分別進行了測試。結果幾乎無一例外:重建後的聚合估計比直接估計更接近真實的ACS統計數據,平均提升幅度相當可觀。

不過,這種"越細越好"的趨勢並非無限延伸。當樹的層級變得非常深、人群被切割得極為細碎時,改善效果會開始下降,有時甚至反而變差。這個現象引導研究團隊去追問:誤差究竟來自哪裡?

**四、拆解誤差的來源:兩個零件,各有問題**

AI在估算加權合併值時,需要兩類輸入:一是對每個子群體的概率估計,二是每個子群體在總人口中的比例(也就是權重,或稱"先驗概率")。團隊把這兩類誤差來源分別獨立出來進行了分析。

先看子群體的概率估計。當研究團隊用ACS真實數據的人口比例來替換AI自己估計的權重(即給AI一個"作弊碼",不用它猜各組的人口占比,直接告訴它),然後讓AI估計各子群體的概率,再用真實權重加權合併,結果發現:改善效果依然穩健。這說明"越細越准"這個規律,主要來源於AI對更具體子群體的條件概率估計確實更準確,而不僅僅是權重選擇的問題。

背後的直覺是這樣的:當你問AI"一個普通美國人年收入超過5萬美元的概率是多少",它需要在腦海中同時考慮各種各樣的人——學生、退休者、全職工作者、失業者——並把這些差異全部壓縮進一個單一的數字。這種"一鍋亂燉"的方式容易讓某些重要的子群體資訊被稀釋或遺忘。而當你專門問它"一個31到68歲的在職美國人年收入超過5萬美元的概率",它能調用的知識更聚焦,答案也更精準。

再看權重的估計。當分組越來越細,AI需要同時估計的子群體數量呈指數級增長。二叉樹每深入一層,節點數量就翻倍。而研究發現,AI對越細碎的人口分組的比例估計誤差越大——這通過把AI的權重估計與ACS真實人口比例比較,用全變差距離(Total Variation Distance)來量化衡量,結果確認AI在深層節點的人口比例估計準確性明顯下滑。

這就產生了一個兩難困境:層級越深,子群體的條件概率估計越好,但權重估計越差。於是整體的提升效果呈現出一條倒U形曲線——先升後降,在某個中間深度達到最佳平衡點。

從更抽象的角度來看,這也可以用統計學中的"全方差定理"來理解。對整體進行估計時,不確定性來自兩個方面:各子群體內部的不確定性(within-group variance)和子群體之間的差異(between-group variance)。當你進行分組時,子群體內部的不確定性降低了,子群體之間的差異變得更加顯性和可估計。這種"把異質性變得可見"的過程,正是分層估計優於整體估計的數學根源。

**五、"由小見大"的提示技巧:在單次對話中復現分層效果**

發現了分層估計的優勢之後,研究團隊自然會問:有沒有辦法不需要繁瑣地構建整棵樹,也能讓AI"主動分層"思考?

於是他們設計了一種叫做"微觀到宏觀提示"(Micro-to-Macro Prompting)的方法。具體來說,就是在提問的時候加入一段額外的指令,大意是:"在給出最終答案之前,請先考慮美國人口中可能在收入水平上存在差異的幾個主要子群體,分別評估它們的人口比例和收入概率,然後綜合這些子群體的情況給出總體估計。"

這個方法的關鍵在於,它不需要研究者預先指定具體的分組方式,而是讓模型自己決定如何分割人群,然後在一次對話中完成所有的子群體評估和合併計算。

測試結果顯示,這個輕量級的改進在大多數情況下確實有效。在ACS收入估計任務中,多數模型在採用"微觀到宏觀提示"後,比直接估計的絕對誤差更小。在另一組使用全球意見調查數據集(GlobalOpinionQA)的測試中,有一半以上的模型也表現出了改善。

不過,這種方法的效果比直接構建分層樹要弱,而且更依賴於具體模型的能力——有些模型從中受益明顯,有些則效果不穩定。這說明"讓模型自己想到要分層"與"強制要求模型按照特定分層來估計"之間,仍然存在系統性差距。

值得注意的是,這也排除了一種替代解釋:也許分層方法之所以更好,僅僅是因為它花了更多的計算步驟?研究給出了否定的答案。"微觀到宏觀提示"同樣需要額外的推理步驟,但效果不如顯式分層樹穩定;而且分層樹在某個深度之後改善效果反而下降,儘管它調用了更多次模型。這些證據都表明,改善來自的不是"更多計算量",而是"更結構化地暴露了子群體差異"。

**六、一致性測試:AI對同一件事的不同問法,答案居然不同**

發現了"宏觀謬誤"之後,研究團隊進一步追問:AI的自相矛盾到底有多嚴重?為此,他們設計了兩種系統化的一致性檢驗,這兩種檢驗的共同特點是不需要任何外部的"標準答案"——它們完全依靠AI自身的輸出來判斷是否自洽。

第一種叫做"分割一致性"(Split Consistency)。它檢驗的是:當AI估計一個整體的某個統計量,以及估計把這個整體按某種方式一分為二後兩個子群體的同一統計量,這兩種估計是否滿足全概率公式?具體操作是對於每一個可能的"父節點-子節點對",計算直接估計與加權合併估計之間的差距,如果差距超過一個容忍閾值(研究中設為0.02,即2個百分點),就判定為"不一致"。分割一致性分數就是通過檢驗的比例。

第二種叫做"順序一致性"(Order Consistency)。它檢驗的是:當AI被問及同一個子群體的統計量,但描述該群體的屬性順序不同,答案是否一致?比如,"一個年齡在31到68歲之間、且目前受僱的人"和"一個目前受僱、且年齡在31到68歲之間的人",這兩句話描述的是完全相同的群體,AI對同一個問題的答案應該相同。順序一致性檢驗的就是這種對表述順序的穩定性。

這兩種檢驗覆蓋了不同層面的自洽性:分割一致性測試的是概率構成的邏輯,順序一致性測試的是表述方式的無關性。兩者合在一起,構成了一套完整的"AI統計推理健康體檢"。

研究團隊在多個任務上系統性地運用了這套檢驗,包括ACS收入預測(四分類收入區間)、ACS通勤時間預測、世界價值觀調查(World Values Survey,涵蓋加拿大和印度尼西亞兩國的五類意見問題),以及兩個完全虛構的預測場景——一個是費德勒對納達爾的網球比賽(按球場類型和首盤結果分組),另一個是一個架空奇幻世界中角色對戰的勝率預測(按白天/夜晚和風力條件分組)。

**七、測試結果:即使是頂級模型,表現也令人擔憂**

各項測試的結果匯聚成一幅令人擔憂的圖景。

在ACS收入預測的四分類版本中,被測試的四款頂級模型(GPT-5.4、Claude Sonnet 4.6、Grok當AI回答人口問題時它其實在悄悄說謊來自馬克斯普朗克研究所的概率一致性測試 4.3、Qwen3.6 Plus)的分割一致性得分在0到0.33之間,遠低於滿分1.0。其中最令人驚訝的是Claude Sonnet 4.6和Grok 4.3的分割一致性得分為零——這意味著在所有被測的分割檢驗中,這兩款模型沒有一次通過了一致性門檻。順序一致性方面稍好一些,最高的是GPT-5.4達到滿分1.0,但其他模型普遍在0.25到0.50之間。

在ACS通勤時間預測的版本中,即便使用同一批模型和同一套分組結構,只是把預測目標從收入換成了通勤時間,一致性得分就出現了顯著變化。這說明一致性並不只是模型本身的固有屬性,而是會因預測任務的不同而呈現不同面貌。

世界價值觀調查的測試揭示了更普遍的失敗模式。研究團隊橫跨兩個國家、五個問題、八個模型進行了全面測試。結果顯示,沒有任何一個模型在所有問題和所有國家上都保持了一致性,甚至沒有任何一個模型在超過一半的檢驗中通過了分割一致性。在印度尼西亞數據上,DeepSeek當AI回答人口問題時它其實在悄悄說謊來自馬克斯普朗克研究所的概率一致性測試 V-3.2模型的分割一致性平均得分只有0.23,而整體平均得分最高的Claude Sonnet 4.6也只達到了0.70(順序一致性)和0.70(分割一致性)。

兩個虛構預測場景的結果同樣不樂觀。網球預測中,沒有任何模型通過了超過一半的分割一致性檢驗。奇幻戰鬥場景中,模型間的差異較大,從0分到滿分都有,但這個場景特別說明了一點:即使在完全沒有真實世界參照數據的情況下,一致性檢驗依然可以運行,因為它只依靠AI自身的內部邏輯。

更大範圍的模型橫向比較則揭示了一個結論性的發現:研究團隊把測試擴展到了24款不同的模型,覆蓋了GPT系列、Qwen系列、Gemini系列和Claude系列的多個版本,並參考了"人工分析智能指數"(Artificial Analysis Intelligence Index)這個衡量模型綜合能力的第三方基準。結果發現,在同一模型家族內,即便模型的綜合能力分數大幅提升,分割一致性和順序一致性的得分並沒有隨之系統性地提高。換句話說,AI模型變得更"聰明",並不自動意味著它變得更"自洽"。統計自洽性是一個獨立的、尚未被現有訓練方法所針對性優化的能力維度。

**八、這意味著什麼:AI在扮演"全知統計學家"時存在根本性缺陷**

回到最開始的問題:AI給出的統計估計,真的靠譜嗎?

這項研究提供了一個清晰的答案:在相當程度上,並不靠譜——至少不能無條件地靠譜。更準確地說,AI對統計問題的回答,會因為你問問題的方式而產生系統性的差異,即便這些不同的方式在數學上是等價的。

這對很多看似合理的AI應用場景構成了挑戰。比如,有研究者用AI來做"合成調查"——讓AI模擬不同背景的人對調查問題的回答,以此代替或補充真實的人口調查。如果AI在宏觀層面和微觀層面的估計之間存在系統性偏差,那麼基於這種合成調查的結論就可能存在根本性的方法論問題,不同的研究者選擇不同的提問粒度,可能得到截然不同甚至互相矛盾的"結論"。

同理,在預測和預報場景中,如果兩個分析師對同一個事件用不同的方式向AI提問——一個直接問整體概率,另一個先按條件情景分類再綜合——他們可能得到系統性不同的答案。而這種差異並不是因為他們掌握了不同的資訊,僅僅是因為提問方式不同。

研究團隊還指出了一個重要的不對稱性:對齊(Alignment)和自洽性(Self-Consistency)是兩個不同的概念,它們之間沒有必然的包含關係。一個模型可以在整體層面上的估計與人類數據高度吻合,但它對子群體的估計卻可能一塌糊塗;反之,一個模型可以內部邏輯非常自洽,但整體估計卻與真實世界大相徑庭。評估AI的統計推理能力,需要同時檢驗這兩個維度,而現有的主流評測體系幾乎只關注對齊,對自洽性的系統性評估幾乎是空白的。

從這個角度看,這項研究實際上提出了一類新的AI評測基準——完全不需要真實世界的參考數據,只需要對AI自身的輸出進行內部一致性檢驗,就能發現其統計推理能力的缺陷。這對於那些無法獲取真實數據的領域(比如預測未來事件、評估假設情景)尤為有價值。

說到底,這項來自德國和瑞士聯合研究團隊的工作,就像是給AI做了一次"邏輯體檢"。檢查結果是:AI的邏輯內臟並不總是互相協調的。它可能知道"年輕人收入低"、"老年人收入低"、"中年人收入高",但當你直接問它"平均下來美國人收入怎麼樣",它給出的答案卻未必能反映出這三個已知事實的合理加權——仿佛大腦的左手和右手並不總是知道彼此在做什麼。

這不意味著AI毫無用處,恰恰相反,研究的另一面是非常積極的:AI確實儲存了大量有用的子群體知識,而通過分層提問的方式,這些知識是可以被更有效地提取出來的。這就為如何更聰明地使用AI提供了實踐指南:與其籠統地問大問題,不如先把問題分解成更小的、更具體的子問題,然後手動或引導AI把這些答案合併起來。

至於這個問題的根本解法——如何訓練出真正滿足概率自洽性的AI模型——則是未來研究需要認真解決的開放課題。有興趣進一步探索這個方向的讀者,可以通過arXiv編號2607.15277查閱完整論文,那裡有更詳盡的數學證明、實驗設置和數據分析,以及對於如何把自洽性檢驗內化為訓練目標的初步討論。

Q&A

Q1:什麼是大語言模型中的"宏觀謬誤"(Macro Fallacy)?

A:宏觀謬誤指的是一種AI的系統性偏差現象:當直接詢問AI對整體人群的統計估計(比如"美國人年收入超過5萬美元的概率"),得到的答案往往比先詢問各子群體的估計、再按人口比例加權合併得到的答案偏差更大。也就是說,"先細問再合併"比"直接粗問"更準確,體現出AI在處理整體層面問題時存在知識壓縮的系統性失真。

Q2:全概率公式一致性檢驗是否需要真實數據才能進行?

A:不需要。研究中設計的"分割一致性"和"順序一致性"兩種檢驗都是參考免基準(Reference-Free)的,只需要比較AI自身在不同提問方式下的輸出,不需要任何外部真實數據。這意味著即使在完全虛構的場景(如奇幻遊戲戰鬥)中,只要能構建出邏輯上互斥且完整的分組,就可以運行一致性檢驗,用來發現AI內部邏輯的不自洽之處。

Q3:使用"微觀到宏觀提示"方法能否完全替代顯式分層聚合?

A:不能完全替代,但在實際應用中是一種有價值的低成本替代方案。顯式分層聚合(構建完整的二叉條件樹)在改善準確率上更加穩定可靠,而"微觀到宏觀提示"僅通過在問題中加入引導語就能部分復現分層效果,但效果更依賴模型本身的能力,不同模型和不同任務上的改善幅度差異較大,有時甚至不如直接提問。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新