你有沒有遇到過這種同事:他明明知道你是新人,但直到項目做到一半才開始放慢語速、少用術語跟你解釋。前半程他腦子裡其實早就貼好了"這人是菜鳥"的標籤,可這個判斷遲遲沒有體現在他說話的方式上。
這篇論文研究的就是AI身上一模一樣的現象。只不過這次的"同事"是語言模型,它在跟你聊天的過程中,會不斷判斷你到底是什麼水平,然後呢,這個判斷被它寫進了腦子裡很淺的地方,但真正拿出來用,卻要等到聊了很久之後。
**核心問題:AI記住的東西,不等於AI在用的東西**
要理解這篇論文在做什麼,得先搞懂一個技術圈裡越來越被重視的區分:可解碼
(decodable)和可因果作用
(causally active)完全是兩碼事。
Transformer
*:目前主流大語言模型(比如ChatGPT、Llama)背後的神經網路架構,由很多層堆疊而成,資訊從輸入的第一層一路傳遞到輸出的最後一層。
殘差流
*:Transformer內部資訊傳遞的一條"主幹道",每一層處理完之後,會把結果加到這條主幹道上,而不是完全替換掉之前的內容,這意味著前面層寫下的資訊,理論上可以一路帶到很後面的層。
殘差流的這個設計帶來一個有意思的副作用:一層網路如果在很早期就把某個資訊記下來了,這個資訊哪怕之後完全沒人用它,它依然可以在很晚的層里被讀出來。研究者管這個叫"可解碼",用一個探針(一個簡單的分類器)去讀某一層的內部狀態,如果能準確猜出某個屬性,就說這層"可解碼"這個屬性。但可解碼不代表AI真的拿這個資訊去做了什麼決定,這就好比你辦公桌抽屜里鎖著一份重要文件,任何人打開抽屜都能看到它,但這不代表你今天的工作決策真的用到了它。
之前已經有幾篇論文發現,對於那些直接寫在輸入里的屬性(比如"這個用戶是醫生"這種明說的資訊),AI經常出現早期就能讀出來、但很晚才真正影響輸出的情況。這篇論文想問的問題更進一步:如果這個屬性不是明說的,而是AI需要在對話過程中一點點猜出來的呢?比如對方到底是新手還是專家,這種事沒人會直接告訴你,得靠聊天過程中慢慢感覺出來。這種"需要推理才能得到"的資訊,會不會表現出同樣的滯後?
**用一場角色扮演對話來做實驗:EXPERTCOLLAB
數據集**
研究者設計了一個巧妙的實驗場景,讓同一個AI模型(Llama-3.3-70B
)分別扮演兩個角色,進行關於科研課題的多輪對話。
這兩個角色分別來自四種身份設定:高中生、初級研究者、資深研究者、教授。研究者給每個身份寫了詳細的性格設定,高中生問的問題偏表面、喜歡用不太準確的類比;初級研究者容易被資深的人一壓就退縮;教授則直接指出方案的致命缺陷,從不拐彎抹角。
關鍵的設計在這裡:這些角色設定里絕對不允許出現"我是教授""我有十年經驗"這種直接暴露身份的話。系統提示里明確寫著"通過你參與對話的方式來體現你的專業水平,而不是直接聲明它"。研究者還專門做了一個"泄露檢測器",去掃描每一段對話,確認沒有任何一句話直接透露了身份,28段對話全部通過檢測。
這個設計的用意其實很實際。如果直接在對話里寫"我是新手",那AI要做的事情就變成了簡單的關鍵詞匹配,跟"推理"沒什麼關係了。研究者想測的是那種更接近真實社交場景的能力:光靠對方說話的語氣、用詞、提問方式,AI能不能在心裡悄悄給對方評分,以及這個評分到底什麼時候真正開始影響它自己怎麼回話。
四個身份等級、四個科研話題(圖神經網路魯棒性、投機解碼、縮放定律、土壤微生物組),組合出28段完整對話,每段12輪。這個規模不算大,論文自己也承認這只是一次初步驗證,而不是一個鐵板釘釘的定論。
**探針實驗:專業水平資訊藏在第8層,但很快就消失了**
研究者從AI每次即將說話前的那個瞬間去讀取它內部的狀態,一共讀了80層里的20個採樣層(每隔4層讀一次)。然後用一個簡單的線性分類器(也就是"探針")去嘗試從這個狀態里讀出兩件事:AI自己扮演的角色是什麼水平,以及AI判斷對方是什麼水平。
結果分成兩條完全不同的曲線。
AI對自己身份的判斷,從第0層開始就能以100%的準確率被讀出來,而且一路保持到最後一層都沒掉過。這很好理解,因為AI自己的身份是系統提示里寫死的,屬於"直接給出"的資訊,架構完全有能力把這種資訊原封不動地傳到底。
AI對對方專業水平的判斷則完全不同。準確率在第8層達到峰值0.79(滿分是1.0,四選一蒙對的概率是0.25),然後一路下滑,到第40層左右就已經掉到接近隨機蒙對的水平了。也就是說,AI確實很早就"感覺"出對方是什麼水平了,但這個感覺越往後傳,越被沖淡,到網路中段基本就找不著了。
研究者還做了個對照實驗,防止這個早期信號只是某種"字面小把戲"。他們用一個只看表面語言特徵的分類器(比如猶豫詞的使用頻率、句子長短、疑問句比例、詞彙複雜度)去做同樣的判斷,結果只有0.32的準確率,比蒙的高一點,但遠遠不如神經網路探針的0.79。這說明AI在第8層記下的東西,不只是簡單的"這人說話囉嗦所以是新手"這種表面統計,而是更深層的東西。
**反轉發生:真正決定輸出的層,是第36層之後**
如果故事到這裡結束,那結論會是"AI很早就懂了,但後面忘了"。但研究者接下來做的因果實驗,揭示了一個更有意思的真相:AI並沒有忘,它只是把這個判斷壓著沒用,直到很晚才開始真正調用它。
這裡用到的方法叫反事實激活拼接
(counterfactual patching)。
反事實激活拼接*:一種因果驗證手段,找兩段場景幾乎一樣、只有一個變量不同的對話(這裡是對方的專業水平不同),計算它們在某一層內部狀態的差異,然後把這個差異"注入"到另一段對話的對應位置,看看這個改動會不會一路傳導到最終輸出。
具體操作是這樣的:研究者找了48組"配對對話",這些對話場景相同,唯一的區別是對方角色的專業水平不一樣。他們計算出這個專業水平差異在某一層殘差流里對應的向量差,然後把這個差值硬塞進另一段對話在同一層的狀態里,讓AI繼續往後跑完整個網路,最後看輸出端的判斷有沒有跟著變。
結果用一個叫"歸一化因果效應
"的指標來衡量,數值接近1代表這個改動完全傳導到了最終判斷,接近0代表這個改動幾乎被網路"無視"了。
在第8層,也就是探針準確率最高的那一層,注入這個專業水平差異,因果效應只有0.01。幾乎等於沒有任何作用。這就好比你在一份文件上悄悄改了一個關鍵數字,但審批鏈條上的每一個人都對這個數字視而不見,最後批下來的結果跟你沒改之前一模一樣。如果不做這個因果實驗,只看探針的解碼準確率,研究者很可能會誤以為"AI在第8層就已經用上了這個判斷",但實際情況恰恰相反:那裡的資訊雖然存在,卻對後續處理毫無影響力。
而當研究者把同樣的注入操作放到第36層往後,因果效應飆升到0.86,第40層之後更是超過0.90。這意味著,同一份"專業水平差異"資訊,在淺層幾乎是死資訊,到了網路後半段卻幾乎能完全左右最終判斷,差距超過一個數量級。
為了排除這只是"隨便改一下深層狀態都會有大影響"這種巧合,研究者還做了一個對照:換成一個跟專業水平毫無關係、只是長度相同的隨機向量去做同樣的注入。結果這個隨機向量在任何層都沒有製造出類似的上升曲線,效應始終在0附近晃蕩,波動區間也寬得多。這說明第36層之後那條清晰的上升曲線,確實是"專業水平"這個方向本身帶來的,不是隨便擾動殘差流就能出現的假象。
**兩種完全獨立的檢驗方法,指向同一個轉折點**
科學結論最怕只靠一種方法撐著。研究者又加了一個完全不需要訓練任何探針的檢驗手段:直接算patch前後最後一層激活值的餘弦不相似度(可以簡單理解成"改動前後輸出內部狀態差了多少")。
這個不需要任何分類器的指標,同樣在第8層附近開始明顯上升,到第32層左右趨於飽和,跟因果效應曲線的轉折點幾乎重合。兩種完全獨立的方法(一種靠訓練好的探針,一種完全不用探針,純靠數學距離)竟然指向同一個層區間,這大大增加了這個發現不是偶然巧合的可信度。
在實際輸出層面,研究者還統計了patch前後AI給出的"最可能的5個下一個詞"重合了多少。淺層patch幾乎不改變這5個候選詞(重合率高達0.97),而深層patch會讓大約三分之一的候選詞發生變化。換句話說,在AI真正要開口說話的那一刻,淺層的那個"專業水平判斷"根本沒有參與決策,而深層的判斷實實在在地在左右它要說的話。
**這一切合起來意味著什麼**
回到開頭那個同事的比喻。這篇論文告訴我們的東西,其實可以這樣理解:AI並不是"忘了"對方是新手這件事,它更像是把這個判斷先記在了一張便簽紙上(淺層),但真正翻出這張便簽、拿來決定該怎麼說話的,是很晚以後(深層)才發生的事情。如果一個產品經理只看AI"知不知道"某件事(也就是探針能不能解碼出來),卻不去驗證"AI有沒有真的用上",很可能會對AI的能力產生錯誤的信心。
研究者把這個轉折點和另一篇論文(Lad等人2025年的工作)發現的現象聯繫了起來。那篇論文發現,Transformer網路在中點附近會出現一個"階段轉換
":表示開始向詞彙空間對齊,也就是網路開始為最終輸出做準備。這篇論文觀察到的因果轉折點(約第36層,網路一共80層,差不多正好是中點偏後)跟那個轉換點對上了號。這提示我們,"需要推理得到的資訊幾時才真正被使用",可能不是隨機分布在網路各處的,而是跟網路本身的功能分區有關係。
論文最後提出了一個可以被驗證或推翻的猜想:一個屬性越是需要靠推理才能得到(而不是直接說出來),它從"能被讀出"到"真正被使用"之間的層數差距就越大。這個猜想目前只有一個對照組的數據支撐(AI自身身份vs對方身份),研究者自己也承認,要真正驗證這條規律,需要系統地控制"資訊明確程度",從直接說明、到有暗示線索、到完全靠推斷,逐檔去測,看因果起效的層數是不是真的跟著單調後移。
這篇論文也坦誠地列出了自己的局限:只用了一個模型(Llama-3.3-70B),只有28段對話的小規模合成語料,而且扮演雙方角色的是同一個模型,這意味著AI某種程度上可能只是在"認出自己生成內容的模式",而不是真正在做通用的社交推理。層數的具體邊界(第8層、第36層)大概率也是這款模型特有的,換個架構未必是同樣的數字。
對於關心AI對齊和安全的人來說,這個發現有一個挺直接的應用提示:如果你想去"讀出"或者"引導"AI對用戶的隱含判斷(比如它是不是在迎合用戶、是不是因為覺得對方懂得少就簡化了回答),你不能只盯著那個探針準確率最高的層去下手,因為在那一層,這個資訊雖然存在,卻根本不參與決策。真正要干預,得去網路的後半段。
寫在後面
讀這篇論文的時候,我一直在想一件事:探針能讀出來的東西,到底算不算AI"知道"的東西?
這其實是個挺哲學的問題。人類心理學裡也有類似的爭論,你腦子裡存在的記憶,跟你在做決定那一刻真正調用的資訊,從來就不是一回事。心理學家管這個叫"內隱知識
"和"可及知識"的區別,你可能知道某件事,但那件事在當下這個決策場景里根本沒被激活。AI的這個發現,某種程度上是這個現象在神經網路里的一個具體、可測量的版本。
論文裡有個細節我覺得特別值得單獨拎出來說:錯誤的混淆矩陣顯示,AI搞錯專業水平時,幾乎全部錯在相鄰等級之間(比如把初級研究者錯認成資深研究者),幾乎不會把高中生和教授搞混。這說明AI對"專業水平"的內部表徵其實是連續的、有梯度的,不是簡單粗暴的四個孤立標籤。這跟人類判斷陌生人專業水平時的直覺其實挺像的,我們很少會把一個新手和專家完全搞反,但經常分不清"有點經驗"和"很有經驗"之間的那條線。
還有一個問題這篇論文沒有回答,但我覺得特別值得追問:這個"早知道、晚使用"的模式,是不是AI在訓練過程中學到的一種"謹慎"策略?會不會是模型在訓練時被隱性地鼓勵不要過早對用戶下判斷,直到積累了足夠多的證據才敢真正調整自己的行為?如果真是這樣,這不是bug,而是一種某種意義上"合理"的保守主義。這個問題留在那裡,沒有答案,但值得繼續想下去。






