宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

香港理工大學聯合四川大學:讓AI的「隱形思維」也能越練越強,這項突破或將重寫推理效率的邊界

2026年08月04日 首頁 » 熱門科技

這項由香港理工大學與四川大學聯合開展的研究,以預印本形式發布於2026年7月22日,論文編號為arXiv:2607.19691v1,有興趣深入了解的讀者可通過該編號在arXiv平台查詢完整論文。

當你解一道數學題,腦袋裡會經歷一段"內心獨白"——先想到用哪個公式,再試試代入數字,發現不對就回頭重想。這個過程雖然在紙上看不見,卻是你真正在"思考"的核心環節。現在,讓AI也擁有這種"內心獨白",正是近年來人工智慧研究的一個重要方向,學界把它叫做"潛在推理"(Latent Reasoning)。

然而,這條路走到今天卻遇到了一堵牆:AI的"內心獨白"雖然速度更快、計算量更少,卻一直被關在"模仿"的籠子裡,沒辦法像那些把思維過程寫出來的AI一樣,通過"做對了就獎勵、做錯了就懲罰"的強化學習方式來自我提升。這就好比一個學生能在腦子裡飛速運算,卻始終只能靠抄老師的解題步驟來學習,而沒辦法通過自己做對題目獲得成就感從而越練越強。

來自香港理工大學和四川大學的研究團隊,正是要打破這堵牆。他們提出了一套叫做**SLPO(Surrogate Latent Policy Optimization,代理潛在策略優化)**的新方法,讓AI的"隱形思維"也能接受結果導向的強化訓練,從而真正實現"越難的題目想得越久,越簡單的題目早點收手"的智能計算香港理工大學聯合四川大學讓AI的隱形思維也能越練越強這項突破或將重寫推理效率的邊界分配。

---

一、AI的兩種"思考方式":說出來的和藏在心裡的

要理解這項研究的意義,得先搞清楚AI目前有哪兩種主要的推理方式,以及它們各自的優缺點。

第一種叫做"顯式思維鏈"(Chain-of-Thought,簡稱CoT)。這類AI在回答問題之前,會像學生演草稿一樣,一步一步把推理過程用文字寫出來。比如回答"小明有3個蘋果,給了小紅1個,還剩幾個?",AI會先寫"3減1等於2",再給出答案"2個"。這樣做的好處是每一步都有跡可循,AI也可以通過檢查每個步驟的對錯來學習和進步。近年來大火的DeepSeek-R1等推理模型,正是沿著這條路走出來的。

但這種方式有個根本缺陷:寫出來的每一個字,都要消耗計算資源。更尷尬的是,很多寫出來的文字其實是在湊語言邏輯的連貫性,而不是真正在推進解題過程——就像有人做數學題時會在草稿紙上寫"首先我們知道……"這種廢話一樣。題目越難、推理越長,這種浪費就越嚴重。

第二種叫做"潛在推理"(Latent Reasoning)。這類AI不把中間步驟寫成文字,而是把它們壓縮成連續的數學向量,在模型內部的"隱空間"里悄悄流轉,最後直接蹦出答案。好處顯而易見:省掉了大量語言組織的開銷,同樣的算力能處理更多的實質性推理步驟。已有研究表明,潛在推理模型在很多標準測試上能以更短的中間計算量媲美甚至超越顯式思維鏈模型。

然而,潛在推理有一個至今未被解決的硬傷:它的中間步驟是一堆數字向量,根本沒有"這一步我選擇了什麼"的概率資訊。而強化學習要獎懲AI,就必須知道"AI在這一步做出了什麼決定、這個決定的可能性有多大"。沒有這個概率資訊,獎懲就無從下手。更何況,現有的潛在推理模型還有另一個問題:它們在訓練和推理時都預設了固定的思考步數,不管題目是簡單還是複雜,都想同樣多步。這就好比無論你去便利店買瓶水還是去超市採購一周的糧食,都只給你同樣長的購物時間,顯然不合理。

正是這兩道障礙——缺乏可用於強化學習的概率估計,以及固定不變的思考時長——讓潛在推理始終停在"模仿老師解題"的階段,無法像顯式推理那樣通過"做對了就自我強化"的方式越練越強。

---

二、兩道障礙的拆解:SLPO的核心設計思路

研究團隊把解決這兩個問題的方案分成了兩個相互配合的模組,共同構成了SLPO的骨架。

**第一個模組:用"代理密度"給隱形步驟評分**

要讓強化學習發揮作用,必須能夠評估"AI在每一步的選擇有多可靠"。對於顯式推理,這件事很自然:AI每輸出一個詞,都有一個詞彙表概率,直接拿來用就行。但對於潛在推理,中間步驟是連續的向量,不經過詞彙表,也就沒有現成的概率。

研究團隊採用的思路,類似於一個質檢員想評估一條流水線的產品質量,但無法直接檢測每個零件,於是他多次重複運行這條流水線,觀察同一個位置每次產出的零件有多大差異,以此推斷這個位置的"穩定性分布"。具體來說,在訓練過程中,對於潛在推理的每一個步驟,研究團隊會用不同的隨機擾動(技術上叫做"MC-Dropout",即蒙特卡洛隨機丟棄)多次運行模型,得到若干個略有差異的輸出向量。然後,他們用這些輸出的均值和方差,擬合出一個高斯分布(一種常見的鐘形概率分布)作為"代理"。

這個代理分布並不是對真實採樣過程的精確描述,但它能給出一個合理的數值:當前步驟產出的這個向量,在這個代理分布下有多大的可能性出現。這個數值,就充當了強化學習所需要的"每步概率"。於是,獎懲信號便能通過這個代理概率,傳遞給整條推理鏈,讓AI學會哪些思考路徑更有可能導向正確答案。值得注意的是,被評估的那些中間步驟向量本身是固定的,不參與梯度傳播;真正被訓練更新的是模型在當前參數下重新計算代理分布的那個過程,這樣既保證了訓練的穩定性,又讓獎勵信號能有效傳入模型。

**第二個模組:用"停止門"讓模型自己決定想多久**

解決了概率問題之後,還有一個問題沒解決:模型仍然不知道什麼時候該停止思考。現有的潛在推理模型都是固定步數的,比如思考六步就停。SLPO的設計是給模型加裝一個"停止門"——一個小型的神經網路模組,接在每一步潛在狀態之後,輸出一個0到1之間的概率值,表示"現在停下來解題"的把握有多大。

但這個停止門剛加上去的時候是空白的,不知道什麼時候該停。於是研究團隊設計了一個叫做"冷啟動"的預訓練階段。做法是:對於訓練集裡的每道題,讓模型用隨機擾動的方式生成多條推理路徑,然後在每條路徑的每個候選長度處截斷,解碼出答案,和標準答案對比是否正確。這樣就得到了一份"哪些長度能答對這道題"的清單。然後用這份清單來訓練停止門:讓它學會把停下來的概率集中到那些"截到這裡就能答對"的步數上。

這個過程就像培訓一個新員工,先告訴他"在這道題上,你在第4步停下來能答對,在第2步停下來就答錯了",讓他積累初步的判斷經驗,再上崗參加正式的強化訓練。

---

三、將兩個模組拼合成一個完整的訓練目標

有了代理概率和停止門之後,SLPO就能構建出一個完整的訓練目標,把三件事的得分加在一起:第一,潛在推理每一步的代理對數概率;第二,最終答案每一個詞的生成概率;第三,在哪一步停下來的概率。把這三部分相加,就得到了整條推理路徑的總得分。

在強化學習中,當一條推理路徑最終產生正確答案時,這條路徑的總得分就乘以一個正向優勢值(大意是"比平均水平好多少"),通過梯度更新讓這條路徑在未來被更頻繁地選擇;當推理路徑導向錯誤答案時,則施以相反方向的壓力。這個優勢值的計算,支持多種主流的強化學習算法,研究團隊主要測試了RLOO(留一法基線)和GRPO(組相對策略優化)兩種。

推理階段則更為簡潔:模型按步驟進行潛在思考,每走一步就讓停止門評估一下,一旦停止概率超過預設閾值,就立刻解碼答案,不再繼續思考。閾值通過在驗證集上掃描不同候選值(0.5、0.6、0.7、0.8、0.9)來選定,選出驗證準確率最高的那個。

---

四、實驗設置:在哪裡、用什麼、和誰比

研究團隊在數學推理任務上對SLPO進行了系統測試,這是目前潛在推理領域最常用的標準評估場景。訓練數據使用GSM8K-Aug,這是基礎數學應用題數據集GSM8K的一個擴充版本。評估則在三個測試集上進行:GSM8K官方測試集、GSM-Hard(把GSM8K里的數字換成更大的量級,讓題目更難)、以及MultiArith(多步驟算術題集合)。在另一組軟令牌遷移實驗中,還額外評估了MATH500、AIME 2025和AMC23這三個難度更高的數學測試集。

測試對象包括兩個不同規模的語言模型骨架:GPT-2(約1.24億參數,相對較小)和Llama-3.2-1B-Instruct(約10億參數,相對較大)。SLPO被施加到兩個已有的潛在推理基礎模型上:COCONUT(通過課程壓縮學會潛在推理)和CODI(通過自蒸餾將顯式思維鏈壓縮為連續表示)。對比的基線方法覆蓋了多種路線:顯式推理的CoT-SFT和iCoT、以及一批現有潛在推理方法包括CoLaR、ReGuLaR、DART和Latent-SFT。

評估指標方面,研究團隊採用了兩類:Acc(確定性準確率,關閉隨機擾動,用單次確定性推理的結果)和Pass@k(並行採樣準確率,用k次隨機推理路徑,只要有一次答對就算成功)。Pass@k中的k取8和16,通過MC-Dropout(隨機丟棄率0.1)產生隨機性。此外還記錄了平均推理步數(#L)。

整個訓練流程分兩階段:先用停止門冷啟動訓練15個輪次,再用SLPO主體進行最多40000步的強化優化。訓練使用4塊RTX 5880 Ada顯卡,每塊GPU批量大小16,合計有效批量64。學習率設為極低的1e-6,配合2000步熱身的常數學習率調度。值得一提的是,訓練中沒有加入KL散度懲罰(用於防止模型偏離初始狀態太遠的常見保險措施),研究團隊選擇了更激進的純結果導向優化。

---

五、主要實驗結果:SLPO讓兩個基礎模型都變得更強

在最核心的對比實驗中,SLPO分別應用於COCONUT和CODI,並在GPT-2和Llama-3.2-1B兩種骨架下進行測試。

加持SLPO之後,無論是COCONUT還是CODI,在GPT-2和Llama兩個規模上,準確率和Pass@k指標都有所提升。規律頗為清晰:Pass@16的提升幅度普遍大於Pass@8,而Pass@8又大於單次確定性準確率的提升。這個規律很有意思——它說明SLPO優化出來的模型,在隨機探索多條路徑時的覆蓋能力提升更為顯著,這正是強化學習塑造了一個更好的隨機策略的體現。換句話說,模型不僅能偶爾答對,而且在多次嘗試時更穩定地找到正確路徑。

具體數字上,以Llama骨架為例,COCONUT+SLPO在GSM8K上的Pass@16從38.13升至41.85,在MultiArith上從63.10升至71.38;CODI+SLPO在GSM8K上的Pass@16從67.48升至70.28,在MultiArith上從98.79升至99.48。提升幅度在COCONUT這個相對較弱的基礎模型上更為明顯,而在CODI這個已經較強的基礎模型上提升幅度則相對溫和但仍然持續存在。

在與更廣泛基線的對比中,CODI+SLPO在Llama骨架下的GSM8K準確率(55.27%)略高於顯式CoT-SFT(54.1%),同時使用的平均推理步數(6.30步)遠少於CoT-SFT(25.4步)。這意味著:用更少的中間步驟,達到了相當甚至略好的準確率。CoLaR、ReGuLaR、DART、Latent-SFT等同類方法在部分子任務上有競爭力,但SLPO作為一個可以直接插在已有潛在推理模型上的方法,具有更強的靈活性。

---

六、停止門學會了什麼:難題多想一會兒,簡單題早點收手

SLPO最引人注目的現象之一,是停止門在優化之後展現出了"按難度分配計算量"的行為。研究團隊用"1減去Pass@32準確率"來衡量題目難度——一道題越難,在32次隨機嘗試中答對的比例越低,難度值就越高。

把所有測試題按難度分成10個區間,再統計每個區間的平均潛在思考步數,可以清楚看到:難度區間越高,平均步數越長。最難的那組題,平均要想6步以上;最簡單的那組題,平均不到5.2步就停了。兩者相關係數在驗證集上為0.30,在測試集上為0.26,顯示出穩健的正向關聯。

這個結果意義非凡。它說明,在SLPO的訓練之後,停止門沒有退化成"永遠在第3步停"或"永遠想滿6步"的極端策略,而是真正學會了根據輸入問題的實際難度,靈活分配思考時長。這正是"自適應計算"的核心價值——計算資源不再被平均分配,而是向真正需要它的地方傾斜。

---

七、兩種強化算法都管用:SLPO不綁定特定算法

SLPO的設計目標之一是作為一個通用框架,能與不同的強化學習算法配合使用。研究團隊在RLOO和GRPO兩種主流算法下分別測試了SLPO的效果。結果顯示,兩種算法在各測試集和不同的k值下表現非常接近,沒有哪一種在全部情況下都占優勢。在COCONUT骨架上,RLOO在Pass@1和Pass@8上略勝,GRPO在Pass@16上緊隨其後;在CODI骨架上,GRPO在GSM-Hard的Pass@1和Pass@8上略占優,RLOO在MultiArith和GSM8K上稍有優勢。

這種高度相似的表現本身就是一種有價值的信號:它說明SLPO提供的代理概率足夠合理,讓不同的優化算法都能從中穩定地提取學習信號。換句話說,SLPO的瓶頸不在於選哪種強化算法,而在於代理概率本身的質量。這為後續研究留下了清晰的優化方向。

---

八、遷移到另一種潛在推理方式:軟令牌推理

SLPO的設計並不局限於某一種特定的潛在推理架構。研究團隊進一步將其應用到"軟令牌推理"(Soft Latent Inference)這一不同的機制上。軟令牌推理的工作方式不同於前面討論的隱狀態傳遞:它在每個潛在步驟中,把模型對詞彙表的概率分布乘以詞向量矩陣,得到一個加權平均的嵌入向量,再把這個嵌入向量送入下一步。這相當於模型在每一步"模糊地想著所有可能的詞",而不是硬性選定一個詞。

把SLPO應用到這種機制時,代理概率的計算方式保持不變,只是把評估對象從隱狀態向量換成了這個加權嵌入向量。在Llama-3.2-1B上,SLPO在GSM8K和MATH500上均優於對比方法(包括CoT基線、GRPO直接優化、以及專門為軟令牌設計的LEPO方法)。在Llama-3.2-3B上,對於極難的AIME 2025測試集,SLPO的Pass@1達到3.33%,而最強競爭者LEPO為0.96%,CoT類方法普遍在0.42%~0.83%之間;AMC23的Pass@1也從LEPO的27.03%進一步提升到32.50%。

特別有意思的是一張追蹤訓練過程中平均輸出序列長度的圖:在軟令牌推理下用SLPO訓練時,模型生成的序列平均長度隨著訓練步數穩步增長,從約750個詞擴展到超過1000個詞;而同樣設置下用GRPO或LEPO訓練的模型,序列長度則基本維持在初始水平附近甚至略有收縮。這說明SLPO真正觸發了模型的"多想一點"行為——模型自發地學會了為了更好的結果而延長推理過程,而不是被動地接受固定長度限制。

---

九、潛在空間的幾何變化:訓練後AI的"內心世界"發生了什麼

強化學習在外部行為(準確率提升)上的效果已經測量清楚了,但研究團隊還想知道:SLPO在AI的"內心世界"里究竟改變了什麼?他們從兩個幾何角度分析了訓練前後潛在推理狀態的變化。

第一個角度叫"步間餘弦距離"(Inter-step Cosine Distance),測量的是相鄰兩個潛在步驟的向量之間有多大差異。餘弦距離為0意味著兩個向量方向完全一樣,為1意味著完全垂直。如果步間距離大,說明每一步思考都在向不同方向邁進,整個推理過程有清晰的"階段感";如果步間距離小,說明每一步都差不多,思考在原地打轉。SLPO之後,這個距離在所有測試集和骨架組合上都有所增加,GSM-Hard上的增幅最大(GPT-2骨架增加17.1%,Llama骨架增加17.8%),SVAMP和MultiArith上的增幅相對溫和(3.8%到7.2%之間)。整體來看,SLPO讓相鄰步驟之間的差異變大了——每一步思考都在推動狀態向新的方向移動。

第二個角度叫"前綴有效秩"(Prefix Effective Rank),測量的是隨著推理步驟的積累,所有步驟向量共同張開的獨立方向有多少。如果有效秩高,說明每一步都在探索新的方向,推理路徑覆蓋了潛在空間的多個維度;如果有效秩低,說明所有步驟都集中在少數幾個方向上,思考更加專注和聚焦。SLPO之後,有效秩在所有骨架、數據集和基礎模型組合下都有所下降——雖然下降幅度因組合而異,但方向一致。這意味著SLPO讓潛在推理軌跡變得更加集中,不再漫無邊際地探索潛在空間,而是沿著更聚焦的子空間前進。

把這兩個發現合在一起,可以得出一幅有趣的圖景:SLPO之後的潛在推理,每一步相鄰狀態之間的差異更大了(更有階段感),但整體軌跡覆蓋的獨立方向卻更少了(更加聚焦)。就好像一個人解題時,每一步思維跳躍都更大,但跳躍的方向更集中、更有目的性,而不是四面開花地亂想。

---

十、對K和G兩個超參數的敏感性:組大小比採樣次數更重要

SLPO有兩個關鍵的超參數需要調節:K和G。K是計算每步代理概率時,用多少次獨立的隨機擾動來估算均值和方差(相當於用多少次重複試驗來測量流水線的波動);G是每道題採樣多少條完整推理路徑來計算強化學習的優勢值(相當於一次比賽里有多少名選手,選手越多,"平均水平"估算得越準確)。

掃描K和G各自取2、4、8的結果表明,G對最終性能的影響更為顯著——G從2增加到8時,Pass@2在GSM-Hard和MultiArith上都有明顯且穩定的提升。K的影響則相對較小:只要K達到一個最低閾值(大約4次就夠),繼續增加K帶來的額外收益有限,而且依賴於具體數據集。這個規律有直觀的解釋:G越大,優勢值的估算越准,強化學習的更新方向越可靠;而K只要足夠穩定化代理概率的估算即可,過多的重複採樣只是浪費計算,不能根本性地提升學習效果。在最終實驗中,研究團隊選用了K=4和G=8作為默認配置。

---

說到底,這項研究做的事情可以用一句話概括:它給AI的"沉默的思考"裝上了一個可以被獎懲的接口,還配備了一個懂得"難題多想一會兒"的停止開關。

這兩件事看起來細節,但對於整個潛在推理領域的走向卻有實質性的影響。此前,潛在推理的研究者面對一個尷尬局面:他們知道潛在推理比顯式推理更高效,卻沒有辦法讓它像顯式推理那樣通過做對題目來自我改進。SLPO打通了這條通路,不需要改動底層的推理架構,只需要加上一個停止門,再用代理概率替換缺失的步驟概率,就能把現有的強化學習工具直接用上。

當然,這項工作也有局限。目前的實驗主要集中在數學推理任務上,模型規模最大隻到10億參數級別。更大的模型、更開放的任務(比如寫作、編程、多模態理解),以及代理概率估算是否足夠精確等問題,都有待後續研究回答。研究團隊在論文中也明確指出,未來希望將SLPO擴展到更大的骨架、開放式推理任務和多模態潛在架構上。

如果你對AI如何思考這件事感興趣,不妨追問一下:當AI能夠真正決定"我需要想多久"時,它的決策依據是什麼?是題目的表面難度,還是它在推理過程中察覺到的某種內在複雜性?這或許是理解AI推理機制的下一個有趣問題。有興趣深入了解的讀者,可以通過arXiv編號2607.19691查閱完整論文。

---

Q&A

Q1:SLPO中的"代理概率"是什麼意思,為什麼潛在推理需要它?

A:潛在推理的中間步驟是向量數字,沒有"選了哪個詞"的概率,而強化學習必須依賴這種概率才能進行獎懲訓練。SLPO的解決方案是:用多次隨機擾動運行模型,觀察同一步驟的輸出如何波動,再用這些波動擬合出一個近似的概率分布,稱為"代理概率"。它不是精確的真實概率,但足以讓強化學習信號順利傳遞給模型進行更新。

Q2:SLPO的停止門是怎麼學會判斷題目難度的?

A:在停止門的"冷啟動"階段,模型會對每道訓練題在不同的思考步數處截斷並解碼答案,記錄哪些步數能答對。停止門隨後被訓練成把"停下來"的概率集中分配給那些能答對的步數位置。經過SLPO強化訓練之後,這個判斷進一步精細化,使得較難的題目觸發更晚停止,較簡單的題目更早收手,從而實現計算資源的自適應分配。

Q3:SLPO和現有的顯式思維鏈強化學習方法(如GRPO、RLOO)有什麼本質區別?

A:現有顯式推理的強化學習方法直接利用每個生成詞的詞彙表概率,這個概率是現成的。SLPO面對的是沒有詞彙表概率的連續向量推理,所以它額外引入了代理概率估算機制來補全這一缺失環節。在代理概率建立之後,SLPO可以直接套用GRPO或RLOO等現有算法,並不需要發明新的優化算法,而是專注於填補潛在推理與強化學習之間的接口空白。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新