宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

凍結的小模型如何同時變得「更聰明」又「更便宜」?Corbenic AI 的這項實驗刷新了我們對AI能力提升的認知

2026年07月27日 首頁 » 熱門科技

這項由 Corbenic AI 獨立研究員完成的研究,以預印本形式發布於 2026 年 7 月,論文編號為 arXiv:2607.14431,有興趣深入了解的讀者可通過該編號查詢完整論文。

說到底,AI 界有一個根深蒂固的信念:模型不夠聰明,就去訓練更大的;速度太慢、成本太高,就去買更多的計算硬體。這個邏輯聽起來無可挑剔,但它有一個致命的代價——貴。訓練一個大型語言模型,光是碳排放就能達到幾百噸二氧化碳當量,更別提每次有人向模型提問時,系統都在重新"回憶"一遍它曾經想過的問題,白白燒掉大量算力。

這篇論文偏偏要走一條完全不同的路:既不改動模型的任何參數,也不增加一台新機器,只用一個機制,讓一個凍結的 12B(120億參數)小模型在某個權威數學競賽基準測試上,從 80% 的正確率一躍升至 93.3%,同時把最難的那批題目的計算代價壓縮了 6574 倍。

這個機制有個頗具神秘感的名字,叫做"字節級精確 KV 狀態移植"(byte-exact KV-state grafting)。聽起來很拗口,但核心思想其實和我們日常存檔、讀檔的直覺如出一轍。

---

一、一切從"存檔"說起:KV 緩存到底是什麼

要理解這項研究,先要搞清楚一件事:大語言模型在思考時,腦子裡裝著什麼。

每當模型讀入一段文字,它會在每一層神經網路里計算出一堆中間數據,這些數據描述了"每個詞和其他每個詞之間的關係",就像大腦在閱讀時對上下文的理解一樣。這些中間數據有個專業名字叫 KV 緩存(Key-Value Cache),可以理解為模型對這段文字"理解之後留下的筆記"。

正常情況下,這份筆記是臨時的——每次有新問題進來,模型都從頭重新讀一遍,重新記筆記,然後再回答。這就像你每次查字典,都要把整本字典重新翻一遍,查到想要的詞,再把字典合上。下次再查同一個詞,還是從頭翻。

這項研究的核心思路就是:能不能把這份"筆記"精確地保存下來,下次直接拿來用,不再重新翻字典?

問題的關鍵在於"精確"兩個字。大家都知道可以緩存一些中間結果,各種推理系統也在這樣做,但通常做的是"近似復用"——就像你根據記憶複述字典定義,大概意思對了,但細節可能有出入。這項研究追求的是更苛刻的標準:復原出來的筆記和重新算一遍完全一模一樣,連每個數字的每一個二進制位都相同。用論文裡的術語來說,就是"字節精確"(byte-exact)。

---

二、存檔要怎麼驗證是真正"原版":SHA-256 哈希與零 KL 散度

字節精確這件事,不能靠感覺,要靠數學驗證。

研究團隊用了兩種方法來證明"復原的筆記和原版筆記完全相同"。第一種方法叫 SHA-256 哈希,可以理解為給文件拍一張"數字指紋"——哪怕文件里有一個比特發生了變化,指紋就會完全不同。研究團隊對復原後的模型輸出向量拍了指紋,再對重新計算一遍的輸出向量拍了指紋,兩張指紋完全一致,5 次獨立試驗全部通過。

第二種方法叫 KL 散度(Kullback-Leibler divergence),可以理解為衡量兩個概率分布之間"差異程度"的尺子。如果兩個分布完全一樣,KL 散度為零。研究團隊對 50 個樣本測量了這個值,中位數和第 99 百分位都是精確的零,而且沒有一次出現"最高概率的候選詞不同"的情況(即 argmax 一致性 100%)。用曼-惠特尼 U 檢驗做統計分析,p 值為 1.0,效應量 Cliff's delta 為 0,意思是復原後的分布和重新計算的分布在統計上完全無法區分。

這個結果在真實的 Gemma-4-12B 模型(谷歌的一個 120 億參數語言模型)和真實的 GPU(英偉達凍結的小模型如何同時變得更聰明又更便宜CorbenicAI的這項實驗刷新了我們對AI能力提升的認知 RTX 5090,代號 Blackwell)上都得到了驗證。後來底層推理框架經歷了一次重大升級,研究團隊重新測量,結論保持不變。這種"升級之後還得重新驗證"的態度,是整篇論文讓人信服的細節之一。

整套系統里,負責字節精確 KV 狀態移植的部分叫 Taliesin(取自威爾斯傳說中的吟遊詩人),負責上層"解題-驗證-存檔"循環的部分叫 Galahad(亞瑟王傳說中尋找聖杯的騎士)。這兩個名字串聯起來的意象頗有意思:一個專注於精確傳遞,一個專注於驗證與積累。

---

三、旋轉位置編碼的"數學陷阱":為什麼只有"原位移植"才能做到字節精確

說到這裡,一個尖銳的問題出現了:模型在讀文字時,會給每個詞標註它在序列里的"位置",就像在信件開頭寫上日期一樣。這套標註機制叫旋轉位置編碼(RoPE,Rotary Position Embedding)。如果把存檔的筆記挪到另一個位置用,位置資訊不就亂了嗎?還能保持字節精確嗎?

研究團隊專門測量了這件事,結果非常乾脆:把筆記放回它原來的位置,字節精確;把它挪到任意其他位置,不精確。

更關鍵的是,研究團隊做了一個對照實驗:不用移植機制,直接讓模型在兩個不同位置上重新計算同一段文字,兩次新算的結果之間,KL 散度也不為零(大約 0.014),而且這個數值和"移植後放到錯誤位置"造成的偏差(大約 0.015)幾乎一樣大。換句話說,"位置不同造成的誤差"完全是模型本身的浮點數計算特性導致的,和移植機制本身無關。

為什麼會這樣?在嚴格的數學世界裡,注意力機制依賴的是詞與詞之間的"相對位置",理論上和絕對位置無關。但在 32 位浮點數的真實計算世界裡,三角函數的運算 cos(a)cos(b) + sin(a)sin(b) = cos(a-b) 這個恆等式並不能在比特級別精確成立——用不同的絕對角度去算同一個相對角度,最後一位比特就會出現差異,這個差異經過網路各層放大,就變成了那個約 0.01 的散度殘差。這是 32 位浮點數的內稟限制,任何推理引擎都無法繞過。

這意味著整個研究有一個非常清晰的邊界:字節精確只在"原位移植"這一個工作點成立,這不是研究者主動選擇的限制,而是物理世界強加的約束。研究團隊提前測試並公開了這一邊界,沒有試圖繞過或掩蓋它。

---

四、能省多少錢:85.6 倍的預填充加速

字節精確確認了,接下來就要算賬了。

研究團隊在真實的 Gemma-4-12B 模型上做了時間測量。當模型需要從零開始處理一段 11994 個詞的提示時,光是"讀入"這段提示就需要 1547.3 毫秒。而如果這段提示之前已經被存檔,直接把存檔的狀態裝入內存再往後算一個詞,只需要 18.1 毫秒。速度提升了 85.6 倍,而且由於移植是字節精確的,計算結果和從頭算完全一樣。

這裡還有兩個容易被忽視的工程細節,研究團隊都如實記錄了。第一個是 Gemma-4 採用了"滑動窗口注意力"機制,原生的提示詞緩存只能在稀疏的檢查點恢復,而不是完整恢復,因此需要特殊配置才能真正跳過全部重算。第二個是在多槽位伺服器上,如果請求被隨機分配到沒有緩存的槽位,加速效果就會消失,需要把帶緩存的請求"釘"在對應槽位才行。這兩個細節都被明確記錄,而不是悄悄消除。

在更宏觀的維度上,研究團隊還做了一個壓力測試:把 2854766 個詞(約 285 萬詞)的內容存成 88 個持久化塊,放在磁盤上,然後在這 88 個塊的各個深度上隨機"埋針"(即在隱蔽位置藏一個特定數字),再測試能否準確取回。結果是 7 個測試點全部正確讀取,涵蓋從第 0 個詞到第 282 萬個詞的各個深度,每次存取的時間大約是 0.29 秒,而且這個時間不隨深度增加——取第 282 萬個詞的代價和取第 0 個詞的代價一樣。

最重要的是,這 285 萬詞全部放在磁盤上,顯存(GPU 內存)占用和正常服務沒有任何區別,峰值顯存 25595 MB,和不用這套機制時完全相同。這相當於把模型可訪問的"有效上下文長度"從 32768 個詞(伺服器配置的上限)擴展到了 2854766 個詞,擴大了 87 倍,而不需要購買任何額外硬體。

---

五、從"更便宜"到"更聰明":在 AIME 2025 數學競賽上的實驗

節省成本只是故事的一半,更引人注目的是能力的提升。

研究團隊選用的測試集是 AIME 2025,這是美國數學邀請賽 2025 年的 30 道題,在 Gemma-4-12B 模型聲稱的訓練數據截止時間(2025 年 1 月)之後才公開,因此模型不可能在訓練時見過這些題。這是一個後截止日期的測試集,能有效防止"模型只是在背答案"的質疑。

谷歌官方的 Gemma 4 模型卡(model card,可以理解為產品說明書)報告了 Gemma-4-12B 在 AIME 2026 上的不使用外部工具的成績是 77.5%,Gemma-4-31B(310 億參數的更大版本)是 89.2%。研究團隊用自己最好的推理配置(在思維鏈自我驗證和代碼執行之間路由選擇)跑完 AIME 2025,得到 80.0%(30 題中答對 24 題),超過了那個 77.5% 的參考錨點。

在這個配置下,有 22 題被標記為"自信且正確",另外 8 題(編號 #9、#10、#11、#13、#14、#20、#28、#30)被標記為"不確定"——這 8 題里包含了模型完全答錯的所有題,以及 2 道答對但沒有自信的題。這 8 題就是"失敗集合",也是飛輪機制的用武之地。

接下來的操作是:用更多的計算資源把這 8 道題逐一解出來,每道題的答案都通過代碼執行來驗證(讓模型寫一段程序,運行程序,確認輸出和已知答案一致,才算通過驗證)。驗證通過之後,把這道題的解題過程所產生的 KV 狀態,作為一個持久化的塊存到磁盤上。整個已驗證的解題庫大約包含 4571 個詞,占用約 441 MB 的磁盤空間。

然後,把這個庫"移植"進來,讓模型面對那 8 道題。結果是 6 道題正確(#9、#10、#13、#20、#28、#30),2 道題未能解出(#11、#14)。#11 和 #14 的問題在於它們對應的緩存程序最長,模型在"一次性適應那麼長的代碼"時出了問題,而緩存本身依然字節精確地保存著正確答案。

最終系統得分:22(模型自信正確)+ 6(從庫中恢復)= 28/30 = 93.3%。這個數字超過了 12B 自己的官方錨點(77.5%),也超過了 31B 更大版本的官方錨點(89.2%)。

---

六、成本的戲劇性:6574 倍的代差

現在來看那 8 道"失敗題"的成本對比,這才是讓人看了需要停下來重讀一遍數字的部分。

研究團隊給基礎模型一個"最佳努力"預算:每道題允許採樣 5 次(best-of-5),8 道題共消耗了 401026 個輸出詞(token),最終答對 0 道。

用移植機制,同樣 8 道題,取回已驗證答案,共消耗 61 個輸出詞,平均每題 7.6 個詞,全部答對 8 道。

401026 除以 61,約等於 6574。用不到七千分之一的計算量,從 0 分變成滿分。

時間方面,整個移植路徑只用了 2.8 秒。能耗方面,因為這 2.8 秒太短,功率採樣儀的解析度不夠,研究團隊給出了一個保守估計範圍:相比基礎模型那 40 萬詞的耗電,移植路徑節省了大約 3000 到 8700 倍的能量。這個不確定範圍被如實報告,而不是取一個最漂亮的數字。

更有趣的是,移植路徑之所以必須做"每道題一個單獨的塊、按需路由"而不是"把所有方法合併成一個大前綴",是因為研究團隊在早期設計中踩了坑:把 8 道題的方法全部合併成一個前綴提供給模型,模型會搞混,把 #9 的問題和 #14 的方法對應上,答出錯誤答案。最終召回率只有 5/8,而且有一次直接把另一道題的答案當成輸出。分開儲存、路由到唯一正確塊,才讓召回率變成 8/8。

---

七、真正的考驗:遷移到沒見過的新題

能記住解過的題算不上真正的智能。更有意思的問題是:緩存的解法能用在從未見過的新題上嗎?

研究團隊設計了遷移測試:把原來 8 道題各自生成一道"結構相同但數字不同"的新題(比如原題某個參數是 5,新題換成 23),每道新題的答案獨立用三種方式交叉核驗,確認正確才算有效新題。結果共得到 7 道有效新題(#10 沒有找到合適的同構新題,如實記錄而非隱瞞)。

實驗流程是:用一次性分類器找到最相關的緩存塊,移植進來,讓模型把緩存的解題程序適配到新的數字上,運行程序得到答案。最終 5/7 正確,路由全部正確(7/7)。

失敗的 2 道題失敗原因非常清晰:#28 的緩存代碼把一個"應該隨參數變化的結構常數"寫死了,適配時被模型錯誤替換,導致程序崩潰;#11 的緩存代碼里把一個具體的數學常數(√185)硬編碼進去了,新題需要的是 √697,無法通過簡單的數字替換完成,模型不得不重新推導,結果超時。

這個邊界非常清晰:當緩存程序在數字上是參數化的(即用變量代替具體數字),遷移就能成功;當具體數字被硬編碼進程序邏輯,遷移就會失敗。這不是機制本身的缺陷,而是模型寫代碼方式的特性,研究團隊專門區分了"緩存的知識本身"和"模型自主應用這些知識"的能力,前者完全正確,後者有邊界。

---

八、擴大規模:310 億參數在 H100 上的驗證

為了驗證整套機制不只適用於特定的小模型和特定的硬體,研究團隊在租用的 H100 伺服器(英偉達 Hopper 架構,數據中心級 GPU)上運行了 Gemma-4-31B(310 億參數)。

所有參數在運行前就已經提前哈希註冊,防止"看到結果再挑選"的可能性,這是一種預註冊(pre-registration)實驗設計,在學術界用於提高結果的可信度。

遷移測試在 31B 上的結果是 7/7(100%),包括 12B 沒能解出的那兩道硬題(#11 和 #28),用了 25361 個輸出詞,耗時 8.4 分鐘,能耗 72.15 Wh。30 道題全部通過的飛輪系統得分是 30/30(100%),其中 8 道最難的題來自緩存,其餘 22 道實時解答,整套流程總雲端費用大約 8 到 12 歐元。

研究團隊對這個"100%"做了非常明確的說明:這是飛輪系統的總分,其中乾淨的泛化能力數字應該看遷移測試的 7/7,而不是讓系統總分代替泛化能力指標。

此外,在另一個叫做 LiveBench 的基準測試上(用舊數據作為庫,最新數據作為泛化測試集,題目 ID 完全不重疊),310 億模型取得了 71.7% 的遷移正確率(43/60),其中邏輯謎題類約 90%,數學競賽類約 85%,奧林匹克類約 25%。

---

九、兩塊不同架構的顯卡:B200 上的預註冊復現

字節精確這件事,到底是這塊 RTX 5090 顯卡特有的特性,還是一個普遍規律?

研究團隊在租用的 NVIDIA B200(數據中心 Blackwell 架構,另一種 GPU)上做了預註冊的復現實驗:在運行之前,先把源代碼的哈希值、模型文件、測試矩陣、通過標準、以及一個可證偽的預測全部寫下來存檔,然後才運行實驗。

結果:兩項指標(原位移植的零散度、SHA 字節相等)全部通過,在 Gemma-4-31B 上用 10 次獨立試驗驗證,10/10 通過。

那個"可證偽的預測"是:在 B200 上,把緩存塊挪到不同位置時,依然會出現非零散度殘差,因為這個殘差來自模型本身的浮點特性而不是特定 GPU。預測的存在方向(有殘差)和非零翻轉數被驗證正確,但殘差的量級(約 7×10??)比 12B 上的(約 1.4×10??)小了將近 19 倍,這個量級差異沒有被預測到,研究團隊如實記錄了這個"預測正確方向、預測錯誤量級"的結果,而不是把它悄悄忽略。

綜合來看,字節精確在兩種規模(12B、31B)和兩種不同 Blackwell GPU 目標(消費級 RTX 5090 和數據中心級 B200)上都得到驗證,H100 上驗證了功能正確性但沒有做字節級測量,所以 H100 不計入字節精確的驗證列表。

---

十、系統行為:路由器出錯了怎麼辦,從磁盤讀取會吃掉省下的算力嗎

兩個最實際的工程問題需要給出測量結果而非理論分析。

關於路由錯誤:在 15 次有庫內匹配的路由測試中(8 道原題 + 7 道遷移新題),路由全部正確(15/15)。統計上,這個樣本量對應的 Wilson 95% 置信區間大約是 79.6% 到 100%,研究團隊報告了這個區間而不是直接說"100% 準確"。對於庫外查詢(比如"法國的首都是哪裡"或"寫一首關於海洋的俳句"),4 次測試中系統全部選擇了"不路由"(4/4),沒有出現自信錯誤的路由。研究團隊也明確指出:從機制上說,"自信地路由到錯誤塊"是可能發生的,只是在這個樣本量內沒有出現,更大規模的表徵是未來工作。

關於磁盤讀取的代價:研究團隊測量了不同長度提示詞下,"從頭重算"和"從磁盤恢復狀態"的時間對比。748 詞的塊,重算需要 96.1 毫秒,從磁盤恢復需要 57.7 毫秒,速度比約 1.7 倍;5977 詞的塊,重算需要 748.3 毫秒,從磁盤恢復需要 85.8 毫秒,速度比約 8.7 倍。規律非常清晰:重算的時間隨詞數幾乎線性增長,磁盤恢復的時間受固定開銷主導,增長緩慢。換句話說,提示詞越長,從磁盤讀取的優勢越大,磁盤開銷不會吃掉省下的算力,反而會隨上下文加長而擴大優勢。這裡做了誠實的說明:這是雙槽位伺服器的測量,沒有高並發擴展性的聲明,"冷啟動"的含義是本次會話的首次訪問而非作業系統頁面緩存被清空,恢復時間包含了 HTTP 往返延遲。

---

十一、研究者主動報告的失敗案例

一篇只報告成功的論文,其實是在向讀者隱瞞資訊。這篇論文的第 4.13 節專門列出了"誠實的負面結果"。

當模型對某類任務本來就能做好時,飛輪機制完全沒有效果——研究團隊測試了一個 2026 年 12B 模型能第一次就做對的自動生成任務,飛輪版本和基礎版本得分完全相同(216/216),時間也完全相同,因為根本沒有失敗的地方需要緩存知識來補救。

更有趣的是"緩存反而有害"的案例:研究團隊給模型提供了一張"中國剩餘定理手工計算方法卡片",用於一個模型其實本來就會的題型。結果準確率下降了 55 個百分點,用的詞數增加了 10 倍,因為強迫模型走了一條比它默認方法更差的路徑。這件事直接改變了研究的核心設計原則:只緩存模型真正缺乏的知識,絕不要把模型本來就會的方法重新規定一遍。

在塊的可移植性方面,字節精確只在相同架構之間成立(同是 H100 的兩台機器之間複製塊,8/8 完全可用)。跨架構時,知識在功能上依然可以傳遞,但原始字節不保證相同,因為不同架構對浮點數的處理順序可能不一樣,最終算出的比特會有差異。

LiveBench 的復現測試里還發現了一個有趣的限制:對於結構複雜、包含多個示例的緩存塊,31B 模型傾向於自己重新解題,而不是"讀取"緩存里的答案,復現率只有 5/20。AIME 題目是單一解決方案的塊,復現率 8/8。這是一個真實的機制局限,不是人為掩蓋。

---

十二、成本與能力的反直覺關係

歸根結底,這項研究最值得停下來細想的地方,不是某個具體的技術細節,而是它所揭示的一個經濟邏輯。

在採樣更多次(投票選最好答案)的路徑上,買到 76.7% 的準確率需要消耗約 25000 個輸出詞每道題;在緩存已驗證知識的路徑上,買到 90.0% 的準確率只需要約 4400 個輸出詞每道題。每個百分點的代價,後者大約是前者的五十分之一。

原因是結構性的:採樣更多次這條路,每次都要付全額計算費用,永無止境;驗證存檔這條路,只有第一次解題時付費,之後每次取用只需要一次移植。而且恰好是那些最難的題(12B 的盲區)對應的計算開銷最大,飛輪機制精準地把那部分最貴的計算變成了一次性成本。

研究團隊還順帶記錄了一個有意思的對照:他們嘗試讓一個大型混合專家模型來解同一批題,這個大模型生成了 244 萬個輸出詞,而 12B 生成了 77 萬個詞,但大模型有一半嘗試沒有在預算內完成,每道題解決成本和 12B 大致相當。"大模型,詞元便宜"這個直覺,在固定內存預算下的硬推理任務上並不成立,因為大模型話多,總詞數反而更多。

這項研究的完整證據鏈通過輸入輸出哈希鎖定,每次實驗的輸入數據集和運行腳本在實驗前做了 SHA-256 哈希,實驗結果和原始輸出在退出時再次哈希,因此結果的真實性可以在不接觸專有引擎的情況下獨立核實。有興趣深入了解原始研究細節的讀者,可通過論文編號 arXiv:2607.14431 查閱完整論文。

---

Q&A

Q1:KV 狀態移植是如何實現"字節精確"的?

A:論文對具體實現機制保密(這是 Corbenic AI 的專有引擎),只公開了驗證方式:在固定的確定性計算配置下,把存檔狀態復原後產生的輸出向量,和重新計算一遍的輸出向量,用 SHA-256 哈希做比較,50 次試驗全部相等,KL 散度全部為零。在這個配置下,兩次新計算的結果本身也是逐位相同的,所以這個驗證是有實質意義的。

Q2:KV 狀態移植和普通的提示詞緩存有什麼本質區別?

A:普通提示詞緩存是"活在伺服器進程里"的臨時狀態,進程重啟就丟失,而且對滑動窗口注意力模型往往只能稀疏恢復,同一段提示詞重新發送仍可能觸發大量重算。字節精確 KV 狀態移植把計算結果永久存成磁盤文件,可以跨進程、跨機器(同架構內)使用,移植後的狀態和重新計算完全逐位相同,這種持久化加上精確性是普通緩存不具備的。

Q3:AIME 2025 上 12B 模型得到 93.3% 是不是作弊了——因為那 8 道題的答案是提前存進去的?

A:這個問題分兩層回答。對於復現測試(同樣 8 道題再次出現),確實是從存檔里取答案,這屬於論文明確區分的"復現"場景,是成本故事而非能力故事。對於能力故事,論文依賴的是"遷移測試"——把從未見過的同結構新題給模型,模型需要自主把緩存方法適配到新數字上,12B 做到 5/7,31B 做到 7/7。這才是論文聲稱的泛化能力數字,而非系統總分。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新