宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

用20瓦跑贏GPU:一位博士想甩開反向傳播重造AI計算

2026年10月05日 首頁 » 熱門科技

一場朋友間的晚宴上,有人拋出一個問題:如果你只能向超級智能的外星人提一個問題,你會問什麼?Francois Chaubard 想到的不是"怎麼解決能源問題"——戴森球、核聚變,這些答案他覺得已經不新鮮了。他更想知道的是,外星人如何計算他們的浮點運算,也就是 flops。這個問題成了他在 YC Paper Club 這場"另類算力"分享的開場白,也是整場討論的核心命題:如果深度學習不再綁定 GPU、反向傳播和 transformer,AI 的計算方式會是什麼樣子。

Chaubard 不是旁觀者。他從 2012 年就開始做深度學習,創立過電腦視覺公司 Focal Systems,拿過 NVIDIA 的 12.5 萬美元競賽獎金,也和 Jensen Huang 本人打過交道。過去十幾年,他親眼見證了硬體架構和優化算法如何相互綁架、共同進化,而這條路徑,正在走到效率的盡頭。

1. 英偉達用20瓦跑贏GPU一位博士想甩開反向傳播重造AI計算關心的從來不是效率,只關心能不能堆出更多 flops

2012 年 AlexNet 出現,卷積神經網路(CNN)的時代持續到 2019、2020 年左右。Focal Systems 曾贏得 NVIDIA 舉辦的一場比賽,拿到 12.5 萬美元獎金,Chaubard 也因此和 Jensen Huang 有過一些接觸。他的判斷是,Jensen 在 2020 年之前其實並不真正關心 AI——那幾年矽谷更火的是加密貨幣,在 Sam Bankman-Fried 事發之前,這個賽道賺的錢比 AI 多得多。NVIDIA 當時的注意力主要放在"每焦耳能擠出多少 flops"上,因為 CNN 既不受內存容量限制,也不受頻寬限制,挖以太坊同樣如此。

2020 年前後,情況變了。GPT-2、GPT-3 讓 NVIDIA 意識到,transformer 對內存容量和頻寬的需求遠超以往——"attention 是 n 的平方,這就是原因"。Ampere 架構是這個轉向的第一代產物。從那之後,NVIDIA 不再那麼在意計算效率,轉而瘋狂追逐內存容量和頻寬,這兩項指標此後一直呈指數增長。至於能效,只要能把 flops 堆出來,燒光全世界的海洋也在所不惜。Chaubard 給出一組數據:過去兩年,每焦耳能完成的 G-flops 幾乎沒有提升——這條曲線已經走平了。

2. 人腦只用 20 瓦,卻從來不做反向傳播

人腦的功耗大約是 20 瓦,相當於一個燈泡,卻能完成今晚幾位分享者將要展示的那些複雜運算。Chaubard 的判斷是,要讓計算成本降到人類水平,每千兆浮點運算的成本必須大幅下降,而生物進化已經用四十五億年時間給出過一份參考答案。

他花了整個博士階段研究大腦如何計算,得出的結論是:大腦幾乎肯定不會做反向傳播。如果大腦真的用反向傳播,某個神經元需要先正向激活,再反過來逆向傳導信號去更新前面突觸的權重——這意味著大腦得先"關機",再反著放電一遍,現實中不存在這種機制。即便是 Hebbian 學習這類前向模型,也會遇到"權重傳輸問題":信號要在一對突觸里走一個正向通路,再在另一條通路里折返,而兩條通路上的權重理論上必須完全相等,這在生物系統里幾乎不可能實現。他提到,如果在這個過程中加入一個激活機制,讓兩條通路都能"看到"同樣的信號,確實能讓模型work,但這本質上只是一張有環的圖,和反向傳播是兩回事,不需要保留大量激活值。

大腦里還有一個經常被忽略的結構:皮層柱。它們不是一團雜亂纏繞的連接,而是大量重複出現、彼此之間有強烈抑制作用的功能組件,這種大面積的抑制機制,讓每一個組件都能相對獨立地完成學習。

3. 光本該是答案,我們卻把它換成電,再換回去

Chaubard 認為,光學計算很可能才是正確答案。數據中心裡,信號本來就是以光的形式傳輸的——先通過光纖跑到交換機,轉換成電信號去尋址,再轉換回光,送進數模轉換器,然後又變回光,經過一次模數轉換後再變回光。在這個反覆轉換的過程里,99.99%的能量被白白燒掉。既然如此,為什麼不乾脆全程用光來完成計算?這樣不僅幾乎瞬時,也幾乎不耗電。他說這更接近他想像中外星文明的計算方式,但也坦言這只是眾多可能性之一——神經形態計算同樣令人興奮,它試圖用模擬電路去模仿大腦的工作方式。不過無論光學還是神經形態,都繞不開同一個難題:用光或模擬信號來儲存比特,成本極高、實現極難,這意味著無論哪條路,都很難直接套用現有的反向傳播框架。

4. 他抱著一本零階優化教科書,從頭實現了每一種方法

在轉向另類硬體之前,Chaubard 把博士生涯的大部分時間用在了另一件事上:另類的優化方法。博士頭六個月,他找來一本零階優化的教科書,把書里的每一種方法都親手實現了一遍。設定很簡單:訓練一個 10 億參數的 LSTM 做下一詞預測,看哪種更新規則效果最好。

最後勝出的方法叫 SPSA(同步擾動隨機逼近),幾乎沒什麼人知道,除了發明者 James Spall 和他的學生。原理並不複雜:對模型參數做兩次正向傳播,分別沿一個隨機方向加上和減去一個很小的擾動半徑,得到一個有限差分,再按這個差分的大小去更新對應方向的參數——差分為零就不更新,差分很大就大幅更新。這套方法也被稱為有限差分法或中心差分法,本質上是同一件事的不同叫法。它最大的優點是不需要梯度,因此在不連續的損失函景上也能照常優化。對比之下,反向傳播在一些非利普希茨的函數上很容易陷入局部極小值,而零階方法能更快地找到真正的谷底。

5. SOMA:把全世界的 GPU 都變成一個個獨立的小專家

有了優化器,下一個問題是:用什麼架構訓練、在什麼硬體上訓練。Chaubard 發現 LSTM 和 transformer 其實都是為反向傳播而生的——LSTM 的設計初衷就是讓梯度能夠順利流動,而 transformer 的並行化訓練方式,本質上是為 GPU 和反向傳播量身定製的。既然現在已經不需要梯度,這兩種架構也許都不是最優選擇。

基於這個思路,他提出了一個名叫 SOMA(Sharded Optimization Mixture of Assemblies)的設想,靈感正來自前面提到的皮層柱結構:把 Common Crawl 這樣的數據集先做聚類切分成許多小塊,每一塊打包分發給全球各地、分布在不同集群里的一塊塊 GPU,每塊 GPU 只訓練一個很小的 LSTM"專家",參數量大約 4 萬左右。測試階段再把這些小專家重新匯聚起來,用一個輕量的路由模組把輸入分配給合適的專家,效果類似混合專家模型,區別在於這裡混合的是一個個完整的小模型,而不是一層層的前饋網路。

但這套方法也有明顯的天花板:零階優化器估計出的梯度誤差,會隨著模型規模增大而變得越來越不准。換句話說,這套方法目前還撐不起一個百億參數級別的模型。

Chaubard 沒有把這當作一個已經解決的問題,更像是拋出一連串正在進行中的實驗:零階優化不需要反向傳播,SOMA 不需要巨型集中式模型,光和神經形態硬體也不需要傳統的 GPU。回到那場晚宴上的提問——外星人怎麼計算他們的浮點運算——答案或許根本不在於造出更快的晶片,而在於重新想像計算本身可以長什麼樣子。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新