宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

十萬加速器規模下,為什麼Google說FLOPS是個虛榮指標

2026年10月07日 首頁 » 熱門科技

這是一場關於"什麼才真正撐起AI算力"的對話。嘉賓Amin Vahdat十萬加速器規模下為什麼Google說FLOPS是個虛榮指標是Google的AI基礎設施首席技術專家,去年底剛被任命統領這個體系。採訪由紅杉資本的Sonya Huang十萬加速器規模下為什麼Google說FLOPS是個虛榮指標主持,播出於2026年10月。

對話發生在一個特殊的節點:Google今年的資本支出預計超過2000億美元,大部分投向數據中心建設,這是人類歷史上規模最大的一次基礎設施投資。Vahdat站在這場建設的最前線,他給出的答案很具體——當集群規模衝到十萬塊加速器,衡量一套系統好不好用,早就不能只看晶片的理論算力了。

1. 一個儲存機架10千瓦,一個AI機架卻要幾百千瓦

AI數據中心和普通數據中心的外殼幾乎一樣:混凝土、電氣間、機械間、冷卻系統、一排排配電設備、龐大的網路和儲存基礎設施。Vahdat說,真正的區別在於"專用化"的程度。

傳統數據中心是一筆20到30年的長期投資,建築要撐得住好幾代硬體的更替——伺服器、儲存、網路,可能還有一些加速器,但硬體壽命通常只有六年左右,所以要為很多代硬體留出空間。AI數據中心則相反,建築本身常常是跟著特定硬體一起設計出來的。

原因是功率密度差太多了:一個儲存機架大概是10到40千瓦,放在同一排的TPU十萬加速器規模下為什麼Google說FLOPS是個虛榮指標或GPU十萬加速器規模下為什麼Google說FLOPS是個虛榮指標機架輕鬆就是幾百千瓦,未來幾年可能更高。網路也是同樣的邏輯,一個儲存機架需要的頻寬——尤其是用硬碟的情況下——跟一個AI機架相比幾乎可以忽略。想讓整棟樓里什麼硬體都能隨便換著放、幾十年都通用,結果往往是建得太大、太冗餘。Vahdat的判斷是,AI數據中心會越來越專用,連冷卻和配電都要跟著硬體一起協同設計。

2. 一張機櫃照片,意外成了全網最受歡迎的帖子

Google給紅杉資本投資的公司Ineffable Intelligence十萬加速器規模下為什麼Google說FLOPS是個虛榮指標交付了一套大型Vera Rubin集群十萬加速器規模下為什麼Google說FLOPS是個虛榮指標,Sonya Huang提到自己看到交付照片時的感受——像在看人類歷史上最偉大的建築工程之一。Vahdat也認同,說那是"美的化身",哪怕只是幾排機櫃。

真正讓人意外的是,Google把這張照片發到社交媒體後,引爆關注的不只是"Ineffable拿到了一套頂級集群"這件事本身,更多人是單純被照片裡光纖布線那種近乎分形的結構美感打動。Vahdat說,這是Google有史以來反饋最熱烈的帖子之一。

3. FLOPS十萬加速器規模下為什麼Google說FLOPS是個虛榮指標只是理論上限,Google真正在意的是goodput十萬加速器規模下為什麼Google說FLOPS是個虛榮指標

無論是FLOPS還是其他晶片層面的指標,本質上都是理論值——在某些理想條件下,一塊晶片能跑出的算力上限。Vahdat的態度很直接:這些數字很少真正決定一個工作負載的實際表現。真正重要的是算力利用率,也就是對某個具體任務來說,理論峰值里到底有多少被實際用上了。

這就引出了Vahdat口中的"goodput"這個概念:吞吐量衡量的是你理論上能跑出多少工作量,但goodput扣掉了因為故障、重算、等待恢復而浪費掉的那部分,衡量的是你真正把答案送到手裡花了多長時間。他舉了一個類比——解一道題分四步,如果因為中間出錯要退回第一步重來,你確實還在"工作",這算吞吐量,但這不是goodput,goodput看的是你解出答案總共花掉的時間,包括所有因故障浪費的時間。

訓練、服務、還有長程agent工作負載大多是同步的,成百上千甚至十萬個組件要在微秒或毫秒級別彼此協調。只要有一個節點失敗,整個任務就可能被拖住——所有組件都在等著彼此完成自己那部分工作,才能湊出最終答案。一旦出故障,還要定位哪個節點出了問題,找到此前某個時間點的檢查點十萬加速器規模下為什麼Google說FLOPS是個虛榮指標,再重啟,最壞情況甚至要從頭開始。Vahdat說,Google對自己的要求是看實際交付的goodput,而不是理論上的基準吞吐量或者"理論上應該很好"這種說法。

4. 十萬塊晶片的規模下,故障是家常便飯

goodput這個詞目前是Google內部用語,但Vahdat說行業里已經越來越多人開始採用。十萬塊加速器規模下故障有多頻繁?他給出的判斷是:這個規模下,故障大概率每天會發生多次,具體配置下甚至可能每小時就有一次。

每一塊晶片都站在製造工藝的最前沿,而且早已不是單顆晶片這麼簡單——很多情況下是由兩顆、四顆、八顆甚至更多chiplet十萬加速器規模下為什麼Google說FLOPS是個虛榮指標組合而成的封裝,外面還掛著HBM、網路連接、甚至封裝內光學互連。會出故障的環節非常多,而當你把十萬塊這樣的硬體堆在一起,總會有什麼東西出問題。

問題不在於某一類固定的故障原因,而是沒有單一的主因。如果真有一個常見的故障原因,Google早就該把它解決了。每次推出新產品,總會冒出新的坑:有時是網路問題,比如這些硬體之間如何以超高速互聯;有時是硬體本身的問題;但很大一部分問題出在軟體層——編譯器的bug、運行時的bug、模型本身的問題,或者作業系統層面的問題。哪怕硬體做到完全可靠,這些軟體層面的問題照樣會拖累整個系統的實際表現。

這場對話里,Vahdat反覆強調的其實是同一件事:在一場動輒兩千億美元的基礎設施競賽里,衡量成敗的標準不是賬面上堆出來的算力數字,而是十萬塊晶片在真實故障環境下,到底能把多少工作量變成答案。這正是Google在這場史上最大規模的資本支出競賽中,給自己設下的那道及格線。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新