對話還沒進入正題,Alex Zhang
就已經把底牌亮了出來:Claude Code
、Codex
、Pi、Prime Agent
——這些看起來各有門道的智能體工具,在他眼裡其實是一回事。更關鍵的那句話緊跟其後:模型的真實能力比我們現在看到的高得多,問題不在模型,而在"沒有試得夠狠"。這是一句不留情面的判斷,也是整場對話的底色。
Alex Zhang 是 MIT 在讀博士,因 Recursive Language Models
(RLM)的研究被更多人認識,同時也是 GPU Mode
社區的核心成員之一。他與 Latent Space
主持人 swyx
的這次對談,從他最早一頭扎進 GPU 編程的經歷講起,順著 KernelBench
、AI 生成核心代碼這條線,牽出一個這段時間被反覆驗證的現象:當算力和模型都已經觸手可及時,真正稀缺的東西變了樣。
1. 一場無聊的實習,催生了一個社區
Alex 第一次接觸 GPU Mode(當時還叫 CUDA Mode)純屬意外。他在 Snapchat 實習時負責 Rexus
項目,"我當時對 Rexus 感到非常無聊",於是轉頭去研究能不能給 Google 那篇 Infinite Attention 論文寫專用核心。項目本身沒做出什麼結果,但他因此認識了 Mark Saroufim 和社區里一批後來深度綁定的人。
這個由 Mark Saroufim 和 Jeremy Howard 在 2023 年創立的 Discord,起初只是一個教人寫 GPU 核心的學習社區,辦講座、答疑。真正讓它脫胎換骨的是 Mark 提出的 Popcorn 項目——也就是今天大家看到的排行榜雛形。驅動這個想法的直覺很簡單:GPU 編程和競技編程(competitive programming)高度相似,優化手法的空間出奇地小,值得被優化的核心種類也並不多。如果能像 Codeforces 那樣積累百萬級的問題庫,GPU 核心的開發也可以被規模化、自動化——KernelBench 正是從這個想法里長出來的。
這件事對研究者的意義被 Alex 點得很直接:像 Mamba 這樣的論文,必須隨論文一起放出配套核心,否則這篇工作在實踐中根本用不起來,而不是所有團隊都配得起一個專職寫核心的人。
2. GPT-5.6 把核心效率提高到足以讓 Luna 便宜 80%,但排行榜第一名靠的不是它
GPU 編程這個領域的飽和速度超出了 Alex 的預期。他還記得 2023 年在普林斯頓聽 Tri Dao 講 Flash Attention 時的震撼——那時候寫核心還是一件極度小眾的事。而現在,"幾乎所有人都在寫核心",用他的話說,這個領域在某種意義上已經接近飽和。
最近的大新聞之一,是 GPT-5.6 寫出的核心效率提升明顯,讓 Terra 和 Luna 相關負載的成本降低了 80%。與此同時,GPU Mode 排行榜上也出現了不具備任何核心寫作背景的人,靠自動化研究循環刷新紀錄。看上去,人類專家的壁壘正在被迅速填平。
但排行榜本身揭示了另一面。社區里一位長期活躍、被公認為"超強核心寫手"的成員 Gaurst,這次也用上了 AI 輔助——但他只是去引導、推動 AI 往特定方向走。結果是:在排行榜前十名里,只有他的方案在實際端到端系統里保持穩定,而且代碼行數明顯更短。GPU 核心一直存在驗證難題,獎勵黑客(reward hacking)從 KernelBench 發布起就是老問題,很多看似更快的方案根本經不起真實系統的檢驗。
3. 一個人的直覺,能抹平一萬億 token 的暴力搜索
這不止是 GPU 核心領域的特例。Alex 把這個觀察擴展到更廣的 AI 系統:即便是最近的數學證明類工作,也不意味著數學家被淘汰——那些公司仍然僱傭數學家,不管是做數據標註,還是去引導模型解決問題。懂行仍然有巨大的 alpha。
這種 alpha 具體是什麼?Alex 的回答是幾種能力的混合:對問題的直覺、拆解問題的方式,以及知道怎麼把這套直覺轉譯給 AI 去執行。他舉了自己的習慣做例子——寫代碼之前先畫圖,圖里有看不懂的地方就停下來搞懂,否則不允許往下走。懂問題的人同時也更懂怎麼用 AI,因為他們本質上在扮演一個"強驗證者"的角色。
真正讓他覺得重要的是這句判斷:"有時候你可以在一個問題上燒掉一千億甚至一萬億 token,但如果找來一個真正懂這個問題的人,他們能幫模型發現一些東西,直接抹平那一萬億 token 的消耗。"這個趨勢具體怎麼量化,他承認並不清楚,但現實世界裡還有大量問題等著被解決,沒有人能負擔得起對每個問題都無限制地堆算力——效率仍然是這件事裡極其重要的一環。
4. 物理極限算得出來,但沒人能保證夠得到
對話的最後一段,落回到一個更基礎的問題:GPU 核心的性能有沒有一個可以用物理定律直接算出來的"正確答案"?Alex 的回答是——有,但計算過程不總是簡單的。對矩陣乘法這類任務,可以相對容易地估算出一個"光速"級別的理論上限:假設數據傳輸、內存布局等條件都是理想狀態下,最快的核心能跑多快。
但這個估算本身依賴一堆假設——數據是從 CPU 出發,還是已經在 GPU 的 DRAM 里,都會讓這個理論數字發生偏移。更關鍵的是,Alex 補充了一句不留餘地的判斷:在很多情況下,根本不清楚這個理論上限是否可能被實際達到,因為它預設了完美的重疊調度和數據傳輸,而現實系統很少能做到這一點。
對話到這裡被截斷,但線索已經足夠清晰:AI 寫代碼的速度和規模正在指數級增長,可它離那條"光速"曲線還有多遠,答案往往不在模型里,而在真正懂問題的人手裡。






