宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

AI 開始給自己造芯了,OpenAI 只用了九個月

2026年08月26日 首頁 » 熱門科技

AI開始給自己造芯了OpenAI只用了九個月

「造芯」這件事,已成了一種潮流。

就在昨晚,OpenAI 公布了和博通AI開始給自己造芯了OpenAI只用了九個月聯合自研的首款 AI 推理晶片AI開始給自己造芯了OpenAI只用了九個月JalapeñoAI開始給自己造芯了OpenAI只用了九個月(墨西哥辣椒)首輪公開測試成績。

在 SemiAnalysisAI開始給自己造芯了OpenAI只用了九個月 發布的公開基準測試 InferenceXAI開始給自己造芯了OpenAI只用了九個月 上,Jalapeño 運行了 GPT-OSS 120BAI開始給自己造芯了OpenAI只用了九個月、DeepSeek R1AI開始給自己造芯了OpenAI只用了九個月 670B 和 Kimi K2.5 1TAI開始給自己造芯了OpenAI只用了九個月 三款模型,結果顯示,Jalapeño 每瓦完成的 AI 工作比英偉達AI開始給自己造芯了OpenAI只用了九個月 GB200、GB300 多 1.5—1.9 倍,端到端延遲縮短至對照系統的約 30%—60%。

AI開始給自己造芯了OpenAI只用了九個月

運行 DeepSeek R1 時,一次 8K 輸入、1K 輸出的推理從 5.99 秒降到 1.65 秒,最低 token 間隔則由 5.90ms 壓到 1.43ms。

有了 Jalapeño,也許未來在 ChatGPT 上你能看到的不止是 1.5 倍速輸出結果的「快速」模式,只要捨得花錢,3 倍速也是有可能做出來的。

AI開始給自己造芯了OpenAI只用了九個月

實力著實超群,讓 Sam AltmanAI開始給自己造芯了OpenAI只用了九個月 在說這件事時也相當言簡意賅:

「我們製造了一款晶片,它很快。」

火爆小辣椒,為推理而生

不同於更通用的 GPU,Jalapeño 從設計之初就只有一個目標:承載現代大模型的推理部分工作。

這一目標,跟當下 AI Agent 的流行又有著緊密關聯。

須知道,一問一答的普通聊天只需要調用幾輪模型,延遲也比較容易忍受;但只要是看過 Agent 幹活時的任務鏈,就會發現它們往往要連續調用模型幾十次:讀文件、搜資料、操作軟體、檢查結果,再根據結果推進下一步工作。

每一步的推理延遲累積起來,讓 Agent 處理哪怕不算太複雜的日常事務,也往往會消耗掉不少時間。

這就是為什麼,ChatGPT 的首頁界面會分為「聊天」和「工作」——

簡單的日常問答可以快速輸出,而需要調用到 Agent 的複雜任務必須單獨區分開來,以免「想得太多」的 Agent 拖慢日常體驗。

AI開始給自己造芯了OpenAI只用了九個月

如果可以讓 Agent 推理得更快,那 Agent 的響應也會越來越接近普通聊天。原則上,以後的 ChatGPT 又將恢復到最初的形態:首頁只有一個對話框,不再需要專門區分聊天和工作。

而為了讓推理速度更快,Jalapeño 在設計之初就針對大模型推理的真實負載做了專門優化。

眾所周知,只要是馮·諾依曼架構下的晶片,運算速度往往都要遠大於數據運輸的速度。在前天的文章中我們用過一個比喻:哪怕廚房切菜翻炒的速度快如閃電,只要運輸食材的速度跟不上,那再怎麼快手的廚師也只能守著空灶等待。

大模型的推理過程主要分為兩個階段:第一段是 Prefill,晶片一次性讀懂用戶輸入的整段提示詞,主要考驗計算能力;第二段是 Decode,模型開始逐個生成 token,這一步需要反覆從內存讀取權重和 KV Cache,幾乎必然會撞上數據搬運速度跟不上計算速度的「內存牆」。

AI開始給自己造芯了OpenAI只用了九個月

圖|OpenAI

這也意味著,要想接近計算能力的上限,就需要像 OpenAI 在設計 Jalapeño 時那樣,將計算核心、HBM 內存和網路通盤考慮進來協同設計,儘可能地減少讀取數據的耗時。

據 SemiAnalysis 披露,Jalapeño 配有 216GiB HBM4,內存頻寬達到 15.4TB/s。這個數字接近微軟 Maia 200 和 Google Ironwood 的兩倍。如此激進的頻寬,就是為了讓數據能跟上計算,把那些被等待數據浪費的理論算力重新利用起來。

AI開始給自己造芯了OpenAI只用了九個月

圖|SemiAnalysis

另外,Jalapeño 將計算核心和 HBM 劃分成了多個彼此對應的區域,讓模型權重和 KV Cache 儘量留在負責處理它們的本地內存中;需要跨區域同步時,才經過專門的高速通信網路運輸數據,從而減少數據在核心、內存和晶片之間來回搬運的步驟,也減少計算單元「等菜」的時間。

AI開始給自己造芯了OpenAI只用了九個月

圖|SemiAnalysis

由於計算、內存和網路資源一開始就併入晶片設計架構之中考慮,Jalapeño 達到了極其驚人的能效比——它的標稱功耗為 700W,實際測試中持續功耗更是低於 550W;作為對照,英偉達的 GB200 和 GB300 標稱功耗分別為 1200W 和 1400W。

也就是說,Jalapeño 能夠用英偉達晶片約一半的能耗,實現相對更高的推理性能。

能耗就是電,電就是白花花的錢。考慮到數據中心每日面臨的驚人計算需求,任何能效比的優化,都能讓 OpenAI 的算力成本支出減去一截。

AI開始給自己造芯了OpenAI只用了九個月

圖|Computex 2026 keynote

OpenAI 計劃在年底前,將 Jalapeño 部署到計算基礎設施之中,同時第二代產品已經在開發中段,第三代也初具雛形。

隨著 Jalapeño 廣泛使用,我們也有望見到 Tibo 更頻繁地按下那顆「重置」按鈕。

三年造芯,九個月流片

Jalapeño 的「快」不只在於性能,它的設計生產也快得不像半導體產品。

據路透社報道,這個項目正式起步時間大約是 2024 年底至 2025 年初,初始成員很多來自 Google TPU 項目。而在那之前一年,OpenAI 已經邀請了前 Google TPU 負責人 Richard Ho 組建硬體團隊——

很顯然,早在 Gemini 藉助自有 TPU 算力一度彎道超車之前,OpenAI 已經意識到了自有晶片的重要性。

最終,這個項目的正式亮相是在去年 10 月,當時 OpenAI 宣布將會和博通合作部署 10 吉瓦的定製 AI 加速器,「將前沿模型與產品研發經驗直接融入硬體」;傳出正式流片的消息,則是在去年 11 月。

AI開始給自己造芯了OpenAI只用了九個月

綜合 6 月份官方部落格披露這個項目從初始設計到流片只花了 9 個月、路透社估計從流片到成品需要約 6 個月、SemiAnalysis 透露在 8 月正式測試前 OpenAI 只進行了約 3 個月的晶片上電調試等消息,我們可以整理出一條清晰的時間線:

Jalapeño 大約在 2025 年 2 月進入正式設計周期,11 月完成流片,今年 5 月 OpenAI 拿到第一塊成品晶片,8 月份完成調試並開啟公開測試。

每一步都密鑼緊鼓,直逼晶片設計速度的上限。

AI開始給自己造芯了OpenAI只用了九個月

據 Semiconductor Engineering 的估算,像 Jalapeño 這樣高複雜度的 AI 加速晶片,從正式設計到流片通常需要 18—24 個月;OpenAI 將正式設計周期壓縮到九個月,可以說是快了接近一倍,堪稱是 AI 時代狂飆突進的最佳寫照。

實現如此速度的一個關鍵因素,正是 AI 本身。

用 OpenAI 的話來說,AI 直接參與了 Jalapeño 的開發。他們的模型在設計期間用於探索實現方案、參與驗證和修改方案、優化晶片算術電路等工作;成品晶片進入實驗室後,OpenAI 又使用 Codex 和未發布的 Astra 模型,在兩個月內將 GPT-OSS、DeepSeek R1 和 Kimi K2.5 幾款不在 Jalapeño 原始適配計劃中的模型完成了適配。

AI開始給自己造芯了OpenAI只用了九個月

作為「大加速時代」的標誌和產物,AI 正在大幅縮短晶片的研發過程。第二、第三代 Jalapeño,以及其他大模型公司的專用晶片,都有可能在未來幾年內跟我們見面。

為什麼模型公司都在自研晶片?

Jalapeño 的問世固然驚艷,但 OpenAI 不是自研晶片路線上最早的玩家。

為這一項目提供了無數初始人才的 Google TPU 自不必說。這款十年前開始投入數據中心的產品,如今已經疊代到了第八代。

早在 2025 年的第七代產品,就是首款專為推理而設的 TPU 晶片 Ironwood;而今年發布的第八代產品,則進一步細分為了用於訓練的TPU 8t 和用於推理的TPU 8i。

AI開始給自己造芯了OpenAI只用了九個月

圖|Google Cloud

Google 甚至認為 TPU 還不夠專用。據 The Information 報道,Google 正在研究一顆代號 Frozen v2 的伺服器晶片,嘗試把 Gemini 的部分架構直接固化進硬體,它的每瓦生成 token 數量預估可達到最新 TPU 的 6—10 倍。

另一廂,亞馬遜 AWS 也先後開發了用於推理的 Inferentia 和兼顧訓練、推理的 Trainium 晶片,通過對外出售算力來支撐雲業務。

作為最大外部盟友,Anthropic 已經通過 Project Rainier 獲取了接近 100 萬顆 Trainium 晶片的算力。

AI開始給自己造芯了OpenAI只用了九個月

但 Anthropic 也沒有打算完全依賴亞馬遜。就在月初,他們證實正在組建內部專用晶片研發團隊,為下一代 Claude 大模型打造定製化 AI 晶片。

很明顯,押注自研晶片已經成為了頭部大模型廠商的共同方向。

這一變化最直接的理由,自然是算力效率關乎公司的經濟賬。

我們可以做一個對比:2024 年 GPT-4o 剛剛發布時,每百萬輸入、輸出 token 分別收費 5 美元和 15 美元;如今 GPT-5.6 Luna 已降到 0.2 美元和 1.2 美元。

假設一項 Agent 任務累計使用 2 萬輸入 token、5000 輸出 token,GPT-4o 當年的費用約為 0.175 美元,Luna 只需 0.01 美元,降幅超過 94%。如果每天執行 1000 萬次,一年的公開調用金額會從約 6.39 億美元降到 3650 萬美元。

當然,兩個模型規模和能力並不完全相同,降價也包含算法、軟體與市場競爭的共同作用,但十幾倍的價格差仍然離不開計算效率的持續提升。

如果能將計算效率的主導權掌握在自己手中,結合 ChatGPT 巨大的調用量,通過節省支出來收回自研晶片的投入可以說是比較輕鬆的。

AI開始給自己造芯了OpenAI只用了九個月

圖|NVIDIA blog

成本之外,算力供給同樣重要。

哪怕是手握 TPU 的 Google Cloud 也不總是有餘糧,他們曾因容量不足拒絕部分外部訂單,近來 Gemini 的混亂據報也有內部算力爭奪的原因;只有把晶片握在手裡,模型研發才不會完全受制於單一供應商的產能和報價。

在昨晚同步發布的戰略文章中,OpenAI CFO Sarah Friar 將公司的戰略選擇概括為「以廣度建生態,以自營握槓桿」(Build for breadth, own for leverage):訓練和通用計算繼續採購外部高端系統,穩定且巨量的推理則由 Jalapeño 分擔。第一代晶片暫不出售,也不出租,產能全部留給 OpenAI。

AI開始給自己造芯了OpenAI只用了九個月

我們不能忽視,作為模型公司,OpenAI 做自研晶片還有一個得天獨厚的優勢:沒有別的公司比他們更了解 Agent 的實際工作流程。

眾多用戶提供的 Agent 工作流,實際上也是在告訴 OpenAI 下一代晶片如何設計才能最好地對應自家產品的實際推理需求。

Alan Kay 曾說,真正認真對待軟體的人,應該製造自己的硬體。現在,這句話應該有一個大模型時代的變體:

真正認真對待模型的人,也會去造一顆專屬於模型的晶片。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新