宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當推理撞上「內存牆」,Solidigm如何抓住AI工廠的新機遇?

2026年08月12日 首頁 » 熱門科技

KV Cache的激增,足以催生出一個全新的儲存市場,這是英偉達當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇CEO黃仁勛在GTC 2026上提及的一個重要判斷。

當大模型越來越大、能力越來越強,並逐步通過Copilot、智能體等形態進入企業應用,推理開始從幕後走向台前。相較於模型訓練,模型推理發生得更高頻、更持續,也更直接關係到企業AI應用的成本與體驗。

作為全球AI產業的風向標,英偉達已經意識到,模型推理太貴、上下文管理太重,正在成為大模型規模化落地的新瓶頸。於是,在其AI基礎設施技術棧中,一個以太網連接、專為KV Cache優化的快閃記憶體層被提出,也就是G3.5層。

這背後並不只是多了一層儲存,而是AI基礎設施的重心正在發生變化。

過去,行業習慣用GPU數量、模型參數和集群規模來衡量AI能力,但在AI工廠當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇時代,真正決定系統產能的,越來越是數據能否快速、穩定、高效地抵達GPU。

這也意味著,儲存正在從數據中心的後台容量池,走向AI算力生產線的關鍵位置。

對於專注於面向數據中心、雲計算和AI工作負載研發儲存產品的Solidigm而言,這一變化不僅意味著SSD市場需求的擴大,也意味著儲存技術在AI架構中的戰略價值正在被重新定義。

當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇

01 AI工廠改變儲存角色

傳統數據中心更像通用IT基礎設施。

它的任務是承載資料庫、ERP、網站、虛擬化、數據分析、備份歸檔等多種應用,核心指標圍繞穩定運行、容量管理、批量計算、多租戶隔離和成本控制展開。

在這樣的體系中,儲存首先是數據容器。行業討論儲存時,通常談的是容量、可靠性、IOPS、吞吐、每TB成本和數據保護。儲存當然重要,但更多是後台系統,是支撐業務運行的基礎設施。

但AI工廠的提出,正在悄然改變儲存的角色。

什麼是AI工廠?

所謂AI工廠,實則一個原生AI的生產環境,旨在以工業規模將數據轉化為「智能」,通過可衡量的吞吐量持續訓練、微調和提供模型服務,以確保有效的推理。

當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇

它不是簡單運行應用,而是持續把數據轉化為模型能力、推理結果、token輸出、預測、推薦和智能體行動。

它更像一條智能生產線:數據被攝取、清洗、轉換、訓練、微調、評估、部署,再進入大規模推理和持續疊代。

因此,AI工廠關注的指標不再只是系統是否在線,而是訓練時間有多短、微調速度有多快、每秒生成多少token、GPU空閒時間有多低、每瓦能產生多少智能輸出、每次推理成本能否下降。

AI工廠的核心不是單塊GPU的峰值性能,而是從數據進入系統到模型輸出結果的端到端吞吐,計算、網路、內存、儲存、調度和軟體棧必須協同運轉,任何一個環節變慢,都會拖累整條生產線。

在AI工廠中,儲存成為AI生產線中對性能至關重要的一個環節,不再僅僅是一個儲存庫。

過去,儲存是「倉庫」,負責把數據放好。

現在,儲存更像「傳送帶」,必須持續、低延遲地把數據送到GPU。

接下來,儲存還會逐漸成為擴展內存層,承載推理上下文、KV Cache、向量檢索數據和智能體狀態。

這也讓企業級SSD的價值被重新審視,對於強於SSD儲存技術的Solidigm而言,AI工廠並不是簡單帶來更多容量採購,而是讓高性能、高密度、低功耗SSD開始進入AI系統的關鍵數據路徑。

當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇

與此同時,儲存行業的評價體系已經悄然改變,客戶不再只是問一套儲存系統有多少容量、多少IOPS,而會追問:

它能否提高GPU利用率?能否降低推理尾延遲?能否提升token吞吐?能否減少數據移動帶來的能耗?能否讓同樣規模的AI集群產生更多輸出?

也正因如此,英偉達提出了G3.5層的概念。

在傳統分層中,GPU HBM和系統內存負責最熱數據,本地SSD承擔緩存和熱數據,遠端文件系統、對象儲存、數據湖負責持久化和長期保存。但推理負載增長後,中間出現了一個新缺口,有些數據太大,無法長期放在HBM或DRAM里,有些數據又太熱、訪問太頻繁,不能放到遠端傳統儲存里慢慢讀取。

這個缺口,就是由G3.5層補齊,英偉達認為,G3.5層應該位於近GPU內存和後端共享儲存之間,面向機櫃級、低延遲、高容量的推理上下文儲存,它不是普通冷數據層,也不是簡單SSD緩存,而是為了AI推理中持續增長的上下文狀態而設計的新型快閃記憶體層。

對儲存行業來說,這意味著儲存不再只為保存數據而優化,而是要為生產智能而優化。

02 推理撞上「內存牆當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇」,高並發、長上下文成新瓶頸

在ChatGPT問世和百模大戰期間,大模型基礎設施的主要矛盾集中在訓練階段。

模型越來越大,訓練數據越來越多,GPU集群規模越來越龐大,行業自然把注意力放在訓練算力、並行通信和數據集吞吐上。

但隨著AI商業化深入,推理正在成為新的主戰場。

訓練是階段性的,推理卻是持續發生的,每一次用戶提問、每一次企業知識庫檢索、每一次智能體調用工具、每一次代碼生成或文檔分析,都會觸發推理。AI應用越普及,推理負載越會以高頻、高並發、長周期的方式增長。

更重要的是,今天的推理已經不再是一問一答。

在ChatGPT問世初期,大模型更像是一個聊天機器人,一個提示詞可能對應一次模型調用,到了Copilot和智能體階段,一個請求可能被拆解為理解任務、檢索資料、調用工具、生成中間結果、反思修正、再次調用模型,最後輸出答案。一次用戶交互背後,可能產生數十次甚至上百次的模型操作。

當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇

這讓模型推理場景呈現出四個鮮明特點:

第一,高並發,企業級AI服務需要同時響應大量用戶、應用和智能體任務,單個會話看似不大,但匯聚到系統層面,就會形成巨大的上下文工作集;

第二,長上下文,模型要處理更長文檔、更長對話和更複雜任務,KV Cache隨之膨脹,它保存模型生成過程中可復用的中間狀態,可以減少重複計算,但也會持續占用內存空間;

第三,小IO高頻讀寫,推理上下文、KV Cache、RAG檢索結果、向量索引和智能體狀態,並不總是大文件順序讀寫,而是大量小塊數據的頻繁訪問;

第四,低時延剛需,推理服務面對的是實時體驗,一次慢讀取、一次上下文調度延遲,都可能影響token生成速度,拉高尾延遲。

這些特點共同放大了行業長期存在的「內存牆」和「儲存牆」。

所謂內存牆,是指靠近GPU的高速內存容量有限、成本高昂,HBM和DRAM很快,但不能無限擴展。面對長上下文和高並發推理,系統往往不是先達到GPU算力上限,而是先遇到內存容量上限。

所謂儲存牆,是指傳統共享儲存或對象儲存雖然容量大,但離計算端較遠,延遲和網路路徑難以滿足token生成關鍵路徑上的實時需求。如果把活躍KV Cache或推理上下文放到傳統遠端儲存中,就可能出現不可預測的延遲波動,讓GPU等待數據。

當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇

這正是AI基礎設施的新現實,GPU仍然關鍵,但AI算力頂峰不再主要由GPU定義。

如果數據不能持續抵達GPU,如果上下文不能快速調入,如果儲存層延遲不穩定,再強的GPU也無法充分釋放性能。

這也解釋了為什麼快閃記憶體在AI推理中的位置會前移,過去SSD更多承擔本地緩存、熱數據加速和容量替代,但在長上下文、高並發推理場景下,SSD開始具備「有效內存擴展」的意義,它既比DRAM更具容量經濟性,又比傳統遠端儲存更靠近計算。

對於Solidigm而言,這正是其產品能力與AI新需求發生交匯的地方。

AI工廠需要的不只是更大的儲存池,而是在有限機架空間、功耗預算和時延約束下,提供更高密度、更穩定性能和更優能效的快閃記憶體基礎設施。

英偉達提出的G3.5層理論,也正是在為這個問題提供新的架構位置。

它將一部分推理上下文、KV Cache、多輪對話歷史和智能體狀態,放在比傳統數據湖更近、比DRAM更具容量經濟性的快閃記憶體層中,這樣既可以減少重複計算,也可以提高上下文復用效率,降低GPU等待時間。

換句話說,快閃記憶體正在從儲存介質變成AI有效內存的擴展層。

03 在新儲存體系中,Solidigm如何找到自己的位置

當AI工廠和G3.5層概念逐漸清晰並成為英偉達造就的又一個時代潮流後,一個自然的問題也隨之出現:什麼樣的儲存產品,才能真正承接這個新層級?

答案並不是單純更大或更快的儲存產品,而是要同時滿足AI推理對性能、容量、密度、能效和穩定性的複合要求。

推理規模化會持續拉動高容量SSD需求,長上下文、多輪對話、RAG和智能體工作流,會不斷產生KV Cache、向量索引、會話狀態和模型工件,僅靠DRAM和HBM承載並不現實,高容量NVMe SSD因此成為擴展上下文空間的重要選擇。

高並發推理也會提升對穩定低延遲SSD的需求,AI服務不只看平均吞吐,更看高負載下的尾延遲和服務質量,如果SSD能在真實混合IO場景下保持穩定讀寫性能,就能幫助減少上下文調度等待,提高GPU利用率。

與此同時,AI工廠還受機櫃空間、電力和散熱約束。單位機架能提供多少TB、每瓦能承載多少數據、能否減少數據搬移,會直接影響AI基礎設施的擴展效率。

這也意味著,SSD正在參與AI單位經濟性的優化。企業最終關心的是每次推理成本、每千token成本、每瓦token數。如果合適的快閃記憶體層可以減少GPU空閒、降低重算、提升並發和吞吐,它創造的價值就不只是降低儲存成本,而是優化整個AI服務成本結構。

在這樣的背景下,Solidigm的機會就不再只是提供SSD,而是以不同類型的企業級SSD,承接AI工廠中不同層級的數據訪問需求。

當推理撞上內存牆Solidigm如何抓住AI工廠的新機遇

從產品布局來看,Solidigm已經形成了比較清晰的產品路線圖,既包括面向性能敏感場景的D7-PS1010等產品,又包括面向高容量密度場景的D5-P5336。

D7-PS1010是一款PCIe Gen5 NVMe SSD,更適合高吞吐、低延遲、高並發的AI工作負載,放在AI工廠場景中,它可以服務於熱數據訪問、本地緩存、KV Cache卸載、RAG檢索、檢查點讀寫,以及對延遲更敏感的推理上下文調度。

如果放到英偉達的G3.5層儲存概念中,D7-PS1010對應的是性能敏感的熱路徑,當AI推理需要頻繁調入上下文、復用中間狀態、快速訪問向量索引時,高性能SSD就是維持推理連續性的關鍵部件。

而G3.5層不僅需要快,也需要足夠大的容量。

它要承載大量並發會話、長上下文狀態和動態KV數據,容量需求會隨著GPU數量、用戶規模和智能體複雜度同步增長。如果每個AI機櫃都需要更多快閃記憶體容量,那麼單位空間、單位功耗下能提供多少TB,就會成為關鍵指標。

這正是Solidigm的D5-P5336的價值所在。

作為高容量NVMe SSD,D5-P5336可提供高達122TB級別的容量配置,天然更適合AI數據湖、高密度訓練數據集、模型工件、向量資料庫和推理上下文容量池等場景,它的意義在於,幫助AI工廠在有限機架和功耗預算內,獲得更高的數據承載能力。

面向當下的AI工廠,Solidigm的產品布局很清晰:

GPU HBM和DRAM負責最熱、最即時的計算狀態,本地高性能NVMe SSD負責熱數據、緩存、數據混洗和低延遲訪問,G3.5層快閃記憶體負責機櫃級共享KV Cache、推理上下文和智能體狀態,後端數據湖和對象儲存負責長期數據、日誌、模型工件和歸檔。

在這個體系中,D7-PS1010更偏向性能敏感的熱路徑,D5-P5336更偏向容量密集的上下文與數據池,二者共同覆蓋了AI工廠對快和大的雙重需求。

AI工廠的競爭,不是單顆晶片的競爭,而是整個系統的競爭。

這其中,GPU決定計算潛力,但儲存決定這種潛力能否被持續釋放,英偉達提出3.5層儲存理論,本質上是在提醒行業,AI的下一輪擴展,不只發生在GPU內部,也發生在GPU之外的數據路徑上。

誰能讓數據更快、更近、更節能地抵達GPU,誰就能幫助客戶提高AI工廠的智能產出效率,而Solidigm要抓住的,正是快閃記憶體在AI推理鏈路中從後台走向核心的這一刻。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新