宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

讓KV Cache流動起來,中科曙光用ParaCache為大模型「吐字」提速

2026年09月02日 首頁 » 熱門科技

使用大模型時,往往要先等待片刻,才能看到第一個Token生成。但第一個Token出現,後續內容便會持續、流暢地輸出。這還要從背後一項關鍵的工程機制KV Cache說起。

中科曙光把提升推理效率的突破口放在了KV Cache上。8月28日,在2026中國國際大數據產業博覽會期間,中科曙光提出從「存數據」到「存智能」的概念,發布新一代詞元加速方案ParaCache。該方案聚焦大模型推理的Token交互場景,為企業帶來計算性能提升、計算成本降低、技術生態適配三大收益。

為什麼KV Cache值得專門做一套管理方案?因為一次完整的推理過程,通常可以分為Prefill和Decode兩個階段。Prefill階段負責處理輸入內容,並生成相應的KV Cache。進入Decode階段後,模型會基於這些結果逐個生成Token,形成用戶看到的連續輸出。

在實際應用中,不同請求之間經常存在重複內容。如果能夠保存並復用已經生成的KV Cache,模型便可以減少重複計算,釋放更多GPU算力。中科曙光分布式儲存產品部總經理石靜表示,通過KV Cache「以存換算」,已經成為業界提升推理效率的一條重要路徑。

但新的問題隨之出現,KV Cache會占用大量顯存,尤其是在長上下文和高並發場景下,如果全部存放在HBM中,很快就會觸及容量上限。即使GPU仍有計算餘力,也可能因為顯存不足而無法承接更多請求,這就是大模型推理過程中常說的「顯存牆」。

破解「顯存牆」主要有兩個方式:一是在算法和模型側壓縮KV Cache,減少其占用空間;另一個是將KV Cache從HBM卸載至容量更大的CPU DRAM、SSD或分布式儲存。

因此,KV Cache需要在不同儲存層級之間進行統一管理和調度,但這一過程中也出現了兩個瓶頸。一是缺少全局視角,不同層級的元數據相互割裂,KV Cache難以在多個推理實例之間共享,也無法實現準確調度;二是分布式儲存雖然具備共享和池化優勢,但受訪問延遲等因素影響,目前大多只能作為冷數據倉庫使用。

ParaCache的思路,正是讓KV Cache在不同儲存層級和計算節點之間高效流動。

ParaCache管起整個KV Cache池

KV Cache被視為推理過程中沉澱下來、可以重複利用的「智能化數據」,需要一套貫穿不同儲存層級的管理機制。

ParaCache能夠統一管理GPU顯存、CPU內存、固態硬碟和分布式儲存,根據使用頻率對計算結果進行分層存放和智能調度,並支持在不同請求、不同計算節點之間共享,實現「一次計算、多次使用」。

從架構上看,ParaCache覆蓋四個儲存層級:L1對應GPU HBM,L2對應CPU DRAM,L3包括本地SSD和集中式全閃儲存FlashNexus,L4是基於POSIX協議的曙光分布式儲存ParaStor。「目前ParaCache已經實現L2、L3和L4的池化,並對不同層級中的KV Cache進行全局管理和動態調度,打破各層之間的元數據孤島。」石靜說道。

讓KVCache流動起來中科曙光用ParaCache為大模型吐字提速

ParaCache通過業界主流的vLLM、SGLang等推理框架就可以無縫對接上層應用。無論採用Prefill與Decode一體化部署,還是在GPU側對KV Cache進行分類管理,ParaCache都能夠提供相應支持。

在具體的調度過程中,ParaCache還可以與推理框架的調度層配合,提前預測下一次請求所需的KV Cache。如果相關數據位於L3或L4,系統可以在請求到來前完成調取,減少數據遷移對響應時間的影響。

L3層除了常見的本地SSD,ParaCache還將面向推理場景的FlashNexus Neo集中式儲存納入這一層級,使多個計算節點能夠共享同一套儲存資源。實際測試顯示,在延遲、吞吐量和並發請求處理等指標上,綜合表現達到了本地SSD方案的兩倍。

L4層是基於曙光ParaStor F9000,並進行了一系列針對KV Cache的優化。例如,首先是將部分Offset覆蓋寫調整為追加寫,減少寫入帶來的延遲;其次是對分布式鎖進行輕量化處理,按目錄取消部分鎖機制,降低強一致性和排他鎖對訪問效率的影響;最後在PD分離架構下僅傳輸增量KV Cache,從而減少集群網路頻寬消耗。

ParaCache還通過XDS打通加速卡與分布式儲存之間的數據通路。XDS可以同時支持GPU和國產加速卡,使KV Cache可以直接在L1與L4之間卸載和回遷,繞過CPU DRAM和本地SSD。優化使得ParaStor在L4層也能夠直接參與KV Cache調度,具備承載生產級推理業務的能力。

首詞元時延最高降低98.5%,詞元吞吐量提升27倍

ParaCache讓KV Cache從「用完即棄」的臨時數據,變成可反覆調用的數據資產。ParaCache帶來的價值,可以概括為「多、快、好、省」。

「多」:高並發場景下,系統每秒處理的詞元量最高達到原來的27倍,同樣的硬體資源能夠承接更多業務請求。

「快」:輸入約12萬詞元時,單輪對話開始回答前的等待時間最多可降低98.5%至0.4秒;連續20輪對話中,這一時間也降低超80%,由43.1秒降至4.9秒。

「好」:兼容主流推理框架和國產AI加速卡,可在現有系統基礎上接入,降低部署和遷移成本。

「省」:高頻內容保留在顯存,其他內容轉移至成本更低的儲存設備,減少對高成本顯存和新增硬體資源的依賴。

KV Cache復用的價值,在多輪對話和Agent應用中更為明顯。隨著對話不斷推進,此前生成的KV Cache可以被後續請求重複調用,從而減少重複計算。

ParaCache也進行了多輪對話場景的測試,初始輸入長度分別設置為30K和120K,並在此基礎上連續進行20輪對話,每輪增加0.5K輸入。測試結果顯示,在約12萬詞元輸入下,ParaCache可使模型開始回答前的等待時間最高降低98.5%;

測試還模擬了多輪對話下的高並發請求。與KV Cache全部存放在HBM中的方案相比, ParaCache加速方案,使系統每秒處理的詞元量最高達到原來的27倍。

目前,ParaCache已經進入實際業務。ParaCache支撐某頭部網際網路廠商的在線推理業務,模型開始回答前的平均等待時間降低50%以上;在同等硬體條件下,系統可承載的業務請求也提升數倍。

針對具體的行業案例,在某銀行的信用卡及辦卡業務中,超節點與ParaCache配合使用,使並發吞吐量提升約3倍;在教育行業的RAG知識庫和智能助學場景中,部分測試的並發能力提升了15至20倍。

「從大模型訓練、在線推理,到自動駕駛、具身智能讓KVCache流動起來中科曙光用ParaCache為大模型吐字提速和智算中心,ParaStor積累的儲存實踐成為ParaCache的重要基礎。」石靜強調。當KV Cache成為可管理、可復用的數據資產,分布式儲存也由此進入大模型推理的核心鏈路。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新