宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

面向AI工廠時代的躍升,AMD發布Instinct MI400系列GPU與CDNA 5架構

2026年07月24日 首頁 » 其他

在Advancing AI 2026大會上,AMD正式發布了Instinct MI400系列GPU,這是其數據中心GPU的最新一代產品,目前有面向前沿AI和AI工厂部署、適合大規模AI訓練與推理的MI455X,以及面向高精度、高性能科學計算的MI430X。

面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構

AMD  Instinct MI455X是此次大會上的主角之一,其基於AMD第五代計算專用GPU微架構CDNA  5打造,在計算性能、內存系統、可擴展性、能效和安全等多個方面相較上代產品有明顯提升。據AMD提供的資訊顯示,在MI455X中,其XCD計算核心將採用2nm工藝製造,FCD和IOD核心則採用3nm工藝製造,電晶體總數達到3200億個,通過CoWoS-L封裝技術將8個XCD、2個IOD和2個FCD與12組HBM4顯存集成於同一封裝內。

面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構
面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構

MI455X相比MI355X雖然延續了8個XCD的設計,但XCD中的計算單元(CU)被替換為全新的工作組處理器(WGP),共計配置有256組WGP,Wave64執行架構也被Wave32執行架構所取代,進一步降低了指令延遲、分支分歧懲罰和寄存器壓力,更適合延遲敏感型計算任務。

面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構

在峰值算力方面,MI455X在MXFP4和MXFP8數據格式下達到40  PFLOPS和20  PFLOPS的水平,相比MI355X均實現了4倍提升,同時新增原生BF16向量數據類型支持、MXFP4分數縮放功能以及tanh等超越函數指令,且現有超越函數指令的吞吐量亦實現了翻倍,顯著加速了激活函數和softmax等關鍵機器學習運算。

面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構

顯存方面,MI455X將從MI355X的8組HBM3E(288GB,8TB/s頻寬)升級為12組HBM4(432GB,23.3TB/s頻寬),HBM4顯存將每堆棧接口位寬從1024-bit翻倍至2048-bit,內存容量提升1.5倍,峰值頻寬提升約2.9倍。同時L2緩存將從上一代的32MB大幅擴展至192MB(6倍增長),實現54TB/s的總緩存頻寬,每個WGP的本地數據儲存(LDS)容量翻倍至384KB,全GPU合計96MB。此外,MI455X還將引入了多播內存操作,即單次內存讀取可同時廣播至多個WGP單元,有效減少冗餘內存流量;Tensor   Data Mover新增LDS與DRAM之間的直接傳輸能力,無需經過中間寄存器暫存,進一步降低數據搬運開銷。

面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構

基於CDNA 5面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構架構打造的MI445X在可擴展性上的提升尤為明顯,MI355X僅提供有7條Infinity  Fabric鏈路,總Scale-Up頻寬為1.07TB/s,通常是以8個GPU節點為單位組建集群;而MI455X則配備了36條UALoE面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構(Ultra  Accelerator Link over Ethernet)鏈路,每條鏈路提供400Gb/s雙向頻寬,單GPU  Scale-Up頻寬達到3.6TB/s,是MI355X的3.4倍。因此藉助UALoE架構,單一共享內存域中可連接72個MI455X,同時AMD還引入了分離式DMA架構,前端單元自動將傳輸請求拆分並分配至UALoE接口的後端單元,通信庫無需感知底層拓撲。

MI455X的Scale-Out頻寬同樣大幅提升。MI355X僅配備一個400Gb/s的Scale-Out NIC,而MI455X支持最多三塊AMD  Pensando Vulcano 800  AI-NIC,提供600GB/s雙向Scale-Out頻寬,相當於是MI355X的6倍。此外MI455X還具備16通道Infinity  Fabric總線,與第六代EPYC 9006 SP7處理器(Zen 6架構,最高256核)連接時可提供256GB/s雙向頻寬,CPU可獲取對GPU內存的硬體一致性緩存訪問。

綜上所述,CDNA 5架構與Instinct MI455X可以說是AMD在AI GPU領域的一次重大升級,從4倍算力提升到近3倍內存頻寬增長,從8  GPU節點到72 GPU共享內存域,配合開放標準的Helios方案面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構和ROCm面向AI工廠時代的躍升AMD發布InstinctMI400系列GPU與CDNA5架構軟體棧,AMD正在憑藉自身實力證明,在不依賴封閉生態的前提下同樣可構建支撐前沿AI的基礎設施。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新