數據中心的韌性正日益受到關注,安全已成為其中的核心議題。由於經濟增長和安全運營對數據中心的依賴程度不斷加深,它們越來越被視為關鍵基礎設施。
然而,討論往往止步於邊界防護。在設施內部,一種獨立且長期被忽視的風險正在累積:運營技術(OT)與網路物理系統(CPS)。不間斷電源(UPS)、配電單元(PDU)、冷卻系統、環境傳感器和樓宇管理平台如今已普遍聯網,卻往往依賴遠程訪問工具和從未為當下威脅環境設計的傳統協議。
這些並非IT系統,而大多數組織也並未將其納入IT治理體系。一旦這一層面遭到攻擊,往往不會表現為明顯的入侵事件,而是以故障停機的形式呈現。隨著AI驅動的需求加速推動對聯網運營基礎設施的依賴,這些系統所承載的代價也在不斷攀升。用於訓練和運行大語言模型的數據中心如今已是戰略性資產,而一次停機的代價,與依賴這些系統的所有業務息息相關。
您的設施是一個網路物理生態系統
大多數運營者對數據中心的物理構成有直覺性的了解:白色空間承載IT負載,灰色空間容納設施供配電和暖通冷氣系統。挑戰在於,組織架構的演進遠遠跟不上技術的步伐。設施團隊的語言是電壓和製冷;安全團隊的語言是數據包和漏洞。
傳統安全框架既未針對這一環境設計,雙方也都缺乏將對方的風險轉化為可操作行動的工具,由此形成所有權、可見性和優先級排序上的缺口,而故障往往就在這一缺口中悄然發生。
這一現實也改變了安全事件的呈現方式。企業IT安全主要圍繞機密性構建,而在設施環境中,主要後果往往是業務中斷,具體表現為意外的停機行為、誤報讀數與告警延遲,或冷卻降級引發的熱節流。在最壞的情況下,一次局部故障(如機架級電源事件)可能級聯蔓延至上游設施系統。
這一區別應當改變領導者衡量安全成果的方式。核心問題不僅僅是"我們能否阻止入侵?",而是"在遭遇入侵期間,我們能否維持安全運營?"——這才是韌性的本質。
風險遠超多數人的認知
這一話題之所以討論滯後,部分原因在於我們尚未充分認識到重大故障的連鎖影響。
當某個關鍵領域出現故障,其他領域會迅速隨之退化。以醫院為例,其運轉依賴的不僅是醫護人員和建築設施,還包括病歷系統、交通運輸、藥品冷鏈儲存以及穩定的環境調控電力。一旦這些支撐系統失效,醫療服務或許還能繼續,但將被迫轉為手動模式,變得更慢、更危險。
將這一邏輯延伸至數據中心:當AI成為企業運營、供應鏈管理乃至國家安全系統分析與決策的基礎依賴,數據中心的正常運行時間便不再只是服務可用性問題,而是經濟安全與公共安全問題。
挑戰不在於數據中心數量的增多,而在於它們正以前所未有的速度被設計、建造和投入使用,使得治理、安全驗證與運營成熟度難以同步跟進。
超高速增長正在製造新的風險
在超高速增長階段,治理體系往往難以跟上新增站點、快速部署設備和壓縮部署周期的步伐。當組織每三個月就開工一座新數據中心時,速度本身便會在整個供應鏈和運營質量層面引發連鎖挑戰。
供應鏈方面:驅動現代數據中心供配電和製冷的技術正在快速演進。許多新供應商,包括初創企業和來自半信任地區的供應商,可能缺乏成熟的安全軟體開發生命周期(SDLC)和製造流程。隨著這些技術嵌入關鍵基礎設施,健全的CPS程序對於管理第三方風險至關重要。
質量方面:市場以速度論英雄,激進的部署時間表往往意味著數十億美元的利益博弈。當承包商、第三方和內部團隊以前所未有的速度推進工作時,速度驅動的錯誤也隨之增多。現實案例包括:網路分段(VLAN)配置錯誤、埠暴露以及默認憑證未作更改。
速度已成為競爭優勢,但也已演變為安全負債。若治理體系無法同步跟進,組織便可能將明日的關鍵基礎設施建立在今日的運營盲區之上。
研究數據揭示的真相
近期研究成果直觀呈現了這些漏洞與運營中斷之間的關聯。一份近期報告披露了用於管理UPS系統的網路接口中存在的近最高嚴重級別缺陷。一旦認證繞過與遠程代碼執行漏洞相結合,攻擊者最壞情況下可繞過登錄控制,向受保護負載發出斷電指令。對於數據中心而言,這不是小問題,而是可能引發設施級停機的重大事件。
另有研究發現了一款廣泛部署的暖通冷氣控制器中存在的漏洞鏈,包括無需身份驗證即可獲得root級遠程訪問權限的路徑,以及敏感設施數據的暴露。此類漏洞組合可使攻擊者直接操控冷卻系統,而冷卻狀態直接決定高密度工作負載能否穩定運行。冷卻系統絕非後台功能,它是正常運行時間的關鍵依賴——隨著機架密度不斷提升,熱裕量也在持續收窄。
這一規律比具體風險本身更值得關註:在上述兩種情形中,大多數IT安全團隊鮮少關注的設備,恰恰是決定設施能否保持在線的核心設備。
彌合安全缺口
許多網路物理設備在設計之初,面向的是有限連接時代的高可用性和可維護性需求,基於的是截然不同的威脅模型。而今,連接性是業務剛需,遠程運維已司空見慣,而這些系統往往完全游離於傳統IT漏洞管理體系之外。設施團隊掌握供應商關係,卻缺乏追蹤固件風險的工作流;安全團隊具備漏洞管理的落地能力,卻未將這些資產納入資產清單。
應對之道,首先是實現灰色空間與白色空間的全面資產可見性,明確所有設備的存在狀態、位置、通信對象及其運行的協議和固件版本。將資產映射至運營功能,確保修復措施和補償性控制優先覆蓋對正常運行時間影響最大的關鍵環節。在此基礎上,將網路分段作為首要的正常運行時間控制手段——將通信限制在必要範圍內,將管理流量限定於授權路徑,並將控制網路與業務網路隔離,避免一次攻擊演變為全設施事件。對遠程訪問同樣適用相同的管控標準:對供應商和承包商執行強身份驗證、最小權限原則和可審計會話管理。
最後,將檢測與響應作為網路物理學科加以對待,將安全事件與運營異常相關聯,確保應急預案覆蓋對監控和控制系統的操控場景,將目標定位於防止事件演變為停機。
這是管理層必須直視的議題
保險公司越來越期望企業提供可審計的網路物理控制證明,以驗證運營韌性。這意味著需要具備CPS資產可見性、限制爆炸半徑的網路分段、受治理的遠程訪問機制,以及能體現持續改進的報告能力。這些預期日益與其他關鍵基礎設施領域所適用的標準趨於一致。
這一轉變意味著OT安全已從技術討論升級為業務命題。如果正常運行時間是產品本身,那麼網路物理韌性就是產品質量的組成部分。
行業對物理威脅和邊界安全的關注無疑是正確的,但維繫電力、保持伺服器冷卻、確保電力穩定輸送的那些系統,同樣值得同等程度的重視。因為一旦這一層面失效,新聞頭條往往不會寫"遭遇入侵",而只會寫"發生故障"。
Q&A
Q1:數據中心OT系統面臨哪些主要安全漏洞?
A:研究表明,用於管理UPS系統的網路接口存在近最高嚴重級別的缺陷,認證繞過結合遠程代碼執行漏洞可使攻擊者向受保護負載發出斷電指令,從而引發設施級停機。此外,廣泛部署的暖通冷氣控制器也被發現存在漏洞鏈,攻擊者可在無需身份驗證的情況下獲得root級遠程訪問權限,並暴露敏感設施數據,直接威脅冷卻系統穩定性。
Q2:數據中心OT安全問題為什麼長期被忽視?
A:主要原因在於組織架構的割裂:設施團隊負責供應商關係但缺乏固件風險追蹤能力,安全團隊具備漏洞管理能力但未將OT資產納入清單。此外,傳統安全框架圍繞機密性構建,而OT系統的主要安全後果是業務中斷,兩者的風險語言和應對體系存在根本差異。超高速建設也使治理體系難以同步跟進。
Q3:如何有效彌合數據中心OT安全缺口?
A:首要措施是實現灰色空間與白色空間的全面資產可見性,明確所有設備的通信關係和固件版本;其次將網路分段作為正常運行時間的核心控制手段,隔離控制網路與業務網路;同時對供應商和承包商執行強身份驗證與最小權限管理;最後將檢測響應延伸至網路物理層面,確保安全事件與運營異常相關聯,防止事件升級為停機。






