波士頓科學公司(Boston Scientific)目前仍在應對兩周多前一次網路攻擊帶來的後續影響,這次攻擊波及了公司系統,並擾亂了製造、訂單處理和物流出貨等環節。
這家生物技術工程與製造公司在恢復運營方面已取得實質性進展。截至9月5日,大多數生產設施已恢復製造,主要配送中心的處理和出貨速度已達到或超過正常水平。但恢復進程並未完全消除此次事件帶來的後果:波士頓科學公司在周一提交給投資者的8K文件中表示,此次事件可能對公司第三季度及全年業績產生重大影響,公司此前的銷售額和調整後利潤預測目標恐難以實現。
IT系統恢復與業務表現之間的這種差距,凸顯出CIO在任何網路攻擊事件後都可能面臨的棘手問題:讓系統重新上線,並不等同於讓業務恢復正常運轉。這兩個節點之間可能相隔數周,有時甚至很難被量化衡量。
那麼,"業務已恢復"到底意味著什麼?
這個答案比"系統恢復百分比"這類指標更難量化。它要求CIO將技術環境與依賴該技術運行的業務流程聯繫起來,同時要考慮安全性、運營能力,以及系統恢復後仍可能長期存在的財務影響。
企業中"恢復"定義的重塑
工業數據AI基礎設施平台NexGenomics聯合創始人愛德華·利比格(Edward Liebig)表示:"讓系統重新上線是一個技術里程碑,而恢復則是一個業務成果。"
IT團隊在實現技術層面恢復方面並不缺乏衡量指標和指導方案,例如應用程式何時可用、基礎設施何時恢復、數據何時恢復完畢等。難點在於,這些指標描述的是技術狀態,而非業務狀態。
IT諮詢與託管服務公司Ahead的安全服務副總裁祖莉·塔爾博特-哈伯德(Julie Talbot-Hubbard)認為,恢復工作不應從IT層面開始,而應從關鍵業務流程入手。這是因為,業務流程所涉及的系統很少能與IT技術棧的邊界完全對應。
她以訂單履行為例:訂單管理應用程式恢復運行後,如果庫存、生產、物流或發票開具等環節仍存在中斷,公司可能仍然無法完成訂單履行。
高管兼職諮詢公司Freeman Clarke的兼職CIO西蒙·拉特克利夫(Simon Ratcliffe)同樣認為,CIO應圍繞企業能否重新可靠地履行客戶承諾、運營承諾、監管承諾和財務承諾來定義"恢復"。他建議在事件發生之前,就將技術服務與業務價值鏈進行映射,這樣恢復團隊就能清楚哪些系統和依賴關係的組合能夠產生這些業務成果。
這就形成了一種不同的恢復衡量標準:不是看某個應用程式是否已恢復,而是看它所支撐的業務流程是否能夠達到可接受的運行水平。
基於影響後果確定優先級
一旦這些依賴關係被梳理清楚,恢復工作的優先順序可能也會因此改變。
最顯眼或技術上最重要的系統,未必是持續中斷會給業務帶來最大風險的系統。利比格認為,CIO應該從需要保護的業務成果出發進行反向推導,思考需要哪些人員、系統、設備和資訊的組合,才能將該業務成果的影響控制在可接受的範圍內。
利比格表示:"正確的恢復單元不是單個伺服器或應用程式,而是能夠產生並交付可接受業務成果的最小完整運營路徑。"
這種思路會顯著改變恢復工作的優先級。對某些企業而言,安全性或產品完整性可能比營收更重要;而對另一些企業來說,當務之急可能是恢復那個正在造成最大財務或客戶影響的流程。
安全架構
公司BlueRadius(提供虛擬CISO服務)創始人傑夫·索維爾(Jeff Sowell)則更直接地表達了他傾向的優先級排序:"安全和營收第一,其他一切都是次要的。"
無論企業選擇哪種排序方式,關鍵在於要為恢復團隊提供一個決策依據,以便在無法同時恢復所有環節時進行權衡取捨。這也促使企業必須自己去定義什麼是"可接受的運營狀態",而不是把這一判斷留給危機中的IT部門去做。
向高管層呈現業務全局圖景
業務影響也應決定CIO如何向公司其他高管層匯報恢復情況。
拉特克利夫表示:"董事會並不關心某個資料庫是否已經恢復,他們想知道的是,客戶能否下單,產品能否正常製造和出貨,以及營收目標是否仍然可以實現。"
利比格認為,高管需要清楚了解當前的運營能力、尚未解決的依賴關係、積壓訂單和恢復速度、客戶或患者受影響情況、財務影響以及剩餘風險,還有哪些決策需要高管層授權。他表示,其目的是讓高管獲得"決策的信心,而不是虛假的精確感"。
這意味著要依據現有的實際數據。索維爾建議在向其他高管匯報進展時保持具體明確:領導層應該了解關鍵流程恢復運行的百分比、每天低於正常產能所造成的成本、下一步恢復工作面臨的阻礙、現實可行的時間表以及可能影響這一時間表的因素,還有哪些情況目前仍不明確。
即便預測結果並不樂觀,坦誠依然是最好的做法;拉特克利夫表示:"在恢復過程中表現得過於自信,可能比坦承認知上的不足更具破壞性。"
同樣重要的是,要認識到這些細節並非一成不變。索維爾建議向CFO提供一個財務影響的區間範圍,並定期更新,而不是將早期的估算當作最終結論來呈現。拉特克利夫同樣建議將財務影響視為一個隨恢復進程動態變化的評估,其中包括產能損失、出貨延遲和運營成本上升等因素。
即便運營已基本恢復,此前中斷事件造成的財務影響仍可能在業務中持續發酵。CIO必須將這一點納入他們對"恢復"的定義之中。
投入時間進行主動測試
如果一家公司事先建立了明確的框架,包括明確定義恢復標準,那麼恢復工作會更為順畏。但傳統的災難恢復演練存在一定局限性。當前的演練協議或許能證明備份系統有效、系統可以恢復,但並不能證明當這些系統、以及人員、設施、供應商或通信渠道都不可用時,企業依然能夠維持運營。
為糾正這一局限,塔爾博特-哈伯德建議將技術恢復測試與業務流程驗證相結合,並讓關鍵第三方參與相關演練。
她補充道:"測試還應該假定生產環境、身份驗證系統以及傳統的災難恢復環境可能已被攻陷,而不僅僅是不可用。"這類演練可以揭示出,當正常系統不可用時,員工是否具備所需的培訓、權限和操作流程來維持運營。
索維爾同樣主張進行貼近實戰的演練,建議CIO在演練中直接切斷某些系統,強制業務在沒有這些系統的情況下運轉,同時讓工廠經理、訂單管理負責人和財務主管等關鍵人員參與其中。他表示:"這樣你就能發現那些在真正的危機中會致命的電子表格、臨時變通方案和供應商依賴問題。"
這些演練所暴露出的問題,將幫助CIO在下一次危機來臨之前,建立一個更實用的"恢復"定義,並清楚了解企業必須具備哪些能力、能夠承受多大程度的中斷,以及從事件發生到恢復至可接受運營水平之間,還存在哪些技術和運營層面的依賴關係。
Q&A
Q1:網路攻擊後系統恢復上線就代表業務恢復正常了嗎?
A:不是。系統恢復上線只是技術層面的里程碑,而業務真正恢復運營是一個更綜合的業務成果,兩者之間可能相隔數周,需要綜合考慮安全性、運營能力和財務影響等多方面因素。
Q2:企業在網路攻擊後應該優先恢復哪些系統?
A:應該基於業務後果的嚴重程度來確定優先級,而不是按系統的技術重要性排序。專家建議從需要保護的業務成果出發反向推導,找出保障該成果所需的最小完整運營路徑,例如安全性、產品完整性或營收相關流程往往應優先恢復。
Q3:CIO應該如何向董事會匯報網路攻擊後的恢復進展?
A:應聚焦業務層面的具體指標,比如客戶能否正常下單、產品能否正常製造出貨、營收目標能否實現等,而不是僅匯報某個資料庫或系統是否恢復。同時應提供關鍵流程恢復比例、每日運營損失成本等具體數據,並保持坦誠,避免過度樂觀的預測。






