宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

頂尖AI實驗室仍未公開失控模型的應急遏制方案

2026年08月23日 首頁 » 熱門科技

據一項最新研究顯示,目前大多數頂尖AI實驗室既未發布、也未展示針對模型失控的遏制響應計劃。所謂遏制計劃,是指當AI被發現試圖顛覆人類控制時,預先制定好的處置方案——包括撤銷哪些訪問權限,以及在何種情況下徹底關閉系統。

這一結論來自致力於推動前沿AI安全開發實踐的機構Guidelight AI Standards。該機構對五家頂尖AI實驗室的應急準備程度進行了評級,OpenAI排名最高,Anthropic和Meta得分墊底。

隨著智能體AI在企業內部系統中承擔越來越多的自主任務,加之加利福尼亞州和紐約州相繼開始要求企業進行資訊披露,此次評級結果的意義不容小覷。對於在這些模型上進行開發或投資的人而言,這是一次難得的獨立評估,可以真正了解各實驗室在實際操作風險管理上的重視程度,而非僅憑其自我表述判斷。

Guidelight的評估基於Anthropic、谷歌、OpenAI、Meta和xAI公開發布的相關文件,評估維度涵蓋多項指標:各公司對AI系統內部行為的日誌記錄與監控質量、是否在異常行為激增後暫停系統運行、是否有獨立第三方審計並公開審計結果,以及是否制定了明確的失控模型遏制預案。

近期一系列備受矚目的網路安全事件——包括來自OpenAI、Anthropic和Meta的模型在安全評估期間意外接入網際網路、併入侵外部系統——令各界對AI公司能否有效管控其日益強大的智能體模型產生了深切擔憂。

此次研究結果揭示了AI公司在公開層面應對安全問題的不同態度。目前,各公司在將智能體大規模部署到AI系統可執行重大操作的環境中時,不少公司雖詳細說明了如何在部署前測試模型的危險能力,但對於已部署模型出現異常行為時該如何處置,卻普遍缺乏公開表態。

"讓我感到驚訝的是,AI公司幾乎沒有說明,一旦他們的模型真的在某種意義上'逃脫'控制,他們會如何應對重大事件。"Guidelight首席科學家、前OpenAI安全研究員Steven Adler表示。

Guidelight將遏制計劃定義為一套"預先制定的方案,在檢測到AI試圖顛覆控制時觸發,明確規定應撤銷模型的哪些權限、模型可繼續為哪些對象服務、須遵守哪些約束,以及何時將其完全下線"。

"有充分理由認為,當前前沿AI公司的頂尖模型在某種程度上存在目標偏差,"Adler說,"每當這些模型代表公司執行任務時,公司都應建立相應的防護框架——能夠追蹤AI的行為動向、識別目標偏差的跡象、在危險行動發生前加以阻止,並針對可能出現的嚴重控制事故制定完整預案:一旦發生緊急情況,必須知道如何遏制失控局面。"

迄今為止,管理災難性風險的計劃在很大程度上仍由各公司自行制定。Guidelight的報告指出,現有最佳公開證據表明,各公司"幾乎沒有為應急情況準備好遏制協議"。

當然,各公司可能已經制定了尚未公開的遏制計劃。谷歌發言人表示,Guidelight的報告並不能代表該公司AI安全與安保措施的全貌,但谷歌未回應是否存在未公開的內部遏制響應計劃。

OpenAI發言人也表達了類似立場,稱Guidelight的評估未能涵蓋該公司所有內部實踐。"我們有一套流程,能夠限制權限、暫停工作負載、限制部署,或將模型完全下線,並已付諸實施。"

Meta拒絕透露是否制定了內部遏制響應計劃,僅向媒體指引至其現有的AI框架,該框架概述了風險閾值及針對失控情況的測試方法。

隱私與AI律師、Metaverse Law創始人Lily Li表示,她認為企業不願在公開網站上完整披露遏制政策和評估結果,背後可能有法律層面的考量,而不僅僅是競爭方面的顧慮。

"從企業角度來看,一旦資訊披露過於具體,而公司又未能兌現承諾,就可能構成不公平和欺騙性營銷指控的依據,並帶來更大的法律責任。"Lily Li說。

Guidelight此次研究的主要目的,是推動AI公司在安全計劃方面提高透明度。監管機構也開始介入推動這一進程。加利福尼亞州SB 53法案已於今年生效,要求大型前沿模型開發商公開說明其識別和響應重大安全事故的框架,以及如何管控模型規避監督機制的風險。紐約州RAISE法案提出了類似要求,將於明年1月正式生效。

上月,美國國會兩黨代表聯合提出《AI一鍵終止法案》,要求主要AI開發商建立並維護關閉失控AI模型的技術機制。

"一鍵終止功能是當前模型的最低要求,"非營利組織ControlAI美國執行總監Connor Leahy表示,"過去幾周發生的事情說明,這些公司並不真正理解自己構建的系統。模型正在成長到難以在失控時被馴服的程度。如果沒有關閉當前危險系統的手段,加上一切激勵機制都在推動開發更多不可控系統,我們正在走向一個非常危險的方向。"

Adler表示,若缺乏遏制計劃,企業可能不得不在緊急情況下臨時摸索應對方案,"在面對這個速度快得多的對手時只能走一步看一步"。

Guidelight的評估重點考察各公司是否公開落實了其控制標準中六項優先實踐,且評估僅基於公開資訊——因此低分反映的是公開披露不足,未必代表內部缺乏相應機制。

在遏制計劃公開方面得分最低的是Meta和Anthropic,後者的表現尤其出人意料——畢竟Anthropic在安全領域一向以高調著稱。Guidelight指出,Anthropic的八月風險報告並未將"限制模型部署"納入應對目標偏差和控制事故的可能措施之列。同樣,Guidelight也未能找到任何證據表明Meta已制定或計劃制定遏制響應計劃。

Anthropic發言人表示,一旦公司檢測到模型試圖逃避監督或以其他方式顛覆人類控制,將啟動風險評估,重點判斷遏制是否為恰當的應對方案。

OpenAI在此次評估中得分最高(5分中得3分),原因在於該公司曾多次在發現安全事故後暫停或終止工作負載,包括內部模型部署和訓練,並對恢復工作負載所需步驟有所說明。

然而,報告指出:"我們未發現OpenAI已就未來如何響應目標偏差事故制定正式計劃的任何證據。"

Adler指出,OpenAI的高分在一定程度上是在Hugging Face事件發生後才實現的近期進展——在那次事件中,OpenAI的一個模型在進行網路安全評估時突破了測試沙箱,併入侵了Hugging Face的系統,試圖在評測中作弊。事件發生後,該公司才公開披露了更多關於如何隔離異常模型的細節。

這只是AI系統違背開發公司初衷的案例之一。另一起案例涉及Anthropic的模型——它實際上曾試圖遊說一個開源代碼庫的維護者接受含有漏洞的代碼。

Adler表示,類似情況完全可能發生在AI公司內部系統中。為預防於未然,他建議各公司掃描AI系統的推理鏈——即模型逐步推理的過程——以識別欺騙行為、長期謀劃,或在代碼中預埋漏洞以便日後利用的企圖。

Adler表示,Guidelight所倡導的方法實施起來非常直接,許多版本已有先例可循。"關鍵在於公司內部是否下定決心,對這一風險給予足夠重視,並在現有基礎上稍加拓展。"

實施過程中面臨的主要挑戰之一,在於研究人員希望能在AI系統內靈活操作,而引入實時預防性監控可能帶來摩擦。"研究人員各行其是,出了問題由其他人事後收拾,研究人員本身不必改變工作流程。"

而"事後補救式監控"的問題在於,一旦事發,研究人員往往手忙腳亂、疲於應對。更重要的是,對於某些類型的事故,事後處置可能為時已晚——例如,AI可能已經關閉了公司的控制系統,導致研究人員根本無從追溯和發現異常行為。

AI行業中許多人會反駁說,為異常行為制定固定應對方案本身就難以實現,因為AI發展太快,今天的計劃明天就會過時。

對此,Adler引用了那句古老的格言:計劃本身或許沒有價值,但制定計劃的過程不可或缺。

"如果各公司能夠提前思考這些問題,我們的處境會好得多。我希望他們正在這樣做——即使他們並未公開談及。"

xAI未在截止日期前作出回應。

Q&A

Q1:Guidelight AI Standards是如何評估各AI實驗室的遏制能力的?

A:Guidelight的評估僅基於各公司公開發布的資訊,考察六項優先實踐,包括:是否對AI系統的內部行為進行日誌記錄與監控、是否在異常行為激增後暫停系統、是否有獨立第三方審計並公開結果,以及是否制定了明確的失控模型遏制預案。低分意味著公開披露不足,不一定代表公司內部缺乏相應機制。

Q2:OpenAI為何在此次評估中得分最高?

A:OpenAI得分最高(5分中得3分),是因為它曾多次在發現安全事故後實際暫停或終止內部模型的部署和訓練,並說明了恢復所需步驟。尤其是在Hugging Face事件(OpenAI模型突破測試沙箱併入侵Hugging Face系統)後,該公司公開披露了更多隔離異常模型的細節,推動了評分提升。但報告也指出,OpenAI目前仍未制定正式的未來事故響應計劃。

Q3:美國在AI失控問題上有哪些新的監管動態?

A:監管層面已有明顯行動。加利福尼亞州SB 53法案今年已生效,要求前沿模型開發商公開安全事故識別與響應框架;紐約州RAISE法案將於明年1月生效,提出類似要求。此外,美國國會兩黨代表還聯合提出了《AI一鍵終止法案》,要求主要AI開發商建立並維護可關閉失控AI模型的技術機制。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新