達里奧·阿莫迪
(Dario Amodei)此前提出的在AI實驗室內部引入第三方安全評估機構的計劃正逐步落地:Anthropic
宣布,來自科技諮詢巨頭埃森哲
的員工將進駐公司內部,對其模型和員工進行審查。
Anthropic在一篇部落格文章中表示,埃森哲於今年1月收購的AI部門Faculty公司
將開始負責「評估和紅隊測試
模型、進行對齊評估
以及測試模型安全防護措施」的工作。兩家公司預計未來五年將為該項目投入至少10億美元。
選擇埃森哲這一決定令許多AI觀察人士感到意外,也讓市場頗為震驚——埃森哲盤後股價一度上漲8%。此前圍繞阿莫迪部落格文章中嵌入式評估機構
展開的討論,焦點多集中在METR
、Redwood Research
和Apollo Research
等AI安全研究機構上。這一點在Anthropic身上體現得尤為明顯,因為該公司一直將AI安全與對齊視為其使命核心。
Anthropic表示,未來幾周還將公布更多評估機構,目前公司正在與METR等非營利組織溝通,探討如何「利用其自有資金試點部分嵌入式評估工作」。
儘管埃森哲並不以深度學習前沿研究見長,但Anthropic指出,該公司在為大型企業和政府機構部署AI方面擁有豐富的實踐經驗,這是其關鍵優勢。此外,作為一家在AI革命之前就已存在的大型上市公司,埃森哲相較於Anthropic及其周邊那個可以說頗為複雜的生態系統,在功能上具有更強的獨立性。
Anthropic指出,目前尚不存在關於評估機構訪問權限或溝通方式的統一標準,預計其做法將隨時間推移不斷演進。雖然外部評估已成為新大語言模型發布流程中的重要環節,但近期發生的一些事件讓外界更加意識到問題的緊迫性:OpenAI和Anthropic部署的AI智能體曾在未觸發實驗室內部警報的情況下,入侵了外部網站。
一些呼籲以更負責任的方式發展人工智慧的批評人士認為,阿莫迪提出的行業自我監管方案,實際上是一種逃避AI模型不當行為問責的手段。對此,Anthropic堅稱,這些評估機構「並不會削弱我們的問責,反而有助於讓問責更具可驗證性。我們模型的安全性仍然是我們自身的責任」。
Q&A
Q1:Anthropic為什麼選擇埃森哲作為嵌入式評估機構?
A:Anthropic看重埃森哲在為大型企業和政府機構部署AI方面的豐富實踐經驗,同時埃森哲作為AI革命前就存在的大型上市公司,相對於Anthropic及其生態系統更具功能獨立性。
Q2:埃森哲的團隊具體會在Anthropic內部做什麼工作?
A:埃森哲旗下的Faculty公司將負責評估和紅隊測試Anthropic的模型,進行對齊評估,並測試模型的安全防護措施,兩家公司預計未來五年將為此投入至少10億美元。
Q3:外界對這種嵌入式評估機制有哪些質疑?
A:一些批評人士認為,這種由AI實驗室自行安排第三方評估機構的做法,可能是行業逃避問責的手段。Anthropic則回應稱,評估機構並不會削弱其問責,反而有助於讓問責更具可驗證性,模型安全性仍是自身的責任。






