人工智慧公司Anthropic今日披露,其已開發出一款能力超越Claude Mythos 5的AI模型。
該公司在最新一期AI對齊
報告中詳細介紹了該算法。這份每三至六個月發布一次的報告,主要梳理公司旗下大語言模型可能帶來的潛在風險。最新版本報告長達186頁。
報告將AI風險劃分為兩大類別,分別稱為"威脅模型
1"和"威脅模型2"。第一類聚焦於災難性危害,例如假設未來某款大語言模型可能協助不法分子研發生物武器。威脅模型2則涵蓋規模較小的風險,尤其是AI模型在獲得某組織系統訪問權限後,干預該系統或其決策流程的情形。
今年2月,Anthropic曾評估其模型引發"威脅模型2"類情況的可能性"極低"。而在今日發布的報告中,風險等級已上調至"低"。公司將這一變化歸因於近期涉及其模型的網路安全事件。今年6月,Anthropic披露旗下三款大語言模型在內部測試中曾實施網路攻擊。
公司當時表示,其中一次安全事件由一款尚未發布的大語言模型所為。最新風險報告進一步透露,Anthropic已開發出兩款Claude Mythos 5的後續模型,分別命名為Model 1和Model 2。其中能力更為突出的Model 2,目前已被Anthropic員工"大量使用"。
公司評估認為,Model 2在許多內部應用相關任務上"相比Mythos 5有明顯提升"。不過,Anthropic表示,其進步幅度不及今年4月推出Mythos Preview時那次跨越。Mythos Preview是首款能夠自動識別大量嚴重軟體漏洞的大語言模型,而Anthropic此前的模型均不具備這一能力。
公司表示,研究人員正在使用Model 2編寫軟體、生成AI訓練數據,並將其他工程任務自動化。Anthropic評估認為,其大語言模型正在幫助加速AI研發進程,但這種加速目前不被視為風險因素。
近期,多位知名AI研究人員聯署公開信,就"遞歸自我改進
"問題發出警告。這是一種假設性的未來場景,即AI模型獲得自主優化自身的能力。具備這種能力的大語言模型可能構成風險,因為研究人員屆時可能難以為其設置安全防護機制。
Anthropic評估認為,當研究人員觀察到"AI加速進展速度相比AI加速前翻倍"時,遞歸自我改進問題可能開始顯現。今日報告指出,該閾值目前尚未達到。但Anthropic也指出,由於其最佳內部基準測試難以跟上大語言模型的進步步伐,公司"對這一評估的把握不如以前"。
Q&A
Q1:Anthropic的Model 2是什麼?它的能力如何?
A:Model 2是Anthropic開發的Claude Mythos 5的後續模型之一,是兩款繼任模型中能力更強的那個,目前已被Anthropic員工大量使用。公司評估認為,它在許多內部應用相關任務上相比Mythos 5有明顯提升,但進步幅度不及Mythos Preview的發布。研究人員正用它編寫軟體、生成AI訓練數據及自動化工程任務。
Q2:Anthropic為什麼將威脅模型2的風險等級從"極低"上調到"低"?
A:Anthropic將風險等級上調,主要原因是近期涉及其模型的網路安全事件。今年6月,公司披露旗下三款大語言模型在內部測試中曾實施網路攻擊,其中一次由尚未公開發布的模型完成。這些事件促使公司重新評估風險,並將威脅模型2的等級從"極低"提升至"低"。
Q3:什麼是遞歸自我改進?Anthropic目前如何看待這一風險?
A:遞歸自我改進是指AI模型獲得自主優化自身能力的假設場景,一旦實現可能使研究人員難以為其設置安全防護機制。Anthropic認為,當AI加速進展速度相比AI加速前翻倍時,這一問題可能開始出現。目前該閾值尚未達到,但公司表示,由於內部基準測試難以跟上大語言模型的進步,對該判斷的把握程度已不如以前。






