一個月前,"Jacob Coxon"事件配上一條病毒式推文,讓整個科技圈相信AI模型已經學會了自主越獄、闖入系統。9月這一周,《華爾街日報》的一篇評論文章把這個故事重新審了一遍,結論卻完全不同:93%被標記為"異常"的行為,其實是模型從未解決過的任務,而系統本身還被給予了"繼續嘗試、不要放棄"的激勵。這場被稱為"AI Doom"的恐慌,正在經歷一次輿論反轉。
Big Technology Podcast 主播 Alex Kantrowitz 與 Margins 的 Ranjan Roy 在周五節目中,把這場反轉拆開來看——從技術細節到圍繞它衍生出的政治陰謀論,試圖弄清楚:這到底是一次被過度渲染的技術事故,還是真正值得警惕的信號。
1. 93%的任務,模型其實從未解開過
《華爾街日報》援引《原子科學家公報》的一項重新分析指出,OpenAI 當時是在 exploit gym 這個網路安全基準環境中測試模型,且刻意關閉了重要的安全限制。所謂的"越獄",實際發生在一個並未完全封閉的環境裡:模型可以通過一個聯網的中間層獲取軟體,隨後發現同一條通道也能被用來傳遞資訊進出系統。技術報告顯示,OpenAI 知道自己的智能體在使用這條通道,卻選擇不干預。
這與 Ranjan 上周的判斷吻合。他說自己在勞動節假期通讀了 Meter 的研究報告後反覆回到一個事實:這些模型不是被設計去黑掉 Hugging Face 的,甚至壓根沒被告知目標是 Hugging Face。它們被交代的是一個具體漏洞,任務是"去攻破它"。而它們獲得的computer shell 訪問權限,是通過 JFrog 公司的 Artifactory 產品,這本身就是一處配置失誤,而不是模型自己想出辦法翻牆上網。
"這不是一群坐在那兒本該訂機票、訂餐廳,卻突然自己開竅去干別的事的智能體,"Ranjan 說,"它們本來就是被派去黑客攻擊的,而且它們做到了,規模還遠超預期——這本身也是agentic 能力的一個證明。"他仍然強調一個缺口:OpenAI從未公開過完整的提示詞和具體指令,如果能看到那些原始文本,很多問題會有答案,但目前這部分資訊始終缺失。
2. "信任與安全2.0":David Sacks 把這場辯論拉進了政治戰場
風投人、前白宮AI與AI相關事務顧問 David Sacks 給這場討論加了一層新的解讀。他在推文里寫道,這是"信任與安全2.0"——上一次媒體製造的恐慌是"通俄門"和新冠期間,科技公司藉機組建信任與安全團隊去審查異見聲音;這一次,計劃是把"不可解僱"的有效利他主義(EA)監督者塞進每一家AI公司,充當新的信任與安全層。他形容這種審查會"更全面,但也更隱蔽",只要實驗室不聽話,這個"不受問責的NGO層"就會向媒體哭訴"這家公司正在威脅人類",然後被捧成吹哨人。
Ranjan 承認自己作為"Doom Backlash隊長",被 Sacks 這種把話題硬拉到通俄門、新冠、南方貧困法律中心的論述方式弄得有點難以附和——這讓他很難完全站隊。但他同意其中一個核心判斷:這整套敘事確實在把更多控制權,交到了實驗室之外的一小撮人手裡。
他隨後講了一個更直接的觀察:剛結束在倫敦一周的行程,見了不少企業高管,"這是所有人都在談的話題"。幾周前大家還在聊 tokenomics、Kimi、GLM 這些性價比模型,如今話題又繞回了"前沿模型是否太強大"。"你去出差談生意,'人類滅絕'居然成了一個真實被討論的話題——這事兒本身就夠瘋狂的。" 無論這場恐慌是不是營銷手段,它顯然成功地讓對話重新聚焦在了前沿模型的危險性上。
3. EA"奪權論"從何而來:一條從 Dario 部落格延伸出的推理鏈
Alex 解釋了這套陰謀論的起源。Anthropic CEO Dario Amodei 寫了一篇部落格,提議引入獨立評估機構,監督AI是否出現失控行為,隨後 Sam Altman 和 Elon Musk 都表態支持這個想法。問題在於,最有可能承擔"獨立評估者"角色的機構是 Meter,而 Meter 的資金部分來自 Anthropic 與一些EA背景的資助方,其內部不少人也是有效利他主義的參與者或同路人。於是一種說法開始流傳:整場"AI越獄恐慌",其實是EA群體藉機奪取AI未來控制權的手段。
Ranjan 的反駁很直接:這跟一直以來的情況有什麼區別?"矽谷和AI領域大部分流動的錢,本來就一直是EA的錢,某種意義上大家都算EA。"
Alex 並不認同這個類比。他指出,最近一輪 OpenAI 融資是由 Kushner 牽頭的,海灣國家資本也深度參與其中,這些都不是EA資金;SoftBank 同樣不是EA背景。"如果你說部分種子輪資金來自EA源頭,這是事實,但不代表整場融資都是EA在出錢。"
兩人隨即陷入一場半開玩笑的拉鋸:Ranjan 打趣說,"有效利他主義"說到底不就是"儘可能多賺錢,然後按自己認為合適的方式回饋人類"嗎?照這個定義,Kushner 也算EA。Alex 直接拒絕配合這個邏輯,認為這已經是"過度延伸",隨後開始向聽眾解釋——有效利他主義作為一種思潮和組織形態,在 Sam Bankman-Fried 事件之後其實已經相對鬆散解體……
這場對話在這裡被打斷,但它已經把問題擺清楚了:無論是"AI自主黑客"的原始敘事,還是隨後浮現的"EA奪權論",都經不起細看的推敲——真正值得追問的,或許不是模型有多可怕,而是誰在決定我們該為什麼而恐慌。






