宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Claude Code自動模式將成為默認設置:人類審批效率遠不及AI

2026年08月12日 首頁 » 熱門科技

在Claude Code早期,用戶面臨兩難困境:要麼對每一步操作手動審批(極為繁瑣),要麼完全放開權限(風險極高)。

今年早些時候,Anthropic推出了自動模式,通過一個獨立的分類器模型,讓Claude自主判斷哪些操作存在風險、需要人工介入。

從8月14日起,自動模式將成為Pro、Max和Team用戶的默認設置(企業用戶及Claude API和雲平台用戶暫時仍需手動開啟,計劃在未來一個月內完成默認推送)。原因很簡單:研究表明,人類在頻繁的權限審批中表現並不理想。

Anthropic自身的研究數據顯示,用戶目前對97%的權限提示選擇了批准。

Anthropic指出:"儘管大多數提示可能對應安全的常規命令,但如此高的批准率表明,許多用戶是在不加審查地機械點擊,而非認真評估每條命令。"

在超過1000名測試人員參與的測試中,研究團隊發現:人類僅識別出13.6%的危險命令,而處於自動模式的Claude Code識別率高達89%。

隨著測試時長增加,人類測試者的表現持續下滑。在經歷50次提示後,測試者僅能發現5%的危險命令。

Anthropic認為,減少權限提示的頻率,反而能讓用戶在真正出現提示時更認真地閱讀和評估。

在實際運行中,當分類器標記某條命令時,自動模式會直接攔截,而非請求用戶批准。隨後,Claude通常會尋找更安全的替代方案,或將該操作提交給用戶明確審批。

系統還設有兜底機制:若連續攔截3次,或單次會話內累計攔截20次,自動模式將把控制權交還用戶,切換回手動審批。

Anthropic還指出,隨著智能體任務時長不斷延伸,自動模式大幅降低了用戶在執行多小時任務時持續"盯屏守候"的負擔。

在此次發布前,Anthropic還對自動模式進行了全面加固。

其中最關鍵的改進是"硬性拒絕ClaudeCode自動模式將成為默認設置人類審批效率遠不及AI"機制。Anthropic表示,分類器被設計為永不批准數據外泄行為,例如將代碼或密鑰發送至外部目標。若開發者需要執行此類操作,必須手動退出自動模式或親自運行命令。

企業還可以自定義"硬性拒絕"規則,針對特定操作設置永久禁止,即便用戶主動發起請求也不例外。

分類器現已內置明確規則,規範密鑰和機密數據的訪問與共享方式,並在執行git push或pull request前檢查目標倉庫是公開、私有還是受信任的——畢竟,同一次推送操作,根據目標不同,可能是常規操作,也可能構成數據外泄。

此外,分類器在執行git reset --hard等破壞性命令前,會先讀取倉庫的git狀態,確保自動模式了解即將丟棄哪些未提交的工作。同時,API端還新增了一個探針,用於掃描Claude從網頁、文件和工具輸出中獲取的內容,檢測提示注入攻擊ClaudeCode自動模式將成為默認設置人類審批效率遠不及AI,並在發現異常時向Claude的上下文添加警告。

為驗證上述加固效果,Anthropic與Apollo Research開展了為期兩周的紅隊測試,將合成攻擊注入真實工作流程。加固前,分類器遺漏了12%的攻擊;加固後,在留存測試集上,這一比例降至7%。

Anthropic此次也藉機與最大競爭對手OpenAI進行了對比。當然,若結果不理想,Anthropic不會主動公布。Anthropic委託第三方機構測試了自動模式在防禦提示注入攻擊方面的表現。

Trajectory Labs的測試結果顯示:在Anthropic模型的自動模式下,720次攻擊嘗試無一成功突破(即便在權限完全繞過的情況下,Claude Sonnet、Fable和Opus 5也僅放行了0.09%的攻擊)。

相比之下,OpenAI的GPT-5.6 Sol在Codex的完全訪問模式下放行了19%的攻擊,在自動審查模式下也有近6%的攻擊得以通過。

不過,Anthropic自身也坦承,自動模式是一個分類器,而非萬無一失的保障——它能降低風險,但無法徹底消除風險。對於生產基礎設施的高風險變更,Anthropic仍建議保留人工審核環節。

除權限機制更新外,Anthropic還於同日宣布:並行運行的多個Claude Code會話現在可以相互通信。這對於多個會話協同處理相關問題、需要同步代碼變更的場景尤為實用。

Anthropic在X平台解釋道:"現在無需在另一個會話中重新說明情況,只需告知Claude去同步即可。它會發送一份摘要(不包含歷史記錄或文件),另一個會話便能在任務進行中接收並繼續。"

Q&A

Q1:Claude Code自動模式是如何判斷哪些操作需要攔截的?

A:自動模式使用一個獨立的分類器模型來評估每條命令的風險。當分類器判定某操作存在危險時,會直接攔截而非請求用戶批准,隨後Claude會尋找更安全的替代方案或提交用戶明確審批。分類器內置了針對數據外泄、密鑰訪問、破壞性git命令等場景的明確規則,並可由企業自定義額外的硬性拒絕規則。

Q2:自動模式的安全性和OpenAI相比怎麼樣?

A:根據第三方機構Trajectory Labs的測試,在Anthropic模型的自動模式下,720次提示注入攻擊無一成功突破;即便權限完全繞過,攻擊通過率也僅為0.09%。相比之下,OpenAI的GPT-5.6 Sol在完全訪問模式下放行了19%的攻擊,自動審查模式下也有近6%通過。不過Anthropic也強調,自動模式只能降低風險,無法完全消除風險。

Q3:自動模式對哪些用戶是默認開啟的?企業用戶怎麼辦?

A:從8月14日起,自動模式將成為Pro、Max和Team用戶的默認設置。企業用戶以及通過Claude API和雲平台使用的用戶暫時仍需手動開啟,Anthropic計劃在未來一個月內完成這部分用戶的默認推送。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新