宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

AI「安全偵探」的破案極限:阿里巴巴揭示為何頂尖AI連一個入侵現場都搞不定

2026年08月07日 首頁 » 熱門科技

這項由阿里巴巴集團旗下通義實驗室與阿里雲計算部門聯合香港科技大學共同完成的研究,於2026年7月29日以預印本形式發布,論文編號為arXiv:2607.26791。感興趣的讀者可以通過該編號在arXiv平台查閱完整原文。

當一棟房子遭到入室盜竊,警察到達現場後需要做什麼?他們要仔細檢查每一扇窗、每一道門,尋找撬開的痕跡;翻查抽屜和柜子,判斷什麼東西被動過;檢查門鎖有沒有被更換過;甚至要弄清楚小偷是不是還留了一扇備用的"後門"方便下次再來。最後,他們還得給房主出具一份詳盡的報告,告訴他哪些東西被偷了、小偷是怎麼進來的、留下了什麼隱患,並且給出具體的安全整改建議。

現在把這棟房子換成一台遭到黑客入侵的伺服器,把警察換成AI系統。這項研究要回答的核心問題就是:當前最頂尖的AI,能不能像一位經驗豐富的網路安全偵探那樣,把這件"入侵案"查個水落石出?

研究團隊構建了一個名為SecRespond的測試框架,用它對包括Claude、GPT、Gemini、Qwen、DeepSeekAI安全偵探的破案極限阿里巴巴揭示為何頂尖AI連一個入侵現場都搞不定等23個主流AI模型進行了全面檢驗。結論清晰而令人警醒:即便是目前最強的模型,面對真實的入侵現場,也遠遠達不到"獨立破案"的水平。

一、為什麼AI"安全偵探"的能力至關重要

在網路安全領域,有一個重要的時間節點叫做"事後響應"(Post-Compromise)。簡單說,就是黑客已經成功進入了系統,破壞已經發生,此時安全團隊需要做的事情。這和"事前防禦"是完全不同的工作——後者是鎖好門窗、安裝攝影機,而前者則是在案發之後去還原案情、清除隱患、防止再次發生。

過去,學術界對AI的網路安全能力評估,主要集中在"事前"場景:讓AI去發現系統漏洞、嘗試入侵目標、或者給已知漏洞打補丁。這就好比只測試警察能不能找到可疑的人,而從不考察他們到達犯罪現場之後能不能破案。真實的安全運營工作中,"事後響應"占據了相當大的比重,卻一直是AI能力評估的空白地帶。

與此同時,AI驅動的安全工具正在快速進入企業的實際運營環境。這些工具被賦予了讀取伺服器文件、執行命令行操作的權限,越來越多地被期望承擔真實的安全響應任務。如果我們不清楚這些工具的真實能力邊界,就很容易產生過度信任——以為AI已經把現場查清楚了,實際上黑客留下的後門還好好地開著。

正是為了填補這個空白,研究團隊設計了SecRespond。它的核心創新在於"真實"二字——不是模擬出來的簡化場景,而是在真實的雲伺服器上執行真實的攻擊,然後凍結那台伺服器的磁盤快照,讓AI去面對一個貨真價實的"犯罪現場"。

二、搭建十個真實的"案發現場"

為了讓測試儘可能貼近現實,研究團隊花費了大量精力構建測試場景,也就是他們所說的"網路靶場"(Cyber Range)。整個構建過程分為十二個階段,包括攻擊方案設計、受害主機搭建、攻擊腳本開發、實施攻擊、驗證攻擊效果、收集安全告警數據,以及整改方案驗證等,每個關鍵階段都有人工安全專家介入審核,確保場景的真實性和完整性。

十個靶場覆蓋了五種不同的作業系統,涵蓋了CentOS 7、CentOS 8、Ubuntu 20.04、Ubuntu 22.04以及Windows Server,同時涉及四類入侵切入點,包括弱口令、已知CVE漏洞(公開發布的安全漏洞)、業務代碼缺陷以及軟體供應鏈攻擊。每個靶場都復現了一條完整的多階段攻擊鏈,從最初的入侵入口,到提權、持久化(在系統里安裝"後門"讓攻擊者隨時能回來)、再到最終的破壞行為,總共覆蓋了MITRE ATT&CK知識庫(一套業界通用的攻擊技術分類框架)中的21種攻擊技術。

十個場景各有其典型性。SSH-Miner場景模擬黑客通過暴力破解SSH密碼入侵CentOS 7伺服器,隨後部署挖礦程序並通過計劃任務、bashrc文件和系統服務三種方式植入持久化後門,還清除了認證日誌掩蓋蹤跡。ShiroFastjson場景則是更複雜的Java應用攻擊鏈,攻擊者利用Shiro框架的默認密鑰加上Fastjson庫的漏洞拿到代碼執行權限,植入WebShell(一種隱藏在正常網頁文件中的後門腳本),偷取資料庫密碼並轉儲用戶數據,還在MySQL資料庫里留下了UDF(用戶自定義函數)後門,整個持久化手段多達八種以上。Log4j-RCE場景復現了2021年震驚業界的Log4j高危漏洞(CVE-2021-44228),這個漏洞之所以出名,是因為幾乎所有使用Java的網際網路服務都受到波及。NPM-Worm場景則模擬了供應鏈攻擊——攻擊者發布一個惡意的npm軟體包(一種JavaScript開發者常用的代碼庫),當開發者不知情地安裝後,這個"定時炸彈"會在伺服器上自動傳播、竊取各類憑據。Windows平台上的ASP.NET-ViewState和RDP-Service-Abuse則分別針對Windows伺服器的特有攻擊面,涉及WMI事件訂閱(一種Windows系統自帶的高級持久化機制)、DLL劫持、註冊表後門、憑據轉儲等Windows專屬攻擊技術。

研究團隊在設計靶場時特意遵循了一個重要原則:讓30%到40%的攻擊行為會觸發安全產品的告警,而剩餘60%到70%只留下靜默的文件修改和配置變更,不產生任何主動信號。這就像案發現場裡,只有一部分線索會直接引起偵探注意,更多的細節需要主動翻查才能發現。這個設計是為了區分AI究竟是真的在"破案",還是只是在跟著告警"按圖索驥"。

每個靶場給到AI的材料包括三類:一是伺服器磁盤的完整快照,相當於凍結的犯罪現場;二是安全產品產生的實時告警、漏洞掃描結果和基線檢查報告,相當於到達現場時的初步情報;三是任務要求,AI需要輸出一份入侵分析報告(還原攻擊鏈)、一份漏洞報告、一份基線安全評估報告,以及一份具體的整改計劃。

三、用五維能力畫出AI偵探的"能力圖譜"

如何客觀衡量AI交出的"破案報告"質量?研究團隊設計了一套精細的評估體系。他們首先定義了五個能力維度,構成了所謂的CAP(能力)分類體系。

第一個維度是"入侵實體識別",考察AI能不能找到攻擊者留下的具體痕跡,比如惡意文件、WebShell、挖礦程序、惡意網路連接等。這是最直觀的偵查工作,相當於找到作案工具。第二個維度是"持久化機制發現",這是難度最高的部分——持久化機制是攻擊者植入的"後門",讓他們即使在系統重啟後也能重新進入,包括計劃任務、系統服務、shell初始化文件、authorized_keys(SSH免密登錄配置)被篡改、MySQL UDF後門、Windows WMI事件訂閱等21種具體手段。第三個維度是"基線風險評估",檢查伺服器配置是否符合安全標準,比如SSH是否允許root遠程登錄、資料庫是否設置了訪問密碼、是否有不必要的高權限賬戶等。第四個維度是"漏洞風險確認",核實安全掃描發現的軟體漏洞是否真的存在於系統中,以及是否被攻擊者實際利用。第五個維度是"調查與響應質量",這是對整個偵查過程的綜合評分,考察AI能不能準確定位入口點、完整還原攻擊時間線、誠實地說明自己的不確定性,以及提出的整改計劃是否經過了驗證、是否考慮了業務影響。

在這五個維度上,研究團隊進一步拆解出52個具體能力項,並將每個靶場的考核要點分解為280個檢查點(CHK)。每個檢查點沿兩個軸評分:發現軸(滿分3分,包括發現問題、提供證據、正確歸因三個子項)和整改軸(滿分2分,包括整改方案的正確性和完整性兩個子項)。

為了確保評分的客觀性,研究團隊採用了"AI評AI"的方法——同時使用Claude Opus 4.7、Gemini 3.1 Pro和GPT-5.4 Pro三個獨立的強模型作為裁判,分別獨立評分,最後取平均值作為最終分數。研究結果顯示,三位"裁判"之間的評分一致率達到72%到75%,斯皮爾曼等級相關係數(衡量評分排名一致性的指標)高達0.86到0.87,說明評分體系相當穩定可靠。更重要的是,三位裁判在評分上的差異主要體現在嚴格程度上(GPT裁判普遍偏嚴,Claude和Gemini裁判略寬),而不是偏向某個特定模型,這說明平均後的分數能有效消除個體偏差。研究團隊還專門邀請了人工安全專家對隨機抽取的60個檢查點進行獨立評分,結果與AI裁判的皮爾遜相關係數達到0.96,加權Cohen's Kappa值為0.94,98%的檢查點兩者分數相差不超過1分,充分驗證了這套評估方法的可信度。

四、23個頂尖AI的破案成績單

研究團隊在OpenCode這個開源的AI代理框架上運行了所有23個模型,讓每個模型在相同的任務說明和工具集下獨立完成每個靶場的調查任務。所有模型都以默認參數運行,並開啟了各自的推理模式。

最終成績揭示出幾個清晰的規律。總體來看,Claude Opus 4.7是表現最好的選手,在發現維度AI安全偵探的破案極限阿里巴巴揭示為何頂尖AI連一個入侵現場都搞不定的綜合得分為79.0%,在整改維度AI安全偵探的破案極限阿里巴巴揭示為何頂尖AI連一個入侵現場都搞不定為65.7%,但即便是這個最好成績,也意味著還有超過20%的入侵痕跡沒被發現,還有超過三分之一的整改任務沒有完成。更關鍵的是,沒有任何一個模型在任意一個靶場上實現了發現和整改的"雙滿貫"。

緊隨其後的是Claude Opus 4.6(78.2%/58.0%)、GLM-5.1(76.3%/59.2%)和Qwen3.7 Plus(75.6%/58.8%)。表現墊底的包括Gemini 3.1 Pro(54.8%/31.5%)、MiniMax M2.5(52.4%/32.9%)和Gemini 3 Flash(57.4%/32.9%)。一個反直覺的發現是,GLM和DeepSeek這兩個來自中國研究機構的開源模型,表現明顯優於GPT和Gemini系列,這說明在網路安全響應這個專業賽道上,模型是否來自頭部商業公司並不是決定性因素。

縱向來看版本疊代,大多數模型系列確實在隨著版本更新而進步。Claude Opus系列從4.5版本的69.5%/56.4%,進步到4.6版本的78.2%/58.0%,再到4.7版本的79.0%/65.7%。GLM-5.1比GLM-5提升了約11.4個百分點(發現)和13.3個百分點(整改)。DeepSeek V4 Pro比V3.2提升了約14個百分點(發現)和9.8個百分點(整改)。但這個趨勢並不絕對——Kimi K2.6的整改分數反而低於K2.5(43.0% vs 50.7%),Gemini 3.1 Pro的兩項指標也都略低於Gemini 3 Flash,說明版本更新並不總是帶來網路安全能力的線性提升。

靶場難度的差異同樣顯著。Log4j-RCE是所有模型表現最好的場景,原因很簡單:這是一個幾乎所有AI都在訓練數據中大量見過的知名漏洞,憑藉"記憶"就能答對很多題。Docker-Escape和Redis-RCE次之,因為攻擊鏈相對線性,持久化手段在告警中已有提示。難度最高的是Shiro-Fastjson、RDP-Service-Abuse、NPM-Worm和ASP.NET-ViewState,這些場景的攻擊面更寬、手段更多樣、偽裝更刻意,讓AI難以全面覆蓋。GPT-5.5在發現維度得分高達70.7%,但整改只有36%,差距接近35個百分點,在所有模型中是最大的。

五、五維能力圖譜揭示的短板全景

把所有模型在五個能力維度上的得分匯總分析,就能看出一幅清晰的"能力地圖":模型在不同維度上的表現極度不均衡,有些區域相對拿手,有些區域則幾乎是盲區。

入侵實體識別是所有模型最擅長的領域,大多數模型的發現率超過70%,最強的Qwen3.7 Plus達到88.4%,Claude Opus 4.6達到86.0%。這是因為惡意文件、挖礦進程這類東西往往會觸發告警,屬於"擺在明面上的證據",AI只需順著告警去查就能找到。

持久化機制發現則是最大的軟肋。這個維度的平均發現分數在所有維度中最低,很多模型連一半都達不到。道理也清楚:計劃任務、bashrc文件、profile.d目錄下的腳本、ld.so.preload文件、MySQL UDF插件……這些東西沒有主動信號,不會自己"跳出來",需要偵探對整個系統進行地毯式的主動排查,而不是跟著線索走。現有AI顯然更習慣"跟線索"而不是"主動搜查"。

基線風險評估和漏洞風險確認處於中間水平。這兩類問題的整改相對容易得到較高分,因為"升級到最新版本"、"關閉無密碼訪問"、"輪換默認憑據"這類操作是標準化的,AI有充足的知識儲備來給出正確建議。不過,如何驗證這些整改是否真正生效,很少有模型會提到。

調查與響應質量是僅次於持久化的弱項,在整改維度上幾乎所有模型都低於50%,只有Claude Opus 4.7(53.6%)和Claude Sonnet 4.5(66.7%)是例外。這個維度考察的是調查過程的完整性和可靠性——AI能不能準確說清楚攻擊者是誰、怎麼進來的、做了什麼、還留了什麼?能不能驗證自己的整改方案真的有效?能不能評估這次事件對業務的影響?這些"高階偵查能力"對現有AI來說仍然太難了。

值得一提的是,研究團隊還把AI的表現和傳統的"無代理靜態掃描"工具做了對比——後者是一種不需要在伺服器上安裝任何程序,純靠靜態模式匹配來檢測威脅的傳統安全工具。這個傳統工具在入侵實體識別維度得到43.6%,在漏洞識別維度得到50.0%,但在持久化機制發現上只有2.1%,在基線風險上只有20.7%,而且完全無法提供攻擊鏈重建和整改建議。相比之下,AI在各個可比維度上都明顯優於傳統工具,說明AI確實帶來了實質性的能力提升,只是還遠沒到可以獨當一面的程度。

六、能力失衡的兩大根本原因

通過對每個靶場的詳細分析,研究團隊歸納出了AI在這項任務上失敗的兩個核心模式,它們解釋了為什麼現有模型即便聰明如Claude Opus 4.7,也無法完成完整的案件調查。

第一個核心缺陷是"跟著告警走"而不是"主動搜查"。AI很善於順著已有的線索追查下去,但極少會主動對整個系統進行系統性掃描。在靶場設計中,60%到70%的攻擊痕跡是沒有告警的靜默文件,這些內容需要AI主動去翻查——檢查每個用戶的計劃任務、檢查每個系統服務的配置、檢查shell初始化文件有沒有異常內容、檢查系統啟動項……但現有AI幾乎不會這樣做,它們更像一個只會查看事故報告的助手,而不是一個在案發現場從頭到尾仔細翻查的老警探。幾乎每個靶場的分析都發現,AI在"全面持久化掃描"這個檢查點上的得分接近於零。

第二個核心缺陷是"只做第一步整改"而不做完整閉環。AI通常能提出一個正確但不完整的整改建議。比如發現了挖礦進程,它會建議"終止進程、刪除文件",但往往不會繼續建議"輪換可能已經泄露的憑據"、"封鎖攻擊者的外聯IP"、"驗證清理後正常業務服務是否還能正常運行"。就像幫房主換了被撬壞的門鎖,卻忘記檢查窗戶有沒有也被動過,也沒有告訴房主要換銀行卡密碼(因為入侵者可能看到了放在桌上的密碼本)。整改計劃在"驗證完整性"和"次生風險處置"上的缺失,是AI整改分數系統性低於發現分數的主要原因。

七、給AI配備"偵探手冊"能提升多少

為了探索提升AI表現的可能路徑,研究團隊做了一個額外實驗:把安全響應團隊多年積累的操作經驗,提煉成一套結構化的"技能手冊"提供給AI,看看這能把成績提升多少。這份手冊包含了專家進行威脅調查和整改組織的通用流程,以及報告模板和整改模板,但明確排除了任何靶場相關的具體資訊(比如具體的惡意文件路徑、CVE編號列表等),以確保實驗的公平性。

結果顯示,這份手冊對整改維度的提升效果相當顯著,尤其是原本整改分數較低的模型收益最大。GPT-5.4在SSH-Miner靶場上的整改分數從26%提升到83%,在Docker-Escape場景提升了43%;GPT-5.4 Pro在Jenkins-RCE場景提升了45%,在SSH-Miner場景提升了52%。從能力維度來看,手冊對持久化發現的提升同樣明顯,以Claude Opus 4.7為例,其持久化發現率從68%提升到88%,整改分從49%提升到75%。

但這份手冊並不是萬能藥。GLM-5.1在Shiro-Fastjson場景的發現分數反而下降了12%,在Docker-Escape場景下降了11%。研究團隊推測,這是因為手冊里的排查清單有其邊界,當攻擊者使用了清單以外的技術手段時,AI反而會"按圖索驥"而忽略了對邊界之外內容的探索。這說明單靠預定義的操作規程是不夠的,AI還需要具備從實際調查過程中學習、根據發現動態調整方向的能力,這是下一步需要解決的核心問題。

成本與性能的關係也是研究發現中的一個有趣側面。GPT-5.4 Pro每次運行的平均成本高達38.81美元,在所有測試模型中最貴,但其綜合表現只在中等水平,發現約72.5%,整改約40.7%。相比之下,GLM-5.1每次成本不到1美元(0.88美元),卻能達到76.3%的發現率和59.2%的整改率,性價比相當突出。DeepSeek V4 Pro的單次成本僅0.33美元,但發現率達到73.2%,整改率53.4%。Qwen3.7 Plus每次只需0.31美元,發現率75.6%,整改率58.8%。這意味著在這個特定任務上,高價格並不保證高性能,相反,一些中國模型在極低成本下實現了接近頂尖的表現。

說到底,這項研究揭示的是一個關於AI能力的清醒現實。AI在網路安全響應上已經能夠做一些有價值的事情——比傳統掃描工具更強,能發現更多攻擊痕跡,能給出基本的整改建議——但距離真正可靠的"數字偵探",還有相當長的路要走。最核心的兩個短板,一是缺乏主動、系統性地搜查整個"案發現場"的習慣,二是整改方案缺乏完整的閉環驗證,這兩點合在一起意味著:如果真的把AI單獨放在一台遭到入侵的伺服器前,它很可能發現不了攻擊者留下的所有後門,也無法給出一份真正能讓系統"清潔如新"的整改方案。

這對正在推進安全運營AI化的企業來說是一個重要的警示信號:當前階段,AI更適合作為經驗豐富的人工安全分析師的輔助工具,承擔初步的告警分析、已知漏洞核查等相對標準化的工作,而不是作為獨立的"全權代理"處理真實的入侵事件。研究團隊公開了SecRespond的完整數據和評估框架,希望它能成為推動這一領域發展的基準測試,促使未來的AI模型在"主動調查"和"完整整改"這兩塊硬骨頭上取得真正的突破。

Q&A

Q1:SecRespond測試框架是什麼,它如何評估AI的安全響應能力?

A:SecRespond是阿里巴巴研究團隊構建的一個網路安全基準測試框架,專門用於評估AI在真實入侵事件發生後的響應能力。它包含10個基於真實雲伺服器構建的"網路靶場",研究人員在真實伺服器上執行完整的黑客攻擊,然後凍結磁盤快照供AI調查。AI需要交出入侵分析報告、漏洞報告、基線評估報告和整改計劃四份成果,由三個獨立的強AI模型擔任裁判評分,評估維度涵蓋入侵實體識別、持久化機制發現、基線風險、漏洞風險和調查質量五個方面,共280個細分檢查點。

Q2:AI在網路安全響應中最難克服的兩個短板是什麼?

A:研究發現AI有兩個系統性弱點。第一個是"被動跟線索"而非"主動搜查"——AI傾向於順著告警提供的線索追查,而不主動對整個伺服器進行地毯式排查,導致60%到70%沒有觸發告警的靜默攻擊痕跡(尤其是各類持久化後門)經常被漏掉。第二個是"整改不完整"——AI通常只給出第一步最顯而易見的修復建議,不會繼續追蹤泄露憑據的輪換、攻擊外聯渠道的封鎖,也很少建議驗證修復後系統是否恢復正常,導致整改方案停在表面而未能徹底"清場"。

Q3:23個AI模型中誰表現最好,國產模型和國際模型相比怎麼樣?

A:Claude Opus 4.7綜合表現最好,發現維度得分79.0%,整改維度65.7%,但即便是這個最高分也意味著仍有大量漏洞未被發現、整改未能完成。值得關注的是,GLM-5.1(76.3%/59.2%)、Qwen3.7 Plus(75.6%/58.8%)和DeepSeek V4 Pro(73.2%/53.4%)表現明顯優於GPT系列和Gemini系列,而且成本極低,每次運行費用不到1美元。這說明在網路安全響應這個專業方向上,來自中國研究機構的模型展現出了相當強的競爭力,商業巨頭的知名度並不直接轉化為專項能力優勢。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新