你有沒有收到過這樣一條消息:一堆看起來毫無意義的表情符號,夾雜著幾個奇怪的字,末尾跟著一個像是打錯字的網址?
如果你覺得這是垃圾資訊隨手划走了,那你可能低估了這背後的門道。這些消息其實是精心設計的,發送者故意把違規內容拆解成表情包、同音字、拆字遊戲,讓審核系統看不懂,卻能讓真正想看懂的人心領神會,然後順著一個偽裝過的鏈接,走向一個和色情、詐騙、賭博或者其他灰色交易相關的網站。
這篇來自百度、京東科技、中國人民公安大學等機構聯合團隊的論文,就是想搞清楚一件事:現在的AI大模型,到底能不能先破譯這些"黑話",再順藤摸瓜去調查那個可疑網站,最後給出一份可靠的風險報告?
問題出在哪:兩件事從來沒被放在一起測過
在這篇論文之前,學術界其實已經分別研究過兩個方向的問題。
一部分研究專門盯著"文字怎麼被偽裝的",比如用同音字替換敏感詞、用emoji打亂語序、用拆字法把一個漢字拆成幾個部件。像TNT、Hatemoji、ToxiCloakCN這些基準測試,都在琢磨AI能不能把這些亂碼一樣的東西還原成正常語句。
另一部分研究則專注於"網頁調查",比如WebArena讓AI在模擬網站裡點來點去、完成任務,看它會不會誤觸惡意鏈接、能不能安全地完成瀏覽任務。
問題是,這兩條研究線幾乎從來沒交叉過。
這就好比警察破案,一組人專門負責破譯犯罪分子的暗語紙條,另一組人專門負責去嫌疑地址踩點取證,可是這兩組人從來不互通消息,也沒人驗證過:如果暗語破譯錯了一個字,會不會導致整個踩點小組跑錯了地址,白忙一場?
論文作者管這個被忽略的環節叫"跨渠道平颱風險調查
"。他們發現,如果只單獨測量"文字復原準確率"和"網頁調查準確率",你根本看不出來復原階段一個小小的失誤,會不會像多米諾骨牌一樣,讓後面整個調查鏈條全部崩掉。這正是RiskChainBench
想要補上的空白。
核心設計:先讓AI"破譯暗號",再讓它"獨立探案",最後用一道門檻把兩件事串起來
搞清楚了問題,接下來就是怎麼設計一個可靠的測試。
研究團隊構建了600個網站場景,每個場景對應一段人工合成的"暗語消息"。注意,這裡所有消息都是虛構合成的,不是從真實社交平台上扒下來的,這樣既保證了安全,也避免了牽扯真實隱私。
每段消息會衍生出6種不同的偽裝變體,包括同音替換、圖形近似字替換、entry混淆(也就是把網址關鍵部分打亂)、詞彙和平台符號混合污染,還有專門針對排版做手腳的幾行式和豎排版本。總共3600條文字復原測試樣本,配上600個人工打好標籤的本地網頁環境。
流程分成兩個任務。
任務一(Task 1)是純文字層面的復原。AI只能看到那段亂七八糟的偽裝消息,看不到任何網頁資訊,它需要輸出三樣東西:還原後的乾淨消息、發消息人想幹什麼(也就是"操作意圖")、以及最可能的目標入口(entry)排序列表。
任務二(Task 2)是網頁調查。這時候AI搖身一變,成了一個"網頁偵探"(論文裡叫VLM
驅動的web agent,也就是基於視覺語言模型的網頁智能體),它被放進一個正確對應的本地網站環境裡,獨立瀏覽、點擊、截圖、收集證據,最後寫出一份帶證據引用的風險判斷報告。
關鍵的巧妙之處在於,這兩個任務是完全隔離的。
網頁調查階段的AI,看不到原始消息,也看不到它自己在任務一里復原出的結果,它只能靠自己在網頁上觀察到的東西做判斷。這樣設計是為了避免AI"作弊",也就是不能靠消息里的暗示或者域名本身看起來像不像正規網站來蒙對答案,它必須真憑實據。
>VLM:視覺語言模型(Vision-Language Model),既能"看"圖像又能"讀"文字的AI模型,這裡被用作能自主操作網頁的智能體。
兩個任務分別評分之後,論文用一個叫"入口門控"(entry gate
)的機制把它們離線拼起來:如果任務一里AI破譯出的首選入口,確實指向了正確的那個網站,這次網頁調查的結果才算數,被記為端到端成功;如果入口破譯錯了,不管網頁調查階段做得多漂亮,這次嘗試就直接判為失敗,記為⊥(失敗符號)。
這個設計其實很像快遞員送貨。你把包裹(暗語消息)先交給一個"地址翻譯員",翻譯員寫出收貨地址,如果地址寫錯了,哪怕後面的快遞員業務再熟練、態度再好、送貨路線再優化,包裹也送不到該去的地方,這一單照樣算失敗。而且論文特別強調,翻譯員寫錯地址後,系統不會自動糾錯,也絕不會把包裹錯送到benchmark里的另一個"看起來差不多"的網站去湊數,錯了就是錯了,誠實記錄。
如果不這樣設計會怎樣?
如果任務一和任務二各自獨立評分、互不影響,那你會得到兩組看似都不錯的分數,比如復原準確率90%,網頁判斷準確率60%,兩個數字單獨看都挺好,可你完全不知道這兩件事合在一起,真實的端到端成功率到底是多少。論文裡給出的答案很扎心:把兩個階段串起來之後,端到端準確率範圍一下子從"網頁階段單獨看"的26.3%到62.8%,收縮變成了16.7%到60.8%,有些模型的損失高達32.3個百分點。
消息是怎麼造出來的:一場精心設計的"文字迷宮"
光說復原任務重要還不夠,得講講這些偽裝消息到底是怎麼被製造出來的,這個過程本身就很有意思。
研究團隊沒有直接從網上扒取真實的違規消息,而是完全合成生成了600條源會話。每條源會話里都藏著一個"保留域名"式的正確入口,然後通過六種不同的處理手法,衍生出六個變體版本。這六種手法分別針對不同的干擾強度:有的著重測試綜合復原能力,有的專攻同音字替換,有的專門混淆入口地址本身,有的把詞彙和平台專屬符號攪在一起,還有兩種專門測試排版花招,比如把資訊拆成幾行躲避整體識別,或者故意豎著排版讓文字識別系統讀不出規律。
>token-text obfuscation
:字符層面的偽裝手法,包括同音替換、字形近似替換、字符拆分、emoji噪聲插入等,目的是讓機器審核系統難以識別敏感內容,但人眼仍能讀懂。
這裡有個細節值得一提。emoji素材來自EmojiAll這個公開的表情符號目錄網站,一共提取了80個文字代碼,外加研究者自己補充的12個Bilibili專屬表情代碼,而且論文特別聲明沒有重新分發任何圖片本身,只用了文字層面的編碼資訊。同音字候選和漢字映射表也全是團隊自己整理、並用pypinyin這個拼音校驗工具反覆核對過的,沒有引進任何第三方詞庫,這算是從版權和數據溯源角度做的一層謹慎處理。
>CER
(Character Error Rate):字符錯誤率,衡量AI復原出的文字和標準答案之間,平均每個字符的編輯距離有多大,數值越低說明復原越精準。
為了保證這套測試題目本身沒有質量問題,研究團隊還專門做了自動化審核,檢查有沒有格式錯亂的條目、對齊錯位的情況、無法逆向還原的轉換,以及重複條目。所有的目標網址都用了".test"這種保留測試域名後綴,不含真實的網址協議、路徑、真實域名、帳戶資訊,也不連接任何外部服務,從根本上杜絕了測試過程中意外訪問真實惡意網站的風險。
這套設計像不像給新手司機設計的駕校考場?
真實馬路太危險,不能拿新手直接練手,但駕校的考場又必須儘量模擬真實路況的複雜度,紅綠燈、斑馬線、突然變道的車都得有,只是換成了不會真的撞死人的場景。如果考場設計得太簡單,學員在真實馬路上照樣會翻車;但如果直接把學員扔到真實車流里練習,風險又太大。RiskChainBench想做的,就是這樣一個既足夠貼近真實偽裝手法、又完全隔離於真實風險的"駕校考場"。
網頁環境:拆掉真實伺服器,留下真實的"案發現場"
如果說任務一是紙面考試,任務二就是實操考試,而實操考試最難的部分在於怎麼造一個既真實又安全的"案發現場"。
研究團隊從2500個真實存在過的網站裡,用一套確定性的混合整數規划算法(說白了就是一種嚴格按配額分配的數學優化方法),精心挑選出了600個用於測試的場景。挑選過程中嚴格控制了不同展現形式、話題類型、語言種類的比例,同時兼顧交互深度、技術實現難度、來源渠道分布,還限制了同一個"網站家族"(也就是模板高度相似的關聯站點)最多只能有8個進入測試集,最終形成了覆蓋339個網站家族的多樣化樣本,其中595個網站支持"點擊回放",333個支持更複雜的"狀態化回放"(也就是能記錄用戶操作後網頁狀態的變化,比如登錄、跳轉之類)。
每個網頁環境都是從真實網頁離線構建的本地鏡像,跑在完全隔離的網路里,儘量保留原網站的頁面結構、內容排布、跳轉邏輯和交互反饋,但去掉了對真實在線服務的依賴。換句話說,AI偵探探案的那個"犯罪現場",是按照真實案發現場1:1復刻的布景,但布景里沒有任何能連到外部世界的電線。
>allowlisted actions
:白名單動作,指AI智能體在測試環境裡只能執行預先設定、經過安全審核的操作類型,比如點擊、滾動、截圖,而不能任意執行未經授權的高風險操作。
網站的最終風險判定,是靠四位經過訓練的標註員,按照統一的編碼手冊人工打出來的。每個網站會拿到兩份獨立判斷,一旦出現分歧,或者有人給出"證據不足"這種模糊判斷,就會觸發盲審,必要時再由協調員做最終裁決。整個標註過程的一致性數據也挺講究:第一輪判斷的一致率是82.50%,聯合標籤一致率80.17%,用統計學上常用的Krippendorff's α
係數衡量,分別是0.6553和0.7425,屬於中等偏上的可靠水平。而且團隊還專門做了"隱藏重複"測試,也就是悄悄把一部分網站重複放進標註流程,結果這些隱藏重複樣本的判斷一致率高達97.9%,標籤+類型聯合一致率95.8%,說明標註員們的判斷標準確實是穩定可靠的,不是碰運氣蒙對的。
最終確定下來的標準答案庫里,394個網站被判定為違規,181個判定為不違規,25個判定為證據不足。
AI裁判上場:一個只看"證據鏈"、不看"標準答案"的多模態法官
這裡出現了一個挺巧妙的設計,就是"證據判斷"和"任務判斷"是徹底分開的兩套評價體系。
網站到底是不是違規,用的是人工標註的黃金標準答案,這個沒什麼好說的,屬於硬性對錯判斷。但除此之外,論文還引入了一個固定的多模態證據法官(論文裡叫Jφ),它的工作不是判斷AI說得對不對,而是判斷AI給出的結論,是不是真的有充分的、來自瀏覽過程的證據支撐。
這個法官會收到一份"消過毒"的調查資料包,裡面包括AI在網頁上做過的所有操作記錄、觀察到的頁面截圖、被引用當作證據的內容片段、AI最終寫的結論和理由。它評分打四個維度:證據是不是忠實(沒有編造)、證據是不是充分、調查過程是不是完整、推理邏輯是不是前後一致。
重要的是,這個法官完全不知道網站的真實標籤是什麼,也不知道是哪個模型在做這次調查,更看不到任何域名或者品牌聲譽資訊,它純粹是在評估AI"說的話"和AI"看到的東西"之間對不對得上。
這就像法庭上專門負責審查證據鏈完整性的角色,他不判定被告到底有沒有罪(那是陪審團的活),他只負責挑刺:你說你看到了這個證據,但你的調查記錄里真的有這一步嗎?你引用的截圖內容和你寫的結論是不是自相矛盾?
如果沒有這樣一個獨立的證據審查角色,會出現什麼問題?AI完全可能靠"蒙"蒙對了最終結論,比如瞎猜這個網站違規,恰好猜中了,但整個調查過程其實敷衍了事,沒做任何有意義的瀏覽動作。有了證據法官,這種"蒙對了但過程稀爛"的情況就能被單獨識別出來,雖然論文裡也坦誠地說,證據評分是"覆蓋條件下的診斷",不構成模型的整體排名依據,它只是一個補充視角。
十個大模型同台競技:誰在復原文字上贏了,誰又在探案上贏了
理論講完了,該看真刀真槍的比拼結果了。
論文測試了十個當前主流的大模型,包括GPT-5.4、GPT-5.6 SOL
、GPT-5.2、Claude Opus 4.8
、Claude Sonnet 5、Kimi K3、Kimi K2.5、Kimi K2.6、Qwen3.6 Plus、Doubao Seed 2.0。
先看任務一,也就是純文字復原的戰績。衡量的核心指標叫Entry Top-1(入口首選命中率),意思是AI給出的排名第一的目標入口,是不是真的準確指向了正確網站。
結果差異相當大:GPT-5.4以95.22%的Entry Top-1拿下第一名,緊隨其後的GPT-5.6 SOL是94.31%,Claude Opus 4.8是92.94%。但另一端,Kimi K2.6隻有35.19%,Qwen3.6 Plus是39.06%,Kimi K2.5是39.86%,最高分和最低分之間足足差了60個百分點。
有意思的是,"字符復原精度高"不等於"入口找得准"。Kimi K3的字符錯誤率(CER)低至1.59%,幾乎是全場最低(意味著它逐字復原的能力很強),但它的Entry Top-1隻有84.58%,排在第四位。這說明一個模型可能很擅長把亂碼還原成通順的句子,卻未必擅長從中精準提取出那個關鍵的目標地址,這是兩種不同的能力,不能混為一談。而GPT-5.6 SOL則在"完整復原"(同時答對消息、意圖、入口三項)這個更嚴格的指標上拿到了73.31%的第一名,說明它雖然入口識別略遜於GPT-5.4,但整體理解和還原的綜合能力最強。
再看任務二,也就是網頁偵探環節,核心指標是三分類判斷準確率(違規/不違規/證據不足)。
GPT-5.6 SOL在這一輪同樣表現最好,達到62.8%的準確率,決策類別的宏觀F1值是59.3%,層級完全匹配率(也就是既答對決策又答對細分違規類型)達到61.0%,全部拿下第一。GPT-5.2緊隨其後是57.3%,Kimi K2.5是55.2%。而在細分違規類型判斷上(Type F1),Kimi K2.5反倒逆襲拿到了全場最高的48.1%,超過了在總體準確率上領先的GPT-5.6 SOL(42.8%),說明它在辨別"具體是哪一類違規"這件精細活上更有一套。
表現最差的兩個是Doubao Seed 2.0(29.5%)和Claude Sonnet 5(26.3%),差不多只有排名最高模型的一半水平。
把兩個階段拼起來:那道"入口門檻"到底刷掉了多少分
單看每個階段的分數還不夠,真正扎心的地方在於把兩個階段串聯起來之後會發生什麼。
論文裡有一張對比表,列出了每個模型"純網頁調查視角"(web-only,假設入口一定正確)和"端到端門控視角"(entry-gated,必須先過入口關)之間的分數差距。
差距最小的是Claude Opus 4.8,只損失了0.7個百分點,從49.8%微降到49.2%,說明它入口復原和網頁調查這兩項能力都比較均衡,沒有明顯的短板拖後腿。GPT-5.6 SOL的損失也不大,只有2.0個百分點,從62.8%降到60.8%,依然穩坐端到端排行榜的第一名。
但另一批模型的情況就完全不同了。Qwen3.6 Plus在純網頁調查階段能拿到51.7%的不錯成績,可一旦套上入口門控,直接暴跌到19.3%,損失了32.3個百分點,幾乎腰斬再腰斬。Kimi K2.5同樣如此,純網頁調查55.2%的成績相當亮眼,接入端到端之後卻只剩25.7%,損失29.5個百分點。Kimi K2.6也損失了24.8個百分點。
這說明這幾個模型有一個共同的短板:它們的網頁調查能力其實不弱,甚至相當能打,但它們在最開始的"破譯暗語、找到正確入口"這一步就已經栽了跟頭,後面調查得再仔細都是白費功夫。
這就好比一個偵探破案能力極強,審訊逼供、勘查現場樣樣精通,可惜他一開始就走錯了案發地址,跑到隔壁小區去偵查了。任務完成質量再高,也因為地址一開始就錯了而全盤作廢。如果不設置這道入口門控,我們只會看到"這幾個模型網頁調查能力不錯"的表面結論,完全意識不到它們真正的短板出在最前端的文字破譯環節。這正是這篇論文最核心的洞察,也是它區別於以往單獨測試文字或單獨測試網頁的地方。
失敗到底出在哪一步:探索能力比判斷能力更關鍵
論文還做了一項細緻的失敗歸因分析,把每次網頁調查任務的失敗原因拆分成四個階段:執行失敗、報告缺失、決策錯誤、類型判斷錯誤。如果一個AI既答對了決策又答對了類型,就算是"層級完全成功"。
匯總600次運行的結果之後,一個很扎眼的數字浮現出來:執行失敗占了整體失敗的31.9%,是所有失敗類型里最大的一塊。相比之下,決策正確但類型判斷錯誤的情況,只占0.9%。
換句話說,AI偵探最大的短板根本不是"看到了證據卻判斷錯了違規類型"這種精細活出問題,而是它壓根沒能順利完成瀏覽探索,比如卡在某個頁面動不了、觸發了系統異常、超出了操作預算,或者壓根沒能生成一份有效的報告。
具體到各個模型,差異也很明顯。Doubao Seed 2.0的執行失敗率高達57.7%,是所有模型里最高的,說明它經常在瀏覽過程中就卡殼了。Claude Opus 4.8的報告缺失率異常突出,達到36.7%,意味著它有超過三分之一的調查任務,瀏覽過程本身沒什麼大問題,但最後就是沒能產出一份合格的報告。GPT-5.6 SOL和GPT-5.2的執行失敗率都控制在20%左右,是表現相對穩健的兩個。
這個發現指出了一個挺重要的方向:與其繼續死磕"怎麼讓AI的違規類型判斷更精準",不如先解決"怎麼讓AI能穩穩噹噹把瀏覽這件事從頭做到尾"。就像修一座橋,橋墩沒打穩之前,糾結橋面鋪什麼材質的瓷磚其實沒有太大意義。
寫在後面
讀完這篇論文,我印象最深的其實不是那些具體的分數,而是它揭示的一個更普遍的問題:我們評價AI能力的時候,太容易只看單點表現,而忽略了不同能力串聯起來之後的真實效果。
這讓我想起一個不完全相關但核心很像的場景,公司招人的時候,面試官分別考察候選人的專業技能和溝通能力,兩項都過關就錄用了,可入職之後才發現,這個人專業能力強、溝通能力也不錯,但他沒法把兩者結合起來,向團隊清楚地傳達自己發現的問題,結果專業判斷再準確,也傳不到需要的人手裡。單項測試滿分,組合起來卻處處卡殼,這種"接口損耗"往往比單項能力不足更隱蔽,也更難被發現。
論文裡有個細節我覺得值得單獨說一下:Kimi K3在字符復原精度(CER)上是最強的,幾乎逐字都能還原準確,但它在"找到正確入口"這件更實用的事情上排名只是中等。這提醒我們,衡量語言模型能力的時候,"文字讀得准"和"關鍵資訊提取得對"完全是兩回事,一個模型可能是個很好的文字校對員,卻未必是個可靠的資訊提取員。這個區分我以前沒太認真想過。
論文最後也坦誠地說了自己的局限:每個模型對每個網站只跑了一次調查,沒有測過重複運行的方差,一部分違規類型樣本量偏少,證據法官的可靠性也還沒有經過大規模人工審核的驗證。這些都是留白,但也正是這種留白讓這個方向顯得還有很多可以做的事。
如果AI偵探連"穩穩噹噹走完瀏覽流程"這件事都還沒做到位,那我們該更擔心它會誤判一個正常網站,還是更擔心它會放過一個真正的風險網站?這兩種錯誤的代價,恐怕並不對等。
Q&A
Q1:RiskChainBench是什麼?
A:RiskChainBench是一個用來測試AI能否先破譯網路黑話消息、再去調查對應可疑網站並給出證據支撐風險報告的基準測試,包含3600條文字復原樣本和600個人工標註的本地網頁環境。
Q2:為什麼要把文字復原和網頁調查兩個任務分開測又要合起來算?
A:因為如果AI一開始就把暗語破譯錯了、找錯了目標網站,後面網頁調查做得再仔細也沒有意義。論文用"入口門控"機制把兩階段串聯,發現有些模型單獨測網頁調查能拿五十多分,一旦串聯進復原錯誤就暴跌到十幾分,損失超過30個百分點。
Q3:測試中哪個AI模型表現最好?
A:GPT-5.6 SOL在網頁調查準確率(62.8%)和端到端組合準確率(60.8%)上都排名第一,GPT-5.4則在純文字入口識別上以95.22%的成績領先,不同模型在不同環節各有優劣。






