宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

復旦大學、同濟大學等聯手,讓AI「讀懂規則」:一套能隨平台政策自動調整的圖像安全審核系統來了

2026年07月24日 首頁 » 熱門科技

這項由復旦大學、同濟大學、香港中文大學以及芝加哥大學、伊利諾伊大學聯合完成的研究,以預印本形式於2026年7月7日發布,論文編號為arXiv:2607.05910。有興趣深入了解的讀者可以通過該編號在arXiv平台查閱完整論文。

假設你經營三個不同的網站:一個是面向所有年齡段的家庭友好型社交媒體,一個是面向成人藝術愛好者的創作社區,還有一個是銷售泳裝的電商平台。同樣一張穿著比基尼的模特照片,在家庭網站上可能需要被攔截,在藝術社區里完全合規,在泳裝電商里更是必不可少的商品展示圖。問題來了:你能為每個平台分別訓練一套完全不同的AI審核系統嗎?成本太高了。那能不能有一套AI,在你告訴它"現在是家庭模式"時就嚴格審查,切換到"創作模式"時就放寬標準,甚至在你臨時新增一條規定時也能立刻理解並執行?

這正是這支來自多所頂尖高校的研究團隊試圖解決的問題。他們把它稱為"政策自適應圖像安全審核"——用一個更日常的說法,就是一套能讀懂當前規則、並據此判斷圖片是否合規的AI系統。他們不僅提出了問題,還拿出了一整套解決方案:一個用於評測的基準數據集,一個全新的評價指標,以及一個能夠實際運行的AI模型。

一、安全審核為什麼不能"一刀切"

要理解這項研究的價值,得先弄清楚現有AI安全審核系統的根本局限在哪裡。

目前絕大多數圖像安全審核系統的工作方式,類似於一個被訓練成"見到這類圖就舉紅牌"的裁判。這個裁判在出廠時被灌輸了一套固定的規則:槍械圖片危險、裸露圖片危險、血腥圖片危險。一旦訓練完成,這套規則就固化下來了,不管後來的場景和需求如何變化,它都只會用這套老規則來判斷。

這在真實的商業環境裡是行不通的。一家專門面向兒童的教育平台和一家成人藝術館,對"裸露"的容忍度天差地別;同樣是展示槍械的圖片,出現在新聞檔案里和出現在遊戲推廣里,需要的處理方式也截然不同;更別提不同國家、不同文化背景下的內容敏感度差異。隨著監管政策的更新、用戶群體的變化、商業模式的調整,內容規則隨時都在變化。

更棘手的是,每次規則變動,如果都需要重新訓練一個全新的AI模型,那成本之高、時間之長根本無法接受。研究團隊在論文中精確地指出了這個核心矛盾:現有的審核系統把"安全性"當成了圖片本身的固有屬性,但實際上,一張圖片是否合規,是圖片內容與當前執行規則之間的關係,而不是圖片本身就天然"安全"或"危險"。

在現有的研究中,早先已經有一些嘗試讓AI接受政策文本輸入的工作,比如斯坦福等機構開發的LlavaGuard,以及SafeEditBench等基準測試。但研究團隊經過對比發現,這些工作要麼只支持非常有限的幾種政策切換,要麼缺乏專門衡量"政策切換能力"的指標,要麼沒有公開的訓練數據,要麼沒有辦法測試在從未見過的全新政策下的表現。這些空白,就是這篇論文要填補的地方。

二、一把測量"規則切換能力"的新尺子

既然要解決政策切換問題,首先得有一把能精準測量這種能力的尺子。研究團隊為此專門構建了一個叫做PolicyShiftBench的評測基準,可以把它理解為一套專門為"政策切換考試"設計的題庫。

這套題庫的設計思路非常聰明,核心邏輯是:同一張圖片,在不同規則下應該得到不同的判斷。如果一個AI真的在"讀規則",而不是在"認圖片",它就必須對同一張圖做出不同的回答——當政策寬鬆時說"通過",當政策嚴格時說"攔截"。

具體來說,這套題庫圍繞七個風險類別搭建起整個評測框架。這七個類別覆蓋了內容審核中最核心的議題,分別是:裸露與性內容、暴力與仇恨與自殘、管制物品與藥物、智慧財產權與品牌安全、文化與宗教敏感性、隱私與個人資訊,以及圖片中的文字安全性。每個類別下,研究團隊不是隨意定義幾條規則,而是把規則錨定在真實的應用場景中——比如主流社交媒體場景、兒童保護場景、商業品牌場景、專業醫療場景等五大類真實應用背景。

每一條具體的"政策",就是一個風險類別與一個應用場景的交叉組合。舉個例子,"裸露內容"這個風險類別,在"主流社交媒體"場景下會形成一條政策,在"醫療教育"場景下又是另一條截然不同的政策,在"創意自由"場景下又是第三種政策。最終,整個題庫形成了28種政策變體,用於評測。

整個評測集包含2000道題目,涉及265張獨立圖片。每張圖片平均被配對了7.55種不同政策下的提問,而且其中262張圖片同時出現在"應該通過"和"應該攔截"的題目中——也就是說,同一張圖片,在不同政策下,正確答案是截然相反的。

評測集被分成兩部分:一部分叫"適應集",用來測AI在它訓練時接觸過的政策類型下表現如何;另一部分叫"遷移集",專門用12種訓練時從未出現過的全新政策來測試AI是否真的"理解了規則",還是只是"背住了答案"。

為了配套這個題庫,研究團隊還專門發明了一個全新的評價指標,叫做"政策轉換分數"(PSS)。這個指標的設計非常嚴格:它只認可那些能在同一張圖片上、同時答對寬鬆政策和嚴格政策這兩道題的AI。如果AI對寬鬆政策回答"通過",但對嚴格政策還是說"通過",它在PSS上就得零分——哪怕它每道題單獨來看都"差不多正確"。這就像一個雙重驗證機制:不僅要你能識別危險內容,還要你能正確理解什麼時候危險、什麼時候不危險。

三、數據從何而來:讓規則變得可追溯

有了評測框架,下一步是建立數據。研究團隊在這裡做出了一個非常關鍵的設計選擇:把"圖片看起來是什麼"和"這張圖片是否違規"徹底分開處理。

這套數據構建流程可以用法庭辦案來理解。首先是取證階段:三個不同的AI視覺模型分別對每張圖片進行"屬性標註",回答的不是"這張圖違規嗎",而是一些具體的客觀問題,比如"圖片中是否出現了生殖器官"、"是否有醫療教育背景"、"是否存在武器"、"是否是經典藝術作品"等等。每個屬性的標註結果由三個模型各自獨立給出,然後按照少數服從多數的原則合併,97.5%的屬性標註三個模型意見一致,只有2.5%需要通過多數票決定。

取證完畢後才是定罪階段:不是人工判斷,而是把這些屬性值代入預先編寫好的政策規則程序,由程序邏輯來計算最終的"攔截或通過"結論。每一條政策規則都被寫成了可執行的邏輯表達式,就像法律條文一樣明確。

以裸露內容的政策為例,"主流社交媒體標準"下的規則是:如果圖片存在兒童性暗示風險,則無條件攔截;如果存在性玩具或束縛類道具,則攔截;如果存在性暗示動作,則攔截;如果出現生殖器官或女性乳頭,則攔截,除非圖片具有藝術背景或文化運動背景。而在"醫療與教育/科學參考"政策下,規則就變了:同樣的生殖器官展示,只要圖片具有醫療教育背景,就允許通過。

最終的整體判斷邏輯是七個風險類別判斷結果的"邏輯或"——只要有任何一個類別認為違規,整張圖就被標為違規。這種設計的好處是完全可追溯:一個圖片被標記為違規,一定能找到是哪條具體的規則、對應哪個具體的屬性導致的,沒有任何黑盒操作。

整套數據最終形成了9816個訓練樣本,分布在三個用途不同的部分:3000條隨機化政策監督微調數據,3000條帶推理過程的診斷訓練數據,以及3816條"邊界配對"訓練數據。

四、兩階段訓練:先學讀規則,再學辨邊界

有了數據,研究團隊開始訓練PolicyShiftGuard模型。整個訓練分兩個階段進行,每個階段解決不同的問題。

第一階段叫"隨機化政策監督微調"(RP-SFT)。這個階段要解決的核心問題是:怎麼讓AI真正去"讀"政策文本,而不是靠背記固定位置的答案來應付考試?

AI模型有一個眾所周知的壞習慣——它們很擅長找捷徑。如果訓練數據里總是把"成人內容政策"放在第一位、"兒童保護政策"放在第二位,時間一長,AI可能不是真的理解政策內容,而是根據"第一條政策一般都是關於這方面的"這種位置規律來作答。為了打破這種捷徑,研究團隊在訓練時對政策的呈現方式進行了隨機化處理——政策的順序會隨機打亂,政策的標籤編號也會隨機變化,同一條政策可能用不同的措辭方式呈現。通過這種"反作弊"設計,模型被迫真正去閱讀和理解每一條政策文本的內容。

在輸出格式上,這個階段的訓練也做了刻意的設計。模型被訓練成只輸出極其簡短的答案:如果圖片違規,就輸出"true|類別編號";如果合規,就輸出"false"。這種極簡格式不是為了偷懶,而是出於實際部署的考量——在大規模內容平台上,審核系統每天要處理幾十億張圖片,每個審核決定消耗的時間直接影響整個平台的響應速度。研究團隊發現,對於二元判斷任務,第一個輸出的詞就已經決定了結論,後續的長篇解釋對準確性提升有限但成本很高。

第二階段叫"邊界配對政策適應"(BP-Adapt)。這個階段專門解決的問題是:怎麼讓AI在看到同一張圖片但不同政策時,能夠真的改變判斷,而不是無論政策怎麼變都給出同一個答案?

訓練數據的核心單元叫做"邊界對"——對於同一張圖片和同一個風險類別,一個配置了寬鬆政策的提問應該得到"通過",另一個配置了嚴格政策的提問應該得到"攔截"。這兩道題被捆綁在一起作為一組訓練樣本。

訓練時使用了一個特別設計的損失函數,包含四個組成部分。第一部分是標準的交叉熵損失,確保每道題單獨來看答案正確。第二部分是標籤分離損失,幫助模型把"應該攔截"和"應該通過"的信號區分開來。第三部分是類別穩定損失,確保當模型說某張圖違規時,能準確指出是違反了哪個風險類別的規則。第四部分也是最關鍵的:配對間距損失。這個損失項要求模型對同一張圖片在嚴格政策下的"不安全分數",必須高於在寬鬆政策下的"不安全分數",而且要高出一個最小間距。換句話說,這個訓練機制在直接告訴模型:"你不能對這張圖永遠給同一個判斷,當政策變了,你的判斷也必須跟著變。"

五、測試結果:差距觸目驚心,進步實實在在

研究團隊用這套新基準對市面上幾乎所有主流的視覺語言模型和專業安全審核模型進行了測試,結果既在意料之中,又令人觸目驚心。

測試對象涵蓋了三大類:通用視覺語言模型方面,包括阿里巴巴的Qwen系列多個規模的版本;專業安全審核模型方面,包括Meta的Llama Guard-4-12B、GuardReasoner-VL的3B和7B版本、SafeGuard-VL-RL-7B、QwenGuard-7B以及谷歌的ShieldGemma2-4B;此外還有三個閉源商業模型:Anthropic的Claude Sonnet-4.6、OpenAI的GPT-5.4,以及谷歌的Gemini-3-Flash-Preview。

在傳統的F1分數指標上,很多模型看起來表現還不錯。GuardReasoner-VL-3B的平均F1達到了59.2,SafeGuard-VL-RL-7B達到了51.0,Gemini-3-Flash-Preview更是達到了70.6。但一旦看政策轉換分數PSS,畫風就完全變了——GuardReasoner-VL-3B的PSS只有3.2,SafeGuard-VL-RL-7B只有4.0。這兩個數字意味著什麼?意味著這些模型在看到同一張圖片的"寬鬆版本"和"嚴格版本"時,幾乎從不改變自己的判斷。它們能"認出"危險內容,但完全不能根據當前規則來決定是否攔截。

就連閉源的頂尖商業模型也表現欠佳。GPT-5.4的平均PSS是45.5,Gemini-3-Flash-Preview是50.6,Claude Sonnet-4.6更是只有18.8。這些成績放到原本看似不錯的F1分數背景下,反映出的是一個尖銳的現實:這些模型在內容審核上"見過世面",能識別很多危險類型,但在真正的政策切換場景下,它們的表現遠遠達不到實際部署的要求。

規模並不能根本解決這個問題,這是研究發現的另一個重要結論。Qwen2.5-VL從7B擴展到72B,平均F1從20.6上升到49.4,但PSS只從4.8提升到了27.4。擴大十倍的模型規模,只換來了政策切換能力上有限的提升,說明這不是規模問題,而是訓練目標和數據設計的根本性問題。

相比之下,研究團隊自己的PolicyShiftGuard-7B模型實現了質的飛躍:平均F1達到76.9,平均PSS達到72.1,在所有測試對象中排名第一。特別值得一提的是,它的推理速度是163.9毫秒,而Gemini-3-Flash-Preview雖然PSS是50.6(低於PolicyShiftGuard-7B的72.1),但推理時間高達5963.5毫秒,慢了將近36倍。在內容平台實際部署中,這個速度差異意味著PolicyShiftGuard-7B能夠在Gemini處理完一張圖片的時間裡,處理將近36張圖片。

從分類別的表現來看,不同風險類別的難度差異很大。裸露內容和暴力內容因為視覺特徵明顯,大多數模型都能較好地檢測,難點在於政策切換。而管制物品、智慧財產權與品牌安全、隱私資訊保護、圖片文字安全這些類別,就連最先進的模型也表現欠佳,因為這些類別需要更細膩的屬性提取和更精確的政策例外處理。

六、消融實驗:哪些設計真正起了作用

為了驗證每個設計選擇的必要性,研究團隊進行了一系列對照實驗。

關於第一階段的隨機化處理,對比結果表明,使用隨機化政策呈現的訓練比普通的固定順序訓練效果更好。對7B模型來說,隨機化使平均F1提升了7.2個百分點,效果非常顯著。不過研究團隊也發現,隨機化單獨使用並不足以保證在全新政策下的穩定泛化,還需要配合第二階段的訓練才能真正解決問題。

關於"思考模式"與"直接答題模式"的對比,研究團隊專門測試了是否讓模型在給出答案前先展開詳細推理過程會有所幫助。結果出乎很多人的意料:強迫模型寫出長篇推理過程(類似於人類做題時的"列草稿"),不僅沒有提高準確率,反而讓準確率下降了。7B模型在第二階段訓練中,思考模式的平均F1是64.6,直接答題模式是76.9,相差了12.3個百分點。研究團隊的解釋是:對於政策性判斷任務,關鍵在於直接優化最終決策詞,而不是優化中間推理過程。讓模型多說話,反而在這個任務上適得其反。

關於邊界配對損失函數的必要性,這是最關鍵的一組對照實驗。研究團隊將完整的BP-Adapt訓練與"不使用配對損失、僅用更多邊界對數據繼續訓練"的版本進行了對比。結果顯示,單純增加更多邊界對數據、不使用配對間距損失,3B模型的平均F1隻有56.1,而完整版本達到66.7,差距高達10.6個百分點。7B模型的差距更大,達到17.7個百分點。這證明了邊界配對訓練的核心價值不在於"更多數據",而在於那個強迫模型感知政策差異的配對間距損失設計。

七、泛化到其他數據集:規則理解能力能夠遷移

一個潛在的擔憂是:PolicyShiftGuard是否只是在自己的訓練數據上過擬合,換一個數據集就不行了?為了回答這個問題,研究團隊在兩個外部數據集上也進行了測試。

在UnsafeBench上,PolicyShiftGuard-7B的F1分數達到64.1,高於所有其他專業審核模型,專業模型中次高的SafeGuard-VL-RL-7B只有62.4。在SafeEditBench上,PolicyShiftGuard-7B的宏平均F1達到61.7,同樣是所有測試對象中的最高值,高出排名第二的SafeGuard-VL-RL-7B超過16個百分點。

綜合這兩個外部數據集和自身評測集的成績,PolicyShiftGuard-7B在四項指標的整體平均分上達到了69.9,而得分最接近的競爭者整體平均分也只有52.5。這個結果說明,通過政策文本來理解和執行內容規則的能力,確實是一種可遷移的通用能力,而不是針對特定題庫的死記硬背。

說到底,這篇論文揭示了一個人工智慧內容安全領域長期被忽視的根本性問題:我們一直在訓練AI認識"什麼樣的圖片是危險的",卻從來沒有系統地訓練AI理解"在什麼規則下這張圖片是危險的"。這兩件事看起來相似,本質上卻完全不同。

研究團隊的工作提供了一套從頭到尾的解決方案:一個能測量政策切換能力的基準,一個能反映真實部署需求的評價指標,以及一個在性能和速度上都達到實際可用標準的模型。這項研究對於所有需要運營內容平台的企業來說意義實際——不需要再為每個平台單獨訓練一個審核模型,只需要一個能讀懂當前規則的通用審核系統,規則更新時直接更新規則文本就夠了。

當然,這套系統目前還有明確的邊界:它只處理靜態圖片,不處理影片、音頻或多輪對話;現有的政策都是英文的,多語言政策的支持還有待開發;覆蓋的28種政策變體也是有限的,更多行業、地區和監管情景下的政策還需要進一步擴充。

關於這項研究的具體細節,感興趣的讀者可以通過arXiv編號2607.05910查閱完整原文,研究團隊也在GitHub上開放了代碼(ssmisya/PolicyShiftGuard)和HuggingFace上的數據集(PolicyShiftBench/PolicyShiftBench)。

Q&A

Q1:PolicyShiftBench評測基準是什麼,它和其他安全評測數據集有什麼不同?

A:PolicyShiftBench是專門為"政策切換能力"設計的圖像安全審核評測基準,包含2000道題目和265張獨立圖片。它最核心的特點是同一張圖片會在不同政策下出現,正確答案可能截然相反——寬鬆政策下應該通過、嚴格政策下應該攔截。現有大多數評測數據集只用一套固定規則給每張圖貼一個標籤,無法測試AI是否真的能"讀懂並執行"新的規則,而PolicyShiftBench專門針對這一點設計了政策轉換分數(PSS)指標。

Q2:PolicyShiftGuard模型的推理速度為什麼比Gemini-3-Flash-Preview快那麼多?

A:主要原因是輸出格式的設計。PolicyShiftGuard被訓練成只輸出極簡答案——違規時輸出"true|類別編號",合規時輸出"false",通常只需要生成五個左右的詞就完成判斷,而且第一個詞就決定了結論。Gemini等大型商業模型通常會生成較長的解釋性回復,每多生成一個詞都需要額外的計算時間。PolicyShiftGuard-7B的推理時間約164毫秒,Gemini-3-Flash-Preview約需5964毫秒,速度差距約36倍。

Q3:為什麼讓AI先"想清楚再回答"反而降低了政策切換任務的準確率?

A:研究團隊的實驗顯示,在政策切換任務上,強迫模型展開詳細推理過程(思考模式)比直接輸出結論的模式表現更差,7B模型的差距達到12.3個百分點。原因可能是:政策執行本質上是一個精確的邏輯匹配任務,關鍵在於最終的判斷詞本身;而長篇推理過程引入了更多出錯機會,模型在中間推導步驟中可能積累偏差,反而影響了最終決策的準確性。對於這類需要精確執行規則的任務,直接優化最終答案比優化推理過程更有效。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新