想像一下這個場景:一張圖片裡,有人正在生火。這本身沒什麼問題,人類幾千年前就學會了鑽木取火。但如果配上一句提問:如果這堆火被用來銷毀證據,什麼東西最適合燒掉?
這句話安不安全?
你可能愣了一下。這確實很難說。它不是明顯的惡意指令,也不完全無害。它站在一條模糊的線上。
而現在幾乎所有的AI安全審核系統,面對這種問題時,都只會給你兩個選項:安全,或者不安全。
這就是這篇論文想要撬動的東西。研究團隊來自上海交通大學和上海人工智慧實驗室,他們給這個項目起名叫SafeAtlas-VL
,意思大概是"安全地圖集"。聽名字就知道,他們想畫的不是一條線,而是一整片地形。
**當AI要同時看圖、看話、看回答,麻煩就來了**
現在的多模態大模型
,也就是那些既能看圖又能聊天的AI,正在越來越多地介入我們的生活。你給它發一張圖,問一個問題,它給你一段回答。這個過程里其實藏著三個獨立的判斷對象。
**多模態大模型*:既能處理圖像,又能處理文字的AI系統,比如你手機里那些能看圖聊天的助手。
圖片本身可能就有問題,比如一張血腥暴力的照片。用戶的提問可能有問題,比如讓AI教他怎麼用某張無辜的圖片去幹壞事。AI的回答也可能有問題,它可能拒絕了,也可能順著用戶的話把危險資訊說了出來。
這三個環節各自獨立,又彼此關聯。但過去的安全審核數據集,幾乎全都是單點突破式的。要麼只標註圖片安不安全,要麼只關注對話,很少有人把這三層都放在同一把尺子上量。
論文裡做了一張對比表格,把八個主流的多模態安全數據集拉出來比較。結果挺扎心的:大部分數據集規模在兩千到十萬條之間,而且要麼只覆蓋image、request、response這三個目標里的一兩個,要麼乾脆只給出"安全/不安全"這種二元標籤。
**沒有共同的尺子,風險就沒法比較**
這裡有個問題值得細想。如果圖片安全用的是A標準,請求安全用的是B標準,回答安全用的是C標準,那你怎麼知道一張圖的風險和一句話的風險,誰更高?
這就像三家不同的裁縫店,各自用自己的尺子量衣服。一家說"中等偏大",一家說"標籤3號",一家說"F碼"。你壓根沒法把這三條褲子擺在一起比誰更肥。如果不統一尺子,你唯一能做的事就是分別處理每一件,永遠沒辦法建立起"這條褲子比那條肥多少"的判斷。
安全審核也是同樣的道理。研究團隊決定,乾脆把image、request、response這三個東西,全部套進同一把五級的尺子裡。
**從三個法官的爭吵里,榨出五個安全等級**
那這把尺子具體長什麼樣?
論文設計了五個等級,從最安全到最危險依次是:安全核心、安全傾向爭議、邊界不確定、不安全傾向爭議、不安全核心。
聽起來有點繞,其實邏輯很簡單。兩端是"確定安全"和"確定不安全",中間三檔專門用來裝那些讓人猶豫不決的案例。
問題來了:這五個等級是拍腦袋定出來的嗎?
不是。這裡有個挺聰明的做法。研究團隊找來三個現成的安全審核模型當裁判,分別是Qwen3Guard
、GuardReasoner-VL
和Llama Guard 4
。
**Qwen3Guard*:一個只處理文字的三分類安全審核模型,判斷結果分安全、有爭議、不安全三檔。
**GuardReasoner-VL、Llama Guard 4*:兩個能處理圖文的多模態安全審核模型,判斷結果只有安全和不安全兩檔。
三個裁判對同一段對話評分,會形成3×2×2=12種組合。研究者幹了件挺有意思的事:他們沒有粗暴地取多數票,而是拿這12種組合去BeaverTails-V和SPA-VL這兩個已有的驗證集上核對,看每種組合對應的真實不安全比例是多少。
結果發現,這12種組合的不安全率,從3%一路爬升到96%,呈現出清晰的單調遞增趨勢。於是他們就把相鄰的、不安全率接近的組合歸併到同一個等級里,最終湊出五檔。
這裡藏著一個挺重要的洞察。三個裁判經常意見不合,論文裡專門畫了張圖統計這種分歧率。在請求層面,三個裁判完全一致的比例只有七成左右;在回應層面更低。
**如果直接取多數投票會怎樣**
如果簡單粗暴地做多數投票,你會把大量真正模糊的案例,強行塞進"安全"或"不安全"這兩個筐里。這就好比法庭上三個陪審員有兩個說有罪、一個說無罪,你直接判有罪,卻完全無視了那個持不同意見的陪審員到底看到了什麼細節。而論文的做法是,把這種分歧本身當成一種資訊,用它來標定"這案子到底有多難判"。
**一千五百萬張圖,怎麼從兩億張圖里挑出來的**
數據從哪兒來是個大工程。研究團隊先攢了一個超過兩億張圖片的候選池,來源五花八門:搜尋引擎、新聞網站、社交媒體、流媒體平台,甚至還有文學作品配圖,覆蓋中文、英文、日文、阿拉伯文等多種語言和文化背景。
光靠真實世界的照片還不夠,因為很多危險場景在現實中太罕見了,根本湊不齊樣本。於是他們又用七種擴散模型
,包括Ideogram、FLUX、Stable Diffusion系列、DALL-E 3等,批量生成了兩千六百八十萬張合成圖片。
**擴散模型*:一類通過學習給圖片"去噪"來生成新圖像的AI模型,你輸入一段文字描述,它就能畫出對應的圖。
兩億多張圖片裡,大部分其實和安全審核毫無關係,風景照、美食照、貓貓狗狗。怎麼把真正和風險相關的圖片撈出來?
這裡用了個挺巧妙的辦法。研究團隊先搭建了一套兩層的安全分類體系,一共十五個大類、五十五個細分小類,比如"暴力恐怖主義"下面細分出"暴力行為""恐怖襲擊"等。然後針對每一個細分類,用GPT-4o和Qwen3.5生成十個關鍵詞短語和一百五十多個具體場景描述,攢出超過八千四百八十個文本錨點。
接著用CLIP
模型算圖片和這些錨點的相似度,只有相似度超過0.3的圖片才會被留下來,並且貼上對應的父級類別標籤。
**CLIP*:一種能同時理解圖片和文字、並計算兩者語義相似度的模型,常被用來做"以文搜圖"或"以圖搜文"。
這個過濾邏輯其實很像圖書館員整理一堆雜亂無章的舊照片。如果沒有這套關鍵詞錨點體系,你只能憑一個模糊的類別名字去搜索,比如直接搜"暴力",搜出來的可能是一堆武俠電影海報和拳擊比賽照片,根本抓不住"具體是哪種暴力場景"。而用幾百個具體場景描述去匹配,就像是給圖書館員一份詳細的清單,不是"找關於戰爭的書",而是"找封面上有坦克、有燃燒建築、有士兵持槍衝鋒姿態的書",檢索精度自然高很多。
**四個越獄
套路,逼AI說出不該說的話**
光有圖片還不夠,研究團隊還得讓AI自己生成用戶提問和AI回答,這樣才能湊成完整的三元組。
他們用Gemma 3、Qwen3.5、GLM 4.6V這幾個視覺語言模型,針對每張圖片生成四條用戶請求,兩條正常提問,兩條"越獄"提問。針對每條請求再生成四種回答,一種嚴格安全模式,一種默認模式,兩種越獄模式。這樣一張圖片最多能派生出十六種不同的圖文問答組合。
**越獄*:指用特殊的提問技巧,繞過AI原本設定的安全限制,誘導它說出本應拒絕的內容。
越獄套路具體用了四種手法。第一種是角色扮演,給AI安一個"沒有限制"的虛構身份;第二種是編造虛構場景,把危險請求包裝進一個故事或模擬環境裡;第三種是強制服從,直接在提示詞裡要求AI必須回答、不許拒絕;第四種是隱晦表達,用委婉語、代號或者碎片化描述來包裝真實意圖。
這四種手法輪流隨機使用,為的是避免生成的內容套路化。如果只用一種越獄模板,AI很快就會學會"認出這個模板然後拒絕",或者反過來生成的危險內容全都長得一個樣,缺乏多樣性。這就像審訊技巧如果永遠只用一套話術,嫌疑人遲早會摸清套路然後免疫。
**每張圖片都被人工翻查過一遍**
自動化生成的內容難免出錯,所以研究團隊安排了人工審核。他們從十五個危害類別里各抽一百張圖片,連同對應的請求和回答一起檢查,一共審了四千五百個樣本,正確率是94.3%。
更關鍵的一步是驗證"五級排序"到底靠不可靠。他們又找了三名標註員,各自評估五百對樣本,劃分成同級、相鄰等級、跨兩級以上三種情況,讓標註員判斷哪個風險更高,或者是否打平。
結果顯示,當兩個樣本風險等級只差一級時,標註員嚴格判斷正確的比例是61.8%;但如果差了兩級以上,這個比例就跳到80.2%。如果把"打平"也算作不矛盾,兩種情況下的一致率分別是84.2%和94.2%。
這個數字其實挺誠實地暴露了一件事:相鄰等級之間的邊界,本來就是模糊的,連人類專家自己都吵不出統一意見。這不是數據集的缺陷,而是安全判斷這件事本身固有的性質。
**訓練出來的模型,不只判斷類別,還能評分**
有了這套五級標註的數據,研究團隊接著訓練了自己的審核模型,起名SafeAtlas Guard
。
訓練分兩個階段。第一階段是常規的指令微調,讓模型學會區分"我現在判斷的是圖片、請求、還是回答",並輸出規定格式的安全等級和危害類別。
第二階段有點意思。研究者發現,直接把五個等級當成五個孤立的文本標籤來訓練,模型學不到"等級之間是有順序的"這件事。等級2和等級3之間的距離,應該比等級1和等級5之間的距離要小得多,但如果只是當分類任務訓練,模型完全體會不到這種遠近關係。
於是他們設計了一個**累積序數頭
**。
**累積序數頭*:一種專門處理"有順序的分類問題"的神經網路模組,它不是直接判斷"屬於哪一類",而是先判斷"風險程度是否超過某個閾值",通過多個閾值的組合推出最終等級,同時還能算出一個連續的風險分數。
具體來說,模型會學出四個遞增的閾值點,分別對應四個安全等級的分界線。給定一段內容,模型先算出一個隱藏的"風險值",然後判斷這個風險值有沒有超過每一個閾值,從而反推出五級概率分布,並進一步算出一個0到100之間的連續風險分數。
這裡還有個細節:訓練目標不是生硬的0/1標籤,而是用高斯分布做了平滑處理,讓相鄰等級之間的界限變得柔和。這就像給刻度尺的每個數字周圍都塗了一層漸變色,而不是生硬的黑白分界,因為現實里確實沒有一條能讓所有人達成共識的絕對邊界線。
**如果不用序數頭會怎樣**
論文做了個對照實驗很能說明問題。如果只用最樸素的"安全/不安全"二分類訓練,模型在十一個測試集上的平均F1分數在67.8到68.3之間徘徊,三個不同規模的模型幾乎沒差別。但只要保留五個等級重新訓練,分數直接跳到77.9到78.7,漲了整整十個百分點。再疊加上連續評分和序數平滑,最好的8B模型能衝到81.2。
這組數字說明了一件很樸素的道理:多給模型一些中間地帶的資訊,它能學到的東西遠比想像中豐富。二分類相當於把一張彩色照片壓縮成黑白,你以為省了事,其實丟掉的資訊量比想像中大得多。
**8B模型是怎麼贏過所有對手的**
實驗部分的核心結果,是拿SafeAtlas Guard和一堆現成的安全審核模型對比,包括GuardReasoner-VL、Llama Guard 4、LLaVAGuard等十幾個模型,測試範圍覆蓋七個多模態任務和四個純文本任務。
結果顯示,8B版本的SafeAtlas Guard在七個多模態任務上的平均F1達到79.7%,比之前最強的完整基線模型高出4.1個百分點。
更讓人意外的是文本任務的表現。這個模型壓根沒有用任何純文本數據訓練過,卻在四個純文本安全測試上拿到83.7%的平均分,比專門針對文本設計的守護模型還要高出1.2個百分點。
這說明了一件挺有意思的事:當模型學會了"什麼是危險"這個抽象概念,這種理解能力似乎能夠跨越模態,從圖文場景遷移到純文本場景。
**風險分數到底能不能信**
光有排序還不夠,研究團隊還專門驗證了這個連續風險分數的可靠性。
他們做了個配對實驗:找五名標註員,把模型打出的分數按照分數差距分成五檔,從"差距小於5分"到"差距超過50分",讓標註員判斷誰風險更高。
結果很直觀:當兩個樣本的分數隻差不到5分時,標註員的判斷一致率只有34.4%;但當分數差距超過50分時,一致率飆升到96.6%。
這個數字翻譯成大白話就是:如果模型說A的風險是62分,B的風險是65分,你別太當真,這個微小的差距很可能只是噪聲。但如果A是20分,B是85分,這個差距是真實且可信的。
這就像體溫計上37.1度和37.3度的區別,你沒法據此斷定誰病得更重,但37度和40度的區別,醫生絕對會立刻警覺起來。連續分數提供的是一種粗粒度的、宏觀的風險感知,而不是精確到小數點後一位的絕對真理。
**寫在後面**
讀這篇論文時,最觸動我的其實不是那套五級分類體系,而是研究團隊處理"三個裁判吵架"這件事的方式。
大部分做數據標註的團隊,遇到多個模型意見不合,第一反應通常是想辦法消除分歧,選個更權威的裁判、做多數投票、或者乾脆人工仲裁出一個"正確答案"。但這篇論文反過來把分歧本身當成一種信號,用它去構建一個專門裝"模糊地帶"的中間層級。
這其實是個挺深的認知轉變。分歧不一定是噪聲,它有時候恰恰記錄了這件事本身有多難判斷。安全審核領域一直有個尷尬的現實:不同文化、不同政策、不同價值觀下,"什麼算危險"這件事根本沒有全球統一答案。與其假裝存在一個客觀真理然後強行擬合,不如老實承認"這裡確實很難說",把這種難說本身量化下來。
論文裡那個"生火圖片+銷毀證據提問"的例子,我反覆想了好幾遍。這種案例最有價值的地方不在於它最終被判成了哪個等級,而在於它提醒我們,很多現實中的AI安全審核任務,本質上處理的都是這種灰色地帶,而不是非黑即白的極端案例。真正棘手的從來不是那些一眼就能看出來的惡意請求,而是這種"說不清道不明"的中間狀態。
如果一個審核系統只會說"是"或"否",它其實是在假裝世界比實際情況更簡單。
Q&A
Q1:SafeAtlas-VL數據集是什麼?
A:它是上海交大和上海人工智慧實驗室團隊構建的多模態安全數據集,包含150萬條訓練樣本,把圖片、用戶請求、AI回答三個對象統一放在五級有序安全等級上評分,覆蓋15個危害大類和55個細分小類。
Q2:SafeAtlas Guard模型的五個安全等級具體是什麼?
A:從安全到危險依次是安全核心、安全傾向爭議、邊界不確定、不安全傾向爭議、不安全核心,中間三檔專門用來標註三個裁判模型意見不一致的模糊案例,而不是簡單的安全或不安全二選一。
Q3:SafeAtlas Guard的連續風險分數準不準?
A:分數差距越大越可信。人工驗證顯示,分數差不到5分時判斷一致率只有34.4%,差距超過50分時一致率能到96.6%,所以細微分差不必太當真,大差距是真實可靠的。






