宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當AI學會「冒充你」:雪梨大學等機構揭示智能體人格技能的隱私黑洞

2026年08月12日 首頁 » 熱門科技

這項由雪梨大學、昆士蘭大學和東南大學聯合開展的研究,以預印本形式發布於2026年8月,論文編號為arXiv:2608.03700,有興趣深入了解的讀者可通過該編號查閱完整原文。

**當你的AI助手開始"變成你"**

假設你每天都在用一款AI助手處理工作郵件、規劃日程、傾訴煩惱。久而久之,這個助手越來越懂你——它知道你愛用哪些口頭禪,知道你是個三十多歲在西雅圖長大的文藝青年,知道你遇到棘手問題時總愛先批評再要答案。某天,有人把這些積累下來的"了解"打包成一個可以隨身攜帶的小程序,分發給其他AI使用。於是,一個能夠在各種場合精準模仿你說話方式、復現你個人資訊的數字替身,就這樣悄無聲息地誕生了。

這不是科幻小說的情節,而是研究團隊正在認真應對的現實威脅。上述研究構建了一個名為AntiSkillBench的評測框架,專門用來衡量這種"人格技能"(persona skill)到底會泄露多少你的隱私,以及現有的防護手段是否真的管用。結論令人警醒:風險比我們想像的更深、更難消除,而現有防護措施的效果則遠比預期要弱。

**一、什麼是"人格技能",為什麼它會成為問題**

要理解這項研究,先得搞清楚一件事:AI"技能"究竟是什麼。

在現代AI系統里,"技能"大致相當於一份專門定製的使用說明書。就像新員工入職時會收到一本"崗位操作手冊",裡面寫著這個崗位的慣用流程、注意事項和風格偏好,AI技能也是類似的東西。區別在於,這份手冊是從真實的對話記錄中"提煉"出來的。

"人格技能"(persona skill)是技能概念的進一步發展。它從某一個具體用戶的歷史對話里提煉資訊,生成一份專屬於這個人的"行為規範",然後裝載到AI助手上,讓助手能夠像這個人一樣說話、像這個人一樣思考、幫這個人完成各種任務。

這個設計初衷是好的。比如,你可以讓AI助手在你不在的時候代你回覆郵件,風格還跟你高度一致;或者在多人協作的AI系統里,一個負責"扮演你"的子模組能夠提供與你個人風格相符的輸入。Anthropic等公司已經在探索相關應用,COLLEAGUE.SKILL等系統專門研究如何從同事、公眾人物乃至普通用戶的對話中構建人格技能。

麻煩恰恰出在這裡。當歷史對話被"提煉"成一份可攜帶、可復用的技能檔案時,原本分散在一條條對話里的個人資訊,就被集中打包在一起了。這份檔案一旦落入他人之手,或者被不當使用,後果可能遠比泄露幾條聊天記錄嚴重得多。

研究團隊把這種風險概括為三個層面。第一是"風險集中":那些散落在幾十次對話里的細碎線索——你提過住在哪個城市、你的口頭禪是什麼、你對某類問題的典型反應——被整合成一份簡潔的檔案,讓任何拿到檔案的人都能一眼讀出你的輪廓。第二是"影響放大":這份檔案可以被複製、共享、加載到任何兼容的AI上,不需要原始對話,也不需要對模型進行訓練,就能在無數場合重現你的風格和資訊。第三是"防護失效":傳統的隱私保護方法,比如刪掉某條記錄里的姓名地址、過濾敏感詞,對這種"整體提煉"式的操作效果很有限,因為提煉過程可以從間接信號中推斷出你的特徵,即使明顯的個人標識已經被去掉了。

**二、研究團隊如何搭建這個評測"靶場"**

為了系統地研究這些風險,研究團隊從頭搭建了一套專門的實驗環境,也就是AntiSkillBench。

這個框架的起點是五十個虛構用戶。每個用戶都有一份詳細的個人檔案,包括姓名、年齡、性別、種族和出生地等基本資訊,還有教育背景、職業經歷和個人經歷的綜合描述。更關鍵的是,團隊還為每個用戶添加了兩個在以往同類研究里幾乎缺席的維度:大五人格特徵和細粒度的溝通風格。

大五人格是心理學裡一個廣泛使用的人格模型,把人的性格傾向分為五個維度:開放性(喜歡新事物嗎?)、盡責性(做事細心有條理嗎?)、外向性(喜歡社交還是獨處?)、宜人性(好相處嗎?)和神經質(容易焦慮不安嗎?)。溝通風格則涵蓋了句子結構、詞彙習慣、節奏、語氣、互動方式、修辭與幽默感、確定性表達、引用習慣和論證策略等九個方面。有了這兩個維度,研究者就能區分"這個人是誰"和"這個人如何說話",而後者恰恰是人格技能最核心、也最危險的捕捉對象。

每個用戶檔案建好之後,研究團隊用AI模擬這個用戶提出五十個真實場景里的問題。這五十個問題分為三類:三十個"通用輔助"類問題,覆蓋日常工作和生活;十個"工具設計"類問題,涉及請AI幫忙設計某種功能性程序;十個"數學計算"類問題,涉及具體的數字推算。每個問題生成之後,還會被擴展成一段三輪對話,模擬用戶如何在與助手的往復交流中逐步細化需求。最終,整個數據集包含兩千五百段對話,合計七千五百條用戶發言,每一條都暗含了相應用戶的個人特徵和語言風格。

在這套數據基礎上,研究團隊設計了三種不同的"技能提煉"方法,用來測試不同的提煉策略會帶來什麼不同的風險。

第一種叫"直接提煉"(Direct Distill),是最直接的方法:把用戶的所有對話一股腦塞進AI,讓它提煉出一份技能。這份技能會著重記錄可以直接觀察到的語言習慣,比如用戶慣用什麼方式提問、有哪些口頭禪、每次追問時傾向於從哪個角度切入。

第二種叫"三階段提煉"(Three-stage Distill),是研究團隊專門設計的結構化方法。第一步提取用戶屬性,從表面可見的特徵出發,一直挖到潛在的偏好和思維模式;第二步從這些屬性推導出"如果遇到X情況,這個用戶通常會怎麼做"的行為規律;第三步把屬性和規律整合成最終的技能檔案。這種方法提煉出的技能更加系統,對用戶內在邏輯的捕捉更深入。

第三種叫"同事提煉"(Colleague Distill),借鑑自COLLEAGUE.SKILL系統。它先用一個"人格分析員"把對話歷史總結成表達風格、決策模式、人際行為傾向和個人邊界四個維度的分析報告,再用一個"技能構建者"把這份報告轉化成一套強調穩定性格特徵和推理模式的分層技能。這種方法更貼近真實世界中已有產品的做法,提煉出的技能著重刻畫用戶的"人格核心"。

**三、如何衡量"泄露了多少"和"模仿得多像"**

有了數據和提煉方法,下一步就是定義和測量風險。研究團隊把風險分成兩個層次,並為每個層次設計了對應的測量指標。

第一個層次是"技能層隱私泄露"。這個層次的問題是:提煉出來的技能檔案本身,保留了多少用戶的個人資訊?為了回答這個問題,研究團隊設計了"技能覆蓋率"(Skill Coverage)這個指標。

具體做法有點像考試閱卷:對於每一個用戶檔案里的個人屬性——比如"這個用戶是三十多歲的西雅圖人"、"這個用戶說話時喜歡用'說到底'這種轉折語"、"這個用戶具有高度開放性和低外向性"——研究者都會擬一道判斷題,讓AI法官去讀技能檔案,判斷這個屬性是否在檔案中有所體現。把所有判斷的平均命中率加起來,就是技能覆蓋率。覆蓋率越高,意味著這份檔案把用戶的資訊保存得越完整,也就意味著隱私泄露越嚴重。

第二個層次是"智能體層模仿風險"。這個層次的問題是:把技能裝載到AI助手上之後,這個助手能在多大程度上冒充真實用戶?研究團隊用兩個指標來回答這個問題。

第一個叫"問答準確率"(QA Accuracy)。研究者直接問裝了技能的AI助手:"你叫什麼名字?""你從事什麼職業?""你的大五人格中外向性是高還是低?"等各類針對用戶屬性的問題,然後把AI的回答與真實用戶檔案進行比對,計算正確率。這衡量的是一種直接風險:一個攻擊者可以通過直接提問來套取用戶資訊。

第二個叫"詞彙增益"(VocabGain)。這個指標要複雜一些,衡量的是AI助手模仿用戶語言風格的能力。測量時,研究者讓三個版本的AI助手在與該用戶個人情況高度相關的場景里生成文本——一個裝了人格技能、一個沒有任何個人資訊、一個擁有完整用戶檔案作為參考。通過對比三個版本生成的文字中有多少詞彙和表達方式與真實用戶的語言習慣匹配,可以計算出技能讓AI的語言風格"向真實用戶靠近了多少"。如果裝了技能的AI比沒有資訊的AI更像那個用戶,但又沒有完全知道用戶檔案的AI那麼像,那這個技能就是真的捕捉到了用戶的語言特徵。這個指標特別之處在於,它不是用一套通用任務來測所有用戶,而是為每個用戶設計與其個人情況高度相關的專屬場景,更接近真實世界裡有人冒充特定人物進行溝通的風險。

**四、觸目驚心的測試結果**

配備了完整的數據集、三種提煉方法和三套指標之後,研究團隊在三個目前業界最前沿的AI系統上進行了大規模測試,分別是OpenAI的GPT 5.4、Anthropic的Claude Haiku 4.5和Google的Gemini 3.6 Flash。每個系統既負責提煉技能,也負責在技能裝載後扮演用戶作答,這樣就能測試一個AI系統端到端的完整風險。

技能覆蓋率的結果首先令人矚目。以GPT 5.4為例,採用三階段提煉時,整體覆蓋率高達66.2%,採用直接提煉時為63.6%,採用同事提煉時也有55.2%。換句話說,提煉出來的技能檔案平均保留了用戶超過一半乃至三分之二的個人資訊。

更值得關注的是不同維度的差異。用戶的溝通風格被保留得最為完整,覆蓋率在88%到92%之間,幾乎到了"幾乎全部留下"的程度;性格特徵的覆蓋率也在69%到76%之間。相比之下,基本人口資訊(如年齡、種族、出生地)的覆蓋率反而更低。這意味著,技能檔案最擅長捕捉的,恰恰是最難通過刪名字、刪地址來防護的那些東西——你說話的語氣、你的思維習慣、你的性格傾向。Gemini 3.6 Flash和Claude Haiku 4.5的表現與GPT 5.4高度一致,整體覆蓋率分別維持在61%到65%和60%到62%之間,溝通風格的覆蓋率同樣接近90%。這種跨模型的一致性表明,這不是某個AI的特定問題,而是人格技能這種機制本身帶來的結構性風險。

在問答準確率方面,裝了技能的AI同樣展現出相當高的資訊復現能力。GPT 5.4採用三階段提煉時,整體問答準確率達到56%,對溝通風格類問題的準確率更高達76%。就算是最弱的一種配置,準確率也在50%左右。這意味著,如果有人系統性地向一個裝了你的人格技能的AI提問,他們平均能正確了解你一半以上的個人屬性。

詞彙增益的結果則揭示了更深層的風險。GPT 5.4的整體詞彙增益約為31%,意味著裝了技能的AI在語言風格上與真實用戶的相似度,比完全不了解用戶的基線版本高出了約三分之一的"追趕距離"。溝通風格維度的增益尤其突出,在某些配置下超過87%,幾乎達到了"擁有完整用戶檔案"版本的水平。換言之,即使攻擊者不能直接讀到技能檔案里寫了什麼,他們只要觀察AI的說話方式,就能以相當高的精度還原出真實用戶的語言特徵。

**五、現有防護手段效果幾何**

面對如此嚴峻的風險,已經有哪些應對方法可以使用?研究團隊設計並測試了四種防護策略,分成"主動防護"和"被動防護"兩大類。

主動防護的目標是在技能提煉之前,減少或擾亂對話記錄里的個人資訊,讓提煉出來的技能儘可能少地攜帶真實用戶的特徵。

第一種主動防護叫"隱私淨化"(Privacy Sanitization,PS),屬於"實時在線"型干預。它的原理是在每次用戶說話之前,先把用戶的原始表達改寫成更中性、更去個性化的版本,再送入對話歷史。舉個例子,原本一個三十多歲的西雅圖文藝青年可能會說:"說真的,我最近在重溫幾部太平洋西北部的雨天電影,有沒有特別有那種西雅圖氣質的片單推薦?"經過淨化處理後,這句話可能就變成了:"推薦一些以特定地區氣候為背景的電影。"個人資訊和語言風格特徵都被抹去了,但請求的基本意圖被保留了下來。為了防止固定的改寫模式被識破,系統會從幾種不同的中性表達形式中隨機選擇,包括簡潔命令式、略正式的句式、口語問句式等。

第二種主動防護叫"對抗性混淆"(Adversarial Obfuscation,ADV),屬於"事後注入"型干預。它不修改已有的對話內容,而是在一段對話結束之後,附加上一段"錯誤資訊"。具體做法是,先從已有對話中識別出暴露了哪些用戶資訊,然後生成一段新的虛假對話,在這段對話里把真實的個人屬性替換成合理但錯誤的替代資訊。比如,如果原始對話暴露了"用戶是項目管理專業的研究生",注入的虛假對話可能聲稱"我在墨西哥灣石化行業做現場服務工程師"。這樣,技能提煉時就會被混入矛盾的資訊,理論上應該會干擾提煉結果。

被動防護則不試圖阻止資訊被提煉,而是在技能里埋下"數字水印",一旦有人未經授權使用這個技能,就能被追蹤到。這種方法叫"語義後門注入"(Semantic-level Backdoor Injection,SBD)。

它的核心邏輯是這樣的:在對話里嵌入一種特殊的"觸發器-響應"對。觸發器是某種特定類型的行為,比如"當用戶要求驗證某個具體數字或計算結果時";對應的響應是一種極為罕見的語言習慣,比如"在回答末尾加一個括號里的心情標註"。這兩個要素都是用語義描述的,而不是固定的字面文字,所以每次注入的具體措辭都不一樣,外人很難察覺規律。一旦有人提煉並使用了包含水印的技能,只要觸發特定情境,AI就會出現那種罕見的語言習慣,從而暴露出技能的來源。

測試結果表明,這幾種防護手段都有一定效果,但都存在明顯的局限性和依賴性。

隱私淨化是表現最好的主動防護。它對溝通風格的抑制效果最為顯著——在直接提煉配置下,溝通風格的詞彙增益從87.3%驟降至6.5%,問答準確率從75.5%降至54.8%。但性格特徵和背景資訊的泄露則難以根除,性格特徵的技能覆蓋率在淨化之後依然維持在68%到70%之間。整體而言,淨化處理之後技能整體覆蓋率降至51%左右,問答準確率降至40%左右,詞彙增益降至個位數。換句話說,淨化確實有效,但離"消除風險"還差得遠,大約還有一半的個人資訊仍然保留在技能中。

對抗性混淆的效果則明顯更弱。它對溝通風格覆蓋率的抑制作用有限,整體技能覆蓋率只降到了58%到59%之間。在同事提煉配置下,混淆甚至反而使整體詞彙增益從19.4%小幅上升至20.9%,說明注入的虛假資訊並沒有有效干擾提煉過程,技能仍然捕捉到了用戶的真實特徵。

後門注入的效果則呈現出極強的"提煉方法依賴性"。在直接提煉和三階段提煉兩種方法下,靜態檢測率(Static ASR,即後門是否在技能檔案中可見)高達96%到100%,行為激活率(Behavioral ASR,即裝了技能的AI是否真的會在觸發情境下表現出水印行為)也達到了40%到82%。但當使用同事提煉時,情況急轉直下:靜態檢測率跌至30%到40%,行為激活率歸零。研究團隊分析認為,這是因為同事提煉會把觀察到的一切都重新整理成"人格特徵"的框架,水印中那個"遇到數字核實要求時加括號心情標註"的習慣,被它重新理解為"這個用戶有一種核實傾向的人格特質",於是具體的觸發-響應對應關係就消失了,水印也就隨之失效。

**六、從細節中讀出更深的規律**

研究團隊還進行了一系列專項分析,進一步揭示了風險的底層結構。

在對話數量對風險的影響方面,測試結果顯示,即使只用10%的對話記錄進行提煉,技能覆蓋率和問答準確率也分別達到了約50%,並隨著對話數量增加而逐步提升,在使用全部對話時分別達到約63%和56%。這說明,風險並不是隨著數據量線性增長的——哪怕只有少量對話,提煉出的技能也已經包含了相當多的個人資訊。換句話說,不存在"只要互動不多就安全"的下限。

在淨化力度對效果的影響方面,研究發現,加大淨化力度能穩定降低技能覆蓋率,在最大力度時降幅達到14.1%。但問答準確率的變化則更不規律:在低力度淨化時反而略有上升,直到高力度時才出現明顯下降。這種分離表明,淨化對"技能檔案里明確寫著什麼"的壓制效果,強於對"裝了技能的AI實際上能答對什麼"的壓制效果。簡單來說,就是檔案可能看起來乾淨了一些,但AI仍然能以某種方式"記住"用戶的特徵,並在被問到時給出正確答案。

在後門注入覆蓋率對水印效果的影響方面,測試表明,只要有20%的對話被注入了水印,靜態檢測率就能達到80%以上,並在更高覆蓋率時維持在80%到100%之間。這說明,水印不需要覆蓋所有對話就能持久存在,反覆出現的語義規律能被提煉過程穩定地捕獲。

值得一提的是,Claude Haiku 4.5和GPT 5.4在主動防護方面表現出高度相似的模式,但在被動防護上有一個明顯差異:對於GPT 5.4,同事提煉會大幅降低水印的靜態可檢測性;而對於Claude Haiku 4.5,無論使用哪種提煉方法,水印的靜態檢測率都維持在90%以上。這意味著不同AI系統對相同技能的"消化方式"有所不同,同一套防護策略在不同系統上的效果可能大相徑庭。

**七、這些發現意味著什麼**

把所有結果拼在一起,可以看出幾條清晰的規律。

人格技能帶來的風險是結構性的,不是個別失誤。無論換哪個AI模型、用哪種提煉方法,隱私泄露和模仿風險都穩定存在。這說明風險來自"把個人對話提煉成可復用檔案"這件事本身,而不是某個具體實現的疏漏。

風險最難防禦的部分不是那些顯而易見的資訊。姓名、年齡、地址這些明顯的個人資訊,其實在技能里的覆蓋率反而最低;而溝通風格、性格特徵這些更隱性的資訊,被技能捕捉和再現的能力卻最強,也是最難被現有防護手段消除的。

現有防護手段之間存在明顯的不對稱性。隱私淨化對表面語言風格的壓制效果相對顯著,但對性格和背景資訊效果有限;後門水印在直接型提煉方法下效果不錯,但遇到更人格化的提煉方式就會失效。沒有一種單一的防護手段能夠跨越不同風險類型和提煉方法,提供全面的保護。

歸根結底,這項研究最核心的資訊是:人格技能這種技術在帶來個性化助手便利的同時,也打開了一扇新的隱私之窗,而我們目前還沒有足夠有效的工具來關上它。

這對普通用戶意味著什麼?如果你用過或正在用某款AI助手,你的歷史對話可能正在被用來構建一份"你"的檔案。這份檔案能復現你的說話方式,能回答關於你的各種問題,而且可以被分發給其他AI系統使用。現有的"匿名化"或"淨化"操作能在一定程度上減少風險,但無法完全消除。研究者希望這份評測報告能夠推動更有效的隱私保護方法的研發,讓個性化AI真正做到對用戶友好的同時,也對用戶的隱私負責。

Q&A

Q1:AntiSkillBench測試的"人格技能"到底會泄露哪些用戶資訊?

A:AntiSkillBench的測試結果顯示,人格技能對用戶溝通風格的資訊保留程度最高,覆蓋率接近90%,性格特徵的覆蓋率也達到70%左右。相比之下,姓名、年齡等基本人口資訊的泄露程度反而更低。也就是說,技能檔案最擅長捕捉的是用戶獨特的說話方式、口頭禪和思維習慣,而這些恰恰是最難用常規匿名化手段消除的內容。

Q2:隱私淨化(Privacy Sanitization)能有效保護人格技能中的用戶隱私嗎?

A:隱私淨化有一定作用,尤其對表面語言風格的壓制效果比較明顯,能將溝通風格的詞彙增益從87%以上降至接近零。但對於性格特徵和背景資訊,效果明顯不足,淨化處理後性格的技能覆蓋率仍維持在68%到70%左右。整體而言,淨化之後仍有約一半的個人資訊留在技能中,距離真正消除風險還有較大差距。

Q3:語義後門注入(SBD)作為水印追蹤手段,在什麼情況下會失效?

A:語義後門注入在直接提煉和三階段提煉方法下表現良好,靜態檢測率可達96%至100%。但當使用同事提煉方法時,水印效果大幅下降,靜態檢測率跌至30%到40%,行為激活率降為零。原因在於同事提煉會把所有觀察到的行為重新歸納為人格特質,水印中的特定觸發-響應關聯被吸收進更寬泛的人格描述,具體的規則就此消失,水印也隨之失效。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新