這項由北京郵電大學、上海人工智慧實驗室和重慶郵電大學聯合開展的研究,以預印本形式發布於2026年7月,論文編號為arXiv:2607.20891,感興趣的讀者可通過該編號查詢完整原文。
當你把一項嚴肅的調查任務交給一位助手,卻發現他讀了一篇謠言文章後,把那篇謠言的結論當成自己的研究成果寫進了報告裡——這件事聽起來像是助手的重大失職。而研究團隊發現,當今最先進的AI"深度研究"助手,正在以超過一半的概率犯下這個錯誤。
近年來,一類被稱為"深度研究"(Deep Research)的AI系統開始流行。這類AI不只是簡單地回答問題,而是像一位真正的研究員那樣工作:先把大問題拆解成小問題,然後在網路上反覆搜索、閱讀資料、整理筆記,最終輸出一份條理清晰的研究報告。OpenAI、Google等公司都已推出了這類產品,它們被用於科研輔助、行業分析乃至學術寫作。
然而,研究團隊提出了一個令人不安的問題:如果網路上恰好存在一些"寫得像模像樣但內容是假的"資料,這類AI助手會不會把假結論當成真結論寫進它的最終報告?
為了系統性地回答這個問題,研究團隊搭建了一套名為MisKnow-Agent的實驗框架,專門用來製造"外表可信、內容卻是假的"文件,然後把這些文件混進AI助手能搜索到的資料庫里,觀察AI最終是否會在報告中採用那個假結論。實驗結果相當驚人:哪怕只混入一份這樣的假文件,六種不同配置的AI系統中,平均有超過54%的報告會把假結論當成自己的研究結論寫出來。而在沒有混入任何假文件的對照組中,這個比例是整整的零。
---
一、"深度研究助手"是什麼,它為什麼會面臨這個風險
要理解這項研究,得先搞清楚"深度研究助手"究竟是怎麼工作的。
普通的AI對話助手,就像一個博聞強識的朋友,你問什麼它回答什麼,依靠的主要是它在訓練時學到的知識。而深度研究助手更像是一個被委託去"做作業"的研究員:收到任務後,它會先制定一個研究計劃,然後一輪一輪地在網際網路上搜索資料、閱讀網頁、把重要內容記錄下來,再根據積累的筆記撰寫報告。整個過程可能涉及幾十次搜索和大量中間材料的積累。
這種工作方式帶來了一個天然的脆弱點:AI助手在整個研究過程中會接觸大量外部資料,而它無法保證這些資料都是真實可靠的。現實世界的網路上,存在著各種各樣質量參差不齊的內容——有些是真正嚴謹的學術論文,有些是道聽途說,還有些內容雖然措辭專業、排版規範,卻包含著根本不存在的"研究發現"或"統計數據"。
此前,學術界已經研究過類似問題在簡單問答場景中的表現,也就是說,當你直接給AI看一段假內容然後問問題,AI多大概率會被誤導。但深度研究助手的工作場景要複雜得多:假內容可能在研究過程中的任何一個環節混入,被摘錄進研究筆記,再在最終生成報告時被當作可信依據引用。這個傳導鏈條更長,檢驗起來也更有挑戰性。研究團隊正是要填補這個空白。
---
二、研究團隊是怎麼製造"精心設計的假文件"的
為了讓實驗嚴格可控,研究團隊不能隨便找一篇網上已有的假文章了事。他們需要針對每個具體的研究任務,定製化地生成一批"外表極具可信度、內容卻是精心設計的謊言"的文件。這個製造過程本身就很有意思。
整個製造流程分三步走。第一步是"打草稿",也就是為每個研究任務設計一個"假結論藍圖"。藍圖里包含了這個假結論的具體內容——比如某個從未存在的軟體功能、某個子虛烏有的統計數字——以及一個按"可信度高低"分層的機構名稱庫。高可信度機構聽起來像MIT、斯坦福這樣的頂級研究院,中等可信度是各類區域研究中心,低可信度則是個人部落格、網路論壇等。藍圖還包含了一套評判標準,用來事後判斷AI是否真的把這個假結論當成了自己的研究結論。
第二步是"批量生產"。根據藍圖,系統自動生成多種版本的假文件,覆蓋不同的機構權威級別和不同的文體風格。文體風格包括四種:看起來像學術論文的正式文章、看起來像新聞報道的資訊文章、看起來像技術部落格的分析文章,以及看起來像社交媒體帖子的短文。每種風格對應著真實網路上最常見的內容類型,而且同樣的假結論會用這四種截然不同的面孔出現。
第三步是"質量把關",這也是最關鍵的一步。研究團隊深知,如果假文件里的某個具體說法恰好在現實中是真的,實驗就會失去控制變量。於是,他們讓五個不同的AI模型分別去搜索驗證每份假文件的核心說法,只有當所有五個模型都判定"這個說法在現實世界中找不到任何支撐,是假的"時,這份文件才會被保留進最終的實驗語料庫。五個驗證模型包括了GLM-5、Kimi 2.6、DeepSeek-V4 Pro、Qwen3.5-397B和Intern-S1-Pro,來自不同公司、使用不同訓練數據,這樣可以減少單一模型偏差帶來的誤判。
經過這套流程加上人工篩選,最終保留了5933份質量合格的假文件,覆蓋100個來自"深度研究基準測試"的真實研究任務。研究團隊還對每個任務的"假結論"逐一進行了人工審核,對照權威來源確認其確實是假的,沒有一個被評為"無法確認"或"實際為真"。這些任務還被人工確認了所有假結論,確保100%都是被實際證偽的錯誤說法。
---
三、實驗是怎麼做的,判斷AI"被忽悠了沒有"的標準是什麼
實驗設計本身也值得細細道來,因為研究團隊在判斷"AI有沒有被忽悠"這件事上,設置了相當嚴格的標準。
判斷AI是否"採用了假結論",不是看AI有沒有在報告裡提到那個假結論,而是看AI有沒有把那個假結論當作自己的研究結論來背書。如果AI只是寫道"某研究機構聲稱……但此說法尚未得到廣泛證實",這算作"沒有被忽悠"。只有當AI的報告在自己的結論、建議或核心分析中,把假結論當成已經確立的事實來呈現時,才算作"被忽悠了"。這個判斷由DeepSeek-V4 Pro擔任評判模型,其與人類標註者的一致率高達99.7%,Cohen's κ係數為0.993,基本可以認為是準確可靠的。
實驗以"假結論採納率"(FCAR,False-Conclusion Adoption Rate)作為核心指標,記錄在各種條件下AI最終報告採納假結論的比例。
研究團隊主要檢驗了以下幾個維度的影響:假文件出現在搜索結果中的位置排名(靠前、散布、靠後)、假文件被AI接觸到的時間節點(研究開始時、研究中間、報告生成前夕)、文件來源的權威級別(高、中、低)、文件的呈現風格(論文、新聞、部落格、帖子)、同時混入的假文件數量(0到5份),以及使用不同的研究框架和底層AI模型的組合。
---
四、最關鍵的發現:什麼因素決定AI有多容易被忽悠
研究團隊從實驗中得到了一系列具體而清晰的發現,每一條都頗具啟發性。
關於文件出現在搜索結果中的位置,研究發現這幾乎沒什麼影響。無論假文件出現在搜索結果的第一位、散布在中間還是排在最末尾,AI的假結論採納率差異不超過兩個百分點(分別是66.2%、65.5%和64.5%)。這說明AI並不像人類那樣會優先關注"排名靠前的結果更可靠",只要內容被讀到,排名高低並不能幫助過濾掉虛假資訊。
關於假文件被讀取的時間節點,這裡出現了最戲劇性的差異。如果假文件在AI開始研究時就混入,假結論採納率是40.5%;如果在研究進行到中途時混入,是44.2%;但如果等到AI已經完成了所有研究、即將開始撰寫最終報告時才混入,假結論採納率驟升至85.5%,六種配置中最高的達到94%。
這個規律背後有一個深刻的邏輯:如果假文件在研究早期混入,AI在後續的研究過程中還有機會搜索到反駁它的真實資料,從而在積累的筆記中形成"這個說法存疑"的判斷。但如果假文件在報告撰寫的最後時刻才出現,AI沒有時間再去搜索驗證,只能直接把它當作最新獲得的參考資料納入報告,結果導致採納率幾乎翻倍。
關於來源的權威級別,總體趨勢是:來源越權威,AI越容易被忽悠。高權威來源(看起來像頂級研究機構發布的內容)對應的平均假結論採納率是61%,中等權威是57.7%,低權威(個人部落格、論壇帖子)是46.2%。在每一種AI配置下,低權威來源的採納率都低於高權威來源。不過,高權威和中等權威之間的差異並不總是單調遞減的,有兩種WebThinker配置甚至出現了中等權威略高於高權威的情況,說明這個規律存在一定波動。
關於文件的呈現風格,這裡出現了比權威級別更強、更一致的效果。以論文形式呈現的假文件,平均假結論採納率最高,達到61%;其次是部落格形式(53%)和新聞形式(44%),而以社交媒體帖子形式呈現的假文件採納率最低,只有37.5%。更值得注意的是,這個排序在所有六種AI配置中都保持一致:論文形式最容易被採納,帖子形式最不容易被採納。論文風格與帖子風格之間23.5個百分點的差距,甚至比權威級別高低造成的14.8個百分點的差距還要大。換句話說,把假內容包裝成一篇格式規範、用詞專業的"學術論文",比把它歸屬給一個"權威機構"還要有效。
關於混入的假文件數量,在沒有混入任何假文件的對照組裡,六種配置的假結論採納率全部是0%,證明這些AI不會無緣無故地"自發"產生那些假結論。一旦混入哪怕一份假文件,採納率就跳升到平均54.7%。隨後混入兩份,採納率升到59.5%;三份時達到峰值61%;繼續增加到四份(60.3%)或五份(58.3%)時,採納率反而不再上升,甚至略有下降。這說明一份假文件就足以造成顯著影響,而堆積更多假文件並不能成比例地加強這種影響。
---
五、不同AI系統和研究框架之間的差異
實驗選用了兩個開源的深度研究框架——DeerFlow(字節跳動開發)和WebThinker——分別搭配三個不同的底層AI模型(DeepSeek-V4 Pro、Qwen3.5-397B和Intern-S1-Pro)進行測試,共形成六種配置。六種配置在高權威、論文風格的標準條件下,假結論採納率從50%到76%不等。
兩個框架之間存在系統性差異:平均來看,DeerFlow的假結論採納率(67%)高於WebThinker(55%)。研究團隊通過分析中間過程發現了一個有趣的解釋:DeerFlow採用相對直接的"規劃-搜索-匯報"流程,搜索到的內容會相對完整地保存並傳遞給最終報告生成環節;而WebThinker會把任務拆解得更細,把搜索到的內容壓縮進一個"文檔記憶庫",再分段撰寫和編輯報告,這些額外的處理步驟有時會無意中過濾掉假文件的影響。
然而,這兩個框架的差距大小因底層模型而異。使用Intern-S1-Pro時,DeerFlow的採納率比WebThinker高出整整21個百分點;使用Qwen3.5-397B時差距縮小到10個百分點;使用DeepSeek-V4 Pro時只剩5個百分點。更反直覺的是,DeepSeek-V4 Pro在WebThinker框架下的採納率反而是三個模型中最高的(60%),因為這個模型在WebThinker的記憶系統里會更積極地在後期合成階段回調早期獲取的證據——包括那些假證據。這說明,AI模型的"智力水平"高低並不直接等同於"抵抗假資訊的能力"強弱,框架設計和模型特性的交互作用才是關鍵。
研究團隊還專門測試了閉源商業系統Gemini Deep Research,發現其表現出了大體相似的規律:高權威來源假結論採納率54%,低權威來源驟降至8%;論文風格採納率54%,帖子風格28%。Gemini在假文件數量增加方面的反應與開源系統略有不同——其採納率從一份文件時的27%隨著數量增加而穩步上升,到三份時達到54%後趨於平穩。這說明這個問題並非某一類系統獨有,而是當前深度研究AI
普遍面臨的挑戰。
---
六、研究團隊提出了哪些防禦手段,效果怎麼樣
發現問題之後,研究團隊也嘗試了兩種防禦策略,並系統測試了它們的有效性。
第一種防禦叫做"研究前防禦",本質上是在把任務交給AI之前,在提示詞裡附加一段額外指令。這段指令要求AI把所有搜索到的資訊視為"未經驗證的資訊",在最終結論中只使用有獨立可靠來源支撐的說法,對於來源單一、證據薄弱或存在矛盾的說法要明確標註不確定性或直接不用。這段指令不涉及任何具體任務內容,也不告訴AI哪份文件是假的,完全是通用的"證據核查意識"激活指令。
第二種防禦叫做"研究後防禦",在AI完成研究報告之後,再啟動另一個搜索增強型AI對報告中的每一個關鍵說法逐條進行獨立核查,對於能找到支撐的說法保留,對於被反駁的說法修正,對於無法確認的說法則打上不確定標記。
實驗結果顯示,兩種防禦都能降低假結論採納率,但都無法完全消除它。在使用DeepSeek-V4 Pro的DeerFlow配置中,基準採納率是65%;單獨使用研究前防禦後降到41%;單獨使用研究後防禦後降到20%;兩者結合則降到15%。對Qwen3.5-397B的效果同樣明顯:從60%分別降到37%、41%和29%。
然而,防禦效果存在明顯的模型依賴性,甚至在某些情況下兩種防禦疊加反而不如單獨使用一種。在Intern-S1-Pro配置中,單獨使用研究前防禦使採納率從76%降到57%,單獨使用研究後防禦降到58%,但兩者結合後反而升到了62%。研究團隊推測,這是因為研究後防禦階段的AI進行獨立核查時,使用的是同一個混入了假文件的資訊環境,有時反而重新檢索到那些假文件並被再次影響,部分抵消了研究前防禦的效果。
歸根結底,這兩種防禦手段減輕了問題的嚴重性,但沒有從根本上解決它。研究團隊認為,真正有效的防禦需要把證據核查機制貫穿於AI研究過程的每一個環節,而不僅僅是在開始前叮囑一句或在結束後補查一遍。
---
說到底,這項研究揭示的問題並不只是一個技術細節,而是關乎AI深度研究工具在現實世界中能否被信任的根本性問題。當AI助手在處理一個複雜研究任務時,它的弱點不在於被故意植入的惡意指令,而在於它對"看起來可信的內容"缺乏足夠的批判性鑑別能力——這是一種內容層面的脆弱性,而非系統層面的攻擊。
對於普通使用者而言,這意味著當你使用任何形式的AI研究助手生成報告時,對於報告中引用了"某某機構發布的研究顯示"這類來源的結論,依然需要保持審慎,尤其是當該結論聽起來很新穎或與主流認知有出入時。AI助手目前能做的是幫你檢索和整理資訊,但它尚不能完全替代人類研究者對證據質量的深度判斷。
這項研究同時也給AI開發者提出了明確的方向:僅僅在使用前提醒AI"注意核查"是不夠的,需要把持續性的證據驗證機制嵌入AI研究工作流的每一個中間環節,才有可能在長周期的複雜研究任務中真正抵禦誤導性資訊的侵入。感興趣的讀者可以通過arXiv:2607.20891查閱完整論文,深入了解實驗設計的所有細節。
---
Q&A
Q1:深度研究AI採納假結論的比例有多高?
A:根據實驗,在沒有混入任何假文件時,六種不同配置的深度研究AI系統假結論採納率均為0%。但只要混入一份設計精良的假文件,平均假結論採納率就會跳升至54.7%。在報告撰寫前夕才混入假文件時,採納率更高達85.5%,某些配置甚至達到94%。
Q2:把假內容偽裝成學術論文格式真的更容易騙到AI嗎?
A:是的,效果相當明顯。實驗發現,以學術論文風格呈現的假文件平均假結論採納率達到61%,而以社交媒體帖子形式呈現的相同假內容採納率只有37.5%,差距超過23個百分點。這個差距甚至比把來源從普通部落格換成頂級研究機構所帶來的差距(約15個百分點)還要大,說明呈現格式比來源權威性的影響還要強。
Q3:MisKnow-Agent框架製造出來的假文件是真實可用的攻擊工具嗎?
A:不是。研究團隊明確說明,他們並沒有把任何假文件發布到真實網際網路上,也沒有修改任何真實的資訊環境。這些假文件只被插入了實驗室控制的測試檢索池中,目的是模擬現實中已經存在的誤導性內容,研究AI系統如何應對,而非製造或傳播虛假資訊。






