宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

騰訊與中科大聯手:當AI搜索遇上「閱卷老師」,文檔篩選的革命來了

2026年08月04日 首頁 » 熱門科技

這項由中國科學技術大學與騰訊元寶團隊、中國科學院大學及山東大學聯合開展的研究,以預印本形式於2026年7月發布,論文編號為arXiv:2607.19747。有興趣深入了解的讀者可通過該編號在arXiv平台查閱完整論文。

一、搜索結果"全對"但答案卻是錯的?

假設你請了五位助手去圖書館幫你查一道歷史題,結果他們帶回來的五本書,每一本都與這道題有關聯——然而翻開一看,兩本書講的幾乎是同一件事,第三本里有一個關鍵錯誤,第四本把重要資訊藏在幾百頁無關內容的中間,第五本提供了一些邊角資訊但缺少最核心的那塊拼圖。最終你手裡有五本"相關書籍",卻依然無法給出一個完整、準確的答案。

這個令人沮喪的場景,正是當今人工智慧搜索系統天天都在經歷的困境。在傳統的資訊檢索邏輯中,評估一次搜索好不好的標準非常簡單:每一篇文檔單獨評分,看它與查詢問題有沒有關係,然後把分數加總排個名次,這就是所謂的nDCG評估體系。這套方法沿用了幾十年,在人類用眼睛瀏覽搜索結果的時代運轉得還不錯——畢竟人類有能力自己過濾重複內容、識別矛盾說法、判斷哪些資訊是真正需要的。

然而現在,讀取搜索結果的主體變了。大型語言模型(也就是那些能對話、能寫文章、能回答問題的AI)會直接把搜索到的文檔塞進自己的"大腦"里,以此為依據生成答案。這個過程叫做檢索增強生成,簡稱RAG。在這種模式下,文檔集合的質量直接決定了AI最終能給出多好的答案——就像廚師只能用現有的食材做菜,如果送來的食材里有壞的、重複的、甚至摻了雜質的,再高明的廚師也無法做出完美的菜餚。

這項研究的切入點正是這個被長期忽視的問題:現有的評估體系根本看不出文檔集合里存在哪些深層缺陷,更無法指導我們去修復這些缺陷。於是,研究團隊決定從頭設計一套全新的診斷工具。

二、一份專為"文檔集合"量身定製的成績單

研究團隊構建的核心工具叫做SETWISEEVALKIT,可以把它理解為一位非常挑剔的閱卷老師,不只是問"這份答卷有沒有寫到點子上",而是從三個層次、九個維度對整套文檔組合進行全面體檢。

第一個層次是文檔個體層面,考察每一篇文檔自身的質量。這裡包含三個維度:相關性,也就是文檔有沒有真正觸及問題的核心,而不只是表面上出現了關鍵詞;真實性,文檔里陳述的事實有沒有和正確答案相符,有沒有包含錯誤資訊;以及質量,文檔的結構是否清晰,讀者能不能方便地從中提取到需要的資訊,而不是把關鍵內容淹沒在大量無關廢話里。

第二個層次是文檔集合層面,考察多篇文檔放在一起時如何相互作用。這裡同樣有三個維度:互補性,不同文檔有沒有各自提供不同的關鍵資訊片段,拼合起來比任何單一文檔都要完整;冗餘性,有沒有兩篇或多篇文檔說的幾乎是同一回事,白白占用了有限的空間;以及衝突性,不同文檔對同一個事實有沒有給出互相矛盾的說法,從而可能誤導AI得出錯誤結論。

第三個層次是整體效用層面,把這套文檔組合當作一個整體來看,考察它能不能真正支撐AI完成推理任務。這裡的三個維度分別是完整性,文檔集合有沒有覆蓋生成正確答案所需的所有關鍵資訊點;資訊密度,文檔里真正有用的內容占整篇文檔的比例,有沒有被大量無關填充物稀釋;以及可達性,僅憑這套文檔集合,不依賴任何外部知識,AI能不能從頭到尾走完完整的推理鏈條,最終得出正確答案。

這套體系的精妙之處在於,它打破了"文檔集合的質量等於每篇文檔質量之和"這個長期被默認接受但實際上並不成立的假設。五篇各自相關的文檔,組合在一起可能因為高度重疊而幾乎沒有額外價值;而五篇看起來分散的文檔,如果每篇恰好提供了不同的關鍵資訊片段,組合起來的價值可能遠超單純的分數疊加。

三、28000條評分標準從何而來

光有評估維度還不夠,還需要具體的評分標準。研究團隊採用了一種被稱為"評分細則"的方法——為每一個查詢問題專門定製一套評判標準,而不是用千篇一律的模板來評價所有問題。

生成這些評分細則的過程本身就頗具巧思。研究團隊把每一對"問題+標準答案"同時交給兩個頂級AI模型分別生成候選標準,要求每條標準必須具體到這道題的關鍵實體、具體事實和數字,絕對禁止寫"包含相關內容"這樣的模糊廢話。然後,第三個AI模型對兩批候選標準進行匯總和篩選,去掉重複的和質量差的,最終產出精華版本。

這個過程在兩類場景下分別進行。第一類是短答案場景,基於四個多跳問答數據集——HotpotQA、2WikiMultihopQA、MuSiQue和Bamboogle——最終保留了2061個高質量樣本,生成了約24000條評分標準。為什麼偏偏選多跳問答?因為這類問題天然需要綜合多篇文檔才能回答,比如"哪家公司收購了在1994年引發個人電腦價格戰的那家公司,最終於2002年完成合併",一篇文檔可能只知道誰發起了價格戰,另一篇才知道後續的收購,兩篇合起來才能回答完整。這種結構特別適合檢驗文檔集合的組合質量。

第二類是長答案場景,基於ResearchQA這個橫跨75個研究領域的學術問答數據集,隨機抽取200個樣本,生成了約4000條評分標準。長答案場景下使用的是一個叫做DR.Tulu-8B的開源深度研究智能體,它會自主進行多輪搜索,每次調用谷歌搜索API獲取文檔,最終綜合所有輪次的發現生成一篇完整的研究報告。

整套標準經過人工質量審核。研究團隊隨機抽取樣本,請博士級別的專家對每條評分標準從兩個角度評分:這條標準有沒有實際區分高低質量文檔集合的能力,以及如果刪掉這條標準,文檔集合的排名會不會發生明顯變化。結果顯示,經過多模型匯總後,大約70%的標準被評定為高度或極度有區分力,遠高於單個模型生成時的37%到43%的比例,而質量堪憂的標準占比只有約8%。三位專家之間的一致性得分也達到了非常高的水平,說明這套評分體系是可靠的。

四、現有搜索排序方法究竟差在哪裡

有了這把精準的量尺,研究團隊對12種主流文檔重排序方法進行了全面評測。這12種方法大致分為三類:傳統的逐文檔評分排序方法(如BGE-Reranker、MonoT5、RankT5等),加入了推理能力的增強型排序方法(如Rank1、Rearank、ReasonRank),以及專門針對文檔集合整體進行優化的新型方法(SetR和Rank4Gen)。

結果令人矚目,但不是那種令人振奮的矚目,而是令人清醒的矚目。即便是表現最好的方法,在這套九維度評估體系下的綜合覆蓋率也不超過45%。換句話說,所有現有方法在保障文檔集合質量方面,都還有超過一半的改進空間。

在短答案場景下,專門優化文檔集合整體結構的SetR和Rank4Gen方法明顯領先,這說明在固定候選池裡選擇最優子集的策略是有效的。加入了鏈式思維推理能力的ReasonRank在全局評估層面表現較強,因為推理能力幫助它更好地判斷一套文檔能不能支撐完整的推理鏈條。而傳統的逐文檔評分方法在任何層次上都沒有明顯優勢,暴露出這類方法在設計上的根本局限。

在長答案場景下,情況發生了有趣的反轉:推理增強型方法後來居上,ReasonRank和Rearank分別占據第一、第二位,而在短答案場景稱雄的集合型方法反而跌到了中游。這個反轉背後的邏輯是:多輪累積搜索場景需要的是判斷每次新檢索到的文檔相對於已有資訊的邊際價值,這正是推理能力的用武之地。

貫穿兩種場景的一個共同發現是:幾乎所有方法在跨文檔協調這個層面都表現得非常薄弱,尤其是互補性和完整性這兩個維度。這意味著現有的排序方法幾乎都沒有真正考慮過"這批文檔放在一起是不是一個有機的整體"這個問題,它們更像是在給每道菜單獨評分,而不是在判斷這一桌菜拼在一起算不算一頓營養均衡的餐食。

另外還有一個值得關注的細節:在長答案的多輪搜索場景里,每一輪檢索到的文檔質量評分都呈現出系統性下降的趨勢,第一輪最高,越往後越低。但這並不意味著排序方法在後面幾輪變差了,而是搜索本身的規律使然——前幾輪把最容易找到的資訊都採集完了,後面幾輪面對的是越來越窄、越來越難的資訊缺口,候選文檔池天然稀薄。研究團隊因此採用了把所有輪次選到的文檔合併去重後統一評分的方式,才能公平衡量整個搜索過程累積下來的文檔集合質量。

五、評分標準能直接變成篩選標準

前面的評測是診斷,接下來研究團隊做了一件更大膽的事:既然評分細則能量化文檔集合的質量,為什麼不讓它直接指導文檔的選擇?

這個想法催生了另一個核心貢獻——RUBRIC4SETWISE方法。這個方法不需要任何額外的模型訓練,直接把評估標準轉換成篩選指令。具體來說,給定一個查詢問題和對應的評分細則,系統會把所有候選文檔和評分細則一起餵給一個推理模型(使用了Qwen3-8B作為推理主幹),要求它先逐一核查哪些文檔能滿足哪些評分條目,然後選出能夠覆蓋所有評分條目所需資訊的最小文檔子集,而不是預先設定"取前五篇"這樣的固定數量。

這種方式的直覺是清晰的:如果我們明確知道回答一個問題需要哪些具體的資訊點,那麼選文檔的策略就不應該是"取得分最高的幾篇",而應該是"找到一個能覆蓋所有必要資訊點的最精簡組合"。前者是量化排名,後者是目標導向的集合優化。

測試結果充分證明了這個思路的價值。在短答案場景下,RUBRIC4SETWISE以平均僅使用2.66篇文檔的代價,在精確匹配率和F1分數兩個指標上都超過了所有其他方法,而排在第二位的SetR平均需要2.75篇文檔,傳統方法則固定使用5篇。用更少的文檔獲得更好的答案,說明精準篩選比堆砌數量更有效。

在長答案場景下,RUBRIC4SETWISE同樣以70.57分的LLM裁判得分拔得頭籌,超過第二名SetR的70.54分,以及推理增強方法ReasonRank的68.36分。更值得注意的是,它使用的總文檔數(20.52篇)少於SetR的29.23篇,搜索輪次(平均4.52輪)也少於SetR的4.73輪。也就是說,RUBRIC4SETWISE用更少的資源換取了更好的結果,這在實際應用中意味著顯著的效率提升。

還有一點尤為重要:RUBRIC4SETWISE是唯一一個在短答案和長答案兩種場景下都保持頂尖表現的方法,其他方法要麼在短答案場景強而在長答案場景弱,要麼反之。這種跨場景的穩定性,正是研究團隊此前就已發現的現有方法普遍存在的"泛化天花板"問題的解法所在。

六、一道題的完整診斷報告

理解這套評估體系最直觀的方式,是看一個具體的例子。

考慮這樣一道問題:"在《辦公室》這部美劇里,德懷特在哪一集救了帕姆的丈夫不被羅伊傷害?"正確答案是第三季第十九集《談判》。

排序系統選出了五篇文檔:第一篇和第二篇分別從不同角度記錄了這一事件,都明確提到了集名和德懷特用辣椒噴霧阻止羅伊的情節;第三篇來自同一集的另一段落,講的是事件之後帕姆和羅伊的關係,沒有重述關鍵事件;第四篇是德懷特這個人物的傳記介紹,完全沒有涉及這場衝突;第五篇講的是第五季完全不同的一集。

逐文檔評分(以相關性為例)顯示:文檔一和二得4分,文檔三得1分,文檔四和五得0分。這和傳統評估體系能給出的資訊基本一致。然而一旦上升到集合層面,新的洞察就出現了:互補性只有1分,因為文檔一和文檔二幾乎涵蓋了所有必要資訊,沒有真正的分工;冗餘性反而得了4分(這個維度分數越高代表冗餘越少,因為兩篇各自提供了略有不同的背景細節);衝突性得4分,說明兩篇核心文檔沒有矛盾。但在全局層面,資訊密度只有1分,因為有用的那一兩句話在每篇文檔中占的篇幅實在太小;可達性只有2分,因為沒有任何文檔明確交代帕姆的丈夫就是吉姆,這個看似顯而易見的鏈接在文檔中是缺失的,純粹依賴這套文檔而沒有外部知識的AI,無法完整地推理出答案。

這就是傳統評估與多維度評估之間的核心差距:前者告訴你有沒有把"對"的文檔選進來,後者告訴你這些文檔放在一起能不能真正幫AI把問題解決掉。

七、研究的真實邊界與未來方向

任何研究都有它誠實承認的局限,這項研究也不例外。

RUBRIC4SETWISE方法依賴預先準備好的評分細則,而這些細則的生成需要知道正確答案。這在研究環境中是可行的,因為研究團隊手裡有標準答案,但在真實應用場景中,系統往往不知道答案是什麼。研究團隊把這種設定誠實地稱為"神諭設置",也就是說目前的結果代表的是這個方法在理想資訊條件下的能力上限,而不是日常部署時可以直接復現的性能。

這個局限同時指向了一個清晰的研究方向:如何在沒有標準答案的情況下,讓系統自己推斷出它需要滿足哪些資訊條件?一種可能的思路是把評分細則的偏好"蒸餾"成可訓練的獎勵信號,讓排序模型在訓練過程中內化這套多維度的質量意識,而不需要在推理時依賴現成的細則。這是研究團隊在結論部分明確指出的下一步工作方向。

另一個需要關注的現象是長答案場景下方法間差距的顯著收窄——所有方法的綜合得分差距只有大約3個百分點,而在短答案場景下這個差距接近9個百分點。研究團隊的解讀是:目前排序模型和搜索智能體基本上是各自為政,排序模型不知道智能體已經積累了哪些資訊,智能體也不會把自己的狀態反饋給排序模組,兩者之間沒有資訊流動,這才是當前長答案搜索質量的真正天花板所在。解決這個問題需要的是排序模型與搜索過程的協同優化,而這超出了當前這項研究的範圍。

歸根結底,這項研究做了一件在資訊檢索領域長期被忽視但又至關重要的事:把評估的視角從"每篇文檔夠不夠好"轉向"這批文檔放在一起夠不夠用"。隨著AI系統越來越多地依賴外部知識庫來生成答案,這種系統性的視角轉換不只是學術上的整潔,更是工程實踐上的必要進化。

當AI助手開始在醫療諮詢、法律分析、科研支持等高風險領域發揮作用時,它所依據的文檔集合究竟有多可靠,直接關係到答案的質量乃至安全性。一套能夠診斷文檔集合深層缺陷的評估體系,和一套能夠主動規避這些缺陷的選擇策略,其價值遠不止於提升幾個百分點的基準測試分數。

Q&A

Q1:SETWISEEVALKIT和傳統的nDCG評估方法有什麼本質區別?

A:nDCG是對每篇文檔單獨打相關性分數然後加總,默認"集合好壞等於單篇之和"。SETWISEEVALKIT則把文檔集合當作整體來評估,涵蓋九個維度,能發現傳統方法看不到的缺陷,比如多篇文檔高度重複、不同文檔之間存在事實矛盾、整套文檔無法支撐完整推理鏈條等問題。這相當於從"每道菜單獨評分"升級到"整桌飯合不合理"的評估邏輯。

Q2:RUBRIC4SETWISE方法為什麼用更少的文檔反而能得到更好的答案?

A:傳統方法通常取排名前五的文檔,其中可能有兩三篇內容高度重複。RUBRIC4SETWISE會先明確這道題需要哪些具體資訊點,再找到能覆蓋所有資訊點的最小文檔子集,平均只需2.66篇。刪掉冗餘文檔後,AI不需要處理重複噪音,關鍵資訊更突出,推理更準確。

Q3:評分細則的生成需要知道正確答案,實際使用時怎麼解決這個問題?

A:目前RUBRIC4SETWISE確實依賴預先知道標準答案來生成評分細則,研究團隊自己也承認這是"神諭設置",代表的是方法的能力上限而非日常可用的狀態。研究團隊提出的解決方向是把評分偏好"蒸餾"成可訓練的獎勵信號,讓模型在訓練階段就內化這套質量意識,推理時不再需要現成答案。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新