這項由美國馬薩諸塞大學阿默斯特分校與Adobe研究院聯合開展的研究,發表於2026年7月,論文編號為arXiv:2607.10463v1,研究方向屬於人工智慧與自然語言處理領域。有興趣深入了解的讀者可以通過該編號在arXiv平台上查詢完整論文。
一、你的AI助手為什麼總是答錯多步驟的問題?
你有沒有遇到過這樣的情況:你問一個AI助手一個需要"查兩遍資料"才能回答的問題,結果它給你一個聽起來很自信但其實完全錯誤的答案?
以一道典型的"燒腦題"為例:哪張Eminem的專輯收錄了一位曾發行過《Unapologetic》專輯的歌手的客串人聲?要回答這道題,你需要先搞清楚《Unapologetic》是誰的專輯(答案是Rihanna),然後再去查哪張Eminem的專輯收錄了Rihanna的客串演唱(答案是《The Marshall Mathers LP 2》)。這是一個典型的"兩跳"問題——得先找到中間那塊"跳板",才能抵達最終答案。
現有的AI問答系統在這類問題上表現糟糕,原因有三個層面。第一,如果AI只查一次資料,它可能恰好拿到了包含Rihanna和Eminem名字的兩段文字,但這兩段文字里還夾雜著大量無關資訊——比如某張專輯的銷售數據、某首歌的作詞經歷——這些"噪音"會把AI的注意力帶跑偏,讓它產生幻覺,把答案誤判為《Encore》而非正確答案。第二,即便AI可以多次查資料,如果第一次查錯了方向(比如誤以為《Unapologetic》是Kelly Clarkson的專輯),那接下來的每一步都會沿著錯誤的軌道越走越遠,最終得出一個看起來"有理有據"卻完全錯誤的結論。第三,AI在查資料時通常只會用一種方式檢索——要麼按關鍵詞精確匹配,要麼按語義相似度模糊搜索——但不同的問題需要不同的檢索方式,用單一策略應對所有情況,必然捉襟見肘。
正是為了解決這三個問題,馬薩諸塞大學阿默斯特分校與Adobe研究院的研究團隊提出了一個名為GRASP的新框架,全稱是"粒度感知搜索策略"(Granularity-Aware Search Policy for Agentic RAG)。
二、AI界的"檢索增強生成"是怎麼一回事?
在正式介紹GRASP之前,有必要先解釋一個背景概念:檢索增強生成,英文簡稱RAG。
可以把大型語言模型(也就是ChatGPT這類AI)比作一個記性極好但知識截止於某個時間點的"百科全書腦"。它在訓練時讀了海量文字,把知識"記"在了大腦里,但一旦訓練結束,它就再也無法主動更新自己的知識庫了。如果你問它一件最近發生的事,它要麼不知道,要麼胡編亂造。
RAG的出現解決了這個問題。它的核心思路是:在AI回答問題之前,先讓一個"助理"去外部文檔庫里查相關資料,把查到的內容遞給AI,AI再基於這些新鮮資料生成答案。這個過程就像考試時允許你查參考書——有了參考資料,答題質量自然大幅提升。
傳統的RAG是"靜態"的,流程固定且簡單:查一次資料,然後生成答案,完事。但對於需要多步推理的複雜問題,查一次往往遠遠不夠——你需要根據第一次查到的內容,再去查第二次、第三次,逐步拼湊出完整的證據鏈。這種"邊想邊查、邊查邊想"的動態模式,就是所謂的"智能體RAG"(Agentic RAG)。
GRASP要解決的,正是如何讓AI在這種動態多步檢索過程中,做出更聰明的決策。
三、GRASP的核心設計:三把不同的"查資料"鑰匙
GRASP給AI配備了三種不同的檢索工具,它們各司其職,相互配合,就像一個偵探團隊裡的不同專家。
第一種工具叫做"語義搜索"。這種搜索不要求你知道確切的詞語,它靠的是"意思相近"來匹配內容。就好比你告訴圖書管理員"我想找一本講人類為什麼會做夢的書",管理員會給你推薦心理學、神經科學等相關書目,即便那些書名里根本沒有"做夢"這兩個字。語義搜索擅長的是宏觀的、概念性的探索——當你還不確定答案在哪裡時,先撒一張大網。
第二種工具叫做"關鍵詞搜索"。這種搜索非常精準,它要求文檔里必須出現你指定的詞語才算匹配。就像你告訴圖書管理員"我要找書名里有'Rihanna'的書",只有書名精確包含這個詞才會出現在結果里。關鍵詞搜索擅長的是鎖定具體的人名、地名、專有名詞——當你已經知道自己要找什麼時,用它來精確定位。
第三種工具叫做"閱讀段落"。前兩種工具返回的是簡短的"摘要片段",就像圖書館的檢索系統只給你看書名和簡介。但有時候,一個簡短的片段不足以說明問題,你需要把整段完整的原文讀一遍,才能確認細節、建立上下文聯繫。這就是"閱讀段落"工具的用途——當你發現某個片段"看起來很有希望"時,立刻調出它所在的完整段落,仔細核實。
這三種工具的關鍵創新之處在於:它們操作的"粒度"是不同的。語義搜索和關鍵詞搜索返回的是句子級別的內容,而閱讀段落則返回完整的段落。通過這種設計,AI可以先看"摘要",確認相關後再讀"全文",避免一開始就把大量無關的長文本塞進自己的思考窗口裡,干擾判斷。
四、如何教會AI什麼時候用哪把"鑰匙"?——強化學習的妙用
設計好三種工具還不夠,更難的是:怎麼教AI學會在正確的時機、用正確的工具、檢索正確粒度的內容?
研究團隊採用了一種叫做"強化學習"的訓練方法。可以把這個過程理解為訓練一隻導盲犬。你不可能逐字逐句地告訴它每一步該怎麼做,但你可以在它做對了的時候給它獎勵,做錯了的時候不給獎勵,讓它通過反覆試驗自己摸索出正確的行為模式。
在GRASP的框架里,AI(也叫"智能體"或"策略")會針對同一個問題,嘗試多條不同的"檢索路徑",每條路徑就是一次完整的推理過程,包括中間的每次檢索動作和最終給出的答案。訓練結束後,每條路徑都會被評分,AI通過比較不同路徑的得分來調整自己的行為策略,逐漸學會哪種做法更有效。
評分的標準設計得相當細緻,涵蓋四個維度。
最重要的是"答案準確性"——最終給出的答案是否正確?這是最核心的評判標準,研究團隊用的是"詞語重疊度"這種客觀指標來衡量,滿分1.0分。
其次是"有根據的閱讀"——AI在使用"閱讀段落"工具時,是否真的在讀與答案相關的"黃金段落",而不是在讀無關的干擾文章?如果AI頻繁地去讀那些與問題無關的段落,會浪費珍貴的"思考空間",這種行為會被扣分。這項指標滿分0.7分,是所有輔助指標中權重最高的。
第三個維度是"互補搜索"——AI在整個推理過程中,是否同時使用了語義搜索和關鍵詞搜索這兩種工具,並且兩種工具都至少找到了一篇相關的"黃金文章"?如果AI只會反覆用同一種工具,說明它沒有學會靈活調配兩種檢索信號,這種行為會得0分。這項指標滿分0.15分。
第四個維度是"步驟效率"——AI在給出正確答案的前提下,是否用了儘可能少的步驟?這是為了防止AI養成"漫無目的地亂查"的壞習慣。但有一個重要的前提:只有當最終答案足夠正確時(準確度超過50%),效率獎勵才會發放,否則AI可能會學會"少查兩步、隨便猜個答案"這種投機取巧的策略。這項指標同樣滿分0.15分。
四項得分加起來,總分上限是2.0分——其中答案準確性占1.0分,所有輔助項合計1.0分。這種設計確保了答案質量始終是最優先的目標,輔助項只起引導作用,而不會讓AI去"鑽空子"刷高某一個單項指標來換取更高總分。
具體的訓練算法採用的是一種叫做GRPO(組相對策略優化)的方法。簡單說,就是對同一個問題生成一批不同的解答路徑,然後通過互相比較這批路徑的好壞來更新AI的策略,而不是依賴一個絕對的評分標準。這種"相對比較"的方式在計算上更穩定,訓練效果也更好。
五、實驗設置:在真實的"多跳"問題集上接受考驗
研究團隊選用了三個公認的多跳問答基準數據集來檢驗GRASP的表現,分別是HotpotQA、2WikiMultiHopQA和MuSiQue。這些數據集的共同特點是:每道題都需要至少兩步推理才能得出答案,而且題庫里同時存在"正確支撐段落"和大量"干擾段落",考驗AI在資訊噪聲中精準定位證據的能力。
GRASP的主模型基於Qwen2.5-3B-Instruct——一個參數量為30億的開源模型,規模算不上大,這對於一個需要在有限"大腦容量"下做複雜多步推理的任務來說是相當有挑戰性的。研究團隊在HotpotQA的訓練集上訓練GRASP,然後把訓練好的模型直接拿去測試其他兩個數據集,以此檢驗模型的"跨數據集泛化能力"——即在沒見過的新場景下的表現。
語義檢索器使用的是Qwen3-0.6B,關鍵詞檢索器使用的是經典的BM25算法,每次檢索返回排名前5的結果。
對比的基線方法涵蓋了多個類型。單步檢索類基線分別測試了純關鍵詞檢索、純語義檢索和混合檢索(融合兩者再用重排模型篩選)三種配置。多步檢索類基線包括:IRCoT(一種通過思維鏈提示來引導多步檢索的方法,使用GPT-5 mini這個強大的商業模型)、Search-R1(一種基於強化學習訓練的單工具語義檢索智能體,也是3B規模的開源模型,有PPO和GRPO兩個版本)。此外還有一個"基礎版"對比項:在沒有經過強化學習訓練的情況下,直接用GRASP的三工具提示模板讓原始模型作答,以此衡量RL訓練本身帶來的提升。
六、實驗結果:GRASP在各項指標上的全面表現
先看檢索召回率,也就是"是否找到了所有答案所需的關鍵文章"。這是一個非常重要的前置指標——如果該找的文章根本沒找到,答案自然不可能正確。
單步檢索方法中,混合檢索的表現最好,在HotpotQA上的召回率達到0.86,明顯優於純關鍵詞檢索的0.61和純語義檢索的0.73。這說明兩種檢索信號確實是互補的,合併使用比任意一種都強。但即便是最強的混合檢索,也只有0.86的召回率,意味著每七道題里就有一道的關鍵證據沒有被找到。
多步檢索方法裡,GRASP在三個數據集上都拿到了最高的召回率,分別是0.90、0.90和0.70,大幅領先於其他所有方法。排名第二的是IRCoT,得益於GPT-5 mini強大的推理能力,它生成的中間查詢質量更高,召回率也相當不錯。但GRASP是一個僅有3B參數的開源模型,能在召回率上超越使用頂級商業模型的IRCoT,足以說明其檢索策略的有效性。
最能說明問題的是"基礎版"的表現:同樣的三工具提示模板,不經過RL訓練,召回率只有0.36、0.27、0.24——比單步檢索還要差得多。這意味著,僅僅"給AI三個工具"是遠遠不夠的,關鍵在於通過強化學習讓它學會如何正確使用這三個工具。
再看問答準確率,研究團隊使用了三種指標:精確匹配(答案必須一字不差)、詞語級F1分(部分匹配也計分)以及"AI法官"評分(用GPT-5 mini來判斷答案是否在語義上正確)。
在HotpotQA上,GRASP的精確匹配率達到0.53,F1分達到0.66,AI法官評分達到0.71。相比之下,最強的單步方法(混合檢索)只有0.37、0.48、0.56,Search-R1(GRPO版)是0.45、0.56、0.58。GRASP在所有三個數據集的幾乎所有指標上都是最優或接近最優的。
有一個有意思的對比值得特別提出:IRCoT在"AI法官"這個指標上往往得分不低(比如在HotpotQA上達到0.63),但它的精確匹配和F1分卻比Search-R1更低。這說明IRCoT生成的答案在語義層面上是靠譜的,但表達方式比較隨意,和標準答案的措辭對不上,所以在字面匹配指標上吃了虧。相比之下,通過強化學習訓練的系統更善於生成措辭精準的答案。
七、AI自發"學會"了人類讀書的技巧
研究團隊對GRASP訓練完成後的行為進行了深入分析,發現了一些非常有趣的現象。
他們把AI的整個推理軌跡看作一個"行為序列",統計了不同工具之間的切換模式。結果顯示,GRASP形成了一套相當規律的行為邏輯,讓研究者聯想到認知科學家描述的"人類資訊覓食"策略。
具體來說,AI往往這樣展開推理:先用語義搜索廣泛探索,找到一些與問題相關的候選段落。發現某個片段"看起來有希望"之後,立刻用"閱讀段落"工具讀完整段,確認細節、提取關鍵實體(比如從"Numb是Rihanna專輯裡的歌"這個片段中,確認《Unapologetic》屬於Rihanna)。拿到這個"橋接實體"後,再用關鍵詞搜索精確鎖定與這個實體直接相關的文檔(比如搜索"Eminem vocals Unapologetic")。如果關鍵詞搜索結果不夠理想,就退回到語義搜索,換一個更寬泛的查詢方式重新出發。如果關鍵詞搜索找到了一個"看起來靠譜"的結果,就再用一次閱讀段落工具核實全文,然後給出最終答案。
研究者指出,這個模式和人類閱讀專業文獻時的行為驚人地相似:先快速瀏覽(skimming)找到大致相關的段落,再精細掃讀(scanning)提取具體資訊,然後針對找到的線索做精確關鍵詞檢索。這套策略完全是AI通過試錯自發習得的,研究團隊並沒有顯式地編程告訴它"你應該先語義搜索再閱讀段落"。
八、消融實驗:少了哪塊拼圖,影響有多大?
為了驗證設計中每個組件的必要性,研究團隊做了一系列"拆零件"實驗——每次只去掉一個工具,觀察性能下降幅度。
去掉關鍵詞搜索工具後,精確匹配率從0.510降到0.498,F1分從0.631降到0.621,影響相對有限。這說明關鍵詞搜索有貢獻,但AI在某種程度上可以通過調整語義搜索來部分彌補。
去掉語義搜索工具後,精確匹配率降到0.438,F1分降到0.567,下降幅度明顯更大。這與前面的行為分析一致——語義搜索是整個推理流程的"起點",承擔著宏觀探索的功能,失去它會讓AI在面對需要概念關聯的問題時寸步難行。
最大的打擊來自去掉"閱讀段落"工具,也就是退回到只能看片段摘要、無法讀完整段落的模式。在這種情況下,精確匹配率跌到0.388,F1分跌到0.484,遠低於完整版GRASP。研究團隊分析,原因在於:當AI只能看到片段而無法讀完整段落時,它生成的後續查詢質量會大幅下降。因為片段里出現了太多的實體名詞和關係詞,AI無法判斷哪個才是真正值得追查的"橋接線索",查詢方向就會變得雜亂無章,往往只是在原始問題上做小修小改,而不是真正基於已找到的中間證據去構建下一步查詢。
九、歸根結底,GRASP說明了什麼?
說到底,這項研究揭示了一個在AI問答領域長期被忽視的真相:檢索不僅僅是技術問題,更是策略問題。
給AI一個檢索工具,它可以查資料。給AI兩個不同類型的檢索工具,它能做到互補。但如果你同時給它控制"閱讀深度"的工具,讓它自己決定什麼時候看片段、什麼時候讀全文,並通過強化學習訓練它在不同情境下做出正確的選擇,這時候它的表現會產生質的飛躍。
這對我們理解AI未來的發展方向有實際意義。當AI助手被用於回答需要多步查找的複雜問題時——比如法律研究、醫學診斷支持、深度新聞調查——它絕不能只是一個"單次查詢、給出答案"的簡單機器。它需要像人類研究者一樣,有計劃地、有策略地在資訊海洋中導航,既要知道何時寬泛探索,又要知道何時精確鎖定,還要知道何時停下來仔細閱讀。
當然,GRASP也並非沒有局限。它目前依賴於標註了"黃金支撐段落"的數據集才能計算獎勵信號,這在現實中並不總是容易獲取的。此外,它有時還是會"過早收手",在還沒有找到所有關鍵證據時就給出答案,這個問題有待進一步研究。訓練所用的模型規模(3B參數)也相對較小,更大的模型是否會產生不同的學習動態,目前還不清楚。
未來的研究方向非常清晰:一方面是擴展工具箱,讓AI不只能"查",還能"計算"、"比較"、"驗證";另一方面是減少對人工標註數據的依賴,探索用模型自身的一致性來替代人工標註的獎勵信號;最後是讓AI的檢索粒度更加靈活,從單句到段落到整篇文章,根據推理需要動態調整。
對於任何在日常工作中需要藉助AI做複雜資訊檢索的讀者來說,GRASP所代表的這個方向——讓AI學會更像人類一樣"分層閱讀、策略檢索"——是非常值得持續關注的。有興趣深入了解完整技術細節的讀者,可以通過arXiv編號2607.10463查詢完整論文。
Q&A
Q1:GRASP框架中的"粒度感知"具體是指什麼?
A:GRASP的"粒度感知"是指AI可以自主決定檢索資訊的"詳細程度"。具體來說,語義搜索和關鍵詞搜索只返回句子級別的簡短片段,而"閱讀段落"工具可以返回完整的段落全文。AI在推理過程中會根據情況判斷:這個片段已經夠用了,還是需要讀完整段落才能確認細節?這種"先看摘要、需要時再讀全文"的分層策略,幫助AI避免在思考過程中被大量無關文本干擾。
Q2:強化學習訓練在GRASP中起到了什麼作用?
A:強化學習是GRASP能夠有效工作的核心。實驗中有一個非常說明問題的對比:同樣配備三種檢索工具,但不經過強化學習訓練的"基礎版"AI,召回率只有0.36左右,遠低於單步檢索。這說明僅僅"給AI工具"是不夠的,必須通過強化學習讓AI反覆試錯、從獎勵信號中學會什麼時候用哪種工具,才能真正發揮出多工具協同的優勢。
Q3:GRASP的獎勵設計為什麼要同時考慮答案準確性和檢索行為?
A:如果只獎勵最終答案的準確性,AI可能會走彎路——比如隨機猜測幾個常見答案來碰運氣,或者重複調用同一個工具刷高某個中間指標。通過同時獎勵"有根據的閱讀"(讀相關段落而非干擾段落)、"互補搜索"(兩種工具都找到關鍵證據)和"步驟效率",研究團隊引導AI學會了更健康的推理習慣,同時通過設置答案準確性不加權的上限,確保最終目標始終是答對題而非鑽制度空子。






