告別昂貴的推理時思考,Retrieve-for-Train
框架僅需一次強化學習訓練一個輕量級擴散模型
,就能繞過繁重的自回歸"思考預算
",即時生成連貫的專家級AI搜索結果集。
快速鏈接
現代搜索或推薦應用,越來越需要返回一組連貫的結果,而不僅僅是單一的最佳匹配。比如,當用戶搜索"露營裝備"時,他們不想要十個略有差異的四人帳篷,而是想要一套連貫、互補的裝備清單,包括帳篷、睡袋、便攜爐具和頭燈等必需品。
為實現這一目標,系統通常採用查詢扇出
(query fan-out)技術,將一個寬泛的提示拆解成多個相關的子查詢,以覆蓋用戶可能的興趣點。然而,讓大語言模型動態執行資料庫感知的查詢拆解,會大量消耗思考預算。從設計上看,零樣本大語言模型本質上是通用的自回歸文本預測器,它們並未針對目標語料庫的特定幾何結構進行優化。因此,為了在保持與固定資料庫對齊的前提下,優化多樣性、覆蓋度、互補性、連貫性等高階集合級屬性,這些模型需要在推理時進行大量額外計算。
在我們發表於ICML 2026的論文《Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion》中,我們通過一種"獎勵轉數據"的編譯框架來解決這一拆解瓶頸。我們的Retrieve-for-Train框架並不強迫模型在推理階段耗費大量思考預算,而是利用離線強化學習發現與獎勵對齊的扇出方案,並將其編譯為監督信號。通過將這些優化過的探索行為蒸餾到一個輕量級擴散檢索器中,我們實現了推理階段高效的單次查詢扇出,從而在不產生測試時思考Token開銷的情況下,達成了數學意義上明確定義的集合級屬性。
為什麼日常AI並非搜索專家
當需要構思一組複雜的搜索詞時,人們很容易想到直接在推理階段調用一個標準的現成大語言模型來完成任務。然而,依賴通用模型進行資料庫感知的查詢拆解,會帶來兩個關鍵挑戰:
Retrieve-for-Train框架
Retrieve-for-Train將AI的訓練過程視為一次離線練習,而不是用戶等待時必須臨場應對的實時考試。系統不會強迫AI每次用戶輸入查詢時都要重新摸索良好搜索的規則,從而消耗巨大的處理預算,而是只運行一次離線強化學習訓練程序。
該程序利用嚴格的獎勵機制,將"確保結果多樣且確實有庫存"這類抽象目標,轉化為精確的分步操作手冊。一旦手冊構建完成,AI在真實搜索場景中便可即時執行,無需延遲。
整個流程分為三個明確步驟:
Retrieve-for-Train框架概覽。第一步:使用強化學習訓練一個扇出語言模型(FOLM),生成與屬性對齊的子查詢。第二步:利用訓練好的FOLM合成監督數據。第三步:訓練一個基於擴散模型的扇出檢索器,直接從查詢嵌入採樣出內容嵌入。
Retrieve-for-Train框架的成功,完全取決於我們如何定義"良好"的搜索行為。傳統的監督訓練通過學習排序來評估單點相關性,即孤立地為每個檢索到的項目評分。然而,真正專業的搜索結果集,是由不可分解的集合級屬性來定義的。你無法衡量單個項目的多樣性或互補性,這些屬性只有在評估整個檢索結果集合時才具有數學意義。
Retrieve-for-Train沒有依賴含糊的自然語言指令來強制實現這些扇出屬性,而是通過強化學習,使用嚴格的數學複合獎勵,對40億參數的開源語言模型(Gemma3-4B
和Qwen3-4B
)進行微調。對於我們的開放式抽象檢索任務,這一複合獎勵是三個相互制衡因素的加權平衡。
在訓練過程中,我們使用帶軟近端策略優化(soft PPO)的組相對策略優化(GRPO
)算法,針對這些幾何現實來優化扇出語言模型。
這組特定的獎勵組合之所以關鍵,是因為它們相互構成制衡錨點。如果模型僅針對"紮根性"進行優化,它會通過生成一些恰好能在數學上映射到特定資料庫坐標、但毫無意義的退化字符串來"鑽空子"。如果為了修正這種無意義字符串而加入對齊性獎勵,策略又會簡單地通過對用戶提示進行重複性改寫來作弊。
通過引入Vendi分數
作為制衡錨點,Retrieve-for-Train有效地堵住了這些捷徑解法。為達到高獎勵狀態,策略被迫進入嵌入空間中的一個平衡區域,在這裡它必須發現既嚴格紮根於資料庫、又在語義上明顯不同的原始意圖變體。
實驗
為評估Retrieve-for-Train框架,我們結合使用了針對特定數據集凍結的多模態嵌入骨幹網路,以及針對查詢擴展優化的開源語言模型。我們在兩種不同的集合值檢索場景下進行了評估。
在多模態嵌入骨幹網路方面,我們在兩個領域進行了實驗:一個是用於文本轉圖像實驗的大規模時尚數據集(收錄用戶精選搭配,使用基於CLIP
的檢索器評估),另一個是用於文本轉音樂評估的專有工業數據集(收錄專家生成的播放列表,使用MuLan
評估)。
在語言模型方面,查詢扇出過程由40億參數的開源模型驅動,具體為Gemma3-4B和Qwen3-4B,它們的任務是為每一個處理的主搜索提示生成恰好10個子查詢。我們通過Soft-GRPO方法為這些扇出模型實現了強化學習訓練,該方法採用帶軟PPO正則化的組相對策略優化。
結果
在兩項檢索任務中,Retrieve-for-Train的表現均優於傳統單查詢搜索、零樣本擴展方案,甚至優於經過大量優化的Best-of-N基線方法。
從質量上看,零樣本大語言模型基線方案往往生成近乎同義的改寫(例如"波西米亞音樂節風格"與"波西米亞音樂節時尚"),導致結果冗餘。而Retrieve-for-Train生成的子查詢高度多樣且各不相同(例如分支出"靴子"或"蕾絲"等方向),同時嚴格保持與資料庫結構的一致性。
直接部署我們經強化學習調優的語言模型,能獲得極佳的搜索質量,但它繼承了標準自回歸模型的延遲限制,並需要較高的計算思考預算。
通過將這一習得行為蒸餾到僅有5390萬參數的Retrieve-for-Train擴散模型中,我們成功打破了延遲瓶頸。由於擴散模型在連續嵌入空間中以單次非自回歸併行方式同時生成所有目標方向,其速度相比自回歸方法實現了12到20倍的大幅提升。
在規模化場景下,自回歸扇出方案的延遲會隨大批量上下文線性增長至近50秒,而Retrieve-for-Train擴散模型的延遲則始終保持在亞秒級到幾秒之間,以極低的計算成本實現了生產級、專家水準的搜索效果。
Retrieve-for-Train框架(包括FOLM和擴散模型)在開放式抽象檢索(OAR)和弱監督組合檢索(WSCR)兩類任務上,均持續超越標準搜索和零樣本基線方案,在多樣性、對齊性和召回率方面均實現顯著提升。
在獎勵優化過程中,我們發現了一個關於訓練搜索扇出語言模型的根本性問題。如果沒有多樣性約束項,模型會很快退化為生成諸如"行末 行末"之類毫無意義的字符串,以此在數學上鑽資料庫向量坐標的空子。而引入幾何多樣性指標(Vendi分數)能起到關鍵的制衡錨點作用,迫使模型進入嵌入空間中的穩定區域,只有真正表現出搜索專家的行為,才能獲得最大化的獎勵。
結論
我們證明了強化學習作為一次性的"目標轉換器"使用時,比作為在線推理引擎使用效果更好。通過將獎勵驅動行為探索的繁重計算,與最終部署的模型解耦,我們的框架成功繞開了在線大語言模型部署中典型的高推理延遲和高計算開銷問題。
將這些複雜的集合級行為蒸餾為一個輕量級擴散先驗模型,使生產環境中的檢索系統能夠有效地針對多樣性、對齊性等高階屬性進行優化。歸根結底,Retrieve-for-Train為專業或多模態領域的集合檢索建立了一條高度可擴展、數據高效的流程,這些領域通常缺乏人工標註、屬性對齊的訓練數據對,獲取成本高昂。更多細節請參閱論文原文。
快速鏈接
Q&A
Q1:Retrieve-for-Train框架解決了什麼問題?
A:它解決了AI搜索中查詢拆解耗費大量推理時計算資源的問題。傳統方法需要大語言模型在推理階段動態思考如何拆解查詢,而Retrieve-for-Train通過一次性離線強化學習訓練,將這些行為提前編譯進輕量級模型,推理時無需再耗費思考預算。
Q2:Retrieve-for-Train的速度比傳統方法快多少?
A:通過將學習到的行為蒸餾到5390萬參數的擴散模型中,Retrieve-for-Train相比自回歸方法實現了12到20倍的速度提升。在大批量場景下,自回歸方案延遲可達近50秒,而該框架的延遲始終保持在亞秒級到幾秒之間。
Q3:為什麼搜索結果的多樣性對AI模型訓練很重要?
A:因為如果沒有多樣性約束,模型很容易通過生成毫無意義但能匹配資料庫坐標的字符串來"鑽空子"。研究團隊引入Vendi分數作為制衡指標,迫使模型在保持結果與資料庫高度相關的同時,生成語義上真正不同的多樣化結果。






