宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

北京大學聯合快手團隊提出「燈塔」模型:AI助手終於學會了「知道自己何時該查工具」

2026年08月10日 首頁 » 熱門科技

這項由北京大學、快手團隊、香港科技大學(廣州)、中文大學、浙江大學和清華大學聯合完成的研究,以預印本形式發布於2026年7月30日,論文編號為arXiv:2607.28595。感興趣的讀者可通過該編號查閱完整論文。

你有沒有遇到過這樣的情況:請一個助手幫你查資料,結果他不管什麼問題都先翻出一大堆工具,折騰半天,給出的答案反而比直接回答還差?或者反過來,明明面對一道極其複雜的數數題,卻偏偏不肯動手算,就靠肉眼瞎猜,猜錯了也不知道?

這正是當前人工智慧視覺助手普遍存在的困境。研究團隊把這個問題比作兩種失職的員工:一種是"工具控",不管什麼雞毛蒜皮的小事都要搬出工具箱,折騰半天反而出錯;另一種是"裸奔選手",明明有工具可以用,偏偏靠感覺硬扛,遇到真正需要精確計算的任務就露了餡。研究團隊正是為了解決這個"知道什麼時候該用工具"的核心難題,提出了名為Beacon(中文可理解為"燈塔")的全新模型。

一、工具用多了和用少了都是問題

以當前最流行的多模態大語言模型為例,這類系統能看圖說話、回答問題、甚至寫代碼。為了處理更複雜的視覺任務,研究者會給模型配備一套"工具箱"——比如放大鏡(圖像裁剪)、標註筆(畫框標記)、計算器(數值計算)等。通過調用這些工具,模型理論上可以處理肉眼難以分辨的細節。

然而,研究團隊在仔細分析了多個代表性的前沿模型後,發現了一個令人意外的現象:給模型配備工具,並不意味著模型就會變得更聰明,甚至有可能越用越糟糕。

打個比方,一道簡單題——"圖裡的天氣是晴天還是陰天?"——本來直接看圖就能秒答,但某些模型偏偏要先寫一段代碼裁剪圖像、調用工具,折騰一大圈,最終答案沒變,時間和計算資源白白浪費了。更糟糕的是,工具調用過程中一旦出錯(代碼bug、坐標算偏等),原本能答對的題反而答錯了。這就是研究團隊所說的"工具傷害"——工具的使用在本不需要它的地方製造了新的錯誤。

與此同時,對於真正困難的任務——比如"軌道上有多少顆藍色彈珠?"這類需要精確數數的視覺任務——很多模型卻又不知道主動調用工具,靠視覺估算猜一個數字,大概率猜錯。這就是"工具收益不足"的問題:工具本來大有用武之地,模型卻沒有抓住機會。

研究團隊把這兩種能力分別定義為"模式適應性"(Mode Adaptiveness)和"工具效果"(Tool Effect)。前者考察的是模型能否根據題目的難易程度,靈活選擇"直接回答"還是"先用工具";後者衡量的是工具使用究竟是幫了忙還是幫了倒忙。這兩個維度構成了整項研究的核心框架。

二、研究團隊是怎麼量化"聰明程度"的

要評判一個模型在工具使用上表現好不好,不能只看最終答題的準確率,因為那個數字掩蓋了太多細節。研究團隊設計了一套更精細的測量體系。

具體做法是:對每道題,不是只問一次,而是連續問五次,並且強制模型在這五次里不許使用任何工具,看看它純靠文字推理能答對幾次。如果五次里有四次或以上都答對了,就把這道題標記為"文本簡單題";如果五次里只有零次或一次答對,就標記為"文本困難題";介於二者之間的題目太模糊,直接剔除不參與分析。

這個設計非常巧妙,就好比給一個人出一道題,不是問他一次就判斷,而是連續測試五次,看他是真的懂還是偶爾蒙對。

有了這個分類之後,研究團隊再讓模型在允許使用工具的情況下回答這些題目,記錄模型是否主動調用了工具,以及最終答對沒有。由此衍生出幾個關鍵指標:模型在"文本簡單題"上有多少比例不動工具(叫做MAtext,越高越好,說明模型懂得在不必要時省力氣);模型在"文本困難題"上有多少比例主動調用了工具(叫做MAtool,越高越好,說明模型在真正需要幫助時知道求助);工具幫助模型在困難題上答對的比例(叫做Tool-Gain,越高說明工具越有價值);工具在簡單題上把原本答對的題搞錯的比例(叫做Tool-Harm,越低越好)。

研究團隊用這套體系評測了四款代表性的前沿模型:Thyme、DeepEyesV2、CodeV和Metis。結果出乎意料地一致:這四款模型幾乎都在"模式適應性"上表現糟糕——不是幾乎所有題都去調工具,就是幾乎所有題都不調工具,缺乏根據題目難易靈活切換的能力。更關鍵的是,這些模型的Tool-Gain和Tool-Harm幾乎旗鼓相當,意味著工具幫你解決了一些難題,但同時也在容易的題上犯了差不多數量的錯,淨收益幾乎為零。允許使用工具之後,這些模型的平均準確率和強制不用工具時幾乎沒有差別。

這一發現直接揭示了問題的根源:當前的訓練方式根本沒有給模型足夠的信號去學習"什麼時候該用工具",也沒有有效地增強模型在最困難任務上通過工具解決問題的能力。

三、燈塔模型是怎麼誕生的

Beacon的訓練分為兩個階段,就像先教會一個學生基本技能,再通過實戰演練讓他變得更聰明、更懂分寸。

第一階段是"打基礎"(監督微調,SFT)。研究團隊從16個公開數據集裡收集了超過21萬道題,涵蓋數學幾何、圖表理解、高解析度感知、空間推理、知識問答等多個方向。他們先讓基礎模型Qwen3-VL-8B回答這些題目,篩選出那些基礎模型答不好的困難題目,再讓強大的Gemini 3.1 Pro為這些題目生成帶有Python代碼調用的完整解題軌跡,只保留最終答對的軌跡。

光有正確答案還不夠,因為Gemini生成的軌跡可能也存在冗餘的工具調用、代碼沒真正幫上忙就直接靠猜答題等問題。於是團隊又用Gemini對這些軌跡進行了二次"精煉",剔除工具沒有真正發揮作用的軌跡、刪掉重複無意義的步驟、補充缺失的觀察分析。最終保留了約1.57萬條高質量的有工具調用的解題軌跡,同時混入了一些基礎模型本來就能直接答對、不需要工具的題目,防止模型被過度訓練成"什麼都用工具"的習慣。

第二階段是"實戰磨礪"(強化學習,RL)。研究團隊在第一階段的SFT模型基礎上,針對那些即便經過SFT訓練仍然難以解決的題目,進行了強化學習。這一階段包含兩個核心設計,也是整個Beacon最獨特的地方。

四、"必要性感知獎勵北京大學聯合快手團隊提出燈塔模型AI助手終於學會了知道自己何時該查工具":教會模型何時該動手

第一個核心設計叫做"必要性感知自適應獎勵"(Necessity-Aware Adaptive Reward,NAAR)。

普通的強化學習訓練方法通常只管"答對了就給獎勵,答錯了就扣分",完全不考慮模型是靠工具答對的還是靠直接推理答對的。這就好比老師批改作業時只看答案對不對,不管學生是認真計算還是偷看答案抄來的——長此以往,學生就不知道什麼時候該老老實實自己算,什麼時候才需要藉助參考資料。

NAAR的設計邏輯是:先判斷當前這組回答里,有沒有純靠文字推理就答對的情況。如果有,說明這道題靠自己就能搞定,那麼直接答對的回答得滿分,而用了工具才答對的回答只得四分之一的分。注意,用工具答對的情況不是零分,因為它畢竟是正確答案,有一定參考價值;只是分數打折,傳遞"這種情況你本可以不用工具"的信號。反過來,如果這組回答里根本沒有靠純文字推理答對的,說明這道題對模型來說是真正的難題,那麼用工具答對的就給滿分,鼓勵模型在真正需要的時候積極調用工具。

這個獎勵機制還有一個關鍵優勢:它是基於模型自身當前能力動態標註的,而不是讓一個外部"老師模型"來預先判斷哪些題需要工具。這樣就避免了"學生的能力和老師的能力不匹配"的尷尬——因為老師可能覺得簡單的題,學生不一定也覺得簡單。

五、"提示引導能力擴展":突破模型能力的天花板

第二個核心設計叫做"提示引導能力擴展"(Hint-Guided Capability Expansion,HCE)。

強化學習有一個著名的瓶頸:如果一道題對模型來說實在太難,模型在一批次內生成的所有回答全都是錯的,那這一批次的訓練就完全浪費了。因為強化學習的核心機制是"比較一組回答的好壞",如果所有回答都是錯的,大家同樣差,就沒有什麼可以學習的梯度信號,就像一群考生都考了零分,老師完全不知道誰比誰稍微好一點點。

然而,這些最難的題目恰恰是模型最需要突破的地方,也是工具使用最能發揮價值的場景。就這麼放棄,太可惜了。

HCE的解法是:當一道題被標記為"全軍覆沒"之後,先請Gemini 3.1 Pro生成一條正確的完整解題軌跡,然後從這條軌跡中提取出關鍵的推理步驟和工具使用策略,轉化為一段"提示"(Hint)——注意,提示里只包含解題方向和中間目標,絕對不包含最終答案。然後把這段提示附加到原始問題後面,讓正在訓練的模型重新嘗試,看看有沒有能夠在提示的幫助下答對的回答。

舉個例子,原來的問題是"這場羽毛球比賽的當前比分是多少,如果球落在紅圈裡,新比分會怎樣變化?"模型完全沒有頭緒,全部答錯。專家給出的提示是:"第一步,裁剪比分板區域和紅圈位置;第二步,根據出界規則計算新得分並找出賽事年份。"有了這個提示,模型在重新嘗試時,會去學習專家推薦的工具調用思路,從而有機會答對。

更巧妙的是,在用提示生成的正確軌跡來更新模型參數時,研究團隊會把提示從輸入里悄悄去掉——只保留"模型在有提示幫助下產生的行為軌跡",但告訴模型"你當時面對的是沒有提示的原始問題"。這樣訓練出來的模型,就把在提示輔助下學到的工具使用技巧,內化成了自己在沒有任何提示時也能自主運用的能力。效果相當於:老師帶著學生做了一遍,下次學生就能自己做了,不再需要老師幫忙。

六、實驗結果:燈塔照亮了多遠

研究團隊在13個不同的視覺推理基準測試上全面評測了Beacon,這13個測試涵蓋了高解析度視覺搜索(比如在密集圖像中找到特定目標)、空間感知推理(判斷物體之間的相對位置關係)、數學圖表理解、組合推理和代理任務等各種類型。

在整體性能上,Beacon在13個測試中的11個位列所有開源模型第一,平均得分58.98%,比基礎模型Qwen3-VL-8B-Instruct提高了約6個百分點,也超過了同等規模的其他所有前沿系統。相比之下,第二名Metis的平均得分是56.67%,差距明顯。

在工具使用的適應性方面,研究團隊特別繪製了一張圖:橫軸是"純文字模式下答對次數"(代表題目的難易程度),縱軸是"實際調用工具的比例"。對於真正聰明的模型,這條曲線應該是向右下方傾斜的——越容易的題,工具調用比例越低;越難的題,工具調用比例越高。在被測試的五個模型里,只有Beacon呈現出這種理想的趨勢:對於五次都能答對的簡單題,Beacon調用工具的比例較低;而對於基本答不對的困難題,Beacon幾乎次次都會調用工具。其他模型的曲線則基本上是平的,說明它們完全不根據題目難易來決定是否用工具。

在工具效果方面,Beacon的Tool-Gain達到9.3%,Tool-Harm為6.2%,淨收益(Tool-Gain減去Tool-Harm)為+3.1個百分點,是所有模型中最大的正差值。相比之下,Thyme的工具淨收益幾乎是負數,DeepEyesV2和Metis也基本打平,說明在這些模型上工具幾乎沒有帶來實質性的進步。

在文本保留率(即"用了工具之後,原來靠文字就能答對的題,還有多少比例保住了正確")方面,Beacon達到91%,遠高於其他模型,說明工具的引入基本上沒有破壞原本就能正確解答的能力。

七、消融實驗揭示的規律

為了搞清楚哪些設計真正起到了作用,研究團隊還做了一系列"拆零件"實驗,依次去掉NAAR和HCE,觀察性能變化。

實驗結果顯示,單純用普通的GRPO強化學習(沒有NAAR,沒有HCE),模型的工具使用淨收益僅有+1.4個百分點,整體準確率57.1%。加入NAAR之後,模式適應性指標MAmean從56.3%提升到了59.7%,工具淨收益提升到+2.54個百分點,整體準確率小幅提升至57.75%。單獨加入HCE之後,工具淨收益提升到+2.96個百分點,說明HCE主要在強化"工具真正幫上忙"這個方向。兩者同時使用,整體準確率達到58.98%,工具淨收益最高+3.14個百分點,兩項指標互相促進。

研究團隊還分析了訓練過程中各項指標的動態變化曲線。一個關鍵發現是:在整個強化學習訓練過程中,使用文字回答和使用代碼回答的比例始終保持穩定,沒有明顯的漂移——模型並不是簡單地越來越偏向某種回答方式。真正在提升的,是"推理模式與題目類型的匹配準確率",也就是說,模型逐漸學會了識別題目性質,並據此選擇合適的模式,而不是無腦偏向其中一種。

在HCE的效果上,研究團隊統計了所有"全軍覆沒"組(所有回答都錯的訓練題目)中,經過提示引導的再次嘗試,有多少比例成功被"救活"(至少出現一個正確回答)。結果顯示約有40%的全軍覆沒組得到了有效轉化,從完全沒有學習價值的數據變成了有用的訓練信號,這對於提升模型在最困難任務上的工具使用能力貢獻顯著。

研究團隊還描述了幾個生動的案例:在第一個案例中,面對"軌道上有多少顆藍色彈珠"的問題,Beacon先獲取圖像尺寸,再通過像素級藍色區域檢測和連通分量算法數出22顆,完全正確。在第二個案例中,面對"圖中有多少輛白色汽車"的街景照片,Beacon通過多次裁剪中景和遠景區域,逐步鎖定每輛車的顏色,最終判斷出2輛白色車,答對選項B。在一個使用提示引導的案例中,面對"這場羽毛球比賽的新比分是多少"這道需要同時識別比分板、判斷紅圈位置、理解出界規則的複合題,Beacon按照提示提供的步驟,依次裁剪比分區域、用輔助線標註球場邊界,最終正確判斷出紅圈在邊線外、球出界、新比分為IND 1:20對TPE 0:16,並識別出比賽年份為2023年。

說到底,Beacon的核心貢獻不在於發明了什麼前所未有的全新技術,而在於清晰地定義了一個此前被忽視的問題——工具使用的"智慧性",並提出了可操作的解決方案。知道什麼時候該動手、動手之後真的有幫助,這才是工具真正的價值所在。對於未來的多模態AI系統來說,與其追求工具的數量和調用的頻率,不如先把"知道何時該用、用了真有效"這個基本功練紮實。

這項研究還提示了一個有趣的思考方向:當我們評價一個AI系統有多聰明時,或許不應該只看它能做什麼,更要看它知不知道自己的局限在哪裡、能不能在需要外援時主動尋求幫助而不是硬撐。這種"元認知北京大學聯合快手團隊提出燈塔模型AI助手終於學會了知道自己何時該查工具"能力,可能正是人工智慧走向真正實用的關鍵一步。

有興趣深入了解細節的讀者,可以通過arXiv編號2607.28595找到這篇完整論文,裡面包含了完整的提示詞設計、數據統計、訓練參數設置和更多案例分析。

---

Q&A

Q1:Beacon模型北京大學聯合快手團隊提出燈塔模型AI助手終於學會了知道自己何時該查工具和普通的視覺AI有什麼不同?

A:普通視覺AI通常要麼總是調用工具,要麼從不調用,缺乏根據題目難易靈活判斷的能力。Beacon通過"必要性感知獎勵"訓練機制,讓模型學會在簡單問題上直接作答,在真正困難的問題上才調用代碼工具,從而減少不必要的錯誤並提升複雜任務的解決率。

Q2:Beacon的"提示引導能力擴展"在訓練時是怎麼起作用的?

A:當模型對某道題完全不會做時,系統會請更強的Gemini模型生成一段解題提示(只提供方向和步驟,不含答案),讓模型藉助提示練習工具使用技巧。訓練時再悄悄去掉提示,只保留學到的行為軌跡,讓模型在沒有提示的正常情況下也能復現這些技能。大約40%原本全部答錯的題目,經過這個機製得到了有效利用。

Q3:Beacon在哪些任務類型上提升最明顯?

A:Beacon在需要精細視覺操作的任務上提升最為突出,比如高解析度圖像搜索、圖表理解、計數推理和組合推理等,平均比基礎模型提升約6個百分點。在ChartQAPro(圖表問答)上提升了約17個百分點,在視覺謎題和競技問答類任務上也有10個百分點左右的提升。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新