宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

北京大學團隊追問:AI助手真的能越用越聰明嗎?——當「技能庫」遇上「持續學習」

2026年08月12日 首頁 » 熱門科技

這項由北京大學人工智慧研究院與北京通用人工智慧研究院聯合完成的研究,以預印本形式發布於2026年8月,論文編號為arXiv:2608.03874,感興趣的讀者可通過該編號查閱完整原文。

---

一、為什麼你的AI助手用久了卻沒變聰明?

每個用過智能助手的人大概都有過這樣的期待:這東西用多了,總該越來越懂我吧?然而現實往往讓人失望——你今天教會它一個技巧,明天它好像又忘了。這種"金魚記憶"式的智能助手,距離真正意義上的"越用越聰明",似乎還差得很遠。

這個問題背後其實有著嚴肅的技術背景。現代的大型語言模型(也就是驅動ChatGPT、Claude等產品的核心技術)在出廠時就已經固定了自己的"知識儲備",就像一本印刷完成的百科全書,內容不會自動更新。為了彌補這個缺陷,研究人員想出了一個辦法:給AI配備一個外掛的"技能庫北京大學團隊追問AI助手真的能越用越聰明嗎當技能庫遇上持續學習",把它在實際使用中學到的經驗整理成文檔,下次遇到類似任務時直接調出來用。這個思路聽起來很美妙,但問題也隨之而來——這套機制真的管用嗎?AI真能從每次任務中提煉出可復用的經驗,還是只是在做無意義的"歸檔"?

正是帶著這樣的疑問,北京大學的研究團隊設計了一套全新的測試框架,專門用來考察AI助手的"技能進化"能力。他們把這套框架命名為CONTINUALSKILLBENCH,直譯過來就是"持續技能基準測試"。

---

二、給AI設計一場"升級打怪"的闖關遊戲

要搞清楚AI能不能真正進化技能,首先需要一個合適的測試場地。研究團隊的設計思路有點像電子遊戲裡的關卡設計:你不能一上來就讓玩家面對最終BOSS,必須先從簡單關卡開始,讓他們逐步積累經驗和裝備,然後再面對越來越複雜的挑戰。

CONTINUALSKILLBENCH覆蓋了五個現實生活中真實存在且頗具挑戰性的領域,分別是法律、醫療健康、數學、金融和辦公事務。每個領域都不是隨機拼湊的題庫,而是經過精心設計的一個連續闖關序列,每個序列包含100道相互關聯的任務,從簡單到複雜依次排列。

以金融領域為例,整個序列從最基礎的財務數字計算出發,逐步進階到市場分析,最終到達需要綜合判斷的戰略決策。法律領域則從合同條款的文本解析開始,經過法規解釋,最終到達複雜的判例匹配和法理推斷。醫療健康領域的路徑是從醫學知識檢索與應用,經過差異化診斷推理,最終到達臨床診斷與治療方案制定。數學領域從基礎代數計算出發,經過數學代碼生成,最終到達研究級別的數學難題。辦公領域則從文檔與數據理解,經過辦公文檔製作,最終到達跨軟體的工作流自動化決策。

這種設計的關鍵在於:前期任務中鍛煉出的技能,應當能夠在後期更複雜的任務中派上用場。就像學會了騎自行車,再學騎摩托車時就不需要從零開始理解"如何保持平衡"一樣。研究團隊把這種關係稱為"技能遷移依賴",並且專門驗證了這種設計的有效性。

---

三、這100道題究竟是怎麼選出來的?

為了讓測試題足夠真實、足夠有深度,研究團隊並沒有自己出題,而是從現有的權威數據集中精心篩選。初始題庫規模達到約3萬道題目,涵蓋了多個來源。法律領域的題目來自LegalBench、LawBench、專業律所的測試集以及律考模擬題庫;醫療健康領域來自專注於醫療代理測試的MedAgentsBench、公共衛生知識庫HealthBench,以及面向職業醫生的PhysicianBench;數學領域匯集了奧數題庫OlympiadBench、美國數學競賽AMC12和AIME的真題、多語言數學推理集NuminaMath、綜合數學套件OmniMath、普特南競賽級別的公理證明題庫,以及強調代碼驅動求解的MathCoder和真實世界應用數學集RealMath;金融領域包含混合表格文本問答數據集TAT-QA、投資決策評測InvestorBench和綜合金融能力評測FinBen;辦公領域則使用了企業文檔問答集OfficeQA和專業寫作評測WritingBench。與此同時,跨領域的通用基準GAIA、現實任務操作評測ClawBench和超大規模文本處理集OneMillionBench也被納入了多個領域。

從三萬道題精簡到每個領域100道,需要經過嚴格的篩選和排序流程。研究團隊分三個階段完成了這個工作。

第一階段是技能標註與篩選。用AI給每道原始題目打標籤,識別出完成這道題需要哪些核心技能,同時過濾掉與該領域核心技能關聯性不強的題目,並給每道題打上初步的難度評級。

第二階段是成對依賴評估與圖排序。從篩選後的候選題目中隨機抽取題對,讓AI判斷"完成題目A所練習的技能,是否有助於完成題目B",以及反過來的方向。每個領域抽取200對,每對雙向評估,共產生400條判斷。基於這些判斷,研究團隊構建了一張有向圖:如果A的技能能幫助B,就從A到B畫一條箭頭。最終的題目順序是通過在這張圖上按難度分層、優先排放"能幫助最多後續任務"的題目來確定的,使用了一種改良版的拓撲排序算法,確保難度遞進的同時最大化技能的前向傳遞機會。

第三階段是人工審核。研究人員手動審核了最終的題目序列,確保難度遞進是真實的、技能遷移關係是合理的。

---

四、這套題真的有"技能傳承"的結構嗎?

光說題目之間有關聯還不夠,研究團隊還用嚴格的數學方法驗證了這種關聯的真實性。他們讓一個獨立的AI模型(與排序過程無關)為每道題單獨標註所需的核心技能,標註時不告知題目在序列中的位置。然後,他們把意思相近的技能(用文本相似度超過0.85的標準)視為"同類技能"。

統計結果表明,在所有五個領域中,平均有69.5%的題目至少包含一項在它之前的題目中出現過的核心技能。從另一個角度看,每道目標題目平均有35.5%的核心技能需求,在它的歷史題目中已經有過對應的練習機會。

更有說服力的是,研究團隊把他們精心排序的序列與隨機打亂順序的同一批題目做了比較,測試窗口分別取前1道、前5道和前10道題目。結果顯示,精心排序的序列在全部五個領域、全部三個時間窗口下,都表現出比隨機順序更高的技能重疊率,其中15個"領域×窗口"組合中有10個在統計上達到了顯著性標準。這說明精心設計的題目順序確實把相關技能的題目放在了彼此更近的位置,而不是隨機分布的。

---

五、測試的時候,AI到底在做什麼?

測試框架建立在一個叫做Harbor的基礎設施之上,並在此基礎上擴展了兩種AI代理接口,分別對應OpenAI的Codex CLI和Anthropic的Claude Code。每道子任務按照一個固定的三輪交互協議執行,這個協議有點像老師布置作業、學生完成、然後老師批卷並給出反饋的過程。

第一輪是"接任務":AI收到任務說明,同時獲得它當前的技能庫目錄,被要求先看看有沒有現成的技能可以用。第二輪是"做任務":AI使用可用的技能、工具和外部資源完成任務,所有操作都被記錄下來用於評估。第三輪是"反思與更新技能":AI收到評分系統給出的反饋,可能是自動化測試的通過率,也可能是按評分標準打出的分數。AI被要求分析失敗原因,並判斷這次經驗是否值得整理成一個可復用的技能文檔。如果值得,它可以調用兩個特殊的元技能——"創建技能"和"修改技能"——來更新自己的技能庫。更新後的技能庫會在下一道任務中生效。

這套流程的妙處在於,它不是讓AI把每道題的答案存下來,而是要求AI提煉可復用的方法論。系統提示中明確告知:不要死記這道題的解法,而要把經驗抽象成可以遷移到其他任務的通用方法、架構模式或領域規則。

---

六、"順序刷題"比"獨立做題"強多少?

研究團隊測試了三個模型:GPT-4o、GPT-5.3-Codex和Claude 4.7 Opus。每個模型都在兩種條件下接受測試:一種是"順序執行",也就是按順序完成100道題,每次都能利用之前積累的技能庫;另一種是"獨立執行",相當於每道題都是第一次做,沒有任何歷史記憶。

對比結果總體上讓人振奮。在15個"模型×領域"的組合中,有14個在順序執行下取得了更高的分數(計分方式是在兩種條件下都成功產出有效答案的題目上的平均得分)。平均而言,順序執行比獨立執行高出約16.9%。

但這個"平均"背後藏著相當大的差異。從領域來看,醫療健康領域的提升幅度最大,三個模型平均提升了14.9個百分點,主要由GPT-5.3-Codex和Opus 4.7貢獻。金融、法律、辦公和數學領域的平均提升分別為7.6、5.8、5.4和5.2個百分點。唯一出現分數下降的情況是Opus 4.7在數學領域,下降了0.8個百分點。

從模型來看,GPT-5.3-Codex獲得了最大的平均提升(+9.8個百分點),其次是GPT-4o(+7.7個百分點),Opus 4.7最小(+5.8個百分點)。有趣的是,這個排名並不等於"基礎能力越強,提升越大"——Opus 4.7在獨立執行條件下基礎得分最高,但順序執行帶來的提升反而最小;GPT-4o基礎得分最低,但提升幅度相當可觀。這說明從順序經驗中獲益的能力,是一種相對獨立的特質,不完全由基礎能力決定。

細看不同題型的表現,結構化任務通常從順序執行中獲益更多。比如GPT-5.3-Codex在金融領域的數值計算題上提升了41.6個百分點,精確匹配題提升了9.1個百分點,但評分標準類(開放性問答)題目只提升了3.8個百分點。不過這個規律並非鐵律:Opus 4.7在醫療健康的評分標準類題目上提升了23.4個百分點,而在數學的評分標準類題目上反而下降了19.2個百分點。

---

七、"記住答案"和"學會方法",其實效果差不多?

順序執行比獨立執行強,這個結論固然令人高興,但它並沒有回答一個更本質的問題:這種提升,到底是來自"積累了明確的技能文檔",還是僅僅來自"上下文裡有了更多歷史資訊和反饋"?

打個比方:一個學生期末考前做了大量練習題,最終考試發揮更好。但這到底是因為他整理了一本詳細的筆記(明確技能),還是僅僅因為腦子裡有了更多做題的感覺和經驗(情境適應)?這兩種解釋對應的含義截然不同。

為了區分這兩種效應,研究團隊引入了第三種測試條件:純上下文學習北京大學團隊追問AI助手真的能越用越聰明嗎當技能庫遇上持續學習(ICL)。這種條件下,AI同樣按順序完成100道題,同樣能看到每道題的反饋,但被明確禁止創建或修改任何技能文檔。換句話說,它只能把經驗"放在腦子裡",不能整理成正式的技能文檔。

這個對比實驗在GPT-5.3-Codex上針對法律、金融、醫療健康三個領域進行。結果相當耐人尋味:三個領域平均而言,獨立執行得分0.466,純上下文學習得分0.605,而有明確技能庫的順序執行得分0.602。也就是說,純上下文學習和有技能庫的順序執行,平均得分幾乎相同,差距只有0.003。

這意味著,順序執行相對於獨立執行的大部分提升,實際上來自於"有了更多歷史資訊和反饋",而不是"整理了明確的技能文檔"本身。

當然,細看之下兩者並非完全一樣。明確的技能庫在法律和金融的精確匹配題型上表現更好,在醫療健康的程序化測試任務上把通過率從0.250拉到了0.500;而純上下文學習在所有三個領域的評分標準類(開放性問答)題目上得分都更高。

這個發現揭示了明確技能文檔的真正價值所在:對於那些有嚴格輸出格式要求、需要一步步按程序執行的任務,明確的技能文檔能夠穩定地固化正確流程;但對於開放性的問答任務,死板的技能文檔反而可能過度適應之前的評分標準,限制了靈活性。

---

八、強模型和弱模型,是怎樣"管理"自己的技能庫的?

除了最終得分,研究團隊還觀察了AI在整個100道題過程中的技能管理行為,重點關注兩個指標:生成的技能被後續任務調用的頻率,以及最終技能庫的規模。

對比GPT-4o和GPT-5.3-Codex的結果,呈現出非常鮮明的對比。GPT-5.3-Codex最終在五個領域共積累了205個技能,而GPT-4o積累了384個——足足是前者的近兩倍。但在技能調用頻率上,GPT-5.3-Codex積累的技能被後續任務調用的次數更多,而GPT-4o的技能庫雖然更大,但調用率更低。

以法律領域為例,GPT-4o生成的技能在後續任務中被調用了24次,而GPT-5.3-Codex是79次;在醫療健康領域,GPT-4o是57次,GPT-5.3-Codex是129次。這種差異在所有五個領域中都保持一致。

更能說明問題的是技能質量評估。研究團隊用GPT-4.1-mini對所有生成的技能文檔進行了質量評分,評分維度涵蓋格式規範性(是否有有效的YAML頭部、名稱是否存在並匹配)以及內容質量(使用場景是否清晰、步驟是否可執行、是否具有可復用性、是否包含常見錯誤和邊界情況、是否有驗證步驟、是否包含可復用的代碼或公式等)。格式部分和內容部分各自評分,最終得分是兩者的乘積,任何一項為零都會導致總分為零,因為格式無效的技能文檔無法被框架正常加載使用。

結果顯示,GPT-4o生成技能的平均質量得分為5.68,而GPT-5.3-Codex的平均質量得分為7.94。GPT-4o不僅生成了更多技能,而且每個技能的質量更低。這種組合——數量多但質量差、復用率低——正是"技能碎片化"的典型症狀。GPT-4o傾向於把每次任務經驗單獨保存為一個窄小的、針對特定任務的文檔,而不是把多次相似經驗合併提煉為一個更通用的方法論。隨著任務推進,這些碎片化的技能越堆越多,不但沒有帶來相應的幫助,反而增加了每次任務開始時檢索和篩選技能的負擔。

---

九、用過去的對話記錄檢索,效果如何?

研究團隊還測試了另一種備選方案:與其讓AI主動整理技能文檔,不如直接把歷史任務的片段建立索引,讓AI在做新任務時檢索最相關的歷史記錄,把它們放進上下文。這種方法叫做檢索增強生成(RAG),可以理解為給AI配了一個"歷史任務搜尋引擎"。

這個實驗在Opus 4.7上針對醫療健康領域進行。RAG方案在評分標準類題目上的表現(得分0.539)比有明確技能庫的順序執行(得分0.517)略高,但在精確匹配題(0.815對0.926)和整體得分(0.617對0.635)上均遜於明確技能庫方案。這個結果與純上下文學習實驗呼應:直接的歷史資訊檢索有助於開放性問答,但在需要嚴格格式和步驟的任務上,系統性整理過的技能文檔更可靠。

---

十、強模型生成的技能,到底長什麼樣?

為了讓讀者對"技能文檔"有直觀感受,研究團隊在論文中提供了三個實際生成的技能示例,分別來自GPT-4o、GPT-5.3-Codex和Claude 4.7 Opus。

GPT-4o生成的技能以金融領域的日期範圍篩選為例,文檔包含簡單的功能描述和一段Python代碼,說明如何按日期範圍過濾數據,格式基本規範,但內容相對簡單,僅針對"交易任務"這個特定場景。

GPT-5.3-Codex生成的技能以金融問答的指標對齊為例,文檔層次更為豐富:先說明這個技能的作用是防止在表格中提取錯誤指標,然後按步驟給出工作流程,包括精確解析問題的目標指標與時間段、從表格行、匯總行和敘述性文本中構建候選值、按明確的優先級規則選擇來源,以及最終驗證單位換算、成分構成和時間順序。文檔還專門列出了常見錯誤(如把分項數據誤認為合計數據、混淆單位量級等)和輸出格式規範。

Claude 4.7 Opus生成的技能以醫療建議開放性問答為例,內容最為全面:說明任務格式、明確輸出文件路徑要求、提供結構化的工作流程、列出常見的疫苗相關醫學知識速查(包括不同國家的具體指南)、給出代碼示例,並專門提醒可能的陷阱,比如開放性問答不等於選擇題、某些問題可能是非英語提問需要用原語言回答等。

這三個例子清楚地展示了為什麼強模型的技能更有用:它們不只是記錄了"這道題怎麼做",而是提煉出了"這類任務的通用方法是什麼,以及哪些地方容易出錯"。

---

歸根結底,AI代理確實可以通過持續交互提升能力,但"真正學會"和"只是記住了更多上下文"之間的差距,比我們想像的要大得多。CONTINUALSKILLBENCH這套測試框架提供了一個重要的提醒:不能只看最終得分,還要看AI是在積累真正可復用的方法論,還是僅僅在堆砌越來越多的碎片化記錄。

對於普通用戶來說,這意味著當你在使用支持"技能學習"功能的AI工具時,工具背後的模型能力至關重要。更強的模型不只是回答得更准,它還能更有效地把經驗提煉成下次真正用得上的東西,而不是把每次交互都變成一個孤立的檔案。對於AI開發者來說,這項研究指向了一個清晰的挑戰:如何幫助AI代理在積累經驗的過程中,做到既不遺忘、又不碎片化,真正實現從經驗到通用能力的轉化。

這個問題的答案,目前還沒有人完全解決。如果你對其中的細節感興趣,可以通過arXiv編號2608.03874找到完整論文,親自看看研究團隊在這個方向上走了多遠。

---

Q&A

Q1:CONTINUALSKILLBENCH測試的是AI的什麼能力?

A:CONTINUALSKILLBENCH測試的是AI代理能否通過完成一系列連續任務,自主積累和進化自己的技能庫,並讓後續任務表現有所提升。它特別關注AI是否能把某一任務中學到的方法,真正遷移復用到後續不同但相關的任務上,而不只是重複記憶。

Q2:順序做任務比獨立做任務強多少?

A:在CONTINUALSKILLBENCH的測試中,順序執行平均比獨立執行高出約16.9%的得分,在15個"模型×領域"組合中有14個出現了提升。其中醫療健康領域提升最大,平均達到14.9個百分點;數學領域提升最小,約5.2個百分點。

Q3:明確整理技能文檔和單純保留歷史對話,哪個對AI幫助更大?

A:兩者效果相當接近。在GPT-5.3-Codex的測試中,純上下文學習(只看歷史對話不整理技能)得分0.605,有明確技能庫的順序執行得分0.602,差距極小。明確技能文檔在需要嚴格格式或程序化執行的任務上更有優勢,而上下文適應在開放性問答上略勝一籌。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新