宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

AI智能體的「世界」從哪來?一篇論文告訴你:讓智能體自己造環境,比人工設計更有效

2026年08月24日 首頁 » 熱門科技

你有沒有想過這樣一個問題:教一個AI智能體學會處理複雜的企業業務,比如訂機票、處理客戶投訴、協調多個部門的工作流程,第一步應該做什麼?

大多數人的答案是:先找到或者造一個能讓它練習的"場景"。就像教孩子游泳得先有個游泳池一樣,教AI幹活總得先有個能讓它上手操作的環境。

但這裡有個問題,一直被這個領域的研究者們忽略了。

被忽略的第三個角色

在AI智能體的訓練體系里,一直有兩個主角。

一個是策略模型:

**策略模型(Policy Model)**:決定AI在每一步該採取什麼行動的"大腦",它看到當前情況,然後決定下一步怎麼做。

另一個是世界模型:

**世界模型(World Model)**:預測環境會如何響應AI的動作,相當於AI腦子裡的一個"模擬器",能提前推演"如果我這麼做,世界會變成什麼樣"。

這兩個角色被研究得很透徹,從強化學習的經典理論到近幾年的各種智能體框架,大家爭論的焦點始終是:策略該怎麼學得更好,世界模型該怎麼預測得更准。

但有一件事很少有人問:這個"世界"本身是從哪來的?

在幾乎所有現有的研究里,環境是被當作一個既定事實處理的。研究者們要麼手工搭建一個特定任務的環境,比如做一個專門測試網頁瀏覽能力的沙盒,要麼圍繞某個具體的評測基準去合成數據。這就好比說,我們花了大量精力研究運動員怎麼訓練、教練怎麼指導,卻從沒認真想過:訓練場本身是誰建的,建得對不對,夠不夠用。

這篇來自Meridian Intelligence Global和馬薩諸塞大學阿默斯特分校的論文,把這個被忽視的角色單獨拎了出來,給它起了個名字,叫PLANETAI智能體的世界從哪來一篇論文告訴你讓智能體自己造環境比人工設計更有效

**PLANET**:論文中提出的新角色,專門負責"構建世界",也就是決定整個環境裡有哪些實體、服務、工具、狀態和運行規則,而不涉及AI具體怎麼行動。

論文的核心工作,就是設計了一套叫AGENTMERCURYAI智能體的世界從哪來一篇論文告訴你讓智能體自己造環境比人工設計更有效的框架,用來自動化地完成PLANET這個角色的工作:從一句高層次的業務描述出發,生成一個完整的、可執行的虛擬世界。

舊辦法的死結:環境是圍著任務轉的

要理解AGENTMERCURY為什麼重要,得先明白現在的環境構建方式究竟卡在哪。

現在主流的做法基本分兩種。第一種是純手工搭建,研究者針對某個特定任務,比如網頁購物、文字冒險遊戲,專門設計一套實體、工具、狀態和轉移規則。第二種是"合成式"的,從任務描述或用戶指令出發,用生成模型去自動造一批類似的任務實例。

這兩種方法有一個共同的隱藏假設:環境是圍繞任務存在的,任務是第一位的,環境只是為了讓這個任務能跑起來而存在的容器。

問題就出在這裡。

如果你的環境是為了某個特定任務量身定做的,那麼增加任務數量,並不會增加世界本身的豐富程度。你造了1000個購物任務,但背後可能還是同一套簡化的購物網站邏輯,本質上換湯不換藥。這就像一個遊樂場,為了讓遊客能玩上"過山車"這一個項目,專門造了1000條一模一樣的過山車軌道,看起來項目很多,但遊客體驗到的東西其實高度重複。真正的多樣性,不是來自於任務數量的堆疊,而是來自於這個世界本身有多少種可能性。

現實世界的業務場景恰恰不是這樣運作的。你去處理一個客戶投訴,這個任務不是憑空出現的,它是從一整套持續運轉的業務系統里"長"出來的:有客戶關係管理系統的記錄,有郵件往來的歷史,有團隊協作工具里的討論,甚至可能牽扯到財務系統的一筆交易。任務是嵌在一個活的、有記憶的世界裡的,而不是獨立於這個世界被單獨設計出來的。

這就是論文想要解決的根本矛盾:如果你從任務出發去造環境,你造出的世界註定是貧瘠的,因為它只需要支撐那一個任務;但如果你反過來,先造一個足夠豐富的世界,讓它自己"長出"各種各樣的任務,你得到的訓練素材會天然地更加多樣、更貼近真實。

論文給這個思路起了個名字,叫"場景驅動的世界生成",和"任務驅動的環境構建"相對。聽起來有點繞,但道理很直白:不要先想"我要考什麼題",而要先想"我要建一個什麼樣的世界",題目自然會從這個世界裡冒出來。

AGENTMERCURY到底造了什麼

論文裡,研究團隊真刀真槍地用這套方法生成了4783個可執行的環境,覆蓋14個行業、50個國家,累計有近1400萬行數據。

這個規模放在同類工作里對比一下會更有感覺。論文專門做了一張圖,把AGENTMERCURY和幾個知名的智能體環境項目放在一起比較,包括AppWorld、MCPMark、τ-bench和agent-world。結果顯示,別的項目要麼環境數量多但每個環境涉及的服務少(一個環境裡可能就一兩個服務在互動),要麼服務複雜度高但環境數量有限,AGENTMERCURY同時做到了數量大和服務多樣兩頭兼顧,平均每個環境涉及超過13個服務、65個工具、31張狀態表和15條SQL驗證規則。

這些數字背後到底意味著什麼?

每個環境不是一個靜態的題目集合,而是一個"活"的軟體系統。它有多個相互連接的服務(比如CRM、郵件、Slack這樣的組合),每個服務下面掛著幾十個可以調用的工具,還有幾十張記錄著業務數據的表格。更關鍵的是,這個系統里嵌入了一套用SQL寫成的驗證規則,能在AI完成任務之後,自動檢查它是不是真的把跨系統的業務邏輯處理對了。

舉個例子。假設某個業務規則要求"客戶升級為VIP之後,必須在計費系統里同步生成一條新的賬單記錄",這個規則不會被寫死成一條強制執行的程序邏輯,環境不會替AI自動生成這條賬單記錄。它只是被記錄為一條"世界應該滿足的不變式",等AI操作完之後,系統再去檢查這條不變式是否真的成立。

這個設計其實藏著一個很微妙的心思:如果規則是被環境強制執行的,那AI根本不需要理解這個規則,它只需要觸發某個動作,系統自動幫它把後續步驟補全了,這樣一來AI壓根學不到真正的業務邏輯。但如果規則只是"事後檢查",AI就必須真正理解"客戶升級後應該同步賬單"這件事,自己主動去完成這個動作,環境不會代勞。這就像考駕照的時候,如果教練車會自動幫你完成側方位停車,那你考試再順利,也不代表你真的學會開車了。只有讓學員自己完成動作,事後再檢查停得對不對,才能真正檢驗和培養駕駛能力。

造一個世界,具體分幾步

論文把整個構建過程拆解成了一套清晰的流水線,可以概括成這樣一條鏈路:一個業務場景,先經過PLANET變成一個可執行的世界,再從這個世界裡生成具體的任務和評分標準,然後AI(策略模型)在這個世界裡行動產生一段交互軌跡,最後系統對這段軌跡評分。

這裡面有幾個層次值得展開講講。

首先是世界本身的構造。論文把一個可執行世界定義成一個七元組,包含狀態空間、動作空間、觀測空間、狀態轉移函數、觀測函數、初始狀態和世界級不變式。這套構造過程被進一步拆解成幾個連續的子步驟:先確定公司身份(這是家什麼行業、什麼地區的公司),再確定服務圖譜(這家公司用了哪些軟體系統,它們之間怎麼連接),然後確定狀態模式(每個系統里有哪些數據表,欄位是什麼),接著播種初始狀態(給這些表填上具體的初始數據),最後生成不變式(哪些跨服務的規則必須成立)。

這個層層遞進的構造方式,其實很像蓋房子的順序:先規劃地基和承重結構(公司身份和服務圖譜),再確定每個房間的具體用途和布局(狀態模式),然後往裡面添置家具和物品(初始狀態),最後定下"這棟樓哪些區域是相互聯通的,哪些安全規範必須遵守"(不變式)。如果你跳過前面幾步,直接從"這個房間要放張桌子"開始設計,你造出來的可能是一堆互不相干的房間拼湊物,而不是一棟能真正住人的完整建築。

其次是任務的生成。世界造好之後,任務是從這個世界裡"取樣"出來的,具體做法是在世界的初始狀態基礎上做一些"任務專屬"的狀態修改,再配上一句自然語言的任務指令和一份評分細則。這就意味著,同一個世界結構完全可以支撐很多個不同的任務,就像同一棟寫字樓里,今天可能有個任務是處理一份逾期賬單,明天可能是協調一次跨部門會議,辦公樓沒變,但裡面每天發生的具體故事各不相同。

還有一個細節值得單獨說一下,就是這些不變式有"可見"和"隱藏"兩種呈現形式。

**可見視圖AI智能體的世界從哪來一篇論文告訴你讓智能體自己造環境比人工設計更有效(Visible View)**:不變式以業務文檔或政策說明的形式出現在世界裡,AI需要靠自己在交互中去發現這些規則,而不是被直接告知;**隱藏視圖AI智能體的世界從哪來一篇論文告訴你讓智能體自己造環境比人工設計更有效(Hidden View)**:不變式轉化成可執行的驗證條件,專門用來做最終的評分評估,AI在交互過程中看不到。

這個設計其實模擬了真實工作場景里的常見狀態:新員工入職一家公司,公司手冊里寫著各種流程規範,但沒人會把每條規矩都掰開揉碎講給你聽,你得自己在處理業務的過程中去摸索、去踩坑,才能真正理解這些規則的存在。而公司內部真正用來考核你的KPI標準,往往是另一套你看不見的東西。

訓練效果:沒瞄準考題,卻考得更好了

理論講得再漂亮,最終還是要看數據說話。論文用這4783個環境作為訓練場,讓智能體在裡面做強化學習,然後拿到各種測試題上去檢驗效果。

這裡有一個特別值得強調的實驗設計邏輯:訓練用的環境,跟最終測試用的評測基準,是完全獨立、互不相關的。也就是說,AI在訓練階段接觸到的是一堆虛構公司里的業務任務,測試階段考的卻是完全不同的、業內已經公認的標準化題目。這種"訓練和考試不同源"的設計,恰恰是檢驗這套方法是否真的教會了AI通用能力,而不只是讓它背下了幾道特定題目答案的關鍵。

先看企業業務場景本身的測試結果,用的評測基準叫ENTERPRISEOPS-GYM,覆蓋了團隊協作、客戶成功管理、郵件處理、IT服務管理、日程安排、人力資源、雲盤管理和跨系統協同這八個業務領域。

用40億參數規模的Qwen3.5-4B模型做實驗,訓練前平均得分是12.3,訓練後漲到15.7,提升了超過27%。具體拆開看,雲盤(Drive)這一項從6.2分直接跳到15.6分,漲了9.4分;郵件處理從23.9分漲到33.3分,同樣漲了9.4分。這些提升相當可觀,尤其是考慮到訓練用的環境跟這個評測基準壓根沒有直接關聯。

再換成一個大得多的模型,350億參數(激活約30億)的Qwen3.5-35B-A3B,用GRPOAI智能體的世界從哪來一篇論文告訴你讓智能體自己造環境比人工設計更有效這種強化學習算法訓練後,平均分從24.8漲到28.1;換用另一種叫SAOAI智能體的世界從哪來一篇論文告訴你讓智能體自己造環境比人工設計更有效的訓練算法,平均分漲到28.3。這說明這套環境不挑訓練算法,無論用哪種強化學習方法,效果都穩定存在。

**GRPO**:一種強化學習優化算法,全稱是分組相對策略優化,會給同一個提示採樣多份不同的回答,用相對比較的方式給策略評分改進;**SAO**:單次滾動異步優化算法,特點是不需要對同一個提示反覆採樣,可以讓一次訓練接觸到更廣泛的環境和任務樣本。

真正讓人意外的,是這套訓練還在"跑題"的領域產生了效果。

論文拿了一系列跟企業業務八竿子打不著的測試題去考這個訓練後的模型,包括數學競賽題(AIME26、HMMT)、編程能力測試(LiveCodeBench)、科學計算題(SciCode)、工具調用能力測試(BFCL),還有研究生水平的知識問答(GPQA-Diamond)。

結果是,Qwen3.5-4B在AIME26數學競賽題上的得分,從訓練前的45.9分漲到訓練後的56.0分,提升超過10分。HMMT數學競賽從28.5漲到35.4,編程測試LiveCodeBench從36.6漲到44.0,科學計算SciCode從22.6漲到25.7。

這就有點出乎意料了。一個專門在虛擬企業環境裡練習處理客戶投訴、協調日程的AI,怎麼會在數學競賽和編程題上突然變強了?

這裡可以打個比方。一個健身教練如果只讓你反覆練習某一個固定的舉重動作,你確實能在這個動作上變得很厲害,但你的核心力量和身體協調性未必會有實質提升。但如果這個教練設計了一整套涉及深蹲、跑步、游泳、攀爬的綜合訓練體系,儘管你從來沒專門練過打籃球,你的爆發力和身體協調性提升之後,去打籃球照樣會比以前強不少。AGENTMERCURY合成的環境之所以有這種遷移效果,很可能是因為這些環境天然要求AI具備多步驟規劃、狀態追蹤、跨系統資訊整合這些底層能力,而這些底層能力恰恰是解數學題、寫代碼時同樣需要的通用技能,不是某個具體領域的窄技巧。

論文裡也觀察到一個例外,就是電信客服(Telecom)這一項測試分數幾乎沒變化,從92.5微降到91.9。這說明這種遷移效果不是"訓練什麼都能漲"的萬能藥水,而是有選擇性的,訓練帶來的提升集中體現在那些真正需要綜合推理和多步操作的場景上,對某些已經接近飽和、區分度不高的測試項影響有限。

還有個細節挺有意思,在350億參數模型的τ-bench工具調用測試里,訓練之前模型的表現波動特別大,比如電信領域的得分是49.1,但標準差高達49.8,幾乎是從0分到接近滿分之間隨機跳動。訓練之後,這個得分變成65.5,標準差降到23.8。這意味著訓練不僅僅提高了平均分,還讓模型的表現變得更加穩定可靠,不再是"看運氣"式的忽高忽低。這一點對於需要連續多步操作才能完成的複雜任務來說,可能比單純提高平均分更重要,因為一個業務流程里只要有一步掉鏈子,整個任務就可能失敗。

訓練過程是否健康:會不會在偷懶作弊

強化學習訓練里有個經常被人擔心的問題,就是模型會不會通過某些取巧的方式騙到高分,比如瘋狂重複某幾個詞、生成一堆沒有實際內容的廢話來拖長回答長度,而不是真正提升能力。

論文專門畫了訓練過程的監控圖,追蹤了四個指標:獎勵分數、回答長度、被截斷的回答比例,以及退化回答(也就是那種胡言亂語或者卡在重複循環里的回答)的比例。

結果顯示,獎勵分數隨訓練穩步上升,回答被截斷的比例持續下降(意味著模型學會了更高效地在規定步數內完成任務),退化回答的比例始終接近於零。這幾組數據放在一起看,說明模型確實是靠"把事情做對了"來拿到更高分數的,而不是靠鑽空子。

造世界這件事,也能教會AI自己去做

到這裡,論文已經證明了合成出來的世界能作為有效的訓練素材。但研究團隊還追問了一個更深層的問題:造世界這個過程本身,能不能也變成一種可以被AI學會的能力?

換句話說,如果給一個AI模型一段高層次的業務描述,它能不能自己動手,把這段描述變成一個結構完整、可以執行的虛擬世界?

為了驗證這一點,研究團隊專門準備了30份沒在訓練中出現過的業務簡介,涵蓋不同國家和行業。他們讓幾個市面上現成的頂尖模型(包括Claude Opus 4.8、GPT-5.4、DeepSeek-V4-Pro、GLM-5.2)直接去嘗試構建,同時也測試了一個基礎版的Qwen3.5-35B-A3B模型,以及經過專門訓練後的同一個模型。

評判標準非常嚴格:不是看生成的文字描述得漂不漂亮,而是直接執行這個生成出來的環境,用12項結構化驗證規則去檢查,只有全部12項都通過,才算是真正成功造出了一個能用的世界。

結果發現,幾個頂尖的商業模型零樣本情況下表現還不錯,成功率在66.7%到90%之間,平均在80%左右。但基礎版的Qwen3.5-35B-A3B模型,零樣本嘗試的成功率只有3.3%,幾乎可以說是不會幹這件事。

真正的轉折點出現在,研究團隊用近3萬條從AGENTMERCURY構建過程中提取出來的"構造軌跡"數據,對這個基礎模型做了專門的微調訓練。這些數據不只是簡單的"業務描述對應最終世界"的配對,還包括了中間步驟的補全練習、根據驗證器反饋修復錯誤世界的練習,以及把一個高層意圖轉化成具體修改動作的練習。

訓練之後,這個模型的成功率從3.3%直接躍升到83.3%,幾乎追平了最強的商業模型。用統計檢驗的方法算了一下,這個提升的顯著性水平達到了p值1.2乘以10的負10次方,說明這絕對不是巧合,而是真實的能力提升。

這個結果背後傳遞的資訊挺深刻的:造環境這件事,原本被大家默認成一種需要工程師手工完成的"髒活累活",是訓練流程之外的一個準備工作步驟。但這個實驗說明,只要給出合適的訓練數據,讓AI觀察大量的構造過程和修復錯誤的案例,這件"髒活"本身也能變成AI自己的一項技能。

這裡有個特別值得琢磨的反常現象。研究團隊還試了一種"給攻略"的做法,就是除了業務描述之外,額外提供一份構造要點摘要和一個精簡過的構造範例,看看這樣會不會幫模型表現得更好。

結果是,對訓練之前的基礎模型,給攻略確實有幫助,成功率從3.3%漲到了20%。但對訓練之後的模型,同樣的攻略反而把成功率從83.3%拉低到了10%。研究團隊進一步分析發現,30個案例里有27個的失敗原因都集中在"跨服務約束的處理錯亂",也就是本該跨系統生效的一條規則,被錯誤地塞進了同一個系統內部。

這個現象其實很好理解,可以類比成學開車這件事。一個還沒學會開車的新手,你給他一份詳細的操作手冊,確實能幫他磕磕絆絆地把車開出去。但一個已經把開車動作練成肌肉記憶的老司機,你突然遞給他一份操作手冊讓他邊看邊開,反而會打亂他原本流暢自然的操作節奏,讓他手忙腳亂。這說明"通過提示詞臨時補充資訊"和"通過訓練把能力內化進模型參數裡",是兩種完全不同性質的機制,前者是外部拐杖,後者才是真正學會了這件事。如果訓練確實讓模型學會了這項能力,那這份多餘的拐杖,反而會成為一種干擾。

論文裡沒細說但值得多想一層的地方

論文本身也很坦誠地指出了當前系統還沒有完全實現的部分。目前這套流程里,造世界(PLANET)和訓練策略(policy)之間還是相對分離的兩個環節,造世界的過程並不會根據AI在訓練中暴露出的具體弱點去針對性地生成新場景。

論文設想的下一步,是讓這兩者形成一個真正的閉環:AI在執行任務的過程中不斷暴露出自己哪些能力還比較薄弱,這些薄弱環節能夠反過來指導PLANET去合成更多針對性的新場景,新場景又反過來訓練出更強的策略,如此循環往復。這有點像一個不斷根據你的弱點調整訓練計劃的私人教練,而不是一套固定不變的健身課表,只不過現在這個"教練"這一環還沒有真正打通。

##

寫在後面

這篇論文最讓我反覆琢磨的一點,是它對"什麼值得被規模化"這件事給出了一個跟直覺相反的答案。

大多數人第一反應會覺得,想讓AI變強,就應該多餵它做題,題目越多越好,題目越貼近考試內容越好。但這篇論文用實打實的數據說明了另一件事:訓練素材跟最終考核標準壓根不沾邊,反而可能訓練出更泛化的能力。這多少推翻了我以前對"針對性訓練"這個詞的默認信任,針對性未必是好事,有時候反而是一種限制。

另一個讓我印象深刻的細節,是"給攻略反而讓訓練後的模型變差"這個反常結果。這其實提醒了一件容易被忽略的事:一個模型的能力狀態是有連續性的,同樣一份外部資訊,餵給不同訓練階段的模型,效果可能完全相反。這跟人類學習一門技能的過程還挺像的,新手需要拐杖,但對已經內化了這項技能的人來說,拐杖反而變成了累贅。

論文裡那句"跨服務約束的坍縮"錯誤也值得單獨玩味一下:一個AI造出的虛擬世界,表面看起來結構完整、邏輯自洽,但實際上把本該分離的兩個系統之間的約束錯誤地塞進了同一個系統內部。這種錯誤光看文字描述根本發現不了,只有真正把這個世界跑起來、執行一遍,才能暴露出問題。這某種程度上說明,判斷一個複雜系統是否真的"對",光靠看說明書是不夠的,你得真的讓它運轉起來試試看。

那麼問題來了:如果造世界這件事本身能被AI學會,那AI是不是也能學會判斷"這個世界值不值得造",甚至是"我需要一個什麼樣的世界來提升自己"?這條鏈路一旦真的打通,AI訓練這件事會變成什麼樣子?

Q&A

Q1:AGENTMERCURY是什麼?

A:AGENTMERCURY是一個可以從高層次業務場景描述出發,自動合成可執行虛擬環境的框架。它先構建一個包含實體、服務、工具、狀態和跨服務規則的持久化世界,再從這個世界裡生成具體任務,供AI智能體訓練和測試使用,目前已經生成了4783個覆蓋14個行業、50個國家的環境。

Q2:用AGENTMERCURY合成的環境訓練AI,效果好在哪?

A:論文實驗顯示,用這些環境訓練出的AI模型,不僅在企業業務測試(ENTERPRISEOPS-GYM)上有明顯提升,比如Qwen3.5-4B從12.3分漲到15.7分,還在完全不相關的數學競賽(AIME26從45.9漲到56.0)、編程測試(LiveCodeBench)等領域表現更好,說明這種訓練方式能提升AI的通用能力,而不只是針對特定任務的窄技巧。

Q3:AI能不能自己學會造這種虛擬環境?

A:可以。論文用近3萬條環境構造過程的數據對Qwen3.5-35B-A3B模型做了微調訓練,結果這個模型在30份未見過的業務場景上,成功造出可執行世界的比率從訓練前的3.3%提升到了83.3%,說明環境構建這件事本身也是一項可以被AI學習掌握的能力。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新