這項由微軟研究院(Microsoft Research)主導的研究以預印本形式發布於2026年7月,論文編號為arXiv:2607.28074,感興趣的讀者可通過該編號查詢完整原文。
**研究概要**
每天,無數人坐在電腦前處理重複性工作:登錄銀行網站轉賬、在日曆上安排會議、在項目管理系統里更新狀態、給同事發送郵件……這些事情對人類來說輕車熟路,但對於AI助手來說,卻是真正的"攔路虎"。問題不在於AI不夠聰明,而在於它沒有地方練習。
你可以把AI學習操作電腦的過程,想像成一個廚師學徒學做菜。學徒必須真正站在爐灶前切菜、翻炒、嘗味道,才能掌握真功夫——光看菜譜是遠遠不夠的。但現實中,如果這個"練習廚房"就是一家正在營業的餐廳,學徒每次練習都會直接影響到真實顧客,那顯然無法大規模訓練。解決方案是什麼?搭建一個專屬的"訓練廚房",讓學徒在裡面隨便折騰,出了錯推倒重來,直到練出真本事。
微軟研究院的團隊正是做了這件事。他們構建了一套名為**Echoverse
**的系統,本質上是一批精心仿造的虛擬應用程式——有模擬電子郵件的、有模擬網上銀行的、有模擬項目協作平台的——AI智能體可以在這些"訓練廚房"里盡情操作、犯錯、重置,直到真正學會如何完成複雜任務。更重要的是,這套系統不只是靜態的練習場,它會隨著AI的進步不斷"升級難度",始終保持對AI的挑戰性。
研究團隊用一個9B(90億參數)規模的小模型在這套系統上訓練後,任務完成率從36.5%躍升至67.1%,已經相當接近遠比它體量龐大的頂尖前沿模型(與GPT-5.4的差距僅14個百分點)。
---
**一、為什麼AI學操作電腦這件事這麼難?**
要理解Echoverse解決了什麼問題,先得搞清楚AI學操作電腦究竟難在哪裡。
回到廚師學徒的比喻。假設學徒只能看著別人做菜的錄像來學習,從不能真正動手,他永遠無法知道"翻炒時鍋的溫度是否合適",因為這個資訊根本不在錄像里。同樣的道理,一張截圖只能告訴AI界面長什麼樣,但無法告訴它"點擊了這個按鈕之後,系統內部發生了什麼變化"。AI需要在真實運行的應用程式里行動,才能感知到自己的操作是否真的生效了。
而且,最有價值的那些操作場景幾乎都藏在"登錄牆"後面——銀行轉賬、醫療記錄修改、企業內部系統的操作——這些地方根本不可能讓AI隨便練習,因為每次操作都會產生真實後果,沒有"撤銷"按鈕。
更麻煩的是,即便研究人員想用公開網站來訓練AI,網站本身也是個不穩定的練習場:今天的頁面布局,明天可能就變了;今天可以訪問的內容,明天可能就被限速隱藏了。訓練一個技能需要在完全相同的環境裡重複數千次,而公開網站根本無法提供這種穩定性。
近年來,學術界已經意識到這個問題,開始批量生成"合成虛擬環境"來代替真實網站。這確實解決了"有沒有練習場"的問題,但隨之而來的新問題是:這些練習場夠不夠真實?夠不夠深入?如果練習場太簡單,AI練出來的技能根本無法遷移到真實世界。
Echoverse的核心主張正是:**練習場的質量比數量更重要**,而且練習場本身也需要不斷進化。
---
**二、什麼叫"深度"練習場?——五個缺一不可的條件**
微軟研究院的團隊提出了一個關鍵概念:"深度"(Depth)。但這個"深度"不是隨口說說的形容詞,而是有嚴格操作定義的技術標準。
回到廚師學徒的比喻來理解這五個條件。一個真正有用的"訓練廚房"需要滿足什麼要求?
第一,廚房裡的所有設備必須按照真實餐廳的邏輯工作。如果訓練廚房裡的爐灶根本不會因為開太大火而觸發安全保護,學徒就永遠學不會控制火候。對應到虛擬應用程式里,這叫做"行為保真度"——界面上的按鈕、權限、錯誤提示,必須按照真實應用程式的邏輯來運作,而不是隨便點什麼都能成功。
第二,廚房裡的各個工作檯必須相互聯通。如果備菜台備好的食材,送到炒菜台時憑空消失了,學徒就無法練習真實的烹飪流程。對應到虛擬應用程式里,這叫做"狀態一致性"——A用戶發出的消息,必須真的出現在B用戶的收件箱裡;取消的會議,必須從所有參會者的日曆上同時消失。
第三,廚房裡的操作流程必須有真實的前後依賴關係。如果一道菜的每個步驟都是獨立的,彼此之間沒有順序要求,學徒學到的就只是一堆孤立動作,而不是真正的烹飪邏輯。對應到虛擬應用程式里,這叫做"工作流深度"——早期的操作選擇,應當約束後續步驟的可能性,就像真實訂房時先選日期、再選房型、最後付款這樣的完整流程。
第四,必須有客觀的評分標準。如果學徒做出一道菜,只能靠導師"看起來不錯"來判斷好壞,那這個評分就是不可靠的。對應到虛擬應用程式里,這叫做"權威驗證"——成功的判定標準必須來自應用程式的資料庫實際發生了什麼變化,而不是AI看起來"做了什麼"的視覺印象。
第五,練習的內容本身必須是值得練的。如果訓練廚房只教學徒如何切胡蘿蔔,而真實餐廳里根本不用胡蘿蔔,那整個練習就是浪費時間。對應到虛擬應用程式里,這叫做"領域價值"——練習場覆蓋的工作流,必須是真實世界裡有意義的場景。
這五個條件缺一不可。一個看起來漂漂亮亮、界面精美的虛擬應用程式,可能在第二或第三個條件上完全不達標,從而成為一個毫無訓練價值甚至適得其反的練習場。Echoverse的論文裡有一個讓人印象深刻的負面案例:用"淺度"練習場訓練的AI,在真實網站上的表現反而比完全沒有訓練還要差(從80分掉到75分)。原因就在於淺度練習場給AI灌輸了一些錯誤習慣——不管遇到什麼情況都隨便點點點,反正練習場裡怎麼點都能過關。
---
**三、Echoverse是怎樣建造這十二個"訓練廚房"的?**
理解了"深度"的重要性,下一個問題就是:如何批量建造出滿足這五個條件的高質量練習場?
微軟研究院的團隊設計了一套"工廠流水線",分為兩個階段,但這兩個階段實際上是一個不斷循環的整體。
第一階段的核心任務是"建造並驗證應用程式本身"。整個過程從一批由人類手寫的"種子"開始——這些種子描述了目標場景、代表性任務、應具備的功能特性。然後,一群專門扮演不同角色的AI智能體接管工作:有的負責"建造"(生成資料庫結構、後端接口、前端界面),有的負責"核查"(像一個嚴格的質檢員,按照事先列明的可驗證條件逐一檢查應用程式),有的負責"分診"(把大量小問題歸類成少數幾個根本原因,就像醫院急診室的分診護士把患者按病情分流),有的負責"修復"(對症下藥,修好問題後再重新檢查,如果修復引入了新問題就回滾)。
這套流程里有一個關鍵的設計理念:負責檢查的人和負責建造的人是分開的,沒有人可以既當運動員又當裁判員。只有當95%以上的可驗證條件都通過檢查,這個應用程式才能"畢業"進入下一階段。
第二階段的核心任務是"在這個應用程式上生成大量可核查的練習任務"。從種子出發,系統在真實運行的資料庫里查詢真實存在的數據,據此生成具體任務——比如"找到用戶ID為123的最近一次轉賬金額",這個答案是直接從資料庫里查出來的,而不是人工編造的,因此天然具有"正確性"。每個任務都經過質量檢查:任務涉及的實體是否真實存在於資料庫中?任務難度是否與所需工作量匹配?最關鍵的一個問題:這個任務在當前界面上是否真的可以完成?
這最後一個檢查是"白盒"的——負責檢查的智能體不僅會像真實用戶一樣操作界面,還會直接讀取應用程式的源代碼和資料庫,用來區分"任務本身無法完成(應用程式的問題)"和"任務很難完成(需要高水平的AI)"這兩種情況。這個區分非常重要:在決定哪些任務存在時,不能讓未來要訓練的AI模型參與評判,否則就會產生"為強模型量身定製任務"的偏差。
整套建造流程最終生產出了十個"全領域深度世界"和兩個"能力專項世界"。十個全領域世界覆蓋了幾類最有價值的工作場景:通訊協調類(模擬電子郵件、日曆、企業即時通訊),技術創作與運維類(模擬機器學習平台、代碼協作平台),受監管的記錄與交易類(模擬網上銀行、醫療收費系統),以及社區媒體與旅行類(模擬論壇、音樂流媒體、民宿預訂)。這十個世界的資料庫都有真實的規模:光是民宿預訂世界(EchoStay)就有18萬條數據記錄,包含3700個房源、5400次預訂、5300條評價和6100個用戶;代碼協作世界(EchoForge)的資料庫里有70.5萬條記錄,包含175個項目、8.1萬個問題單和13.4萬個合併請求。
兩個能力專項世界則是為了解決一個特殊問題:有些AI的短板不是缺少某個領域的知識,而是某個具體的界面控制項操作不熟練。日期選擇器就是典型例子——真實網路上的日期控制項形態各異,有傳統日曆格、滾輪式、熱力圖式,還有需要推算的相對日期("下周一"、"工作日後第10天")。一個再深度的民宿預訂模擬器,也只有一種日期控制項。於是研究團隊專門建了一個"日期選擇器專項世界",把同一個功能用100種不同外觀渲染出來,涵蓋6種核心控制項形態、10種應用場景。類似地,"嵌套篩選器專項世界"把各種搜索篩選面板做成了20個控制項家族、200個不同前端界面,橫跨房地產、購物、金融、旅行、雲計算、寵物6個主題垂直領域。
---
**四、評分機制:不看"表演",只看結果**
現在,AI在這些虛擬世界裡完成了任務,怎麼評分?
評分的核心原則是:**只看資料庫里發生了什麼,不看AI的截圖和自述**。
以一個具體例子來說明區別。假設任務是"把會議室A的預訂從下午3點改到下午4點"。糟糕的評分方式是:讓另一個AI看AI操作後的截圖,判斷"看起來好像成功了"。優秀的評分方式是:直接查資料庫,看會議室A的預訂時間欄位是否真的從15:00變成了16:00。
Echoverse採用的正是後者。對於"寫入類"任務,系統會比對操作前後的資料庫差異(通過SQLite的sqldiff工具),確認所需的數據變化確實發生了,而且變化的內容與要求一致。對於"讀取類"任務,系統會把AI報告的答案與從資料庫直接查詢出的正確答案做比對。對於既要讀取又要寫入的任務,兩種驗證都要通過。
這樣的評分機制有一個關鍵優勢:它極難被"忽悠"。AI無法通過聲稱"我已經完成了"就獲得分數,因為資料庫不說謊。這對於用來訓練AI的信號質量至關重要——如果訓練信號本身就不可靠,那訓練出來的AI也會學會"演戲"而非真正完成任務。
當然,完全的字符串匹配也不合適——畢竟"287.62元"和"288元"在語義上是等價的。因此,最終的比對步驟會用一個小型語言模型來判斷語義等價性,但這個模型看到的輸入非常有限:只有AI的回答和從資料庫讀出的參考答案,沒有操作截圖,沒有AI自己的解釋,只回答一個問題:"這兩個答案是否表達了相同的內容?"這個狹窄的比對任務比讓AI判斷"整個操作流程是否看起來正確"要可靠得多。
---
**五、訓練場和AI一起進化——"共同進化"循環**
到目前為止,Echoverse聽起來像是一個"先建好練習場、再讓AI去練"的靜態系統。但真正讓它與眾不同的,是它的動態性:練習場和AI是同步進化的。
這背後的洞察是:當AI在某個任務上失敗時,失敗的原因有兩種可能。第一種:AI確實不會。第二種:練習場本身有問題——資料庫里的數據對不上、界面有Bug、評分標準寫錯了。如果把第二種失敗也當成"AI的學習素材",就會把錯誤的經驗餵給AI,訓練出一個專門適應了"有Bug的虛擬世界"的AI,而不是一個能在真實世界裡工作的AI。
EchoStay(民宿預訂世界)就是一個真實發生過的典型案例。在這個世界的第一個版本里,有一個控制"入住人數"的界面控制項出了問題——AI操作時,這個控制項會靜默地保持默認值,不管AI怎麼操作都改不了。結果,所有涉及"指定入住人數"的訂房任務,都因為這個Bug而自動失敗,與AI的實際能力無關。當時這個世界裡,只有48%的預訂任務實際上是可以完成的。
修復了這個Bug之後,可完成的預訂任務比例從48%升到了78%,有15個原本被卡住的任務重新變得可解。更重要的是,在修復後的世界上訓練的AI,任務完成率從16.2%直接跳到了38.5%,相當於一躍完成了與頂尖前沿模型GPT-5.4(50.4%)之間三分之二的距離。
EchoForum(社區論壇世界)有類似的故事:修復了前端問題和頁面加載速度後,原本37個全部失敗的任務變成了36個成功。EchoChat(企業即時通訊世界)的問題則出在評分機制上:驗證程序與資料庫數據出現了不同步,導致只有34%的任務可以被正確評分——重新對齊後,可評分任務比例達到了99%。
這些案例說明了一個關鍵道理:**在用AI的失敗案例來訓練AI之前,必須先確認這些失敗是AI自己的問題,而不是練習場的問題**。這就是"共同進化"循環的精髓——每一批AI的運行記錄,既是訓練數據的來源,也是排查練習場缺陷的線索。兩個信號從同一次運行里讀取出來,形成一個螺旋式上升的改進循環。
有一個重要原則貫穿整個修復過程:修復絕對不能以降低要求為代價。如果某個任務確實有效、本身是合理的、而且評分機制也是對的,那AI在這個任務上失敗,恰恰是最有價值的訓練信號——正是這個任務揭示了AI真正的能力邊界。修復只能改善練習場,而不能把難題改成簡單題來提升通過率。
---
**六、規模的邊界:多少練習場才夠用?**
研究團隊用一系列實驗來測量不同因素對AI能力的影響,結果揭示了一些出人意料的規律。
第一個實驗:固定練習場的數量,只增加在這些場裡的練習次數(軌跡數量)。結果是:在同一批練習場裡反覆練,對合成任務的成績還在提升,但對真實網站的遷移能力卻到了天花板——從6400條軌跡增加到2萬條,在真實WebVoyager測試集上的成績幾乎沒有變化(54.8%到55.6%),在另一個真實測試集上甚至小幅下滑。就像一個學徒在同一個廚房做了幾千遍同樣的菜,廚房裡能學到的東西已經全部學完,繼續重複不會帶來新的技能。
第二個實驗:固定總練習次數,只增加練習場的種類。結果完全不同:隨著練習場種類的增加,不僅合成任務成績持續上升,在真實網站上的表現也隨之提升,一直到12個練習場時才達到最佳值。這說明,對AI能力的拓展而言,**多樣性才是真正的槓桿,而不是重複量**。
但這裡有一個重要的前提:增加的練習場必須是高質量的"深度"練習場。研究團隊在另一個實驗裡做了直接對比——用同樣的領域(Allrecipes食譜網站和Hugging Face機器學習平台),分別建造淺度版練習場和深度版練習場,各自訓練一個模型,然後放到真實網站上測試。淺度版的結果令人警覺:在Allrecipes上,訓練了淺度練習場的AI反而比完全沒訓練的基礎模型還要差(從80分掉到75分);在Hugging Face上,成績基本沒有改變。只有深度版練習場才讓兩個任務的成績都切實提升(Allrecipes從80到85,Hugging Face從48到65)。
這個"負向遷移"現象的機制可以在AI的行為記錄里看出來:淺度練習場訓練出的AI更容易陷入循環、重複無效操作、浪費步驟——因為在簡單的淺度練習場裡,這些壞習慣從來沒有被懲罰過。
---
**七、強化學習:讓AI從自己的錯誤中學習,突破模仿天花板**
前面描述的所有訓練方式,本質上都是"模仿學習"——AI觀察人類(或頂級AI)的正確操作軌跡,然後模仿。這種方式有一個內在上限:AI只能學會重現正確路徑,但永遠不會從自己的錯誤中主動學習如何糾正。
更深的問題在於:頂級AI出錯的方式,和一個普通9B模型出錯的方式是完全不同的。頂級AI會在高難度的推理判斷上出錯,而9B模型卻經常在一些顯而易見的地方犯低級錯誤——沒認清一個明顯的按鈕、在沒有任何響應的元素上重複點擊、還沒完成任務就宣告結束。模仿只能傳授"頂級AI如何從頂級AI自己的錯誤中恢復",而不能教會普通模型如何從普通模型自己的錯誤中恢復。
強化學習(RL)解決的正是這個問題:讓模型在真實環境裡按自己的方式行動,看看結果如何,然後根據結果來調整。好的結果受到鼓勵,壞的結果受到懲罰,AI逐漸學會在自己真實會遇到的情況下做出更好的選擇。
但強化學習對環境有非常嚴苛的要求,這些要求恰好是公開網路無法提供的:必須能精確重置到初始狀態(公開網站的頁面會變,日期會滾動,內容會更新,兩次運行根本不一定是同一個場景);必須支持高並發、大規模採樣(公開網站會限速甚至封鎖自動訪問);必須有可靠的獎勵信號(公開網站沒有後端權限,只能靠另一個AI看截圖猜測任務是否成功,而這個判斷本身就可能出錯,錯誤的獎勵會直接污染訓練);任務的含義在整個訓練過程中必須保持穩定不變(訓練同一個任務數千次,需要每次面對的都是完全相同的世界狀態);最後,破壞性操作必須是安全可逆的(在真實賬戶里亂操作會造成不可挽回的後果)。
Echoverse恰好滿足了這五個條件,而且不需要任何額外改造——每個任務都有獨立的資料庫快照,運行前恢復,運行後對比;應用程式可以在伺服器上並行複製;獎勵來自資料庫的真實變化,而不是截圖判斷;種子數據固定不變;虛擬世界隨時可以銷毀重建。這使得Echoverse可以直接用作強化學習環境,無需修改。
研究團隊在五個世界(銀行、代碼協作、社區論壇、民宿預訂、音樂流媒體)上運行了一輪強化學習訓練,實驗結果是:持有不參與訓練的保留任務(每個世界25個),以資料庫真實結果評分,從監督學習結束後的58.8%提升到了68.0%,超過了單純模仿學習的天花板。
獎勵的設計有一個微妙之處值得單獨說明。在強化學習里,信號越早、越頻繁,學習越高效。但資料庫只有在任務結束時才給出最終結論——整個50步的操作軌跡,只得到一個"成功/失敗"的二元判斷,這使得每一步的功過難以分清。為了解決這個問題,研究團隊引入了一個"逐步獎勵":在每一步操作後,讓一個多模態視覺模型查看操作前後的兩張截圖,判斷這個操作是否真的產生了有意義的效果(頁面狀態變化了、操作建立在前一步的基礎上),還是無效操作(重複點擊、沒有任何響應、毫無意義地滾動頁面、還沒完成就宣告結束)。
這個逐步獎勵是判斷性的(來自一個AI模型),而最終任務獎勵是基於資料庫事實的,兩者加總但最終事實占主導——如果最終任務失敗,那最後一步的逐步獎勵強制歸零;如果任務完成結果是錯的,還會額外施加懲罰。這樣既利用了逐步反饋的學習效率,又確保了不會出現"過程表現漂亮但結果錯誤"的情況被獎勵。
---
**八、主要實驗結果:數字背後的意義**
把所有這些設計放在一起,最終訓練出的9B規模模型(πSFT)在14個評估維度上取得了明顯進展。
基礎模型在14個維度上的平均成功率是36.5%,訓練後的模型達到67.1%,而作為"教師"的GPT-5.4是80.7%。換句話說,一個參數規模遠小於GPT-5.4的模型,在使用Echoverse訓練後,與前者的差距縮短到了13.6個百分點。
按具體領域來看,在銀行操作任務上,訓練後的模型達到了94.6%,甚至超過了GPT-5.4的92.8%;在郵件處理任務上,訓練後模型達到81.1%,也超過了GPT-5.4的74.5%。最難的領域是民宿預訂(EchoStay),這裡需要跨越搜索、篩選、查看房源詳情、檢查日曆可用性、完成支付等多個依賴步驟,平均需要約34次操作才能完成一個任務,成功率從基礎的20.5%提升到37.6%,距離GPT-5.4的50.4%還有一段距離。
能力專項訓練的效果尤為值得關注。日期選擇器專項訓練後,在從未見過的日期控制項類型上,成功率從34%提升到52%——這說明AI學到的不是某種特定控制項的操作方式,而是處理日期選擇這類問題的通用能力。嵌套篩選器專項訓練的遷移效果更加顯著,在未見過的篩選器控制項家族上,成功率從62.8%提升到84.1%。更有趣的是,訓練日期選擇器還順帶提升了篩選器的操作能力,反之亦然——兩種能力之間有正向遷移,而不是互相競爭。
這種能力甚至可以遷移到完全沒有參與訓練的真實網站。在WebVoyager(真實公開網站測試集)上,訓練後的模型成績從50.9%提升到55.6%;在Online-Mind2Web上,從29.5%提升到37.2%。由於訓練數據完全來自合成虛擬環境,與這些真實網站毫無重疊,這個提升純粹是技能遷移的結果。
---
歸根結底,Echoverse做的事情可以用一句話概括:搭建一個會跟著學生一起成長的練習場,讓AI既能從好的示範里學,也能從自己的實際錯誤中學,而且練習的內容從第一天起就是真實世界裡會遇到的真正挑戰。
研究表明,僅靠堆砌大量粗糙的練習場是不夠的,甚至會適得其反;僅靠在同一批練習場裡反覆練習也會很快觸到天花板;真正持續有效的方式,是保持練習場的質量,同時持續擴展練習場的多樣性,並且讓練習場隨著AI的進步不斷發現並修復自身的問題。
對於普通人來說,這項研究的直接意義是:AI助手真正能幫人處理工作中那些繁瑣的登錄後操作——寫報告、查餘額、安排會議、跟進項目進度——可能比我們預期的更快到來。而這一天能夠到來,背後需要的不是更大的模型,而是更好的練習場。
有興趣深入了解技術細節的讀者,可以通過論文編號arXiv:2607.28074查閱完整原文,微軟研究院也在https://aka.ms/echoverse開放了部分環境代碼和評測任務。
---
**Q&A**
Q1:Echoverse和WebArena這類已有的合成環境有什麼區別?
A:WebArena等系統的核心貢獻是手工搭建了可重置、可驗證的合成環境,是非常重要的基礎工作。Echoverse與之的區別主要在三個維度:第一,Echoverse強調環境的"深度",即環境必須支持完整的跨步驟、跨用戶工作流,而不只是渲染出界面外觀;第二,Echoverse引入了"共同進化"機制,每輪AI運行後會自動診斷並修復環境自身的缺陷,而不是把Bug當成AI的失敗來學習;第三,Echoverse用AI智能體流水線自動化了環境和任務的生成與驗證過程,使得規模化成為可能。
Q2:Echoverse的評分為什麼比截圖判斷更可靠?
A:截圖評分存在一個根本缺陷:AI可以聲稱"我已經完成了",並且在截圖上顯示出一個看起來成功的界面,但資料庫里什麼都沒變。Echoverse的評分直接查看資料庫在任務前後的變化差異,寫入類任務需要確認所要求的數據修改確實發生了,讀取類任務的參考答案也是直接從資料庫查詢出來的。這種機制使得AI無法靠"表演完成"來獲得分數,訓練信號因此更可靠。一個小型語言模型僅用於判斷語義等價性,而非對整個操作過程進行主觀評價。
Q3:為什麼強化學習需要Echoverse這樣的專屬環境,而不能直接在真實網站上做?
A:強化學習需要同一個任務被重複執行數千次,每次都從完全相同的狀態出發,而且每次都能得到可靠的獎勵信號。真實網站無法滿足這三個條件:頁面會更新,日期會滾動,網站會限速或封鎖自動訪問,而且沒有後端權限意味著無法知道操作是否真的成功,只能靠另一個AI猜測。一個基於錯誤獎勵信號訓練的模型,學到的是如何欺騙獎勵模型,而不是如何真正完成任務。Echoverse通過獨立資料庫快照實現精確重置,通過並行複製實現高吞吐量,通過資料庫差異比對
實現可靠獎勵,天然滿足了強化學習的所有前提條件。






