宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

WorldMind:當遊戲裡的Boss終於學會「看懂局勢」再出手

2026年09月02日 首頁 » 熱門科技

你有沒有玩過這樣一款遊戲,Boss明明離你十萬八千里,卻突然放了個近戰大招,或者你剛躲到牆角喘口氣,它又莫名其妙地放了個遠程技能,仿佛完全不知道你在哪裡?

這不是你運氣不好,這是當前所有遊戲世界模型WorldMind當遊戲裡的Boss終於學會看懂局勢再出手的一個共同軟肋。

2024到2025年這兩年,遊戲世界模型這個方向突然火了起來。所謂遊戲世界模型,簡單說就是用AI直接"生成"遊戲畫面,你按下按鍵,AI實時畫出下一幀該有的樣子,不再依賴傳統的遊戲引擎渲染。這類模型在畫面流暢度和操控響應上確實取得了讓人驚訝的進展,Genie、Oasis、Matrix-Game這些名字如果你關注這個領域應該不陌生。

但一個問題一直被懸置在那裡:這些模型畫得出玩家的動作,卻搞不定NPC(非玩家角色,也就是遊戲裡那些Boss、怪物、路人)該怎麼"反應"。

問題出在哪?兩條死路

現有方案基本分兩派。

第一派叫"隱式生成WorldMind當遊戲裡的Boss終於學會看懂局勢再出手",說白了就是讓AI在生成畫面的同時,順帶把NPC的行為也"編"出來。這種做法的問題在於,NPC的行為完全是從訓練數據里學到的視覺模式里"長"出來的,AI並不真正理解當前打鬥的距離、角度、Boss技能冷卻情況,它只是在模仿"看起來差不多"的畫面。這就是文章開頭那個近戰大招亂放的場景,AI壓根不知道玩家在哪,它只是覺得"這裡應該出現一個技能動作"。

第二派叫"顯式外部控制WorldMind當遊戲裡的Boss終於學會看懂局勢再出手",也就是把NPC該做什麼這件事,甩給一個外部信號去指定,模型只負責根據這個信號畫畫面。這看起來更可控,但本質上是把決策權徹底移出了世界模型本身,模型自己依然不理解遊戲狀態,只是被動執行外部下發的指令。

這兩條路都繞開了一個核心矛盾:一個稱職的遊戲世界模型,理應同時干三件事,理解當前發生了什麼,判斷NPC接下來該做什麼,把這個決定畫出來。可現在的模型要麼把這三件事混在一起囫圇吞棗,要麼乾脆放棄中間那一步。

這就好比讓一個廚師同時聞著味道、想著菜譜、顛著勺炒菜,還要求他腦子裡同時想清楚"這道菜現在火候到哪了、該加鹽還是該出鍋",三件事擠在一個腦子裡同時處理,效果可想而知會打折扣。如果不把"判斷火候"這件事單獨拎出來當一個清晰的決策環節,廚師很容易憑手感亂來,做出的菜時好時壞,正如現在的NPC時而合理時而離譜。

Tencent和新加坡國立大學的研究團隊想明白了這一點,他們提出的WorldMindWorldMind當遊戲裡的Boss終於學會看懂局勢再出手,核心思路就一句話:把"理解狀態"和"決定動作"這兩件事,從"畫面生成"里徹底剝離出來,單獨做成兩個獨立環節,再用一個閉環把它們串起來。

四層架構:讓每個環節各司其職

WorldMind把整個交互過程拆成四層,理解層、決策層、控制層、生成層。

理解層(Understanding Layer)*:負責從生成的畫面和歷史動作記錄里,提煉出一個"精簡狀態",比如Boss和玩家的距離、朝向、上一個技能是什麼、當前哪些技能還在冷卻。

這一層其實是兩條支線並行工作的。一條叫"技能分支",它不需要看畫面,純靠記錄Boss之前放過什麼技能、什麼時候放的,就能算出每個技能還剩多久冷卻完,這條線完全是確定性的計算,不依賴AI猜測。另一條叫"幾何分支",專門負責搞清楚Boss和玩家的空間關係,比如兩者相距多遠、面朝哪個方向。這條線沒法靠歷史記錄推算,只能從最近生成的幾幀畫面里,用一個卷積網路加GRUWorldMind當遊戲裡的Boss終於學會看懂局勢再出手(一種處理序列數據的循環神經網路結構)去識別。

這裡有個細節值得琢磨。研究團隊專門做了實驗對比,如果用現成的、沒有針對這個任務微調過的通用視覺模型(比如DINOv2WorldMind當遊戲裡的Boss終於學會看懂局勢再出手或者VideoMAEWorldMind當遊戲裡的Boss終於學會看懂局勢再出手,都是目前視覺領域很有名的預訓練模型)去做這件事,效果會差多少?答案是差得不輕。以Isaac這款遊戲為例,距離預測的誤差從他們自己訓練的模型的8.187,直接飆到DINOv2的31.17,差了將近4倍。這說明"看懂遊戲裡的距離和角度"這件事,並不是隨便拿個通用視覺模型糊弄一下就行的,它需要針對這個具體任務專門訓練。

決策層(Decision Layer)*:拿到理解層給出的精簡狀態之後,負責推理Boss接下來該幹什麼,這一層由一個通用語言模型(Gemma-4-E2B-itWorldMind當遊戲裡的Boss終於學會看懂局勢再出手)來承擔。

有意思的是,研究團隊特意沒有用他們收集的數據集去微調這個語言模型。為什麼?因為一旦用具體的Boss戰錄像去微調,語言模型很可能只是記住了"這種情況下數據集裡的Boss通常這麼做",而不是真正理解"這個技能的機制決定了它在這種局面下更划算"。他們更想讓語言模型靠純粹的推理能力去做判斷,而不是死記硬背。

為了驗證這一點是不是真的做到了,團隊設計了一個挺巧妙的實驗。他們把技能的名字全部換成中性代號(比如把"猛擊"改成"技能A"),然後測試兩種情況:如果把技能的機制說明整個刪掉,模型的選擇會不會變;如果把兩個技能的機制說明互相調換,模型是不是會跟著說明走,而不是死守著原來的代號。結果顯示,刪掉說明後,模型的首選技能改變率在52%到90%之間,調換說明後改變率高達80%以上,並且模型更傾向於"跟著說明走"而不是"守著原代號不放"。

這個結果說明什麼?說明模型確實是在理解"這個技能能幹什麼",而不是單純記住"看到這個名字就選它"。這就好比你去一家新開的餐廳,菜單上把"紅燒肉"改名叫"招牌菜一號",你點菜的依據應該是菜品描述本身,而不是這個陌生的編號。如果你還是習慣性地點"看起來眼熟的編號",那說明你根本沒看懂菜單,只是在憑記憶瞎點。WorldMind的決策層顯然是"看懂了菜單"的那一種。

控制層(Control Layer)*:把決策層給出的完整動作,比如"放一個突進技能,同時向右移動",翻譯成生成層每一幀都能理解的、按時間對齊的提示詞序列。

生成層(Generation Layer)*:真正負責把這些提示詞變成畫面的影片擴散模型WorldMind當遊戲裡的Boss終於學會看懂局勢再出手(一種通過逐步去噪生成圖像或影片的AI生成技術),團隊用的是Wan 2.2 TI2V-5BWorldMind當遊戲裡的Boss終於學會看懂局勢再出手模型,並且做了蒸餾加速,讓它能以大約20幀每秒的速度實時運行。

生成完的畫面會重新流回理解層,形成一個閉環,Boss下一步該怎麼做,永遠建立在它剛剛"看到"自己上一步動作造成了什麼後果的基礎上。

這個閉環設計其實很關鍵。如果沒有這個反饋迴路,Boss的決策就變成了開環的,也就是提前想好一套劇本按部就班地演,完全不管玩家中途做了什麼反應。這就像你跟人下棋,如果你不看對方每一步怎麼走,只是提前把自己接下來十步全部想好死板地執行,那對手隨便一個變招就能讓你滿盤皆輸。WorldMind的做法是每走一步就重新觀察一次棋盤,再決定下一步,這才是真正意義上的"對局",而不是"演戲"。

數據從哪來:BOSS-140K

要訓練和驗證這麼一套系統,光有遊戲畫面和玩家按鍵記錄是遠遠不夠的,你還需要知道遊戲內部那些"看不見"的狀態,比如Boss當前血量、技能冷卻、精確坐標。

於是團隊搭建了一個叫BOSS-140K(Boss-fight Observations with States and Skills)*的數據集,涵蓋三款遊戲(其中一款代號Game A,另外兩款是知名獨立遊戲《空洞騎士》和《以撒的結合》),一共14個Boss,超過14萬個片段,總時長超過200小時。

這個數據集最特別的地方在於,它不是靠人工一遍遍打遊戲錄出來的,而是用了一個"狀態感知型遊戲智能體"去自動打遊戲,這個智能體能讀取遊戲引擎內部狀態,並針對每款遊戲的具體機制調整打法,從而在自動運行的情況下也能觸發豐富多樣的戰鬥場景。這解決了一個很實際的問題,如果靠人工錄製,玩家很可能下意識地重複幾種固定打法,導致數據集裡的場景高度雷同,覆蓋不了各種邊緣情況。這就好比你想統計一個城市所有紅綠燈路口的車流規律,如果只派一個司機開車繞圈錄像,他大概率只會走自己熟悉的幾條路,很多冷門路口永遠不會被記錄到。用一個能主動探索、覆蓋各種情形的智能體去跑,才能拿到真正全面的數據。

結果好不好:數據說話

理解層的狀態重建準確度如何?團隊用了幾個指標,距離誤差、角度誤差、以及按區間分類的準確率。結果顯示在三款遊戲裡,距離和角度的重建誤差都保持在較低水平,比如《空洞騎士》里角度誤差只有2.96度,分類準確率高達99.6%。

決策層的機制理解能力前面已經提到,刪除或調換技能說明後,模型的選擇會隨之明顯變化,證明它是真的在"讀懂"技能機制,而不是死記硬背技能名字。

最關鍵的是整個閉環系統跑起來之後到底行不行。團隊請了兩個大語言模型裁判(GPT-5.5和Gemini-3.1-pro)對WorldMind和兩種基線方案(隱式生成、外部控制)做了一分鐘遊戲片段的兩兩對比評測。結果顯示,WorldMind在大約70%的成對比較中被裁判認為更勝一籌,動作合理性評分和整體連貫性評分也都排在第一位。具體數字上,GPT-5.5給WorldMind打的動作有效率是74.0%,明顯高於兩個基線的63.6%,序列連貫性評分(滿分5分)WorldMind拿到3.85分,基線只有3.2分出頭。

方法 GPT-5.5勝率 動作有效率 序列連貫性

隱式生成(無NPC控制) 71.5% 63.6% 3.28

外部控制(有NPC控制) 70.9% 63.6% 3.22

WorldMind N/A(作為對照基準) 74.0% 3.85

跨遊戲泛化能力上,團隊還在一個公開的WildWorld數據集上做了測試,發現決策層能部分遷移到新遊戲上,依然保持對狀態變化的敏感度,但狀態重建這部分(也就是理解層的幾何分支)需要針對新遊戲重新適配訓練,沒法直接照搬。這也提示我們,讓AI理解"空間關係"這件事,很大程度上還是依賴於對特定視覺場景的學習,還沒到真正意義上"舉一反三"的程度。

寫在後面

讀這篇論文的時候,最讓我停下來想了想的地方,是那個"故意不微調語言模型"的決定。

大部分做AI應用的思路是有什麼數據就往上懟,微調總歸能讓效果看起來更好看。但WorldMind的團隊反其道而行,寧願犧牲一部分"在這個具體數據集上表現得更像"的效果,也要保住語言模型靠純推理做判斷的能力。這背後其實是一個更深的取捨,你到底是想要一個"記住了這批Boss怎麼打"的系統,還是一個"理解了打鬥邏輯,遇到沒見過的Boss也能大概推理出該怎麼應對"的系統。前者短期分數好看,後者才有走向真正通用的可能。

另一個讓我意外的細節是,團隊專門測試了"給決策層多加一張畫面"會不會有幫助,結果發現在兩款遊戲上反而是負增長,加了畫面之後機制遵循率下降了6到8個百分點。這說明那個被壓縮出來的"精簡狀態"文本本身已經把該有的資訊都提煉乾淨了,多塞進去的圖像資訊反而成了噪音干擾。這多少推翻了一個直覺,很多人會下意識覺得"資訊越多越好",但這個實驗提醒我們,有時候把資訊精煉到剛剛好,比什麼都往裡塞更管用。

如果Boss真的能理解玩家在做什麼,理解自己技能的機制,那它和玩家之間的關係還只是"程序和用戶"嗎,還是已經悄悄變成了某種更接近博弈的東西?

Q&A

Q1:WorldMind是什麼?

A:WorldMind是由Tencent和新加坡國立大學團隊提出的遊戲世界模型框架,它把NPC(非玩家角色)的行為決策拆分成理解遊戲狀態、規劃下一步動作、轉換控制信號、生成畫面四個獨立環節,讓Boss等角色能根據實時戰況做出有針對性的反應,而不是靠AI瞎猜或外部硬性指定。

Q2:WorldMind和之前的遊戲世界模型有什麼不同?

A:之前的模型要麼讓NPC行為完全隱藏在畫面生成過程里,模型自己也不清楚NPC為什麼這麼做;要麼把NPC動作交給外部信號強制指定。WorldMind則專門設計了一個"理解層"和"決策層",讓NPC的每個動作都建立在對當前距離、角度、技能冷卻等真實狀態的推理之上,實驗顯示這種做法在約70%的對比測試中被裁判認為表現更好。

Q3:BOSS-140K數據集是怎麼收集的?

A:BOSS-140K涵蓋三款遊戲、14個Boss、超過200小時的錄像,由一個能讀取遊戲內部狀態並自動調整打法的智能體全自動收集完成,而不是靠人工反覆錄製,這樣能覆蓋更多樣化的戰鬥場景,避免數據集裡出現大量重複雷同的打法。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新