這項由騰訊、南洋理工大學、新加坡國立大學及新加坡科技研究局前沿人工智慧研究中心聯合完成的研究,於2026年7月以預印本形式發布,論文編號為arXiv:2607.26754,研究提出了名為StatePlay
的全新遊戲世界模型框架,致力於解決AI生成遊戲畫面時"好看但不能玩"的根本性缺陷。
**遊戲AI的"花瓶困境"**
假設你花了很長時間等待一款完全由AI生成的格鬥遊戲上線,終於在螢幕前坐下來,按下出招鍵,畫面里的角色也跟著動了起來,打鬥場景看起來酷炫無比。但沒多久你就發現,對手的血量早就歸零了,角色卻還站在那裡繼續打你;你的必殺技技能槽明明只剩一半,AI卻讓你成功放出了只有技能槽滿格才能使用的招式。整個遊戲"好看",卻完全不符合任何遊戲規則。
這正是當下AI遊戲世界模型面臨的核心困境。近年來,一批優秀的AI系統已經能夠根據玩家操作實時生成視覺上相當逼真的遊戲畫面,但這些系統骨子裡只是一台"圖像預測機器"——它學會了"打拳時拳頭會碰到對方身體"這樣的視覺規律,卻根本不理解遊戲背後那套由血量、技能槽、計時器構成的規則體系。結果就是,生成出來的遊戲畫面像一部精緻的武打片,卻不像一個真正的遊戲。
來自騰訊與多所頂尖學術機構的研究團隊正是看到了這個問題,決定從根本上重新設計AI遊戲生成系統的工作方式,讓它不僅能"看懂"畫面,還能"理解"規則。
**一、遊戲規則藏在哪裡**
要理解這項研究為什麼重要,先得搞清楚一件事:遊戲規則到底藏在哪裡?
在一款格鬥遊戲中,畫面只是表象。你看到角色揮拳,那是畫面;但角色揮拳之後對方血量減少了多少,這取決於內部的一個數字——血量值。你看到角色發出了炫酷的超級必殺技,那是畫面;但這個必殺技能否被觸發,取決於另一個內部數字——技能槽是否已經充滿。比賽結束時螢幕上出現"YOU LOSE",那是畫面;但觸發這個結局的,是血量值歸零這個內部狀態的變化。
這些隱藏在遊戲幕後的數字,研究團隊把它們叫做"遊戲狀態",具體包括計時器、雙方的血量值以及雙方的技能槽百分比,總共五個核心變量。它們就像遊戲世界的骨架,畫面只是覆蓋在骨架外面的皮肉。過去的AI遊戲模型只學習皮肉,卻忽視了骨架,所以生成出來的遊戲在視覺上看得過去,但一接觸規則就露餡了。
研究團隊意識到,僅憑畫面像素幾乎不可能可靠地反推出這些內部狀態的變化規律。血量條在畫面上只占幾十個像素,稍微有一點畫面質量波動,AI就可能讀錯血量。技能槽是否剛好達到100%這個臨界點,從像素里判斷更是困難重重。因此,要讓AI真正理解遊戲規則,必須直接告訴它這些內部狀態是什麼,並讓它學會預測這些狀態如何隨時間演變。
**二、從零搭建一個"懂規則"的訓練場**
解決了"為什麼",接下來就是"怎麼做"。研究團隊面臨的第一個現實挑戰是:市面上幾乎找不到現成的、同時包含遊戲畫面、玩家操作和內部狀態數據的公開數據集。
為此,研究團隊選擇了經典格鬥遊戲《快打旋風3》作為實驗平台。這款遊戲有清晰的規則體系,狀態變量直觀,非常適合研究遊戲規則與畫面之間的關係。他們通過一個叫做stable-retro的模擬框架,用Python程序控制遊戲運行,像"無人駕駛"一樣讓AI自動打遊戲,同時全程記錄每一幀畫面、每一個玩家操作,以及從模擬器內存中直接讀取的五個狀態變量。每場對戰打到一方被KO為止,然後把整段錄像切成每段5秒、每秒20幀的影片片段。
但光有數據還不夠,數據的質量和分布同樣關鍵。如果AI訓練時接觸的99%都是普通對戰場景,那它就很少有機會學習"技能槽滿了觸發必殺技"或"血量歸零顯示YOU LOSE"這類關鍵時刻的規律。為了解決這個問題,研究團隊設計了一套精心的數據均衡策略,把10000個訓練片段分成五類:玩家勝利結局、玩家失敗結局、必殺技成功釋放、必殺技嘗試但未滿足條件而失敗,以及普通對戰。前四類各占10%,普通對戰占60%。這樣一來,AI就能接受到足夠多的關鍵狀態轉變場景的訓練。
數據集裡還加入了一個有趣的設計:用谷歌旗下的Gemini模型對影片中NPC(電腦控制角色)的戰鬥策略進行自然語言描述,分為主動進攻型、遠程控制型和被動防守型三類,並將這些文字描述也加入訓練數據,讓AI能夠通過文字指令來控制NPC的戰鬥風格。
**三、一個"左右手分工"的全新模型架構**
有了數據,接下來是模型設計。研究團隊在一個已有的影片生成模型基礎上,做了一個關鍵改造——給它額外裝上了一條專門處理遊戲狀態的"神經網路支線"。
整個StatePlay模型就像一個雙手協作的工匠。右手(視覺分支,50億參數規模)負責處理畫面,學習如何生成視覺上逼真的遊戲幀;左手(狀態分支,7.6億參數規模)負責處理數字狀態,學習血量、技能槽、計時器如何隨時間變化。兩隻手各有分工,但又在關鍵環節相互配合。
這個配合機制叫做"聯合注意力模組",可以理解為兩隻手之間的一個資訊傳遞窗口。視覺分支可以通過這個窗口查看狀態分支的資訊——"哦,現在技能槽滿了,那畫面里應該出現必殺技的特效";同樣,狀態分支也可以查看視覺分支的資訊——"畫面里出現了一記重拳,血量應該減少更多"。這種雙向資訊交流,讓兩條支線能夠互相校正,共同保證輸出內容既好看又合規。
這種"專家各司其職,關鍵時刻交流"的架構被稱為混合專家變換器(MoT),相比另一種"把所有資訊塞進同一套網路處理"的方法,在實驗中被證明效果明顯更好。原因也很直觀:畫面資訊是高維度的複雜數據,而血量值只是一個0到100之間的簡單數字,把它們強行塞進同一個處理空間,反而會相互干擾。就像讓一個廚師同時兼顧擺盤的美感和食譜的精確配比,不如讓兩個人分別專注於各自擅長的事情,再在關鍵步驟溝通協調。
在訓練方式上,兩條支線也採用了完全不同的方法。視覺分支用的是"流匹配"技術,這是當前主流圖像和影片生成模型的標準訓練方式,適合處理高維度、充滿細節的畫面數據。狀態分支則選擇了更直接的回歸損失函數,本質上就是讓模型預測出一個數字,然後直接跟真實數字比較差距,差多少就懲罰多少。研究團隊解釋,這是因為遊戲狀態變量遵循明確的規則:血量被打了就減少,技能槽使用必殺技後就清零,這些有規律可循的變化用直接的數值預測來學習,比用影片生成那套複雜的擴散框架要高效得多。
**四、實驗說話:數字背後的真實差距**
研究團隊設計了一套相當全面的評測體系,從四個維度來衡量生成的遊戲影片質量。
第一個維度是畫面質量,用兩個指標衡量:一個叫SSIM,測量生成畫面和真實遊戲畫面在結構上的相似程度;另一個叫LPIPS,從更接近人眼感知的角度衡量畫面的視覺相似性,數值越低越好。第二個維度是動作可控性,也就是玩家按了什麼鍵,AI生成的畫面里角色就做了什麼動作,包括移動準確率和攻擊準確率兩個子指標。第三個維度是狀態預測精度,衡量AI預測出來的血量、技能槽等數值跟真實數值差多少。第四個維度是機制忠實度
,用Gemini和GPT-5.5兩個大模型當"裁判",看生成影片裡的遊戲事件是否符合規則,比如必殺技觸發對不對、勝負判定準不准。
所有指標都在100個測試片段上評測,這些片段均勻覆蓋了各種機制場景。
在零樣本測試中,研究團隊直接拿了幾款當前最先進的遊戲世界模型來做橫向比較,包括Matrix-Game 3.0、LingBot-World、LingBot-World 2.0、HY-World 1.5和ReactiveGWM。結果顯示,這些模型在機制忠實度上幾乎全軍覆沒,最好的ReactiveGWM也只達到48%左右的正確率,很多時候就是在隨機猜測遊戲結果的水平。這充分說明,當前的遊戲AI在視覺上可以做到像模像樣,但面對規則約束時基本束手無策。
在針對同一數據集進行微調後,StatePlay的狀態預測對齊分數達到了0.947(滿分為1),意味著它對血量、技能槽等變量的預測平均誤差不超過6%。更重要的是,機制忠實度在Gemini評估下達到82.3%,在GPT-5.5評估下達到78.3%,相比最強基線ReactiveGWM的63.7%,提升了超過18個百分點。與此同時,StatePlay在畫面質量和動作可控性上並沒有出現明顯下滑,SSIM分數0.378和LPIPS分數0.424都處於同級別模型中的最優水平。
消融實驗進一步驗證了架構設計的每個關鍵選擇。採用MoT雙支線結構比共享單一網路的方案在機制忠實度上高出17.6個百分點;用回歸損失訓練狀態支線比用流匹配方法在機制忠實度上高出21.6個百分點,在狀態預測精度上高出12.1個百分點。還有一個細節:訓練時對狀態序列加入噪聲(而非簡單地把初始狀態複製到所有時間步)對模型學習時間演變規律也有幫助,機制忠實度從78.3%提升到82.3%。
**五、眼見為實:三個場景里的勝負分明**
除了數字,研究團隊還展示了具體案例,讓效果差距一目了然。
在必殺技觸發場景里,給定同樣的操作序列和初始狀態,ReactiveGWM在技能槽已滿的情況下依然沒能生成出必殺技的視覺效果,而且兩個角色在畫面里糊在了一起,變成了一團分不清楚的模糊影像。StatePlay則準確地在技能槽滿格時觸發了必殺技的炫酷特效,並在必殺技使用後正確地把技能槽清零——這正是遊戲規則的要求。
在NPC血量歸零場景里,ReactiveGWM生成的畫面里,對手明明血量早就見底,卻依然站著打人,完全無視了遊戲應該結束的規則。StatePlay則在正確的時機生成了"YOU WIN"的勝利畫面。
在玩家血量歸零的場景里,情況更有意思:ReactiveGWM不僅沒有生成"YOU LOSE"的失敗畫面,甚至生成了一個顛倒的場景——玩家在慶祝勝利,NPC躺在地上,完全搞反了勝負。StatePlay則穩定地生成了符合規則的失敗結局畫面。
這三個案例清晰地說明,沒有狀態建模的AI會對遊戲規則產生嚴重的理解偏差,有時甚至給出完全相反的輸出。
**研究的邊界與下一步**
研究團隊也坦誠地指出了當前工作的局限性。StatePlay雖然能準確預測內部狀態,但生成的畫面里,血條和技能槽的視覺表現有時仍然與預測的數值不完全一致——骨架對了,皮肉還在追趕。當多個遊戲事件同時發生,比如放出必殺技的同時對方血量歸零觸發遊戲結束,畫面質量也會有所下降,處理同時發生的複雜事件仍然是個挑戰。
更根本的限制是數據集的範圍。目前整個研究只在《快打旋風3》這一款格鬥遊戲上驗證過,其他類型的遊戲,比如射擊遊戲裡的彈藥數量、賽車遊戲裡的氮氣加速、角色扮演遊戲裡的魔法值,都有各自不同的狀態體系和規則邏輯。把StatePlay推廣到更多遊戲類型,需要構建更多包含狀態標註的遊戲數據集,這也是研究團隊希望未來社區能共同推進的方向。
說到底,StatePlay這項研究的核心貢獻在於指出了一件聽起來簡單但此前被忽視的事情:一個真正"能玩"的遊戲AI,必須同時理解畫面和規則,而規則本質上藏在那些看不見的內部數字里。把這些數字顯式地納入模型的學習和生成過程,是讓AI遊戲從"視覺演示"升級為"真實模擬"的關鍵一步。對普通玩家來說,這意味著未來由AI生成的遊戲世界,不僅會看起來真實,也會玩起來真實。對遊戲開發者來說,這套框架提供了一個可以直接擴展到不同遊戲類型的技術路線圖。
有興趣深入研究技術細節的讀者,可以通過論文編號arXiv:2607.26754查閱完整論文,項目頁面也提供了更多可視化演示材料。
Q&A
Q1:StatePlay和普通遊戲AI影片生成模型有什麼本質區別?
A:普通遊戲AI只學習畫面之間的視覺變化規律,不知道血量、技能槽這些內部數字的存在。StatePlay在生成畫面的同時,額外設置了一條專門預測這些內部狀態數字的支線網路,讓兩條支線互相參考、互相約束,從而確保生成的畫面不違反遊戲規則。核心區別就是:一個只學"看起來像什麼",另一個同時學"規則上應該發生什麼"。
Q2:StatePlay的訓練數據是怎麼來的?
A:研究團隊用程序自動控制《快打旋風3》遊戲運行,記錄每一幀畫面、操作指令,同時從模擬器內存里直接讀取血量、技能槽、計時器等五個狀態數值。共收集了10000個5秒影片片段,並刻意保證其中40%的片段包含必殺技觸發、勝負判定等關鍵規則場景,避免訓練數據過於集中在普通對戰。
Q3:StatePlay生成的遊戲畫面質量會不會因為加了狀態預測而變差?
A:實驗結果顯示並沒有明顯變差。StatePlay的畫面質量指標(SSIM為0.378,LPIPS為0.424)在所有同級別參與對比的模型中處於最優水平,動作可控性也基本持平。加入狀態預測支線反而通過資訊互補略微提升了畫面的一致性,並大幅提升了機制忠實度。






