這項由中國科學技術大學與北京MetaStone Technology聯合開展的研究,以預印本形式發布於2026年7月30日,論文編號為arXiv:2607.27816v1,有興趣深入了解的讀者可以通過該編號查詢完整論文。
你有沒有和某個AI角色聊過天,感覺它非常懂你,讓你欲罷不能?或者相反,感覺它的回答永遠差那麼一口氣,說不出哪裡不對勁?這種"懂不懂你"的感覺,長久以來一直是AI角色扮演領域最難量化的東西。這項研究,正是為了解決這個難題而生的。
研究團隊發現,現有的評測方式存在一個根本性的缺陷,就像讓廚師在別人已經炒了一半的鍋里繼續翻炒,最後評的其實不是這位廚師的手藝,而是前一位廚師打下的底子好不好。於是他們設計了一套全新的評測框架,取名PALATE(Person-Aligned LLM-Simulated-User Assessment with Tailored Evaluation,即基於個人化大語言模型用戶模擬的定製評測體系)。這套框架的核心思路是:讓AI角色從頭開始和一個"真實模擬用戶"聊天,而不是繼續別人寫好的劇本,並且用這個用戶自己的偏好標準來判斷聊得好不好。
---
一、評測AI角色扮演,為什麼那麼難?
要理解這項研究解決了什麼問題,先要明白原來的評測方式是怎麼運作的。
現有的主流評測方式可以打個比方:有一道已經寫好前半段的故事,讓不同的AI續寫後半段,然後請裁判給續寫部分評分。這個方式看起來公平——每個AI拿到的前半段都一樣,大家起跑線相同。然而問題恰恰出在"前半段"上。
研究團隊做了一個受控實驗:他們找來5段真實的人機對話,每段超過20輪,然後人為地把AI角色說的那一半重寫成兩個版本:一個是"高質量版",語言細膩自然、緊貼劇情、個性鮮明;另一個是"降級版",保留所有情節事實,但語言變得平淡重複、缺乏細節。接著,讓4個候選AI在不同深度的節點上續寫這兩個版本,再用同一套標準評分。
結果非常說明問題。相比原始版本,讀了高質量前半段之後,AI的續寫平均分會高出約0.21分(滿分5分);而讀了降級版前半段,AI的續寫平均分會低約0.13分。換句話說,同一個AI,僅僅因為前半段質量不同,分數差距可以超過0.3分。更有趣的是,Claude Sonnet 4.6在高質量前半段下的得分超過了Gemini 2.5 Pro,但在降級版前半段下的得分反而不如Gemini 2.5 Pro——兩個AI的"名次"因為前半段的好壞而發生了顛倒。
研究團隊還進一步分析了這種偏差的來源。他們把續寫的內容固定不變,只是把給裁判看的"前半段"換掉(一次展示高質量版,一次展示降級版),結果發現:裁判自己看到的前半段質量也會影響評分,但影響方向和大小都不同於"前半段實際影響了AI續寫質量"這條路徑。本質上,更大的分數差異來自於前半段真實地改變了AI的輸出內容,而不只是裁判被"視覺效果"帶偏了。
由此可以得出一個核心結論:現有的"續寫式"評測,測量的其實不是AI的角色扮演能力本身,而是"在特定前半段條件下的角色扮演能力"。這兩者是有本質區別的。就像你無法通過觀察一個廚師在別人炒了一半的菜里加最後幾下調料,來判斷他的廚藝高低。
---
二、每個用戶都是不同的"食客"
第二個問題同樣根本:誰來評判"好不好吃"?
角色扮演的核心價值在於用戶體驗,而人與人之間的偏好差異極大。一個喜歡慢熱劇情、逐漸建立情感聯結的用戶,會覺得緩慢推進的對話充滿魅力;而一個喜歡高張力、快節奏衝突的用戶,則會覺得同樣的對話拖沓無聊。如果用一把統一的尺子衡量所有人的體驗,就好像用同一套評分標準去評价川菜和粵菜的廚師——你的標準本身就已經偏向了某一類口味。
現有的評測框架大多採用通用評分維度,比如"角色一致性"、"情節連貫性"等,這些維度對所有用戶一視同仁。研究團隊指出,這種做法忽視了用戶個體差異,無法真實反映具體某個用戶的滿意度。
PALATE的解決思路是:不僅要讓AI從頭開始聊,還要用這個用戶自己的偏好標準來評分。這兩個問題——"誰來聊"和"怎麼評"——被設計成一個統一的體系,共同指向同一個人的真實體驗。
---
三、PALATE怎麼運作:給每位"食客"配一個專屬裁判
整個PALATE框架分為四個步驟,像是一套精心設計的廚藝大賽規程。
第一步是訓練"用戶模擬器"。研究團隊建立了一個標註平台,招募了5位志願者,讓他們自由選擇角色,與一個AI進行真實的多輪對話,同時對每一輪AI的回覆打滿意度分數(1到5分)。每位用戶大約進行了1000輪對話。這些數據被用來訓練專屬於每個人的"用戶模擬器"——一個能夠模仿這個人說話風格、互動習慣、甚至退出對話時機的AI模型。
訓練方式是在一個名為Qwen3.5-35B-A3B Instruct的基礎模型上,為每位用戶單獨微調一套輕量級適配器(即LoRA,可以理解為給同一台鋼琴換上不同觸鍵風格的調整裝置),而不是從頭訓練一個全新模型。每個用戶的模擬器只會"記住"這個人的聊天方式,不會被植入任何手寫的用戶描述或人口學標籤——它的所有個性都來自真實對話數據本身。
為了驗證這些模擬器是否真的像真人,研究團隊設計了一個"圖靈測試"式的檢驗:把真實用戶寫的下一句話和模擬器生成的下一句話並排放在一起,讓裁判來猜哪個是真人寫的。結果表明,純粹提示通用大模型來"扮演用戶"時,裁判幾乎每次都能一眼看出哪個是AI生成的(愚弄率
接近0);而用了個人化LoRA微調
之後,裁判猜對率接近50%——也就是說,模擬器生成的內容和真人寫的內容已經難以區分。另一項"身份一致性"測試也顯示,個人化微調後的模擬器得分從約56分(通用大模型)提升到了約78分(滿分100)。
第二步是"自由多輪角色扮演"。研究團隊事先凍結了10張角色卡(包括8張原創角色和2張知名IP角色,如芙寧娜和蝙蝠俠),這些角色卡在任何候選AI被測試之前就已經確定,不會因為測試結果而更改。每個用戶模擬器與每個候選AI在每張角色卡上自由對話,每個組合獨立進行兩輪,共產生5×10×16×2=1600條對話軌跡。對話從角色卡規定的開場白開始,沒有任何外部腳本控制劇情走向——完全由用戶模擬器和候選AI共同"即興創作",直到模擬器輸出退出信號或達到預設的深度上限為止。
第三步是自動構建"個人化評分標準"。針對每位用戶,系統會從他們的訓練對話中抽取50個樣本(按滿意度分層抽取,確保高低分樣本都有),連同完整的評分分布,餵給一個元提示詞(meta-prompt),讓它歸納出這個用戶的個性化體驗評估標準。這套標準會自動識別出這個用戶最在意的4個"體驗驅動因素",比如U1用戶最在意"具體情節推進"和"角色主動性",而U4用戶最在意"動作/事實掌控感"和"隱含的潛台詞"。
這套評分標準還會專門分析用戶"下一句話"的語義——當用戶滿意時,他們傾向於繼續順著劇情深入;當不滿意時,他們傾向於糾正、重定向或冷卻。這些語言信號都被提煉成規則,成為評分的依據之一。標準一旦構建完成就被凍結,不會在正式評測時再看原始數據。
第四步是"三軌道評分"。每條對話軌跡會同時接受三種維度的評分:個人化體驗分(用每個用戶專屬的標準評分)、通用單輪質量分(用12個共享維度評估每一輪AI的回覆質量)、以及整體會話分(用11個共享維度評估整條對話的長程表現)。最終匯總成三個指標:U-Score(個人化體驗得分,對5位用戶等權平均)、G-Score(通用質量得分,對單輪和會話質量等權平均)以及Overall(三軌道等權匯總,僅作參考用)。
---
四、個人化評分標準,真的比通用標準更准嗎?
在正式大評測之前,研究團隊專門驗證了個人化評分標準的有效性。
驗證方式是這樣的:在每位用戶的"測試集"對話中,對同一個用戶在同一場會話里的不同輪次進行配對——如果A輪的人類滿意度評分高於B輪,那麼好的評分標準應該也能正確判斷A輪比B輪好。這種"同會話內配對比較"的方式排除了不同角色、不同對話階段帶來的基準差異,讓比較更加公平。
結果顯示,個人化評分標準(配合用戶下一句話作為證據)的宏觀平均準確率為0.613,而通用標準的準確率為0.480(不含下一句話)或0.507(含下一句話),基準對照組(參照MiniMax公開的評分維度構建的標準)為0.467。個人化標準對5位用戶中的每一位都有正向提升,說明用戶專屬規則確實捕捉到了通用標準之外的有效信號。值得注意的是,U2用戶的情況略有不同——他的個人化標準不含下一句話時反而不如通用標準,但加入下一句話後就反超了,說明對某些用戶來說,行為反應是更有力的滿意度證據。
---
五、16個候選AI大比拼:沒有萬能冠軍
這套框架在16個候選AI上進行了完整評測,候選名單覆蓋了近期主流的通用大模型和專屬角色扮演模型,包括GPT-5.4/5.1、Claude Opus 4.8/Sonnet 4.6、DeepSeek
V4 Pro/Flash/V3.2、Gemini 2.5 Pro/3.5 Flash、Qwen3-Max、Qwen3.5-35B-A3B Instruct、Seed 2 Mini、Grok
4.3、GLM-5.1、MiniMax M2-her以及CoSER-Llama-3.1-70B。評測結果揭示了幾個非常值得關注的規律。
首先,三個軌道的冠軍並不一致。GPT-5.4在通用單輪質量(G-Score)上領先,其最突出的優勢在於情節連貫性、角色知識準確性、角色行為一致性以及指令跟隨能力;但在整體會話質量(Session)上,Claude Sonnet 4.6卻後來居上,它在情感發展、關係發展、節奏把控和長程記憶上表現最佳;而在個人化體驗(U-Score)上,DeepSeek V4 Pro的綜合表現更為突出。這三個維度衡量的是不同方向的能力,正如一位廚師可能在刀工上無懈可擊,另一位在火候控制上獨樹一幟,第三位在整桌菜的搭配節奏上最讓食客滿意——這三種能力並不是同一件事。
其次,沒有任何一個AI贏得所有用戶的青睞。U1和U2用戶最偏愛Qwen3-Max;U3和U5用戶最偏愛Claude Opus 4.8;而U4用戶則最偏愛Claude Sonnet 4.6。Qwen3-Max在通用單輪質量和會話質量兩個共享軌道上都不是第一,但卻是U1和U2體驗最好的AI——這說明"用戶滿意"和"客觀質量高"是兩件不完全重疊的事。
第三,專門針對角色扮演做過優化的模型,並沒有自動贏得優勢。MiniMax M2-her和CoSER-Llama-3.1-70B都有專門的角色扮演訓練或評測背景,但在三個軌道上的表現都處於中下游。相比之下,開源的GLM-5.1在三個軌道上都保持了均衡的高水準,躋身領先梯隊。這說明,面向多種用戶和多種角色的真實交互表現,不能簡單地通過專項訓練來保證。
通用單輪質量的細分維度也揭示了一些有趣的差異:GPT-5.4在連貫性、角色知識和行為一致性上領先;DeepSeek V4 Pro在詞彙豐富度、情節推進和互動吸引力上領先;而Qwen3-Max則以最高的流暢度分數獨占鰲頭。這說明不同模型通過不同的"手藝組合"達到了接近的總體得分。
整體會話質量的細分同樣精彩:Claude Sonnet 4.6在情感發展、關係發展、節奏適配、記憶保持和適應恢復能力上均為最強;GPT-5.4則在角色穩定性、動機一致性和跨輪邏輯一致性上最為穩健;DeepSeek V4 Pro的情節推進和結構多樣性在會話層面領先——這也與它在單輪層面的特點一脈相承。
重複穩定性方面,每個模型的兩輪獨立測試之間,排名的Spearman相關係數最低也在0.959以上,說明評測結果高度可重複。研究團隊還用Claude Opus 4.8和DeepSeek V4 Pro重新評判了一個凍結的子集,發現在個人化體驗和通用質量兩個軌道上,不同評判模型之間的相關係數均超過0.84,主要差距較大的結論是穩健的。會話軌道和頭部模型間的細微差距對裁判更敏感,研究團隊也坦誠地指出了這一點。
---
六、這套系統的原材料:角色卡和真實對話數據
支撐整個評測框架的"原材料"同樣值得詳細介紹,因為它們的質量直接決定了評測的可靠性。
角色卡庫包含300張平行中英雙語結構化角色卡,分為240張原創角色和60張知名IP錨點角色。原創角色從大型公開角色扮演社區中提取了高參與度角色的抽象結構——包括主題、關係張力和互動鉤子——然後用全新的名字、背景和文字重新創作,不包含任何社區原始文本。每張卡片包含角色介紹、人物設定、性格、說話風格、好惡、背景、當前場景、示例對話和互動指導等欄位,中英文並行。所有卡片都經過人工審查,排除了侵害用戶自主性、場景矛盾、殘留編輯指令或主要測試拒絕行為的設計。
正式評測用的10張凍結面板在所有候選AI測試開始之前就已選定,遵循嚴格約束:8張原創、2張IP;5女5男;10種不同原型;雙語欄位完整;開場白自洽;保留用戶主動性。這10張角色覆蓋了動漫IP(芙寧娜)、劇情RPG(蝙蝠俠)、科幻(Sloane Whitfield)、對立張力(Diane Foster)、日常生活(Joan Whitaker)、浪漫劇情(Helena Draycott)、導師助手(Marcus Doyle)、夥伴型(Shadowstep)、神秘奇幻(Mateo Duarte)以及喜劇(Finn Callahan)等多種類型。
人類數據方面,5位志願者的對話全部在同一個AI平台(DeepSeek V4 Flash作為角色扮演引擎)上收集,總計5133輪用戶發言。每位用戶的數據按完整會話切分為訓練集和測試集,訓練集用於訓練模擬器和構建個人化評分標準,測試集只用於最終驗證,測試集的滿意度標籤在整個評測過程中從未被用於構建或評分。
---
七、PALATE告訴了我們什麼,又還沒有告訴我們什麼?
說到底,這項研究的價值不在於給出一張"誰最強"的簡單榜單,而在於展示了一種更真實的評測思路:角色扮演AI的質量,不是一個獨立於用戶的客觀屬性,而是在特定用戶與特定AI的交互過程中動態產生的。
從實際應用角度看,這意味著"哪個AI最適合你"這個問題沒有統一答案。一個偏愛快節奏、高控制感對話的用戶(如U4),和一個偏愛慢熱、注重情感積累的用戶(如U3),在同一組AI面前會得出截然不同的滿意度排序。這對AI角色扮演產品的設計有直接啟示:不能只追求通用意義上的"高質量",還需要考慮不同用戶群體的個性化適配。
這項研究也坦誠地說明了自己的局限性。目前只有5位經過深度標註的用戶參與,收集長時間的多輪對話並標註每一輪滿意度是非常昂貴的工作,擴展用戶規模是下一步的方向。此外,雖然用戶模擬器和個人化評分標準都在留出的測試集上得到了驗證,但尚未建立一個橫跨所有16個候選AI的完整人類排名參照——這意味著主評測表格中的對比結構已經被驗證,但每個候選AI的具體得分與真實人類滿意度之間的絕對對應關係還需要進一步校準。
此外,所有對話數據都來自同一個角色扮演平台(DeepSeek V4 Flash),模擬器學到的用戶行為模式是在這個平台上形成的,不一定完全覆蓋用戶面對其他風格候選AI時的所有行為可能性。研究團隊也明確指出了這一點。
---
歸根結底,這項研究做的事情,是把"評測AI角色扮演"這件事從"讓AI續寫別人的劇本"變成了"讓AI和真實模擬用戶一起從零開始寫自己的劇本",並且用這個用戶自己的口味標準來評判成敗。就像一場真正的廚藝大賽:每位廚師從生鮮食材開始,做出一桌完整的菜,然後由特定口味的食客來評分——而不是讓所有廚師在別人炒了一半的鍋里加最後幾勺調料,再讓一個口味未知的通用評委來評分。
這種方式更接近角色扮演AI真實部署時的狀態,也更能暴露不同AI在不同用戶眼中的真實差距。正因如此,它給AI開發者提供了一面更真實的鏡子,也給用戶提供了一個更誠實的參考。對這項研究感興趣的讀者可以通過arXiv編號2607.27816查詢完整論文,所有角色卡、用戶對話數據、評分標準文件和代碼也在計劃公開發布中。
---
Q&A
Q1:PALATE評測
框架和現有角色扮演AI評測方法有什麼本質區別?
A:現有評測通常讓AI續寫一段固定的對話歷史,再由統一標準評分。PALATE的核心區別在於兩點:第一,候選AI從對話開頭開始自由交互,不繼承任何外部生成的歷史,評的是AI自己構建對話的能力;第二,評分標準是從每位真實用戶的歷史對話和滿意度標籤中自動歸納出來的個人化標準,而不是對所有用戶一視同仁的通用維度。這使得評測結果同時反映了AI的客觀質量和對特定用戶的實際滿意度。
Q2:PALATE中的用戶模擬器是怎麼訓練出來的,為什麼不直接用提示詞讓大模型扮演用戶?
A:用戶模擬器基於Qwen3.5-35B-A3B Instruct模型,為每位用戶單獨進行LoRA微調,訓練數據是該用戶真實的多輪對話記錄,模型沒有被注入任何手寫的用戶描述。直接用提示詞讓通用大模型扮演用戶的問題在於,生成的內容往往過於書面化、耐心過度、帶有助手腔調,無法真實還原真人的說話節奏、退出習慣和內容偏好。實驗中,提示詞方法的"愚弄率"僅約0.18,而個人化LoRA微調後達到了約0.56,接近隨機猜測的0.5,說明難以區分真人和模擬器。
Q3:PALATE評測顯示沒有哪個AI贏得所有用戶,這對普通用戶挑選角色扮演AI有什麼實際意義?
A:這意味著"最好的角色扮演AI"這個問題本身就沒有統一答案。不同用戶因為互動偏好不同,對同一組AI的滿意度排序會顯著不同。實驗中,5位用戶分別有不同的偏好冠軍。對普通用戶來說,這提示你在選擇角色扮演AI時,應該優先考慮自己的互動風格——比如你更喜歡AI主動推進劇情還是等待你發指令,你更在意角色說話的個性感還是情節邏輯嚴密性——而不是單純依賴通用排行榜。






