你有沒有試過讓ChatGPT幫你寫一段說唱歌詞?
結果大概率是這樣的:押韻對是對上了,但讀起來像一篇分行的作文,沒有flow
,沒有節奏感,甚至你都不知道該怎麼念出來才帶感。再試試讓它寫一份電影劇本,你會發現對話是有了,但根本不符合劇本格式,沒有場景標註,沒有鏡頭語言,更別提讓它寫遊戲設計文檔了,機制、玩法、玩家交互這些術語,它壓根不知道該往哪兒擺。
這不是模型笨,而是它壓根沒怎麼學過這些東西。
一群來自韓國中央大學和LG AI研究院的研究者發現了這個問題的根源:現在市面上能拿來訓練AI寫作能力的高質量數據,幾乎全部是故事,而且是那種起承轉合的小說體故事。你去看那些經典的寫作數據集,WritingPrompts
也好、ROCStories
也好,清一色是敘事文本。這就好比一個廚師從小到大隻學過做紅燒肉,你讓他去做分子料理,他連工具都不認識。
數據的偏科到底有多嚴重
先說一個可能顛覆你認知的事實:大語言模型最常被使用的場景之一就是創意寫作,這不是小眾需求,而是實打實的高頻剛需。但支撐這些模型學會創意寫作的訓練數據,卻嚴重偏科在"講故事"這一件事上。
這事兒聽起來好像沒什麼大不了,寫故事不也是創意寫作嗎?問題是,現實里人們找AI寫東西的需求五花八門。有人要寫說唱歌詞,有人要寫一份手遊的角色設定,有人要寫播客腳本,有人要寫話劇對白。這些體裁彼此之間的差別,根本不是換個話題那麼簡單,而是結構和功能上的天壤之別。
說唱要求押韻密度、節奏感和flow,電影劇本要求場景轉換、人物弧光和台詞分寸,遊戲設計文檔要求講清楚遊戲機制和玩家如何互動。這些都是硬性的、可以被專業人士一眼識別出"對不對"的行業規範。
一個只在故事堆里泡大的模型,可能敘事能力很強,詞藻華麗,情節流暢,但你讓它寫個說唱verse,它給你的可能是押韻的散文,完全沒有節奏感可言。
研究者把這個問題概括得很精準:模型學會了豐富的敘事內容,卻學不會不同創意體裁各自的結構性和功能性規範。
**這才是問題的核心,不是AI不會寫,而是AI只學過一種"寫法"。**
為什麼不能簡單粗暴地"造數據"
那辦法很簡單啊,缺什麼類型的數據,就去造點什麼類型的數據不就行了?
沒那麼容易。
現在業界已經有一套成熟的思路去批量生成訓練數據,叫做合成指令生成
,簡單說就是拿幾個種子任務,然後讓AI自己去演化、擴寫出更多類似的指令和答案,數量可以滾雪球一樣越滾越大。這套方法在編程和數學領域已經玩得很轉了,因為這兩個領域有一個天然的優勢:答案對不對,是可以被驗證的。代碼跑不跑得通,一試便知,數學題算得對不對,也是板上釘釘的事。
創意寫作恰恰缺這種驗證的錨點。
一首說唱寫得好不好,一部劇本寫得地道不地道,沒有一個可執行的程序能給你評分。你要是照搬編程數學那套"自動生成加自動驗證"的流程,大概率會得到一堆話題挺新鮮、但格式完全跑偏的東西。因為寫作這件事的"對不對",取決於人類長期形成的、約定俗成的體裁慣例,比如歌詞該怎麼分段、劇本該怎麼標註場景,這些東西不是靠算法能憑空推導出來的,它得靠人的經驗去定義。
**這意味著,創意寫作數據的生成,需要人類介入的不只是最後把關質量,更是從一開始就要定義每個體裁"該長什麼樣"的遊戲規則。**
打個比方,這就像你要教一個從沒見過中餐的外國廚師做菜。你不能只告訴他"做出好吃的菜就行",然後指望他自己悟出川菜要麻辣、粵菜要清淡、魯菜要咸鮮。你得先把每個菜系的調味邏輯、烹飪手法先講清楚,他才有可能做出像樣的東西來。如果跳過這一步,直接讓他"隨便發揮",結果大概率是所有菜吃起來都差不多,因為他根本不知道菜系之間的邊界在哪兒。
拆開"聊什麼"和"怎麼寫"
研究團隊想出的解法,叫做屬性引導的體裁擴展框架
。
這個名字聽著拗口,拆開看其實思路很直白:把"寫什麼內容"和"用什麼體裁寫"這兩件事徹底分開處理。
以前的數據往往是內容和體裁綁死的,一個種子提示詞天生就是故事,你沒法把它直接改造成一份遊戲設計文檔。這個團隊的做法是,把"主題創意"當作可以自由搬運的原材料,把"體裁規範"當作單獨的調味料,想給什麼話題配什麼體裁,現炒現賣。
具體怎麼做?
他們先從Reddit上一個叫r/WritingPrompts
的社區論壇里,收集了大量人類真實寫的故事創作提示。
引用塊:r/WritingPrompts,是Reddit上一個專門發布創意寫作提示的社區,用戶在這裡貼出各種故事開頭或設定,供其他人續寫。這些帖子由真人撰寫,題材五花八門,從愛情、戰爭到科幻、懸疑都有,天然帶有豐富的話題多樣性。
這些故事提示本身質量參差不齊,團隊先用GPT-5-mini過濾了一遍,刪掉了686條包含不當內容的樣本,又清理了861條跑題或者帶論壇套話的碎片內容。剩下的,就是一批乾淨、話題豐富的種子庫。
接下來是關鍵的一步:給每個目標體裁,人工整理出一套專屬的"結構屬性清單"。
比如說唱這個體裁,清單里會列出押韻方案、flow節奏、雙關語、主題、速度、押韻密度、金句、韻律、比喻、俚語使用這些維度。電視劇劇本會有另一套清單,敘事弧線、人物成長這些。這些清單不是AI瞎編的,而是團隊先讓GPT-5從維基百科和創作手冊里提取出結構化的屬性列表,再由人工逐條審核、合併重複項、剔除太籠統的說法、補充遺漏的關鍵維度,最終每個體裁沉澱出5到15條屬性。
有了話題種子和體裁屬性這兩樣東西,生成的時候,團隊會隨機抽5個故事提示當作"話題靈感來源",再從對應體裁的屬性清單里隨機抽取一部分屬性(數量也是隨機的,從0個到全部都有可能),把這兩者塞進一個統一的提示模板里,餵給GPT-5-mini去生成新的寫作指令。
**這裡有個很巧妙的設計:抽取的屬性數量是隨機的。**
抽0個屬性的時候,生成的指令就是完全開放式的,類似"寫一段關於城市孤獨的說唱"。隨著抽取的屬性越來越多,指令會變得越來越具體,比如"寫一段關於城市孤獨的說唱,要求AABB押韻,節奏感強,大量使用雙關"。這麼做是為了模擬真實世界裡人們提問的多樣性,有人問得籠統,有人問得極其精細,數據集也得覆蓋這兩頭。
引用塊:verbalized sampling
(顯式採樣),是一種在生成階段明確要求模型輸出內容在話題、語氣、結構上要有差異的技巧,用來防止生成的多條內容彼此高度雷同,也就是常說的模型崩塌問題。
生成完指令之後,團隊用Qwen3-235B-A22B-Thinking這個強模型去回答這些指令,產出對應的作品。最後再用另一個獨立的模型Qwen3-30B-A3B-Instruct當裁判,給每條回答評分,把得分低於平均分兩個標準差的低質量樣本篩掉。
這一整套流程走下來,最終形成了一個叫Multi-Genre Collection
的數據集,總共5萬條樣本,橫跨13個創意體裁,包括故事、歌詞、說唱、電影劇本、遊戲設計、播客腳本、話劇對白、電視劇本、演講稿、雜誌文章、角色設計等等,還有一小部分歸入"其他"類別的長尾體裁,比如日記體、漫畫劇本、互動小說這些。
這套設計如果不這樣做會怎樣?
如果直接讓AI憑空生成各種體裁的寫作指令,不給任何屬性約束,大概率會出現"話題挺新鮮,但格式全靠模型自由發揮"的情況。你問它寫遊戲設計文檔,它可能只是換了個話題的故事,壓根不會出現"核心玩法""勝負條件""關卡設計"這些專業結構。屬性清單的存在,相當於給AI劃了一條硬性的護欄,逼著它在生成指令的時候,必須往這些結構性維度上靠。
數據長什麼樣,靠不可靠
數據造出來了,得驗證一下這套東西是不是真的做到了"體裁各自獨立、彼此有區分度"。
團隊做了個可視化實驗,把所有生成的指令用一個叫Qwen3-Embedding-0.6B的模型轉換成向量,再用t-SNE
降維技術投影到二維平面上觀察分布。
引用塊:t-SNE,是一種把高維數據壓縮到二維或三維空間進行可視化的算法,常用來直觀檢驗數據點之間是不是真的存在分組和聚類關係。
結果顯示13個體裁在圖上形成了邊界清晰、幾乎沒有重疊的獨立聚類。這說明這套屬性注入的方法,確實生成出了體裁上有實質區分的指令分布,而不是簡單地把故事換了個說法重新包裝了一遍。
從數量分布看,故事類占了13.6%,略高於其他體裁,剩下12個主要體裁each占6.8%左右,長尾的"其他"類占5.1%。整體上做到了相對均衡的覆蓋。
訓練出來的模型到底強不強
數據有了,接下來就是拿去訓練模型,看效果。
團隊選了三個基礎模型來做實驗:Llama-3.1-8B-Instruct、EXAONE-3.5-7.8B-Instruct、還有Qwen3-8B。都用LoRA
做微調。
引用塊:LoRA(低秩適應),是一種參數高效的微調技術,不需要更新模型全部參數,只訓練一小部分低秩矩陣,既能省算力,又能保留模型原有的知識。
評測用了三套標準。一套是Arena Hard的創意寫作子集,由GPT-4.1對照參考答案評分。一套是WritingBench里跟創意寫作相關的領域,由GPT-5-mini評分。還有一套是從Multi-Genre Collection本身留出的測試集,13個體裁each留了50條,共650條,由GPT-4.1按1到10分評分,考察質量、創意性和體裁契合度。
結果挺打眼的。三個基礎模型在用這套數據微調之後,全部實現了明顯提升。拿Llama來說,微調前在Arena Hard上只有2.9分,微調後飆到33.0分,漲了整整30.1個百分點。這不是一星半點的進步,而是幾乎重新定義了模型的寫作能力。
**更值得說道的是,這些微調後的模型,全部超過了專門為長文寫作優化的LongWriter-glm4-9B基線模型。**
LongWriter原本在Arena Hard上只有2.3分,遠低於所有微調後的模型。這說明一個專攻"寫得長"的模型,不如一個學過"寫得對體裁"的模型好使。堆量不如把結構學明白,這個道理放在這裡格外貼切。
團隊還找來了另一個現成的寫作數據集DeepWriting做對比。為了公平起見,雙方都只抽2000條樣本來訓練同一個Qwen3-8B模型。結果Multi-Genre Collection訓出來的模型,在Arena Hard上拿到7.5分,比DeepWriting訓出的4.9分高出不少,在體裁覆蓋測試上也是71.4分對65.9分,全面勝出。
| 數據來源 | Arena Hard | WritingBench | 多體裁覆蓋測試 |
|---|---|---|---|
| DeepWriting | 4.9 | 55.5 | 65.9 |
| LongWriter | 7.0 | 56.4 | 69.6 |
| **Multi-Genre** | **7.5** | **59.1** | **71.4** |
體裁越多,輸出越有新意
這裡有個特別耐人尋味的發現:隨著訓練時用到的體裁數量增加,模型輸出內容的新穎度也在持續攀升。
團隊用了一個叫NoveltyBench Distinct的指標來衡量這一點,它的原理是把生成的多條內容按語義和功能相似度聚類,聚類數越多,說明生成的內容彼此差異越大,新穎度越高。
引用塊:NoveltyBench Distinct指標,通過將模型的多次生成結果按內容是否語義等價進行分組,統計出不重複的簇的數量,來量化模型輸出的多樣性和非重複性。
實驗設置了不同的體裁數量梯度:只用0個體裁(相當於沒訓練)、4個、8個、12個、全部13個體裁。新穎度分數分別是3.87、3.93、4.26、4.56、4.81,一路單調上升。
| 訓練體裁數量 | 0 | 4 | 8 | 12 | 全部13個 |
|---|---|---|---|---|---|
| 新穎度得分 | 3.87 | 3.93 | 4.26 | 4.56 | **4.81** |
這個現象說明的東西,比表面看起來更深一層。不只是"體裁多了模型見識廣了"這麼簡單的解釋,而是暗示著體裁之間的結構差異,能夠反過來激活模型在創作時的表達空間。一個只見過故事的模型,寫什麼都往敘事的套路里靠,而一個見過說唱的節奏感、見過劇本的場景切換、見過遊戲文檔的機制描述的模型,它腦子裡可用的"表達模板"變多了,自然更不容易寫出千篇一律的東西。
這就像你去問一個只吃過白米飯的人和一個吃過八大菜系的人,同樣是"給我做頓飯"這個要求,後者能給出的答案空間顯然大得多。見得越多,組合的可能性越豐富,這不是玄學,是實打實能測出來的效果。
排除"自己夸自己"的嫌疑
一個很自然的疑問冒出來了:整套流程里,生成指令和最初評判質量都用了GPT系列模型,那最後評測模型能力的時候,會不會存在"自己人評自己人"的偏袒?
團隊專門做了個交叉驗證,換了三個完全獨立的裁判模型:GPT-5-mini、DeepSeek v3.2、Gemini 3 Flash,分別對微調前後的Llama和Qwen模型評分。
結果顯示,不管換哪個裁判,微調後的模型都穩定超過微調前的版本。比如Qwen在GPT-5-mini裁判下從56.1分漲到63.6分,在DeepSeek v3.2裁判下從51.5漲到65.9,在Gemini 3 Flash裁判下從58.5漲到71.5。三套完全不同的裁判系統,得出的結論高度一致。
| 裁判模型 | GPT-5-mini | DeepSeek v3.2 | Gemini 3 Flash |
|---|---|---|---|
| Llama基礎版 | 43.7 | 36.6 | 41.7 |
| Llama微調後 | 60.6 | 63.1 | 70.5 |
| Qwen基礎版 | 56.1 | 51.5 | 58.5 |
| Qwen微調後 | **63.6** | **65.9** | **71.5** |
不放心的話,團隊還找了真人來評分,從WritingBench里隨機抽了50道題,讓人類按照標準評分。結果Multi-Genre Collection訓出的模型得分59.3,略高於LongWriter的57.7和DeepWriting的56.9。雖然差距不算懸殊,但方向和之前的機器評測是一致的。
一個具體案例:寫歌詞的差距在哪
抽象的分數聊了這麼多,不如看一個具體例子更有畫面感。
論文裡給了一個測試案例,要求寫一首帶故事情節的交響金屬死核風格歌詞,主題是"一個逐漸被力量腐蝕的年輕巫師",格式還要適配Suno這類AI音樂生成工具。
基礎版Llama寫出來的東西,遵循了傳統的verse-chorus結構,但意象比較套路化,比如"鳳凰涅槃""知識越多黑暗越深"這類,讀起來像是隨便哪首西方搖滾都能套用的歌詞模板,而且沒有標題,也沒有具體的人名或地名。
微調後的Llama交出的答案叫ASCENDANCE,一上來就有標題。故事發生在一個叫Aethel的具體地方,有個反覆出現的角色叫Elara,還提到了三個具體的魔法名字,Lumen、Aero、Verdant,而且每一段都標註了精確到秒的時間戳,完全符合Suno這類工具的輸入格式要求。
**這個對比說明的不只是分數上的提升,而是模型學會了體裁的"里子",不只是押韻和節奏,還包括世界觀搭建的細節感、格式規範的死記硬背、以及敘事的連貫邏輯。**
這就好比讓兩個人寫一份產品需求文檔,一個人只是把想法寫成大白話段落,另一個人知道這類文檔必須有版本號、必須有驗收標準、必須標註優先級。哪怕兩人表達的核心想法差不多,後者寫出來的東西一看就是"內行",前者寫出來的東西一看就知道沒在這行幹過。格式和結構上的這些"暗規則",恰恰是這篇論文想要教給AI的東西。
這條路往前會走向哪裡
創意寫作數據集這條線,早年的代表作品都聚焦在單一體裁上。WritingPrompts主打故事提示配對,ROCStories專攻五句話的常識性短故事,用來訓練模型理解敘事邏輯,LitBench則是給故事質量和寫作風格建立了偏好標註體系,用來評判什麼樣的故事寫得更好。
除了故事之外,也有零星工作瞄準過單個非故事體裁。SongComposer專門研究歌詞和旋律的配對生成,Mirowski等人的工作專注在劇本和話劇的人機協同創作上,請了業內專業人士來評估AI的協作能力。
這些工作各自在自己的賽道上鑽得挺深,但沒有一個嘗試把13種體裁放進同一個框架里統一處理。**這篇論文補上的,恰恰是這個長期被忽視的整合性空白。**
至於這條思路會怎麼繼續往前走,有幾個值得琢磨的方向。一個是體裁的數量能不能繼續擴,現在13個覆蓋的還只是常見需求,真實世界裡的創意寫作場景恐怕比這多得多,比如廣告文案的不同細分類型,或者不同文化背景下的說唱風格差異。另一個是屬性清單本身要不要引入更動態的更新機制,畢竟創意體裁的規範也在隨著時代變化,今天的短影片腳本規範和五年前完全不是一回事。
寫在後面
讀完這篇論文,最觸動我的一點是,它把一個看似"內容生成"的問題,重新定義成了"結構規範"的問題。
我們平時聊AI寫作,總習慣性地關注它"寫得好不好看",很少去想它是不是"寫得對不對格式"。這篇論文提醒我,創意寫作的門檻,很多時候不在於想像力,而在於對體裁潛規則的熟悉程度。一個人類新手編劇寫不好劇本,往往不是想像力不夠,而是不懂場景轉場該怎麼標,這跟AI遇到的問題其實是一回事。
另一個讓我意外的細節是,屬性抽取數量用了隨機採樣,從0到全部隨機取一個數值。這個設計初看不起眼,但它解決的其實是"指令顆粒度"的問題,現實中人們提需求,有的極其模糊,有的極其精確,一個好的訓練數據集得同時覆蓋這兩種情況,而不是假設用戶永遠會說清楚自己想要什麼。
如果這套思路繼續往下推,下一個值得追問的問題是:體裁之間的屬性清單,能不能也交給模型自己去歸納和更新,而不是完全依賴人工整理?畢竟人類創作形式還在不斷演化,誰能保證十年後不會冒出一種全新的、現在還沒被命名的創作體裁?
Q&A
Q1:Multi-Genre Collection數據集是什麼?
A:這是一個由韓國研究團隊構建的5萬條樣本的創意寫作數據集,覆蓋故事、說唱、歌詞、電影劇本、遊戲設計文檔等13種創意體裁,專門用來解決AI模型在非故事類創意寫作上表現薄弱的問題。
Q2:屬性引導的體裁擴展框架具體是怎麼做的?
A:它把"寫什麼話題"和"用什麼體裁寫"分開處理,從Reddit的r/WritingPrompts社區獲取真實的故事創作主題作為話題種子,再結合人工整理的各體裁結構屬性清單(比如說唱的押韻方案、flow節奏),組合生成既有話題多樣性又符合體裁規範的寫作指令。
Q3:用這套數據訓練出來的模型效果到底好在哪?
A:實驗顯示,用這套數據微調的模型不僅全面超過原始基礎模型,還超過了專門做長文寫作優化的LongWriter基線模型和其他現有寫作數據集訓練出的模型,而且訓練時接觸的體裁種類越多,模型生成內容的新穎度也越高,這一結論在多個獨立裁判模型和人工評測下都得到驗證。






