宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當AI學會「聽」懂整首樂隊合奏——Kyutai、Mirelo AI與IRCAM-CNRS索邦大學聯合推出MuScriptor開放音樂轉錄模型

2026年07月24日 首頁 » 熱門科技

這項由法國人工智慧實驗室Kyutai、初創公司Mirelo AI與法國國家科學研究中心附屬機構IRCAM-CNRS索邦大學聯合開展的研究,於2026年7月以預印本論文形式發布,論文編號為arXiv:2607.08168v1,感興趣的讀者可通過該編號在arXiv平台查閱完整原文。

**一首歌里藏著多少層聲音?**

當你戴上耳機聽一首喜歡的搖滾樂,你的耳朵會同時接收到電吉他的嘶吼、貝斯的低鳴、架子鼓的爆發,以及主唱的嗓音。人類的大腦經過多年訓練,能輕而易舉地把這些聲音分開來欣賞。但對於一台電腦來說,這簡直像是同時看懂一百個人在同一張紙上寫的字——每個人的筆跡疊在一起,沒有橡皮,沒有顏色區分,只有一團混沌的墨跡。

自動音樂轉錄(Automatic Music Transcription,簡稱AMT)正是要解決這個難題:讓電腦把一段音頻錄音"翻譯"成樂譜或MIDI格式,就像把語音識別成文字一樣。MIDI可以理解為一種數字樂譜格式,它記錄了每個音符的音高、開始時間和持續時長,鋼琴曲、吉他獨奏、交響樂都可以用MIDI來描述。有了準確的MIDI轉錄,音樂人就能輕鬆扒譜練習,音樂學者可以分析歌曲結構,甚至AI作曲系統也能以此為素材進行學習創作。

然而現實很骨感。現有的技術在處理單件樂器錄音時還算湊合,比如純鋼琴獨奏或純吉他演奏。一旦面對真實的流行歌曲或搖滾專輯——多種樂器同時發聲、電吉他帶著失真效果、混音經過專業處理——這些系統就開始"抓瞎",輸出的結果錯誤百出,根本不具備實用價值。

這支來自歐洲的研究團隊正是為了突破這道瓶頸而集結。他們推出了一個名為MuScriptor的開放權重多樂器音樂轉錄模型,並把模型權重和推理代碼完整公開在GitHub上,任何人都可以免費使用。這在多樂器音樂轉錄領域,可以說是頭一次有如此實用且開放的成果。

**一、這條路前人是怎麼走的,又卡在哪裡了?**

音樂轉錄技術的演進,走過了一段從"專科醫生"到"全科醫生"的漫長旅程。早期的研究者針對每種樂器單獨開發算法,用的是隱馬爾可夫模型、非負矩陣分解、支持向量機這些經典統計工具——這些方法就像是專門為某一種病症設計的特效藥,換個症狀就完全不管用了。

隨著深度學習的崛起,研究者開始嘗試用卷積神經網路和循環神經網路來判斷每個時間點上哪些音符在響。其中一個頗具代表性的框架叫做"Onsets and Frames",它把每個音符的"起始點"和"持續時段"當作兩個相互關聯的任務來處理,效果比之前好了不少。但這類方法本質上還是在操作一張巨大的"鋼琴卷"——把時間和音高畫成一張二維網格,然後在每個格子裡標記是否有音符。這張網格在面對多種樂器時會變得極為龐大而稀疏,計算起來非常消耗資源。

更新的思路是把音樂轉錄做成一個"語言翻譯"任務。具體來說,模型不再逐格判斷,而是像寫句子一樣,按順序輸出一串離散的"音符事件"——某個時刻,某種樂器,奏出了某個音高,持續了多少時間。這種方式更靈活,也更接近人類記譜的方式。谷歌的研究團隊2022年提出的MT3框架就是這個方向的重要里程碑,它使用編碼器-解碼器Transformer架構,把音頻頻譜圖轉換成MIDI事件序列,並且支持多種樂器的同時轉錄。

MT3之後,學界又陸續提出了改進版本,比如YourMT3+,它用一個在時頻域操作的層級注意力Transformer替換了標準編碼器,還引入了專家混合層(Mixture of Experts)和跨數據集的音軌增強技術。再往後,MIROS進一步把頻譜圖編碼器換成了MusicFM這一自監督音頻基礎模型。

然而這些模型都面臨同一個致命傷:它們嚴重依賴合成數據來訓練,也就是把MIDI文件用軟體"彈奏"出來的音頻,而非真實的錄音棚產品。合成音頻和真實音樂之間存在巨大的"域差異"——真實錄音里有專業的混音、效果處理、樂手的演奏風格,這些都是合成音頻模擬不來的。結果就是,模型在合成測試集上表現不錯,一遇到真實歌曲就原形畢露,轉錄結果幾乎無法實際使用。

**二、MuScriptor的核心思路:讓模型"見過世面"**

MuScriptor的團隊沒有在模型結構上大搞花樣,而是把重心放在了數據和訓練策略上。他們的核心判斷是:模型表現差,根本原因不是架構不夠聰明,而是從來沒見過足夠多的真實音樂。

為此,他們在三個層面上構建了訓練體系,就像培養一個音樂人,先打基礎,再精專業,最後打磨細節。

首先是合成數據的預訓練階段。團隊收集了約145萬首MIDI文件,來源涵蓋公開數據集(如Lakh MIDI)和商業數據提供商,風格以流行和西方古典音樂為主。為了讓這批數據更有用,他們開發了一套"實時合成流水線":每次從MIDI庫中隨機選取片段,對音符進行隨機升降調、變換節奏、調整力度(即音符的輕重),然後隨機替換樂器音色,再用250多種不同的音色庫(soundfont)把它合成為音頻,最後還會對合成出的音頻做隨機的微調音處理。這意味著同一段MIDI可以被合成成無數種聽起來不同的音頻,大大豐富了模型接觸到的聲音多樣性。這個合成數據集被稱為DSynth。

然後是真實音樂數據的微調階段。這是MuScriptor最核心、也最難復現的資產:他們收集了17萬首真實音樂錄音,總時長超過1.1萬小時,涵蓋從古典到重金屬的幾乎所有主流音樂風格,並且每首都配有對齊的音符標註。這批數據絕大多數來自"音頻-樂譜同步"技術——用算法把已有的MIDI/樂譜和對應的錄音精確對齊,從而自動生成標註。對齊過程中使用了基於色度特徵和起始點特徵的動態時間規整算法,並通過設定時間扭曲閾值來過濾掉對齊質量差的樣本。這個真實數據集被稱為DReal。

從DReal的樂器分布來看,聲學鋼琴最多(出現在約51%的曲目里),其次是失真電吉他(約47%)、電貝斯(約43%)、鼓(約32%)、原聲吉他(約24%)。總共有33種不同樂器類別,而且有17種樂器出現在至少5%的曲目中,說明數據集的樂器多樣性相當豐富。

最後是強化學習的後訓練階段。團隊從DReal中人工篩選出300首標註質量特別高的曲目,組成一個小型精品數據集DRL,用於進一步打磨模型,這個過程將在後面詳細介紹。

**三、模型的內部結構:一個"只聽不回頭"的翻譯家**

MuScriptor使用的是純解碼器Transformer架構,也就是說它只有"解碼器"部分,沒有單獨的"編碼器"。這種架構已經在語言模型領域被證明非常有效,MuScriptor把它遷移到了音樂轉錄任務上。

模型的輸入是兩樣東西:一段5秒鐘的音頻片段對應的梅爾頻譜圖,以及一份可選的樂器列表。梅爾頻譜圖可以理解為一張把時間和頻率可視化的熱力圖,橫軸是時間,縱軸是音高頻率,顏色深淺代表響度——人耳感知音高的方式本身就是非線性的,梅爾尺度正好模擬了這個特點。具體來說,音頻先被轉換成16kHz單聲道,然後用2048點的短時傅里葉變換、160個採樣點的幀移(對應100Hz的幀率)、以及512個梅爾濾波器來計算頻譜圖。

樂器列表的作用是告訴模型"這首曲子裡有哪些樂器",從而幫助模型更有針對性地轉錄,避免把低音提琴誤認成大提琴,或者對著純人聲歌曲硬生生"找出"根本不存在的鋼琴音符。這裡的樂器資訊是整首曲子層面的,而不是針對某個5秒片段的——這意味著即使某段5秒內某種樂器暫時沒在響,它仍然可能出現在樂器列表里。

在模型內部,梅爾頻譜圖被投影到Transformer的隱藏維度,然後和各樂器類別的嵌入向量(通過一個可學習的查找表獲得)拼接在一起,作為前綴條件輸入給Transformer。模型輸出的是一串離散的音符事件詞元(token),遵循與MT3相似的編碼方案,但把128種MIDI樂器映射到了36個樂器子組,這套分類體系來自YourMT3+提出的MT3_FULL_PLUS分類法。

團隊提供了四種不同規模的模型:6000萬、1億、3億和13億參數,參數量的差異主要來自注意力頭數量、層數和隱藏維度的不同。訓練時使用了100萬個步驟,批量大小64,AdamW優化器(動量參數β1=0.9,β2=0.95),學習率1e-4,配合2000步線性預熱和餘弦衰減調度。為了讓模型在有無樂器條件時都能工作,訓練時每個條件信號以0.2的概率獨立隨機丟棄,這就是"條件丟棄"訓練策略。

推理時,模型用貪心解碼(argmax)逐步生成音符序列,同時應用一種叫做"無分類器引導"(Classifier-Free Guidance,CFG)的技術,引導強度αCFG=2。這個技術原本流行於圖像生成領域,原理是同時做兩次前向傳播——一次帶條件,一次不帶條件——然後把兩個結果的差值按比例放大,讓模型更堅定地往"有條件指導"的方向生成,從而提升轉錄的準確度和一致性。

**四、強化學習:用"獎懲機制"打磨細節**

訓練完成的模型已經比以往任何多樂器轉錄模型都要強,但團隊沒有止步於此。他們借鑑了近年來在大語言模型對齊領域大放異彩的強化學習技術,把它用在了音樂轉錄上——據他們所知,這是這個領域的首次嘗試。

具體方法融合了兩種算法思想:REINFORCE算法(一種經典的策略梯度強化學習方法)和GRPO(Group Relative Policy Optimization,來自DeepSeekMath論文的組相對策略優化方法)中的"組內相對優勢歸一化"思想。

操作流程是這樣的:在每個訓練步驟,把模型切換到評估模式,針對同一段5秒音頻,用溫度τ=0.75進行隨機採樣,生成G=8個獨立的轉錄結果。然後把這8個結果分別和真實標註的MIDI進行比對,計算出一個獎勵分數,這個分數是三種F1指標的加總:音符起始點F1、幀級F1和音符結束點F1。接下來,對這8個獎勵分數做組內標準化,計算出每個結果相對於組內均值的"優勢"——比均值好的結果獲得正優勢,比均值差的獲得負優勢。最後,把模型切回訓練模式,用REINFORCE目標函數更新參數:對於優勢為正的生成序列,增大其出現概率;對於優勢為負的,降低其概率。

與完整版GRPO相比,這裡省去了重要性採樣比率裁剪和相對於凍結參考策略的KL散度懲罰項,實現更為簡潔。批量大小為8。

從實際效果來看,這個強化學習後訓練階段帶來了相當顯著的提升:以13億參數模型為例,所有評估指標都有明顯改善,音符起始點F1從52.5提升到60.4,幀級F1從69.4提升到73.3,音符結束點F1從42.0提升到49.0。從圖1的鋼琴卷展示來看,定性上也能感受到變化——強化學習後的模型漏檢(綠色標記)減少了,預測的音符起始時間也更準確了。

**五、評估標準:怎麼衡量一個轉錄結果好不好?**

研究團隊使用了五種評估指標,全部來自音樂資訊檢索領域的標準工具庫mir_eval。

最基礎的是音符起始點F1(Onset F1):只要預測的音符音高正確,且起始時間與真實值相差不超過50毫秒,就算命中。50毫秒大約是人耳能感知到的最小時間差,這個標準已經相當嚴格了。

音符結束點F1(Offset F1)則在起始點F1的基礎上更進一步:除了起始時間要准,預測的音符結束時間也必須落在真實值的50毫秒或20%時值範圍內(取較大者),這樣才算命中。這個指標更能反映模型對音符時值的理解,對弦樂這類有延音效果的樂器尤其重要。

幀級F1(Frame F1)則不那麼在意精確時刻,而是把時間軸切成62.5毫秒的小格,看每個格子裡預測的"哪些音在響"是否和真實情況吻合。直覺上,這對應了兩張鋼琴卷的重疊程度,對時間精度要求相對寬鬆。

鼓起始點F1(Drums Onset F1)單獨統計鼓的起始點F1,因為鼓擊打是瞬發的,沒有持續音,只有起始點有意義。

最嚴苛的是多樂器F1(Multi F1):在音符結束點F1的基礎上,還要求預測的樂器類別也正確——就算音符的時間完全準確,如果你把小提琴當成了中提琴,也不算命中。這個指標最接近實際應用中對轉錄質量的要求。

測試數據集DTest由372首從DReal中精挑細選、具有高質量標註的曲目組成,且已從訓練集中移除,同時還過濾掉了標題與測試集相似的訓練曲目,以保證評估的公正性。此外,由於該模型的編碼方案不允許同一樂器同時有兩個相同音高的音符疊加,評估前會從DTest中刪除這類"重疊音符"中較短的那個,這樣理想的模型理論上可以達到滿分1.0。

**六、實驗結果:每一步訓練都有多少提升?**

最直觀的對比來自表1。最強基線模型YourMT3+的多樂器F1為21.9,幀級F1為45.54,起始點F1為32.52。

僅在合成數據DSynth上訓練的MuScriptor(13億參數),幀級F1已經能達到51.3(開CFG後為48.9),但起始點F1(34.5)和多樂器F1(16.2)還比較一般,說明模型會"感知"到音頻里有音在響,但精確定位和樂器區分做得還不夠好。

加入真實數據DReal微調後,情況發生了質的飛躍:起始點F1躍升至54.4,幀級F1升至69.3,音符結束點F1從16.1躍至42.3,多樂器F1從16.2躍至41.6。幾乎所有指標都提升了約20個百分點,這充分說明真實數據對於模型性能的關鍵作用,光靠合成數據是不夠的。

再經過強化學習後訓練後,模型進一步提升:起始點F1 60.4,幀級F1 73.3,音符結束點F1 49.0,鼓起始點F1 50.2,多樂器F1 48.2。這是目前公開模型中在多樂器音樂轉錄任務上最強的表現。

從合成數據預訓練的價值分析來看(圖4),研究團隊系統比較了不同比例的真實數據加入時,有無合成數據預訓練的差異。結論很有規律:當真實數據極少時(比如只用1%的DReal),合成數據預訓練的價值極其顯著——僅用1%真實數據、有合成預訓練的模型,音符結束點F1能達到33.4,而沒有預訓練的僅有9.9;隨著真實數據越來越多,兩者差距逐漸縮小,但即便用滿100%的真實數據,有預訓練的模型(42.3)仍略優於沒有預訓練的(41.0)。這說明合成預訓練可以在數據稀少時顯著降低對真實數據的依賴,同時即便真實數據充足時也能帶來邊際收益。

**七、樂器條件控制和模型規模對結果的影響**

關於樂器條件控制,團隊在表3中做了專項對比:僅在真實數據上訓練的模型,不提供樂器條件時多樂器F1為38.7,提供正確樂器列表後提升至40.5。雖然看起來提升幅度不大,但在實際使用中意義重大——它能讓模型在同一首歌的不同片段之間保持一致的樂器判斷,避免"前幾秒認為是鋼琴,後幾秒又認為是電鋼琴"這種不穩定現象,也讓用戶能夠自定義只轉錄某幾種樂器。

關於模型規模,表4展示了從6000萬到13億參數四個規模的對比(均僅在DReal上訓練,αCFG=2)。最小的6000萬參數模型幀級F1已經達到65.7,13億參數最大版本為68.7,差距並不懸殊。這意味著即便是資源受限的用戶,使用小模型也能獲得相當實用的結果。

關於音頻表示的選擇,表5比較了梅爾頻譜圖、常數Q變換幅度譜(CQT)、Encodec神經音頻編解碼器特徵和MERT音樂理解嵌入四種輸入方式的效果(均用300M模型、僅DReal訓練)。梅爾頻譜圖表現最佳(多樂器F1 39.7),CQT稍差(38.2),MERT更差(36.8),Encodec最差(28.9)。有趣的是,神經網路學習出的表示(MERT、Encodec)反而不如直接反映物理信號特性的傳統頻譜圖,這提示在音樂轉錄任務中,貼近原始信號物理特性的表示可能更有利於模型捕捉精確的時頻資訊。

在與其他公開數據集的比較中(表2),MuScriptor在多個數據集上都展示了相對於YourMT3+的優勢,尤其在幀級F1方面提升明顯,比如Dagstuhl ChoirSet(合唱數據集)幀級F1從51.0提升到80.7,PHENICX-Anechoic(管弦樂錄音)從58.9提升到74.6,RWC-P(流行音樂)從51.6提升到61.2。不過起始點和結束點分數的提升因數據集而異,合唱這類音樂本身音符邊界就比較模糊,即便是人工標註也很難做到精確,這反映在指標上就是起始點和結束點F1偏低。

值得一提的是重疊音符問題的分析(第4.2.3節):如果不過濾掉DTest中同樂器同音高的重疊短音符,13億參數模型的起始點F1會從60.4下降至51.8,結束點F1從49.0降至41.9,多樂器F1從48.2降至42.0。這說明同一樂器同時奏出相同音高兩個音的情況在真實音樂中確實存在,而當前的編碼方案無法處理這種情形。解決這一問題需要設計新的音符編碼方案,是未來改進的方向之一。

**說到底,這件事意味著什麼?**

歸根結底,MuScriptor做到了一件之前沒人做到過的事:把一個對真實世界多樂器音樂實際有用的轉錄系統,以開放的方式交到了所有人手中。

對於音樂人來說,這意味著扒譜這件事可能會發生根本性變化。以前要花幾個小時一個音一個音地把喜歡的歌曲手動記下來,現在也許幾分鐘內就能得到一份雖不完美但可以作為起點的參考樂譜,再在此基礎上校對修改,效率會大幅提升。對於音樂資訊檢索研究者來說,有了可靠的多樂器轉錄,和弦識別、調性分析、曲式分析等下游任務都會受益。對於生成式AI音樂系統來說,高質量的MIDI數據是訓練的養料,MuScriptor提供了一個更高效的途徑來從海量錄音中提煉這些養料。

當然,這個系統還不完美。它還不能處理同一樂器同時彈奏相同音高兩個音的情況。它處理的片段長度只有5秒,推理速度因此還有提升空間。它的樂器詞彙表也還有擴展餘地。團隊在結論部分也坦誠地指出了這些局限,並把它們列為未來工作的方向。

這項研究最有趣的啟示或許是:一個領域的突破,有時候不是來自架構的奇思妙想,而是來自腳踏實地地去收集那17萬首真實的歌曲,並想清楚怎麼用它們來訓練。有興趣深入了解MuScriptor的讀者,可以通過arXiv:2607.08168在arXiv平台查閱完整論文,也可以直接訪問GitHub上的muscriptor/muscriptor倉庫獲取代碼和模型權重。

Q&A

Q1:MuScriptor和以前的多樂器音樂轉錄模型相比,最大的區別是什麼?

A:最大的區別在於訓練數據的類型。以前的模型(比如MT3、YourMT3+)主要依賴把MIDI用軟體合成的音頻來訓練,這類合成音頻和真實錄音有很大差距,導致模型在真實歌曲上效果很差。MuScriptor則收集了17萬首真實音樂錄音(共1.1萬小時)並配合對齊的音符標註來微調模型,讓模型真正見過"帶有專業混音和效果處理"的真實音樂,因此在實際應用中效果大幅超越前代模型。

Q2:MuScriptor的強化學習是怎麼用在音樂轉錄上的?

A:針對同一段5秒音頻,讓模型隨機生成8個不同的轉錄結果,然後把每個結果和真實標註做比對,計算獎勵分數(三種F1指標之和)。再對這8個分數做組內標準化,比平均分高的獲得正獎勵,低的獲得負獎勵,最後據此更新模型參數,讓好的生成方式概率增大、差的方式概率減小,從而讓模型向更準確的轉錄方向進化。

Q3:MuScriptor的樂器條件控制功能是怎麼用的?

A:用戶可以在使用MuScriptor時提供一份"這首曲子裡有哪些樂器"的列表作為輸入條件。模型會根據這份列表來調整轉錄,只關注被指定的樂器,同時在整首歌的不同片段之間保持樂器判斷的一致性,避免同一首歌前後段落樂器識別不穩定的問題。如果不提供樂器列表,模型也能獨立工作,只是準確率略低一些。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新