近日,Meta Superintelligence Labs 對外發布首款面向實時音頻感知的大模型 Muse Voice Transcribe,主打低延遲流式語音轉寫,兼顧識別精度與響應速度,同時把目標場景指向 AI 眼鏡這類全天候運行的個人智能硬體。
該模型將音頻切割為 80 毫秒的片段,依靠強化學習訓練的策略動態調整輸出節奏。遇到簡單詞彙時快速輸出文本,面對複雜表述則適當延長監聽窗口,以此平衡轉寫延遲與識別正確率。

第三方機構 Artificial Analysis 的評測顯示,該模型英文單詞錯誤率為 3.1%,說話結束後輸出延遲僅 0.16 秒,綜合表現優於 ElevenLabs、AssemblyAI 等同類型主流產品。
除基礎轉寫能力外,模型把說話人區分、切換檢測、語句邊界判斷整合在一套體系內,無需額外後期處理。它可以同時分辨二十位以上發言者,可連續處理時長超一小時的錄音,官方也放出 8 人現場對話的實時分人轉寫演示。
語言層面,模型訓練覆蓋 70 余種語言,其中 25 種完成完整測試,還支持同一段落內多語言自由切換,開發者輸入關鍵詞、上下文提示,還能改善專有名詞識別效果。

在商用定價上,該 API 每小時收費 0.18 美元,折算每千分鐘 3 美元,對比 Cartesia、ElevenLabs 等競品具備一定價格優勢。Meta 將這項能力部署在 Meta AI 與 Muse Code 語音輸入模組,外部開發者可通過 Meta Model API 調用。
Meta 著重提及,這套實時語音技術是個人 AI Agent 理解現實對話的關鍵底座,多人區分、長時錄音解析的能力,能夠適配 AI 眼鏡在多人交談環境下的資訊採集需求。值得注意的是,官方並未對外披露模型參數量、訓練數據集與音頻素材來源,也沒有開放模型權重下載。






