Google日前在官方部落格宣布推出最新的語音轉文本模型 Gemini 3.5 Transcribe。與在背景噪音、專業術語等場景下頻頻失手的傳統語音識別方案不同,該模型可將原始音頻直接轉換為準確、整潔且已排版的文本。

性能是本次升級的重點。據 Artificial Analysis 測量,Gemini 3.5 Transcribe 的平均詞錯率(WER)為流式 4.0%、非流式 2.6%;在 FLEURS 多語言基準上分別為 5.50% 與 5.04%,全面優於上一代模型 Chirp 3,最終轉寫耗時縮短 70%。
具體能力上,模型的智能轉寫可處理諸如「我們周二見面——不,還是周三吧」這類口誤自我糾正,自動去除語氣詞並完成排版;函數調用功能允許它將圖片生成、文件分析等任務委託給其他 Gemini 模型執行(目前見於 macOS 版 Gemini 應用);在噪音環境下仍能準確識別郵政編碼、訂單號等字母數字實體;藉助自定義詞表可適配專業行話與特殊拼寫;支持 85 種以上語言及方言口音;預錄音場景下最多可為三名說話人做歸屬標註。

模型也正在進入 Google 各條產品線:Android 版 Gboard 的 Rambler 功能借其實現語音整理成文與口述編輯;Antigravity 利用螢幕上下文和聊天記錄提升轉寫精度;Chrome 的「隨說隨寫」功能即將上線。
調用方面,模型通過兩套 API 提供服務:基於 Live API 的實時流式接口(gemini-3.5-transcribe-live)支持雙向流式傳輸,延遲低於一秒;基於 Interactions API 的錄音轉寫接口可處理會議與通話錄音,提供詞級時間戳。目前兩者均已在 Google AI Studio 與 Gemini Enterprise Agent Platform 開啟公開。






