宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Gemini 3.5 Transcribe 上線:流式延遲低於一秒,還可調用其他模型幹活

2026年08月27日 首頁 » 其他

Google日前在官方部落格宣布推出最新的語音轉文本模型 Gemini 3.5 Transcribe。與在背景噪音、專業術語等場景下頻頻失手的傳統語音識別方案不同,該模型可將原始音頻直接轉換為準確、整潔且已排版的文本。

Gemini35Transcribe上線流式延遲低於一秒還可調用其他模型幹活

性能是本次升級的重點。據 Artificial Analysis 測量,Gemini 3.5 Transcribe 的平均詞錯率(WER)為流式 4.0%、非流式 2.6%;在 FLEURS 多語言基準上分別為 5.50% 與 5.04%,全面優於上一代模型 Chirp 3,最終轉寫耗時縮短 70%。

具體能力上,模型的智能轉寫可處理諸如「我們周二見面——不,還是周三吧」這類口誤自我糾正,自動去除語氣詞並完成排版;函數調用功能允許它將圖片生成、文件分析等任務委託給其他 Gemini 模型執行(目前見於 macOS 版 Gemini 應用);在噪音環境下仍能準確識別郵政編碼、訂單號等字母數字實體;藉助自定義詞表可適配專業行話與特殊拼寫;支持 85 種以上語言及方言口音;預錄音場景下最多可為三名說話人做歸屬標註。

Gemini35Transcribe上線流式延遲低於一秒還可調用其他模型幹活

模型也正在進入 Google 各條產品線:Android 版 Gboard 的 Rambler 功能借其實現語音整理成文與口述編輯;Antigravity 利用螢幕上下文和聊天記錄提升轉寫精度;Chrome 的「隨說隨寫」功能即將上線。

調用方面,模型通過兩套 API 提供服務:基於 Live API 的實時流式接口(gemini-3.5-transcribe-live)支持雙向流式傳輸,延遲低於一秒;基於 Interactions API 的錄音轉寫接口可處理會議與通話錄音,提供詞級時間戳。目前兩者均已在 Google AI Studio 與 Gemini Enterprise Agent Platform 開啟公開。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新