宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

谷歌推出兩款Gemini 3.8 Live模型:實時語音對話模型,可邊推理邊說話

2026年09月16日 首頁 » 熱門科技

Google日前在官方部落格宣布推出Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款實時對話模型。前者面向規模化與成本效率,把對話智能與流暢語音、視覺理解能力結合在一起;後者面向高複雜度任務,強化了整體智能與多步推理。兩款模型即日起在 Gemini API 與 Google AI Studio 向開發者開放,企業側在 Gemini Enterprise 進入私測,普通用戶可先在 Search Live 用上 3.8 Live。

谷歌推出兩款Gemini 3.8 Live模型:實時語音對話模型,可邊推理邊說話

官方公布的數據集中在語音質量與任務完成度兩方面。Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分位列總榜第一,在 τ-Voice 與 Sierra 的 τ-Voice-banking 基準上分別取得 68.6% 與 35.1%,Big Bench Audio 得分 97.7%;Gemini 3.8 Live 在 Speech Agent Arena 排名第二。Google 稱,在 ServiceNow 的 EVA-Bench 上兩款模型把準確率與對話質量之間的帕累托前沿向前推進,該測試在 Gemini Enterprise Agent Platform 的 Live API 上運行。

谷歌推出兩款Gemini 3.8 Live模型:實時語音對話模型,可邊推理邊說話

能力方面,Gemini 3.8 Live 可近實時處理視覺輸入,並在對話過程中自動檢測、切換 97 種受支持語言;工具調用與 API 請求被放到後台執行,模型先確認請求,任務在後台完成期間對話不中斷。Extended Thinking 的區別是把推理與說話並行:它先用"Let me check that…"這類口頭提示接住提問,再用實時進度播報交代多步後台任務的進展。官方演示包括實時指導下棋、把白板草圖與語音反饋轉成可用的 React 組件,以及協調多步預訂與異步函數調用。

谷歌推出兩款Gemini 3.8 Live模型:實時語音對話模型,可邊推理邊說話

Google 同時列出了語音開發生態的合作方:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 通過 Gemini Live API 提供實時媒體流基礎設施,開發者不必自建底層;Salesforce、Genspark 與 Lumeris 被列為合作企業,關注點是延遲、流暢度與工具調用能力。Google 還表示,其 AI 產品生成的音頻統一嵌入 SynthID 隱性水印。

值得一提的是,在月初,Google 已先發布 Gemini 3.8 Flash 與面向漏洞檢測、自動修補的 Gemini 3.8 Flash Cyber,本次兩款 Live 模型則是 3.8 系列裡的實時語音部分。鋪開節奏上,3.8 Live Extended Thinking 已進入 Gemini Live,Workspace 的 Docs 面向 Google AI Pro 與 Ultra 訂閱者,Gmail 與 Keep 面向全部 Google AI 訂閱者;面向企業客戶的兩個版本標註為"即將推出"。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新