宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

剛剛,Gemini 3.8 Flash 來了,結果慘遭對手嘲諷

2026年09月03日 首頁 » 熱門科技
好好好,谷歌也開始按月更大模型了。
就在剛剛,距離 Gemini 3.7 Flash 發布僅僅過去三周,Google Gemini 3.8 Flash剛剛Gemini38Flash來了結果慘遭對手嘲諷 和專攻網路安全的 Gemini 3.8 Flash Cyber剛剛Gemini38Flash來了結果慘遭對手嘲諷 同時登場。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
算下來,短短 6 個星期,Gemini Flash 產品線已經完成了 3 次大版本疊代,平均每三周就有一個新模型出現。
放在過去的大模型行業里,這種更新速度幾乎難以想像。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
更值得關注的是,谷歌內部一套新的模型開發方式也逐漸顯露出來:越來越多 Agent、強化學習和工具調用方面的新能力,開始優先出現在體量更小、修改成本更低的 Flash 上。
而且最近突然加速的還不止谷歌。
就在 Gemini 3.8 發布前後,Meta 剛剛也更新了 Muse Spark 1.3剛剛Gemini38Flash來了結果慘遭對手嘲諷,把 Agent 長任務、編碼能力和推理效率列為這一代模型的主要升級方向。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
更有意思的是,Meta AI 負責人 Alexandr Wang剛剛Gemini38Flash來了結果慘遭對手嘲諷 發布新模型之後,也再次陰陽怪氣地調侃道:「我真不想這麼說,但是……Gemini 是誰?」
剛剛Gemini38Flash來了結果慘遭對手嘲諷
Pro 難產,Flash 被推上了主桌
先看主角 Gemini 3.8 Flash。
谷歌給它的定位相當高,稱其為目前谷歌最智能的推理與編程模型之一,重點瞄準端到端自主 Agent 工作流,以及需要持續運行較長時間的軟體工程任務。
從官方公布的 Benchmark 來看,谷歌顯然希望推動 Flash 擺脫「便宜、快速模型」的固有定位,進一步承擔複雜任務的執行。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
在 DeepSWE v1.1 長周期軟體工程測試中,Gemini 3.8 Flash 可以自主處理複雜的端到端工程問題,成績超過了不少體量更大的前沿模型。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
面對金融和法律等專業場景,它同樣提升明顯。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 等測試中,3.8 Flash 都顯著領先上一代 3.7 Flash;涵蓋 STEM、人文與專業知識的 HLE-Verified 測試里,它拿到了 54.9% 的成績。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
至於這款模型是怎麼做到的,就不得不提谷歌這次重點強化的 Agentic loops剛剛Gemini38Flash來了結果慘遭對手嘲諷,也就是模型在完成複雜任務時持續推理、調用工具、檢查結果並修正方案的能力。
過去很多 Coding 模型更像一次性給答案,生成一段代碼以後,後續能不能運行、哪裡需要修改,往往還得依賴用戶繼續介入。
現在的 3.8 Flash,則越來越像一個願意把活幹完的「打工聖體」。
面對複雜任務,它可以主動增加推理步驟,連續調用不同工具,根據執行結果重新評估方案,並在發現問題以後繼續修改。
因此,當用戶把 effort level剛剛Gemini38Flash來了結果慘遭對手嘲諷 調高以後,模型會投入更多推理和 Token 預算,以換取更高的複雜任務完成率;面對普通任務,也可以降低 effort level,把響應速度和使用成本控制下來。
官方 Demo 更能說明這種變化。
在 Google Antigravity剛剛Gemini38Flash來了結果慘遭對手嘲諷 中,只需要給出一個相對簡單的循環任務指令,Gemini 3.8 Flash 就可以持續調用工具,完成一個可玩的 3D 巫師闖關遊戲,其中包括謎題、環境敘事以及由 Nano Banana剛剛Gemini38Flash來了結果慘遭對手嘲諷 生成的紋理資源。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
它甚至還能做出一個完全可玩的 DOS 版 Google Maps,其中包括街景和導航功能。
不過根據網友的真實測試,3.8 Flash 的優缺點也變得更加鮮明。
目前比較一致的感受,是它真的非常快,而且便宜得驚人,但「做得快」和「最終成品最好」之間,暫時還不能完全畫上等號。
AI/ML API 用完全相同的提示詞,讓 Gemini 3.8 Flash 和 Claude Opus 5剛剛Gemini38Flash來了結果慘遭對手嘲諷 分別製作四個獨立的 Three.js 物理場景,包括針刺氣球、水球墜落、蘑菇雲以及動態原子模型。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
Gemini 3.8 Flash 總成本只有 0.12 美元,Claude Opus 5 則花了 1.86 美元,價格相差超過 15 倍;與此同時,Flash 完成每個場景都不到 70 秒,Opus 5 最慢則接近 5 分鐘。
另一位,開發者 Tim Jayas 的結果更加誇張。他把同一個提示詞分別交給 Gemini 3.8 Flash 和 Opus 5,Opus 5 花了整整 24 分鐘,3.8 Flash 只用了 37 秒。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
不過另一批測試,也暴露了 Flash 很典型的另一面。
開發者 Aditya 用 Gemini 3.8 Flash 和 Kimi K3剛剛Gemini38Flash來了結果慘遭對手嘲諷 製作同一個 Sticky Ball 遊戲時就發現,Flash 生成速度極快,消耗的 Token 也明顯更少,但最終遊戲體驗明顯落後於 K3,在運動機制、移動表現和整體遊戲設計上都有差距。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
類似情況也出現在一個高複雜度的紐約城市場景測試里。
博主 AI Pulse Daily 使用完全相同的提示詞測試 Gemini 3.8 Flash、3.7 Flash 和 Opus 5,要求模型生成一個細節密集的 Three.js 紐約城市場景。
結果 3.8 Flash 整座城市只放了 6 棵樹,甚至比三周前 3.7 Flash 的 10 棵還少,而 Opus 5 塞進了 1840 棵。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
提示詞明確要求的人行橫道條紋、水下焦散和色差效果,3.8 Flash 也全部略過;與此同時,它卻主動加入了 5 個攝像機預設、3 個後處理開關、標題卡和實時時鐘,其中不少功能根本沒有出現在用戶要求里。
另外,在價格方面,Gemini 3.8 Flash 的輸入價格仍然為每百萬 Token 0.75 美元,輸出為每百萬 Token 3.75 美元,與三周前降價後的 Gemini 3.7 Flash 保持一致,目前的優惠價格將持續到 2026 年底。
對於谷歌來說,Flash 的角色已經越來越明確:它既負責成本和速度,也一定程度上承擔過去更多由旗艦模型負責的複雜任務。
Gemini 的新能力,為什麼總在 Flash 首發?
與 Gemini 3.8 Flash 一起發布的,還有專門針對網路安全任務訓練的 Gemini 3.8 Flash Cyber。
後者通過新的 Fairwind 計劃向經過審核的防禦者開放,能力重點集中在漏洞發現、滲透測試以及自動生成安全補丁等場景。
Gemini 3.8 Flash Cyber 在標準 CyberGym 漏洞發現 Benchmark 中明顯超過上一代 Gemini 3.5 Flash Cyber,同時也超過了多款體量更大的前沿模型。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
在谷歌內部覆蓋 20 種編程語言的真實代碼測試中,它發現漏洞的成功率超過 70%。
自動修復漏洞方面,Gemini 3.8 Flash Cyber 在 CWE-Bench 上取得了 47.2% 的 Pass@1,與表現最好的前沿模型 47.8% 已經非常接近,而模型運行成本明顯更低。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
Chrome 安全團隊給出的內部結果顯示,Gemini 3.8 Flash Cyber 生成的正確漏洞補丁數量,可以達到部分大型商業模型的 2.6 倍。
安全公司 Wiz 的測試同樣顯示,使用該模型進行滲透測試以後,漏洞召回率提高了約 7.5% 至 9.7%,與此同時,成本下降約 2.3 至 5.2 倍。
谷歌雲漏洞研究團隊還披露過一個更加極端的案例,他們利用 Gemini 3.8 Flash Cyber,在不到兩個小時的時間裡發現了一處嚴重基礎漏洞,而按照傳統研究流程,類似問題通常可能需要數月時間才能被定位。
值得一提的是,在 Gemini 3.8 Flash 系列模型發布前,《華爾街日報》就曾披露 Gemini 3.8 Flash 在谷歌內部的代號為 Skimaki。
員工曾經在內部代碼工具 Jetski 中,讓它與 Anthropic 的 Claude Opus 進行對比測試,結果不少谷歌工程師反而更加偏好自家的新模型。
代碼能力重新成為谷歌重點競爭的戰場,而 Flash 目前顯然承擔了相當重要的角色。
對比之下,谷歌過去一年在旗艦模型上的進展經歷了不少波折。
Gemini 3.0 在去年 11 月發布以後曾經短暫取得領先,隨後 OpenAI 和 Anthropic 的新模型繼續向前推進,谷歌的優勢沒有維持太久。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
Noam Shazeer、Jeff Dean 等重要技術人物也在今年夏天陸續離開。
原本計劃繼續推進的 Gemini Pro 新版本同樣遭遇調整。
皮查伊曾在今年 5 月透露新版 Pro 可能在隨後一個月到來,但谷歌內部準備的 Gemini 3.5 Pro 方案最終被取消,其中一個重要原因,就是相對於 Flash 系列的能力提升不夠明顯。
更遠一些的 Gemini 4 雖然已經完成部分預訓練工作,目前仍然處在後訓練階段,距離正式發布還有一段距離。
谷歌隨後也調整了 DeepMind 的管理層,Koray Kavukcuoglu 接手更多管理職責,新管理層給團隊提出的一項明確要求,就是進一步加快模型研發與發布速度。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
大哥難產,只能靠小老弟 Flash 出來扛大旗了。
不過 Flash 最近近乎瘋狂的更新頻率,背後其實對應著大模型研發方式正在發生的一次變化。
單純依靠擴大模型規模獲得能力增長,邊際收益已經沒有前幾年那麼明顯;強化學習、Agent training、工具調用和其他後訓練技術的重要性,則持續上升。
《華爾街日報》提到一個很關鍵的細節:Flash 規模相對較小,因此修改和重新訓練模型所需要消耗的算力更低,谷歌內部可以讓多個團隊同時嘗試不同方案。
換成規模龐大的 Pro 系列以後,每一次模型調整都會涉及更多 GPU、訓練時間以及跨團隊資源協調,同樣一種後訓練實驗,試錯成本自然高得多。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
與此同時,谷歌今年明顯增加了對強化學習和後訓練的投入,還從 OpenAI 招募了後訓練負責人 Barret Zoph 擔任研究副總裁。
資源投入方式變化以後,一個結果逐漸顯現出來:新的 Agent 訓練方法、RL 策略以及工具調用機制,更容易先在 Flash 上進行實驗,並在驗證有效以後迅速進入正式版本。
從產品開發方式來看,現在的 Flash 多少有點 Gemini「高速開發分支」的意思。
模型更小,修改成本更低,所以谷歌可以讓多個團隊同時嘗試不同的 Agent training、RL 和工具調用方案,三周左右就完成一次新版本疊代。
剛剛Gemini38Flash來了結果慘遭對手嘲諷
Pro 系列承擔的任務則越來越接近真正意義上的旗艦版本,只有能力提升達到足夠大的幅度以後,投入巨量算力和內部資源更新一次才更划算。
說到底,谷歌未必一開始就計劃讓 Flash 扛起這面大旗。但陰差陽錯的是,這種局面恰好撞上了大模型研發重心的變化。
伴隨著強化學習、Agent training 和工具調用越來越重要,模型體量更小、實驗成本更低的 Flash,反而在短時間內比 Pro 更適合快速後訓練。
因此在旗艦模型難產的情況下,谷歌反倒提前摸到了 Flash 模型下半場更重要的能力:也就是更快訓練、更快驗證,以及更快把新的後訓練成果交到用戶手裡。
當然,這一切的前提是,Gemini 4 最終能爭點氣,不再讓人失望。
宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新