
以近乎下餃子的速度,Gemini 又雙叒更新了。
今天凌晨,Gemini 3.8 Flash
正式上線。這已經是 Google 在六周之內發布的第三款 Flash 模型。

看起來,Google 要把「小步快跑」的戰略貫徹到底。但我比較擔心的是,按這個速度,在 Gemini 4
出來之前 3.x 的版本號好像不太夠用了……
從版本號上看這只是一個常規更新,但 Google 給 Flash 系列模型安排的任務卻越來越重。官方說法稱,它的目標是編寫和修改大型項目、反覆調用工具、獨立完成持續數小時的複雜工作。
這些一般用來衡量頂級 Agentic 模型
的活兒,如今都委派給了 3.8 Flash。

Flash 系列原本的意義是跑得更快、花得更少,但現在,它不得不代替遲遲沒有出現的 3.5 Pro,證明 Google 仍有能力留在牌桌上。
看官方跑分,Google 似乎真的做到了;但社區反饋和我們的簡單測試得出了一個相反的結論:
六周連更三代,Gemini 3.8 Flash 依然「聖質如初」。
三周一個新模型,跑分已逼近 Opus 5
Google 將 Gemini 3.8 Flash 稱為「迄今最聰明的 Flash 模型」,主要面向長程軟體工程、自主 Agent 和複雜企業工作流。
話都這樣說了,那最顯眼的提升自然是編程。
在測試長程軟體工程能力的 DeepSWE v1.1
中,Gemini 3.8 Flash 拿到 71.0% 的成績,相比 3.7 Flash 的 65.3% 又提高了近 6 個百分點,距離 Claude Opus 5
的 74.0% 只剩一步之遙——要知道,一個半月以前的 3.6 Flash 只有 49%。

而在跨越 STEM、人文和專業知識的 HLE-Verified
中,3.8 Flash 得分 54.9%,略高於 Opus 5 的 54.4%。
在部分多模態測試中,優勢甚至更為明顯:複雜圖表理解測試 CharXiv Reasoning
得分 86.2%,超過 Opus 5 的 83.7%;採用 Agent 模式處理長影片時,LVBench
得分達到 87.8%,更是碾壓 GPT-5.6 Sol
和 Opus 5 在內的一眾頂級模型。

金融和法律也是 Google 重點宣傳的方向。3.8 Flash 在 Vals Finance Agent V2 和 Harvey’s Legal Agent
Benchmark 中均超過 3.7 Flash 及其他更昂貴的前沿模型。

只看這些數字,一款價格遠低於 Opus 5 的 Flash 模型,似乎已經在編程、圖表、影片和部分專業任務中摸到了旗艦模型的門檻。
好消息是,這些能力提升算是「免費升級」,因為 3.8 Flash 和不久前發布的 3.7 Flash 價格保持一致:每百萬 Token 輸入 0.75 美元,輸出 3.75 美元。
原則上這只是限時優惠價格,2027 年 1 月 1 日起,輸入輸出價格將分別恢復至 1.5 美元和 7.5 美元。

其實早在 3.6 Flash 發布時,Google 就說過這優惠價只會持續到年底;但現在看來,他們更新模型的速度已經明顯快過更新價格。說不定這個優惠政策,能熬走四五代模型。
Google 解釋稱,3.8 Flash 之所以能完成更困難的任務,主要是因為它「更加努力」。也就是說,面對複雜問題時,它會執行更多推理步驟、反覆調用工具,並在過程中檢查自己的工作。

代價是,它可能比 3.7 Flash 消耗更多的 Token。Google 甚至建議,如果任務更重視計算效率,可以選擇降低推理檔位,或者繼續使用 3.7 Flash。從這個角度來看,3.8 Flash 所謂的更強,似乎有相當一部分來自這種推理上的「強制超頻」。
與 3.8 Flash 一起發布的還有 3.8 Flash Cyber。在頂尖大模型越獄發動攻擊已經變成一種新的 benchmark 的當下,Cyber 可以說是專門給網路安全機構和網路基礎設施維護者用來發現、修復漏洞的專用「補鍋匠」。

Google 表示,在一項覆蓋 20 種編程語言的內部漏洞發現測試中,其成功率超過 70%。不過,這款模型只通過 Fairwind Program 提供給可信的網路安全機構,普通用戶還是接觸不到。
速度很 Flash,結果也還是 Flash
為了彰顯對 3.8 Flash 的宣傳所言非虛,Google 在官方部落格中準備了幾段炫技演示。
其中一個是完整的 3D 魔法城堡。玩家扮演巫師在城堡中探索,場景里包含謎題、環境敘事、可交互物品和完整關卡,紋理由 Nano Banana 負責生成。

另一個案例則把 Google Maps 塞進了 DOS 界面。它復刻了早年的電腦視覺風格,功能相當完善,可以搜索地點、規劃路線,甚至進入街景界面。

至少從官方影片來看,這些已經是具備交互功能和基本產品邏輯的完整 Demo 了。
但 Google 說的話吧,我們也就姑且聽聽,畢竟前天他們還向《華爾街日報》爆料稱內部工程師編程時更喜歡用 3.8 Flash 而不是 Opus 5……
結果怎樣,還是要實測了才知道。
所以,我們也拿了兩個類似的任務,簡單測試了下 3.8 Flash 的成色。
第一項測試是利用 Three.js 搭建一個空客 H145 直升機的 3D 模型。3.8 Flash 沒讓我等太久,僅用不到一分鐘就拆解完了需求,然後以恐怖的速度傾瀉出代碼;又過了 109 秒,場景和模型就都做好了。

單從生成速度來看,它的確對得起 Flash 的名頭。
但打開看結果,有點不對勁了。功能倒是齊全的,基本光照也有,但機身細節、部件關係和運動方式都相當粗糙。跑是能跑,但和 H145 直升機的關係約等於雞仔餅與雞仔的關係。
一直有看的讀者應該熟悉,這正是昨天我們報道 Fable 5.1 時援引過的測試案例。怎麼說呢?由奢入儉難啊……

第二項測試是 3D 水流模擬,要求設置可替換的地形,來模擬降雨和地表徑流在地形上的移動。同樣是兩分鐘做出來,但這個火山口好像有點漏水……

這類結果的微妙之處在於,它在工程上確實不是完全失敗。任務能結項,代碼通常能運行,要求的功能也齊全,但顯然離官方案例有著肉眼可見的距離。
X 上的首批用戶反饋也出現了類似分裂。一方面,3.8 Flash 的響應速度普遍得到認可;但與此同時,它在真實編程和生成任務中依然容易草率理解需求,迅速交出一個形式完整、但細節一塌糊塗的結果。

這未必就代表著 Google 偽造了跑分。更有可能,官方和用戶測試已經是完全不同的使用方式。
在魔法城堡的案例里,官方明確提到,它是由 3.8 Flash 在 Antigravity 中通過循環指令持續工作,並調用 Nano Banana 生成了場景紋理。
換句話說,官方樣例里模型通常有專門設計的 Agent 框架、工具環境和明確的多輪測試標準,而我們用的時候,通常只是給它一段一次性的自然語言指令。
Google 展示的是 3.8 Flash 被整套技術棧托舉之後的上限;我們接觸到的,是模型單獨工作時的下限。因此,3.8 Flash 有可能是個不錯的 Agent 零件,但離單獨撐起一套可靠的自主工作流還有距離。

更值得注意的是,Google 聲稱 3.8 Flash 會更認真地推理、調用工具和檢查結果,但實際體驗很難感受到這種「勤奮」。哪怕將推理等級調到最高,它給人的感覺也不是深思熟慮規劃後作答,而是快速堆出一個能交差的結果。
Google 原本想證明,Flash 模型也能在部分場景干旗艦模型的重活,但至少現階段,它的判斷力、穩定性和完成度和旗艦模型相比還是有很明顯的差距。
模型之間,等級森嚴。
Google 不爭第一,反而可能贏得更多
就在 3.8 Flash 發布前一天,Google AI Studio 負責人 Logan Kilpatrick 放出了一段與 Google DeepMind 新掌門人 Koray Kavukcuoglu 的訪談。

Koray 在採訪中承認,Google 當前的模型「略低於前沿」,但也相當直接地回應了外界關於 Google 已經放棄最強模型競爭的說法:
除了站在前沿,沒有別的事情對我們更重要。我百分之百確定,我們會回到前沿。
但表態和現實是兩回事。此前獲悉,Gemini 3.5 Pro 交付失敗之後,Google 短期內不再押注 Fable、Opus 級別的超大規模模型,而是將更多資源轉向成本更低、疊代更快的 Flash。
當然,這不代表 Koray 說的是空話。Gemini 4 仍然承擔著帶領 Google 重返第一梯隊的長期目標,但不在第一梯隊,人也是要吃飯的——在那之前,Flash 要負責守住用戶、產品、開發者和收入。
不過,「前沿」有時是一種詛咒。
OpenAI 即將推出的 Astra 已經達到了所謂「關鍵級」網路安全能力,可以在較少人工介入的情況下發現未知漏洞;研究者也擔心,下一代模型可能逐漸採用越來越難觀察內部推理過程的架構,讓依靠思維鏈監控危險行為變得更困難。

Anthropic 的 Fable 5.1 則展示了另一種代價——它的能力大幅領先,但社區反饋表示,長任務、子 Agent 和複雜工作流甚至會在兩個簡單問題後就吞噬掉 Max 訂閱計劃的五小時額度。
當前沿模型繼續前進,它們帶來的還有更難控制的能力、更昂貴的推理過程,以及監管機構的巨大壓力。
從這個角度來看,3.5 Pro 的失敗未必完全是壞事。
轉向 Flash 以後,Google 可以將數月一次的前沿模型豪賭,變成像普通軟體一樣持續更新。新的 Flash 模型可以迅速進入 Gemini App、AI Studio、Antigravity 乃至 Google 搜索,在真實使用中暴露問題,再以「周更」的節奏修修補補。

如果 3.5 Pro 沒有失敗,Google 未必會這麼決絕地走上這條路。
Gemini App 的月活躍用戶已經超過 10 億,成為 Google 歷史上增長最快的產品;從去年五月至今,它增加了約 6 億用戶。
可見,增長不需要最強的模型。
大多數人不會讓 AI 獨自連續工作九個小時,也不會要求它發現零日漏洞。他們只是想搜索資料、修改照片、總結郵件、做心理諮詢或者寫一篇小說給自己看。這種時候,沒有被長程任務優化污染的 Gemini,反而能寫出更好的文字。
即將在中國市場補上空缺的 Apple Intelligence 也是如此。它首先要解決的是通知、文本、圖片、Siri 和跨應用操作問題,而非在 benchmark 中擊敗誰。

對於要被塞進數億台手機、瀏覽器和辦公軟體的 AI 而言,速度快、成本低、能夠高並發運行,比拿下排行榜第一更重要。

退出最強模型的消耗戰,可能是一門更輕鬆的生意。
可這也意味著,在 Gemini 4 真正出現之前,為 Google 技術力代言這項工作只能由 Flash 強行頂上。
於是,Gemini 3.8 Flash 成了一款絕無僅有的奇怪模型。

它既要足夠快、足夠便宜,塞進搜索、手機和十億人的日常;又要像旗艦模型一樣長時間工作、反覆調用工具,承擔複雜編程和 Agent 任務。
理想很美,現實很糟。兩種相反目標的張力之下,3.8 Flash 只能在官方跑分里冒充一會兒 Pro 的樣子。






