我們還沒等來Gemini 3.5 Pro,卻等來了它的三位同事。
就在Google一次性甩出3款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、以及一個只給政府和「可信合作夥伴」用的Gemini 3.5 Flash Cyber。
三款Gemini,各自領到了一份相當具體的工作:3.6 Flash負責複雜任務,3.5 Flash-Lite負責高並發流水線,3.5 Flash Cyber負責尋找和修復代碼漏洞。
一個當主力,一個跑量,一個負責安全。大模型已經開始像一支工程團隊那樣分工。

順便說下,這波發布,原本的主角本該是Gemini 3.5 Pro。早在今年5月的Google I/O上,Google曾經提了句Gemini 3.5 Pro「6月底見」,結果7月過去了大半,3.5 Pro還是沒發,引發業界猜測3.5 Pro跳票了。而這次三箭齊發,某種程度上也算是暫時交差。
但Google也沒含糊,官方放話說:「Gemini 3.5 Pro目前正在與合作夥伴開展測試,我們計劃在準備就緒後儘快廣泛開放。」同時,還不忘再賣個關子,「我們最雄心勃勃的下一次預訓練已經啟動,Gemini 4正在路上。」

Emmm也就是說,雖然3.5 Pro難產,但是4.0已在緊鑼密鼓地干。
好了,話不多說,先來看新三款模型怎麼個事兒。
/01/
3.6 Flash:更便宜,也更聰明
三款模型中,Gemini 3.6 Flash被Google稱為「workhorse model」,意思是承擔日常複雜工作的主力模型。
它直接在3.5 Flash基礎上升級,主要強化了代碼、知識工作、多模態理解和電腦操作能力。但Google反覆強調的指標,並非參數量,而是「Token效率」。
我們看到在綜合評估的Artificial Analysis Index數據里,3.5 Flash平均消耗28K Token,3.6 Flash平均消耗23K Token,降幅約17%。在DeepSWE v1.1測試中(測試模型編碼和長任務能力),3.5 Flash完成一個任務平均消耗276K Token,3.6 Flash完成同樣的任務平均只消耗97K Token,降幅約65%。

截圖自 DeepSWE
Token少了意味著什麼?同樣的活兒,讓你少花錢。Google稱,3.6 Flash在執行多步驟工作流時,會減少推理步驟和工具調用次數,同時降低不必要的代碼修改與重複執行。
價格方面,3.6 Flash的輸入價格為每百萬Token 1.5美元,輸出價格為每百萬Token 7.5美元。此前3.5 Flash是9美元,直接砍了16.7%。再疊加「輸出Token本身少17%」的效果,做同樣一個Agent任務的實際成本,大概會下降三成左右。Google試圖把衡量標準從「每百萬Token多少錢」,進一步推向「完成一項任務總共多少錢」。


截圖自 Artificial Analysis Index官網
別看價格便宜了,能力卻蹭蹭漲了,像極了當代打工人的現狀。Google給出了一組對比圖。


截圖自 Google Blog
上圖的四組柱狀圖可見,3.6 Flash在軟體工程、機器學習工程、知識工作和電腦操作四類Agent任務上,都高於上一代3.5 Flash,也高於3.1 Pro。
在長期軟體工程測試DeepSWE v1.1中,3.6 Flash得分49%,高於3.5 Flash的37%;在機器學習工程測試MLE-Bench中,兩者分別為63.9%和49.7%;知識工作測試GDPval-AA v2中,3.6 Flash獲得1421分,3.5 Flash為1349分。
這次更新中有個細節,我覺得挺關鍵的。Google還強化了3.6 Flash的Computer Use能力(電腦操作能力),在測試電腦操作能力的OSWorld-Verified中,從上一代的78.4%提升至83.0%。Computer Use通過Gemini API和Gemini Enterprise,以內置客戶端工具的形式提供。
什麽叫Computer Use?簡單說就是,AI可以打開你的瀏覽器、操作你的電腦、點擊按鈕、填寫表單、跨應用做事。這個能力先被Anthropic的Claude 3.5 Sonnet率先端上電腦界面(Claude Computer Use),之後OpenAI、Google陸續跟上。
光看benchmark數字可能不夠直觀,Google直接放出一個對比影片,讓3.5 Flash和3.6 Flash分別跑同一個任務,任務是,在維基百科上找到耶魯大學莫爾斯學院的院徽,下載下來,再用Python代碼把圖片改格式、調尺寸。
這個任務其實是三件事:資訊檢索(去維基百科翻)、文件下載(把圖片扒下來)、代碼執行(寫Python改格式)。結果在OSWorld-Verified測試中,3.5 Flash消耗了3833個Token,執行了18步,最終完成度評分85分;3.6 Flash只消耗了1695個Token,執行了14步,最終完成度100分。

截圖自 Google Blog
也就是說,如果你原來跑一個AI Agent每月要花1萬塊,現在用3.6 Flash可能5000塊就夠了,而且還更快、更穩定。
這次Gemini 3.6 Flash的整個更新邏輯,幾乎完全圍繞這一件事展開的。
更有說服力的,是Google這次亮出的幾個真實的客戶案例,秀出了它在文檔解析、圖表數據分析、報告撰寫等多任務的表現。
具體見下圖。左上圖,在金融平台AIS上,3.6 Flash做分析財報和會議記錄,效率碾壓3.5 Flash。右上圖,在AGY平台上,3.6 Flash通過多智能體協作跑代碼遷移,延遲更低、質量更高。左下圖,利用Canvas功能,一句話讓 3.6 Flash 做一個「3D 紋理提取器」,直接用在3D建模。右下圖,3.6 Flash 靠視覺理解,直接搭出一個可交互的主題設計工作檯。

截圖來自Google Blog,製圖來自科技行者
值得一提的是,3.5 Flash的知識截止時間是2025年1月,3.6 Flash直接更新到2026年3月。也就是說,直到四個月前的大部分事兒它都知道,也都能聊。
以上屬實是Agent的典型場景,看來3.6 Flash想表達的是,「我們的3.6 Flash不僅省錢,還很實用」。
/02/
3.5 Flash-Lite:一個小殺器,居然打過了它的大哥
如果說3.6 Flash是主角,那3.5 Flash-Lite就是這次發布里最有意思的「小殺器」。
Google給它的定位是,3.5系列裡最快、最便宜的一款。它瞄準的就是另一類需求:量大、頻繁、對延遲敏感。
在Terminal-Bench 2.1中,3.5 Flash-Lite的編碼和代理任務能力達到54%,而3.1 Flash-Lite是31%。在GDM-MRCR v2中,3.5 Flash-Lite的長上下文能力是72.2%,3.1 Flash-Lite是60.1%。在GDPval-AA v2中,3.5 Flash-Lite的真實世界任務執行能力達到1140分,而3.1 Flash-Lite是642分。

而在許多代理和編碼評估中,3.5 Flash-Lite的性能甚至強於3 Flash,包括 SWE-Bench Pro測試是54.2%比49.6%,OSWorld-Verified測試是74.0%比65.1%。

按照Artificial Analysis測試,3.5 Flash-Lite每秒可以輸出350個Token,是Gemini 3.5系列中速度最快的模型。它的價格也更低,每百萬輸入Token 0.3美元,每百萬輸出Token 2.5美元。
Google列出的典型場景有很多,包括Agent搜索、文檔處理、大規模數據提取、票據翻譯和摘要等。其中在電商場景,我看Google截圖顯示,3.5 Flash-Lite從一個海量的電商數據集裡,批量提取產品特徵,併合成分析。

3.5 Flash-Lite還允許開發者設置不同的「思考等級」。簡單任務,可以選擇較低的思考強度,以優先控制延遲和成本;遇到多步驟子任務時,再提高推理強度。
Google還展示了一個有意思的用法,讓3.5 Flash-Lite和3.6 Flash協作:3.6 Flash作為「總控智能體(Master Agent)」,負責規劃;3.5 Flash-Lite負責「批量出活」。展示的場景是,用戶說「幫我做幾個網頁設計」,然後3.5 Flash-Lite並行生成了25個可探索的設計概念。
等等,這一幕怎麼有點熟悉,這也許是當代AI大模型新潮流——人類指揮,大模型理解目標、拆分任務,小模型幹活。
03/
3.5 Flash Cyber專門修漏洞
第三款模型Gemini 3.5 Flash Cyber更加特殊。它基於3.5 Flash進行安全領域微調,主要用於發現、驗證和修復代碼漏洞,並與Google的代碼安全Agent CodeMender(Google的代碼安全智能體)配合使用。
但是這個模型不對所有人開放,只提供給「政府和可信合作夥伴」,作為CodeMender的限量試點。
Google還提到,3.6 Flash引入了增強的Frontier Safety安全防護,覆蓋化學、生物、放射、核武(CBRN)、網路攻擊濫用四個方向。這些防護讓模型對越獄攻擊(jailbreaks),更具抗性。
04/
一個信號
聊完新模型,還想聊一件事,今天業內對Google為什麼不發新Pro,反而集中發三個Flash討論比較多。
我看到Google在這篇官方部落格的開頭寫道:「開發者和客戶在構建生產級AI Agent時,需要更高的Token效率、更低的延遲、更可靠的性能。」

這麼理解吧,當大模型的更新速度比你家樓下奶茶店出新品還快時,大家開始算賬了。
矽谷創投圈有個術語,叫Unit Economics單位經濟模型,原本指一家公司做一單生意能不能賺錢,通常用在SaaS、電商、外賣這些燒錢換增長的行業。現在這個詞,輪到AI應用了。
AI的每一次調用都要算出經濟賬:Agent跑一次要花多少錢?Token省下的錢能不能覆蓋開發成本?性價比高不高?
做AI應用,已經不再是「選哪個模型最強」這麼簡單了。就像點奶茶,你不會每次都點最貴的那款,得看今天想解什麼渴、預算多少、能等多久。
話說回來,那款「最貴的」Pro,我們還是挺期待的。






