宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Gemini 4 發布即「屠榜」,但我不敢半場開香檳

2026年10月01日 首頁 » 熱門科技

停更長達七個半月的 Gemini 旗艦模型,終於更新了。

就在剛剛,多個 Google 相關帳號同步宣布:Gemini 4 ArgonGemini4發布即屠榜但我不敢半場開香檳 正式發布。

並且,這可能是最近唯一一個寫作、知識和長文本能力明顯強於編程與 Agent 能力的前沿模型。

Gemini4發布即屠榜但我不敢半場開香檳

士別三日,Gemini 4 連命名方式都改變了,一眼看上去甚至像是 OpenAI 家的某個模型。官方並沒有解釋這個名字的由來,我們只知道這是把測試期間的內部代號沿用到了正式版。

而從字面來看,它代表第 18 號元素氬,一種惰性氣體,倒是和 Chrome(鉻)形成了某種有趣的對仗。

先不用急著去 Gemini App 試用——延續最近流行的「安全」敘事,Gemini 4 Argon 目前只通過 Fairwind 計劃Gemini4發布即屠榜但我不敢半場開香檳對少量網路安全合作夥伴開放,官方也並未列出全面公開的時間點,只說明「屆時首先向付費 API 用戶和 Google AI UltraGemini4發布即屠榜但我不敢半場開香檳 訂閱者開放」,普通訂閱用戶還要等上一段時間。

Gemini4發布即屠榜但我不敢半場開香檳

此前在測試場裡流出過據稱是 Gemini 4 的模型版本,但鑑於官方從未認領、沒人知道它是不是真的 Gemini 4,也不知道裡面有沒有摻了 Fable 和 Astra,那些所謂的比對測試結果實際上不太可信,我們暫時只能列舉一下官方釋出的數據(也讓這篇文章的工作量少了很多)。

至少,從官方跑分來看,Gemini 4 Argon 是極其強悍的:

Gemini4發布即屠榜但我不敢半場開香檳

你沒看錯,列舉出來的 18 項測試中,Gemini 4 在其中 13 項都取得了領先成績。

最大的領先出現在知識工作方面。在涉及真實金融分析和真實律師工作的 Vals Finance Agent v2Gemini4發布即屠榜但我不敢半場開香檳 與 Harvey’s Legal AgentGemini4發布即屠榜但我不敢半場開香檳 Benchmark 兩個測試上,甚至可以不誇張地說 Gemini 4 領先其他任何模型兩檔。這一點倒是不奇怪——即使在最拉的時候,也從未有人懷疑過 Gemini 的世界知識能力。

Gemini4發布即屠榜但我不敢半場開香檳

另一個 Gemini 傳統優勢領域是長上下文。在測試能不能用好 256k—1M 超長上下文的 GraphWalksGemini4發布即屠榜但我不敢半場開香檳 測試中,Gemini 4 同樣領先其他旗艦模型超過 10%。

一個新特性可以解釋這種領先幅度。

Gemini4發布即屠榜但我不敢半場開香檳

Gemini 4 Argon 將輸出上限從上一代的 6.4 萬 token 拉升到了 100 萬 token,也就是說只要你錢包扛得住且 Gemini 足夠有傾訴欲,它可以一口氣輸出約 70 萬到 100 萬個漢字,對思維鏈構建而言算得上是個史詩級升級。官方解釋是:

當模型擁有足夠的空間進行深入思考,並在單次推理軌跡中生成數十萬個詞元時,它將為推理帶來全新的深度,從而一次性解決棘手問題。

相比之下,Gemini 4 編程表現就有些起伏不定。在最常用的真實世界長周期軟體構建測試 DeepSWE v1.1Gemini4發布即屠榜但我不敢半場開香檳 上,Gemini 4 成績達到 77.9%,領先 GPT-6 AstraGemini4發布即屠榜但我不敢半場開香檳 和 Claude Opus 5.5Gemini4發布即屠榜但我不敢半場開香檳 接近 4 個百分點。

Gemini4發布即屠榜但我不敢半場開香檳

但在需要從零構建項目解決問題的 FrontierSWE v2Gemini4發布即屠榜但我不敢半場開香檳 和操作 Linux 終端處理複雜任務 Terminal-Bench 4.0 上,Gemini 4 都處於墊底水平。

我們大概可以這樣總結 Gemini 4 的特性:知識/寫作>編程>終端。

第三方測試也可以佐證這種判斷——

在通過盲評投票來決定成績的 Arena.ai 評分里,Gemini 4 因為處理高難度提示詞、指令遵循、創意寫作等項目都取得高分,在 Text Arena 中排名第一;但回到更注重工程能力的 Code Arena: WebDev 和 Agent Arena 中,Gemini 4 就只能排到第 8。

Gemini4發布即屠榜但我不敢半場開香檳

某種意義上,一個編程能力落後的 Gemini 稱得上是時代之幸。過度優化 Agent 編程能力,似乎讓很多前沿模型開始變得「不說人話」,包括 GPT-5.3 時期延續至今的瘋狂分行和 Opus 4.7 開始的神秘黑話問題。這種時候,一個因為編程能力一般而保留有文字審美的 Gemini 模型,可以解決很多寫作上的難題。

另一個值得關注的變化是幻覺率大幅下降。

Gemini4發布即屠榜但我不敢半場開香檳

在 Artificial Analysis 的測試中,Gemini 4 的幻覺率只有 15%,在所有前沿模型中是最低的。這代表它在面對不確定的回答時,會更傾向於說「不知道」,而不是編造答案。

但對普通用戶來說,最重要的問題當然是定價,而 Google 在這方面一向非常大氣。

Gemini 4 Argon 的官方 API 定價是每百萬 token 輸入 2 美元,輸出 10 美元,命中緩存的價格是 5% 亦即 0.1 美元。官方公告表示首發優惠期結束之後價格會翻倍,但根據經驗,大概率在下一代模型出來之前優惠期都不會結束。

Gemini4發布即屠榜但我不敢半場開香檳

以優惠期價格來算,Gemini 4 的價格是 GPT-6 Astra 和 Fable 5.1 的五分之一,大致上持平 GPT-6.1 Sol 和 Sonnet 5.5。換句話說,只要能力沒有虛假宣傳,Gemini 4 就是當前「智價比」最高的模型,用中端模型的價格就能用上旗艦的智能。

Gemini 4 Argon 的發布也終結了一個尷尬的記錄:在過去近半年的時間裡,Google AI Pro 套餐的權益描述是「可以用 3 Pro 模型」……考慮到 3.5 Flash 時代之後連 Flash 模型都能暴打 Pro,這個會員套餐更顯得相當幽默,很大程度上人們買會員只是為了那個 5T 的 Google Drive。

Gemini4發布即屠榜但我不敢半場開香檳

至少現在,Google 終於可以光明正大地宣傳自己的會員了。

寫到這裡,我也想說幾句題外話。

每個人心裡都有自己的白月光,而我在 AI 領域的白月光就是 Gemini 2.5 Pro。去年年初,2.5 Pro 文字能力的確是驚為天人,也正是在那之後,我才正式把 AI 加入了自己的工作流程之中。後來看見 Gemini 3 發布,我更是第一時間轉發到朋友圈。

從這個意義上說,沒有人比我更希望 Gemini 4 能支棱起來。

Gemini4發布即屠榜但我不敢半場開香檳

本 Gemini 粉絲的幻想

但我們還是要尊重客觀規律。像很多人評論的,大模型歸根結底是一種製造業,像手機和晶片一樣的製造業。我們不能期待一個長久沒有更新的模型,突然就力壓群雄,這跟一個長期停留在 10nm 的晶片廠突然拿出了 2nm 晶片一樣不現實。

Gemini 3.8 Flash 跑分和實測效果的巨大落差,也表明這段時間 Google 為了掩飾尷尬,有可能做了一些跑分刷榜的「特殊優化」。同理,Gemini 4 在大多數基準測試中達到 SOTA 水平也是相當可疑的——

幾乎就在 Gemini 4 公布的同時,彭博社也發出報道稱,Google 內部員工對 Gemini 4 的實際性能持懷疑態度。他們援引的「知情人士」表示,Gemini 4 在真實任務中的效果不盡如人意,「難以處理某些編碼任務」。

Gemini4發布即屠榜但我不敢半場開香檳

雖然 Google 方面迅速反駁,也有一些員工表示 Gemini 4 很不錯,但我們大概可以相信,最終來到我們面前的 Gemini 4 不會像跑分里那麼強,更何況等待 Gemini 4 實裝這段時間,又足夠 ChatGPT 和 Claude 模型疊代一個版本了。

不管怎麼說,往好的方面想,Gemini 4 Argon 的發布畢竟代表 Google 終於回到了賽場上。

它的上限未必很高,下限還是可以保證。之後要做的事,就是用大模型製造業的方法,一步一步地趕上來。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新