誰敢數數馬斯克這兩天發了多少推?
昨天的主題是 Grok Bot,今天是 Grok 4.6。
他是鐵了心要做 Top 3,哦不,是要做就做 Number 1。
距離上一代模型 Grok 4.5 發布僅僅過去了 35 天,馬斯克此時便已經預告大家 Grok 4.7 將超過當前所有模型了。
Grok 4.7 will exceed all current models. That said, Anthropic is a great company and will probably release improved models soon. However, the SpaceX training corpus is so awesome & unique that I would be shocked if any model is better at real-world engineering than 4.7.
我們先別信,先來一起看看 Grok 4.6 究竟表現如何。
xAI 對 Grok 4.6 的官方定位,是一個能夠勝任「研究一個話題、分析資訊、跨代碼庫協作、把一個想法變成一個可運行的應用」。
這類需要持續推進多個步驟的任務的模型——瞄準的是需要多輪推理、狀態保持和工具協調的真實工作場景。
Grok 4.6 想解決難題

在 Artificial Analysis Intelligence Index 上,Grok 4.6 拿到 61 分,全球第三——前面是 Claude Opus 5(63)和 Claude Fable 5(62),與 GPT-5.6 Sol 並列,身後緊跟 Kimi K3。

代際對比上,Grok 4.6 比上一代 4.5 漲了 5 分,比一個多月前的 Grok 4.3 漲了整整 23 分。Artificial Analysis 對此評價,xAI 重回前沿梯隊,「只落後於 Anthropic」。
Grok 4.6 high vs Grok 4.5 high in Grok Build Huge improvement 🔥🔥 > 3D model of an Airbus H145 helicopter in Three js
知識工作維度上,Grok 4.6 拿到 1753 分,小幅領先 Claude Fable 5 的 1741 分和 GPT-5.6 Sol 的 1728 分,在同級競品中位居榜首。
這說明模型在複雜知識任務,例如長文檔分析、跨領域問答、多步推理中綜合表現最佳。
法律與複雜專業推理方向,Harvey LAB 的數據更誇張些:Grok 4.6 拿到 15.8%,大幅領先 Fable 5 Max 的 11.3%,而 GPT-5.6 僅 2.5%。
這意味著 Grok 4.6 對專業領域的深度理解和多步推導能力領先。
多輪工具調用方面,τ³-Banking 模擬客服結合工具調用的真實業務場景,Grok 4.6 以 50.7% 拿到全場第二,僅次於 Qwen3.8 Max 的 51.3%。長程知識工作場景的 AA-Briefcase Elo 為 1577,處於 Fable 5 檔位,落後於 Opus 5 系列。
Cursor CEO Michael Truell 在發布第一時間給出背書,稱這個模型在「高難度任務和知識工作上明顯更強,把 Opus 級智能和低成本高速度結合在了一起」。
Excited to release Grok 4.6. With each release, Grok is becoming a more capable digital colleague. 4.6 is significantly better at difficult tasks and knowledge work. It combines Opus-class intelligence and polish with very low cost and high speed.
有開發者調用 Grok 4.6 的工具鏈,完成了一個河流演變過程的五階段動態演練——從早期原始生態河流,到水運貿易、工業時代改造、現代濱水區設計,直至最終的生態恢復階段。
Built from concept to code with Grok 4.6: an interactive simulation of one river crossing evolving through five eras, from a wild river to trade, industry, the modern waterfront and ecological restoration.
整個多步驟任務中,模型展現出極強的長程狀態保持與工具鏈調度能力,中途沒有出現上下文漂移或工具調用中斷。
收購 Cursor 後,編程有多能打
SpaceX 今年早些時候以約 600 億美元完成了對 Cursor 的收購,而這次模型疊代,Cursor 的數據價值首次被系統性地注入訓練流程。
具體來說,Grok 4.6 的 SFT 階段使用了 Grok 4.5 重新生成的軌跡數據,覆蓋 STEM、軟體工程和知識工作等多個領域,並通過模型自檢機制過濾有問題的訓練樣本。
換句話說,Cursor 積累的海量真實開發者調試數據,這次正式進了訓練管線。
效果立竿見影:Grok 4.6 在 DeepSWE v1.1(考察模型在真實軟體工程任務中的代碼生成與調試能力)上,從 4.5 的 54% 大幅跳到 65.9%,提升近 12 個百分點;APEX-Agents(測試多步驟 Agent 任務完成率)從 47.1% 升到 57.5%,漲了 10 個百分點。
@matt_palmer 用 Grok 4.6 構建《辦公室》這款遊戲的二維代理模擬時,最直接的感受是速度。吞吐量約為 80 tokens/秒,延遲低,他評價「可以與 Cursor 的 Composer 模式相媲美」。
我們都知道,在需要高頻疊代的 Agent 編程場景中,響應速度直接影響工作節奏。
說到價格,Grok 4.6 的 API 價格定在每百萬 input token 2 美元、output 6 美元。當 prompt 進入 xAI 的長上下文(20 萬 token 起),價格翻倍到 4 美元/12 美元,且整單所有 token 均按高價計費。
即便如此,短上下文的定價仍比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60% 以上。Artificial Analysis 的數據顯示,Grok 4.6 每任務成本約為 0.84 美元,是目前綜合能力與單任務成本比最優的模型。
Reddit /r/cursor 版塊里有開發者發帖,說自己在日常高負荷開發中用 Grok 4.6 的 High Reasoning 模式做前期架構規劃,再把任務下發給輕量級 Agent 完成,感覺「性價比高到有點不真實」。
另有人表示直接從 Claude Opus 4.8 爬牆,原因是「對我的 use case 能完成同樣的事,但省了快 70% 的錢」。
高度依賴上下文緩存的 Agent 編程中,調用同等能力的 Claude Opus 每次請求成本約 0.052 美元,DeepSeek V4 Pro 約 0.000875 美元,Grok 4.6 介於兩者之間,但在響應速度和綜合智能上明顯占優。
有測試者分別用 Grok 4.6 和 Claude Opus 5 處理來自馬斯克 TERAFAB 大型工廠的三個 3D 場景——黃昏時的外部環境、潔淨室生產車間、帶有行走工人的中央操作大廳,所有場景均直接通過 API 獲取,未做任何編輯。
兩個模型都在第一次嘗試時成功交付了可運行的代碼,但成本差距顯著:Grok 4.6 花費 0.38 美元,Claude Opus 5 花費 2.06 美元——同等輸出質量下,成本差了 5.4 倍。
此外,Grok 在每個場景中使用的 token 數量也明顯更少。
Grok 能躋身新御三家嗎
2025 年底,行業共識里的御三家是 OpenAI、Anthropic、Google。
現在看 Artificial Analysis 的總榜前排:Claude Opus 5 (63)、Claude Fable 5 (62)、Grok 4.6 (61)、GPT-5.6 Sol (61)、Kimi K3 (約 59.7)。
Google 不在這張表的前排。
它自 2 月的 Gemini 3.1 Pro 之後就沒有發過前沿模型。旗艦 Gemini 3.5 Pro 被報道落後計劃數月,至今只在合作夥伴內測;最近一輪 Google 發的是 3.6 Flash、3.5 Flash-Lite 和一個安全垂類的 Flash Cyber。
隨著 DeepMind 的 CEO 離任、強化學習團隊流失,SemiAnalysis 認為 DeepMind 已經不再是一家前沿實驗室。
第三把椅子空出來了一半。
但擠進來的Grok 能坐穩嗎?

提到 Grok,我們也不免想到極端言論、對馬斯克的過度讚美、圖像生成被用來做非自願的性化內容。對合規和負責任 AI 要求嚴格的企業來說,有些東西不會因為分數變好而消失。
一個月前,Grok Build CLI 在本地初始化和每次任務執行時,以完全隱蔽的形式,在後台將用戶的整個本地項目倉庫進行強制性打包,並將其傳輸至 SpaceXAI 的雲端伺服器上。
所以在 4.6 發布之後,它也面臨這樣的聲音:不會偷偷把我的代碼庫打包帶走吧?
不過,對夾在 Grok 4.6 和 DeepSeek V4 Pro 中間的那些模型來說,今天大概是最難受的一天。
畢竟「不怕朋友過得苦,就怕朋友開路虎。」






