上周末,Anthropic CEO 阿莫迪
帶頭髮長文呼籲減速,奧特曼
、馬斯克
和哈薩比斯
等幾大頂流也紛紛在 AI 剎車這件事上達成共識。
可倡議書剛發出來沒幾天,GPT-6 Sol
和 Claude Opus 5.2
的爆料資訊卻又在本周雙雙洗版。不是說好要踩剎車了嗎?怎麼又捲起來了。
OpenAI 放出重磅預告,GPT-6 Sol 成猜測大熱門
昨天,OpenAI 賽博義父 Tibo
在社交平台上神秘兮兮地表示,這周要端出一批分量堪比 DevDay
的重磅更新。

奧特曼隨即順水推舟轉發,並拋出了經典的謎語人式預告。

根據部分測試用戶反映,自己的日常請求似乎已經被悄悄分流到了 GPT-6 Sol。X 用戶 Kiran Jd 昨天也曬出了詳細體驗:
新模型的普通模式速度至少提升了 50%,token 的響應時間改善了約 67%;他讓兩個任務線程連續跑了兩個多小時,最後只花掉了大概 3% 的周額度。用 Kiran Jd 的話來說,新模型更像是一款「更便宜的 Astra
」。

此外,各顯神通的網友們,也找到了一些關於鑑定新模型的蛛絲馬跡。

有網友嘗試在不聯網、不調用記憶的情況下,讓模型回答競品 Claude Opus 4.7 的發布時間,覺得只要能準確報出新事件,就證明後台換了更新的知識底座;

還有網友試圖通過抓包看內部的「juice」數值來區分版本。
除了模型本身的傳聞,OpenAI 聯合創始人布羅克曼
最近也吊足了胃口。他透露 OpenAI 在「另一個千禧年數學難題」上取得了顯著進展。

而根據之前流出的網傳消息,這次的突破方向幾乎被鎖定在了代數幾何皇冠上的明珠——霍奇猜想(Hodge Conjecture)。

作為代數幾何領域最著名的開放問題之一,霍奇猜想試圖解答一個非常抽象的問題:那些通過拓撲和微積分分析觀察到的某些幾何結構,究竟能否全部對應到由代數方程定義出來的幾何對象上?
此外,據網友 Leo 爆料, OpenAI 或 Anthropic 還同樣在集中重兵,逼近另一道千禧難題——BSD 猜想(Birch and Swinnerton-Dyer 猜想)。

Claude Opus 5.2 被曝內測,AI 開始主動檢查自己的工作
最近幾天,幾位 Claude Code 的重度用戶表示自己疑似內測了未公開的 Opus 5.2,測試場景覆蓋了寫代碼、操縱瀏覽器、調用插件和多 Agent 協同。

用戶 Chetaslua 提到,界面上寫的雖然還是 Opus 5,但後台可能已經切成了新版本。
在他放出的案例里,模型跑完用戶交代的任務後並沒有直接歇工,而是主動檢查並優化了一遍產出結果。

另一位用戶 Gegam 連續測了兩天,發現這版模型處理殘缺資訊的能力明顯變強,不需要用戶來回確認細節。在 8 個複雜測試任務里,模型不僅一路推進到底,收尾時還會自我覆核。
在調用能力方面,他觀察到模型不會一股腦把 Skills、MCP 和插件全塞進上下文,而是按需索取,跑完大量重活後,會話只消耗了約 60% 的上下文。
更戲劇化的是,在多 Agent 協作測試里,一個疑似 Opus 5.2 的子 Agent 甚至挑出了另一個模型在任務分配上的毛病,並要求重新分工。據此,Gegam 認為它的能力已經夠到了 Astra 和 Fable 的水平。

上下滑動查看更多內容
在視覺生成上也有類似的反饋。
用戶 SuSu 酥酥用一張「戴頭盔的鵜鶘騎自行車」的 2D 線稿做測試,模型不僅把它擴充成包含了道路、燈塔和圍巾的完整 3D 場景,還在初稿後主動進行了多輪細化。

另一位用戶 Conor Dart 用一個耗時 51 分鐘的項目測試後,也認為該模型在單次成功率和畫質上提升明顯。


還有網友就在 Microsoft Foundry 中翻出了疑似 claude-opus-5-2 的模型標識,暗示 Anthropic 已經在雲平台側做準備。

如果不出意外,我們在本周就能見到這兩款新模型登場。至於 Codex 會不會順手再重置一次額度,就看 Claude Opus 5.2 給不給力了。
回過頭看,上周末那份言之鑿鑿的減速倡議,反倒更像是一場各懷心思的心理戰:人人都希望對手先踩剎車,好讓自己在彎道上多超半個身位。






