OpenAI正式推出品牌史上能力最強大模型GPT-6 Astra,官方將這款模型定義為全球智能水平最高、對齊效果最優的生成式AI模型。
其訓練工作在美國德州Stargate超算基地完成,動用超過10萬張GPU完成預訓練,也是OpenAI首次大規模使用前代模型參與監督訓練的旗艦產品。

那麼它的能力有多強?
Epoch AI聯合曼徹斯特大學發布 FrontierMath Erdős(FME)基準測試論文,GPT-6 Astra 成為全場唯一交出有效答卷的大模型。
在包含68道人類懸而未決的Erdős數學難題的嚴苛測試中,它一舉攻克5道長期未解猜想,其餘GPT-5.6、Claude Fable 5.1等四款主流AI全部得0分。
測試選用全部沒有標準答案的開放難題,杜絕訓練集「背答案」,要求AI輸出Lean形式化證明,由核心自動核驗對錯;所有模型統一預算300美元、限時72小時,條件完全公平。
標準測試環節,GPT-6 Astra成功解決2道題目,放寬算力預算的追加實驗中又攻克3道,其中就包括Erdős18歲提出、自稱「人生第一個正經問題」的1931年解離集猜想,以及極值圖論赫赫有名的Erdős-Sós猜想,這些題目數十年來困住無數頂尖數學家。
五道成果里,既有構造反例推翻舊猜想,也有完整證明新命題,難度非同一般。
GPT-6 Astra完成五道題全部嘗試合計消耗超22萬美元算力,而標準基準測試本身只花了約2萬美元,按300美元一次、3%成功率計算,解出一道重要開放問題的期望成本約為1萬美元。
不過也有論文指出,模型有可能想出正確思路,卻無法轉換成Lean形式證明;基準只考察解題,而數學研究同樣看重提出新問題,68道難題依舊有63道沒被解開,即便OpenAI宣布「AGI時代到來了」,但距離全面攻克高階數學還有很長距離。






