
「歡迎來到 AGI
時代。」
OpenAI 總裁 Greg Brockman
用這句話結束了 GPT-6 Astra
的媒體吹風會。
幾個小時前,ChatGPT、Claude
和 Grok
才經歷了一次罕見的同時宕機,但短暫故障沒有打亂 OpenAI 的發布節奏——
就在剛剛,GPT-6 Astra 正式亮相。

Brockman 對這款模型的評價,甚至超過了 OpenAI 以往任何一次新品發布:
如果幾年以後回頭追問,AGI 究竟在什麼時候誕生,我想答案大概就在這段時間,甚至可能就是這個模型……就我個人而言,我認為我們已經達到了(AGI 水平)。
對於聽慣了 AI 公司豪言壯語的人來說,問題也隨之而來:Astra 到底做到了什麼,足以讓 OpenAI 定調說「這是全球最智能、最符合人類意圖的模型」?
跑分沒有橫掃一切,價格倒是登上了頂峰
按照 OpenAI 的說法,Astra 是一次「代際躍遷」,能力提升覆蓋電腦操作、軟體工程、專業工作、科學和網路安全。

根據官方公布的數據,Astra 在代表「腦力」的研究級數學測試 FrontierMath Tier 4
和科學知識測試 GPQA Diamond
中成績是 97.6% 和 96%。
而在代表「動手能力」的長程軟體工程測試 DeepSWE
、CAD 繪製測試 BenchCAD
和漏洞利用能力測試 ExploitBench
中,Astra 也分別做到了 74.1%、95.9% 和 100%。

也就是說,GPT-6 Astra 已經把很多既有測試「刷爆」了。要想完整理解它的能力上限,我們可能需要設計一些新的測試。
但 OpenAI 更傾向於介紹 ARC-AGI-3 的成績:99.9%。
這是一項高度抽象化的測試,模型要進入一個完全陌生的小遊戲世界,不提供任何規則說明和目標,模型必須自己通過互動觀察環境的變化,推斷出這個世界的「遊戲規則」然後規划行動。

在今年 3 月剛公布時,最強的 AI 成績只有 0.51%,即使是 GPT-5.6 Sol 在默認框架下也只有 7.8%,而現在 Astra 在特設的保留推理+壓縮上下文框架下,就做到了和人類完全等同的環境推理滿分成績——這一點會和我們稍後說到的「環境操作」能力緊密相關。

作為最新的超旗艦級模型,Astra 的基本規格自然不會落後:105 萬 token 上下文窗口,最高輸出 12.8 萬 token,知識截止時間為 2026 年 4 月 30 日,支持 low、medium、high、xhigh 和 max 五檔推理強度。
但與此同時,模型的價格也來到了新高度。
標準模式下,每百萬輸入 token 收費 10 美元、輸出 50 美元;輸入超過 27.2 萬 token 後,整次請求的輸入和緩存價格翻倍,輸出價格升至 75 美元。模型依然支持更快給出結果的快速模式,相應地要支付兩倍價格。

對比起來,Astra 的輸入與輸出單價是 5.6 Sol 當前促銷價的 2.5 倍,也和 Anthropic 剛發布的 Fable 5.1 相同。
想體驗的話,我們可能還得稍微再等幾天:Astra 目前率先向小部分可信合作企業開放,ChatGPT 各級會員用戶和 API 則會在未來幾天裡陸續推送使用權限。另外還有一個涉及最高級網路攻擊能力的版本,只會提供給網路防禦機構使用。
當然,我們都知道官方口徑向來是「報喜不報憂」的,第三方獨立機構的測試稍微能給官方敘事降一下溫——

在 Artificial Analysis 最常用的通用智能獨立測試 Intelligence Index v4.1.1 中,Astra max 的成績「只有」61 分,和 GPT-5.6 Sol max 持平,低於 Fable 5.1 的 66 分、Opus 5 的 63 分以及 Muse Spark 1.3 的 62 分。
這也和 X 上一些提前獲得內測資格的開發者體感相仿:Astra 不是那種在智能上遙遙領先的模型,但它堪稱恐怖的環境理解和操作能力彌補了這一點,最終交出的輸出結果相當漂亮。

雖然在通用智能測試上不算吃香,可一旦轉到 Coding 測試就是另一回事了:
在 Artificial Analysis Coding Agent Index 中,Astra 得到 67 分,距離榜首 Fable 5.1 只差 3 分。與此同時,Astra 體現出了極佳的 token 效率,使用的 token 僅相當於 5.6 Sol max 的三分之一、Opus 5 high 的五分之一。

憑藉效率優勢,Astra max 完成單項 Coding 任務的成本和 Sol 大致相當。於是,在散點圖中我們能看到 Astra 在左上角幾乎劃出了一個專屬「斬殺區」——在相同的價格區間,Astra 目前可以說是「無敵」的。
另外,Astra 的幻覺也明顯減少。Artificial Analysis 測得 Astra max 的幻覺率為 51%,遠低於 Sol 的 92%,拒答率數據也顯示它沒有依靠頻繁拒絕回答來壓低幻覺。
單看綜合跑分,很難說 Astra 是什麼「獨一檔」的模型。但它的關鍵進步,其實藏在「模型如何使用電腦」這件事上。
為人類設計的界面,Astra 用得比人更好
Astra 的發布宣傳片開頭,引用了一個 80 年代的早期 AI 演示。當時,人對電腦說「畫一個黃色圓圈」,電腦就能照做。

同樣的夢想延續到了今天。如今,幾個人只是站在投影大螢幕前,或拿起筷子吃飯,或甩動手裡的網球拍, 同時嘴上說出想要做一個完整可玩的 3D 遊戲、把商品上架到 eBay,或是編輯照片後放入特定文件夾。
等待片刻,工作就完成了。

複雜的提示詞和來回操作修改的過程全部消失,只需要像吃飯時看劇聊天一樣,隨口說幾句話,Astra 就能把工作全部搞定。
這可能是理解 Astra 最好的方式。
OpenAI 還展示了一批更貼近日常工作的案例:
尋找貓咪寄養服務,人類平均需要半小時,Astra 用時 5 分 27 秒;尋找工作從約 5 小時縮短到 2 分 51 秒。它還能預約車管所服務、尋找公寓、填寫表格、整理日曆、更新 CRM,在 Excel 和 Power BI 中處理數據,在 Blender 中製作模型並進一步轉換成 UE5 中的交互場景。

在這些現象的背後,是一種更具衝擊力的技術路線——
以前我們希望 AI 使用一套軟體或一種服務,通常要先為它開發 API,用 MCP 協議規定可用的外部工具和數據。每多接入一個系統,都要重新處理權限、數據格式和調用邏輯。大量老舊的政務、醫療、保險和企業軟體,甚至根本沒有合適的 API。
但我們還有另一種已經為人類這種通用智能服務了幾十年的接口:GUI。
螢幕、鍵盤和滑鼠是一套覆蓋數十億台電腦、兼容無數新舊軟體的接口。模型只要能看懂螢幕、理解當前狀態並準確操作,今天仍在使用的軟體就可以直接成為它的工具。

Greg Brockman 在吹風會上也談到了這一點。他認為,AI 行業長期受困於為不同工具逐一編寫連接器;當電腦操作能力足夠成熟,Agent 就能直接穿梭於表格、表單和網頁。
模型開始主動適應人類的軟體世界,企業就不必等待整個軟體世界先完成一次「AI 化改造」。
衡量 Computer Use 能力的 OSWorld 2.0 基準測試結果也顯示,Astra 得分達到 72.6%,高於 Sol 的 65.7%;平均完成一項任務約需 40 分鐘,Sol 則需要約 75 分鐘。成功率提高約 7 個百分點,耗時減少了約 47%。

效率在這裡變得格外重要。GUI 任務往往持續幾十分鐘,包含數百次觀察、判斷和操作。每一步都可能產生截圖、上下文和推理 token。單次決策節省一點,放進長達幾百步的工作流後,差距會被迅速放大。
儘管 Astra 的單 token 價格很高,但極高的 token 效率和更少的試錯,可以有效抵消漲價。OpenAI 估算,Astra 最高配置完成一項 DeepSWE 任務的 API 成本比 Sol 低約 57%。
猝不及防地,Astra 的誕生直接改換了旗艦模型的競爭賽道。它不需要追求最高的智能分數,只需要能理解目標、接管現成工具、處理途中出現的意外,就已經可以承擔相當大一部分的人類工作。
開啟發現和創造的新時代
適應人類現有工具框架的能力,讓 Astra 擁有了讓所有內測開發者都嘆服的實際工程表現。
從已經公開的反饋看,不同於以往很多 AI 只能生成演示,Astra 已經可以在很大程度上一次性做出完整的產品了。
開發者 Flavio Adamo 試著用 Astra 單次生成一個完整的 Minecraft demo。可以說,這是讓我這個 MC 老玩家最驚艷的 demo 沒有之一。從環境、UI、音效到具體的跳躍挖掘動作和動畫效果,都和原版遊戲幾乎如出一轍,找不出多少 AI 痕跡。

另一個創作者 Tom Krcha 只給了 Astra 一張房子的照片,它就重建出了一個完整的 Blender 3D 模型,包含所有家具、電器等陳設,而且可以在本地上像玩遊戲一樣 360 度無死角遊覽。

t3dotcodes 的 CEO theo 則通過 Astra 一次性生成了可以在瀏覽器里運行的完整遊戲,所有運動、光照和建模都恰到好處,沒有 AI 生成遊戲常見的穿模,也不需要修正。

在工程 demo 之外,Astra 也在進入更廣的專業工作。
官網公布的一個案例里,它可以基於參考樣本,生成一份在排版風格上完全一致但內容複雜得多的 PPT。

法律科技公司 Legora 則用一次 Agent 運行審查了 41 份財務文件,幾分鐘內就找到了全部 4 處人為埋入的錯誤,包括藏在收入附註中的 50 萬英鎊差額。相比前一代模型,它在這項工作流上提升了近 40%,並且依然把最終判斷留給人類專家。

報稅、建築渲染、遊戲開發和財務核對,這些 Astra 擅長的工作跨越了截然不同的專業領域,共同點是都要在真實軟體中理解上下文、調用工具、發現錯誤,再把一個模糊目標推進成可交付的成果。
這也讓 Greg Brockman 的思考有了更具體的解釋。當一個系統能跨越不同的專業操作環境,自己觀察、學習、行動和糾錯,它就變成了切實的生產力。OpenAI 敢於給 Astra 冠上 AGI 之名,關鍵也在於此——
AI 終於可以從零開始獨自完成工作了。

雙手越靈活,護欄就越重要。OpenAI 表示,Astra 強化了對齊和指令遵循能力,能更好地遵守用戶設定的限制,並拒絕高風險網路請求。公司也加強了隔離測試、網路和工具權限、模型權重保護與全局行為監控,高風險操作可以被另一個模型審查和中斷。
但另一方面,OpenAI 首席科學家 Jakub Pachocki 也提醒,智能進步不會自動帶來對齊進步;模型越強,人們就越難準確理解它正在做什麼。
甚至有一種更危險的可能性:更強的模型可能理解自己正處於被監控、測試或審查的環境中,並嘗試主動欺騙監控系統。這種「反身性」雖然還不等同於意識覺醒,卻也會讓監控一款模型變得更為棘手。

當然,這種提醒更多是面向未來的。至少在當下,我們可以大膽地慶祝 Astra 的誕生——
人類花了幾十年時間,建立起了一整套以 GUI 為基礎的數字基礎設施;而 Astra 的跨越,就在於能夠直接操縱這套設施,讓人類跳過操作的部分,從意圖直達結果。
當操作的門檻被大幅壓低,專業技術也許就不再稀缺。從重複的辛勞中解放,才能凸顯人類創造力的價值。
世界的運行方式,正在悄然改變。






