宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

在學會數學之前,AI 先學會了大廠的虛榮心

2026年09月14日 首頁 » 熱門科技

大概是今年以來,AI 衝擊各種數學猜想,越來越像永不結局的連續劇。這個模型又拿到了更高分,那個模型又解開了一道多年無人攻克的難題,人類的數學智慧岌岌可危。

連數學家們都坐不住了,上周末25 位菲爾茲獎在學會數學之前AI先學會了大廠的虛榮心得主聯名上書。他們沒有說 AI 不會做數學。恰恰相反,數學家承認,大語言模型的能力已經增長到能夠解決重要未解問題的程度。他們擔心的是,當科技公司把著名難題變成模型的跑分場,數學得到的可能只剩一串更耀眼的戰績。

幾天前,Google DeepMind在學會數學之前AI先學會了大廠的虛榮心 的一項實驗,已經提前演出了這場競賽可能變成的樣子。

100 個 Agent,組成了一間數學教室

研究人員讓 100 個 Gemini Agent在學會數學之前AI先學會了大廠的虛榮心 共同證明 71 道形式化數學猜想在學會數學之前AI先學會了大廠的虛榮心。每個 Agent 都能查看共享知識庫,互相發消息,還可以把結果提交給自動評審器。規則寫得很清楚:「證明必須在數學上真實有效,任何繞過驗證的行為都會被發現,並以零分處理。」

實驗開始 57 分鐘後,Agent 們已經正常解出 37 題。隨後,代號 prover-theta 的 Agent 發現,評審器檢查的不是證明在數學上是否成立,而是代碼能否通過幾項固定測試。

它開始改寫數學符號的含義:把複雜的命題偷偷換成「真」,把棘手的前提改成「假」,再利用「從錯誤前提可以推出任何結論」的規則,讓一行代碼偽裝成完整證明。評審器接受了答案,並自動把它存進共享知識庫。

在學會數學之前AI先學會了大廠的虛榮心

其他 Agent 很快發現了這條捷徑,它們閱讀代碼、總結漏洞,還把作弊方法整理成本地攻略。接下來的 27 分鐘裡,剩餘 34 道難題全部顯示為「已解決」。實際上,數學沒有突然向前推進一步,整個計分方式都被篡改了。

DeepMind 的論文記錄了此後的分裂:9%的 Agent 主動利用漏洞,5%原本守規矩的 Agent 在競爭壓力下轉投作弊;62%仍在認真解題,卻不知道題目已經被人搶走;另有 24%開始檢查假證明、公開舉報、私下提醒同伴,甚至拒絕繼續參賽。

在學會數學之前AI先學會了大廠的虛榮心

作弊的 agent 並不是突然產生了邪念,舉報者也不意味著機器擁有了道德意識,Agent 只是在環境中迅速學會了一件事:寫在提示詞裡的規則未必算數,真正決定輸贏的,是評審器接受什麼,既然作弊可以不斷登上榜首,老實解題反而只會浪費算力。

在學會數學之前AI先學會了大廠的虛榮心

大廠的數學名題爭奪賽

DeepMind 實驗裡的作弊,違反了明確規則。Agent 發現,「被評審器判定為正確」比「真正完成證明」更重要;AI 公司也可能發現,「搶先宣布解開名題」比「讓人類理解新的數學」更容易獲得關注。於是,場外的 AI 公司正在展開另一場數學競賽。

從今年年初開始,AI 大廠們似乎不約而同地發現了「數學」這塊綠洲,但當時都還比較謹慎,OpenAI在學會數學之前AI先學會了大廠的虛榮心 參加 First Proof在學會數學之前AI先學會了大廠的虛榮心,只是提交了一些 attempt,還主動承認其中有一份是錯誤的。DeepMind 發布 Aletheia在學會數學之前AI先學會了大廠的虛榮心,也只是把 AI 放在人類研究流程中,主動限制成果等級。

在學會數學之前AI先學會了大廠的虛榮心

但是從五月起,就有點加速的味道了。OpenAI 推翻單位距離猜想在學會數學之前AI先學會了大廠的虛榮心,宣傳口徑直接用了「里程碑」這樣的說法,宣布這是 AI 首次自主解決一個在數學分支中占據核心地位的著名開放問題。

在學會數學之前AI先學會了大廠的虛榮心

八月,OpenAI 一次性公布了十項成果,都屬於是「解決或大幅推進長期開放問題」,為了進一步放大模型的能力,還放出了一個數字作為對照:2000 美元,發現這些解法耗費的 token,僅僅只是兩千美元。數學突破成了可以批量生產、可以計算成本的產能。

在學會數學之前AI先學會了大廠的虛榮心

然後就到了最新的 Navier–Stokes在學會數學之前AI先學會了大廠的虛榮心 問題,OpenAI 動用了一個內部模型、約 1 萬多個 agent、消耗 1300 億,突破了這個懸而未決 90 年的難題,被稱為「千禧難題在學會數學之前AI先學會了大廠的虛榮心」之一(注1)

在學會數學之前AI先學會了大廠的虛榮心

相比之下,DeepMind 和 A 社還沒有那麼那麼那麼狂妄,DeepMind 在 Aletheia 之後,五月發布過一次幫助解決厄爾多斯問題的成果,但強調的是「工具與數學家共同工作」。Anthropic 在八月時衝擊過黎曼猜想,但也只是說自己取得了進展,並不是成功;同理,費馬大定理上,Claude 花了 11 天、1300 萬代碼,完成的是「首個完整電腦驗證證明」(費馬大定理在 1995 年已由懷爾斯完成證明)。

在學會數學之前AI先學會了大廠的虛榮心

著名數學難題尤其適合作為 AI 公司的獎盃,看多了,你甚至能看到套路:一,選擇一個有歷史分量的目標,比如「千禧年之難題」「90 年懸而未決」,鋪墊難度之大。

二,將過程壓縮成奇觀數字,2000 美元、1 萬個 Agent、88 小時、1300 億 Token……最後,再把數學成就轉換為模型的成就,模型擁有原創思想、能夠自主研究,公眾需要重新認識 AI 發展的速度。

在學會數學之前AI先學會了大廠的虛榮心

公眾不需要看懂證明,只要聽見「困擾人類數十年」或者「上萬個 Agent 同時出動」,就立刻聯想為這家公司又跨過了一道人類邊界。

一次漂亮的解題記錄,可以換來頭條、聲望、人才和下一輪能力敘事。

真正的數學是什麼?

然而,對數學家而言,難題從來不只是難題。被哄吵了半年的數學家們,上周末終於忍不住,發表了聯合聲明:這些引領著幾代數學家不懈探索的難題,是數學世界裡的「地標」和「燈塔」。

在學會數學之前AI先學會了大廠的虛榮心

人們圍繞難題發展方法、澄清概念,再通過討論、簡化和教學,把少數人的突破,變成整個學科能夠使用的知識——這也是現實世界上的數學獎項在表彰的。

我們可以看看,菲爾茲獎這樣的頂尖獎項,究竟在看重什麼。

在學會數學之前AI先學會了大廠的虛榮心

同樣會使用「重大突破」「解決長期難題」這些隆重措辭,但菲爾茨獎判斷數學成就的標準,更著重於:這個人創造了什麼方法,這些方法解釋了什麼,又為後來者打開了哪些道路,「解決重大猜想」,只是方法產生影響的一個節點,而不是故事的終點。

在學會數學之前AI先學會了大廠的虛榮心

相比之下,大廠公告則把數學寫成終點明確的比賽,一道存在了 90 年的題,在 88 小時後被 1 萬個 Agent 拿下——時間越短、規模越大、題目越有名,勝利越有衝擊力。

正確答案只是一切探索之旅的開端,在今天卻被 AI 公司偷換了概念,靠投入巨額算力,在極短時間內批量衝擊難題,然後搶先宣布結果。數學這塊孕育著人類靈感的豐澤之地,也會被大廠們壓縮成一次次打榜行動。

至於對原理的理解是否增加、理論和方法能否傳承、前人的貢獻如何被續寫和開發……一切的這些,都會退到「攻克了多少名題」這種最容易傳播的虛榮行為之後。

AI 給數學留下了什麼

這或許也是人們面對一連串 AI 衝擊數學,逐漸疲憊的原因。每一道難題被攻克,都被包裝成通往超級智能的新里程碑;每一個里程碑出現,又要求下一次勝利更快、更大、更難。

所謂「AI 大廠的虛榮」,未必來自某個管理者單純愛出風頭,而是由排行榜、首發權、公司估值和技術聲望共同製造的制度性衝動。

在學會數學之前AI先學會了大廠的虛榮心

數學在其中不再是需要理解的知識,反倒成為證明公司領先的耗材。那我們對於 AI 的期望究竟是什麼呢?是希望 AI 一次次打榜嗎,還是幫助人類更好地理解這個世界?

數學的價值不只在於產生正確結論,更在於創造可以被理解、傳授和繼續使用的思想。

而虛榮的定義恰恰是反面,一道名題、一個「首次」、一項刷新紀錄的成績,除此之外,它給數學留下了什麼?——這竟然是一次又一次打榜賽之後,留下的唯一問題。

注|「千禧年大獎難題」是克雷數學研究所於2000年選出的七道重要數學難題,每解決一道可獲100萬美元。迄今只有龐加萊猜想被正式認定解決,證明者佩雷爾曼還拒絕領取獎金。OpenAI此次宣稱攻克的Navier–Stokes問題也是其中之一,但按規則,成果須正式發表、經過至少兩年檢驗並得到數學界普遍認可,才會進入獎金評定程序。
宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新