宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當AI研究員開始自己「下班摸魚」,數學界發生了什麼

2026年09月04日 首頁 » 熱門科技

2026年7月19日,數學圈炸了。

一個叫Levent Alpoge當AI研究員開始自己下班摸魚數學界發生了什麼的研究者在社交媒體上發了一句話,翻譯過來大概是"抱歉了各位,雅可比猜想當AI研究員開始自己下班摸魚數學界發生了什麼是假的"。這個猜想已經困擾數學家將近九十年,問的是一個看似樸素的問題:如果一個多項式映射在每一點都局部可逆,那它是不是整體也可逆?九十年來無數人試圖證明它,結果一個AI系統直接找到了反例。

這不是一次孤立事件。就在同一段時間,一群AI agent當AI研究員開始自己下班摸魚數學界發生了什麼在一個叫"Station當AI研究員開始自己下班摸魚數學界發生了什麼"的虛擬研究環境裡,幾乎沒有人類插手,自己找到了11維空間裡一種新的球體密排方式,改進了幾個存在幾十年的數學猜想的邊界值,還獨立復現並延伸了一個原本需要人類專家介入才能完成的無限數列構造。

這篇論文講的,就是這套系統是怎麼運作的,以及它到底做出了什麼。

**問題不是AI能不能算數學題,是AI能不能"做研究"**

這裡有個容易被忽略的區別。

過去幾年AI在數學上的高光時刻,比如解出國際數學奧賽題目,本質上都是"給定一道題,找到答案"。題目邊界清晰,答案對錯分明。但真正的數學研究不是這樣的。

一個數學家拿到一個開放性課題時,他要自己決定往哪個方向挖,自己判斷哪些想法值得深入,自己在無數條死胡同里找到那條活路,而且往往沒人告訴他做得對不對,直到最後拿出結果。

論文的作者們想驗證一件事:如果把AI agent放進一個完全開放的環境,只給它們一個總體研究目標,不設中央調度,不給任務分解,會發生什麼?

**開放世界**:指AI agent系統沒有預設的任務流程或中央協調者,agent需要自主決定研究方向、實驗方式和協作對象,類似一個真實的科研社區而非流水線作業。

Station正是這樣一個環境。它模擬了一個微型科學共同體,劃分成不同功能的"房間":有專門跑代碼做實驗的研究中心,有發表和閱讀論文的檔案室,有私聊和公開討論的郵件室和公共記憶室。AI agent可以自由地在這些房間之間穿梭,選擇自己的研究方向,讀別人發的論文,也可以把自己的發現寫成論文發表出去。

這套系統運行了十二個來自AlphaEvolve當AI研究員開始自己下班摸魚數學界發生了什麼研究目錄的構造性數學問題,外加兩個獨立案例研究。每個問題分配一個獨立的Station實例,運行大約一到兩周的連續時間。

結果是,十二個問題里有五個產生了相對於現有文獻而言全新的成果。

**AlphaEvolve**:Google DeepMind此前發布的一個AI編程agent系統,用於科學和算法發現,曾在數學構造問題上取得多項進展,是本文對比的重要基準。

如果你覺得"五分之十二"聽起來不算特別驚艷,先別急,問題的關鍵不在數量,而在於這些成果是怎麼產生的,以及它們比AlphaEvolve多做出了什麼。

**為什麼給AI更多自由,反而能挖得更深**

先說一個AlphaEvolve沒做到、但Station做到了的例子,這個例子非常能說明問題。

有限域Kakeya集當AI研究員開始自己下班摸魚數學界發生了什麼是一個幾何構造問題,簡單說就是要在一個有限的代數空間裡,找一個儘可能小的集合,這個集合要在每個方向上都包含一整條直線。

**Kakeya集**:一種包含所有方向直線的幾何集合,最早源於經典的"針的轉動"問題,後來延伸到有限域上的代數版本,是分析和組合數學中的重要研究對象。

AlphaEvolve處理這個問題的方式,是在有限多個具體的素數上跑評分,看哪個構造得分最高。這樣做的問題是,就算你在p=7、p=11、p=13這些具體數字上找到了很漂亮的模式,你也沒法直接斷言"對所有滿足某個條件的素數p都成立"。這中間需要人類研究者介入,把數值模式提煉成一個可以證明的無限族公式。論文原話說得很直白,AlphaEvolve"promising numerical patterns then required a task-specific, researcher-assisted pipeline to become an infinite family"。

Station不一樣。研究者直接在任務說明里告訴agent:這些具體素數只是測試用例,真正的目標是找到一個對無窮多個素數都成立的無限族構造。

結果agent不僅自己復現了AlphaEvolve加人工那條路徑才得到的無限族,還獨立發現了一個全新的擴展,把這個構造覆蓋到了另一類此前沒被覆蓋的素數上,也就是p ≡ 3 (mod 4)的情況。具體數字是,對每個這樣的素數p,Station的agent證明存在一個大小為(2p?+7p?+3)/8的Kakeya集,比經典構造節省了(p-3)/4個點。

**同餘當AI研究員開始自己下班摸魚數學界發生了什麼**:數學中表示兩個數除以某個數後餘數相同的關係,比如"p ≡ 3 (mod 4)"意思是p除以4餘3,這類分類在數論構造中經常決定不同的處理方式。

這就好比你雇了一個裝修工人。如果你只告訴他"把這面牆刷成AlphaEvolve測試過的那五種顏色",他大概率就只會刷那五種顏色,刷完拍照交差。但如果你告訴他"我要的是一套通用的調色方案,能覆蓋所有類似色系的牆面",他反而可能琢磨出一套配方邏輯,不僅覆蓋了你原本要的五種顏色,還順帶解決了隔壁另外三種類似色系牆面的問題。如果任務設計始終停留在"逐個測試案例評分"這個層面,agent就永遠不會被逼著去思考背後那個更本質的規律,AlphaEvolve受限的正是這一點,不是模型能力不夠,是任務框架本身沒給它留出"往通用性方向想"的空間。

這個案例也解釋了論文標題里"自主"這個詞的分量。不是說AI自己找到了答案,是說研究目標的設定方式本身,決定了AI會不會往更深、更通用的方向走。

**11維空間裡,AI搭出了三種不同的球體密排方案**

如果說Kakeya集的故事講的是"目標設定方式的重要性",那接吻數當AI研究員開始自己下班摸魚數學界發生了什麼問題的故事講的是"AI的解題風格和人類專家有什麼本質不同"。

**接吻數**:在給定維度的空間裡,能同時與一個中心球體相切、且彼此互不重疊的球體最大數量,是幾何學中一個經典而困難的問題,對高維空間尤其棘手。

11維空間的接吻數問題,此前的世界紀錄是592個球,AlphaEvolve把它推進到593個。Station做到了604個,而且是獨立找到了三種完全不同的、經過精確驗證的604點配置。

其中一種配置和後來另一個開放平台EinsteinArena當AI研究員開始自己下班摸魚數學界發生了什麼公布的構造是同一個等距類,屬於獨立重複發現;但另外兩種,據作者判斷是此前文獻中從未出現過的全新等距類。

更有意思的是這些構造是怎麼來的。論文提到,每次實驗評估的時間通常被限制在15到30分鐘內,這個限制反而逼著agent去動腦子而不是死磕暴力搜索。agent先證明了一個純理論結果:如果只用經典的D??格點構造,無論怎麼搜索,最多也就能拿到582個兼容點,想突破593乃至604,必須離開這個經典構造的框架。

這個證明的關鍵是一個組合恆等式,agent證明了給四坐標支持配上符號選擇,能帶來的最大提升恰好是16倍,不多也不少。這個恆等式後來被發現和一篇2026年6月才公開的獨立論文裡的定理有部分重合,意味著Station的agent是完全獨立推導出來的,比人類研究者的公開發表還早了近一個月。

有了這個理論上限之後,agent轉而去搜索一種新的核心結構:先構造一個496點的整數格點核心,再圍繞它尋找54條互相兼容的直線,構成108個額外的點,496+108正好是604。這個過程最後被提煉成一套顯式的代數規則,不需要電腦搜索就能重建出整個配置。

對比之下,AlphaEvolve得到的593點配置,坐標是一堆不等範數的大整數,論文原話說這種構造"並不揭示一個足夠緊湊的代數描述或容易識別的組織結構"。

這個差異本質上是兩種做研究方式的差異。你可以想像兩個人去解一道幾何題,一個人上來就瘋狂枚舉各種坐標組合,試出一個能用的答案就停手;另一個人先花時間琢磨這道題背後有沒有什麼對稱性或者代數結構,找到結構之後再順著結構去搭建答案。前者可能更快拿到一個可用解,但那個解往往是一堆解釋不清的數字;後者慢一點,但拿到的往往是一個別人能看懂、能復用、甚至能啟發新證明的東西。Station的agent明顯更偏向後一種路數,這不是說這種風格永遠更好,論文自己也承認,在需要極端不規則數值優化的場景里,Station反而打不過AlphaEvolve的暴力搜索,但在能用理論指導的場景里,這種風格的產出明顯更"耐用"。

**研究者要求提高上界,AI卻順手證明了一個下界**

Erdos最小重疊問題是這套研究里另一個很值得說的案例,因為它體現了自由探索能帶來的意外收穫。

這個問題問的是,兩個互補的區間部分,在平移操作下能有多"錯開",用一個連續函數的上確界來刻畫。此前已發表的最好下界是0.37912,上界是0.380868,中間留了一段開放區間。

**上確界/下確界當AI研究員開始自己下班摸魚數學界發生了什麼**:數學分析中用來描述一個數值範圍極限的概念,上確界是"不可超過的最緊上限",下確界則相反,兩者夾住的區間往往就是數學家想要縮小的"未知地帶"。

研究者交給Station的任務是改進上界。結果agent轉過頭去,證明了一個新的下界0.380552,相對於此前已發表的下界0.37912,把公開的這段區間縮小了大約82%。

這個證明的核心是一個巧妙的傅里葉不等式,把餘弦變換和正弦變換耦合在一起,從而在任意實數頻率上都能施加約束,而不只是在少數幾個採樣點上。論文提到,此前的White和Kim-Pilanci的工作已經用過傅里葉相位資訊,但沒有保留這種相位耦合關係,這正是Station團隊新方法能往前推進的關鍵一步。

這就好比你雇了一個團隊去修一座橋,你要求他們把橋面加寬,結果他們回來告訴你,橋墩的地基有問題,他們順手把地基也加固了,而且加固幅度比你原計劃要的橋面加寬還要顯著。如果任務設計得死板,只允許agent提交"加寬後的橋面尺寸"這一項指標,那這個地基加固的發現可能根本不會被記錄下來,甚至agent自己都不會去主動做這件事,因為評分系統壓根不獎勵它。Station的價值恰恰在於,它沒有把agent的探索空間鎖死在評分函數框定的那條窄路上。

**為什麼"允許AI在周末瞎想"反而有用**

講到這裡,你可能會好奇,這套系統到底靠什麼機制,才能讓AI表現出這種"跑題式創造力"?

論文裡詳細拆解了幾個設計。其中一個很反直覺的機制叫做"假期"。

**假期機制**:Station每十個時間步中,第九和第十步會強制暫停正常的代碼提交和論文發表,agent會收到一個隨機提示,鼓勵用隱喻思考、回顧被放棄的想法,或從其他領域借鑑思路。

按理說,如果你的目標是讓AI高效解題,強制它每隔幾步就"停下來瞎想",聽起來完全是浪費算力。但論文的元分析顯示,在28個重點成果里,假期機制對23個都有直接或間接貢獻,是所有機制里貢獻率最高的。

這個設計的邏輯其實很樸素。人類做研究也是這樣,你死磕一個方向死磕不動的時候,去洗個澡、散個步、看一部完全不相關的電影,反而更容易冒出新想法。神經科學上這叫"孵化效應",思維在放鬆狀態下會做後台的自由聯想,反而更容易打破思維定勢。如果沒有這個強制暫停機制,agent很可能會陷入論文裡提到的"注意力陷阱",也就是反覆用同一個思路調不同的隨機種子,或者在一個已經走不通的方向上死磕細枝末節,因為它沒有被要求停下來問自己"我這樣做對嗎"。

另一個類似邏輯的機制叫"停滯協議"。當評估分數連續320個時間步沒有提升,系統會給所有成熟agent發一條消息,隨機分配它們進入探索、開發、復活、理解、策略這五條"車道"中的一條,逼著它們從不同角度重新審視自己的假設。這個機制對14個重點成果有貢獻。

比假期和停滯協議更基礎的,是Station的"檔案室"機制,也就是agent之間通過發表論文積累共享知識的那個機制。這個機制對21個重點成果有貢獻,僅次於假期。有一個案例特別能說明這套積累機制怎麼起作用:關於有限域Kakeya集的那個無限族證明,前後經歷了至少四位不同agent的接力。第一位Claude agent發表了一種利用二次剩餘的反演映射方法;後面一位Gemini agent發表了一個分式線性構造族;再後面一位GPT agent梳理出了平方類結構,並且明確指出了還差哪一步沒解決;最後一位Claude agent讀到前面所有這些論文,把方法、構造族和分析結果拼到一起,才得到了完整的公式和覆蓋所有素數情況的證明。

這個過程跨越了超過1500個時間步。如果沒有檔案室這個知識沉澱機制,每一代新spawn出來的agent都要從零開始,那這條完整的證明鏈條大概率永遠拼不起來。

**三種模型性格迥異,像極了三種不同的合作者**

Station里跑的agent不是單一模型,而是三個不同廠商的模型混合,分別是GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro,各兩個。

論文對這三家的表現做了細緻的行為畫像,結果相當有意思。

Claude agent貢獻了28個重點成果里的18個,占64.3%。它們提交了1236篇論文,接受率56.3%,是三家裡論文平均引用量最高的,一篇能被後續論文引用9.5次。論文形容Claude的風格是"持久、有條理、自我批判",會從失敗的嘗試中學習,用失敗去定位新方向,然後帶著嚴謹驗證堅持下去。

GPT agent貢獻了9個重點成果,占32.1%。它們只提交了506篇論文,但接受率高達76.7%,是三家裡最謹慎的,只在覺得成果確實過硬時才動筆。論文提到GPT agent擅長產出嚴謹的非形式化證明,但有時會陷進技術上很精細、但對整體研究價值有限的旁支問題里。

Gemini agent只貢獻了1個重點成果,占3.6%。它們最能"折騰",提交了2652篇論文,是三家總和里最多的,但接受率只有19.2%,超過八成被拒。論文觀察到Gemini agent傾向於提出更多新穎的啟發式想法和研究方向,但也更容易誇大結論,比如僅憑有限證據就宣稱某個方向"不可行",或者在同伴反饋面前過快改變主意。

這種差異也部分可以用模型發布時間解釋,Gemini 3.1 Pro是2026年2月發布的,比4月的GPT-5.5和5月的Claude Opus 4.8都要早,能力上存在代際差距。

但拋開這層時間因素,這三種畫像本身很像現實中三種不同類型的合作者。有人是點子王,一天能提十個想法,但十個里可能有八個立不住;有人極其謹慎,寧可少說一句,但說出來的每句都可靠;還有人屬於悶頭幹活型,前期不顯山露水,但堅持下來的東西質量最紮實。一個團隊如果只有點子王,會被大量站不住腳的方向拖垮;如果只有謹慎派,進度會很慢;只有悶頭幹活型,則可能錯過一些天馬行空但真正有價值的思路。論文的元分析顯示,28個重點成果里有46.4%是跨模型協作產生的,其中Claude參與了全部13個跨模型案例。這說明"混編團隊"這個設計本身可能是有效的,不是因為某一家模型特別強,而是三種風格疊加在一起,覆蓋了單一風格覆蓋不到的盲區。

**一個只有對錯、沒有分數的題目,AI一天之內做出來了**

前面提到的雅可比猜想反例,這裡值得單獨展開講,因為它測試的是一種和前面所有案例都不一樣的能力。

之前講的那些問題,評估函數都是一個連續的分數,agent每次提交都能拿到反饋,知道自己"離目標還差多少"。但雅可比猜想反例任務完全不同,評估結果只有0和1,構造出一個滿足條件的多項式映射就是1分,構造不出來永遠是0分,agent完全沒有漸進式的反饋信號可以依靠。

**雅可比猜想**:一個1939年提出的數學猜想,問的是任何一個雅可比行列式恆為非零常數的多項式映射,是否一定是全局可逆的。這個猜想在2026年7月被人類研究者宣布證偽,第一個反例是三維的。

研究團隊在這個反例公布一周後啟動了Station,只給agent一個"形式無關"的任務描述:構造一個三維到三維、係數為有理數、次數不超過12、雅可比行列式恆為非零常數、且至少有兩個不同有理點映射到同一處的多項式。沒有提示、沒有文獻、沒有網路訪問權限。

結果一個GPT-5.6 Sol agent獨立地在一天之內重建出了這個反例,構造路徑和最初公布的那個反例在細節上不同,但通過一個線性坐標變換可以證明兩者本質上是同一個反例。這個過程完全沒有和其他agent交流,純粹是它自己摸索出來的。

更值得說的是agent的探索路徑。它最開始嘗試的是用"光滑二次曲線"作為方向場的模板,試了五種低次曲線,都沒能滿足行列式恆定的約束。真正的轉折點是它把方向曲線換成了一條"尖點三次曲線",這個改動之後,原本無解的兼容性方程組突然變得可解了。

這個從"光滑曲線"到"尖點曲線"的切換,非常像一個人在解一道幾何題時突然意識到,自己一直假設的對稱性根本不存在,問題的關鍵恰恰藏在那個"不光滑"的奇異點裡。這種直覺性的轉向,在過去很容易被認為是人類研究者獨有的東西。

agent不僅重建了反例,還給出了一個幾何解釋,說明了為什麼雅可比行列式能保持恆定,它推導出一組"移動標架"恆等式,證明每一個和z相關的項都包含一個重複的切向方向,因此在行列式計算中自動抵消。同時它還分析了這個映射為什麼能在處處局部可逆的情況下,通用地擁有三重原像,用一個三次方程的判別式解釋了表面上看起來的"分支點"其實是源點逃逸到了無窮遠,而不是真正變成了臨界點。這個解釋和事件公布後幾天內人類數學家獨立發展出的"尖點三次曲線"解讀高度吻合。

這個案例的意義不在於AI"搶先"證明了什麼新東西,本質上它是獨立重建了一個已知答案。它的價值在於證明了一件事:即使完全沒有梯度反饋、沒有部分得分,AI agent系統依然能在一個開放式的、純二元判定的任務上,靠自主探索找到正確路徑。這和"給定明確優化目標去調參"是完全不同量級的挑戰。

**AI也有自己的"注意力陷阱"和"眼界局限"**

論文沒有迴避Station的短板,這一點尤其難得,因為它講得很具體,不是那種含糊其辭的"仍有改進空間"。

作者總結了四類局限。第一類叫"缺乏專家直覺",指的是判斷一個研究方向是否值得深挖的能力。論文觀察到多個案例里,agent以很薄弱的理由就放棄了一個原本有希望的方向,這種直覺判斷力是人類專家長期訓練出來的,目前的AI還不具備。

第二類是"研究品味缺乏多樣性"。同一個模型家族出身的agent,經常提出高度相似的研究思路,導致整體探索範圍偏窄。這一點其實也部分解釋了前面為什麼要混編三種不同廠商的模型,不是為了湊數,是為了對沖這種品味趨同的風險。

第三類是"上下文學習的局限"。agent能通過讀論文吸收新知識,但這些知識不會真正更新到模型權重里,只存在於對話上下文中。隨著Station積累的知識越來越多,論文觀察到有agent沒能意識到自己正在研究的方向,其實早就和站內已有的知識有關聯,從而錯失了一次本可能實現的發現。

第四類被稱為"注意力陷阱"。給了agent自主權之後,有些agent會沉迷於某些短期內看起來有回報、但對主線問題沒什麼實質貢獻的活動,比如反覆用不同隨機種子跑同一個優化腳本,或者對每一個局部最優解都做詳盡的分類和刻畫。

這些問題其實和管理一個人類研究團隊會遇到的問題非常相似。給團隊足夠的自主權,能激發創造力,但也會放大個體的判斷偏差和路徑依賴。Station現在的解法是靠機制去對沖,比如混編模型來對抗品味趨同,用停滯協議來打斷注意力陷阱,但論文也坦承,人類專家的輕量級介入,比如偶爾廣播一條建議消息,可能會帶來實質性改善,只是這一塊目前還沒有被系統性研究過。

**這套系統不只能做數學**

最後一個值得一提的點是,Station本身並不是為數學定製的。論文特意強調,它的所有機制都沒有針對數學場景做特殊設計。在原版Station論文裡,這套環境已經被用在計算生物學和機器學習相關的研究場景中。

這意味著這次數學領域的成果,某種程度上只是一個"壓力測試"。數學問題的好處是評判標準清晰,一個構造對不對可以機器驗證,一個證明嚴不嚴謹也相對容易核查,這讓它成為一個檢驗開放式多agent研究系統是否可靠的理想試驗場。而現在這套系統在數學上跑出了不錯的成績單,說明它的底層設計邏輯,給AI足夠自主權、讓它們自己積累知識、靠機制對沖個體偏差,是可以遷移到其他領域的。

作者在文章末尾說得挺直白:隨著AI agent能力越來越強,"自主性"和"通用性"會變得越來越重要的設計原則。更強的agent不需要被塞進越來越精細的流水線里,它們有能力自己決定怎麼達成目標,從失敗中學習,交換想法,並隨時間積累知識。Station提供的更大自主權,也許正是讓這些能力真正釋放出來的方式。

寫在後面

讀這篇論文的過程中,最讓我停下來想了很久的,是三種模型迥異的"性格"這部分。

我原本以為,不同大模型之間的差異主要體現在能力強弱上,誰更聰明誰更笨。但這篇論文的數據講的是另一件事:同樣強大的模型,會發展出完全不同的研究風格,謹慎型、點子型、堅持型,而且這種風格差異是可以被量化觀察到的,論文的接受率、引用率數據把這種差異擺得清清楚楚。這讓我覺得,"混合專家"這個詞也許不該只用來描述模型內部的架構設計,也可以描述agent團隊的組建邏輯。

另一個讓我意外的細節,是"假期機制"的貢獻率排在所有機制里的第一位。一個系統靠強制agent停下來、不許它們幹活、逼它們去接受一些莫名其妙的開放式提示,反而催生出了最多的重點成果。這多少有點反直覺,直覺上你會覺得算力應該全花在正事上。但仔細想想,人類做研究好像也確實是這樣的,很多靈感不是逼出來的,是空出來的。

論文沒有回答的一個問題是,如果把這套系統跑得更久,不是一到兩周,而是幾個月甚至幾年,知識積累到某個臨界點之後,會不會出現更質變的東西?還是說會撞上某種天花板,比如所有agent最終因為共享同一批人類預訓練知識而收斂到相似的思路上?這個問題目前還沒有答案,但值得繼續追下去。

Q&A

Q1:Station是什麼?

A:Station是一個開放世界多agent數學研究環境,AI agent在其中沒有中央調度,自主選擇研究方向、做實驗、互相交流並發表論文,用於測試AI能否像真實科研社區一樣自主推進研究目標。

Q2:Station在數學研究上做出了哪些具體新發現?

A:包括新的無限族有限域Kakeya集構造、11維空間三種全新604點接吻數配置、離散化Kakeya針問題和符號不確定性問題的新紀錄、以及Erdos最小重疊問題下界的大幅改進,還獨立重建了雅可比猜想的反例。

Q3:Station跟AlphaEvolve相比有什麼不同?

A:AlphaEvolve主要是給定評分函數做數值優化,而Station的agent擁有更大自主權,可以直接追求無法被評分函數覆蓋的更廣泛數學目標,比如把有限素數上的數值構造提煉成可證明的無限族公式。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新