重點摘要
AI 用 2,000 美元解決了人類數學家數十年未能突破的十道難題
OpenAI Astra 解決群論、量子博弈、球堆積等十項橫跨多個數學分支的世紀難題,並以 Lean 4 形式化證明提供機器可驗證憑證,任何人均可獨立核查。
生成十項解法的 API 計算成本約 2,000 美元(每題約 200 美元),但批評者指出這數字可能忽略了大量失敗嘗試的隱性成本,存在選擇性報告疑慮。
數學家社群反應分裂:一方歡迎研究加速,另一方憂慮學術責任歸屬、論文慣例與數學文化的根本性危機,超過 3,000 人聯署 Leiden 宣言。
前情提要
章節一:十項數學與理論CS突破概覽
2026 年 8 月 1 日,OpenAI 在正式發布下一代主力模型 Astra 的同時,公開了一份 249 頁的手稿:其內部版本已獨立解決十項橫跨高維幾何、群論、量子複雜度、算術電路複雜度與極值組合學的長年未解問題。
這十項突破中,最受矚目的包括:非索菲克群 (non-sofic group) 的首個顯式構造(解決 Gromov 1999 年提出後懸置 27 年的核心問題)、Connes 剛性猜想的反例(顛覆馮紐曼代數領域的長年假設)、高維球堆積密度上界自 1978 年以來的首次改進,以及雙人量子博弈的平行重複定理。
名詞解釋
非索菲克群 (non-sofic group) :「索菲克性」是衡量群結構能否被有限對稱群近似的性質,Gromov 於 1999 年提出後,數學界長期未能找到不具此性質的明確例子,Astra 給出了首個顯式構造。
此前,2026 年 5 月 OpenAI 已推翻懸置自 1946 年的「單位距離猜想」,一週內人類研究者借助相同技巧解決了另一個重大猜想。這次十項突破更是同步公開所有 Lean 4 機器可驗證憑證,讓任何人得以獨立核查,不需信任 OpenAI 系統本身。
章節二:Lean 形式化驗證在AI數學中的角色
OpenAI 選擇以 Lean 4 形式化語言作為這批成果的「可信基礎」,標誌著一個重要的方法論轉向。傳統數學論文的核實依賴同行評審——由人工閱讀每一步推論,這套機制在篇幅超過數百頁時存在結構性侷限。
名詞解釋
Lean 4:一種互動式定理驗證語言,以依賴型別理論為基礎,「編譯通過」即代表邏輯正確,常用於數學定理的機器驗證。
形式化證明則要求每一步推論都能被機器自動驗證,邏輯上不留人工判斷空間。HN 用戶 black_knight 因此認為:「Lean 形式化驗證的正式證明已去除疑慮——我看不出有任何理由需要知道這些證明是如何得出的。」
但批評者的疑慮指向另一個層次。c7b 等用戶要求公開「確切的模型型號、推理設定與完整提示歷史」,認為這是確保可重現性的必要條件。traes 進一步指出,若不公開失敗嘗試的次數與總計算成本,2,000 美元的數字可能形成嚴重誤導。
這場辯論的本質是:形式化憑證只能驗證「結果正確」,卻無法還原「解法如何被發現」的過程——而後者在數學研究中同樣具有獨立的學術價值。
章節三:數學家社群的分裂反應與爭議
菲爾茲獎得主 Timothy Gowers 的反應最受矚目。他坦言 GPT 5.6 Pro 解決了他花費大量時間研究的兩個問題,形容感受「非常奇怪,而且不特別愉快——就像地毯從腳下被抽走一樣」,並擔憂數學文化可能因此走向崩解。
另一位菲爾茲獎得主 Terence Tao 的立場則有所演進:起初持懷疑態度,現已視語言模型為可能「將數學工業化」的工具,但強調複雜問題仍需人機協作。
數學家 Abhishek Saha 則採更務實角度,稱前沿 AI 模型「至少與一個穩健且不知疲倦的博士生一樣好」,他以 GPT-5.5 Pro 一天完成了原本需要數週的工作,自我定位從「全部自己演奏」轉為「扮演指揮家」。
白話比喻
就像電子試算表讓會計師不再需要手工加減,但會計師仍然需要理解財務結構、設計公式、詮釋結果——AI 的數學突破可能重新定義「數學家做什麼」,而非消滅這個職業。
超過 3,000 名數學家聯署的 Leiden 宣言,要求 AI 工具使用透明化、保護作者權利並維持人類責任歸屬——但並未全面排斥 AI。這份宣言本身即折射出社群的矛盾:既無法否認 AI 的貢獻,又擔憂現有學術發表規範難以應對這一轉變。
章節四:AI數學研究的方法論轉向
HN 用戶 esperent 提出了一個尖銳的方法論問題:「非常容易跑 100 次失敗的對話(每次花費約 2,000 美元),然後只發表成功那一次。」這類似統計學中的「選擇性發表」問題——在不知道總嘗試次數與成功率的情況下,單次成功的代表性存疑。
Epoch AI 的基準測試資料提供了另一個視角:儘管 AI 在這十項問題上取得突破,其在最高難度類別(Major Advance、Breakthrough)的整體評分仍為零。六個千禧年大獎問題(含 P vs. NP、黎曼假設,各值百萬美元)至今毫無進展。
jhanschoo 在 HN 討論中精準指出了一個制度層面的矛盾:「傳統上,數學家需為其論文的智識工作負全責;但現在這一責任歸屬變得模糊。」這不只是學術誠信問題,更是整個學術發表體制是否能適應 AI 協作時代的根本挑戰。
如何量化 AI 的貢獻、如何分配學術榮譽、如何在法律框架內釐清著作權——這些問題的答案,目前仍不存在。
核心技術深挖
Astra 解決這批數學難題的技術路徑,體現了大型推理模型在深度搜尋與形式化驗證兩個維度的同步突破。
機制 1:深度推理鏈搜尋
Astra 為每項結果附上「思維鏈推理過程」說明,顯示模型並非直接輸出答案,而是透過長鏈推理反覆展開、驗證假設、修正方向。這類推理不同於單步問答,更接近數學家「草稿紙探索」的過程——但其速度與廣度遠超人類個體。
機制 2:Lean 4 形式化輸出
模型輸出不止於自然語言論證,還包含 Lean 4 的機器可驗證程式碼。Lean 4 是一種依賴型別理論語言,要求每步邏輯都通過編譯器的型別檢查,任何邏輯漏洞都會導致驗證失敗。
名詞解釋
依賴型別理論 (dependent type theory) :一種讓型別系統能表達數學命題的理論框架,Lean 4 基於此框架,使「型別正確的程式碼」與「邏輯正確的證明」等價。
機制 3:跨分支協同覆蓋
Astra 同時解決群論(非索菲克群)、運算子代數(Connes 猜想)、量子博弈(平行重複定理)、幾何(球堆積上界)等截然不同的數學分支。這種跨域能力依賴預訓練時對大量數學文獻的吸收,而非針對單一領域的專業化微調。
白話比喻
就像一位閱讀了全球所有數學教科書和論文的研究生,能夠在不同分支之間類比遷移——但他的「閱讀量」已遠超任何人類個體終身所能企及。
工程視角
環境需求
使用 Lean 4 驗證 AI 生成的數學證明需要:Lean 4 執行環境(官方支援 Linux、macOS)、Mathlib4 函式庫(Lean 4 的標準數學函式庫)、以及足夠的 API 額度(每問題級任務約 200 美元以上起跳)。
最小 PoC
-- Lean 4 + Mathlib4:驗證 AI 生成的定理框架
import Mathlib
-- 以 #check 確認 Mathlib 中的相關定義已載入
#check Finset.sum_comm
-- 構造一個簡單命題的形式化證明
example (n : ℕ) : n + 0 = n := by
ring
驗測規劃
執行 lake build 或 lean --run 並確認無型別錯誤。Lean 4 的「build 通過」即代表每步邏輯均符合依賴型別系統,無需額外人工核查邏輯鏈。若 AI 生成的程式碼含有 sorry 佔位符,視為驗證未完成。
常見陷阱
- Lean 4 驗證通過不等於在所有公理系統下正確:模型可能依賴特定公理假設
- Mathlib4 版本相依問題:AI 生成的程式碼可能依賴特定版本,升版後需重新驗證
- 提示歷史不公開時,同一問題的重現成功率可能遠低於預期,勿以首次成功代表可重現性
上線檢核清單
- 觀測:Lean 4 build log 無錯誤、所有
sorry佔位符已移除 - 成本:API 成本已納入總嘗試次數估算,而非僅計成功那次
- 風險:公理系統相依性已明確標注;模型版本號與推理設定已記錄以利重現
商業視角
競爭版圖
- 直接競品:Google DeepMind(AlphaProof、AlphaGeometry 系列)、xAI(Grok 系列推理能力)
- 間接競品:傳統數學軟體(Mathematica、Maple)、專業形式化驗證工具(Coq、Isabelle)
護城河類型
- 工程護城河:跨多個數學分支同時突破的能力,仰賴超大規模預訓練與深度推理架構,短期難以複製
- 生態護城河:Lean 4 形式化驗證的公開釋出,建立「可驗證 AI 數學」的技術規範,有望成為後繼研究的參照標準
定價策略
以 Sol API 定價計算,每題約 200 美元、十項合計約 2,000 美元。未來隨模型效率提升,每題成本有望大幅下降,可能開啟「數學研究即服務 (MRaaS) 」的商業模式雛形。但真實成本需納入失敗嘗試,總體 TCO 可能高出公開數字數倍。
企業導入阻力
- 學術界發表慣例與責任歸屬規範尚未建立,機構採購有合規風險
- 六個千禧年大獎問題仍未攻克,市場對「AI 能解決什麼級別的問題」存在合理疑慮
第二序影響
- 數學博士培育生態可能轉向:從「解題能力」轉向「問題定義與方向判斷」能力的培養
- Lean 4 等形式化語言的採用率可能因此急速上升,催生新的驗證工具市場
判決:具結構性影響(但非顛覆式替代)
AI 數學突破已具備真實的研究加速效果,但千禧年大獎問題未解、方法論爭議持續,短期內更可能是強力輔助工具而非獨立研究者。企業若有數學密集型研發需求,值得試點導入人機協作工作流程。
數據與對比
Epoch AI 難度基準
Epoch AI 的 AI 數學能力基準顯示,AI 在最高難度類別(Major Advance、Breakthrough)的整體評分目前仍為零。六個千禧年大獎問題(含 P vs. NP、黎曼假設,各值百萬美元)至今無任何 AI 突破,顯示現有能力集中於「有邊界的困難問題」,而非開放式最難問題。
本批突破的成本指標
生成全部十項解法的 API 計算成本約 2,000 美元(以 Sol API 定價計算,每題約 200 美元)。批評者指出,這一數字的可信度取決於是否公開總嘗試次數與失敗率——若存在大量失敗嘗試,真實成本可能高出數倍乃至數十倍。
最佳 vs 最差場景
推薦用
- 形式化數學驗證輔助:利用 Lean 4 自動生成與驗證框架,加速已有方向的論證形式化
- 跨分支文獻綜合:利用模型對多個數學分支的廣泛覆蓋,探索跨領域的技巧遷移可能性
- 人機協作研究:如 Abhishek Saha 的「指揮家模式」——由人定方向與判斷,AI 執行大量計算與探索
千萬別用
- 在無形式化驗證的情況下直接信任 AI 的數學結論:自然語言論證可能含有隱藏錯誤
- 以 AI 成本數字(如 2,000 美元)作為學術可行性的唯一依據:選擇性發表問題尚未解決
- 在學術發表中規避 AI 使用揭露:Leiden 宣言等社群規範正在形成中,早期避責策略可能帶來日後的聲譽風險
唱反調
2,000 美元的計算成本若不揭露總嘗試次數,極可能是選擇性報告——真實成本可能是公開數字的數十倍,類似統計學的 p-hacking
Lean 4 驗證只能確認推論在特定公理系統下成立,無法保證這些結果對數學社群最重要的開放問題有直接貢獻
Epoch AI 基準顯示 AI 在最高難度類別(Major Advance、Breakthrough)評分仍為零,這十項突破可能集中在「有邊界的困難」而非「開放的最難」
社群風向
傳統上,數學家需為其數學論文的智識工作負全責;但現在這一責任歸屬變得模糊。這其實應被解讀為:在傳統隱性理解下,作者身份的一種明確限制聲明。
關於今天 OpenAI 公布的數學成果,有幾點值得注意:最重要的是,這是在每題花費約 200 美元的情況下實現的。如果我們投入 2 萬美元甚至 20 萬美元的計算量來攻克更難的問題,會發生什麼?單位距離問題的成功率曲線對計算量呈正二階導數——沒有人知道這種能力在哪裡觸頂,連 OpenAI 自己也不例外。
震驚:OpenAI 表示其未發布的 Astra 模型在數學、量子複雜度與理論計算機科學的多個長年未解問題上取得十項進展,包括:首個顯式非索菲克群、Connes 剛性猜想被推翻、雙人糾纏量子博弈的平行重複定理獲得證明、Ehrhart 體積猜想獲得證明、1978 年以來首次改進一般球堆積指數。
AI 代理與頂尖模型正在發生極為震撼的事情。我真的認為我們的世界很快就會因此大幅改變。
下一代 GPT Astra 解決了數學中 10 個未解問題,這些問題中的每一個在過去十年或更長時間內幾乎沒有任何進展。
炒作指數
行動建議
安裝 Lean 4 + Mathlib4,嘗試以 AI 生成並驗證你熟悉領域的一個簡單定理,親身體驗形式化驗證流程的門檻與效益
若團隊有數學密集型研發需求,設計一個「AI 提案 + Lean 4 驗證 + 人工審核」的三層工作流程試點,並記錄完整嘗試次數以評估真實成本
追蹤 Leiden 宣言的後續進展,以及學術機構對 AI 輔助論文的發表規範制定——這將直接影響 AI 數學工具的合規使用邊界