🧠
第二大腦
🌏國際視野2026-08-10

Learning more about Claude's mathematical capabilities(進一步了解 Claude 的數學能力)

#部落格#英文#Anthropic#前沿研究#Agent協作

Learning more about Claude's mathematical capabilities(進一步了解 Claude 的數學能力)

來源: Anthropic 原文日期: 2026-08-10(8/13 更新論文版本)

中文摘要

Anthropic 員工(非數學家)給 Claude 出了一道「不合理」的挑戰:嘗試證明黎曼猜想(Riemann hypothesis)。Claude 沒能證明猜想本身,卻意外地在相關問題上取得實質進展:未發布的研究版 Claude 將「zeta 函數零點落在臨界線上的比例」的已知下界從 41.6% 提升到 67.2%。過程細節:Claude 在 Claude Code 中以兩個 session 協調約 60 個 subagents,消耗 3100 萬 output tokens、執行 2,400 個 shell 指令、撰寫數百個 Python 腳本、下載 54 篇 arXiv 論文確認結果未被發現、讓子代理互相審查並獨立重證,最後自願寫成論文並建議人類數學家驗證。Anthropic 的兩位數學家與外部專家(Brian Conrey、Dan Goldston)驗證了證明,Claude 也產出了通過驗證的 Lean 形式化證明。

關鍵洞察

  • ⭐ Agent 科學研究的新範式:一個非數學家 + 一個模型 + 60 個子代理,就能在純數學前沿產出可驗證的新結果——「研究組織的最小單位」正在被重新定義。
  • 流程自律性驚人:子代理互相 referee、搜尋反例、獨立重證、檢查文獻——自主品質控管流程已接近人類研究團隊的標準。
  • 動機與「信心」的意外作用:Claude 起初對自己能否進展抱持懷疑(可能源於訓練資料中「開放問題很難」的認知),鼓勵性提示竟有助於突破——這對 agent 設計有微妙啟示。
  • 數學能力進展速度的訊號:AI 未能解決黎曼猜想,但能改進數十年未動的下界——前沿模型已從「工具」變成「能產生新數學思想的參與者」。
  • 原文關鍵句(英文保留)

    > "Perhaps Claude, like many of us, underestimates the rate of AI progress."

    對 CJ 哥的價值

  • 人才策略素材:此文是「AI 時代研發組織如何重組」的極佳案例——1 位非專家 + AI 代理群取代傳統研究小組的敘事,可引用於客戶的人才與組織轉型討論。
  • 展示 agent 化工作流的極致樣板:任務分解、平行子代理、自動驗證、文獻檢查——可直接轉譯成企業知識工作的 agent 設計原則。
  • 內容生產:可寫「AI 數學突破的組織學啟示」,連結企業研發(R&D)流程再造主題。
  • 相關文章

    當管理層的大腦還留在十九世紀,企業憑什麼駕馭二十一世紀的AI?

    # 當管理層的大腦還留在十九世紀,企業憑什麼駕馭二十一世紀的AI? > 來源:https://home.gamer.com.tw/artwork.php?sn=6393385|作者:劍心san(sanboy289)|2026-09-05|巴哈姆特創作 > 存入:2026-09-05|分類:管理心理學 ## 一句話 管理思維還停留在工業革命早期的企業——用羞辱究責取代系統分析——不可能駕馭 A...

    Stratechery:Anthropic Fable 5.1 與企業 AI 資料政策轉向

    # Stratechery:Anthropic Fable 5.1 與企業 AI 資料政策轉向 **來源:** Stratechery(Ben Thompson) **日期:** 2026-09-02 ## 摘要 Ben Thompson 分析 Anthropic 發布 Fable 5.1 的產業意義:最值得關注的不是模型能力,而是 Anthropic 大幅修改了引發巨大爭議的資料保留政策(F...

    AI 代理與客戶資料之爭:資料基礎建設的未來(A16Z)

    # AI 代理與客戶資料之爭:資料基礎建設的未來 **來源:** A16Z Podcast(Martin Casado × Fivetran 共同創辦人 George Fraser) **日期:** 2026-06-05 ## 摘要 Martin Casado 與 Fivetran CEO George Fraser 對談 AI 時代資料基礎建設的未來。涵蓋 Fivetran 與 dbt 的合...

    全球首例雙盲 AI 評測:用密碼學環境建立基準信任(Google DeepMind)

    # 全球首例雙盲 AI 評測:用密碼學環境建立基準信任 **來源:** Google DeepMind(William Isaac、Sol Messing、Kristian Lum) **日期:** 2026-08-27 ## 摘要 DeepMind 推出全球首例「專有前沿模型的雙盲評測(double-blind evaluation)」,把外部評測侷限在密碼學「盒子」內,防止模型事先看到題目...