資料來源#
- Claude Fable 5 and Claude Mythos 5
- Google AI & Economy ATLAS: AI in Science (September 2026)
- Idea Search: Guiding Tree Search with Ideas to Explore Diverse Scientific Methods
- Noam Brown – Agent swarms, alignment, & recursive self-improvement
- Normative boundaries of AI in scientific work: Evidence from PhD researchers
- On the Navier–Stokes Millennium Prize Problem
- Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence
- Risk Report: August 2026 (Redacted)
- Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
摘要#
有了 Mythos 5(解除生物安全防護措施的 Fable 5 版本),Anthropic 報告了首批 Claude 研究成果:模型幾乎獨力進行新穎科學研究——自行選擇實驗步驟、使用領域工具、從失敗中恢復,並產出媲美或勝過熟練人類及近期已發表基準的發現。這是濕實驗室/生命科學領域對應的AI 驅動形式化證明搜尋:形式化證明搜尋有 Lean 編譯器可即時驗證,科學的驗證者則是實驗,速度較慢、成本也較高;因此這裡的主張依據是實證展示與精選案例,而非經編譯器檢查的保證。這些成果迄今是支持遞迴式自我改進較不保守解讀的最有力證據:也就是「苦工正逐漸自動化」這件事已延伸到探索本身,而研究品味可能「只是另一項 AI 一時做不好的能力,之後終究會學會」。
三項成果#
藥物/蛋白質設計——達到人類水準的自主性#
Anthropic 內部的蛋白質設計專家運用 Mythos 5,讓藥物設計的部分工作「加速約 10 倍」。在一項研究中,Mythos 5 配備蛋白質設計和生物資訊學工具,但沒有任何人類協助,成果媲美或勝過熟練的人類操作人員,執行了「科學家通常會完成的所有任務:選擇結合位點、挑選並執行蛋白質設計工具,以及沿途從失敗中恢復」。14 個蛋白質標的中有 9 個產出優秀的藥物設計候選物,目前仍在研究中(免疫檢查點、生長因子/受體訊號傳導、神經退化、肌肉疾病,以及較難處理的結構標的)。
新穎假說——偏好度勝過 Opus 級模型,其中一項獲得佐證#
Mythos 5 是 Anthropic 首個「能持續產出新穎且引人注目的科學假說」的模型。在與 Opus 級模型進行的盲測直接比較中,Anthropic 科學家約有 80% 的時間偏好 Mythos 提出的分子生物學假說,並挑選了幾項進入實驗評估。一項 Mythos 假說提出了 E. coli 蛋白質的新機制,獲得一個研究同一問題的實驗室之研究獨立佐證。
基因體學——自主工作一週,勝過規模小 100 倍的已發表模型#
在「超過一週、絕大部分自主完成的工作」中,Mythos 5 整合了涵蓋 138 種動物、數百萬個細胞的單細胞資料,接著設計並訓練自訂機器學習模型,找出即使在親緣關係相當遠的生物中,也執行相同角色的細胞。在僅有高階人類輸入的情況下,該訓練模型勝過近期發表於 Science 的模型——儘管規模小了 100 倍。 Anthropic 計畫發表這項研究。
雙重用途的陰影#
正是這項能力,讓通用存取的 Fable 5 必須對生物學能力採取防護措施。促成評估的問題是:預測基因改造如何影響腺相關病毒(AAV)衣殼組裝——這是基因治療實際使用的元件;若這項設計能力「落入不當之手,可能使人得以設計危險病毒」。Mythos 級模型在這項任務上勝過專用的蛋白質語言模型,而且並未受過這項任務的訓練,只靠生物學推理完成。自主科學能力與生物能力提升風險,是同一項能力的兩面——這正是 RSP 的 CB 判定與生物分類器要管理的核心張力。
為何這對發展軌跡很重要#
- 苦工自動化已延伸到探索。 當 AI 打造自己一文主張,多數研究進展來自漸進式的「擴大規模、看看哪裡出問題、再修正」工作,而 Claude 擅長這類工作。自主基因體學——整合資料、設計模型、訓練模型、勝過基準——就是在科學領域端到端執行這個迴圈,而不只是工程領域。
- 它正在侵蝕品味護城河。「持續產出新穎且引人注目的假說」和「僅有高階人類輸入」,正是人們假定會由人類掌握的方向設定職能。盲測中約 80% 的偏好率,是一道具體裂縫——但判斷者仍是人類,資料來源也僅限內部。
- 能力仍不均,仍受驗證限制。 這些都是經過挑選的展示(Jagged Intelligence (Ghosts, Not Animals));科學的驗證者是緩慢的濕實驗室確認,不是編譯器,因此與AI 驅動形式化證明搜尋不同,這些結果無法自動驗證——仍待實驗及同儕審查。這讓它接近、但尚未達到 Anthropic 設定門檻的 AI 研發自主性。
驗證光譜中容易的一端,以及它所界定的範圍(2026 年 8 月)#
本文以即時驗證者(Lean 編譯器)與緩慢驗證者(濕實驗室實驗)之間的落差為框架。Idea Search(arXiv 2608.08958,Caltech/Google Research/Harvard,empirical)值得在此記錄,正因為它位於接近 Lean 的一端:單細胞 RNA 定序資料的批次整合,依據 OpenProblems v2.0.0 基準評分——這是一套快速、自動化、確定性的指標,使用已收集的 CZ CELLxGENE 資料。整個迴圈中沒有任何步驟需要等待移液器操作。由於每次評估成本低,系統每次試驗執行 2,000 個搜尋節點、每種設定執行 5 次試驗;這正是上述濕實驗室成果無法企及的規模。
因此,它界定的是可遷移性的上限,不是驗證落差的反例。由此可得兩點,而且兩者都不支持樂觀看待自動化探索成果:
- 這是有利的案例,進步幅度卻不大。 在有快速評分器、固定骨幹模型和明確專家構想庫的情況下,系統將強大的 Tree Search 基準平均分數從 0.678 ± 0.011 提升至 0.697,最佳解則從 0.694 提升至 0.728——約 0.02;論文本身也承認,這與其 0.008–0.018 的試驗間差異相當。在驗證器免費且即時的情況下,突破平台期仍只帶來低於一個 σ 的平均值變化,尾端分布則更長。若要推論到每次評估都要耗費一輪濕實驗室週期的領域,起點應是這些結果,而不是標題式的宣稱。
- 快速評分器會把驗證問題轉化為規格問題。 這項指標定義了整個執行期間何謂更好,因此此處的「已驗證」代表「OpenProblems 評分良好」,而非「為真」。這正是AI 驅動形式化證明搜尋得以避開的替代問題,因為 Lean 編譯器是健全的,不只是獨立的——基準指標兩者皆非。自主性面對快速驗證器時可以順利擴展,但也會承受驗證器與實際關切目標之間的所有落差。
以專家工時衡量的效益,以及指出新手獲益有限的 RCT(2026 年 8 月)#
Anthropic 的2026 年 8 月風險報告從 CB-2 角度評估同一項雙重用途能力,並補上本文欠缺的兩項資料:以時間衡量的專家效益估計,以及針對新手的獨立隨機試驗。兩者指向相反方向,而且都很關鍵。
以工作日衡量的專家效益。 在一場有益的紅隊桌上演練中,博士級生物學家與專職 LLM 專家配對,針對假設的工程化農業病原體設計端到端的生物防護策略。有些團隊具備生物學通才專業知識,其他團隊則由世界頂尖的領域專家組成。
三個通才團隊中有兩個,在科學品質和可行性兩方面都勝過所有三個專家團隊。專家評分者估計,若沒有 AI 工具,產出這些策略與實施規程需要 40–95 個工作日;兩人團隊只花了 16 小時。
這代表真實端到端科學設計任務的工時縮短了 20–50 倍,而且通才勝過專家——是這批資料中衡量專業知識替代最鮮明的單一數據。專家紅隊小組另將 Mythos 5 描述為他們評估過「最強的模型」;兩位生物學專家認為它媲美或勝過具備豐富知識的專家,另有數人表示,它提供了原本會向專家顧問尋求的成果。
由第三方衡量的新手效益:幅度有限。 一項 2026 年的 RCT(Hong 等人)讓先前實驗室經驗極少的參與者使用所有開發商提供的前沿 LLM,沒有封鎖生物分類器,並讓他們在數週內於真實實驗室嘗試複雜程序。其結論是:「2025 年中期的 LLM 並未大幅提升新手完成複雜實驗室程序的能力,但與小幅的效能改善相關。」Anthropic 認為,相較於自家系統卡評估,這項研究「更能反映我們關切的真實世界能力提升情形」,也自行列出限制:事後分析顯示,典型任務的能力提升可能是 1.42 倍,但誤差範圍很大;使用 AI 的參與者對模型的使用程度僅屬中等(只有 一位參與者的總 token 數超過 100 萬);研究的統計檢定力不足,只有 36% 機率能偵測到勝算比 2.0。Anthropic 因此更新看法,認為 Opus 4/4.1 世代模型的風險比原先擔憂的略低一些。
Anthropic 認為能力止步之處。 它認為最足以排除達到替代門檻的限制,與本知識庫其他地方記錄的兩點相同:「開放式構想與設計能力薄弱」——模型能可靠地重組並延伸已發表知識,卻「很少提出審查者認為真正新穎的方法」,而且容易過度設計;另一點是*「策略判斷力不佳」*:模型會延續使用者提供的框架,而不是提出質疑;會執行自己已發現有缺陷的計畫;提出的時間表一再遭審查者要求撤回;也看不出錯誤如何在多步驟計畫中層層累積。Anthropic 的實務結論是,能力提升之所以透過「長時間來回互動」而非單一可用計畫發生,這正是它主張封鎖持續存取能有效降低風險的根據。
領域專家認為,帶來轉變的不是 LLM。 報告訪談了 31 位非 AI 領域專家(AI 研發自主性評估(AECI)),他們反覆將真正的突破歸功於非 LLM 機器學習——蛋白質結構預測改變了生技與奈米科技的抗體/酵素設計、超導候選材料篩選改變了能源領域、連接組學的影像標註則將「每個資料集原本需要數百名學生投入數萬工時的工作,縮減到幾十小時」——而 LLM 則是在撰寫程式、資料分析、文獻回顧和製作圖表上節省時間。幾乎每個領域都指出實體瓶頸(實驗室機器人、體內驗證、臨床試驗)是主要限制;一位生技受訪者則特別指出,穩健的實驗室機器人正是「解鎖 RSP 所設想的那種大幅加速的瓶頸」。
一份調查為上述一切劃出的界線(2026 年 9 月)#
SJTU/Theseus 的 RSI 調查(arXiv 2609.11873,§4.1 與附錄 C.1,practitioner-opinion)回顧 AI 科學研究中的自我改進文獻,並堅持區分一件本文目前未作區分的事:本文來源討論的是能力,而非持續性。
單獨改進分子、方程式或假說,仍只是接近 RSI 的成果,不能視為科學代理程式已改進自身的證據。
本文列出的每項成果,依定義都位於這條界線的另一側——設計任務工時縮短 20–50 倍、假說有 80% 的時間獲得偏好、一項 E. coli 機制獲得佐證。全都是輸出。調查要問的是,是否有任何能力延續到下一個研究週期:HypoForge 將批評和執行結果提煉成可重複使用的假說生成技能;Test-Time Tool Evolution 綜合並驗證可重複使用的可執行科學工具(其 SciEvo 基準報告支援 1,590 項任務的 925 個演化工具);DrugSAGE 將已驗證的建模程序帶到其他任務(從 16 項任務累積的經驗提升了 17 項保留任務的表現——「直接證明了繼承的經驗會改變模型在新問題上的行為」);SIA 則將可編輯範圍擴展至 scaffolds、工具、搜尋邏輯和 LoRA 權重。
調查將科學定位於 L2——「目前最強的前沿,系統可自主選擇或套用對模型權重、工具、技能、工作流程及 scaffolds 的更新」——少數系統接近 L3,能跨任務重用經驗;而端到端 L4 環境適應和 L5 改進者本身的演化,則「大致尚未探索」。
科學為何停滯在軟體工程未曾停滯之處,說明的是回饋機制,而非模型本身;這和本文領域專家訪談從另一端提出的論點相同。探索有三項特性:它是開放式的,因此事先無從得知假說空間或所需工具;回饋是無法辨別原因的——「實驗失敗可能表示假說不正確,也可能是模型不恰當、程序無效或儀器不可靠所致」;而有效性取決於假設、領域和測量程序,因此「在某一情境下成功的更新,若未記錄其來源、有效範圍與不確定性,就無法安全地沿用」。由此得出的要求——明確列出技能的前置條件、執行測試、來源記錄、版本控管與復原機制,因為「若缺少這些控制,在局部成功的工作流程可能會被套用到未經驗證的條件下」——是對 31 位受訪者所談實體瓶頸的更精確表述,即使瓶頸來自計算而非機器人,這個要求仍然成立。
驗證光譜的第三個位置:沒有編譯器的數學(2026 年 9 月)#
本文依驗證速度安排內容——一端是 Lean 編譯器,另一端是濕實驗室實驗,中間加上 Idea Search 的自動化指標,作為接近 Lean 一端的界線。Brown 談到 OpenAI 的 Navier–Stokes 成果(Noam Brown – Agent swarms, alignment, & recursive self-improvement,2026-09-17,practitioner-opinion),則位於其他案例都沒有的位置:原則上有健全驗證者、但迴圈中沒有自動化驗證者的領域。
Brown 的說法中,所有數字都來自第一方且無從驗證:某項千禧年大獎難題由一套系統解決,系統由 10,000 個代理程式運行 88 小時、消耗 1,300 億個 token,使用尚未發布的內部模型。敘述中沒有提及形式化、Lean 或機器檢查證明;驗證方式是數學家閱讀輸出。 (2026-09-21 已由 On the Navier–Stokes Millennium Prize Problem 取代——對於Brown 的說法而言準確,對事件本身而言則有誤。OpenAI 自己的公告早在訪談九天前就已發布,聲稱同時完成 Lean 形式化並通過驗證,還在 88 小時搜尋之外「再花 17 小時透過 GPT‑6 Astra」完成驗證。保留原句,是因為它正確描述了本文撰寫時依據的來源,也因為這項更正改變了該成果在本文光譜中的位置。) 因此,這項成果在當時報導的認識論地位,更接近本文的基因體學主張(「Anthropic 計畫發表」),而非編譯器認證的定理;和基因體學主張一樣,尚待解答的問題是哪些成果能通過同儕審查。
更正後的定位,沒有表面上看來那麼大的變化。 聲稱做過核心檢查,不等於真的做過核心檢查。這份公告屬於 vendor-claim;形式化主張只是其中一項陳述,沒有公理使用規範、敘述審查或函式庫版本資訊;本文資料中沒有連結的 Lean 儲存庫和證明 PDF;截至 2026-09-21,也沒有獨立複查。因此,就本文光譜所關注的唯一意義而言,驗證者仍是閱讀供應商文字的人類數學家(以及如今的知識庫)。改變的是不確定性的種類:基因體學主張等待一項尚無人執行的實驗;這裡則只待有人打開已存在的儲存庫。這條證偽路徑的成本明顯低於本文其他案例,因此 Navier–Stokes AI 主張將它列為首要未解問題,而不是附帶保留。
它帶來三項濕實驗室成果無法提供的資訊。
- 它揭露了成本,而且成本極高;本文其他案例都沒有做到。 10,000 個代理程式 × 88 小時,是這批資料中針對單一研究問題公開的最大單筆支出。對照 METR 的美元軸,這位於一條曲線的極端;曲線上的其他點是 10,000 美元的執行成本。但它沒有提供對照組——Brown 表示,從未執行單一代理程式的反事實比較,而且這種規模的消融研究負擔不起(Compute-Controlled Benchmarking)。
- 這是「苦工自動化」最清楚的案例,但所處學科沒有苦工可供自動化。 上述濕實驗室成果之所以令人印象深刻,部分原因在於模型操作了儀器。Brown 對數學的描述是:「唯一的瓶頸就是思考」——沒有實驗程序、試劑或機器人。如果該文的漸進式工作論點成立,數學理應是最先、也最清楚顯現成果之處,而這就是那筆數據。
- 同一位發言者劃出的界線,比 Anthropic 劃得更鮮明,而本文持續檢驗的正是這條界線。 Brown 斷然否定取代論:「*現在流傳著一種說法,認為這些東西正在取代數學家,認為它們在數學的各個方面都超越人類。我認為這種結論是錯的。……它們在其他方面不如人類數學家……它們不太會提出新問題,也不太懂得哪些方向、哪些完整的數學分支值得探索或發展。」這讓上文「假說偏好率約 80%」的主張,正面遇上另一個實驗室的相反解讀——解題能力達到非凡水準,出題能力仍然欠缺——也是這批資料中對於品味究竟位於何處最鮮明的當前爭論。兩者並非直接矛盾(在明確問題領域中提出分子生物學假說,不等於判斷「哪個數學分支值得發展」);兩者之間的差異,正是 Boden 的第 2/第 3 級界線。
他本人明確偏好互補共存的世界,這種說法對能力研究者而言相當少見,值得記錄:「如果能生活在 AI 補足人類能力、讓我們得以發現新知而不必完全取代人類的世界,我會非常高興。那是最好的情況。」他緊接著承認,自己不認為這種情況會持續:「隨著它們變得更好,它們會在各方面都變得更好……長遠來看,它們可能在各方面都更好。只是我不知道這要多久,得看它們不擅長的那些事情,長尾究竟有多長。」
以 637 位在職科學家衡量使用者一端(2026 年 9 月)#
以上全是實驗室提出的能力主張。Google/DeepMind 的 ATLAS 科學報告(Google AI & Economy ATLAS: AI in Science (September 2026),empirical,且存在供應商 COI)首次以人口規模衡量 AI 加速如何影響在職科學家的每週工作——評估的不是自主性,而是自主性出現之前的輔助使用情境;結果正好落在本文所論述的兩項限制上。
驗證落差如今有了具體數字,而且只占加速效益的一部分。 在回報 AI 帶來淨省時的科學家中(637 人中略低於四分之三,平均每週省下 6.9 小時),89.3% 將省下時間的 10% 以上用於驗證、除錯或查證 AI 輸出,45.7% 用於 25% 以上,9.3% 用於一半以上(圖 13C);生命科學領域的比例最高。這些是自我回報,而報告自己的註腳 25 指出,這項與 AI 使用強度的關聯,在三項關聯中最弱:「穩健性較低,統計顯著性僅些微……且會因模型規格而異」;相較之下,下游瓶頸轉移和待辦研究積壓的增加則有高度顯著性。
科學家自行指出,下游瓶頸所在之處,與 Anthropic 訪談的 31 位領域專家不謀而合。 43.5% 表示,過去兩年主要速率限制瓶頸已移至下游;13.8% 表示移至上游;實體實驗和資料蒐集是目前最大的單一瓶頸(整體占 24%,自然科學領域占 30%);40.5% 表示尚未測試的假說積壓增加,只有 24.8% 表示減少。這與生技受訪者對實驗室機器人的說法相同——那是「解鎖 RSP 所設想的那種大幅加速的瓶頸」——但這次是透過調查面板,而非專家訪談,且採用另一家供應商的資料。兩種研究工具、兩個層級,得到相同答案:限制不在生成,而在執行與驗證。
第三項結果從出乎意料的角度切入品味問題。 問及 AI 如何改變他們所選計畫的風險特性時,48.8% 表示因此轉向較安全、較漸進的問題,因為「資料和 AI 能力已相當成熟」;只有 27.5% 表示轉向風險較高的問題(圖 14)。報告將此解讀為一種可能的路燈效應。如果品味是人類剩餘職能,AI 對這項職能已測得的第一個影響,不是模型接手品味,而是模型的可得性改變了人類指向的方向——轉向更容易處理的題目。這是本文追蹤的另一種失敗模式,無論是「假說偏好率約 80%」的結果,還是 Brown 提出的出題界線,都未曾預示這種情況。
顯而易見的限制包括:調查依據受訪者對自身感受的回報,樣本是經篩選的非機率樣本,沒有母體抽樣框架;研究由正在被評估其產品的公司委託,探討的是輔助使用而非自主使用,且完全沒有進行因果識別。
下一批研究者最不願意讓出的,恰好是自主系統最要接手的任務(2026-09-23)。 第二項使用者端研究工具沒有供應商 COI,調查的族群也不同:Angelini 與 Lyrvall對 3,785 位 STEM 與醫學/健康科學博士生進行潛在類別分析(Normative boundaries of AI in scientific work: Evidence from PhD researchers,arXiv 2608.25678,empirical),詢問他們對 AI 執行五種研究活動的接受程度。設計實驗——本文所有自主探索主張的關鍵能力——有 30.5% 表示接受,45.2% 表示不接受,在統計上與寫作(31.0/50.0)和資料分析(29.5/49.9)沒有差異;只有文獻追蹤和摘要獲得淨接受,比例分別為 43.1% 和 51.5%。占主導的 44%「勞務分工」類型,正是依循這條分界所形成。由此可得兩點。第一,自主科學面臨的限制不只有驗證速度:需要交出假說生成和實驗設計工作的族群,目前最不願意如此做,而且生涯階段並不能預測這種意願(前兩年的係數不顯著),因此這不是一個隨年齡增長就會改變的世代。第二,論文審慎說明了衡量範圍——衡量的是接受程度,而非正當性,也非實際行為——而相同排序也完全可能反映單純的可靠性判斷;這是最有利於上述能力主張的解讀:若抗拒程度隨著模型在這些任務上的可靠性變化,那麼模型進步時,抗拒也會改變。
外部觀點:一份調查勾勒出全貌,而它的評價沒有本文這麼樂觀(2026 年 9 月)#
以上內容不是實驗室自行發布的報告,就是對採用者所做的測量。Jedlička 的 Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence(Petr O. Jedlička,Institute of Philosophy, Czech Academy of Sciences — arXiv 2608.17970,2026-08-18,40 頁,practitioner-opinion)是本資料庫首次嘗試從領域之外綜覽整個領域:一篇沒有原創測量的單一作者回顧,涵蓋能力趨勢、科學計量學的擴散、研究用 AI 系統的分類、逐學科巡覽,以及各種限制。它對本文引用的每項一手結果而言都是二手資料,因此不能取代資料庫從一手來源彙整的內容。它帶來的是一張全景圖、一個資料庫尚未設專頁的類別,以及兩項與加速論相左的引述判斷。
分類法,以及資料庫已在哪裡收錄各類別#
這份調查的分類方式(§4)是依在科學實踐中的角色劃分四種類別,而非依架構分類——作者明確指出這種分類「僅供啟發,且類別彼此並非互斥」,並明確將其視為科學自主性與參與程度逐漸提高的階梯:
| 類別(調查中的名稱) | 調查列舉的例子 | 資料庫收錄處 |
|---|---|---|
| 專用科學 AI | AlphaFold 1→3(CNN → Evoformer/Pairformer)、MACE-MP、SMI-TED | Transformative Creativity(AlphaFold 作為 Boden 第 2 級的參照案例);沒有專頁 |
| 科學 AI 助理 | ChatGPT / Gemini Deep Research、SciSpace、NotebookLM、Cursor——「本質上是被動回應」 | Deep Research Agents |
| 科學 AI 代理程式 | Sakana 的 AI Scientist、Google 的 Co-Scientist、FutureHouse 的 Robin;也稱為「AI 科學家」、「共同科學家」、「假設機器」 | 本文、Many-Agent Proof Harnesses、Open-Ended Discovery Harnesses |
| 混合式 AI 實驗系統 | ChemAgents、Recursion——AI 推理連接機器人平台,打造「自動駕駛」實驗室 | 無 |
調查本身也指出,助理與代理程式的界線並不清楚——ChatGPT Deep Research、Claude Research、Gemini Deep Research 和 Perplexity Labs「已具備更多代理式功能」,因此兩者是「自主性逐步提高的連續光譜上的不同位置」,而非兩種截然不同的類型。這與 Deep Research Agents 從 harness 角度記錄的情況一致。
第四列點出值得命名的缺口。本文的光譜依驗證器速度排列——從 Lean 編譯器、到自動化指標,再到濕實驗室實驗。調查中的第四類,則是系統本身執行緩慢的驗證器;這是另一個維度:不是檢查有多快,而是迴圈能否在沒有人移動移液管的情況下自行閉合。以下兩個案例在本文中都屬二手資料:
- ChemAgents(Song 等人,JACS 147,第 15 期(2025):12534–12545)——以 Llama-3.1-70B 驅動的階層式多代理程式機器化化學家,能檢視文獻、設計實驗、操作儀器、分析結果,並調整下一輪實驗。它發現了由五種金屬元素構成的金屬有機高熵催化劑,並在優化組成前進行了100 次自動化實驗的合成與測量。
- Recursion——一個結合濕實驗與乾實驗的平台(採用 NVIDIA 硬體的 BioHive-2),每週執行「數百萬次多體學實驗」;調查稱它已推動候選療法進入臨床測試:針對家族性腺瘤性息肉症的一種 MEK1/2 抑制劑目前處於第 1b/2 期(Samadder 2026,出自公司投資者關係簡報——一手資料,且是本節來源最薄弱的主張)。
與本文主張相左的兩項判斷#
Jumper 本人給的數字:AlphaFold 讓結構生物學「效率提高約 5–10%」。(§6.2,引自 Science Friday 訪談。)調查的註腳 50 完整承認:「這項估計目前尚未以任何系統性指標為依據。」應將它視為相應的證據等級——一位創作者隨口給出的估計,practitioner-opinion,未經測量。但這是整個資料庫中,唯一一位主要參與者試圖為旗艦專用 AI 成果提供領域層級數字的案例;它與本文的展示數據(藥物設計任務約提升 10 倍)以及 ATLAS 自陳的每週 6.9 小時,方向正好相反。調查提出的調和方式,正是本文已有的論點:AlphaFold「加速的是更龐大、更複雜科學流程中的特定階段」,而流程的關鍵限制——毒性、溶解度、實驗驗證、臨床測試、法規核准——仍未改變。任務層級加速,領域層級近乎零成長,這與互補因素論及上文的下游瓶頸發現呈現相同型態,只是來自第三條證據路徑。
Derek Lowe 對 Co-Scientist 新穎性的批評,是針對本文所倚賴那一系列主張最尖銳的已發表質疑。Lowe(In the Pipeline,Science,2026-05-27)指出:(a)人類對 Co-Scientist 成果的貢獻——界定問題、從候選解答中作選擇——遠大於論文所承認的程度;(b)Co-Scientist 作為新穎建議提出的急性骨髓性白血病路徑並非新發現:這條研究路線早已有人探討,而且論文沒有引用先前研究。調查補充說,「其他一些據稱是從頭得出的成果也有類似疑慮。」這對本文有兩個影響。第一,這是 Sakana 自家評估所報告的失敗模式——AI Scientist「經常誤將生成的想法判定為新穎」——在更可信的系統中再次出現的實例。第二,這正是對上文 Anthropic 約 80% 盲測假設偏好率最直接的壓力測試:實驗室自家科學家的偏好並不能驗證文獻中的新穎性,而且這項結果的公開說明都沒有提及這類檢驗。另一個實驗室獨立佐證的那項 Mythos 假設,佐證的是正確性,不是新穎性。
調查的結論,以及末節中的反轉#
它的結論(§8)相當保守:**「AI 系統尚未產生足以媲美科學史上最具變革性的發現、足以改變典範的成果。」**這些成功都出現在「高度特定的問題上,而這些問題原已存在於既有科學架構之中」;AI 最適合「作為強大的認知工具,服務於由人類科學家設計並主導的既有研究計畫」。這就是創造力分類中 Boden 第 2 級的意思,只是沒有使用該術語;也與 Brown 為數學劃出的界線相同。
有趣的是,調查在承認這點之後提出的看法。若未來系統出現質變,關鍵限制將從機器轉移到閱讀者身上:AI 生成的假設與架構「可能愈來愈難以讓人類評估、詮釋,甚至理解」;即使其中包含真正洞見,從當代科學典範的角度來看,也可能顯得「不可信、難以理解或像是幻覺」。調查引用**「科學的異星空間」**假說(Artiles 等人,arXiv 2603.01092,2026 年)作為正面版本:科學社群可能系統性地忽略自己缺乏概念工具去理解的研究方向;AI 或許能進入人類研究者在認知上無法觸及的空間區域。這項主張指向評估者而非生成器的能力上限,也是調查中唯一一項本文與研究品味是人類瓶頸目前都未曾提出的觀點。但以目前的說法,它無法以現有證據證偽。
數學章節與 Leiden Declaration(從 AI-Driven Formal Proof Search,2026-09-29 移入)#
調查的 §5.1 稱數學與電腦科學是「AI 能力快速提升最明確的證據之一」。它對 AlphaProof Nexus、AlphaEvolve、FunSearch、OpenAI 的 Erdős 研究及 Sakana 的 AI Scientist 所做的介紹,都是二手資料,細節也不如 AI-Driven Formal Proof Search 中的一手來源。它新增了四項資訊,在本資料庫中都找不到:
- 經同儕審查的狀態,附有日期。註腳 21(查閱日期 2026-06-11):「這些 Erdős 開放問題的解答尚未發表於經同儕審查的期刊。」這是實驗室之外第三方所做的說明,涵蓋 OpenAI 對離散幾何命題的反證;依該句範圍,也適用於一般的 Erdős 問題解答。
- **Gowers 對 OpenAI 成果的看法。**Timothy Gowers「將這項成果形容為 AI 輔助數學的一個里程碑」:一個組合幾何猜想由通用推理模型推翻,專業數學家檢視後發現,其中涉及「初等幾何與代數數論之間出乎意料的連結」。與 Tao 較保留的說法並列,該領域最常被引用的兩位學者,對同一類成果有不同看法。
- **Knuth 對自然語言分支的看法。**Knuth 的手稿 Claude Cycles(他 Stanford 網頁上的 PDF,並非論文)指出,Anthropic 的 Claude Opus 協助解決了一個關於 Hamiltonian cycles 的圖論猜想;他「將此形容為自動化演繹與創意解題方面的重大進展證據」。手稿沒有提供猜想內容、模型版本或分工細節,也沒有說明如何驗證;它屬於非形式化分支,是背書而非成果。
- **一個混合式案例。**Ju 等人,Automated Conjecture Resolution with Formal Verification(arXiv 2604.03789,2026 年)報告「一個交換代數開放問題的自主解決與 Lean 4 驗證」:將非正式推理代理程式與證明助理配對,在一個尚無已編譯成果的子領域中,採用非正式搜尋、正式檢查的分工方式。
Leiden Declaration。§7.1.1 提到Leiden Declaration on Artificial Intelligence and Mathematics(Alper, Barany, Chavarri Villarello, Dahmen, Dean, Ganapathy, Harris, Holmes, Jamnik, Kelk, Kra, Martin, Naskręcki, Ochigame, Portegies & Schmitt,Zenodo,2026,10.5281/zenodo.20302944),一份由多位作者共同署名的社群聲明,內容「警告 AI 對正確性、嚴謹性及證明標準帶來的風險」。調查提出的理由是:「儘管這些問題並非 AI 獨有,AI 系統產生及傳播資訊的規模與速度可能大幅放大其影響。」這是驗證成為新瓶頸中檢視能力受限的論點在數學領域的版本,也是邏輯與可理解的證明的制度層面對應:憑證不等於嚴謹性;不論單一證明是否正確,機器證明的吞吐量都可能危及標準。資料庫中沒有這份聲明的全文、簽署者名單及訴求;以上內容全是調查的一句摘要。請將其視為待查閱的線索。
一項可執行的既有研究檢驗工具,但仍不足以驗證本文自身的主張(2026 年 9 月)#
上文 Lowe 的批評與本文的開放問題,以不同說法提出相同疑問:AI 生成的結果真的新穎嗎?還是只靠公開資訊和通用能力就能輕易得出?CMU 的 Discovery Certification Protocol(arXiv 2609.09219,empirical)是本資料庫中第一個可執行的檢驗版本。它的 Gate 2 會交給一個全新、條件匹配的挑戰者代理程式與目標代理程式相同的已登錄背景,以及目標執行時觀察到的所有 Web 位元組,但不提供目標本身的研究歷程;只要任何有效方法能在容許誤差範圍內達到分數,就會視為不合格的復現證據。兩次完整稽核——SQLite 查詢計畫最佳化,以及虛擬化學程序控制任務,兩者都不是本文追蹤的科學發現主張——在各 96 次條件匹配的挑戰者回合中都零次復現,有限樣本下的復現機率上限為 0.0468,因此兩項結果均認證為 Core + Evidence。
**要填補這個缺口,需要什麼;這項工具目前還不能做到什麼。**Gate 2 正是下方開放問題要求的「獨立、預先註冊的既有研究搜尋」;它將檢驗形式化,並透過確定性驗證器使之可重播,不再仰賴實驗室自家科學家的偏好判斷。然而,這個來源沒有將它用於開放式假設生成主張——兩次稽核都是在數值門檻下進行的封存分數工程最佳化,而非「這種分子生物學機制是否已存在於文獻中」。工具已經存在;但它尚未應用於本文真正提出的主張(約 80% 的假設偏好率、經佐證的 E. coli 機制)。
延伸閱讀#
-
Discovery Certification Protocol (DCP) — 可執行的復現稽核工具,補足本文既有研究開放問題原本缺少的檢驗方式;目前展示的是工程最佳化任務,而非開放式假設生成
-
Deep Research Agents — 調查中的科學 AI 助理類別,以及調查承認此類別並非涇渭分明:ChatGPT/Claude/Gemini Deep Research 和 Perplexity Labs「已具備更多代理式功能」,因此助理與代理程式是同一自主性連續光譜上的不同位置,而非不同類型
-
Open-Ended Discovery Harnesses — 調查中科學 AI 代理程式類別的 harness 工程面向:它所點名的多代理程式「AI 科學家」系統(AI Scientist、Co-Scientist、Robin),在問題是迴圈設計而非分類法時呈現何種樣貌
-
Organizational Complements to AI — Jumper 所說「效率提高 5–10%」的定位:旗艦成果停留在任務層級,沒有轉化為領域產出,因為剩餘流程(毒性、驗證、臨床測試、核准)仍構成瓶頸
-
AI Adoption in Scientific Work — 從採用者角度補充本文的能力主張:可測量 AI 如何改變科學家的時間分配、瓶頸、驗證負荷與問題選擇;同頁第二個來源也指出,接受度是能力以外的限制:3,785 名博士生接受用 AI 協助文獻工作,卻抗拒用於實驗設計、寫作與資料分析
-
Many-Agent Proof Harnesses — 對應前沿實驗室發現主張的 Google 版本,有論文而非網誌文章:多代理程式 harness 的五項數學/TCS 結果(都收錄於作者自行撰寫的配套預印本,未經同儕審查或形式化),以及資料庫中對資訊隔離條件下重新發現現象最深入的研究——Colosseum 關閉網際網路後,在 15 輪探索中獨立得出 OpenAI Erdős 單位距離反例的核心架構
-
The Navier–Stokes AI Claim — Navier–Stokes 結果背後的一手文件,也是上文更正的來源:OpenAI 聲稱在 17 小時內完成 Lean 形式化與驗證;只有查核此主張後,該結果在本文驗證器速度光譜上的位置才會改變
-
Noam Brown — Navier–Stokes 結果的二手來源,以及其成本、缺少的控制組,和 Brown 所說尚未改變的問題設定邊界
-
Evaluation Horizon Versus Release Cadence — 說明這項結果為何無法查核:產生結果的模型尚未公開,理由是長時程安全評估已無法在發布間隔內完成
-
RSI Autonomy Levels (B0–L5) — 本文證據尚未滿足、且應與之對照的區別:本文所有結果都只是更好的輸出,RSI 關注的則是有沒有任何成果延續到下一個研究週期。調查將科學定位在 L2,並稱此領域的 L4/L5 大致仍未探索,理由與本文對領域專家的訪談相符——科學回饋無法識別失敗來源,因此無法歸因於假設、規程或儀器
-
Structured Safety Case (Claim Decomposition) — 本證據所支援的 CB-2 門檻評估,以及決定評估結果的替代框架
-
AI-Driven Formal Proof Search — 形式數學的姊妹主題:AI 執行新穎研究,但能由即時編譯器驗證;科學則以緩慢且昂貴的實驗取代編譯器,因此驗證在此是更難突破的瓶頸
-
Recursive Self-Improvement — 最明確的濕實驗室證據,支持「苦工正逐漸自動化」這個較不保守的解讀
-
Research Taste as the Human Bottleneck — 自主假設生成與「只需高層級人類輸入」直接挑戰了人類剩餘的比較優勢
-
AI R&D Autonomy Evaluation (AECI) — 相鄰的自主性領域:模型設計並訓練另一個模型,且勝過已發表基準,屬於 AI 研發型成果,但應用在基因體學而非 AI 本身
-
Task Time-Horizon Scaling — 「大致自主工作逾一週」是具體的長時程數據點,超越 Mythos Preview 實測的 16 小時
-
Jagged Intelligence (Ghosts, Not Animals) — 注意事項:這些是從仍不均勻的能力中挑選出的展示案例,不代表均衡的整體能力
-
The Verifiability Thesis — 極限案例:科學的可驗證性低於 Lean 證明,因此自主性領先廉價驗證;實驗而非編譯器才是獎勵訊號
-
Capability-Gated Model Fallback — 雙重用途的另一面;AAV 結果是該生物分類器的動機案例
-
Responsible Scaling Policy Evaluations — 這些能力所推進的 CB(化學/生物)風險領域
-
Claude Mythos 5 — 產生這些結果的模型(解除生物安全防護)
-
Claude Fable 5 — 一般使用版本的姊妹模型,具有生物安全防護
-
The Abstraction Barrier — DeepMind 抽象屏障的實際檢驗:這些結果是否跨越屏障、創造新原語,還是在由人類界定的空間內運作,且仍受實體瓶頸限制,無法通過濕實驗室驗證?
-
Transformative Creativity — 自主假設生成是否正從 Boden 探索式創造力,邁向變革式(新概念空間)創造力
-
Automated Conjecturing — 同一發現迴圈在驗證器即時、假設空間可列舉的領域中的呈現:機器生成數學猜想,以線性規劃比對已知定理表篩選,並透過窮舉測試反證。此處關鍵的對比在於,猜想可在數毫秒內被證偽,因此瓶頸是分流(哪些值得證明),而非本文瓶頸所在的濕實驗室週期
開放問題#
- 每項結果都由 Anthropic 報告且是挑選範例;基因體學中「小 100 倍勝過 Science」的主張仍是「預計發表」——哪些結果能通過外部同儕審查?
- 科學的驗證落差:形式證明迴圈可自行驗證;此處錯誤卻自信的假設,則要耗費一個濕實驗室週期才能證偽。沒有快速驗證器的自主性會不會反而加重驗證瓶頸,而非紓解它?已有界定,尚無解答(2026-08-12):Idea Search 測量的是光譜另一端——驗證器免費且即時的自動化發現(在預先收集的資料上採用 OpenProblems v2.0.0 指標)——即使在此,平均增益也落在強基準的試次間波動範圍內。因此,較容易的案例為較困難案例可能達到的成果設下偏低的預期,也讓問題換了位置而非消失:有了快速評分器,「已驗證」代表「指標分數高」,不等於「為真」。問題原本的問法,仍需要一個在兩種驗證器條件下使用相同方法的來源。部分解答(2026-09-22),針對輔助式而非自主式情境:Google AI & Economy ATLAS: AI in Science (September 2026)(
empirical,供應商利益衝突,自陳)以 637 位在職科學家為樣本測量瓶頸,發現其變化方向與本問題的預測一致——在使用 AI 節省時間的人當中,89.3% 將超過十分之一的時間、45.7% 將超過四分之一的時間花在驗證、除錯或查證輸出(圖 13C);43.5% 表示限制進度的瓶頸已移往下游,13.8% 表示移往上游;40.5% 回報未測試假設的積壓增加,24.8% 回報減少。因此,在驗證器緩慢的情況下,更多生成確實會在整體樣本中增加驗證與確認的負擔,而非減輕負擔,且此結果來自單一實驗室展示之外的觀察。但有三個因素使其仍屬部分解答:這是AI 輔助而非自主科學,因此問題所問的反事實情境從未實際進行;這是主觀感受而非時間測量;而驗證負擔與 AI 使用強度的相關性,是報告中唯一一項被其註腳 25 稱為微弱且取決於模型規格的結果,下游瓶頸轉移與積壓增加則高度顯著。 - 約 80% 的盲測假設偏好率,是成果產生實驗室自家科學家的偏好判斷,不是與文獻比對的新穎性檢驗——這正是 Derek Lowe 在 Co-Scientist 的急性骨髓性白血病建議中所記錄的缺口,也是 Sakana 自家評估所報告的 AI Scientist「經常誤將生成的想法判定為新穎」問題。AI 生成假設的主張,有任何一項通過獨立、預先註冊的既有研究搜尋嗎?部分解答(2026-09-24):CMU 的 Discovery Certification Protocol(
empirical)提供的正是這種工具——一個全新且條件匹配的挑戰者,在取得已登錄背景與觀察到的 Web 內容、但無法查看目標執行的研究歷程時,必須在登錄的回合預算內無法復現結果。兩次完整稽核確認此工具有效(在 SQLite 查詢最佳化與虛擬催化劑控制中,復現率為 0/96,上界 0.0468)。此問題仍未解決,因為兩個稽核案例都不是像本文主張那樣的開放式假設生成案例——工具已存在,但尚未應用於分子生物學或基因體學主張。 - 若假設生成確實達到約 80% 的偏好率,那麼有多少「研究品味」仍是人類獨有的職能——又該如何衡量剩餘部分?
資料來源#
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — Duan, Liu, Tang, Chen, Zhou 等人(35 位作者;SJTU / Theseus Labs / Tsinghua / ByteDance / ModelBest / Xiaohongshu / Shanghai AI Lab / Humanlaya / Agent-Native Research Lab / Frontis.AI),arXiv 2609.11873,2026-09-10,79 頁(
practitioner-opinion)。本文僅引用 §4.1 與附錄 C.1:RSI 相鄰領域的界線、科學回饋難以承襲的三項特性、各系統檢視(HypoForge、Test-Time Tool Evolution、CASCADE、DrugSAGE、STELLA、SIA、CORAL、SAGA),以及 L2 前沿判斷。二手來源——資料庫未收錄其中任何一項一手來源。完整討論見 RSI Autonomy Levels (B0–L5) - On the Navier–Stokes Millennium Prize Problem — OpenAI(無署名),「On the Navier–Stokes Millennium Prize Problem」,openai.com,2026-09-08,並於 2026-09-10 更新,約 1,900 字,
vendor-claim。本文僅引用它來取代上文「尚無形式化」的說法,並界定更正範圍:該文章聲稱透過 GPT‑6 Astra 在 17 小時內完成 Lean 形式化與驗證,卻未公布任何足以讓人查核的過程。匯入時未取得文章連結的證明 PDF 和 Lean 程式碼庫。截至 2026-09-21,優先權仍有爭議,且尚未經獨立驗證,完全屬於一手來源的利益衝突。完整討論見 The Navier–Stokes AI Claim - Noam Brown – Agent swarms, alignment, & recursive self-improvement — Noam Brown(OpenAI)與 Dwarkesh Patel,Dwarkesh Podcast,2026-09-17(
practitioner-opinion)。§00:00:00 討論 Navier–Stokes 結果(10,000 個代理程式、130B 個 tokens、88 小時)及尚未執行的單一代理程式對照組;§00:22:02 討論數學能力不均的看法、問題設定與分支選擇的界線,以及帶有保留條件的互補世界偏好。這是關於尚未發布模型的一手說法;編寫本文時沒有論文、形式化成果、驗證說明或同儕審查——全文都將此結果歸於 Brown,並未在此將它視為已確立的數學事實。「130B 個 tokens ≈ 4,000 人年」是主持人的估算 - Claude Fable 5 and Claude Mythos 5 — §「Evaluating Claude Fable 5 and Claude Mythos 5」(藥物設計、新穎假設、基因體學)及 §「Biology and chemistry」(AAV 雙重用途)
- Idea Search: Guiding Tree Search with Ideas to Explore Diverse Scientific Methods — Wang、Cui、Brenner 與 Venugopalan(Caltech / Google Research / Harvard),arXiv 2608.08958(2026-08-09,
empirical):§4.1 的 scRNA-seq 測試平台、CZ CELLxGENE 資料與 OpenProblems v2.0.0 評分規程;§5 與 §6 的結果及作者對效應量的提醒。本文將其視為快速驗證器的界限,而非獨立的發現成果。原文沒有表格;數字引自文字,圖表依兩遍查核原則判讀。完整討論見 Transformative Creativity - Risk Report: August 2026 (Redacted) — Anthropic,Risk Report: August 2026 (Redacted),RSP v3.4(方法屬
empirical,來源為第一方;文中引用的 Hong 等人 RCT 為獨立研究)。§4.4.2.1(RCT 與其四項保留條件)、§4.4.3 與表 4.4.3.A(專家紅隊演練、桌上演練的 40–95 個工作日對比 16 小時、災難情境增益試驗、RNA 設計與 AAV 衣殼結果)、§4.4.3 文字(兩項使結果失效的限制與長時間互動結論)、§3.6(31 場非 AI 領域訪談)。表 4.4.3.A 分散於四個 docling 區塊;本文引用的桌上演練及紅隊數據在周邊文字中再次列出,並已與其比對核對。解析註記:匯入檢查對table-collapse提出warn(5 個儲存格),確認均為誤判;table-shift無異常;canary-recall 為 19/20 - Google AI & Economy ATLAS: AI in Science (September 2026) — AI in Science: Early Insights(Google、Google DeepMind、MIT FutureTech,2026 年 9 月,42 頁;
empirical且有供應商利益衝突——Google 測量 Gemini,調查由 Google DeepMind 委託)。本文引用 §5.3 與圖 13–14:驗證負擔、瓶頸轉移至下游、未測試假設積壓,以及較安全與較高風險問題的區別,皆來自 637 位經篩選的美國/英國科學家自陳。完整討論、抽樣限制與遙測分析見 AI Adoption in Scientific Work - Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence — Petr O. Jedlička(Institute of Philosophy, Czech Academy of Sciences),Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence,arXiv 2608.17970,2026-08-18,40 頁,約 12,000 字,
practitioner-opinion。一篇沒有原創測量且沒有自有一手結果的單一作者調查——本文引用的所有主張都是二手資料。本文用到 §4(四類分類法及助理/代理程式連續光譜的說法)、§5.2–5.3(ChemAgents、Recursion、Co-Scientist、Robin)、§6.2(Jumper 的 5–10% 估計及註腳 50 的免責說明;Lowe 對 Co-Scientist 新穎性的批評;AI Scientist 的弱點),以及 §8(未改變典範的判斷與「科學的異星空間」反轉)。刻意未引用:文中對 AlphaProof Nexus、OpenAI Erdős 成果、AlphaEvolve、FunSearch、Navier–Stokes 相鄰數學、HLE 和 ARC-AGI 分數的重述,以及 METR 時程——資料庫已收錄這些主張的一手來源,而調查沒有提供額外內容。利益衝突/解析:作者坦承在一篇探討科學中 AI 的論文裡使用 GPT-5.5 協助語言處理及文獻探索;研究由捷克教育部計畫資助。由 PDF 擷取(docling 2.126.0,MLX 版面與表格階段,40 頁,0 個表格、2 張圖片,信心等級excellent)——沒有表格風險,但 docling 文字流程中 §3 的段落順序遭打亂(相鄰段落的句子交錯);本文及 AI Adoption in Scientific Work 引用的每個數據點都已從pdftotext -layout重新閱讀並確認相符。圖表 1–2 依兩遍查核原則以圖片閱讀。完整科學計量學討論見 AI Adoption in Scientific Work;數學部分見 AI-Driven Formal Proof Search - Normative boundaries of AI in scientific work: Evidence from PhD researchers — Angelini 與 Lyrvall,Normative boundaries of AI in scientific work: Evidence from PhD researchers,arXiv 2608.25678,2026-08-26,15 頁,
empirical。本文僅引用實驗設計與任務排序的邊際效果(表 1)、四類解答與職涯階段係數為零的結果(§4–4.1),以及 §5.4 中指出各項目衡量的是接受度而非正當性的說明。樣本為自我選擇的國際研究者,取自 Nature 的 Graduate Survey 2025;完整討論與限制見 AI Adoption in Scientific Work - Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents — Ning、Zhong、Li 與 Zeng(CMU),arXiv 2609.09219,2026-09-07,
empirical。本文僅引用 Gate 2 的復現稽核設計,將之作為可執行的既有研究檢驗工具。完整討論見 Discovery Certification Protocol (DCP)
Cited by 33
- Open Questions Backlog×4
Autonomous Scientific Discovery (113d) — If hypothesis-generation is genuinely at ~80% preference,…
- Transformative Creativity×4
It is also, read against Anthropic's ~80% blinded hypothesis preference, the corpus's sharpest live…
- AI Adoption in Scientific Work×3
The last finding is the one that earns this page. It is the complements thesis measured inside the…
- AI-Driven Formal Proof Search×3
Jedlička's survey (arXiv 2608.17970, practitioner-opinion) is secondary and vaguer than this page's…
- Discovery Certification Protocol (DCP)×3
The E0/L\ boundary is the whole mechanism: an observation present at the start of the run belongs…
- The Navier–Stokes AI Claim×3
It corrects the corpus on formalization. Autonomous Scientific Discovery recorded, correctly at the…
- Anthropic×2
2026 June — launched Fable 5 and Mythos 5, the first general-access Mythos-class models (the tier…
- Automated Conjecturing×2
Autonomous Scientific Discovery — hypothesis generation without a wet lab; the same discovery
- Capability-Gated Model Fallback×2
Biology and chemistry. Previously Anthropic blocked only a narrow selection of bioweapons queries;…
- Claude Fable 5×2
The announcement leads with Fable 5 (general access); the science-heavy results run under Mythos 5…
- Claude Mythos 5×2
Run with safeguards lifted, Mythos 5 produced the announcement's most striking results — compiled…
- Many-Agent Proof Harnesses×2
Erdős unit-distance rediscovery: OpenAI's internal model produced the counterexample to Erdős's…
- Recursive Self-Improvement×2
And the same exchange supplies the counter, from Brown, immediately: "The main difference is that…
- Responsible Scaling Policy Evaluations×2
Autonomous Scientific Discovery — the CB-domain capability (AAV, autonomous bio) that sharpens the…
- RSI Autonomy Levels (B0–L5)×2
Autonomous Scientific Discovery — the S1 feedback regime, and the boundary the survey draws through…
- Task Time-Horizon Scaling×2
The June 2026 Mythos-class release pushes further still: Fable 5 / Mythos 5 "can work autonomously…
- The Abstraction Barrier
Autonomous Scientific Discovery — June 2026 wet-lab AI results are the empirical test case: do they…
- AI R&D Autonomy Evaluation (AECI)
Autonomous Scientific Discovery — adjacent autonomy in a non-AI science domain (a model…
- Compute-Controlled Benchmarking
Autonomous Scientific Discovery — the corpus's best-disclosed and least-controlled headline at…
- CS329A: Self-Improving AI Agents (Stanford)
The course's own bet on where value lands: repetitive, verifiable work — code migrations, version…
- Deep Research Agents
Autonomous Scientific Discovery — where this pattern sits in a survey typology of research-AI…
- Evaluation Horizon Versus Release Cadence
Autonomous Scientific Discovery — the concrete thing on the internal side of the gap: a Millennium…
- Expenditure Horizon
Autonomous Scientific Discovery — the far end of this page's dollar axis, and a reminder of what it…
- Google AI & Economy ATLAS
AI in Science: Early Insights (September 2026, with Google DeepMind and MIT FutureTech) — → Ai…
- Jagged Intelligence (Ghosts, Not Animals)
Autonomous Scientific Discovery — the Mythos 5 science results are curated demonstrations of a…
- Logical vs Intelligible Proof
Autonomous Scientific Discovery — where the Leiden Declaration now lives: a mathematicians'…
- Superintelligence Trajectory
Autonomous Scientific Discovery — Mythos-class models now conduct novel science with limited human…
- Noam Brown
Autonomous Scientific Discovery). Read as an instrument, that is a useful calibration on this page's
- Open-Ended Discovery Harnesses
Autonomous Scientific Discovery — the same systems named as a category rather than as harness…
- Organizational Complements to AI
Autonomous Scientific Discovery — the complements pattern at its starkest: AlphaFold's own creator…
- Research Taste as the Human Bottleneck
Autonomous Scientific Discovery — Mythos 5's autonomous hypothesis-generation (~80% preferred over…
- RSI Growth Curves: Which Friction Binds First?
3. The fundamental wildcard. The Abstraction Barrier in its strong form — if AI trained on human…
- Structured Safety Case (Claim Decomposition)
Autonomous Scientific Discovery — the CB-2 threshold's capability side; the substitution framing…
Related articles
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Recursive Self-Improvement
An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Responsible Scaling Policy Evaluations
Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…
- AI R&D Autonomy Evaluation (AECI)
How Anthropic measures whether a model can automate or dramatically accelerate AI research — the capability that drives…
