H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

AI 加速 AI 開發

《When AI builds itself》的實證核心:測得的證據顯示 AI 已在 Anthropic 加速 AI 研發——超過 80% 的合併程式碼由 Claude 撰寫, 每位工程師每日程式碼量約為 2024 年的 8 倍,核心最佳化評估在一年內從 3 倍提升至 52 倍, 自動化研究員找回了弱模型到強模型差距的 97%,而模型對下一步的判斷勝過人類 64%

Article metadata
Publication details
Published:June 7, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:GovernanceAI RdProductivityCapability EvaluationAnthropic
Reading:18 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

AI 加速 AI 開發的插圖

資料來源#

摘要#

這是 Anthropic Institute《When AI builds itself》的實證篇:此前未公開的內部資料顯示,AI 已在 Anthropic 加速 AI 的開發。 公開基準測試(Task Time-Horizon Scaling)呈現能力的提升;本文則彙整部署端的證據,說明能力提升已回饋到 Anthropic 自身的工程與研究產能。這是 Recursive Self-Improvement 外推所立足的當下實況,也是 AI R&D autonomy eval 所設門檻要衡量的具體加速案例。

工程與研究的分野(以及自主性階梯)#

打造前沿模型需要兩類工作,而 Claude 在兩者上的進展各不相同:

  • 工程(撰寫程式碼、建置基礎設施、監督訓練):Claude「可以接手一個規格不完整的問題,並設法找出解法;人類提供目標,但不再需要提供方法。」
  • 研究(選擇實驗、解讀結果、決定接下來嘗試什麼):Claude「已能在執行明確規格的實驗時,達到熟練人類的水準,甚至超越他們。」

兩者之中,持續存在的差距在於選擇目標的判斷力——請參見研究品味是人類的瓶頸。這篇文章把能力放在 Anthropic 用於自家員工的資歷階梯上:

  1. 執行指定任務——「匯出按鈕不能用,請修好它。」
  2. 為給定目標設定方法——「調查網路為何在高負載時變慢。」
  3. 選擇值得投入的問題——「團隊下一季該打造什麼?」

Claude 已從第 1 階升到第 2 階;第 3 階仍是前沿。

工程證據#

Claude 撰寫了 Anthropic 大部分的程式碼。 截至 2026 年 5 月,超過 80% 的合併程式碼由 Claude 撰寫;在 Claude Code 於 2025 年 2 月推出研究預覽版前,比例僅是個位數。 (領導層曾公開估計,若計入腳本與實驗程式碼,比例超過 90%;超過 80% 是較保守的「合併進正式環境的程式碼行數」歸因。)

每位工程師的產出約增至 8 倍。 2021 至 2024 年,每位工程師每日合併的程式碼行數大致持平,之後出現兩個轉折點:2025 年(Claude 開始能執行程式碼,而不只是提出建議)以及 2026 年(模型開始能在更長的時間跨度內自主工作)。2026 年第二季,典型工程師每日合併的程式碼量約為 2024 年的 8 倍。需坦白指出:程式碼行數衡量的是數量而非品質,因此 8 倍「幾乎可以確定高估了真正的生產力增幅」;但它仍顯示確實有所加速,而且 Anthropic 不會按程式碼行數給予獎勵。

  • 2026 年 3 月一項民調(130 位研究團隊員工)顯示,受訪者估計使用 Mythos Preview 後的產出中位數約為不用 AI 時的 4 倍(Anthropic 認為實際提升略低——開發者自我估計已知會高估)。
  • 原本「不會發生」的工作:2026 年 4 月,Claude 推出了 800 多項修正,將一類 API 錯誤減少 1000 倍——估計相當於四個人年、耗費大量心力跨脈絡找出並修復錯誤。

程式碼品質已達到同等水準。「好程式碼」代表能正常運作,且其他工程師能以此為基礎繼續開發。在「能正常運作」方面,員工在任務中途修正、引導或接手的比率已連續一年穩步下降,即使是開放式問題也是如此(最難級別的工作階段成功率在 2026 年 5 月達到 76%,六個月增加 50 個百分點)。在「易讀性」方面,Claude 撰寫的程式碼「在 2025 年底略遜於人類撰寫的程式碼……如今大致相當,我們預期一年內會明確勝過人類。」

自動化審查員。 現在每項變更在合併前都會由自動化 Claude 審查員檢視。回溯分析發現,它本可在正式環境上線前攔下過去 claude.ai 事故中約 三分之一的相關錯誤——「Claude 現在能抓到[世界上最優秀工程師]漏掉的錯誤。」這是將驗證和在全新脈絡中審查的模式落實於組織規模。

研究證據#

三項測量,從執行逐步邁向判斷:

  • 核心/實驗最佳化(第 1 至 2 階,如今超越人類)。 每次發布都會執行固定評估:給定一段用來訓練小型模型的程式碼,讓它盡可能加快速度,同時通過相同的正確性檢查。Opus 4 約提升 3 倍(2025 年 5 月)→ Mythos Preview 約提升 52 倍(2026 年 4 月)。 熟練的人類需要 4 到 8 小時才能達到約 4 倍。「不到一年,Claude 在明確界定的實驗內最佳化,已從非常有幫助進步到超越人類。」(*需注意:*絕對倍數取決於起始程式碼尚有多少改進空間,並不代表真實世界訓練速度的提升;有參考價值的是模型彼此及與人類相比時的同類比較。)
  • 端到端的開放式研究(第 2 階)。 2026 年 4 月的自動化弱轉強研究員:代理程式接到一個開放式 AI 安全問題(弱模型能否可靠地監督更強的模型?),接著提出假設、進行測試、讓平行運作的代理程式分享發現並反覆迭代。它們在約 800 個代理程式累積工作小時(約 18,000 美元運算成本)內,找回了底層到頂層差距的約 97%;兩位人類研究員花一週找回了約 23%。需注意:結果未能順利遷移到生產規模的模型,而且問題仍由人類選定,評分規準也由人類撰寫——設定方向是人類唯一有實質意義的角色。
  • 研究下一步判斷(第 2 至 3 階,前沿訊號)。 在 n=129 個人類曾經岔開原定路線的真實研究工作階段中,模型只看到岔路前的工作並提出下一步;另一個 Claude(看過工作階段如何結束)則判斷誰選得較好。Opus 4.5(2025 年 11 月)以 51% 勝過人類 → Mythos Preview(2026 年 4 月)達到 64%。 關於評審偏誤,有一項關鍵但需注意的地方:在另一組 127 個人類的選擇本來就很強的時刻中,模型只有約 20% 的時間被判定較好——因此這不是同條件下的人類與模型比較,而是在困難且模糊的決策上觀察到的趨勢。

外部觀點與一項無效結果(METR,2026 年 7 月)#

以上所有數據都是 Anthropic 測量 Anthropic。METR 的支出時間跨度說明(2026-07-21,empirical)開頭列出目前業界回答「AI 加速 AI 研發多少?」的各種方式,並指出每種方式都有不足之處——這是解讀本文證據時很有用的架構:

  • AI 研發基準測試(RE-bench、MLE-bench)——通常沒有人工基準,或只在固定的 8 或 40 小時下提供人工基準;題目「往往無法反映前沿 AI 研發。」
  • 研究員提升研究——實驗很難進行;現有數據都是自我回報(Mythos Preview 卡片約 4 倍,Becker/METR 約 2 倍),兩份報告都提醒應謹慎看待。Anthropic 合併程式碼行數約 8 倍的數據確實存在,但「程式碼產出很難對應到研發生產力」(程式碼產出帶來的研究員提升是 METR 嘗試彌補這個落差的研究)。
  • 質性回饋——例如 18 位 Mythos Preview 回覆者中,有 4 位認為只要經過三個月的鷹架迭代,它就能取代入門級研究員。有參考價值,但非量化資料。
  • 對前沿最佳化問題的貢獻——TTT-Discover、AlphaEvolve、LLM 輔助的 NanoGPT 紀錄:難以和人類投入的心力比較,而且「回報內容偏向成功案例。」
  • 能力進展的加速(時間跨度、Epoch 的 ECI)——本質上是落後指標,只有在能力出現在模型中之後才觀察得到,而且必須另外估算人類與運算資源的貢獻。

METR 的貢獻是直接測量第四類,結果卻降低了預期。六個代理程式從 NanoGPT 速度賽紀錄第 78 名開始自主最佳化,每個最高花費 10,000 美元,重新驗證後只提升約 1% 至 1.5%——「相當於 1 至 2 位人類的貢獻」,相較之下,人類在同一問題上累積投入約 1,650 小時(約 250,000 美元)。排除雜訊後,六個代理程式中有兩個毫無所獲。維護者大約會合併 70% 的點子,但只會採納 50% 到 60% 的加速效果,並稱其餘內容「大多是在調參。」

這並不與本文的內部證據相矛盾——兩者測量的對象不同。Anthropic 回報的是混合式產能(人類使用 Claude);METR 測量的則是自主最佳化,過程中沒有人工介入,並明確指出「代理程式仍有可能大幅提升人類進展。」兩個數字代表同一問題的兩端,兩者間的差距就是人類尚存貢獻的大小——以金額衡量,也就是研究品味是人類的瓶頸。

一個看似更高、實際衡量範圍卻小得多的作者身分數據#

Ouroboros/Hope(arXiv 2608.08311,case-study)回報一段為期 161 天的部署中,1,085 次自我修改提交有 94.2% 由代理程式撰寫。看起來似乎超過本文的 80% 數字,但兩者在三個方面都不可比較——值得寫清楚,因為這兩個數字很可能會被並列引用:

  • 單位不同。 Anthropic 衡量的是合併程式碼行數的占比;這裡衡量的是提交占比。提交占比不受大小影響,因此一行和一萬行計數相同。
  • 分母不同。 Anthropic 的分母是前沿實驗室整個正式環境程式碼庫;這裡的分母則是單一代理程式對自身儲存庫所做的編輯——總計 175,755 行已發布程式碼,全都是 harness。其範圍比「AI 相關工程工作」還窄,更不用說 AI 開發了。
  • 權限不同。 Anthropic 的 Claude 撰寫由人類指示要寫的程式碼;Hope 自行選擇要做的變更,而人類扮演審查關卡的角色,會擋下 63.5% 的近期自我編輯嘗試。較高的代理程式作者占比和會擋下多數變更的審查員,是同一系統的兩種描述。

而且這項研究由受研究系統自行回報,論文也將貢獻列給該系統。適當的解讀是:這屬於本文當下主張的一部分——AI 正在壓縮 AI 相關工程工作的時間——但範圍只有一個 harness 儲存庫,不能據此認定作者占比趨勢已經改變。本資料集另一個同類案例是 Cline 的行動;兩者都是 Anthropic 以外、關於鷹架而非模型開發的數據點。

坦承的限制#

這篇文章對證據範圍的界定異常謹慎:程式碼行數會高估生產力;自我回報的提升幅度有向上偏誤;核心最佳化的倍數取決於尚有多少改進空間;弱轉強的結果未能擴展到更大規模,而且使用人類選定的問題;下一步測試則刻意選用人類表現較弱的時刻。即便如此,核心主張仍然成立:人類在每個階段的角色都在縮小,而實際「執行」所需的人力時間如今幾乎為零(運算成本仍然存在)。

另一家實驗室的版本,以及足以動搖本文所有數字的混淆因素(2026 年 9 月)#

以上限制關乎測量工具偏誤——程式碼行數會高估、自我回報會灌水、核心最佳化倍數取決於改進空間。Brown(Dwarkesh Podcast,2026-09-17,practitioner-opinion)指出的則是定義上的混淆因素,無論測量工具做得多精良,都會影響本文的每一個數據:

「你是在拿它和三年前的加速幅度相比嗎?問題究竟是『以我們三年前做的工作為基準,現在能快多少?』,還是『以我們現在做的工作為基準,三年前會慢多少?』這其實是兩個非常不同的問題。」

兩者之所以不同,是因為工作本身已經改變。Brown 提出的機制是能力不均與替代:模型*「特別擅長檢視資料集並檢查每一個資料點」,所以「你可以在這些事情上大量使用 AI」——而且「當某件事突然快 100 倍、好 100 倍,你當然會做更多這類事情。」* 向前推算的反事實是在三年前,估算今天的任務組合會花多少時間;其中有些工作當時根本不存在。向後回推則是用今天的效率估算舊任務組合的耗時,而那些工作已經沒人做了。Anthropic 約 8 倍的數據和 Kwa 的反推估算都沒有說明各自算的是哪一種,兩者的落差也不是靠更謹慎的測量就能消除的誤差。

他還補充了本文限制中沒有涵蓋的第三個混淆因素:「如果是人類指揮 AI 做這些工作,那麼有多少該歸功於人類?又有多少該歸功於 AI?」——程式碼作者占比從定義上就掩蓋了這個歸因問題,而這也正是94.2% 由代理程式撰寫的數據從另一方向引發的疑問。

而他實際提出的數據是投入量,這才是有意思之處。 Brown 沒有引用生產力倍數,而是提到 OpenAI 的內部加速部落格文章:截至 8 月初,研究員中*「最前面的 1%」每天在 Codex 上花費 7,000 至 8,000 美元,而且「還在指數成長。」* 這是本資料集中第一個 Anthropic 以外的內部加速數據,但它刻意不主張產出有多少:支出曲線說明買了什麼,並未指出產生了什麼成果。對照本文的其他系列,這是誠實的補充——程式碼行數和自我回報衡量的產出,分母卻有爭議;這項數據衡量的則是沒有分母爭議的投入。這也呼應活動與能力之間的區別;先前正是這項區別使 Ouroboros 的四組月度序列無法說明問題,而這次提出區別的是一位不會把活動誤認成能力主張的作者。

列為低可信度。「最前面的 1%」沒有分母,沒有團隊規模,沒有絕對人數,也沒有文章連結(raw/ 中找不到該文);而且這個數字是在對話中回想的,來源是一家公司員工撰寫的部落格文章,那家公司正是發布文章並販售被購買產品的公司。

延伸閱讀#

  • Noam Brown——兩種反事實的區別、替代混淆因素,以及 OpenAI Codex 內部支出數據的來源;也是加速情境下另一家實驗室的中位數 3 倍估計,見智慧爆炸動態
  • 智慧爆炸動態——本文的加速數據在此轉化為曲線形狀的論證;Brown 經審慎限定的 3 倍估計和 Kwa 約 2.5 倍的估計並列,是本資料集中唯二對同一量級現象提出的量化估計
  • Recursive Self-Improvement——這些證據所奠定的外推:「迴圈已在加速收緊」
  • AI R&D Autonomy Evaluation (AECI)——正式的能力門檻(AECI、替代門檻);本文則是評估預期中的部署端對照資料
  • 研究品味是人類的瓶頸——這些測量一再碰上的持續差距:在於選擇目標,而非執行目標
  • Task Time-Horizon Scaling——與這份內部資料相對應的外部基準(METR、SWE-bench、CORE-Bench)
  • 驗證是新的瓶頸——自動化審查員,以及「審查成了新的瓶頸」,都是這個論點在組織規模上的體現
  • 模型進步帶來的 harness 精簡——人類角色同樣在收窄:不再撰寫程式碼,轉而負責指引與審查
  • The Bitter Lesson——「研究進展主要取決於工具與資源」是套用於研發本身的苦澀教訓
  • Agentic Loops Overtake Bespoke Systems——同樣是簡單迴圈超越客製化系統的動態,並以形式數學加以測量
  • LLM-Driven Vulnerability Research——Project Glasswing 是 AI 加速技術產出的實例
  • AI-Native Startup Lifecycle——這種加速擴散至整體經濟:100 人的公司做出 1,000 人規模的工作
  • Frontier Pause Verification——加速效應不斷累積,因此「我們沒有數十年時間」來建立驗證制度
  • 程式碼產出帶來的研究員提升——將約 8 倍數字轉化為經濟意義:生產函數把程式碼產出 8 倍換算為可能超過 2 倍的序列研究員提升(Kwa/METR),並將本文「程式碼行數會高估」的限制明確形式化為冗長程式碼/Cadillac 程式碼折扣
  • Expenditure Horizon——外部測得的純自主對照數據,結果為無效:在前沿訓練速度問題上,代理程式每次執行花費 10,000 美元,只換得相當於 1 至 2 位人類貢獻的加速,而人類在同一問題上累積投入約 250,000 美元
  • Agent-Authored Harness Optimization——Anthropic 以外的同類數據點:Cline 的基準測試爬坡工作,從 2026 年 1 月四位工程師耗時兩週,變為 2026 年 7 月一個提示詞無人值守執行 17 小時;任務本身就是 AI 工程
  • Continuous Self-Modification Under Review——不可與本文比較的作者占比數據:1,085 次自我修改提交中,有 94.2% 由代理程式撰寫;衡量的是提交占比而非程式碼行數占比、單一代理程式自己的 harness 儲存庫而非實驗室的正式環境程式碼庫,且審查關卡擋下了 63.5% 的近期嘗試

尚待解答的問題#

  • 程式碼行數、自我回報和取決於改進空間的倍數都會高估;Anthropic 承諾轉向「直接測量 AI 研發加速與研究員提升」(AI R&D Autonomy Evaluation (AECI))時,實際會採用哪種無偏差產能指標?部分已有答案:程式碼產出帶來的研究員提升——Kwa 認為,與按小時衡量的程式碼提升相比,程式碼產出(也就是 8 倍本身)更好,因為產出已透過時間重新分配反映邊際價值,也不受生產函數假設影響;但它仍受冗長、實用性很低的「Cadillac」程式碼,以及以樂趣為導向的時間分配轉變所污染。因此,真正指向的指標是經品質調整的程式碼產出,而這仍需要內部資料,單靠程式碼行數無法提供。
  • 弱轉強的結果未能遷移到生產規模模型。這是暫時的規模效應,還是自主研究的結構性限制?
  • 下一步判斷趨勢(51%→64%)只在人工選擇較弱的片段上測量。若採用具代表性的研究決策樣本,趨勢曲線會呈現什麼樣貌?

資料來源#

  • Noam Brown – Agent swarms, alignment, & recursive self-improvement——Noam Brown(OpenAI)與 Dwarkesh Patel 對談,Dwarkesh Podcast,2026-09-17(practitioner-opinion)。僅引用 §00:22:02:歸因混淆因素、能力不均加替代的混淆因素、兩種反事實的區別,以及 Codex 內部支出數據(8 月初 OpenAI 研究員中最前面的 1% 每日支出 7,000 至 8,000 美元,「還在指數成長」)。此數字的來源可信度最低——在對話中回想自一篇 raw/ 中沒有收錄的 OpenAI 部落格文章,沒有分母、團隊規模或絕對人數,而且提供者是販售該產品的公司的員工。三項混淆因素才是持久有效的部分,它們是關於方法的主張,而非測量結果
  • When AI builds itself——§「Evidence from within Anthropic」(工程與研究證據、生產力民調、核心評估、弱轉強研究員、下一步判斷)
  • Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution——Razzhigaev、Gritsaev、Kaznacheev、Dragunov、Yampolskiy 與 Kuznetsov(MSU / Skoltech / Joi Lab / AIRI,arXiv 2608.08311,2026-08-08,case-study——編譯時從 empirical 降級):僅引用表 4 的作者占比與審查統計。由受研究系統自行回報;作者利益衝突(COI)完整。關於解析警告及完整分析,請見該文
  • Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT——Cunningham、Shetty、Cheng 與 Rush(METR,2026-07-21,empirical):引言提出 AI 研發加速證據的五類分類法,以及各類證據無法支持哪些結論;另引用 NanoGPT 對「前沿最佳化問題的貢獻」類別所做的測量——每次花費 10,000 美元的自主代理程式執行,可產生相當於 1 至 2 位人類貢獻的加速。完整分析見 Expenditure Horizon
§ end
Cited by 24
Related articles
  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…

  • AI R&D Autonomy Evaluation (AECI)

    How Anthropic measures whether a model can automate or dramatically accelerate AI research — the capability that drives…

  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • Responsible Scaling Policy Evaluations

    Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…

  • Anthropic

    AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…