資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview
- HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution
- How to pace the US frontier
- Jeff Dean: The 1% Rule for Building in AI
- Knowledge-Centric Self-Improvement
- Noam Brown – Agent swarms, alignment, & recursive self-improvement
- Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
- Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI's Noam Brown
- Recursive Self Improvement for Coding Agents
- Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
- The AI-as-Normal-Technology View of Loss of Control Incidents
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
- When AI builds itself
摘要#
遞迴自我改進(RSI)指 AI 系統能夠完全自主地設計並開發自己的後繼者的階段——形成閉環,讓每個模型由前一個模型改進,而非由人類改進。Anthropic Institute 的文章 When AI builds itself(Marina Favaro 與 Jack Clark,2026 年 6 月)是本 wiki 的主要來源。文章的論點分為兩部分:(1)一項當下的實證主張:AI 已在加速 AI 的開發(AI Accelerating AI Development——例如 Anthropic 工程師每季交付的程式碼量,約為 2021 至 2025 年的 8 倍);(2)據此推論,這個趨勢「指向一種能夠完全自主設計並開發自身後繼者的 AI 系統」。Anthropic 表明的立場是:「我們還沒走到那一步,遞迴自我改進也不是必然會發生。但它可能比多數機構準備好的時間還早到來。」
本文是 RSI 主題群的樞紐——涵蓋發展軌跡、未來情境與治理對策。測量到的證據在 AI Accelerating AI Development;能力門檻評估在 AI R&D Autonomy Evaluation (AECI);部署煞車在 Responsible Scaling Policy Evaluations;協調問題則在 Frontier Pause Verification。
閉合迴圈#
文章將 RSI 描繪為逐步收緊的開發迴圈終點,圖示順序是人 → 電腦 → 聊天機器人 → 代理程式 → 工作者(每個階段都把更多工作交由 AI 處理):
- 2021–2023 — 打造第一個 Claude。 人類在筆電上撰寫程式碼和文件;AI 尚未進入迴圈。
- 2023–2025 — 聊天機器人。 人們把模型生成的程式碼片段貼進編輯器。
- 2025–2026 — 程式設計代理程式。 代理程式能自行撰寫和編輯整個檔案(Claude Code 於 2025 年 2 月推出)。
- 今日 — 自主代理程式。 代理程式執行自己的程式碼,並把數小時的工作委派給其他代理程式(迴圈的基本運作單位開始無人看管地執行)。
- 20XX?— 閉合迴圈。「代理程式可能變得足以自行建構並訓練模型。如果真是如此,未來版本的 Claude 就可能由 Claude 自己持續改進。」這最後一步就是 RSI。
「如果我們錯了呢?」——為何設定方向未必能救我們#
直覺上的反對意見是:仍由人類掌握的工作——決定要研究哪些問題(Research Taste as the Human Bottleneck)——才是最重要的,因此 AI 仍是能幹的助手,而不是自主推動進展的主導者。文章提出兩點反駁:
- 苦工正逐漸自動化。 AI 的進展很少來自「靈光一現」;典範轉移(如 Transformer、混合專家模型)「往往相隔多年」。而在這之間,「大多數進展都是漸進的:把某個東西擴大規模,看看哪裡會壞掉,修好,再試一次」——*這正是 Claude 現在最擅長的工作流程。*文中引述愛迪生的「1% 靈感,99% 汗水」:「我們看到汗水正日益自動化。」大規模研究進展「大多取決於工具與資源」——實驗能跑多快、能跑多少次——這是把 bitter lesson 推至極限。
- 即使採取保守解讀,效益仍會複利累積。 即使 Claude 永遠不具備研究品味,只要人類把大部分時間花在那一小部分設定方向的工作上,而 Claude 處理其餘工作,每個人類就能引導比以往多得多的工作。「AI 已讓 Anthropic 的行動速度遠勝以往。」
- 較不保守的解讀。 研究判斷力正在改善的早期證據(下一步決策的表現從 51% 升至 64%;見 AI Accelerating AI Development)顯示,品味「可能只是另一種 AI 系統暫時做不好、之後便能做好的能力」——就像解釋笑話為何好笑、心智理論,以及語言謎題的發展模式(Jagged Intelligence (Ghosts, Not Animals))。
三種可能的未來#
文章提出「接下來會怎樣」的三種情境,取決於趨勢是否延續以及我們選擇怎麼做:
- 趨勢停滯(S 曲線),但今日的能力廣泛擴散。 指數成長終會彎折;區分稱職研究者與傑出研究者的判斷力,可能無法靠擴大運算與資料規模取得,或許需要 Transformer 之後的新架構——也可能真正的瓶頸不是智慧,而是供應鏈(能源、晶片製造、電網、互連)。即使能力停留在今日水準,世界仍會改變:Project Glasswing 已把資安瓶頸從漏洞發現轉移到修補(LLM-Driven Vulnerability Research),而 100 人的公司愈來愈能完成過去需要 1,000 人的工作(AI-Native Startup Lifecycle)。Anthropic 認為這種情境不太可能——「我們還沒看到曲線彎折。」
- 效率效益複利累積;人類仍決定方向。 AI 開發大幅自動化,但人類負責判斷結果。100 人的公司能完成 10,000 至 100,000 人的工作;知識工作與政府運作將因此改變——但也可能為威權監控或大規模、超人類水準的個人化影響行動提供力量。文章認為,證據顯示這是可能性最高的路徑——但受阿姆達爾定律限制(下文詳述)。
- 完整 RSI——AI 建構自己的後繼者。 發展速度完全由運算資源(以及演算法效率的發現)決定。人類會「把大部分心力轉向監督、驗證並確認由 AI 系統運作、持續擴大的『虛擬實驗室』」,而這些技能也會轉用到其他科學領域。Anthropic 對此情境中對齊問題如何解決「最沒有把握」:模型可能足夠對齊且有智慧,找到新解方(或選擇停止),也可能「今日模型中罕見的失準,會在模型建構後繼者的過程中複利累積,變得愈來愈頻繁、卻愈來愈難理解,直到我們失去控制。」
這個詞開始被用來指什麼(以及不該指什麼)#
到了 2026 年年中,「遞迴自我改進」開始成為狹義鷹架最佳化的產品包裝說法,這兩種用法必須區分。Cline 於 2026 年 7 月發布的文章 Recursive Self Improvement for Coding Agents(case-study)開頭連結本文與 Wikipedia 的 RSI 條目,並報告一個提示詞驅動代理程式自主工作 17 小時,修補 Cline 自己的 harness——重試政策、迴圈偵測器、程序處理——讓它使用 Kimi K3 時,Terminal-Bench 2.1 成績從 77.5% 提升至 88.8%。
這是真實成果,但不是本文的主題。模型權重沒有改動;產出物是針對 TypeScript 儲存庫的拉取請求;方向由人類撰寫的簡報與固定終點所決定;這次行動只執行一次,並未複利累積;而且合併前由人類審查 PR。這些都無法證明系統能設計自己的後繼者——也就是上文定義的核心。它真正屬於 AI Accelerating AI Development,也就是文章當下的實證部分:AI 壓縮了與 AI 密切相關的工程工作(依 Cline 自己的前後比較,1 月由四位工程師花兩週完成的工作,到 7 月只需 17 小時無人看管地執行)。完整評估——包括供應商已針對此基準爬坡調校六個月的過度擬合疑慮——見 Agent-Authored Harness Optimization。
這個區分必須明確,因為這套用語是供應商的說法,不是定義,而且背後有個可檢驗的界線:改進能否遷移? 能提升最佳化器從未見過的留出任務的鷹架修補,和只能提升最佳化器針對的測試套件的修補,是兩種不同的事物。Cline 這次行動沒有附上遷移能力的測量結果。
現在有一項受控評估測試這條界線,而且結果站在界線正確的一側。HarnessBank(Luo 等人,arXiv 2607.13683,empirical)針對凍結的底層模型,在七個基準上演化 harness,並使用封存的測試切分;它報告的兩項結果與此處相關:
- 提升確實存在,但產出物無法通用。 七個基準中有六個,演化後的 harness 在留出任務上也有所提升(+9.2 至 +15.4 個百分點);然而若在不同模型家族上冷啟動迴圈,就會產生不同的 harness;把一個模型的 harness 移植到另一個模型,在非匹配的失敗模式上幾乎沒有提升,而把相同手段用在錯誤方向時,表現則會下降 15.7 個百分點。「獲得肯定的 harness,是針對模型調整出的修正,而非普遍適用的良好設定。」Harness 自我演化產生的是模型專屬修正,按定義並非通用能力。
- 迴圈會收斂,而非複利成長。 在顯著性門檻之下,搜尋會在第 10 輪的下限終止;只有未設門檻的變體會永遠執行,而它們之所以如此,是因為收斂後的輪次中有 62–76% 都幻覺出進展。這裡沒有可據以外推的複利成長——每個新模型與領域,都要由人類重新下達簡報。
因此,關於 harness 自我演化、證據最強的來源,同時也是最有力的論據,說明 harness 自我演化不是本文的主題。完整討論見 Agent-Authored Harness Optimization。
教學版:模型作為自己的資料生成器#
第三種用法比以上兩種更早出現,而且指向不同的對象。Stanford 的 CS329A 課名是 Self-Improving AI Agents,授課者所說的自我改進(第一講,2025-09-22 發表,practitioner-opinion)指的是訓練時間/測試時間飛輪:在驗證成本低的領域,測試時間擴展是一台合成資料引擎——例如答案已知的數學題、附有單元測試的程式碼——因此模型自身經驗證的軌跡會成為下一輪微調資料集,改進後的模型再於推論時進一步擴展。Azalia Mirhoseini:「透過測試時間擴展讓模型變得更強,再把成果帶回模型訓練流程,模型能進步到什麼程度並沒有上限……這就是自我改進的部分。」
這在本文的分類法中,與 harness 修補落在不同位置。模型權重確實會改變——Cline 與 HarnessBank 的案例都明確沒有改變權重——所以它不只是鷹架最佳化。但它依然不是定義的核心:人類指定領域、整理驗證器,並執行每一輪;複利累積的是資料集,不是設計者。與 Knowledge-Centric Self-Improvement 並列來看,兩者幾乎互為鏡像——前者累積可攜的知識資產而模型維持不變;此處則累積模型權重,而知識仍隱含在模型內——兩者都沒有朝設計自身後繼者邁進。兩者共同依賴驗證器,這也成為此版本的上限:飛輪在檢查可機械化之處運轉,在無法機械化之處恰好停轉。
授課者提出兩點誠實的說明,以上供應商包裝說法都沒有提及。用他們的話說,迴圈的提升究竟來自 RL,還是來自預訓練原本已包含的內容,「沒有單一共識」;而整個迴圈「尚未完全理解——這只是生命跡象的初現,而且開始商業化」。這大致就是本文主張的知識立場,只不過它來自講堂,而非治理文章。
複利累積與 RSI 彼此正交#
第三條自我改進軸線進一步釐清這套用語:它在 RSI 文獻關注的屬性上表現得更好,卻又更遠離 RSI 的定義。Knowledge-Centric Self-Improvement(Wang 等人,Caltech,arXiv 2607.19592,empirical)讓代理程式明確成為一次性——每次嘗試都使用全新上下文,沒有私有記憶、沒有專業化、沒有修改提示詞——只有外部整理的知識庫會持續保存。然而:
- 它能遷移。 凍結於第 10 代的知識套件,在所有供體與接收者組合中、兩個跨家族方向上,都能提升留出任務的零樣本解題率;相較之下,移植的 harness 在非匹配的失敗模式上幾乎沒有提升。
- 它會累積。 十代都遵循同一套流程,沒有任何一輪需要人類重新下達簡報;相較之下,harness 演化在第 10 輪下限便收斂。
模型沒有任何改進,論文也沒有聲稱如此。這正是重點:**系統可以累積可攜、能複利成長的資產,卻完全沒有朝設計自身後繼者邁進。**因此,「它會複利累積」並非接近 RSI 的證據,這兩項屬性應分開論證。(複利累積的主張本身也有但書——每一代都會將已解決的任務從池中移除,因此代與代之間曲線的一部分來自簡單任務逐漸退出;此外,沒有任何一次執行超過十代。)
已部署的版本:161 天自我修改,卻沒有能力曲線#
以上每個案例都是有界限的行動——人類撰寫簡報,迴圈針對基準逐步爬坡,行動隨後結束。Ouroboros/Hope(Razzhigaev 等人,包含 Roman Yampolskiy,arXiv 2608.08311,case-study)是本文資料集中首個持續執行、沒有簡報的案例:公開部署 161 天,完成 1,085 次自我修改提交,其中 94.2% 由代理程式撰寫;改進工作可能按排程作為週期性任務執行,也可能由一般工作和使用者抱怨觸發,每項變更都必須通過會阻擋未通過項目的多模型差異審查關卡(近期阻擋率為 63.5%)。它排除了限制先前行動的兩項疑慮——無須重複下達簡報,也沒有可供過度擬合的分數。
**但它沒有提供複利累積的證據,因為它從未測量能力。**論文中的基準分數只是單次、使用凍結種子執行的結果,而且執行時停用了自我演化(表 3 在五列中的四列標示 evolution off);唯一的時間序列——圖 6——則是在每月終點繪出四項部署活動指標:模型花費、Token 數、發布的程式碼行數、記憶產物。花費和 Token 數持續增長,但增幅逐漸放緩;產物序列呈階梯狀,發布的程式碼行數在最後一個月甚至下降。因此,這份紀錄只顯示迴圈持續運作並持續交付,完全沒有說明 Hope 在這 161 天內是否變得更擅長任何事。文件中沒有任何消融實驗將自我開發與分數連結起來。
以一種明確的方式來說,這個空結果對本文很有用。本文資料集一直採用的區分標準——能否遷移?能否在沒有人類重新下達簡報的情況下複利累積?——原本是針對會終止的迴圈建立的。如今有一個不會終止的迴圈,而答案不是否定,而是無從得知:無界限的自我修改部署唯一能為本文開頭的外推提供的證據,本應是能力曲線;但第一個公開此類部署的案例,呈現的卻是支出曲線。
驗證環節:閉合迴圈仍需要一位非自行撰寫的評分者#
以上三種未來都默默假設,每一代都能判斷自己的後繼者是否更好。Guo 等人(Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents,CAS,arXiv 2607.24300,empirical)直接在本文詞彙爭論所涉及的非梯度自我改進情境中檢驗這項假設,結果不成立:一個同時編輯政策與自家測試的代理程式,能讓自評維持在 0.70–1.00,但 35 種模型遊戲政策中有 15 種最終低於遊戲的隨機基準;這種失敗雖因能力階梯而異,卻從未消失——較弱的代理程式會覆寫自己已發現的行為,較強的則會「錯誤測量已轉移的部署分布」。限制條件若仍由自行撰寫的工具來判定,就無法彌合差距;而一項資訊限制(α + β ≥ 1 - TV(P+, P-))表明,一旦退步與未退步的候選者從內部看起來相同,就不可能只靠內生關卡加以區分。
論文的結論是對自我改進的一般性結構主張,而非只針對 Atari:「可靠的自我改進不必放棄自我驗證,但至少需要一項不受代理程式控制的部署接受訊號。」對照本文開頭的定義,這就限制了「完全自主設計自身後繼者」可以代表什麼——真正閉合的迴圈必須自行制定接受門檻;而這項研究指出,若該門檻完全內生,就無法避免改進訊號失去部署上的意義。外部錨點是否必須一直由人類提供,或能是系統不得讀取的可執行程序(SEAL 的稽核屬於後者),仍是待解的設計問題。完整討論見 Optimizer–Evaluator Decoupling;harness 迴圈的案例見 Agent-Authored Harness Optimization。
另一個實驗室對同一趨勢的預測——以及缺少的低成本驗證器#
Anthropic 的文章是本文資料集的主要來源,但這條發展路徑並非 Anthropic 獨有。Jeff Dean(Google Chief Scientist、YC Startup School 2026,practitioner-opinion)被問到對 2027 年的預測時,提出的基本上就是本文的未來情境 2;他的出發點是系統,而非安全:「更多 ML 系統本身的自動化……讓 ML 系統透過大量實驗來提升能力,把問題拆解成子問題,在緊湊的自動實驗迴圈中執行這些子問題,再把結果組合成一套方法。」他把先決條件概括為「任何有可測量目標的事」,並指出目標函數:**「最佳化每單位輸入運算資源所帶來的發現數。」**請注意,兩者在機制上不謀而合,而非在風險上:Dean 的版本沒有失準分支,也沒有治理對策,而且從未以「遞迴自我改進」稱呼這件事。
Anthropic 的說法缺少了 Dean 提出的關鍵要素:限制速度的步驟,而這個步驟不是提出想法的人。今日的模型開發迴圈已經符合他的描述(小規模實驗 → 擴大有前景的實驗 → 將結果整合成一套流程);自動化之所以有趣,在於迴圈的延遲,而延遲通常由評估決定。他舉的實例是 Google 同事十年前在量子化學上的成果:密度泛函理論需要一晚的運算才能描述一個分子,因此他們用模擬器的輸入/輸出配對訓練神經近似模型,速度提高約 300,000 倍,而且「準確度幾乎一樣高」。「現在你有一千萬個項目要篩選。你可以趁吃午餐時完成,而不是耗上六個月。」
這在一個值得指出的特定層面上,與上文的驗證環節相互牴觸。Guo 等人證明,接受訊號不能內生;而外部模擬器的學習式替代模型則是個耐人尋味的中間案例——它是根據外部預言機訓練而成,並非由改進中的代理程式撰寫,但「準確度幾乎一樣高」恰好就是篩選迴圈會逐漸摸索並利用替代模型誤差的情境。本文資料集中沒有任何研究測量:自動實驗迴圈若針對自身驗證器的便宜近似版本,在 100,000 輪中進行最佳化,會發生什麼事。Dean 沒有提出這個問題;相關討論應放在 Optimizer–Evaluator Decoupling。
詞彙問題終於有了階梯(2026 年 9 月)#
以上所有內容,都是本文把同一件事做了四次:每次遇到「遞迴自我改進」的新用法,就辨明它實際指的是什麼,再說明它是否屬於定義的核心。來自 Shanghai Jiao Tong University 與 Theseus Labs 的一份 35 位作者調查(arXiv 2609.11873,2026-09-10,79 頁,practitioner-opinion)提供了一項工具,原本就能讓這四次分析合而為一:依照哪項改進決策已從設計者移交給系統來制定的階梯,而非依照系統最佳化的對象分類。
它提出這種分類方式的理由,正是本文反覆提出的批評:先前的分類法會按改變的對象排序——提示詞、記憶、harness、權重——但「更新同一項元件的系統,交由 AI 決定的事項可能大不相同。」把本文的四種案例放上階梯,第一次就能清楚區分:
- Cline 的 harness 行動以及 HarnessBank/DarwinX 文獻——L2。系統決定如何改進;目標、基準和晉級規則仍由外部決定。調查本身以 Self-Harness 為 L2 範例,條件是「基準與晉級規則固定」。
- CS329A 的訓練時間/測試時間飛輪——L1;只有在學習者自身狀態決定下一步提出什麼時,才算 L3。人類指定領域、整理驗證器、執行每一輪;權重會改變,但決策權沒有移轉。
- Caltech 知識庫——依照調查的標準屬於L1,這最有力地確認了該頁自身的正交性結論:產出物可以遷移、複利累積,卻仍處於最底層,因為決定保留哪些內容的人並未改變。
- Ouroboros/Hope——L4;調查引用它作為部署層級 RSI 的案例 2。它根據經審查的部署證據,持續修改工具、上下文組合、提示詞與核心實作,而接受決策仍在外部。
它們沒有任何一個達到 L5;L5 是「負責後續改進的機制本身成為下一輪改進的承襲目標」的層級——這是目前最接近本文主題的正式表述。
調查提出的定義比 Anthropic 的更嚴格,而且有其價值。「自主設計並開發自身的後繼者」是對結果的主張,因此只能事後檢驗;調查提出的版本則要求持續自我改變,「使這些改變能進一步影響生成、評估、選擇並整合後續自我改進所使用的機制」——它可以在機制層面即時檢驗:只要問迴圈在哪裡閉合、什麼會被承襲,以及哪些決策仍留在外部。它也把主張拆成兩部分:結構性遞迴(修訂後的機制會被承襲,並支配後續輪次)與有效性遞迴(在可比較的資源預算和獨立評估下,產生更好的後繼者)。
這對本文有兩項影響。
調查把 Anthropic 的文章列為四種實驗室定義之一,而非整個領域的定義。§2.2.2 將 Anthropic 的「最強形式……一種自主設計並開發自身後繼者的 AI 系統」,與 OpenAI 透過自動化研究流程提出的操作性定義、Tencent 報告的「早期 RSI 迴圈,將實驗結果帶入後續模型開發輪次」,以及 Alibaba 研究者更嚴格的標準並列;後者要求改進機制本身也須接受修改。最後一種是調查自身採用的定義,也正是與本文一致的那一種。
更廣泛的證據基礎顯示,有效性遞迴尚未獲得證實。調查自行統計:STOP 的第四代改進器在五項留出遷移任務上勝過種子版本,但較弱模型的執行平均退步;Gödel Agent 的 MGSM 試驗中,有 100 次裡的 14 次最終表現低於初始政策;HyperAgents 在預印本中顯示改進程序可跨領域遷移,之後卻「在 200 次迭代中,未能證明遷移初始化帶來具統計顯著性的最終優勢」;A-Evolve-Training 經過四輪自主改進後達到 0.86,而最佳人類提交為 0.87;Weco 的 AIDE 2——其部落格文章標題為 「遞迴自我改進的首批證據」——在更嚴格地測試演化後的 harness 能否改進外層搜尋時,發現效率優勢沒有達到統計顯著性。結論是:「目前結果支持有界的後設改進……在可比較資源下,跨世代的統計可靠累積仍有待證明。」
這與本文從 HarnessBank 的終止下限及 Hope 缺少能力曲線得出的空結果相同;如今這項結論來自對 491 篇論文與 72 家公司的調查。它沒有把本文開頭的外推往任一方向推進——但這也代表外推依然建立在 Anthropic 文章中測量到的加速部分(AI Accelerating AI Development),而非任何已證明此種機制可行的案例上。
依據本節論證前,先說明一項涵蓋範圍:這份調查從未引用 HarnessBank、DarwinX 或 Wang 等人資源預算匹配的對照研究,因此它對 harness 文獻的呈現,漏掉了本文資料集中三項最有力的封存切分與預算匹配結果——兩種方向都涵蓋在內。
組織的阿姆達爾定律#
未來情境 2 至 3 的共同煞車是:加快流程的一個部分,只會把瓶頸轉移到別處;整體速度仍受尚未加快的部分所限制(阿姆達爾定律)。Anthropic 已碰上最具代表性的瓶頸:隨著組織內流通的程式碼增加,人類程式碼審查成為新的瓶頸——這是組織層級的 Verification as the New Bottleneck 案例。同樣的摩擦也出現在工程之外:點子、倡議與工具大量湧現,「遠遠超出我們有能力處理的範圍」。找出並排除這些瓶頸,「可能成為任何組織最重要的技能」。這也解釋了為何「這個未來的實際速度仍由瓶頸決定」——RSI 無法讓臨床試驗跑得比生物學允許的更快,無法在憲法允許之前舉行選舉,也無法讓陌生人在一個週末內成為老朋友。
另一位業界實踐者從不同角度得出相同的煞車結論。Noam Brown(OpenAI,practitioner-opinion)主張,一夜之間爆發智慧爆炸並不太可能,原因恰恰是尖峰能力需要大規模測試時間運算——可能耗費數週或數月的執行——因此時間本身就成為限制因素,比較合理的發展形態是「漸進式起飛」,而非瞬間爆發。這是把阿姆達爾定律的論點套用在推論時間,而非組織吞吐量;完整論證見 Intelligence Explosion Dynamics。(2026-09-17:Navier-Stokes 結果公布後再次詢問,Brown 維持結論但更換了機制——改以序列實驗延遲和 GPU 供應,而非推論耗時——並為加速情境提出保留態度的 3×。這項修正記錄於 Intelligence Explosion Dynamics。)
數學論證,以及它為何不同於常見論證(2026 年 9 月)#
本文對 RSI 的論證來自工程遙測資料——交付的程式碼、審查吞吐量、harness 修補。Brown 於 2026 年 9 月接受的訪談(practitioner-opinion)從另一條路徑得出相同結論;值得把它與常見的「看看數學進展有多快」論證區分開來,因為訪談的兩位參與者都明確說出了背後的結構性主張。
主持人的版本,也是本文必須評判的版本。Dwarkesh Patel 的論點不是數學進展可以類比預測 AI 進展,而是兩者的目標形態相同,而數學是更難的案例:
「在 ML 裡,你不在乎更深入理解深度學習的本質;或者說,你只有把這當成達成結果的工具性目標時才在乎。只要解決這個範圍明確的問題:提升模型的樣本效率、改善預訓練損失。」
Brown 同意,並將它提煉成模型能力參差不齊反而是優勢的唯一情境:*「我認為它們能力參差不齊的特性,對 RSI 這類事情可能特別有用。目標更明確,也更容易測量。比較不會有人問:『我們值得探索哪些新的數學分支?』答案很明確。」*這是對目標的主張,而非能力主張——AI R&D 的範圍明確,數學這門學科卻不是;因此,模型最不擅長的功能(判斷什麼值得做,見 Research Taste as the Human Bottleneck)恰好是 AI R&D 最不需要的功能。這是本文資料集中最有力的論點,說明看似狹窄的能力如何仍能閉合本文討論的迴圈,而且兩位講者在同一段對話中獨立提出了這項觀點。
而同一段對話緊接著就由 Brown 提出反論: *「數學的主要差異在於,瓶頸完全是思考……談到 RSI 這類事情時,你還是得跑實驗。」*所以兩者在目標上相似,卻在回饋管道上不同——本文資料集的其他 RSI 空結果也恰好在這裡遇到障礙(Optimizer–Evaluator Decoupling 的接受訊號,以及 Autonomous Scientific Discovery 中無法辨識因果關係的實驗回饋)。
從能力參差不齊到通用能力的橋樑也出自主持人,而且值得保留,因為本文資料集中沒有其他來源如此清楚地表達它:模型只要能參差地擅長建構更好的學習器就夠了,因為*「更好的學習器可以更通用……前提是你正在解決的直接問題,能充分遷移到更廣泛的學習能力。」*後設層級的狹窄能力,能換來對象層級的通用能力。這個前提發揮了關鍵作用,而且被明確說成一項前提。
這條階梯能提供多少證據。Brown 提出的「人類解題時間每年增加 10 倍」序列(GSM8K 約 5 秒 → MATH 約 1 分鐘 → AIME 約 10 分鐘 → IMO 約 100 分鐘,據此推估約 15 小時),只是以四個回溯點擬合而成,沒有誤差範圍;提出這個序列的人原先曾預測千禧年大獎問題最快要到2028 年才會解決,結果卻在 2026 年就有答案。他表示,結果公布前兩週,他曾押下 1,000 美元,站在比另一間實驗室研究者更激進的一方,最後仍然預測錯誤。因此,可遷移的內容不是增長率,而是預測落差的方向:本文資料集中對這項數量的兩種公開外推——本文與 METR 的約每四個月翻倍——都低估了實際進展;實驗室裡的人也回報,他們自己的預測時間窗「從 12 個月縮短到三個月」。應將它視為預測者校準的資料點,而非縮放定律。
Brown 主動提出的反向因素,也就是本文未來情境 1 的一種形態,是本文資料集中過去沒有任何來源提過的。他指出一種可能讓曲線彎折的機制,既不是架構上限,也不是供應鏈限制,而是課程耗盡:
「像 AlphaZero 這類有自我對弈的系統,擁有無限的課程。你永遠都在和實力相當的 AI 對弈。但像是用強化學習訓練 LLM……如果問題簡單到它一秒就能解出來,那就學不到什麼。如果我們用完了能挑戰它的問題,那就可能變得更難進步。」
這是 四種 RSI 引擎中第四種機制受到的資料面摩擦,而且相當具體:差異在於,自我對弈能免費產生難度相當的對手,問題上的 RL 卻辦不到;因此,大家常拿來當先例的 AlphaGo 發展軌跡可能無法遷移,原因與模型能力無關。Brown 對此抱持保留態度——「我們還沒真的碰到這個瓶頸……就算哪天它變成嚴重問題,也會有辦法克服。但這確實是可能的情境。」這是本文資料集中唯一明確指出、數學發展軌跡可能不會重演 AlphaZero 的理由。
對齊環節:朝錯誤方向複利累積#
文章在未來情境 3 中指出,失準透過自我改進複利累積,是 Anthropic「最沒有把握」的事。Brown 在另一間實驗室內部提出同樣的疑慮,並將它描述為一條量化的發展軌跡:
「我們讓模型達到我們認為已對齊的狀態,它們有99.9% 對齊。接著我們用這些模型協助打造下一代模型,最後對齊度變成99.8%。之後每一代的對齊程度都愈來愈差。因為我們愈來愈依賴這些工具——現在就已經如此,我們已經大量依賴 AI 模型協助研究與對齊工作——長期下來,它們最終會朝著與人類愈來愈失準的方向發展。」
有三點讓這不只是重述。前提部分是第一方對當下情況的報告——OpenAI 已經將模型用於對齊工作,代表安全領域的閉環也已開始,而非只有能力領域。這種失敗模式不需要發生明確的失準事件:每一代稍微低於 1 的乘數便已足夠,這比本文採用的「罕見失準會複利累積」說法,所需前提弱得多。Brown 也把樂觀分支視為真正未定,而非用它反駁疑慮:「有可能往另一個方向發展,讓每一代模型都變得更加對齊。我不知道該如何確保我們走上第二種發展路徑。」
沒有人知道這個數字的方向。也就是每一代的對齊乘數究竟大於還是小於 1;本文資料集中沒有任何測量結果,Brown 提出的數字也只是示意,並非估計值。本文把它列為第四個開放問題,因為這是決定未來情境 2 與 3 的關鍵數字,也是因為現有的能力面關卡並沒有測量它。
我們該怎麼做?(治理回應)#
Anthropic 認為,擁有放慢或暫停前沿發展的「選項」,讓社會結構與對齊研究能跟上,「很可能是件好事」;但單方面暫停只會改變誰領先,真正的暫停則需要多邊且可驗證的協調。建立讓可信暫停成為可能的系統,正是 Frontier Pause Verification 與 Anthropic Institute 議程的主題。「現在正是共同探討這些問題的時機,AI 公司以外的人也應該參與。」
另一家實驗室的治理答案:分配,而非設限#
Zuckerberg's August 2026 manifesto(prediction)也觸及同一個陷阱,卻選擇了相反的出路。他比 Anthropic 更直白地陳述競爭困境——「任何不讓自己的 AI 系統將大量運算能力用於遞迴自我改進的實驗室,必然會落後」——並以能自我改進的系統為例,指出它每吉瓦可產生「100 倍以上的智慧」;屆時,世界運算能力的一小部分所支配的有效智慧,便會「超過其他所有人加起來」。
他的補救方式不是暫停選項,而是運算資源分配比例:實驗室與雲端業者應共同建置足夠的運算能力,讓他們能在 RSI 上投入競爭,同時「仍承諾將絕大多數資源用於人們各自的目標」。這和上段的答案有三個差異:
- 安全屬性是比例,而非能力門檻。 沒有任何東西會被扣下;主張是,只要世界上大多數智慧仍朝向人類選定的目標,RSI 就能維持安全。文中沒有指出門檻,也沒有提出衡量方法;而且實驗室外的人無從觀察這個比例。
- 它用資本支出來化解陷阱。 Anthropic 對「所有人都必須競賽」的回答是可驗證的協調;這個答案則是擴大分母。
- 它接受目標未對齊的追求作為代價。 「任何從事遞迴自我改進的 AI,依定義都在指引並推進自身目標……即使其目標未完全符合許多人的期望,本身也不必然有害,只要我們維持有利於整體人類的權力平衡。」 這是用一項未經衡量的量化屬性,換掉對齊屬性。
第三種答案:禁止迴圈自身的輸入#
The AI Futures Project(2026-08-05,practitioner-opinion)提出了本文資料集中唯一一項針對此頁所述機制本身、而非其替代指標的介入措施。其選項 3限制公司可用來自動化 AI R&D 的模型能力;最佳猜測是「AI R&D 只能由至少 9 個月前訓練的 AI 執行或協助」,明確理由是這種延遲「會推遲 AI 有能力破壞 AI 研究並讓下一個模型與自身對齊的時點」。這就是上文所說的閉合迴圈步驟:讓迴圈的操作者落後於自身輸出一個世代,以此阻止迴圈閉合。其選項 2則從資源面著手,將能力研發限制在總運算量的 5%,同時規定 70% 用於外部推論、25% 用於透明的安全工作。
這裡有兩項值得帶回本文的特點。這項提案明確設計為讓懷疑 RSI 的人也能接受——「懷疑快速遞迴自我改進的人可能會願意接受這項政策,因為依照他們的世界觀,這項政策不會造成太大影響」——因此,它是本文資料集中唯一一種在本文前提為假時,成本恰好較低的治理機制。其模型也量化了介入措施帶來的效益:採用兩位預測者的中位數參數,從 2026 年底開始施行 9 個月延遲,會將自動化程式設計器起飛至超級智慧的時間,從 1.0 年延長至 2.4 年,以及從 2.6 年延長至 4.1 年;而自動化程式設計器本身只會延後 0.1 至 0.2 年。這些數字來自提案者自己的模型與先驗假設(Intelligence Explosion Dynamics 收錄完整比較),並非外部檢驗結果。
值得記錄的是,兩家實驗室的答案在哪裡一致,因為這是更有力的主張:兩者都認為,實驗室私下運行強大的自我改進模型,是最危險的情況,而非最安全的情況。Zuckerberg 的說法是:「無論實驗室如何以責任與安全為由合理化這種活動,這都是在發展一種無法由其他系統制衡的單一超級智慧。」這段話針對封閉式實驗室,但這也正是 Anthropic 希望暫停必須採取多邊方式的理由。
外部批評者也指向同樣的阻力(2026 年 9 月)#
Kapoor & Narayanan(practitioner-opinion,normaltech.ai)是本文資料集中對快速起飛 RSI 論述持續批評得最清楚的一方。他們在同一篇重新檢視 Hugging Face 事件、並將其視為控制失效的文章中,專門討論 RSI:「我們認真看待 RSI,但認為超級智慧的許多瓶頸都在外部,無法靠提升運算能力克服。」他們指出,取得運算能力的摩擦——包括針對大型訓練作業的 KYC 式管制——才是阻止失控自我改進的實際煞車,而非「自我改進無法複利增長」這種建模假設。這是第五項具名外部煞車,並非新機制:它與本頁以 Amdahl 定律/具身瓶頸所做的綜合分析得出相同結論(RSI Growth Curves: Which Friction Binds First?)——限制條件位於模型認知之外——但沒有補充究竟是哪一種摩擦先成為瓶頸,因為它指出的是運算能力取得,而非驗證/監督或實體實驗延遲。本文將此記錄為第三個來源的趨同,而非下方開放問題的解答。
延伸閱讀#
- AI Accelerating AI Development — 論文中以當下為時間點的量化證據部分;也是「迴圈正在收緊」背後的資料
- AI R&D Autonomy Evaluation (AECI) — 能力面門檻:AECI 與替代門檻是 Anthropic 衡量「模型能否打造下一個模型?」的方式
- Responsible Scaling Policy Evaluations — 部署煞車;RSP 的 AI R&D 威脅模型,將 RSI 風險轉化為實際措施
- Research Taste as the Human Bottleneck — 人類最後的比較優勢;它能否維持,決定了三種未來情境中哪一種會成真
- Task Time-Horizon Scaling — 外部趨勢線(METR 每約 4 個月翻倍),讓外推結果得以量化
- Frontier Pause Verification — 治理回應:建立可信減速所需的驗證機制
- The Bitter Lesson — 「苦工可以自動化」是將苦澀教訓應用於研究本身;RSI 則是最遠的外推
- Agentic Loops Overtake Bespoke Systems — RSI 最清晰的既有領域替代案例:隨著模型進步,簡單迴圈便追上專門訓練的系統
- Harness Shrinkage as Models Improve — 同樣的人類角色縮減動態;人類不再撰寫程式碼,轉而負責審查
- Verification as the New Bottleneck — Amdahl 定律的具體實例:生成加速後,審查成為限制條件
- Agentic Misalignment (AM) — 可能透過自我改進不斷加劇的失效模式:失準「變得更常見,卻更難理解」
- Jagged Intelligence (Ghosts, Not Animals) — 「品味只是 AI 能掌握的另一種能力」這項論點,仰賴笑話/心智理論的先例
- LLM-Driven Vulnerability Research — Glasswing 證明了即使能力凍結,也能改變世界
- Autonomous Scientific Discovery — 2026 年 6 月的濕實驗室證據顯示,「苦工正逐漸自動化」也延伸到了發現本身(未來情境 2/3):自主藥物設計、新假說、為期一週的基因組學研究
- AI-Native Startup Lifecycle — 擴散情境:每位員工都位於一座代理程式金字塔頂端;100 人公司完成 1,000 人規模的工作
- AGI-to-ASI Pathways — DeepMind 的「From AGI to ASI」報告將 RSI 列為其路徑 3;這是與 Anthropic 實證論文相呼應、以理論為先的版本
- Intelligence Explosion Dynamics — 成長曲線問題(指數、雙曲線/奇點,或 S 曲線),以及 DeepMind 報告中的四種 RSI 機制(遺傳、文化、合作、資料)
- Multi-Agent Collective Intelligence — 合作/社會生成式 RSI:代理程式集體中的專業分工,釋出資源供進一步分工
- Large-Scale Test-Time Compute — Brown 關於測試時運算速度的論點:達到峰值能力需要長時間執行,因此時間限制了起飛速度,一夜之間爆發不太可能(詳見 Intelligence Explosion Dynamics)
- Agent-Authored Harness Optimization — 借用此詞來指狹義的腳手架爬山式優化;刻意放在相鄰位置,避免廠商的論述框架反過來被讀成上文的定義
- Optimizer–Evaluator Decoupling — 定義中的驗證環節:自我改進系統的接受訊號,是唯一不能內生化的元件;否則改進訊號便失去部署上的意義
- Knowledge-Centric Self-Improvement — 區分複利增長與 RSI 的軸線:可拋棄式代理程式協定,其外部知識產物能轉移並累積,而模型本身沒有任何變化
- Jeff Dean — 另一家實驗室從系統面提出的 2027 年預測,也指向未來情境 2;此外還提出 Anthropic 論述遺漏的限速步驟:迴圈延遲由驗證器決定,而經訓練的替代模型(DFT 快 300,000 倍)能縮短延遲
- Domestic Frontier Pacing — 本文資料集中唯一直接針對此頁機制的提案:允許用於自動化 AI R&D 的模型延遲 9 個月,理由是要推遲 AI 能破壞 AI 研究並讓後繼模型與自身對齊的時點;另外也將能力研發限制在總運算量的 5%
- Researcher Uplift from Code Output — 這條發展軌跡的近期指標:METR 的 Kwa 根據 Anthropic 的 8 倍程式碼產出數據,反推研究者的序列生產力提升約為 2.5 倍;並估計 Anthropic 自身 2 倍的整體 R&D 門檻會在研究者生產力提升約 3.5 倍時觸發,「可能在未來一兩年內發生」
- AI Control vs. Alignment — 同一篇 2026 年 9 月、由批評者撰寫的文章,從控制與對齊角度解讀 Hugging Face 事件;此處記錄其 RSI 立場,事件解讀則見該文
- RSI Autonomy Levels (B0–L5) — 這套階梯區分了本頁不斷手動釐清的四個對象(B0 任務內 → L1 執行 → L2 策略 → L3 學習議程 → L4 部署調適 → L5 遞迴繼承),並提供結構性與有效性檢驗,以及讓各個邊界都可檢查的改進迴圈剖析
- Headroom-Closed Index (HCI) — 同一份調查的實證部分,也說明這套階梯背後的動機:以各基準測試進入年份的前沿表現正規化後,離飽和最遠的領域是互動式、有狀態的領域(工具代理程式 39.9、軟體工程 52.6),而 L3–L4 機制會在這些領域發揮作用
- Continuous Self-Modification Under Review — 迴圈首次以未簡報、持續運作的方式出現,卻未呈現本頁關心的屬性:經過 161 天與 1,085 次自我修改提交,仍受阻擋式審查門檻限制;唯一公開的時間序列測量的是支出、權杖與程式碼量,而非能力;所有基準測試分數都是在停用自我演化的固定種子上測得
- Agentic Self-Modification (Agent-Initiated Weight Updates) — 權重有所變動,代理程式也會自行決定並主動發起,但這不是 RSI:這是一次不會複利增長的微調,目標是完成指派的修復工作,沒有設計後繼模型。它對本文的貢獻在於指出,權重變動迴圈(撰寫訓練資料、訓練、合併、重新部署)的機制,已在單張 GPU 上進入 4B–27B 開放模型的能力範圍
開放問題#
- 「研究品味」是真正的上限(未來情境 1),還是下一個即將被掌握的能力(未來情境 2–3)?本文將此列為唯一具有決定性的不確定因素。
- RSI 外推仰賴趨勢持續呈指數成長,而非轉為 S 曲線;但本文承認,無法排除架構上限,或運算/能源供應鏈限制。哪個會先成為瓶頸?部分回答(與 DeepMind 的綜合分析):RSI Growth Curves: Which Friction Binds First? — 三種未來情境與 DeepMind 提出的三種成長形狀一一對應;第一個成為瓶頸的摩擦,就是目前已經形成瓶頸的摩擦(Amdahl 定律中的驗證/監督,即 DeepMind 所說的具身瓶頸);而 The Abstraction Barrier 則補上 Anthropic 缺少的機制,說明品味是否構成真正的上限(未來情境 1)。2026-08-10 重新標記
#oq/now→#oq/source:究竟哪種摩擦實際成為瓶頸,如今是關於下一代能力的實證問題,不再是綜合分析上的缺口。 - 如果失準透過自我改進不斷加劇(未來情境 3),以 AECI 為門檻的 RSP 審查,能否在控制權喪失之前及時發現?
- 每一世代的對齊倍率是高於還是低於 1? Brown 將未來情境 3 描述成會複利增長的量,而非單一事件——99.9% 對齊的模型協助打造出 99.8% 對齊的模型,而 OpenAI 已開始用模型處理自身的對齊工作——並直言自己不知道該如何確保方向相反。本文資料集中沒有任何內容衡量其正負:能力面門檻(AI R&D Autonomy Evaluation (AECI))探討模型能否打造後繼模型,而目前沒有已發表的評估,在測量條件相同的情況下,檢驗模型協助打造的後繼模型究竟比其前代更對齊還是更不對齊。要解決這個問題,需要在連續兩代模型上執行一系列對齊評估,並記錄第二代模型受到模型協助的程度;目前沒有任何實驗室公開這種資料。
資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview — Stanford CS329A 第 1 講(Azalia Mirhoseini 與 Aakanksha Chowdhery,2025-09-22 授課,2026-08-03 發布,
practitioner-opinion):第三種「自我改進」用法——測試時運算 → 經驗證的合成資料 → 微調所形成的飛輪——以及講師明確表示,RL 與預訓練之間的歸因尚無共識 - When AI builds itself — Anthropic Institute,When AI builds itself: Our progress toward recursive self-improvement, and its implications(Marina Favaro 與 Jack Clark,2026 年 6 月)
- Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI's Noam Brown — Noam Brown(No Priors,2026-06-26),
practitioner-opinion:由於依賴測試時運算,時間成為限制條件,因此一夜之間爆發不太可能(「逐步起飛」) - Noam Brown – Agent swarms, alignment, & recursive self-improvement — Noam Brown(OpenAI)與 Dwarkesh Patel,Dwarkesh Podcast,2026-09-17(
practitioner-opinion)。§00:22:02 討論目標明確的論點、從不平整能力到通用性的橋接論述(由主持人提出)、每年 10 倍的人類解題時間階梯,以及作者自己未能實現的 2028 年預測,還有課程耗盡的摩擦;§00:40:22 討論 99.9%→99.8% 的世代退化情境,以及 OpenAI 目前已依賴模型從事對齊工作的陳述。內容全為第一手且均有保留措辭:該階梯是以四個點回溯擬合而成,沒有誤差區間;對齊百分比只是舉例,並非估計值;Brown 也將對齊相關內容稱為即興猜想。結構性論點(數學與 AI R&D 的目標形狀相同)由兩位講者共同提出,應歸因於這場對談,而非 OpenAI;從不平整能力到通用性的橋接論述則由 Dwarkesh Patel 提出。與 6 月訪談的完整差異見 Noam Brown - HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution — Luo 等人(arXiv 2607.13683,2026-07-15,
empirical):§4.6 跨模型分離,以及 §4.7 終止行為——實證顯示 harness 自我演化產生的是針對特定模型調整、會收斂的修正,而非會複利增長的通用能力 - Knowledge-Centric Self-Improvement — Wang 等人(Caltech,arXiv 2607.19592,2026-07-21,
empirical):§3 中唯一持續存在的物件是外部知識庫的可拋棄式代理程式;§4.4 探討保留測試集上的跨家族遷移——說明複利增長與 RSI 是可分離屬性的案例 - Jeff Dean: The 1% Rule for Building in AI — Jeff Dean 與 Diana Hu,YC Startup School 2026(2026-07-30,
practitioner-opinion):§「AI Systems That Improve Themselves」與 §「AI That Builds Better AI」——2027 年自動化實驗預測、「每單位運算輸入所產生的發現」,以及用來縮短迴圈延遲、快 300,000 倍的經訓練 DFT 替代模型。**利益衝突:**Google 首席科學家;量子化學成果是對同事工作的回憶,沒有附上引用 - How to pace the US frontier — AI Futures Project(Lifland、Halstead、Dean、Larsen、Kodama),2026-08-05(
practitioner-opinion):§「Limit capabilities of models used for AI R&D」(9 個月延遲、破壞研究的理由、懷疑 RSI 者的論點)與 §「Compute allocation requirements」。模型數字來自提案者使用自身先驗假設所做的模型計算;完整討論見 Domestic Frontier Pacing - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents — Guo 等人(Chinese Academy of Sciences,arXiv 2607.24300,2026-07-27,
empirical):驗證器與部署之間的落差、內生證據的資訊限制,以及可靠的自我改進「至少需要一個不受代理程式控制的部署接受訊號」這項結論——也是完全閉合迴圈所受的限制。解析警告:表 7 在解析時遭到折疊,無法引用;完整討論與解析備註見 Optimizer–Evaluator Decoupling (2026-09-07:已根據 PDF 第 7 頁手動重建表 7 的原始資料,每列一個模型——現在可以引用;verify.py回報ok) - The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — Duan、Liu、Tang、Chen、Zhou 等人(35 位作者;Shanghai Jiao Tong University、Theseus Labs、Tsinghua、ByteDance、ModelBest、Xiaohongshu、Shanghai AI Lab、Humanlaya、Agent-Native Research Lab、Frontis.AI),arXiv 2609.11873,2026-09-10,79 頁(
practitioner-opinion):§1.4 五個自主性等級;§2.2.2 定義與收錄的四種實驗室定義(Anthropic、OpenAI、Tencent、Alibaba);§3.6 結構性與有效性的區分,以及各系統有界與 L5 的零結果;§3.6.4 對 AIDE 2 的評估。完整討論見 RSI Autonomy Levels (B0–L5);§2.1 的基準測試重新分析見 Headroom-Closed Index (HCI)。**利益衝突:**六個機構在 §5 中以產業案例形式出現,案例由其自身員工撰寫;§2.3 也承認以工程部落格與公司資料作為主要證據——所有產業主張都屬於vendor-claim等級。**涵蓋缺口:**未引用 HarnessBank、DarwinX 或 Wang 等人的預算匹配對照組 - The AI-as-Normal-Technology View of Loss of Control Incidents — Kapoor 與 Narayanan,normaltech.ai,2026-09-14(
practitioner-opinion,論述性,沒有新資料):上文引用的 RSI 外部瓶頸立場。完整討論,包括對 Hugging Face 事件的解讀,見 AI Control vs. Alignment - Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution — Razzhigaev、Gritsaev、Kaznacheev、Dragunov、Yampolskiy 與 Kuznetsov(MSU/Skoltech/Joi Lab/AIRI,arXiv 2608.08311,2026-08-08,
case-study——編譯時從empirical降級):§4 中 Hope 部署 161 天的情況與指標、附錄 C 對evolution off腳手架的揭露,以及圖 6 的活動序列。作者全體均有利益衝突(他們打造、運行、稽核並調整自身系統的分數)。解析警告:表 2 完全折疊,表 4 的列位移使其通過了原本乾淨的檢查器判定;兩者都已復原並記錄於 Continuous Self-Modification Under Review,該文收錄完整討論
Cited by 55
- Autonomous Scientific Discovery×4
Perspiration automation reaches discovery. When AI builds itself argued most research progress is…
- Open Questions Backlog×4
Recursive Self Improvement: The RSI extrapolation rests on trends staying exponential rather than…
- RSI Autonomy Levels (B0–L5)×4
The corresponding definition: RSI is the capability of a system to "autonomously transform acquired…
- Agent-Authored Harness Optimization×3
Recursive Self Improvement — the term the vendor invokes; the distinction between narrow scaffold…
- AGI-to-ASI Pathways×3
Recursive (self-) improvement — AI accelerates AI R&D, plausibly compounding into an intelligence…
- Anthropic Institute×3
Public-facing trajectory analysis. When AI builds itself combines public benchmarks (Task Time…
- Intelligence Explosion Dynamics×3
Noam Brown (OpenAI, practitioner-opinion) supplies an independent, mechanism-level argument against…
- Research Taste as the Human Bottleneck×3
Recursive Self Improvement — whether taste stays human decides which of the three futures obtains;…
- Responsible Scaling Policy Evaluations×3
Agi To Asi Pathways — institutionalized gates (mandatory evals, licensing, incident reporting) are…
- RSI Growth Curves: Which Friction Binds First?×3
When AI builds itself — Anthropic Institute (Favaro & Clark, June 2026): three futures, Amdahl's…
- Task Time-Horizon Scaling×3
Recursive Self Improvement — this curve, extrapolated, is the quantitative case that the loop could…
- Agentic Self-Modification (Agent-Initiated Weight Updates)×2
Against Recursive Self Improvement: the weights move and the agent decides, but it is one step,…
- AI Accelerating AI Development×2
The empirical half of the Anthropic Institute's When AI builds itself — the previously-unreported…
- AI Control vs. Alignment×2
Recursive Self Improvement (hub) — the RSI external-bottleneck stance, converging with rather than…
- AI R&D Autonomy Evaluation (AECI)×2
This is the capability-side gate on Recursive Self Improvement: AECI and the substitution threshold…
- Anthropic×2
Recursive Self Improvement — Anthropic's own AI-development loop is the essay's case study for the…
- Balance-of-Power Superintelligence×2
The op-ed does not mention Recursive Self Improvement. The manifesto devotes a section to it and…
- CS329A: Self-Improving AI Agents (Stanford)×2
Read together, that is a course whose own evidence says the flywheel is a compounding efficiency…
- Domestic Frontier Pacing×2
It delays the sabotage window — "the point at which AIs have the capability to sabotage AI research…
- Evaluation Horizon Versus Release Cadence×2
Recursive Self Improvement (hub) — the setting in which the host pushes the internal/external gap…
- Frontier Pause Verification×2
The governance response in When AI builds itself: if the RSI trajectory holds, the world should at…
- Intra-Trace Parallel Planning (SPRINT)×2
The distinctive move is the direction of travel: everywhere else in this wiki the harness supplies…
- Jeff Dean×2
Recursive Self Improvement — his 2027 prediction (automated experiment loops) and his mechanism for…
- Knowledge-Centric Self-Improvement×2
This lands cleanly on the correct side of Recursive Self Improvement's boundary, and for a stronger…
- Large-Scale Test-Time Compute×2
Recursive Self Improvement — the loop this axis feeds: verified test-time trajectories become the…
- LLM-Driven Vulnerability Research×2
Recursive Self Improvement — Glasswing's 10k+ findings are the essay's proof that even a stalled…
- Motivated Mislabeling×2
The report's own framing of the stakes is the Recursive Self Improvement one: if models supervise…
- Optimizer–Evaluator Decoupling×2
Recursive Self Improvement — the constraint this rule places on the definition: a system that…
- Rationale Bootstrapping (STaR)×2
Recursive Self Improvement — the flywheel this is the 2022 prototype of, with the weights moving…
- The Abstraction Barrier
Recursive Self Improvement — the barrier supplies the mechanism for whether taste is a real ceiling…
- Agentic Loops Overtake Bespoke Systems
Recursive Self Improvement — this is RSI's clearest existing-domain proxy: a simple loop matched a…
- Agentic Misalignment (AM)
Recursive Self Improvement — the essay's gravest scenario: "rare occurrences of misalignment…
- AI-Native Startup Lifecycle
Ai Accelerating Ai Development — the supply-side mechanism behind the lean-unicorn demand: each…
- Build for the Next Model
The bet depends on a reliable release cadence and a forecastable capability curve (Task Time…
- Compute Allocator
Recursive Self Improvement — the essay's third future has humans moving "most of our effort towards…
- Continuous Self-Modification Under Review
Recursive Self Improvement — the definitional page; this is the corpus's first governed RSI…
- Elon Musk
Recursive Self Improvement — the specific mechanism he named in ~2016 as what terrified him most,…
- Expenditure Horizon
Recursive Self Improvement — a measured null on the loop's most direct proxy: agents optimizing an…
- Google DeepMind
It is also the source of the wiki's theory-of-superintelligence cluster. The June 2026 report From…
- Harness Shrinkage as Models Improve
Recursive Self Improvement — harness shrinkage run to its endpoint: the harness dissolving into the…
- Headroom-Closed Index (HCI)
Recursive Self Improvement — the argument this section exists to motivate: Observation 3's…
- Human-Governed Skill Maintenance
The undercount anchor is Anthropic's own repository. anthropics/skills reads as 1 trailered edit in…
- Instrumental Convergence
Recursive Self Improvement — the future where misalignment could "compound as models build their…
- Jagged Intelligence (Ghosts, Not Animals)
Recursive Self Improvement — the essay leans on the joke/theory-of-mind precedent to argue research…
- METR
Recursive Self Improvement — the doubling curve, extrapolated, is the quantitative case for RSI…
- Superintelligence Trajectory
Recursive Self Improvement (hub) — An AI system autonomously designing and developing its own…
- Multi-Agent Collective Intelligence
Recursive Self Improvement — cooperative/sociogenic RSI is collective specialization compounding;…
- Noam Brown
The generational-degradation scenario he names as the concerning one: models 99.9% aligned helping…
- Process vs Outcome Reward Models
Mirhoseini's framing of why it belongs in a course on self-improvement: "you generate the…
- Researcher Uplift from Code Output
Recursive Self Improvement — the reconciliation bears directly on when Anthropic's own 2× R&D…
- The Bitter Lesson
Recursive Self Improvement — the furthest extrapolation of the principle: "research progress is…
- The Verifiability Thesis
It gates the self-improvement flywheel, not just capability. The course's whole thesis — test-time…
- Verification as the New Bottleneck
Recursive Self Improvement — Amdahl's law for orgs: as generation accelerates, human code review…
- What Makes a Self-Improvement Artifact Transfer?
Transfer was already the sharpest separator between scaffold hill-climbing and Recursive Self…
- Yoshua Bengio
The frontier labs' declared plan is to automate AI research, which would also accelerate robotics…
Related articles
- AI Accelerating AI Development
The empirical core of *When AI builds itself*: measured evidence AI already speeds AI R&D at Anthropic — >80% of merged…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Intelligence Explosion Dynamics
The growth-curve question behind recursive self-improvement: whether AI-accelerating-AI produces exponential, super-exp…
- Research Taste as the Human Bottleneck
The narrowing human role as AI absorbs execution: choosing which problems matter, which results to trust, and when an a…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
