資料來源#
- A Framework for Frontier AI and the Dawning of a New Age
- How to pace the US frontier
- Silent Revision: Measuring Undisclosed Change in the Safety Frameworks of Frontier AI Developers
- When AI builds itself
摘要#
《When AI builds itself》提出的治理回應是:如果 RSI 發展軌跡成立,世界至少應該保有放慢或暫時暫停前沿 AI 發展的選項,讓社會制度與對齊研究跟得上。但只有在暫停措施可信——具多邊性且可驗證——時才有用,因為單方面暫停只會改變領先者。 Anthropic Institute 表明,其議程是建構可信減速所需的系統。這是 RSP 內部部署煞車的政策另一端:RSP 管控單一實驗室的發布;暫停驗證則是實驗室之間、國家之間的協調問題。
為什麼單方面暫停還不夠#
Anthropic 的立場是:「如果減速只讓最不謹慎的行動者在技術上追上來,可能會讓所有人都更不安全。」單一實驗室單方面暫停「可以立即做到,但作用小得多:它會改變誰是領跑者,卻無法建立目前缺少的更廣泛審議程序。」Anthropic 表示,如果其他前沿或接近前沿的開發者也以可驗證的方式採取行動,自己就會放慢或暫時暫停——因此驗證是關鍵所在。
為什麼 AI 的驗證格外困難#
可信的暫停需要多個資源充足的實驗室,在多個國家同意依相同條件停止,且各方都能驗證其他各方確實停下來。AI 使得連可偵測性(門檻低於完整的可驗證性)都比其他技術更難:
- 訓練執行比飛彈發射井更容易隱匿。 沒有可供觀察的大型實體特徵。
- 投入要素用途廣泛。 算力、資料與人才並非武器專用,因此無法像管制裂變材料那樣,限制相關前置要素。
- 暗中背離的誘因極大——「其他人暫停時,仍繼續發展的一方可能繼承領先地位。」
- 可信的暫停還必須明定哪些情況會觸發、何時解除,以及由誰裁定——目前都尚無定義。
先例與時間難題#
這「在原則上未必不可能」——世界曾為複雜技術建立驗證制度,例如**《中程核武條約》(INF Treaty)**。但那些制度「花了數十年才建立基礎設施與信任」,而依 RSI 的時間軸,「我們沒有那麼久。」因此 Anthropic Institute 的押注是:現在就開始建構可偵測性/驗證基礎設施,早於任何協議,讓需要時能有此選項。未來幾個月,Anthropic 計畫召集政策制定者、研究人員、公民社會與其他 AI 公司,並公開會議成果——明確邀請非 AI 公司人士參與討論。
不需要驗證制度的較弱機制#
Musk 於 2026 年 7 月提出的方案(Cross-Lab Pre-Release Review)值得放在這篇文章旁邊看,因為它針對同一個協調缺口,並避開了最棘手的部分。方案要求在前沿模型發布前,讓競爭者取得 1–2 週的 API 存取權;只有在實驗室拒絕處理已標示的危險時才通知政府。由於開發者是自願提供存取權,因此不需要驗證——沒有什麼需要偵測。
這能做到什麼、不能做到什麼:它提出延遲單次發布的建議,而非經驗證的停止;對訓練執行也隻字未提,而這正是本文所說的可偵測性問題所在。這是對下方第三個開放問題的部分回答——由競爭者依 Motion Picture Association 模式裁定——但效果有限,因為方案沒有標準、沒有秘書處,也沒有在「競爭對手要求延後」與「通知政府」之間設定任何步驟。Musk 提出此方案時的出發點也恰好相反:他曾簽署 2023 年的暫停聯署信,如今卻表示「即使有停止按鈕,我們大概也不該按下它」,因此他的機制是為了配合加速發展而設計,不是為了促成停止。
將減速設為國家機構的權限之一#
Hassabis 於 2026 年 7 月提出的 Standards Body 方案(practitioner-opinion)從意想不到的方向切入本文主題。其權限升級上限是,審查制度「可在情勢嚴重程度需要時逐步加強,包括在必要時協調 Frontier Labs 放慢發展」——將跨實驗室協調減速寫成附屬子句,並視為美國標準機構的一項調節設定,而不是條約問題。
這是語料庫中唯一設想由單一機構協調減速的地方,卻沒有提供本文指出此舉所需的任何要件:沒有可偵測性基礎設施、沒有驗證哪些人實際停止、沒有明確觸發條件、沒有解除條件、沒有執行機制,也沒有超越「成為制定共同國際標準的重要起點」這一期望的多邊範圍。對照本文來看,這是把協調問題重述為一項行政權力——這有助於了解實驗室內部如何看待問題,卻不是解決方案。
國內方案:逐項列出的驗證選單,以及對前提的質疑#
AI Futures Project 於 2026 年 8 月提出的方案(Lifland、Halstead、Dean、Larsen、Kodama,2026-08-05,practitioner-opinion)是語料庫中第一個以清單而非概略表述,回答本文第一個問題的來源。稽核員可取得的權限分成五個逐級提高的層級——僅有公開資訊;能提出高階問題並獲得答覆或執行基準測試(以 METR 的 Frontier Risk Report 為例);取得公司系統的員工層級存取權(METR 在 Anthropic 的存取權);進駐公司內部;以及直接稽核算力分配,例如透過網路分接點,作者也指出這會付出使用者隱私的代價。此外,若懲罰嚴厲到足以產生效果,訪談舉報者並提供保護可作為較低成本的替代方案;TEE 認證與零知識證明則是純軟體選項,作者認為它們「可能更加穩健」。
這份選單背後的結構性主張是降低問題難度,並將其一分為二。他們主張,進駐公司的稽核員加上政府執法,足以處理國內情況;硬體驗證(例如網路分接點)則僅在國際情況下才有必要,因為對手是具備實體存取權與供應鏈觸及能力的民族國家。依此觀點,本文的可偵測性問題是條約問題,而不是監管問題——司法管轄區可以安排稽核員帶著公司筆電,管理本地實驗室的發展速度。
而且這也反駁了本文的立論基礎。 Anthropic 的主張是,單方面暫停「會改變誰是領跑者,卻無法建立目前缺少的更廣泛審議程序。」這些作者將質疑具體落在司法管轄區層級,而非實驗室層級,並以數字回應:根據 Epoch 的 ECI 國家資料,美國原本的能力領先「大約 4–8 個月」;但由於中國的許多進展「來自蒸餾美國前沿模型,以及使用美國發現的演算法」,他們「估計若美國停止發展,中國約需一年才能追上」——這提供了值得善用的喘息空間,而且若「中國即將取得主導地位」,還能選擇再次加速。他們還提出反向論點:美國實驗室「目前的安全性遠不足以抵禦民族國家行動者」,因此在能力發展上放慢腳步、同時全力提升安全性,「實際上可能在超人能力階段取得對中國更大的領先優勢」。這是語料庫中第一個以數字回應領跑者疑慮的說法。這些數字是提案者自己的估算,而且兩個來源都是未經衡量的提案,因此本文記錄這項分歧,但不作裁決。
這份提案沒有提供本文第三個問題所問的內容。四種選項之間如何升級,只是給讀者的建議,並未賦予任何人權力;至於權限則直接被視為既定前提:「本文假設由美國政府執行這種發展節奏管理。」
相關文章#
-
Domestic Frontier Pacing — 語料庫中第一份逐項列出的驗證選單(五層稽核員存取階梯,最終到網路分接點),也是第一個以數字挑戰單方面暫停疑慮的來源:美國原本領先約 4–8 個月,計入蒸餾與竊取演算法的管道後,追上約需 1 年。其結構性主張將本文問題一分為二——進駐稽核員足以處理國內情況,硬體驗證則適用於條約——但仍未指明由誰裁定升級事宜
-
Frontier AI Standards Body — 提議由國家標準機構將跨實驗室協調減速列為一項升級設定,卻沒有本文所說可信減速所需的驗證、觸發或執行機制;也是第一個提出由某機構承擔下文所述裁定任務的方案,卻沒說明機構內由誰決定
-
Cross-Lab Pre-Release Review — 較弱的自願存取替代方案,不需要驗證基礎設施,因此也無法促成停止
-
Recursive Self-Improvement — 讓暫停選項值得建構的發展軌跡;本文則是相應的治理回應
-
Responsible Scaling Policy Evaluations — 單一實驗室的部署煞車;暫停驗證是多邊層面的對應機制
-
AI Accelerating AI Development — 加速效應日益累積的證據,說明「我們沒有數十年」為何是實際限制
-
Agentic Misalignment (AM) — 失去控制是可信暫停旨在降低的風險
-
AGI-to-ASI Pathways — DeepMind 所說的「審慎減速」阻力(阻力 #6)正是同一個協調問題;其「軍事—經濟適應主義/無政府狀態作為架構師」分析,則說明可驗證的多邊協調在結構上為何如此困難
-
Open-Weight Elicitation Irreversibility — 驗證框架的盲點:暫停可觀測的訓練執行,無法處理已發布權重上的無限制推論
-
Balance-of-Power Superintelligence — 相反的治理立場:Zuckerberg 主張讓個人取得分配到的能力,才是確保超級智慧安全的關鍵,而非協調減速機制
-
Government Checkpoint Sharing — 明確以此方案為對照而設計的機制:透過將能力移交給政府而非賦予政府停止權,達成零發布延遲的監督
-
Safety Commitments That Cannot Bind the Actor Who States Them — 這項條件的結構性後果:若暫停承諾取決於尚不存在的制度,當下就不會帶來任何成本;而支撐此條件的領跑者前提,在語料庫中本身也受到質疑
-
Silent Revision Rate — 曾經量測到的同類自我管理問題:甚至還沒測試任何暫停承諾之前,開發者對其既有安全框架變更的自述,便未披露三分之二的重大變更(12 家開發者),且未披露的削弱次數約為強化次數的兩倍——本文這種有條件暫停立場若要偵測同類不對稱,也需要外部驗證
開放問題#
- AI 訓練的「驗證制度」具體包含哪些要素——算力核算、資料中心稽查、硬體認證、晶片遙測?文章點出問題,未提出機制。部分解答(2026-08-12):Domestic Frontier Pacing 提供語料庫中第一份逐項列出的選單——五層稽核員存取階梯(公開資訊 → 基準測試層級問題 → 員工層級系統存取 → 進駐公司 → 透過網路分接點直接稽核算力分配),另列舉保護舉報者、TEE 認證與零知識證明作為替代方案,並主張不同情境所需的層級不同(國內採進駐稽核員,國際採硬體驗證)。仍有兩點未解:這是
practitioner-opinion,沒有任何項目經過試行;而且它回答的是算力分配的驗證問題,不是本文開頭提出的訓練執行可偵測性問題——未獲告知的訓練執行,無法靠公司內部稽核員解決偵測問題。 - 可偵測性 < 可驗證性:當訓練執行不會留下實體特徵、投入要素又可兩用時,偵測究竟能否做到可靠?
- 由誰裁定觸發與解除?目前沒有任何機構擁有此權限,而成立這樣的機構本身就是需要數十年的工作。部分解答(2026-08-12)——一個候選機構,以及下一層同樣存在的缺口:Hassabis 的 Standards Body 是第一個提出由某機構承擔此權限的方案,並明定可升級至協調跨實驗室減速。但它在機構內重現了同一個問題:文章沒有說明由誰宣布評估程序「有效且穩健」、由誰判定有必要減速,也沒有說明如何執行。因此答案從「沒有機構掌有此權限」變成「已有機構提案,但提案沒說明內部由誰決定」——回答了「在哪裡」,卻完全沒有回答「由誰」。
practitioner-opinion,尚未實施。三週後的第四份提案(Domestic Frontier Pacing)對「由誰」仍未提出答案:它假設由美國政府執行,沒有指定任何人負責四種選項之間的升級,並且只為稽核員的刪節決定訂定爭議處理機制。
資料來源#
- When AI builds itself — §「What should we do?」(可驗證的多邊暫停;可偵測性與可驗證性的差別;《中程核武條約》(INF Treaty) 先例;Anthropic Institute 籌辦的會議)
- A Framework for Frontier AI and the Dawning of a New Age — Demis Hassabis,2026-07-14(
practitioner-opinion):升級條款(「逐步加強……包括在必要時協調 Frontier Labs 放慢發展」)與國際範本的框架。詳見 Frontier AI Standards Body - How to pace the US frontier — AI Futures Project(Lifland、Halstead、Dean、Larsen、Kodama),2026-08-05(
practitioner-opinion):§「Auditor access」(五層階梯)、§「How to prepare to pace the frontier」(TEE 認證、零知識證明、網路分接點、暗算力),以及 §「But wouldn't domestic pacing let China win?」(美國原本領先 4–8 個月與約需 1 年追上的估算)。詳見 Domestic Frontier Pacing - Silent Revision: Measuring Undisclosed Change in the Safety Frameworks of Frontier AI Developers — Louis Yiven Zhu(Oxford),arXiv 2609.08789,2026-09-08(
empirical):本文僅引用其自我管理層面的對照(開發者對自身框架修訂的說明,未經驗證);詳見 Silent Revision Rate
Cited by 19
- Domestic Frontier Pacing×4
Read against Frontier Pause Verification, which asks what a verification regime concretely consists…
- Anthropic Institute×3
Coordination infrastructure. It plans to "conduct research — in collaboration with many others —…
- Cross-Lab Pre-Release Review×3
This is a third position in the wiki's governance map, distinct from both poles already recorded.…
- Open Questions Backlog×3
Frontier Pause Verification: What does an AI-training "verification regime" concretely consist of —…
- Recursive Self-Improvement×3
Frontier Pause Verification — the governance response: building the verification regime a credible…
- Responsible Scaling Policy Evaluations×3
How does the RSP brake interact with Recursive Self Improvement: is AECI-based gating fast enough…
- RSI Growth Curves: Which Friction Binds First?×3
5. The friction humans must choose. Deliberate slowdown is the only exogenous item on the list —…
- Safety Commitments That Cannot Bind the Actor Who States Them×3
The Institute's position is not "we will pause." It is that the world should have the option, and…
- AGI-to-ASI Pathways×2
Deliberate slowdown / regulation / societal backlash — rogue use, accidents, military/political…
- Balance-of-Power Superintelligence×2
Evidence tier matters here: every load-bearing claim is a forecast or a philosophical stance by the…
- Competitor-Indexed Safety Triggers: What the Revision Record Settles About Pause Postures, Acceleration Regret and Benchmark Perimeters×2
Answered. The question asked how the posture interacts with the incentive to ship. It does not…
- Elon Musk×2
The interviewer's summary — "you seem to have decided it's inevitable, let's hope for the best and…
- Frontier AI Standards Body×2
Frontier Pause Verification — the escalation ceiling here ("coordinating a slowdown in development…
- Government Checkpoint Sharing×2
Frontier Pause Verification — the pole this proposal is designed against: instrumented multilateral…
- Open-Weight Elicitation Irreversibility×2
Frontier Pause Verification — governs training compute; says nothing about unbounded inference on…
- AI Accelerating AI Development
Frontier Pause Verification — compounding acceleration is why "we don't have decades" to build a…
- Anthropic
2026 June — the Anthropic Institute published When AI builds itself, disclosing…
- Superintelligence Trajectory
Frontier Pause Verification — The arms-control problem of a credible, verifiable slowdown or pause…
- Silent Revision Rate
Frontier Pause Verification — a pause commitment conditioned on an external verification regime is…
Related articles
- Responsible Scaling Policy Evaluations
Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…
- Domestic Frontier Pacing
AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…
- Frontier AI Standards Body
Hassabis's July 2026 proposal for a US-led, FINRA-modelled public-private standards body that tests Frontier-class mode…
- Cross-Lab Pre-Release Review
Musk's proposal that frontier labs get 1–2 weeks of competitor API access to test each other's models before release, w…
- Recursive Self-Improvement
An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…
