H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

前沿 AI 暫停驗證

前沿 AI 是否能以可信且可驗證的方式放慢或暫停,是一項軍備管制難題:其可偵測性比其他技術更難(訓練執行比飛彈發射井更容易隱匿),因此 Anthropic Institute 致力建構多邊暫停所需的驗證系統

Article metadata
Publication details
Published:June 7, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:GovernanceAI PolicyCoordinationArms ControlAnthropic
Reading:13 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

前沿 AI 暫停驗證插圖

資料來源#

摘要#

《When AI builds itself》提出的治理回應是:如果 RSI 發展軌跡成立,世界至少應該保有放慢或暫時暫停前沿 AI 發展的選項,讓社會制度與對齊研究跟得上。但只有在暫停措施可信——具多邊性且可驗證——時才有用,因為單方面暫停只會改變領先者。 Anthropic Institute 表明,其議程是建構可信減速所需的系統。這是 RSP 內部部署煞車的政策另一端:RSP 管控單一實驗室的發布;暫停驗證則是實驗室之間、國家之間的協調問題。

為什麼單方面暫停還不夠#

Anthropic 的立場是:「如果減速只讓最不謹慎的行動者在技術上追上來,可能會讓所有人都更不安全。」單一實驗室單方面暫停「可以立即做到,但作用小得多:它會改變誰是領跑者,卻無法建立目前缺少的更廣泛審議程序。」Anthropic 表示,如果其他前沿或接近前沿的開發者也以可驗證的方式採取行動,自己就會放慢或暫時暫停——因此驗證是關鍵所在。

為什麼 AI 的驗證格外困難#

可信的暫停需要多個資源充足的實驗室,在多個國家同意依相同條件停止,且各方都能驗證其他各方確實停下來。AI 使得連可偵測性(門檻低於完整的可驗證性)都比其他技術更難:

  • 訓練執行比飛彈發射井更容易隱匿。 沒有可供觀察的大型實體特徵。
  • 投入要素用途廣泛。 算力、資料與人才並非武器專用,因此無法像管制裂變材料那樣,限制相關前置要素。
  • 暗中背離的誘因極大——「其他人暫停時,仍繼續發展的一方可能繼承領先地位。」
  • 可信的暫停還必須明定哪些情況會觸發、何時解除,以及由誰裁定——目前都尚無定義。

先例與時間難題#

這「在原則上未必不可能」——世界曾為複雜技術建立驗證制度,例如**《中程核武條約》(INF Treaty)**。但那些制度「花了數十年才建立基礎設施與信任」,而依 RSI 的時間軸,「我們沒有那麼久。」因此 Anthropic Institute 的押注是:現在就開始建構可偵測性/驗證基礎設施,早於任何協議,讓需要時能有此選項。未來幾個月,Anthropic 計畫召集政策制定者、研究人員、公民社會與其他 AI 公司,並公開會議成果——明確邀請非 AI 公司人士參與討論。

不需要驗證制度的較弱機制#

Musk 於 2026 年 7 月提出的方案(Cross-Lab Pre-Release Review)值得放在這篇文章旁邊看,因為它針對同一個協調缺口,並避開了最棘手的部分。方案要求在前沿模型發布前,讓競爭者取得 1–2 週的 API 存取權;只有在實驗室拒絕處理已標示的危險時才通知政府。由於開發者是自願提供存取權,因此不需要驗證——沒有什麼需要偵測。

這能做到什麼、不能做到什麼:它提出延遲單次發布的建議,而非經驗證的停止;對訓練執行也隻字未提,而這正是本文所說的可偵測性問題所在。這是對下方第三個開放問題的部分回答——由競爭者依 Motion Picture Association 模式裁定——但效果有限,因為方案沒有標準、沒有秘書處,也沒有在「競爭對手要求延後」與「通知政府」之間設定任何步驟。Musk 提出此方案時的出發點也恰好相反:他曾簽署 2023 年的暫停聯署信,如今卻表示「即使有停止按鈕,我們大概也不該按下它」,因此他的機制是為了配合加速發展而設計,不是為了促成停止。

將減速設為國家機構的權限之一#

Hassabis 於 2026 年 7 月提出的 Standards Body 方案(practitioner-opinion)從意想不到的方向切入本文主題。其權限升級上限是,審查制度「可在情勢嚴重程度需要時逐步加強,包括在必要時協調 Frontier Labs 放慢發展」——將跨實驗室協調減速寫成附屬子句,並視為美國標準機構的一項調節設定,而不是條約問題。

這是語料庫中唯一設想由單一機構協調減速的地方,卻沒有提供本文指出此舉所需的任何要件:沒有可偵測性基礎設施、沒有驗證哪些人實際停止、沒有明確觸發條件、沒有解除條件、沒有執行機制,也沒有超越「成為制定共同國際標準的重要起點」這一期望的多邊範圍。對照本文來看,這是把協調問題重述為一項行政權力——這有助於了解實驗室內部如何看待問題,卻不是解決方案。

國內方案:逐項列出的驗證選單,以及對前提的質疑#

AI Futures Project 於 2026 年 8 月提出的方案(Lifland、Halstead、Dean、Larsen、Kodama,2026-08-05,practitioner-opinion)是語料庫中第一個以清單而非概略表述,回答本文第一個問題的來源。稽核員可取得的權限分成五個逐級提高的層級——僅有公開資訊;能提出高階問題並獲得答覆或執行基準測試(以 METR 的 Frontier Risk Report 為例);取得公司系統的員工層級存取權(METR 在 Anthropic 的存取權);進駐公司內部;以及直接稽核算力分配,例如透過網路分接點,作者也指出這會付出使用者隱私的代價。此外,若懲罰嚴厲到足以產生效果,訪談舉報者並提供保護可作為較低成本的替代方案;TEE 認證與零知識證明則是純軟體選項,作者認為它們「可能更加穩健」。

這份選單背後的結構性主張是降低問題難度,並將其一分為二。他們主張,進駐公司的稽核員加上政府執法,足以處理國內情況;硬體驗證(例如網路分接點)則僅在國際情況下才有必要,因為對手是具備實體存取權與供應鏈觸及能力的民族國家。依此觀點,本文的可偵測性問題是條約問題,而不是監管問題——司法管轄區可以安排稽核員帶著公司筆電,管理本地實驗室的發展速度。

而且這也反駁了本文的立論基礎。 Anthropic 的主張是,單方面暫停「會改變誰是領跑者,卻無法建立目前缺少的更廣泛審議程序。」這些作者將質疑具體落在司法管轄區層級,而非實驗室層級,並以數字回應:根據 Epoch 的 ECI 國家資料,美國原本的能力領先「大約 4–8 個月」;但由於中國的許多進展「來自蒸餾美國前沿模型,以及使用美國發現的演算法」,他們「估計若美國停止發展,中國約需一年才能追上」——這提供了值得善用的喘息空間,而且若「中國即將取得主導地位」,還能選擇再次加速。他們還提出反向論點:美國實驗室「目前的安全性遠不足以抵禦民族國家行動者」,因此在能力發展上放慢腳步、同時全力提升安全性,「實際上可能在超人能力階段取得對中國更大的領先優勢」。這是語料庫中第一個以數字回應領跑者疑慮的說法。這些數字是提案者自己的估算,而且兩個來源都是未經衡量的提案,因此本文記錄這項分歧,但不作裁決。

這份提案沒有提供本文第三個問題所問的內容。四種選項之間如何升級,只是給讀者的建議,並未賦予任何人權力;至於權限則直接被視為既定前提:「本文假設由美國政府執行這種發展節奏管理。」

相關文章#

  • Domestic Frontier Pacing — 語料庫中第一份逐項列出的驗證選單(五層稽核員存取階梯,最終到網路分接點),也是第一個以數字挑戰單方面暫停疑慮的來源:美國原本領先約 4–8 個月,計入蒸餾與竊取演算法的管道後,追上約需 1 年。其結構性主張將本文問題一分為二——進駐稽核員足以處理國內情況,硬體驗證則適用於條約——但仍未指明由誰裁定升級事宜

  • Frontier AI Standards Body — 提議由國家標準機構將跨實驗室協調減速列為一項升級設定,卻沒有本文所說可信減速所需的驗證、觸發或執行機制;也是第一個提出由某機構承擔下文所述裁定任務的方案,卻沒說明機構內由誰決定

  • Cross-Lab Pre-Release Review — 較弱的自願存取替代方案,不需要驗證基礎設施,因此也無法促成停止

  • Recursive Self-Improvement — 讓暫停選項值得建構的發展軌跡;本文則是相應的治理回應

  • Responsible Scaling Policy Evaluations — 單一實驗室的部署煞車;暫停驗證是多邊層面的對應機制

  • AI Accelerating AI Development — 加速效應日益累積的證據,說明「我們沒有數十年」為何是實際限制

  • Agentic Misalignment (AM) — 失去控制是可信暫停旨在降低的風險

  • AGI-to-ASI Pathways — DeepMind 所說的「審慎減速」阻力(阻力 #6)正是同一個協調問題;其「軍事—經濟適應主義/無政府狀態作為架構師」分析,則說明可驗證的多邊協調在結構上為何如此困難

  • Open-Weight Elicitation Irreversibility — 驗證框架的盲點:暫停可觀測的訓練執行,無法處理已發布權重上的無限制推論

  • Balance-of-Power Superintelligence — 相反的治理立場:Zuckerberg 主張讓個人取得分配到的能力,才是確保超級智慧安全的關鍵,而非協調減速機制

  • Government Checkpoint Sharing — 明確以此方案為對照而設計的機制:透過將能力移交給政府而非賦予政府停止權,達成零發布延遲的監督

  • Safety Commitments That Cannot Bind the Actor Who States Them — 這項條件的結構性後果:若暫停承諾取決於尚不存在的制度,當下就不會帶來任何成本;而支撐此條件的領跑者前提,在語料庫中本身也受到質疑

  • Silent Revision Rate — 曾經量測到的同類自我管理問題:甚至還沒測試任何暫停承諾之前,開發者對其既有安全框架變更的自述,便未披露三分之二的重大變更(12 家開發者),且未披露的削弱次數約為強化次數的兩倍——本文這種有條件暫停立場若要偵測同類不對稱,也需要外部驗證

開放問題#

  • AI 訓練的「驗證制度」具體包含哪些要素——算力核算、資料中心稽查、硬體認證、晶片遙測?文章點出問題,未提出機制。部分解答(2026-08-12):Domestic Frontier Pacing 提供語料庫中第一份逐項列出的選單——五層稽核員存取階梯(公開資訊 → 基準測試層級問題 → 員工層級系統存取 → 進駐公司 → 透過網路分接點直接稽核算力分配),另列舉保護舉報者、TEE 認證與零知識證明作為替代方案,並主張不同情境所需的層級不同(國內採進駐稽核員,國際採硬體驗證)。仍有兩點未解:這是practitioner-opinion,沒有任何項目經過試行;而且它回答的是算力分配的驗證問題,不是本文開頭提出的訓練執行可偵測性問題——未獲告知的訓練執行,無法靠公司內部稽核員解決偵測問題。
  • 可偵測性 < 可驗證性:當訓練執行不會留下實體特徵、投入要素又可兩用時,偵測究竟能否做到可靠?
  • 由誰裁定觸發與解除?目前沒有任何機構擁有此權限,而成立這樣的機構本身就是需要數十年的工作。部分解答(2026-08-12)——一個候選機構,以及下一層同樣存在的缺口:Hassabis 的 Standards Body 是第一個提出由某機構承擔此權限的方案,並明定可升級至協調跨實驗室減速。但它在機構內重現了同一個問題:文章沒有說明由誰宣布評估程序「有效且穩健」、由誰判定有必要減速,也沒有說明如何執行。因此答案從「沒有機構掌有此權限」變成「已有機構提案,但提案沒說明內部由誰決定」——回答了「在哪裡」,卻完全沒有回答「由誰」。practitioner-opinion,尚未實施。三週後的第四份提案(Domestic Frontier Pacing)對「由誰」仍未提出答案:它假設由美國政府執行,沒有指定任何人負責四種選項之間的升級,並且只為稽核員的刪節決定訂定爭議處理機制。

資料來源#

§ end
Cited by 19
Related articles
  • Responsible Scaling Policy Evaluations

    Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…

  • Domestic Frontier Pacing

    AI Futures Project's four-option ladder for pacing US frontier AI unilaterally — temporary pause (100% inference), comp…

  • Frontier AI Standards Body

    Hassabis's July 2026 proposal for a US-led, FINRA-modelled public-private standards body that tests Frontier-class mode…

  • Cross-Lab Pre-Release Review

    Musk's proposal that frontier labs get 1–2 weeks of competitor API access to test each other's models before release, w…

  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…