H
Howardism
Plate IIAgent Security機器翻譯 · machine-translatedENHOWARDISM

「不可能,而非繁瑣」會否扼殺縱深防禦?分層摩擦、相對於攻擊者,以及頻率悖論

降級,而非否定:摩擦層永遠不會累積成屏障,因為每次嘗試成本近乎為零的適應型攻擊者,會針對整套聯合防禦最佳化(失效彼此相關,且攻擊者最後行動)——純摩擦堆疊的適應型下限由模型決定,而非層數;只有在至少一道移除能力的閘門之上,摩擦才保有價值,作為降低殘餘風險的手段(Opus 5 的探測器+分類器雙層架構就是已部署的實例)——2026-09-02 收窄定義:「摩擦」指的是會提高攻擊成本、而攻擊者可自行發動的控制措施;至於提示層級的控制,若攻擊所經通道無法在缺少目標配合時繼續,而該控制撤回了目標的「配合」(mind-virus 警告、EvoMal 的反提示),則它能抵禦適應型攻擊,並可視為以 token 實作的移除能力終點。判準是相對於對手成本,而非相對於代理程式本身:「不可能」的控制會約束所有行動者;「繁瑣」的控制則須放進攻擊者的嘗試成本曲線中定價,因此混合威脅模型必須逐一評估每項控制,並以有能力發動攻擊的最低成本對手類別為準。至於最低代理自主性的頻率悖論,則可從機制上化解:可重設的速率(節流)屬於摩擦;與帶外授權事件綁定的基數上限(單次使用 nonce、交易 token、到期 token、冪等性上限)則是移除能力——「頻率」恰好能成為屏障,前提是計數器位於代理程式信任網域之外,而且觸及上限時會拒絕,而非延遲。

Article metadata
Publication details
Published:July 29, 2026
Filed:Essay
Domain:Agent Security
Tags:DerivedSecurityZero TrustDefense In DepthAdaptive Evaluation
Reading:13 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

「不可能,而非繁瑣」插圖:分層摩擦與移除能力

「不可能,而非繁瑣」會否扼殺縱深防禦?分層摩擦、相對於攻擊者,以及頻率悖論#

問題#

摩擦與屏障主題群中的三個 #oq/now 項目,以下合併作答:

  1. 傳統縱深防禦會依據「摩擦控制措施累積到一定數量就能形成屏障」的理論,將它們層層堆疊。不可能,而非繁瑣(設計測試) 是要否定分層摩擦,還是只將它降到移除能力之下?
  2. 有些控制措施對人類而言是摩擦,對代理程式卻是屏障(反之亦然)。這項測試是否相對於代理程式?面對人類與代理程式並存的威脅模型,應如何評估?
  3. 最低代理自主性 增加了「頻率」這個面向(「多常」),但同一套框架又說速率限制屬於摩擦,而非屏障。為什麼限制頻率既是最低代理自主性控制,又只算摩擦?

答案一:降級,而非否定——關鍵機制是失效相關#

摩擦層永遠不會累積成屏障,因為適應型攻擊者面前的各層失效並非彼此獨立。(2026-09-02 依據 心智病毒(代理程式間的想法傳播) 與 代理程式自我投毒(CREATE 路徑) 收窄定義——「摩擦」指的是會提高攻擊成本、而攻擊者可自行發動的控制措施,本答案所測量的控制措施皆屬此類;下方第四個項目則是邊界案例。)**會提高攻擊成本的摩擦層,永遠不會累積成屏障,因為適應型攻擊者面前的各層失效並非彼此獨立。**傳統縱深防禦的算術假設每一層都會獨立失效,因此層層堆疊會讓攻擊者通過的機率相乘並趨近於零。面對適應型最佳化者,這項假設並不成立:攻擊者會針對實際部署的整套系統*最佳化,因此各層會一起失效。實測案例是 AutoDojo:它的黑箱迴圈能將注入攻擊特化,做到「攻擊防禦時從未辨識出防禦」,因為實際運作的防禦(不論部署了哪種堆疊)都會隱含地納入每次適應度評估。單一最佳化迴圈會把整套堆疊當作一個攻擊面;增加另一層同類防禦(另一個內容偵測器、另一個篩選器),只會改變迴圈所最佳化的環境。作者指出了結構性原因:任何內容層級的防禦都得面對一個「永遠最後行動」的攻擊者。

實證紀錄支持這兩方面:

  • **同質摩擦堆疊會一起崩潰。**Nasr 等人讓十二種已發表的帶內防禦措施遭受攻擊,攻擊成功率均超過 90%——聚光與夾心式攻擊的成功率更超過 95%——幾乎完全反轉了它們的靜態分數(帶外提示注入防禦)。某個篩選器的靜態 ASR 為 0%,但在低成本、六輪迭代的黑箱攻擊下,洩漏率達 28%(動作開放任務則達 64%)(提示注入中的任務規格效應(AutoDojo))。十二種繁瑣措施仍無法讓攻擊變得不可能。
  • **純摩擦堆疊的適應型下限由模型決定,而非層數。**AutoDojo 幾乎無法提高未設防強模型的 ASR(Claude-Haiku-4.5 為 0.3%→1.8%),但面對弱模型的篩選器時,則能恢復兩位數的攻擊成功率——「下限是模型的性質,而不是分層篩選防禦的性質」(代理程式提示注入,分層殘餘的開放問題)。再堆疊更多摩擦,無法把模型本身沒有的下限買回來。
  • **至少有一層移除能力時,分層防禦確實有效。**兩類控制措施的性質不同:確定性的動作閘門在同樣擊破篩選器的適應型攻擊下仍能守住(Progent 在五個模型上的結果為 8.2%→7.7%;Narisetty 的獨立重現結果為 25.8%→4.2%→2.6%)(帶外提示注入防禦)。已部署的範例則是在強固基礎上採用異質分層:Anthropic 的正式環境架構明確採用「兩個獨立層」——輸入時讀取工具結果的探測器,以及輸出時封鎖危險工具呼叫的分類器,「攻擊必須分別擊敗兩者才能成功」——在自動模式下,129 個瀏覽器情境中沒有一個成功(代理程式提示注入,Opus 5 章節)。此處的獨立性是設計特性(不同機制、不同通道,其中一個是確定性的),而非一項假設。
  • 「摩擦」涵蓋範圍的邊界:需要目標配合的攻擊,定價方式不同,因為它們根本不會被定價(2026-09-02 新增)。兩項 empirical 結果將提示層級控制歸到屏障一側。心智病毒(代理程式間的想法傳播):一段 SOUL.md 警告讓代理程式間的感染率從 70%/52% 降到 1%/0%,之後在15 代、超過 150 個針對受警告代理程式演化的酬載下仍維持此結果;突變器看過所有失敗軌跡,也沒有任何內容傳播超過一跳。代理程式自我投毒(CREATE 路徑):四行反提示讓自我投毒率維持在 ≤1.8% ASPR,且零回呼(每個模型 ≤1.3%),即使面對六種特意改寫以躲避反提示的橫幅——token 重新命名、權限升級、非命令式偽裝、分散措辭、結構融合,以及盲目的內文覆寫——仍然有效;拒絕條款是關鍵,若刪掉它,只保留安全框架,ASPR 就會回升至 30.1-31.4%,而未設防時為 41.8%。兩者都不反駁失效相關性,因為這兩種控制措施都沒有在定價任何行為:兩種攻擊都依賴目標的自願配合——一種是說服,另一種是在重新撰寫時模仿——因此,針對目標行為傾向的控制措施會移除通道,而非提高成本。這是以 token 實作的移除能力,而且它只是一層而非堆疊,因此「累積成屏障」的算術並未恢復。適用範圍以論文自身的說明為準:心智病毒的適應型實驗只在單一模型上執行,且突變器無法觸及那些「傳播」意圖隱含的酬載(論文列出一種以越獄優先的病毒為未測項目;Claude 拒絕擔任突變器,因此負面結果受限於 Kimi K2.5 的搜尋能力);EvoMal 的反提示未經白箱攻擊者持有其確切文字的情境測試,作者稱它是「一種柔性、依賴模型、且預設代理程式並未具備的控制措施」,並搭配確定性的簽署式隔離閘門——正是本答案提到的「屏障前置摩擦」形態,也是防禦者自行選擇的設計。

因此,這項測試對縱深防禦的判決是修正,而非廢除:**摩擦從承重機制降級為降低殘餘風險的手段。*摩擦層仍能低成本削減機會主義、非適應型攻擊的數量(聚光仍是「抵禦非適應型攻擊的真正縱深防禦層」——代理程式提示注入),也能爭取偵測時間(AI 代理程式的零信任 第 5 階段:速率限制「能爭取時間」)。但摩擦無法再取代屏障:若遏止計畫的最後一道防線是摩擦,就「會失敗」(不可能,而非繁瑣(設計測試),第 3 階段)。因此得到的設計規則是:每條攻擊路徑都必須以至少一項移除能力的控制措施為終點;摩擦應置於屏障之前,絕不能取代屏障。確定性閘門後方的分層摩擦能降低成本與雜訊;單獨使用的分層摩擦,只是一個掛著 N 個徽章的相關層。(*2026-09-02 收窄:終點不必位於模型之外。如果攻擊無法在缺少目標配合時繼續,提示中的行為傾向控制就是移除能力的終點——被移除的能力是目標參與其中的意願。除此之外——包括注入、越獄、擷取、酬載層級篩選;這些攻擊只需要目標照常執行工作,並不需要其他配合——終點仍須位於帶外;把「提示層級控制曾經守住一次」讀成通用許可,就是本文收窄定義要避免的錯誤。)

答案二:測試相對於對手成本,而非絕對相對於代理程式#

這項測試看起來是二分法(「不可能還是繁瑣?」),但第二個判準是以特定貨幣計價:**攻擊者每次嘗試的成本與耐心。**這正是 AI-Accelerated Offense 所說的代理型攻擊者會改變的量——每次嘗試成本近乎為零、耐心無限——也正是「這會花太久,不值得」不再成立的原因。所以答案是肯定的,測試具有相對性;但相對的是對手的成本曲線,而非對手究竟是人類或代理程式:

  • **「不可能」不因行動者而異。**密碼學難度、不存在的網路路徑、模型從未持有的憑證(代理程式身分管理系統(AIMS):「模型從未擁有過的秘密,就不可能被外洩」),對所有攻擊者都有約束力。這就是為什麼在威脅模型不確定時,移除能力是安全的答案——它不必依攻擊者的成本定價。
  • **「繁瑣」須按對手類別定價。**速率限制或重新編碼篩選器,能有效阻止人類手動嘗試;面對只需支付 API 費用就能不斷重試的代理型攻擊者,成本差異則微乎其微。反過來的例子也存在:知識庫中最清楚的「對人類而言是摩擦,但對代理程式毫無作用」案例,是每次動作前的確認對話框——在 ADI 下,「代理程式的推理會強化攻擊者偽造的說法」,因此對話框會消耗人類注意力(造成核准疲勞),卻無法阻斷攻擊路徑。這是指向錯誤對象的摩擦。
  • **成效也取決於攻擊者的位置,而不只有成本。**當攻擊者是與目前使用者不同的主體時,aiAuthZ 的逐訊息身分閘門能有效阻擋攻擊(9/9 起身分偽冒案例遭阻擋);若注入攻擊是在使用者本人的權限下發動,它就會退回普通的價值政策摩擦。同一項控制措施,在一種威脅位置是屏障,在另一種位置則是摩擦。

**混合人類/代理程式威脅模型的評估規則:**逐一測試每個(控制措施、對手類別)組合,並以有能力發動攻擊的最低成本對手類別評分每條攻擊路徑——整套防禦的強度取決於各類別中的最低值,因為攻擊者會選擇對自己最有利的類別。只有在控制措施能抵禦所有可能觸及其所防護路徑的對手類別時,才算屏障。若某項控制措施對代理型攻擊者只是摩擦,卻對人類有承重作用(對話框、多重要素驗證提示、審查閘門),就應假設另一端是代理型攻擊者,而非人類,重新評分——這正是把框架的「假設它會失敗」立場落實成程序。目前尚未測量的殘餘問題是:沒有任何來源測量過混合威脅部署;這項規則是由單一類別證據作出的原則性綜合。

答案三:從機制上化解頻率悖論——速率與授權綁定基數#

表面上的矛盾——最低代理自主性 把「多常」列為一項控制面向,但同一套框架又稱速率限制為摩擦——只要把「限制頻率」拆成兩種共用同一個詞的機制,就能化解:

  • **速率(節流)屬於摩擦。**每分鐘 N 次、可重設、以延遲為基礎:它縮小窗口,卻不會關閉窗口。耐心無限的攻擊者可以等速率限制解除;依據該框架,速率限制「能爭取時間,但無法阻止意志堅定的代理型攻擊者」(不可能,而非繁瑣(設計測試),第 5 階段)。
  • **與授權事件綁定的基數上限屬於移除能力。**該框架自身列出的有效控制措施中,已有一項通過測試的頻率限制:**到期/短效 token——「窗口會關閉,而不只是縮小。」**同一結構也出現在幾個受評估的強力系統中:AIMS 交易 token 會將廣泛 token 限縮為單筆、不可重用的交易(頻率 = 1,並以密碼學強制執行);aiAuthZ 會將每次呼叫綁定至經驗證的人類訊息中的單次使用 nonce 與時間窗口;ScopeGate 的金額上限與冪等階段則是確定性的逐次呼叫上限,並採用失效封閉設計(靜態測試 0/48、適應型繞過 0/29)。在每種情況中,第 (N+1) 次操作都不是速度變慢——而是未經授權,直到新的帶外事件建立新授權為止。

從受評估系統中各種機制所在的位置,可以歸納出判別條件:限制頻率在以下情況屬於屏障:(a) 計數器/帳本位於代理程式信任網域之外(位於主機外,或以密碼學方式嵌入憑證本身);(b) 耗盡上限時會拒絕,而非延遲(失效封閉);(c) 重設路徑是一項獨立的授權事件(經驗證的人類訊息、重新簽發 token),而非時間流逝。若限制依據的是攻擊者只須等候即可跨過的可重設計時器,或由模型本身執行的帶內建議,則屬於摩擦。因此,最低代理自主性的頻率面向與速率限制屬於摩擦的判定,都正確描述了不同機制。設計建議是:將「多常」實作為授權基數(單次使用、到期、逐筆交易),而非速率;如此一來,它就從繁瑣升級為不可能。

綜合結論#

三個答案的結構相同。「不可能/繁瑣」界線不是依據控制措施的名稱(速率限制、多重要素驗證、篩選器、對話框)分類,而是看相對於對手的控制機制:下一次攻擊是從原理上遭拒,還是僅僅成本提高——而如今評估「成本提高」時,必須面對嘗試成本近乎為零的攻擊者。2026-09-02 的收窄定義,補上了機制問題的另一面:由誰執行成本高昂的步驟。只有在攻擊者能自行發動攻擊時,成本才會產生作用;若工作由目標執行——因代理程式受到說服而傳遞酬載,或因代理程式模仿而重現橫幅——便能把從原理上拒絕參與的措施寫進提示,因為被移除的是目標的配合,而非攻擊者的存取權限。縱深防禦仍可作為屏障前的摩擦;測試應逐一套用到各對手類別,並取最低值;頻率控制則恰好在重新實作為授權基數時才能通過測試。這個主題群目前仍缺少的實證包括:對混合人類/代理程式威脅模型的測量評估;對異質堆疊(摩擦+確定性閘門)發動的適應型攻擊——AutoDojo 第 6 節中「重新塑造酬載,使其看起來符合使用者合理意圖」的路徑仍未測試;以及對配合依賴規則進行前瞻性測試,因為這兩項成功的提示層級控制,都是在適應型實驗結果已知後,才由測試自身防禦的作者歸類;每項測試都只涵蓋一種攻擊與一個模型(不可能,而非繁瑣(設計測試) 將此列為開放問題)。

後續閱讀,2026-08-19——設定落差:安全性論證測量了什麼,又涵蓋了什麼 從安全性論證的角度,得到本文的失效相關性結論:實驗室安全案例中的緩解層,多半沿用了它們原本要作為後盾的同一模型特性前提,因此會一起失效;而整個語料中唯一真正獨立的層,是(僅涵蓋非國家行為者的)權重安全性,以及一項坦承缺乏直接證據的論證。本文推導出的獨立性條件——計數器位於代理程式信任網域之外、失效封閉、只由帶外授權事件重設——正是填補該落差的設計答案。它也原封不動承接本文尚未解決的實證缺口:沒有人對異質堆疊發動過適應型攻擊。

§ end
Cited by 11
Related articles
  • Out-of-Band Prompt-Injection Defense

    Second-generation prompt-injection defense enforced outside the model: a deterministic reference monitor mediates tool…

  • Agent Data Injection (ADI)

    A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…

  • Agentic Prompt Injection

    Direct and indirect injection of malicious instructions into an agent; LLMs cannot reliably distinguish information fro…

  • Capability Gating Is Not Authorization

    Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…

  • Zero Trust for AI Agents

    Anthropic's security framework for deploying autonomous agents: trust nothing / verify everything / assume breach, appl…