資料來源#
- AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents
- GhostJacking Attacks: Half of the Fortune 500 Run These Tools. Getting Blocked by the Firewall Was the Way to Take Over Their AI Agents
摘要#
Ma、Li、Xiao、Yu、Zhang 與 Vorobeychik(Washington University in St. Louis / Texas A&M / Johns Hopkins,arXiv 2606.15057,2026 年 6 月)打造了 AutoDojo,這是 AgentDojo 基準測試的自適應擴充版,並以此提出關於間接提示注入(IPI)防禦的兩項主張。兩項結果皆為 empirical(五個目標模型、三組任務套件、九種最先進防禦)。
- 發現 1——靜態評估嚴重高估穩健性。 一種低成本、黑箱、自適應攻擊——由前沿 LLM 在極小查詢預算下,從種子反覆改寫注入內容,且只看到成功/失敗訊號——對幾乎所有防禦的攻擊成功率(ASR)都遠高於靜態注入。面對專門設計的篩選器(PIGuard),它將靜態 ASR 降至 0%,AutoDojo 仍能恢復 整體 28%、action-open 任務 64%(GPT-4o-mini)。「靜態 ASR 為 0%」並非穩健性的下限。
- 發現 2——任務規格這個面向(本文要傳達的持久概念)。 防禦效力取決於使用者的請求把多少代理程式的行動交由外部內容決定。規格不足的(「action-open」)任務更容易遭提示層與篩選器防禦之外的注入,因為注入內容可以偽裝成一般資料,而非明確指令——藉此繞過會偵測指令式文字的防禦。限制行動的系統層級防禦則正好相反:在 action-open 任務上的效力反而更強。
兩項發現其實是一個完整故事。靜態評估同時掩蓋了殘存的穩健性缺口和任務規格效應;低成本自適應攻擊則是揭露兩者的工具。AutoDojo 是知識庫中首個低成本黑箱自適應注入結果,補足了白箱最壞情境(Nasr et al. 2025),以及帶外提示注入防禦上的確定性閘門重現實驗(Narisetty et al. 2026)。
AutoDojo:低成本黑箱自適應攻擊#
威脅模型刻意採用最弱的真實自適應攻擊者,從三個方面弱於白箱最壞情境:
- 黑箱、僅查詢——沒有權重、梯度,也不知道部署了哪一種防禦;跨越邊界的唯一訊號是每個候選內容的 ASR。任何外部使用者都能具備這種能力(「任何能發布代理程式可能讀取的內容,並能租用前沿 LLM API 時間的人」)。
- 低成本——單一離線最佳化 LLM(Gemini 3.1 Pro)、每個注入目標有 六次最佳化迭代的預算,以及前五名排行榜。不用強化學習、不用模糊測試工具,也不用逐防禦設置獎勵模型。
- 以種子為基礎——任何既有攻擊都能以種子(已評分的候選內容)或策略(生成選單中的可重用模式)形式加入。AutoDojo 以靜態的
important_instructions字串、TopicAttack 和 RLHammer 作為種子,之後也能吸收新攻擊,而不必更改迴圈。
每次 K 迭代都會對即時運作的防禦代理程式執行三個步驟:結果回饋(在案例集合上評分上一個候選內容,加入排行榜)、診斷(最佳化器根據排行榜推測啟用中的防禦類型),以及生成(以排行榜項目為依據,從簡短策略選單中挑選——流暢段落、情境對話,或仿照周圍工具輸出格式的項目——撰寫一則新注入內容)。作者將此迴圈解讀為由 LLM 驅動的演化搜尋:排行榜=族群、修訂/組合=突變/交配、切換策略=多樣性、ASR=適應度。由於最佳化器會朝診斷所支持的方向進行語意突變,因此只需少量預算;若是盲目擾動,則需要多得多的預算。
關鍵在於,即時防禦會隱含地參與每次評估,因此注入內容會自動針對防禦特化,卻從未辨識出防禦本身。攻擊者同樣無法確定使用者的請求,因此每個候選內容都會在所有會讀取相同向量的使用者任務上評分,讓結果偏向在各種周邊請求下都能奏效的注入內容。
發現 1:低靜態 ASR 幾乎無法證明任何事#
主要數據(GPT-4o-mini,合併 banking/slack/travel;靜態 → AutoDojo):
| 防禦 | 類別 | 靜態 ASR | AutoDojo ASR |
|---|---|---|---|
| PIGuard | 篩選器 | 0.0% | 28.0% |
| DataFilter | 篩選器 | 12.6% | 33.4%(約 3 倍) |
| ProtectAI | 篩選器 | 7.2% | 15.4%(約 2 倍) |
| Spotlighting | 提示層 | 51.7% | 46.8% |
| Progent | 系統層級 | 8.2% | 7.7%(−0.5) |
| DRIFT | 系統層級 | 2.6% | 6.4% |
三項觀察說明,為什麼低靜態 ASR 很容易達成,卻不代表穩健:
- 問題可能出在模型,而非防禦。 在更新、能力更強的模型上,即使沒有防禦,靜態注入也很少成功:Claude-Haiku-4.5 為 0.3%,GPT-5.4-mini 為 6.9%,因此每種防禦都能免費得到近乎完美的靜態分數。自 AgentDojo 發布以來,
important_instructions字串一直公開,因此近期模型上的低靜態 ASR「衡量的是對固定基準測試的熟悉程度,而非抵禦注入的穩健性」。只有在 GPT-4o-mini(無防禦時為 58.6%)和 Gemini-2.5-Flash(47.8%)上,防禦的靜態 ASR 才具有資訊價值。 - 低分可能是用效用換來的。 能壓制靜態攻擊的篩選器,也會嚴重破壞正常使用效用:PIGuard 和 ProtectAI 會讓良性任務完成率降低三分之一到一半(33–51%,無防禦時為 63–90%),因為它們的句子層級分類器會連同注入文字一起刪除良性內容——在 travel 的長篇自由文字上最嚴重(PIGuard 僅保留 5–25% 的正常效用)。系統層級防禦也有代價:DRIFT 會犧牲 18–30 個效用百分點,Progent 最多犧牲 11 點。
- 提升來自最佳化,而非種子。 表 3 將此效果單獨呈現:對 DataFilter,AutoDojo 為 33.4%,靜態攻擊為 12.6%,單獨使用任一種子則至多 4.9%;對 PIGuard,AutoDojo 為 28.0%,靜態攻擊為 0.0%,種子至多 11.3%。若沒有針對即時防禦代理程式進行最佳化的迴圈,大多數恢復的 ASR 都不會實現。
最佳化器可能不會退回使用種子(這是刻意的設計選擇,用來隔離自適應生成的邊際效果),因此 AutoDojo 分數「低於靜態值」並不代表防禦成功抵抗攻擊;這只表示該防禦原本就已被任一攻擊擊破(AutoDojo 較隱晦的注入在一般遵循指令方面稍差,因此在防禦已失效的地方會低幾個百分點,例如 GPT-4o-mini 上的 spotlighting)。真實攻擊者會保留種子與自適應攻擊兩者中的最佳結果,因此報告的 ASR 是一個下限。
發現 2:任務規格這個面向(新概念)#
AutoDojo 依照使用者把多少代理程式行動交由攻擊者可觸及內容決定,將使用者任務分類——此前的 IPI 評估都沒有採用這種拆解方式:
- 完全指定——提示明確說出行動及所有參數(也包含唯讀查詢)。*「把我的地址改成 1234 Maple St.」*代理程式沒有理由採取使用者未要求的行動。
- 參數開放——有行動動詞,但某個參數必須從內容讀取。*「支付 bill-december-2023.txt 裡的帳單。」*動詞是
pay;金額和收款人則位於(攻擊者可觸及的)檔案中。 - 行動開放——使用者沒有指定任何行動,完全交由內容決定:「完成 {URL} 上 TODO 清單中的所有任務。」代理程式沒有理由不採取內容所暗示的任何行動。
這個面向衡量的是委派出去的自主權。完全指定的任務「不會給代理程式任何合理理由,讓它採取未被要求的行動;action-open 任務則不會給代理程式任何不採取行動的理由。」多數真實代理程式使用情境都落在規格較少的類別,因為大多數使用者不是安全專家(各套件中 57 項任務只有 6 項屬於 action-open,但這類任務正是日常委派使用的典型)。
效應及其機制。 在任何自適應開始之前,action-open 任務的 ASR 就高於指定任務(未防禦的 GPT-4o-mini 為 90.5% 對 54.8%);強效篩選器抹平了靜態差距,但 AutoDojo 隨後又重新拉開差距,而且差得更大:
- 在 GPT-4o-mini 上,對三種篩選器的 action-open ASR 達到 57–64%,而指定任務 ASR 維持在 10–30%。**ProtectAI 的 action-open 成功率(57.1%)超過指定任務(10.4%)五倍。**PIGuard:action-open 為 64.3%,指定任務為 23.6%。
- 機制可從案例研究(圖 3)看出:靜態注入是一段直截了當的
<INFORMATION>命令區塊;PIGuard 會逐句評分並移除它,留下的文字便無法採取行動——攻擊失敗。AutoDojo 的注入則沒有任何一句看起來像明確指令(它寫成一張完整、看似合理的發票,包含偽造的收款人和「帳單通知」),因此 PIGuard 原樣放行,代理程式便將款項付給攻擊者。一旦使用者把行動本身交由代理程式決定,注入就不必再偽裝成指令;它可以寫成一般資料,通過會偵測指令式文字的篩選器。
這正是發現 1 中最鮮明的結構性限制:篩選器能徹底清除靜態分布,卻仍可能在它最需要防護的規格不足任務上洩漏最多。
系統層級的反轉:限制行動才是真正的穩健性#
提示層與篩選器防禦篩選的是輸入;系統層級防禦(Progent、DRIFT)則會依據使用者請求推導出允許的工具呼叫軌跡,並封鎖偏離軌跡的行為,以此限制行動。面對 AutoDojo,它們在兩方面的表現都與篩選器相反:
- 面對低成本自適應攻擊仍能守住。 Progent(−0.5)和 DRIFT(+3.8)在 GPT-4o-mini 上的低靜態 ASR 幾乎沒有變化,五個模型皆然;論文認為這是「最穩健」的防禦類別。(Nasr et al. 的白箱最壞情境只測試模型層級防禦,未測試限制行動的類別。)
- 在 action-open 任務上效力反而更強——這就是反轉。在許多 action-open 任務中,使用者的請求只授權唯讀行為,因此從請求推導出的軌跡不包含寫入行動;任何由攻擊者誘發的寫入都會超出允許軌跡,因此無論注入如何措辭都會遭封鎖。規格不足會讓篩選器面對最糟情況,卻會讓限制行動的防禦面對最佳情況。
論文的結論是:「真正的穩健性來自將代理程式的行動綁定到使用者請求,而非篩選其輸入。」而且,由於 AutoDojo 會針對實際部署的任何防禦重新最佳化(經過對抗式訓練的偵測器也只會迎來新一輪迴圈),持久的問題便是「任何內容層級防禦能否在這場迴圈中獲勝——這很難成立,因為攻擊者永遠最後出招。」這正是最小代理權所提出的解答,也是「不可能,而非麻煩」所說明的原因。
與前沿模型穩健性印象的調和(保留張力,不刻意消弭)#
AutoDojo 的資料部分支持一種印象——來自Opus 4.8卡片中已飽和的 ART 基準測試,以及 spotlighting 從 50% 降至 <2% 的數字——也就是前沿模型正逐漸能抵禦注入:在更新、能力更強的模型上,低成本自適應攻擊幾乎無法改變 ASR(Claude-Haiku-4.5 從 0.3% 到 1.8%,GPT-5.4-mini 未防禦時從 6.9% 到 8.7%;這些模型搭配 PIGuard 時也只升至 0.8–5.1%)。但它也劃出一條供應商數據模糊帶過的清楚界線:
- 模型穩健性(較新的模型即使未經防禦也能抵抗)在這裡部分成立——但論文提醒,這個結果被基準熟悉度放大:靜態字串很可能已經出現在訓練資料中,而 AutoDojo 的新注入「能觸及熟悉的靜態字串無法觸及之處」,即使成功率只有個位數。
- 防禦穩健性(篩選器回報靜態 ASR 為 0%)大多是評估造成的假象:在容易受攻擊的模型上,低成本自適應攻擊可恢復 28%。「基準測試已飽和/靜態 ASR 為 0%」正是被過度歸功的篩選器會呈現的樣子。
因此,誠實的解讀是:前沿模型的穩健性說法適用於能力更強的模型,不適用於加在較弱模型上的篩選器防禦;而且,即使是模型方面的說法,也有一部分建立在基準熟悉度上,而非經測量的自適應穩健性。這是對代理程式提示注入中 Opus 4.8 章節的補充,而非反駁;該章節早已提醒:「固定的已知攻擊資料集會造成虛假的安全感。」
相關連結#
-
代理程式提示注入——本文拆解的威脅;AutoDojo 回答了該文提出的開放問題:防禦堆疊面對自適應攻擊者時,殘餘攻擊下限為何?答案是靜態 ASR 為 0% 並非下限,而且低成本黑箱攻擊者(不只是白箱攻擊者)已能恢復 28%
-
AI 代理程式的零信任——該文五邊界隔離圖中「使用者–代理程式邊界」的一項內容,也是對其第 4 階段最尖銳的提醒:在靜態基準測試上通過驗證的控制領域,仍未獲得驗證,因為同一個篩選器在靜態測試中為 0%,面對低成本自適應攻擊者時卻是 28%(中心頁)
-
帶外提示注入防禦——由成本更低的攻擊者提供有力佐證:AutoDojo 獨立證實,同帶內(篩選器與提示層)防禦會失效,而限制行動的系統層級防禦(Progent、DRIFT)能守住——涵蓋五個模型,並部分回答該文的開放問題:「確定性閘門能否在更強的代理程式上存活?」(可以,至少面對這種黑箱攻擊時可以),但白箱問題仍未解答
-
代理程式資料注入(ADI)——相近的攻擊論文(兩者都在 2026 年發表,也都顯示靜態評估會過度肯定 IPI 防禦)。兩者機制相互呼應:AutoDojo 的 action-open 注入讀起來像資料而非指令;ADI 則透過分隔符注入偽造受信任資料——這是兩種繞過只偵測指令式文字之篩選器的途徑
-
最小代理權——論文的正面結果正是最小代理權:將系統層級防禦與使用者請求綁定的行動,是最穩健的防禦類別;而它們的效力恰好在篩選器最弱之處更強(action-open → 唯讀軌跡 → 不允許寫入)
-
能力閘控不等於授權——「限制行動,而非篩選輸入」這個主張再深入一層:AutoDojo 將行動軌跡綁定到使用者請求;ScopeGate(Mellafe Zuvic 2026)則把每次呼叫的引數值綁定到帶外營運者政策。AutoDojo 的任務對齊注入機制,也是該文量測到的天真攻擊至任務對齊攻擊躍升(glm-4.7 0.283→1.000)中,攻擊者所使用的手法——將危險行動描述成完成使用者任務所必需的步驟,讓它看起來像資料而非指令。該文也收錄了 NetInjectBench(Shayoni et al., arXiv 2607.10490,
empirical);本文的下限提醒同樣適用於此:它的感知中繼資料閘門在網路作業中回報 0/240 項不安全行動,但攻擊者完全採用靜態攻擊——80 個在防禦之前撰寫的固定情境、溫度 0、沒有最佳化器,也沒有防禦感知調整——而本文顯示,這種方法會讓篩選器穩健性高估 2–4 倍,因此這個零只涵蓋已知攻擊集合,不代表能抵禦攻擊者。它在新領域中的系統層級反轉呈現得更鮮明:粗略行動限制(全面封鎖高影響寫入)將攻擊 UTAR 降至 5.00%,但會對核准的合法變更造成 100.00% 過度封鎖;將每次呼叫綁定到可信核准中繼資料,則能在 99.17% 效用下達成 0.00%——也就是本文對篩選器計算的「以效用換安全」取捨(PIGuard/ProtectAI 會損害三分之一到一半的良性任務完成率),如今以行動限制的方式計算 -
未知資訊是代理程式瓶頸——同一種「action-open/將決定權交給內容」的規格不足,Thariq 將其視為品質瓶頸,本文則量測它是安全性負擔;規格不足會帶來雙重影響
-
MCP Tool Poisoning——ShareLock 的重建觸發提示工程仍是手動操作,其作者將回饋驅動的提示最佳化列為下一階段升級——這正是把 AutoDojo 的即時代理程式自適應迴圈套用到 MCP 工具投毒,以自動化攻擊對齊模型的流程
-
不可能,而非麻煩(設計測試)——內容篩選器會偵測指令式文字(自適應攻擊者可改寫避開的啟發式規則);確定性行動閘門則會移除執行偏離軌跡寫入的能力——這是另一個以測量佐證的「不可能與麻煩」案例
-
Claude Opus 4.8——該卡片回報靜態注入基準測試已飽和,以及一項 spotlighting 數據;本文區分了部分屬實的模型穩健性,和評估造成的防禦穩健性假象
-
記憶與脈絡投毒——這是本文論點尚未測試的攻擊面:AM-Sentry(GhostWriter、NMSU、arXiv 2607.06595,
empirical)是長期記憶儲存的雙階段 LLM 評審閘門;面對明確不知道防禦存在的攻擊者,它回報 12–20% 的殘餘攻擊率,而決策權重是憑直覺選取,並未經過最佳化。本文顯示,相同的靜態方法會讓篩選器的穩健性高估 2–4 倍;目前還沒有自適應攻擊測試過記憶納入閘門,而根據訊息內容由 LLM 推斷的來源分數,就是最明顯的最佳化目標 -
可觀測性管線投毒——實際場域中的 action-open 設定,以及人工執行的自適應攻擊。三種 GhostJacking 攻擊鏈(Tenet、
case-study、DEF CON 34,由供應商撰寫)都由將行動交給攻擊者可觸及內容決定的請求觸發——「修好我的問題」、「檢查記錄」、「查看錯誤並修復」——這正是本文量測為對提示層與篩選器防禦更容易遭注入的規格不足案例。此外,該文的代理程式自我利用技術,是人工執行 AutoDojo 黑箱自適應迴圈的例子:兩個彼此隔離且關閉記憶的 Cursor 工作階段,將目標工作階段的拒絕回覆提供給輔助工作階段,由它改寫有效負載;作者稱之為由拒絕訊號驅動的最佳化迴圈。這重現了本文的核心洞見——只要利用遭防禦代理程式本身的拒絕訊號,就足以提供最佳化所需的回饋——差別在於以模型而非搜尋程序擔任最佳化器;它產生了讓攻擊成功的措辭切換(祈使句 → 掃描器遙測) -
綁定而非禁止;預防而非偵測:Action-Open 與受污染記憶的殘餘風險——解答了本文關於 action-open 對策的問題:預設採用綁定;如果綁定會讓任務無法進行,就由系統引導使用者補充規格;其餘安全關鍵行動則逐項授權
開放問題#
- AutoDojo 是最弱的真實自適應攻擊者(黑箱、六次迭代、二元訊號)。作者指出,每個面向——更豐富的回饋(軌跡、token 機率)、非語意的表面技巧,或改寫成符合使用者合理意圖的有效負載——都會顯著增強攻擊,因此報告的 ASR 是下限。若將有效負載改寫成看似與任務相關的行動(自然的逃避行動限制途徑),系統層級防禦還能守住多久?
- 能否將經梯度最佳化的(白箱)注入作為種子放進迴圈,再由 LLM 搜尋進一步調整——結合白箱攻擊力與黑箱自適應能力?作者指出這點值得探討,但尚未測試。
- 任務規格這個面向是在三組套件中的 6 項 action-open 任務上測量。action-open 遠高於指定任務的排序(以及系統層級反轉)能否在更大規模和更強的代理程式上成立?「任務中 action-open 的比例」能否作為每次部署可用的風險指標?
已解決問題#
- 如果 action-open 任務容易遭注入,而且也是非專家使用者日常使用的預設方式,實際對策是否該禁止 action-open 委派(強制使用者說明要執行的行動),把安全負擔推回任務規格——也就是未知資訊引導基於品質考量所要求的同一套規範?已回答:綁定而非禁止;預防而非偵測:Action-Open 與受污染記憶的殘餘風險——不。禁止會在使用者這一端增加阻力,卻偏偏把負擔加在能力最不足的一方身上,也會犧牲代理程式之所以存在的委派價值;而且這並非必要,因為本文自己的反轉結果已顯示,規格不足會讓行動綁定防禦面對最佳情況(未指定行動 → 保守的行動軌跡 → 無論注入如何措辭都會封鎖寫入)——危險的設定是「action-open 加上只有篩選器」,而不是「action-open 加上使用者」。依序採取的對策是:預設綁定;當綁定妨礙真正開放的任務時,由系統引導使用者補充規格(在採取行動前先釐清——也就是未知資訊引導所建議的做法,因此安全與品質能共同促成同一套規範);其餘安全關鍵行動則採逐項授權(該管道在受保護行動上的量測效力為 100%)。負擔應落在系統結構上,永遠不該落在使用者的措辭上。
資料來源#
- AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents — Ma、Li、Xiao、Yu、Zhang 與 Vorobeychik(WUSTL / Texas A&M / Johns Hopkins),arXiv 2606.15057,2026 年 6 月,
empirical。§3(黑箱威脅模型)、§4(最佳化迴圈:排行榜/診斷/生成;演化搜尋解讀;種子與策略的整合)、§5.1(設定:5 個模型、9 種防禦、3 組套件、389 個案例;Gemini 3.1 Pro 最佳化器、6 次迭代)、§5.2 發現 1(表 2 匯總 ASR、表 3 GPT-4o-mini 攻擊消融、圖 1 靜態攻擊至 AutoDojo 的恢復情況、圖 3 案例研究)、§5.3 發現 2(表 4–5、action-open 與指定任務類別、系統層級反轉)、§6(低於靜態分數的原因是設計使然;AutoDojo 在自適應攻擊中的位置;偵測器是否能強化)。依照圖表兩階段規則檢視圖 1 和圖 3,以交叉核對列資料被打散的結果表格。 - GhostJacking Attacks: Half of the Fortune 500 Run These Tools. Getting Blocked by the Firewall Was the Way to Take Over Their AI Agents — Sternberg、Poran 與 Bobrov(Tenet Threat Labs),GhostJacking Attacks,2026-08-09,DEF CON 34 Main Track,
case-study(由供應商撰寫,文中處理 COI)。本文僅引用其 action-open 觸發請求,以及雙工作階段、由拒絕訊號驅動的最佳化迴圈。完整討論見可觀測性管線投毒
Cited by 17
- Can Models Learn to Separate Instructions from Data? Durable Property vs Training Gap×6
Capable models resist even undefended. AutoDojo (Ma et al. 2026) measures static injection with no…
- Capability Gating Is Not Authorization×5
Task-aligned framing — presenting the same dangerous action as required to complete the user's task…
- Out-of-Band Prompt-Injection Defense×5
Does the ~6× reduction and the "held under adaptive attack" result survive on a strong agent with a…
- Bind, Don't Forbid; Prevent, Don't Detect: The Action-Open and Poisoned-Memory Residuals×4
The honest residual is utility, and it dictates the rest of the prescription. Binding costs task…
- Agentic Prompt Injection×3
autodojo adaptive attacks ipi defenses — Ma et al., arXiv 2606.15057, empirical; a cheap black-box…
- Memory and Context Poisoning×3
Non-adaptive by the authors' own admission. AM-Sentry was evaluated only against attackers unaware…
- Observability-Pipeline Poisoning×3
Task Specification Injection Surface — the trigger in all three chains is an action-open
- Does 'Impossible, Not Tedious' Kill Defense-in-Depth? Layered Friction, Agent-Relativity, and the Frequency Paradox×2
Homogeneous friction stacks collapse jointly. Nasr et al. drove twelve published in-band defenses…
- MCP Tool Poisoning×2
Vendor-COI caveat. Tenet Security sells AI-agent runtime security (open-sources "agent-jackstop",…
- Zero Trust for AI Agents×2
Task Specification Injection Surface — a user–agent boundary entry in the map above, and the one…
- Agent Data Injection (ADI)
Task Specification Injection Surface — sibling attack paper (AutoDojo, Ma et al. 2026): both show…
- Impossible, Not Tedious (Design Test)
Task Specification Injection Surface — the injection-defense instance measured directly: a content…
- Least Agency
Task Specification Injection Surface — least agency as the winning answer: AutoDojo (Ma et al.…
- Agent Security
Task Specification Injection Surface — AutoDojo (Ma et al., arXiv 2606.15057): a cheap black-box…
- Open Questions Dashboard
Agentic Prompt Injection: Spotlighting and constitutional classifiers each leave a residual (2%,…
- Open Questions Backlog
Task Specification Injection Surface ×3 (oldest 81d) — AutoDojo is the weakest realistic adaptive…
- Unknowns as the Agentic Bottleneck
Task Specification Injection Surface — under-specification cuts both ways: the "action-open / defer…
Related articles
- Agent Data Injection (ADI)
A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…
- Out-of-Band Prompt-Injection Defense
Second-generation prompt-injection defense enforced outside the model: a deterministic reference monitor mediates tool…
- Agentic Prompt Injection
Direct and indirect injection of malicious instructions into an agent; LLMs cannot reliably distinguish information fro…
- Capability Gating Is Not Authorization
Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…
- Impossible, Not Tedious (Design Test)
Zero Trust design test for agentic security: does a control make the attack impossible, or just tedious? Friction-only…
