資料來源#
- Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
- Agent Data Injection Attacks are Realistic Threats to AI Agents
- AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents
- Zero Trust for AI Agents
簡答#
在真正重要的層面上具有持久性。 任何單一道邊界看起來都能透過訓練改善——模型強化能將經典指令注入的成功率降至約 0%,即使面對最先進的代理程式防禦也一樣(Agent Data Injection (ADI))。但封住一道邊界,只會把攻擊轉移到下一道更細的邊界,因為根本原因並非模型能學會的某條規則缺漏,而是 LLM 對不精確結構分隔符的機率式解讀,這是架構上的特性(Agent Data Injection (ADI))。因此,坦誠的結論必須一分為二:
- 整體而言,這種區隔是持久的架構特性。 再多提示或微調,也無法可靠地建立可用的指令↔資料區隔(Out-of-Band Prompt-Injection Defense,引述 Zverev et al. 2025);而且有明確證據顯示,一旦訓練封住指令/資料邊界,資料內部的偽造(可信↔不可信)就能直接穿過同一批經過強化的模型,成功率達 22–50%(Agent Data Injection (ADI))。
- 個別邊界上的易受攻擊程度,是部分受能力影響的訓練落差。 較新、能力更強的基礎模型,即使沒有任何防禦,也能抵擋靜態注入(Claude-Haiku-4.5 為 0.3%,GPT-5.4-mini 為 6.9%);較舊的模型則完全失守(GPT-4o-mini 為 58.6%)(Task-Specification Effects in Prompt Injection (AutoDojo))。能力提升會降低針對特定分隔符的攻擊成功率,但在自適應攻擊者面前,成功率始終無法乾淨地歸零;而且表面上的改善有一部分來自對基準測試的熟悉,並非經測量的穩健性。
這兩項事實並不矛盾,合在一起便回答了這個問題:能力會縮小每道邊界上的漏洞,卻不會消除讓攻擊者持續鑿出新漏洞的機制。 因此,整個帶外防禦研究脈絡不再試圖在模型內部修復問題,而是在模型外部以確定性方式強制執行邊界。這套框架將「LLM 無法可靠地區分資訊與指令」視為持久且根本的結構特性(Agentic Prompt Injection、Zero Trust for AI Agents)——2026 年的證據支持這種看法,也更清楚指出背後原因。
證據整理#
1. 邊界可以逐個分隔符訓練(「訓練落差」面向)#
兩項獨立證據顯示,指令↔資料邊界確實會受到模型訓練影響:
- 強化訓練能封住指令注入。 即使面對同一批最先進的代理程式防禦,經典指令注入(將攻擊者文字視為命令)的 ASR 也只有 0.0–0.7%——在指令/資料區隔方面強化模型,正是「指令注入成功率約為 0% 的確切原因」(Agent Data Injection (ADI),§5)。
- 能力較強的模型即使沒有防禦也能抵擋。 AutoDojo (Ma et al. 2026) 測量的是完全沒有任何防禦時的靜態注入:Claude-Haiku-4.5 為 0.3%,GPT-5.4-mini 為 6.9%,相較之下,GPT-4o-mini 為 58.6%,Gemini-2.5-Flash 為 47.8%。較新的模型不費吹灰之力,就能在靜態測試中取得近乎完美的分數。這是最有力的單一數據,證明能力提升能降低模型在固定邊界上的易受攻擊程度。
如果故事到此為止,那麼「未來的模型會把問題解決」就說得通。
2. 封住一道邊界只會轉移攻擊,並不會消除攻擊(「持久特性」面向)#
ADI (Choi et al. 2026) 是關鍵研究結果:即使是那些能把指令注入成功率降到約 0% 的同一批強化模型,面對 Agent Data Injection 仍有 22–50% 的易受攻擊率。這類攻擊偽造的是可信資料(留言的作者/角色、電子郵件的 sender、UI 元素 ID、工具呼叫歷史),而非指令。代理程式仍然完成使用者的任務——但依據的是攻擊者偽造的資料。已成功且負責任地揭露的攻擊案例包括:在 Claude Code / Codex / Gemini CLI 上執行 RCE(偽造維護者來源)、在 Chrome 中任意點擊 Claude(重用元素 ID),以及利用偽造工具呼叫歷史進行的供應鏈合併(Agent Data Injection (ADI),§4)。
這種機制說明了為什麼能力提升無法徹底消除問題。經典分隔符攻擊(SQLi、XSS)需要完全精確的分隔符,因為目標是確定性的解析器。LLM 則以機率方式解讀結構,因此即使是不精確、無法通過解析器驗證的分隔符也能奏效——JSON 解析器會保留為一般文字的跳脫字元 \",仍可能被機率式地解讀為結構性引號(Agent Data Injection (ADI),§3)。你可以訓練模型遵守某個分隔符,卻無法透過訓練普遍消除它對不精確分隔符的機率式誤讀。因此,邊界階層——指令/資料,接著是可信/不可信資料,之後想必還有更細的邊界——無論攻擊者下一步仿冒哪個層級,都仍會存在漏洞。
可解釋性研究從模型內部得出的結論,與此出自同一個根本事實:The Assistant Persona in the Workspace 指出,模型「也無法區分可信與不可信資料,因為這兩種邊界都只是由模型以機率方式解讀的分隔符」——安全研究與機制研究殊途同歸,都指向同一項架構主張。
3. 提示與微調都無法建立可用的區隔#
Narisetty et al. (2026) 引述 Zverev et al. (2025),直接指出這項持久特性:目前的模型無法維持可用的指令/資料區隔,提示與微調都無法可靠地建立這種區隔。這正是第二代防禦「放棄依賴模型,改在模型外部執行控管」的原因——這是結構上的主張,而非悲觀情緒。在使用工具的代理程式中,注入是「授權問題,而非內容問題——造成損害的不是一句糟糕的話,而是一個動作。」
4. 能力提升帶來的改善也有一部分只是表象#
那項看起來像是「模型正在解決問題」的數據,也有同一篇論文提出的但書。AutoDojo 警告,近期模型在靜態測試中的低 ASR「測量的是對固定基準測試的熟悉程度,而非對注入攻擊的穩健性」——important_instructions 字串自 AgentDojo 發布以來便已公開,因此很可能已進入訓練資料(Task-Specification Effects in Prompt Injection (AutoDojo))。AutoDojo 新提出的黑箱自適應注入「能達到熟悉的靜態字串無法達到的程度」,即便結果仍只有個位數也一樣(Claude-Haiku-4.5 從 0.3% 升至 1.8%,GPT-5.4-mini 從 6.9% 升至 8.7%)。因此,模型穩健性的改善有一部分是真實進步,另一部分是對基準測試的記憶;而攻擊者後發制人後,成功率始終無法乾淨地歸零。
5. 自適應攻擊者持續迭代,正是「下一個模型也救不了你」的原因#
能力單獨無法封住問題,最深層的原因是:針對內容的區隔會成為攻擊者持續重新最佳化的目標。AutoDojo 使用一個低成本黑箱六輪最佳化器,將原本 ASR 為 0% 的篩選器,重新推高到 28%(在 action-open 任務上達 64%)——白箱攻擊的門檻還要高得多。「靜態 ASR 為 0% 並非下限。」而且 AutoDojo 會針對任何已部署的防禦重新最佳化,因此經對抗式訓練的偵測器也只會迎來新一輪攻擊——「攻擊者永遠最後出手,因此任何針對內容的防禦能否贏得這場迭代,都是難以樂觀的問題。」這正是將「不可能,而非麻煩」套用到區隔問題上:跨越機率式邊界只是麻煩(提升能力、增加每次嘗試的成本),永遠不會變成不可能。
真正有效的解法(整個研究群體共同歸納出的建議)#
如果訓練無法讓區隔變得乾淨,就必須在能夠以確定性方式執行的位置強制邊界——也就是模型之外:
- 將動作綁定到請求,不要篩選輸入。 動作限制型的系統層級防禦(Progent、DRIFT)在同一種低成本自適應攻擊下仍能維持效果,而篩選器則被擊垮(五個模型中,Progent 從 8.2%→7.7%,DRIFT 從 2.6%→6.4%);而且在定義不足、最容易讓篩選器漏接的「action-open」任務上,防禦效果反而會更強——因為唯讀請求的執行軌跡不會包含寫入動作,所以無論攻擊者怎麼措辭,注入的寫入操作都會被擋下(Task-Specification Effects in Prompt Injection (AutoDojo)、Least Agency)。
- 追蹤來源,不要偵測內容。 唯一能完全阻止資料內部 ADI 攻擊的防禦,是正確追蹤資料流——CaMeL Strict 的 ASR 為 0%——但代價高昂(效用從 86.5% 降至 36.5%)(Agent Data Injection (ADI),§6)。以模型為基礎的隔離 LLM 正是分隔符攻擊能利用的漏洞(雙 LLM 為 25%),再次印證閘門不能由模型擔任。
- 這正是 Zero Trust 的安全立場。 該框架的關鍵前提是「LLM 無法可靠地區分資訊性脈絡與可執行指令」,因此防禦必須採取結構性措施——以醒目提示/分類器構成縱深防禦,但持久的控管手段是在動作邊界設置參考監視器(Agentic Prompt Injection、Out-of-Band Prompt-Injection Defense)。
坦誠看待剩餘問題#
- 最新模型上的更細邊界尚未經過測試。 ADI 已在 GPT-5.2 等級的代理程式上獲得驗證;前沿模型的能力是否也會降低可信/不可信資料邊界上的機率式分隔符易受攻擊程度,就像降低指令注入的易受攻擊程度一樣,目前尚未測試(Agent Data Injection (ADI) 的開放問題 3)。依據機制推測,能力會降低成功率,但不會使其歸零——然而這是預測,不是測量結果。
- 「在真正重要的層面上具有持久性」是對機制的主張,並非證明。 這項主張建立在 ADI 將不精確分隔符的誤讀描述為架構特性之上。能推翻此主張的,會是未來在邊界以確定性(而非機率式)方式解析結構的架構,而非同類型的更大型模型。隨機數化(ChatGPT Atlas 使用不可預測的
ref_4af2b1c9,以無法猜出的分隔符為代價擊敗元素 ID 注入)暗示,真正的解法是移除可被仿冒的分隔符;這項解法屬於結構層面,而非模型擴展曲線(Agent Data Injection (ADI),§4)。
結論#
這個問題設下了錯誤的二分法。針對個別邊界而言,能力提升能部分填補訓練落差;整體而言,這是持久的架構特性,因為開啟下一道邊界的機制,會在每次模型改進後繼續存在。「等下一個模型」不是防禦手段——它降低的是數字,而不是消除機制。五份彼此獨立的 2026 年資料都認同,站得住腳的工程解法,是將模型內部的區隔視為無法達成,並在模型之外以確定性的動作/資料閘門強制執行。
資料來源#
- Agentic Prompt Injection — 本文要解答的持久特性開放問題;以 Zero Trust 架構表述「LLM 無法可靠地區分資訊與指令」
- Agent Data Injection (ADI) — 關鍵研究結果:強化模型(指令注入成功率約 0%)仍有 22–50% 的機率遭可信資料偽造攻擊;以機率式分隔符注入作為架構機制
- Out-of-Band Prompt-Injection Defense — Zverev et al.(提示與微調都無法建立可用的區隔);「在模型外部強制執行」的建議
- Task-Specification Effects in Prompt Injection (AutoDojo) — 各模型在沒有防禦時的靜態 ASR(能力影響);對基準測試熟悉度的但書;低成本自適應攻擊迴圈;系統層級防禦在 action-open 任務上仍有效且效果反轉
- The Assistant Persona in the Workspace — 機制上的交會:模型無法乾淨區分可信與不可信資料,因為兩者都是由模型以機率方式解讀的分隔符
- Agent Data Injection Attacks are Realistic Threats to AI Agents — Choi et al., arXiv 2607.05120
- Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents — Narisetty et al., arXiv 2606.26479
- AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents — Ma et al., arXiv 2606.15057
- Zero Trust for AI Agents — Anthropic Zero Trust 電子書,第二/四部分
Cited by 5
- Agent Data Injection (ADI)×2
Instruction Data Separation Durable Or Trainable — the filed synthesis this paper anchors: ADI's…
- Agentic Prompt Injection×2
Instruction Data Separation Durable Or Trainable — the filed synthesis of this page's central open…
- Agent Security
Instruction Data Separation Durable Or Trainable — Durable at the level that matters: the…
- Open Questions Backlog
Agent Data Injection: ADI was demonstrated on GPT-5.2-class agents. Does frontier model improvement…
- Self-Propagating Prompt Injection (AI Worms)
The second one is the sharper data point for this wiki. Microsoft's second remediation was the…
Related articles
- Observability-Pipeline Poisoning
The observability stack — WAF blocks, APM logs, error-tracker events — is an attacker-writable input channel that agent…
- Zero Trust for AI Agents
Anthropic's security framework for deploying autonomous agents: trust nothing / verify everything / assume breach, appl…
- Agent Data Injection (ADI)
A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…
- Capability Gating Is Not Authorization
Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…
- Least Agency
OWASP term extending least privilege to agents: constrain not just what an agent can access but what each tool can do,…
