H
Howardism
Plate IIAgent Security機器翻譯 · machine-translatedENHOWARDISM

模型能學會區分指令與資料嗎?持久特性與訓練落差

在真正重要的層面上具有持久性:指令/資料邊界可以逐個分隔符訓練(強化可將指令注入成功率降至約 0%),但無法普遍解決——每封住一道邊界,攻擊就會轉移到下一道更細的邊界(指令→資料,接著是可信→不可信資料),因為根本原因是 LLM 對不精確結構分隔符的機率式解讀,這是架構上的事實。較新的模型降低了每道邊界的成功率,卻始終無法實現乾淨的區隔;部分改善來自對基準測試的熟悉,而非經測量的自適應穩健性——因此,整個研究群體一貫的建議,是在模型之外以確定性的動作/資料閘門強制執行邊界

Article metadata
Publication details
Published:July 16, 2026
Filed:Essay
Domain:Agent Security
Tags:DerivedSecurityPrompt InjectionTrust BoundaryAdaptive Evaluation
Reading:11 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

「模型能學會區分指令與資料嗎?持久特性與訓練落差」插圖

資料來源#

簡答#

在真正重要的層面上具有持久性。 任何單一道邊界看起來都能透過訓練改善——模型強化能將經典指令注入的成功率降至約 0%,即使面對最先進的代理程式防禦也一樣(Agent Data Injection (ADI))。但封住一道邊界,只會把攻擊轉移到下一道更細的邊界,因為根本原因並非模型能學會的某條規則缺漏,而是 LLM 對不精確結構分隔符的機率式解讀,這是架構上的特性(Agent Data Injection (ADI))。因此,坦誠的結論必須一分為二:

  • 整體而言,這種區隔是持久的架構特性。 再多提示或微調,也無法可靠地建立可用的指令↔資料區隔(Out-of-Band Prompt-Injection Defense,引述 Zverev et al. 2025);而且有明確證據顯示,一旦訓練封住指令/資料邊界,資料內部的偽造(可信↔不可信)就能直接穿過同一批經過強化的模型,成功率達 22–50%(Agent Data Injection (ADI))。
  • 個別邊界上的易受攻擊程度,是部分受能力影響的訓練落差。 較新、能力更強的基礎模型,即使沒有任何防禦,也能抵擋靜態注入(Claude-Haiku-4.5 為 0.3%,GPT-5.4-mini 為 6.9%);較舊的模型則完全失守(GPT-4o-mini 為 58.6%)(Task-Specification Effects in Prompt Injection (AutoDojo))。能力提升會降低針對特定分隔符的攻擊成功率,但在自適應攻擊者面前,成功率始終無法乾淨地歸零;而且表面上的改善有一部分來自對基準測試的熟悉,並非經測量的穩健性。

這兩項事實並不矛盾,合在一起便回答了這個問題:能力會縮小每道邊界上的漏洞,卻不會消除讓攻擊者持續鑿出新漏洞的機制。 因此,整個帶外防禦研究脈絡不再試圖在模型內部修復問題,而是在模型外部以確定性方式強制執行邊界。這套框架將「LLM 無法可靠地區分資訊與指令」視為持久且根本的結構特性(Agentic Prompt Injection、Zero Trust for AI Agents)——2026 年的證據支持這種看法,也更清楚指出背後原因。

證據整理#

1. 邊界可以逐個分隔符訓練(「訓練落差」面向)#

兩項獨立證據顯示,指令↔資料邊界確實會受到模型訓練影響:

  • 強化訓練能封住指令注入。 即使面對同一批最先進的代理程式防禦,經典指令注入(將攻擊者文字視為命令)的 ASR 也只有 0.0–0.7%——在指令/資料區隔方面強化模型,正是「指令注入成功率約為 0% 的確切原因」(Agent Data Injection (ADI),§5)。
  • 能力較強的模型即使沒有防禦也能抵擋。 AutoDojo (Ma et al. 2026) 測量的是完全沒有任何防禦時的靜態注入:Claude-Haiku-4.5 為 0.3%,GPT-5.4-mini 為 6.9%,相較之下,GPT-4o-mini 為 58.6%,Gemini-2.5-Flash 為 47.8%。較新的模型不費吹灰之力,就能在靜態測試中取得近乎完美的分數。這是最有力的單一數據,證明能力提升能降低模型在固定邊界上的易受攻擊程度。

如果故事到此為止,那麼「未來的模型會把問題解決」就說得通。

2. 封住一道邊界只會轉移攻擊,並不會消除攻擊(「持久特性」面向)#

ADI (Choi et al. 2026) 是關鍵研究結果:即使是那些能把指令注入成功率降到約 0% 的同一批強化模型,面對 Agent Data Injection 仍有 22–50% 的易受攻擊率。這類攻擊偽造的是可信資料(留言的作者/角色、電子郵件的 sender、UI 元素 ID、工具呼叫歷史),而非指令。代理程式仍然完成使用者的任務——但依據的是攻擊者偽造的資料。已成功且負責任地揭露的攻擊案例包括:在 Claude Code / Codex / Gemini CLI 上執行 RCE(偽造維護者來源)、在 Chrome 中任意點擊 Claude(重用元素 ID),以及利用偽造工具呼叫歷史進行的供應鏈合併(Agent Data Injection (ADI),§4)。

這種機制說明了為什麼能力提升無法徹底消除問題。經典分隔符攻擊(SQLi、XSS)需要完全精確的分隔符,因為目標是確定性的解析器。LLM 則以機率方式解讀結構,因此即使是不精確、無法通過解析器驗證的分隔符也能奏效——JSON 解析器會保留為一般文字的跳脫字元 \",仍可能被機率式地解讀為結構性引號(Agent Data Injection (ADI),§3)。你可以訓練模型遵守某個分隔符,卻無法透過訓練普遍消除它對不精確分隔符的機率式誤讀。因此,邊界階層——指令/資料,接著是可信/不可信資料,之後想必還有更細的邊界——無論攻擊者下一步仿冒哪個層級,都仍會存在漏洞。

可解釋性研究從模型內部得出的結論,與此出自同一個根本事實:The Assistant Persona in the Workspace 指出,模型「也無法區分可信與不可信資料,因為這兩種邊界都只是由模型以機率方式解讀的分隔符」——安全研究與機制研究殊途同歸,都指向同一項架構主張。

3. 提示與微調都無法建立可用的區隔#

Narisetty et al. (2026) 引述 Zverev et al. (2025),直接指出這項持久特性:目前的模型無法維持可用的指令/資料區隔,提示與微調都無法可靠地建立這種區隔。這正是第二代防禦「放棄依賴模型,改在模型外部執行控管」的原因——這是結構上的主張,而非悲觀情緒。在使用工具的代理程式中,注入是「授權問題,而非內容問題——造成損害的不是一句糟糕的話,而是一個動作。」

4. 能力提升帶來的改善也有一部分只是表象#

那項看起來像是「模型正在解決問題」的數據,也有同一篇論文提出的但書。AutoDojo 警告,近期模型在靜態測試中的低 ASR「測量的是對固定基準測試的熟悉程度,而非對注入攻擊的穩健性」——important_instructions 字串自 AgentDojo 發布以來便已公開,因此很可能已進入訓練資料(Task-Specification Effects in Prompt Injection (AutoDojo))。AutoDojo 新提出的黑箱自適應注入「能達到熟悉的靜態字串無法達到的程度」,即便結果仍只有個位數也一樣(Claude-Haiku-4.5 從 0.3% 升至 1.8%,GPT-5.4-mini 從 6.9% 升至 8.7%)。因此,模型穩健性的改善有一部分是真實進步,另一部分是對基準測試的記憶;而攻擊者後發制人後,成功率始終無法乾淨地歸零。

5. 自適應攻擊者持續迭代,正是「下一個模型也救不了你」的原因#

能力單獨無法封住問題,最深層的原因是:針對內容的區隔會成為攻擊者持續重新最佳化的目標。AutoDojo 使用一個低成本黑箱六輪最佳化器,將原本 ASR 為 0% 的篩選器,重新推高到 28%(在 action-open 任務上達 64%)——白箱攻擊的門檻還要高得多。「靜態 ASR 為 0% 並非下限。」而且 AutoDojo 會針對任何已部署的防禦重新最佳化,因此經對抗式訓練的偵測器也只會迎來新一輪攻擊——「攻擊者永遠最後出手,因此任何針對內容的防禦能否贏得這場迭代,都是難以樂觀的問題。」這正是將「不可能,而非麻煩」套用到區隔問題上:跨越機率式邊界只是麻煩(提升能力、增加每次嘗試的成本),永遠不會變成不可能。

真正有效的解法(整個研究群體共同歸納出的建議)#

如果訓練無法讓區隔變得乾淨,就必須在能夠以確定性方式執行的位置強制邊界——也就是模型之外:

  • 將動作綁定到請求,不要篩選輸入。 動作限制型的系統層級防禦(Progent、DRIFT)在同一種低成本自適應攻擊下仍能維持效果,而篩選器則被擊垮(五個模型中,Progent 從 8.2%→7.7%,DRIFT 從 2.6%→6.4%);而且在定義不足、最容易讓篩選器漏接的「action-open」任務上,防禦效果反而會更強——因為唯讀請求的執行軌跡不會包含寫入動作,所以無論攻擊者怎麼措辭,注入的寫入操作都會被擋下(Task-Specification Effects in Prompt Injection (AutoDojo)、Least Agency)。
  • 追蹤來源,不要偵測內容。 唯一能完全阻止資料內部 ADI 攻擊的防禦,是正確追蹤資料流——CaMeL Strict 的 ASR 為 0%——但代價高昂(效用從 86.5% 降至 36.5%)(Agent Data Injection (ADI),§6)。以模型為基礎的隔離 LLM 正是分隔符攻擊能利用的漏洞(雙 LLM 為 25%),再次印證閘門不能由模型擔任。
  • 這正是 Zero Trust 的安全立場。 該框架的關鍵前提是「LLM 無法可靠地區分資訊性脈絡與可執行指令」,因此防禦必須採取結構性措施——以醒目提示/分類器構成縱深防禦,但持久的控管手段是在動作邊界設置參考監視器(Agentic Prompt Injection、Out-of-Band Prompt-Injection Defense)。

坦誠看待剩餘問題#

  • 最新模型上的更細邊界尚未經過測試。 ADI 已在 GPT-5.2 等級的代理程式上獲得驗證;前沿模型的能力是否也會降低可信/不可信資料邊界上的機率式分隔符易受攻擊程度,就像降低指令注入的易受攻擊程度一樣,目前尚未測試(Agent Data Injection (ADI) 的開放問題 3)。依據機制推測,能力會降低成功率,但不會使其歸零——然而這是預測,不是測量結果。
  • 「在真正重要的層面上具有持久性」是對機制的主張,並非證明。 這項主張建立在 ADI 將不精確分隔符的誤讀描述為架構特性之上。能推翻此主張的,會是未來在邊界以確定性(而非機率式)方式解析結構的架構,而非同類型的更大型模型。隨機數化(ChatGPT Atlas 使用不可預測的 ref_4af2b1c9,以無法猜出的分隔符為代價擊敗元素 ID 注入)暗示,真正的解法是移除可被仿冒的分隔符;這項解法屬於結構層面,而非模型擴展曲線(Agent Data Injection (ADI),§4)。

結論#

這個問題設下了錯誤的二分法。針對個別邊界而言,能力提升能部分填補訓練落差;整體而言,這是持久的架構特性,因為開啟下一道邊界的機制,會在每次模型改進後繼續存在。「等下一個模型」不是防禦手段——它降低的是數字,而不是消除機制。五份彼此獨立的 2026 年資料都認同,站得住腳的工程解法,是將模型內部的區隔視為無法達成,並在模型之外以確定性的動作/資料閘門強制執行。

資料來源#

§ end
Cited by 5
Related articles
  • Observability-Pipeline Poisoning

    The observability stack — WAF blocks, APM logs, error-tracker events — is an attacker-writable input channel that agent…

  • Zero Trust for AI Agents

    Anthropic's security framework for deploying autonomous agents: trust nothing / verify everything / assume breach, appl…

  • Agent Data Injection (ADI)

    A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…

  • Capability Gating Is Not Authorization

    Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…

  • Least Agency

    OWASP term extending least privilege to agents: constrain not just what an agent can access but what each tool can do,…