H
Howardism
Plate IIAgent Security機器翻譯 · machine-translatedENHOWARDISM

以成功寫入為條件的記憶中毒數據

將記憶中毒語料中的每一項階段級攻擊與防禦數據,重新表述為在成功寫入條件下的端到端成功率。核心論點成立:在條件化後,回憶階段篩掉 9.6 個百分點,採納階段則篩掉 29.4 個百分點(MemSecBench);最強攻擊會將 96.5% 的寫入和 77.9% 的檢索轉化為端到端成功。不過,語料中的高檢索率是低成本攻擊得手後的倖存結果,並非沒有成本的階段——GhostWriter 自己未經最佳化的控制組,雖然注入率也約為 98%,啟動率卻只有 0–16.7%。在寫入後控制措施中,防禦排名仍成立,但在寫入邊界上兩度翻轉:專用 GPT-5.4 偵測器從文字檢查組中並列最佳(51–57% AUR),跌至倒數第二(條件化後 81–92%),因為它的效果有 11–14 個百分點來自阻擋寫入,而非抑制使用;而在 MemSecBench 中,Mem0 搭配 Hermes/MiniMax 的 E2E-ASR 看來差了 13.9 個百分點,但 MESR 反而好 2.8 個百分點(Spearman 0.702,涵蓋全部 24 組設定,排名最多移動 15.5 名;2026-09-02、當時解析出的 18 列:0.785 和 7)。只有 MemSecBench 提供真正逐案例計算的條件率;其他地方只有邊際率,沒有聯合列聯表。語料中也沒有任何防禦措施同時測量效用,唯一例外的那組設定,在檢索最佳化時會讓證據召回率降至 0.00%。

Article metadata
Publication details
Published:September 2, 2026
Filed:Essay
Domain:Agent Security
Tags:DerivedSecurityMemoryMetrics
Reading:26 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

以成功寫入為條件的記憶中毒數據插圖

資料來源#

問題#

Memory and Context Poisoning 中的 #oq/now 項目:

語料是否過度解讀檢索階段的成功率?在 PipePoison 的 12 組設定網格中,全部七種攻擊的排序都毫無例外地是 AUR < WSR < RSR@5;而記憶中毒論文報告的最大單一數字幾乎總是檢索率——GhostWriter 約 94%、MemSecBench 的召回率 76.1%、本文的 94.2%。如果檢索在結構上就是容易的階段,那麼以抑制檢索來評估的防禦,就是在最不重要的階段接受評分。這個主張可以證偽,而且用已公開的測試工具驗證成本很低:把此語料中每項檢索階段防禦結果重新報告為條件量——在成功寫入的條件下,端到端成功率是多少——再檢查重新表述後防禦排名是否仍成立。

簡短回答#

  1. 前提成立,而條件化後更加明確。 在唯一真正逐案例報告條件率的來源中,回憶階段篩掉 9.6 個百分點,採納階段則篩掉 29.4 個百分點(MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair)。最強攻擊能將 96.5% 的寫入和 77.9% 的檢索轉化為端到端成功(Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents)。
  2. 但檢索成本低,不代表沒有成本。 GhostWriter 自己的控制組——相同代理程式、相同約 98% 的注入率,以及一個從未針對後續查詢最佳化的 AgentDojo 載荷——啟動率只有 0–16.7%,「原因是檢索率低」(When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents)。語料中 94% 的檢索率,是每個標題攻擊都成功買下這項結果後留下的倖存者,而不是某個毫無成本的階段。
  3. 寫入後控制措施的防禦排名仍成立,但在寫入邊界上兩度翻轉。 PipePoison 的專用 GPT-5.4 記憶操弄偵測器,從文字檢查組中並列最佳的一階(51–57% AUR)降至 倒數第二(條件化後 81–92%),因為它表面效果中有 11–14 個百分點來自阻擋寫入。在 MemSecBench 中,Hermes/MiniMax-M3 下的 Mem0,E2E-ASR 看來差 13.9 個百分點,MESR 卻好 2.8 個百分點——排名完全反轉;找回 Mem0-Graph 列後,這種反轉共有三例:在 Hermes/MiniMax-M3 下,所有非 Native 後端的端到端結果看起來都更差,但條件率都更好(全部 24 組設定的 Spearman 0.702,排名最多移動 15.5 名;2026-09-02、18 列時為 0.785 和 7)。
  4. 最明顯的反轉發生在唯一有測量效用軸的實驗組。 Karunanidhi 修正後的信任權重,是語料中檢索抑制分數最佳的設定(毒化項目排名第一的比率:100% → 2%,在語料 M 為 0%),但會讓語料 N 的證據召回率降至 0.00%。檢索最佳化帶來災難性效用,而語料中沒有其他研究測量這一組合。
  5. 語料無法回答的地方。 只有 MemSecBench 提供逐案例聯結。本文其他所有條件率都是邊際率相除;其中兩項還依賴論文未曾說明的假設;AM-Sentry 的三個寫入政策層級完全沒有端到端測量;而 Bad Memory 的基礎架構沒有可供條件化的檢索階段。

重新表述的規則,以及適用條件#

所求的量是 P(end-to-end | write succeeded)。只有在端到端事件包含於寫入事件之中時,這才是有效的條件率。PipePoison 明確支持這種解讀:「使用成功……要求攻擊相關資訊在寫入後留存、在後續查詢時被檢索,並被代理程式使用」(第 2.2 節);若寫入器沒有產生記憶,它也會將檢索分數設為 0。因此 AUR 同時包含在 WSR 和 RSR@5 之內,AUR/WSR 與 AUR/RSR@5 都是條件率。

以下每個數字都伴隨三項注意事項。

  • 率的比值,而非聯結資料。 PipePoison、GhostWriter 和 Karunanidhi 都只報告各實驗組的邊際率。只有在逐案例事件不受設定影響時,兩者相除才會精確得到條件率;在 12 組穩定設定下,這個近似相當好,但仍只是近似。MemSecBench 是語料中唯一逐案例計算條件率的來源——MESR = Σwe / Σw——因此它是本文最關鍵的證據。
  • RSR@5 是超集合事件,而非鏈中的一個階段。 PipePoison 以寫入器產生的最佳記憶評分檢索,「不論惡意載荷是否完整保留」(第 3.2 節)。即使記憶攜帶的載荷已劣化,也可能被檢索到。因此按定義,RSR@5 系統性地高於 WSR;問題所注意到的 AUR < WSR < RSR@5 排序,有一部分是定義造成的假象——這本身就說明不應再把檢索率當作標題數據。
  • 讀取圖表。 PipePoison 的防禦結果位於圖 11 和圖 12,而不是表格。Non-Malleable Memory Authority (TMA-NM) 頁面已透過 pdftotext -layout 找回圖 12 的資料標籤。圖 11 沒有資料標籤,因此下列各設定數值是從 400-dpi 圖像上以像素量測而得,並以未防禦列校準;該列與表 9 的 η=0.7 數值完全一致(S1–S4 的 WSR 為 76/68/77/72,AUR 為 73/67/67/69)。可視為 ±1–2 個百分點;各自的範圍也符合論文文字所述(「Llama Guard……59%–63%」、「51%–57%」、「53%–61%」)。

1. 七種攻擊的重新表述(PipePoison,表 1,12 組配對設定)#

12 組設定網格的平均值。AUR|write 是從另一端表述論文自己的讀法——論文談到 MINJA 時說「RSR@5 為 87.6%,AUR 卻只有 48.2%」,表達的是同一件事。

攻擊WSRRSR@5AUR寫入成功條件下的 AUR檢索成功條件下的 AUR
PipePoison76.1%94.2%73.4%96.5%77.9%
Sleeper40.6%80.5%35.7%87.9%44.3%
MemMorph63.0%85.8%54.3%86.2%63.3%
MINJA58.3%87.6%48.2%82.7%55.0%
Zombie23.1%61.4%18.7%81.0%30.5%
GhostWriter(重新實作)41.8%75.8%32.0%76.6%42.2%
ER-MIA38.0%71.2%29.0%76.3%40.7%

邊際率表格掩蓋了兩件事。

  • 攻擊之間的差異在寫入階段;寫入後的流程則彼此相似。 WSR 範圍為 23.1–76.1(相差 3.3 倍);AUR|write 範圍為 76.3–96.5(相差 1.26 倍)。PipePoison 的 AUR 優勢為 19.1 個百分點,其中 13.1 個百分點來自額外的寫入,另有 9–20 個百分點來自轉換率提升——論文自己的總結「它取得的寫入能挺過其餘流程」,正是對結果的條件式描述。
  • AUR|retrieval 是從攻擊方角度測得的採納關卡,與 MemSecBench 結果一致。 PipePoison 將 77.9% 的檢索轉化為端到端成功;MemSecBench 的宏觀流程鏈為 P(adopt ∧ externalize | recall) = 50.3/76.1 = 66.1%。兩個彼此無關的基準測試,測試工具和指標都不同,但使用關卡落在相同的 66–78% 區間。這才是防禦措施應該努力降低的數字,而語料中的各個階段都沒有直接針對它。

2. 八種防禦的重新表述——排名結果#

PipePoison 的防禦階梯從頭到尾都不受防禦措施影響(毒化內容在未防禦的影子環境中最佳化,提交時不做修改)。邊際 AUR 取自論文文字及 Non-Malleable Memory Authority (TMA-NM) 對圖 12 的資料還原;各防禦的 WSR 則從圖 11(a) 讀取。

防禦層級WSR(S1–S4)邊際 AUR寫入成功條件下的 AUR排名變化
衝突解決記憶管理不變(76/68/77/72)41–48%55–63%1 → 1
來源標記記憶管理不變51–56%67–76%3 → 2
A-MemGuard系統約略不變(77/69/76/71)51–57%72–78%3 → 3
安全感知系統提示系統約略不變(74/67/75/73)53–61%73–82%5 → 4
專用 GPT-5.4 偵測器工具輸出62/57/64/6151–57%81–92%3 → 5
Llama Guard工具輸出71/63/71/6559–63%87–95%6 → 6
PPL 篩選器工具輸出75/69/77/7067–73%(「效果有限」)88–97%7 → 7
(未防禦)—76/68/77/7267–73%87–99%—

時間戳感知檢索只以範圍報告(無關項目 57–66%/語意相關項目 49–59%),因此其條件率約為 79–97% 和 68–87%,無法逐設定排名。

五項寫入後階段的排名仍成立,但工具輸出篩選器的排名則會改變。 衝突解決在兩種尺度上都是最佳,條件化後領先幅度還更大(55–63%,下一項為 67–76%)——這與 Non-Malleable Memory Authority (TMA-NM) 的解讀一致:以記憶庫中的其餘內容作為依據,比檢查記憶文字更有效。改變的是專用偵測器:以邊際率來看,它是三項最佳階段之一,也是論文中最強的文字檢查結果;但在已成功通過偵測器的寫入條件下,它仍留下 81–92% AUR,幾乎與未防禦時的條件率相同,也比所有系統層級和記憶管理階段都差。它全部的貢獻就是拒絕 11–14 個百分點的寫入。這確實是一種控制措施,但它是寫入准入控制,卻和使用控制一起放在同一欄;因此 Out-of-Band Prompt-Injection Defense 上的八階防禦階梯,實際上混用了兩種尺度。

一般化來說:存入記憶庫之前的記憶防禦,評估的是語料已顯示對攻擊者最困難的階段;存入記憶庫之後的防禦,評估的則是語料顯示幾乎不費力的階段。把兩者放在同一欄,讀起來像是在比較同一件事,實際上並非如此。

3. MemSecBench:語料中唯一真正的條件率,以及排名反轉#

MESR = Σwe/Σw 正是問題所問的數值,而且是逐案例計算。宏觀平均為 59.6%(摘要;圖 4 流程鏈為 50.3/84.2 = 59.7%,24 列校正後表 2 的未加權宏觀平均為 59.56%——三者一致)。

根據宏觀平均,將生命週期流程鏈 W1 91.1 → W2 84.2 → E1 76.1 → E2 53.7 → E2E 50.3 重新表述為條件率:

轉換條件通過率篩掉的百分點
寫入後持續存在92.4%7.6
毒化後成功回憶90.4%9.6
回憶後採納70.6%29.4
採納後外化93.7%6.3

這清楚證實了問題的前提。 維基頁面反覆引用的「76.1% 回憶率」是累積率;作為單一階段,它的通過率是 90.4%,而採納階段篩掉的比率約為三倍。論文自己所用的「採納關卡」表述,才是條件式描述;維基頁面一直引用的是累積率。

後端排名無法完整維持;在完整網格中的維持程度更低。 以下使用全部 24 組設定,資料來自 2026-09-05 對 MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair 的 docling 2.126 重新解析,並逐格與 PDF 第 6 頁核對——這次重新解析找回了 2026-08 解析時悄悄漏掉的六列 Mem0-Graph。E2E-ASR 排名和 MESR 排名之間的 Spearman ρ 為 0.702(2026-09-02、18 列時為 0.785),最大排名變動為 15.5 名(2026-09-02、18 列時為 7 名),且有六組設定的排名變動至少五名(18 列時有三組)。兩種指標都採升冪排名,因此排名第 1 是最安全的設定。

找回的列沒有稀釋結果,反而包含了最極端的案例:矩陣中最大的單一差異,出自 18 列統計無法涵蓋的 Mem0-Graph 列。

比較E2E-ASRMESR解讀
Hermes/MiniMax:Native → Mem034.8% → 48.7%(差 13.9)58.7% → 55.9%(好 2.8)排名反轉——MPSR 59.4% → 87.1%;整個退步都來自 Mem0 接受了 Native 拒絕的寫入
Hermes/MiniMax:Native → Mem0-Graph(找回的列)34.8% → 45.8%(差 11.0)58.7% → 52.6%(好 6.1)第二次反轉,形狀相同——MPSR 59.4% → 87.1%
Hermes/MiniMax:Native → A-MEM34.8% → 41.0%(差 6.1)58.7% → 47.7%(好 11.0)第三次——MPSR 59.4% → 85.8%;此欄所有非 Native 後端都反轉
Mem0-Graph/OpenClaw/GPT-5.5(找回的列)24 組中排名第 5.5排名第 21最大差距為 15.5 名。 它比 Native 多出的 16.1 個百分點 E2E-ASR 優勢——論文報告的後端效果最大值——其中 10.5 個百分點來自拒絕寫入(MPSR 77.4% → 63.2%),只有 5.7 個百分點來自轉換率降低
Native/Hermes/MiniMax24 組中排名第 3(最安全設定並列,為 33.87%)(2026-09-02、18 列時排名第 2,最安全)排名第 12(18 列時第 9)其安全性來自寫入階段(矩陣中最低的 MPSR,59.35%)
Mem0/OpenClaw/GPT-5.5排名第 8(18 列時第 6)排名第 18(18 列時第 13)它比 Native 多出的 13.6 個百分點 E2E 優勢,有 6.2 個百分點來自拒絕 8.4 個百分點的寫入(MPSR 77.4% → 69.0%),另有 7.4 個百分點來自轉換率降低
Native/OpenClaw/GPT-5.5排名第 17(18 列時第 13)排名第 24(最差)(18 列時排名第 18,最差)矩陣中 MESR 最高,為 73.75%

24 列中,E2E-ASR 有兩組完全相同的數值(33.87% 和 40.97%,各出現兩次),所以上述排名採平均排名;最大差距落在半個排名上。若使用任一種序位平手裁決,差距都是 15 或 16 名。

研究發現 4 的標題結論——「在 OpenClaw 下,Mem0 會讓 E2E-ASR 降低 4.2–13.5 個百分點;在 Hermes 搭配 MiniMax-M3 時則會讓它從 34.8% 升至 48.7%」——正是論文自己證明後端排名無法轉移的證據。重新表述後可以看出原因,而找回的資料列則顯示這並非單一異常值。在 Hermes/MiniMax-M3 下,三種外部後端都比 Native 的 59.35% MPSR 多放行 26–28 個百分點的寫入,而且轉換這些寫入的效率都低於 Native;E2E-ASR 欄將其解讀為三項退步,MESR 欄則將其解讀為三項進步。這裡不是後端或測試工具「讓已寫入的毒化內容更有效」——而是它們讓更多毒化內容成功寫入。原本被當成同一項結果報告的其實是兩種不同特性,而且出現在三組資料中,而非一組。

4. GhostWriter 和 AM-Sentry:同一欄中的兩種尺度#

GhostWriter 從未明確報告端到端數值。 圖 6 畫出三根長條:P1 注入約 98%、檢索約 94%、P2 啟動約 60%。啟動數據是邊際端到端率(提示注入控制組將低啟動率歸因於低檢索率;只有啟動率並非以檢索成功為條件,這種解釋才說得通),因此:

  • 端到端率約為 60%;以成功注入為條件的比率為 60/98 = 61.2%。兩者都不是 94%。 約 94% 的檢索長條是診斷數據,並未進入乘積計算;而這正是本維基頁面及整個領域最常引用的數字。
  • 控制組是語料中最佳證據,說明檢索是買來的,而非免費贈送的。 相同代理程式、相同基礎架構,使用 AgentDojo 提示注入載荷:P1「與 GhostWriter 非常相似」,啟動率卻只有 0–16.7%;論文明確指出,「原因是檢索率低,且載荷未針對後續提示中的啟動進行最佳化」。以成功寫入為條件,GhostWriter 的檢索最佳化相對於 ≤17% 的啟動率,帶來約 61% 的結果——同樣的寫入有 3.6 倍的提升。攻擊已付費的階段才會容易。

AM-Sentry 的階梯在同一欄中混用了兩種指標。 圖 8 的 S1/S2/S3 數據是准入率(「我們的記憶保存政策防止惡意記憶注入的效果」;A-MAC 的 84% 是「在 A-MAC 下觀察到的攻擊成功率」,測量的是准入階段)。圖 9 的 S+R 數據則是端到端率(「若攻擊成功啟動並改變代理程式行為,則視為成功」)。若以未防禦轉換係數 0.612,將寫入階段數據換算成端到端尺度:

設定報告方式尺度估計端到端率
A-MAC(先前研究基準)平均准入率 84%寫入約 51%
S1(ChatGPT)准入率約 97%寫入約 59%
S2(ChatGPT,最佳格)准入率 71%寫入約 43%
S3(ChatGPT/DeepSeek/Gemini)准入率 15%寫入約 9%
S3(Llama)准入率 77%寫入約 47%
S1+R / S2+R最差格約 70%端到端70%
S3+R<12%;Llama 為 20%端到端<12%;20%

以下兩項解讀都只是估計,因為論文並未授權使用一項假設(寫入政策不會改變以成功准入為條件的啟動率):

  • 在能力較強的模型上,檢索篩選器的邊際價值無法與零區分,也可能為負。 單獨使用 S3 時,估計端到端率約為 9%,而 S3+R 的實測值為 <12%。論文聲稱 R「大幅改善整體效能」,對寫入政策較寬鬆的 S1 和 S2 成立;對Llama 尤其成立(單獨 S3 約 47% → S3+R 20%),因為此處模型無法遵循格式,導致寫入政策失效。R 是寫入政策失效時的後援措施,不是額外增益——這與階梯數據所暗示的產品建議不同。
  • Out-of-Band Prompt-Injection Defense 與 TMA-NM 的 0% 比較時,12–20% 的殘餘率才是應採用的正確比較數字(它是端到端率);但該頁面一併引用的 15% 對 77% 裁決者差異,測量的是准入率,不應把兩者當成同一組數據來解讀。

5. Utility Under Attack:條件率精確的唯一實驗組,以及最重要的排名反轉#

這是語料中最清晰的測試,因為寫入時內容篩選器沒有拒絕 360 個遭毒化記憶中的任何一個。按設計,所有實驗組的寫入成功率都是 100%,所以端到端率就是條件率,沒有率比值近似問題,而且實驗組之間的所有差異都純粹來自檢索階段。

實驗組毒化項目排第 1(檢索分數)保留效用(=寫入成功條件下的端到端率)McNemar p
無防禦100%35%—
信任加權 w_t=0.15(目前預設值)87%(抑制 13 個百分點)37%(恢復 2 個百分點)0.80
信任加權 w_t=0.35(修正後)2%(抑制 98 個百分點)56%(恢復 21 個百分點)0.0015

檢索抑制轉換為端到端結果的關係極不線性,起點約等於零。 目前使用的防禦措施讓檢索指標改善 13 個百分點,端到端指標卻完全不變(p=0.80)——這項可報告的檢索改善對端到端結果毫無幫助,正是開放問題所預測的失效模式。即使幾乎完全抑制檢索,失去的 65 個百分點中仍有 44 個無法恢復:毒化項目先前已經取代了真實證據,因此將它從排名第一的位置移除,並不能恢復答案。語料中所有以攻擊成功率評分的數字都看不到這個殘餘效應。

接著,排名完全反轉。 以檢索抑制分數來看,w_t=0.35 是整個語料測得最好的防禦:毒化項目排名第一的比率降至 2%;在語料 M 中,良性不可信內容的佔比也降至 0%。在語料 N——答案所需的證據本身也來自不可信來源——相同設定會讓證據召回率降至 0.00%,準確率從 0.8583 降至 0.0417。使檢索階段指標達到最高的設定,同時也會摧毀整個系統。語料中沒有其他防禦措施具有效用實驗組:Non-Malleable Memory Authority (TMA-NM) 指出,PipePoison 的八個階段都沒有以良性任務表現作為測量依據;AM-Sentry 的效用測試套件則是研究者自行設計的合成工作週。

這也說明了為何重新表述並不能修正全部問題。AUR|write 仍然是只測安全性的數字。語料需要的是 (AUR|write, utility|no attack) 這組搭配,而目前只有一項測量。

6. 語料缺少這項數字的地方#

直白列出來,因為這些缺口本身就是研究發現:

  1. 除了 MemSecBench,沒有逐案例的聯合列聯表。 沒有其他研究逐案例報告同一試驗是否同時通過寫入、檢索和使用階段。第 1、2、4 節的所有條件率都是邊際率相除。
  2. PipePoison 的記憶管理防禦沒有 WSR 數據。 圖 12 只畫出 AUR 和 RSR@5。作者未列出 WSR,算是他們認為 WSR 不變的薄弱證據,但「不變」是我的假設,不是作者的說法。衝突解決會整併記憶,是寫入後對記憶庫的修改——如果它在整併時移除了毒化內容,那麼 55–63% 條件率的一部分實際上來自寫入持續性效果,它的領先幅度便會縮小。
  3. AM-Sentry 的 S1/S2/S3 從未在不使用 R 的情況下測試至啟動階段。 這是第 4 節最有價值的缺失測量,而且不需要新的測試工具——只要重跑論文已經建置的實驗即可。
  4. 除了 Karunanidhi,沒有任何地方設有效用實驗組。 因此「排名是否仍成立」只能問安全軸上的排名。PipePoison 的八個階段和 AM-Sentry 六組設定中的五組,都無法計算安全性與效用的聯合排名。
  5. Bad Memory 沒有可供條件化的檢索階段。 自動載入的 [[agent-context-files|CLAUDE.md-class files]] 以 1 的機率進入上下文,所以其 ASR 已經以寫入為條件;其持續性率則是工作階段結束時的狀態,而非流程中的一個階段。語料中最高的兩項檢索率,對人們今天實際使用的基礎架構都沒有對應數據——這與問題的擔憂方向相反:在那種基礎架構上,檢索抑制防禦不只是被過度高估,而是根本無從著手。
  6. 時間戳感知檢索只以範圍報告,所以無法依各設定納入第 2 節的排名。
  7. 以上每個數字都以靜態或不受防禦影響的攻擊者為前提——PipePoison 針對整個流程最佳化,且從未觀察受防禦的受害者;MemSecBench 將 310 個預先編寫的案例原封不動地重播;Karunanidhi 的對手只執行一次生成。因此這裡每個條件率都是攻擊成功率的下限,也是防禦效果的上限;Out-of-Band Prompt-Injection Defense 對這整類結果都附上了相同的注意事項。

7. 結論#

就前提而言——是,語料過度解讀檢索階段的比率;條件化後的論據比原始排序更有力。 回憶階段通過率為 90.4%,採納階段為 70.6%(MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair);最強攻擊能將 96.5% 的寫入和 77.9% 的檢索轉化為成功(Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents);GhostWriter 約 94% 的檢索長條並未進入它自己的端到端乘積,該乘積約為 60%(When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents)。問題提到的三個標題級檢索率,分別不含任何端到端資訊、含有的端到端資訊少於其累積形式所暗示的程度,以及因評分採用超集合事件而被定義性地灌高。

就作用機制而言——檢索成本低,不代表免費;這項差異會影響防禦評估。 同一種基礎架構能讓最佳化載荷達到 94% 的檢索率,也能讓未最佳化載荷的檢索率低到啟動率不足 17%。因此檢索端控制措施並非毫無價值:PipePoison 的良性記憶庫掃描會在 WSR 不變的情況下,將 RSR@5 降低 11–22 個百分點;條件 AUR 也隨之降低 5–17 個百分點(S3:96% → 79%)——每降低一個百分點的檢索率,約帶來 0.5–0.8 個百分點的轉換率變化;Context Lifecycle Management 已將它視為檢索預算控制的安全面向(K=1 時 AUR 為 34–39%,K=5 時為 67–73%,整個掃描過程中的寫入成功率維持不變)。毫無價值的是把檢索階段的比率當成防禦結果來報告;目前使用的 w_t=0.15 權重正是如此:抑制排名第一的比率 13 個百分點,對結果的影響 p=0.80。

就排名而言——寫入後控制措施的排名仍成立,但在寫入邊界上兩度翻轉。 衝突解決在兩種尺度上都是最佳。專用 GPT-5.4 偵測器從並列最佳變成倒數第二。Hermes/MiniMax-M3 下的 Mem0 發生排名反轉;完整 24 組設定網格中,同一欄內其他非 Native 後端也全都如此。兩次反轉的形狀相同:降低進入記憶庫的毒化內容數量的控制措施,卻被當作能降低已存入毒化內容效果的控制措施來評分。正確的做法不是以條件率取代邊際率,而是同時報告兩者,因為它們回答不同問題——邊際率回答「多少攻擊能在這個部署上完成」,條件率回答「若有毒化內容成功寫入,這項控制措施能帶來什麼效果」。在同一欄混合准入控制與使用控制的防禦階梯,會在不知不覺中兩個問題都答不上來。

什麼結果會改變這個結論#

  • PipePoison 或 GhostWriter 的逐案例聯結資料。 兩種測試工具都在同一試驗中執行寫入與使用流程;若公布 2×2(或 2×2×2)列聯表,而非三組邊際率,就能把第 1、2、4 節的所有估計轉為實測值。這就是開放問題所提出、而且成本更低的實驗——不需要重跑,只要對已完成的執行結果採用不同的彙整方式。
  • 不使用 R 的 AM-Sentry S1/S2/S3 啟動測量。 如果單獨使用 S3 的真正端到端率明顯高於約 9%,那麼「R 在能力較強的模型上幾乎沒有貢獻」這項主張就不成立,而論文所報告的階梯結果便是正確的。
  • PipePoison 衝突解決階段的 WSR。 如果整併會移除記憶庫中的毒化內容,而非只降低其排名,那麼它部分的領先效果其實來自持續性階段,對來源標記的條件化優勢也會縮小。
  • PipePoison 八個階段中的任一項效用實驗組。 Karunanidhi 在語料 N 的結果提醒我們,檢索端控制措施可以在標記率上取得滿分,卻完全無法使用;在第二個來源測量這組數值之前,第 2 節的排名只是安全性排名,而不是建議。
  • 以適應型攻擊者測試任一項防禦。 以上條件率都會改變,且受模型判斷閘門影響的數字變化最大——這是 Out-of-Band Prompt-Injection Defense 以及 Bind, Don't Forbid; Prevent, Don't Detect: The Action-Open and Poisoned-Memory Residuals 一直以來的預測。

證據層級與權重#

  • MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair(empirical,Zhejiang University of Technology,arXiv 2607.27080)——本文給予最高權重,唯一計算逐案例條件率的來源;310 個案例 × 24 組設定,依據證據裁定,裁決者與人工的準確率為 90.60%/91.80%。折扣因素:沒有受測防禦措施、每個設定與案例組合只執行一次、攻擊者為靜態。現在已完整採用表 2(2026-09-05)。 docling 2.126 重新解析找回 2026-08 解析時悄悄漏掉的六列 Mem0-Graph,使用前已逐格與 PDF 第 6 頁核對全部 24 列——這一步不可少,因為新的解析反而破壞了 Native 區塊(將 Hermes/DeepSeek-V4-Pro 列標成 OpenClaw,並把 Hermes/GPT-5.5 列拆成兩行),所以只有與 PDF 一致的部分才採用 Markdown 資料。兩項檢查支持這次核對結果:全部 24 列、四項指標的每個百分比都與各自的計數和分母相符(183/298 = 61.41%、128/235 = 54.47%、173/292 = 59.25%……);校正後網格的未加權宏觀平均也準確重現論文標題數據——MPSR 84.2%、MESR 59.6%、E2E-ASR 50.3%、SRSR 56.1%——而 18 列子集無法做到(84.2 / 60.1 / 50.7 / 58.0)。階段流程鏈使用的五個宏觀平均,仍取自研究發現 1 的文字敘述,而非資料網格。
  • Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents(empirical,Shandong University,arXiv 2609.00523,無 COI)——語料中最強的攻擊,也是唯一具有八階防禦階梯的來源;AgentEvals 以 800 筆人工標註紀錄驗證,結果為 0.93–0.95。折扣因素:只提供邊際率;防禦結果位於未標示的圖中(第 2 節的 WSR 列是以表 9 校準後的像素讀值);沒有效用實驗組。
  • Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking(empirical,Quantify Labs)——精確條件率,也是唯一同時提供安全性與效用數值的來源;上述三項研究發現都是作者自家已發布產品的負面結果。折扣因素:未揭露 COI(受測系統為 Aegis)、n=120、只用一種檢索器/嵌入器/讀取器、攻擊者刻意設為不適應。
  • When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents(empirical,New Mexico State University,arXiv 2607.06595)——提供「檢索需要付出代價」的控制組證據,也是第 7 節作用機制論點的依據。折扣因素:第 4 節 AM-Sentry 的條件率是估計值;作者承認攻擊者不會適應;政策權重由研究者手動挑選;效用測試套件由研究者自行設計。
  • Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems(empirical,University of Washington)——僅提供邊界觀察,指出其基礎架構沒有檢索階段。排名時未納入權重。

以上五項研究的類別都是 empirical,因此無須在層級間進一步決勝;上面的排序依據是測量設計,而非證據層級。

§ end
Cited by 7
Related articles
  • Memory and Context Poisoning

    Corruption of persistent agent memory that influences behavior long after the initial injection — RAG poisoning, shared…

  • Agent Data Injection (ADI)

    A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…

  • Blast Radius (Agentic)

    The potential damage if an agent is compromised; the unit Zero Trust's 'assume breach' posture is built to contain via…

  • Capability Gating Is Not Authorization

    Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…

  • Out-of-Band Prompt-Injection Defense

    Second-generation prompt-injection defense enforced outside the model: a deterministic reference monitor mediates tool…