資料來源#
- Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair
- Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents
- Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking
- When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents
問題#
Memory and Context Poisoning 中的 #oq/now 項目:
語料是否過度解讀檢索階段的成功率?在 PipePoison 的 12 組設定網格中,全部七種攻擊的排序都毫無例外地是 AUR < WSR < RSR@5;而記憶中毒論文報告的最大單一數字幾乎總是檢索率——GhostWriter 約 94%、MemSecBench 的召回率 76.1%、本文的 94.2%。如果檢索在結構上就是容易的階段,那麼以抑制檢索來評估的防禦,就是在最不重要的階段接受評分。這個主張可以證偽,而且用已公開的測試工具驗證成本很低:把此語料中每項檢索階段防禦結果重新報告為條件量——在成功寫入的條件下,端到端成功率是多少——再檢查重新表述後防禦排名是否仍成立。
簡短回答#
- 前提成立,而條件化後更加明確。 在唯一真正逐案例報告條件率的來源中,回憶階段篩掉 9.6 個百分點,採納階段則篩掉 29.4 個百分點(MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair)。最強攻擊能將 96.5% 的寫入和 77.9% 的檢索轉化為端到端成功(Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents)。
- 但檢索成本低,不代表沒有成本。 GhostWriter 自己的控制組——相同代理程式、相同約 98% 的注入率,以及一個從未針對後續查詢最佳化的 AgentDojo 載荷——啟動率只有 0–16.7%,「原因是檢索率低」(When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents)。語料中 94% 的檢索率,是每個標題攻擊都成功買下這項結果後留下的倖存者,而不是某個毫無成本的階段。
- 寫入後控制措施的防禦排名仍成立,但在寫入邊界上兩度翻轉。 PipePoison 的專用 GPT-5.4 記憶操弄偵測器,從文字檢查組中並列最佳的一階(51–57% AUR)降至 倒數第二(條件化後 81–92%),因為它表面效果中有 11–14 個百分點來自阻擋寫入。在 MemSecBench 中,Hermes/MiniMax-M3 下的 Mem0,E2E-ASR 看來差 13.9 個百分點,MESR 卻好 2.8 個百分點——排名完全反轉;找回 Mem0-Graph 列後,這種反轉共有三例:在 Hermes/MiniMax-M3 下,所有非 Native 後端的端到端結果看起來都更差,但條件率都更好(全部 24 組設定的 Spearman 0.702,排名最多移動 15.5 名;2026-09-02、18 列時為 0.785 和 7)。
- 最明顯的反轉發生在唯一有測量效用軸的實驗組。 Karunanidhi 修正後的信任權重,是語料中檢索抑制分數最佳的設定(毒化項目排名第一的比率:100% → 2%,在語料 M 為 0%),但會讓語料 N 的證據召回率降至 0.00%。檢索最佳化帶來災難性效用,而語料中沒有其他研究測量這一組合。
- 語料無法回答的地方。 只有 MemSecBench 提供逐案例聯結。本文其他所有條件率都是邊際率相除;其中兩項還依賴論文未曾說明的假設;AM-Sentry 的三個寫入政策層級完全沒有端到端測量;而 Bad Memory 的基礎架構沒有可供條件化的檢索階段。
重新表述的規則,以及適用條件#
所求的量是 P(end-to-end | write succeeded)。只有在端到端事件包含於寫入事件之中時,這才是有效的條件率。PipePoison 明確支持這種解讀:「使用成功……要求攻擊相關資訊在寫入後留存、在後續查詢時被檢索,並被代理程式使用」(第 2.2 節);若寫入器沒有產生記憶,它也會將檢索分數設為 0。因此 AUR 同時包含在 WSR 和 RSR@5 之內,AUR/WSR 與 AUR/RSR@5 都是條件率。
以下每個數字都伴隨三項注意事項。
- 率的比值,而非聯結資料。 PipePoison、GhostWriter 和 Karunanidhi 都只報告各實驗組的邊際率。只有在逐案例事件不受設定影響時,兩者相除才會精確得到條件率;在 12 組穩定設定下,這個近似相當好,但仍只是近似。MemSecBench 是語料中唯一逐案例計算條件率的來源——
MESR = Σwe / Σw——因此它是本文最關鍵的證據。 - RSR@5 是超集合事件,而非鏈中的一個階段。 PipePoison 以寫入器產生的最佳記憶評分檢索,「不論惡意載荷是否完整保留」(第 3.2 節)。即使記憶攜帶的載荷已劣化,也可能被檢索到。因此按定義,RSR@5 系統性地高於 WSR;問題所注意到的 AUR < WSR < RSR@5 排序,有一部分是定義造成的假象——這本身就說明不應再把檢索率當作標題數據。
- 讀取圖表。 PipePoison 的防禦結果位於圖 11 和圖 12,而不是表格。Non-Malleable Memory Authority (TMA-NM) 頁面已透過
pdftotext -layout找回圖 12 的資料標籤。圖 11 沒有資料標籤,因此下列各設定數值是從 400-dpi 圖像上以像素量測而得,並以未防禦列校準;該列與表 9 的 η=0.7 數值完全一致(S1–S4 的 WSR 為 76/68/77/72,AUR 為 73/67/67/69)。可視為 ±1–2 個百分點;各自的範圍也符合論文文字所述(「Llama Guard……59%–63%」、「51%–57%」、「53%–61%」)。
1. 七種攻擊的重新表述(PipePoison,表 1,12 組配對設定)#
12 組設定網格的平均值。AUR|write 是從另一端表述論文自己的讀法——論文談到 MINJA 時說「RSR@5 為 87.6%,AUR 卻只有 48.2%」,表達的是同一件事。
| 攻擊 | WSR | RSR@5 | AUR | 寫入成功條件下的 AUR | 檢索成功條件下的 AUR |
|---|---|---|---|---|---|
| PipePoison | 76.1% | 94.2% | 73.4% | 96.5% | 77.9% |
| Sleeper | 40.6% | 80.5% | 35.7% | 87.9% | 44.3% |
| MemMorph | 63.0% | 85.8% | 54.3% | 86.2% | 63.3% |
| MINJA | 58.3% | 87.6% | 48.2% | 82.7% | 55.0% |
| Zombie | 23.1% | 61.4% | 18.7% | 81.0% | 30.5% |
| GhostWriter(重新實作) | 41.8% | 75.8% | 32.0% | 76.6% | 42.2% |
| ER-MIA | 38.0% | 71.2% | 29.0% | 76.3% | 40.7% |
邊際率表格掩蓋了兩件事。
- 攻擊之間的差異在寫入階段;寫入後的流程則彼此相似。 WSR 範圍為 23.1–76.1(相差 3.3 倍);
AUR|write範圍為 76.3–96.5(相差 1.26 倍)。PipePoison 的 AUR 優勢為 19.1 個百分點,其中 13.1 個百分點來自額外的寫入,另有 9–20 個百分點來自轉換率提升——論文自己的總結「它取得的寫入能挺過其餘流程」,正是對結果的條件式描述。 AUR|retrieval是從攻擊方角度測得的採納關卡,與 MemSecBench 結果一致。 PipePoison 將 77.9% 的檢索轉化為端到端成功;MemSecBench 的宏觀流程鏈為P(adopt ∧ externalize | recall)= 50.3/76.1 = 66.1%。兩個彼此無關的基準測試,測試工具和指標都不同,但使用關卡落在相同的 66–78% 區間。這才是防禦措施應該努力降低的數字,而語料中的各個階段都沒有直接針對它。
2. 八種防禦的重新表述——排名結果#
PipePoison 的防禦階梯從頭到尾都不受防禦措施影響(毒化內容在未防禦的影子環境中最佳化,提交時不做修改)。邊際 AUR 取自論文文字及 Non-Malleable Memory Authority (TMA-NM) 對圖 12 的資料還原;各防禦的 WSR 則從圖 11(a) 讀取。
| 防禦 | 層級 | WSR(S1–S4) | 邊際 AUR | 寫入成功條件下的 AUR | 排名變化 |
|---|---|---|---|---|---|
| 衝突解決 | 記憶管理 | 不變(76/68/77/72) | 41–48% | 55–63% | 1 → 1 |
| 來源標記 | 記憶管理 | 不變 | 51–56% | 67–76% | 3 → 2 |
| A-MemGuard | 系統 | 約略不變(77/69/76/71) | 51–57% | 72–78% | 3 → 3 |
| 安全感知系統提示 | 系統 | 約略不變(74/67/75/73) | 53–61% | 73–82% | 5 → 4 |
| 專用 GPT-5.4 偵測器 | 工具輸出 | 62/57/64/61 | 51–57% | 81–92% | 3 → 5 |
| Llama Guard | 工具輸出 | 71/63/71/65 | 59–63% | 87–95% | 6 → 6 |
| PPL 篩選器 | 工具輸出 | 75/69/77/70 | 67–73%(「效果有限」) | 88–97% | 7 → 7 |
| (未防禦) | — | 76/68/77/72 | 67–73% | 87–99% | — |
時間戳感知檢索只以範圍報告(無關項目 57–66%/語意相關項目 49–59%),因此其條件率約為 79–97% 和 68–87%,無法逐設定排名。
五項寫入後階段的排名仍成立,但工具輸出篩選器的排名則會改變。 衝突解決在兩種尺度上都是最佳,條件化後領先幅度還更大(55–63%,下一項為 67–76%)——這與 Non-Malleable Memory Authority (TMA-NM) 的解讀一致:以記憶庫中的其餘內容作為依據,比檢查記憶文字更有效。改變的是專用偵測器:以邊際率來看,它是三項最佳階段之一,也是論文中最強的文字檢查結果;但在已成功通過偵測器的寫入條件下,它仍留下 81–92% AUR,幾乎與未防禦時的條件率相同,也比所有系統層級和記憶管理階段都差。它全部的貢獻就是拒絕 11–14 個百分點的寫入。這確實是一種控制措施,但它是寫入准入控制,卻和使用控制一起放在同一欄;因此 Out-of-Band Prompt-Injection Defense 上的八階防禦階梯,實際上混用了兩種尺度。
一般化來說:存入記憶庫之前的記憶防禦,評估的是語料已顯示對攻擊者最困難的階段;存入記憶庫之後的防禦,評估的則是語料顯示幾乎不費力的階段。把兩者放在同一欄,讀起來像是在比較同一件事,實際上並非如此。
3. MemSecBench:語料中唯一真正的條件率,以及排名反轉#
MESR = Σwe/Σw 正是問題所問的數值,而且是逐案例計算。宏觀平均為 59.6%(摘要;圖 4 流程鏈為 50.3/84.2 = 59.7%,24 列校正後表 2 的未加權宏觀平均為 59.56%——三者一致)。
根據宏觀平均,將生命週期流程鏈 W1 91.1 → W2 84.2 → E1 76.1 → E2 53.7 → E2E 50.3 重新表述為條件率:
| 轉換 | 條件通過率 | 篩掉的百分點 |
|---|---|---|
| 寫入後持續存在 | 92.4% | 7.6 |
| 毒化後成功回憶 | 90.4% | 9.6 |
| 回憶後採納 | 70.6% | 29.4 |
| 採納後外化 | 93.7% | 6.3 |
這清楚證實了問題的前提。 維基頁面反覆引用的「76.1% 回憶率」是累積率;作為單一階段,它的通過率是 90.4%,而採納階段篩掉的比率約為三倍。論文自己所用的「採納關卡」表述,才是條件式描述;維基頁面一直引用的是累積率。
後端排名無法完整維持;在完整網格中的維持程度更低。 以下使用全部 24 組設定,資料來自 2026-09-05 對 MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair 的 docling 2.126 重新解析,並逐格與 PDF 第 6 頁核對——這次重新解析找回了 2026-08 解析時悄悄漏掉的六列 Mem0-Graph。E2E-ASR 排名和 MESR 排名之間的 Spearman ρ 為 0.702(2026-09-02、18 列時為 0.785),最大排名變動為 15.5 名(2026-09-02、18 列時為 7 名),且有六組設定的排名變動至少五名(18 列時有三組)。兩種指標都採升冪排名,因此排名第 1 是最安全的設定。
找回的列沒有稀釋結果,反而包含了最極端的案例:矩陣中最大的單一差異,出自 18 列統計無法涵蓋的 Mem0-Graph 列。
| 比較 | E2E-ASR | MESR | 解讀 |
|---|---|---|---|
| Hermes/MiniMax:Native → Mem0 | 34.8% → 48.7%(差 13.9) | 58.7% → 55.9%(好 2.8) | 排名反轉——MPSR 59.4% → 87.1%;整個退步都來自 Mem0 接受了 Native 拒絕的寫入 |
| Hermes/MiniMax:Native → Mem0-Graph(找回的列) | 34.8% → 45.8%(差 11.0) | 58.7% → 52.6%(好 6.1) | 第二次反轉,形狀相同——MPSR 59.4% → 87.1% |
| Hermes/MiniMax:Native → A-MEM | 34.8% → 41.0%(差 6.1) | 58.7% → 47.7%(好 11.0) | 第三次——MPSR 59.4% → 85.8%;此欄所有非 Native 後端都反轉 |
| Mem0-Graph/OpenClaw/GPT-5.5(找回的列) | 24 組中排名第 5.5 | 排名第 21 | 最大差距為 15.5 名。 它比 Native 多出的 16.1 個百分點 E2E-ASR 優勢——論文報告的後端效果最大值——其中 10.5 個百分點來自拒絕寫入(MPSR 77.4% → 63.2%),只有 5.7 個百分點來自轉換率降低 |
| Native/Hermes/MiniMax | 24 組中排名第 3(最安全設定並列,為 33.87%)(2026-09-02、18 列時排名第 2,最安全) | 排名第 12(18 列時第 9) | 其安全性來自寫入階段(矩陣中最低的 MPSR,59.35%) |
| Mem0/OpenClaw/GPT-5.5 | 排名第 8(18 列時第 6) | 排名第 18(18 列時第 13) | 它比 Native 多出的 13.6 個百分點 E2E 優勢,有 6.2 個百分點來自拒絕 8.4 個百分點的寫入(MPSR 77.4% → 69.0%),另有 7.4 個百分點來自轉換率降低 |
| Native/OpenClaw/GPT-5.5 | 排名第 17(18 列時第 13) | 排名第 24(最差)(18 列時排名第 18,最差) | 矩陣中 MESR 最高,為 73.75% |
24 列中,E2E-ASR 有兩組完全相同的數值(33.87% 和 40.97%,各出現兩次),所以上述排名採平均排名;最大差距落在半個排名上。若使用任一種序位平手裁決,差距都是 15 或 16 名。
研究發現 4 的標題結論——「在 OpenClaw 下,Mem0 會讓 E2E-ASR 降低 4.2–13.5 個百分點;在 Hermes 搭配 MiniMax-M3 時則會讓它從 34.8% 升至 48.7%」——正是論文自己證明後端排名無法轉移的證據。重新表述後可以看出原因,而找回的資料列則顯示這並非單一異常值。在 Hermes/MiniMax-M3 下,三種外部後端都比 Native 的 59.35% MPSR 多放行 26–28 個百分點的寫入,而且轉換這些寫入的效率都低於 Native;E2E-ASR 欄將其解讀為三項退步,MESR 欄則將其解讀為三項進步。這裡不是後端或測試工具「讓已寫入的毒化內容更有效」——而是它們讓更多毒化內容成功寫入。原本被當成同一項結果報告的其實是兩種不同特性,而且出現在三組資料中,而非一組。
4. GhostWriter 和 AM-Sentry:同一欄中的兩種尺度#
GhostWriter 從未明確報告端到端數值。 圖 6 畫出三根長條:P1 注入約 98%、檢索約 94%、P2 啟動約 60%。啟動數據是邊際端到端率(提示注入控制組將低啟動率歸因於低檢索率;只有啟動率並非以檢索成功為條件,這種解釋才說得通),因此:
- 端到端率約為 60%;以成功注入為條件的比率為 60/98 = 61.2%。兩者都不是 94%。 約 94% 的檢索長條是診斷數據,並未進入乘積計算;而這正是本維基頁面及整個領域最常引用的數字。
- 控制組是語料中最佳證據,說明檢索是買來的,而非免費贈送的。 相同代理程式、相同基礎架構,使用 AgentDojo 提示注入載荷:P1「與 GhostWriter 非常相似」,啟動率卻只有 0–16.7%;論文明確指出,「原因是檢索率低,且載荷未針對後續提示中的啟動進行最佳化」。以成功寫入為條件,GhostWriter 的檢索最佳化相對於 ≤17% 的啟動率,帶來約 61% 的結果——同樣的寫入有 3.6 倍的提升。攻擊已付費的階段才會容易。
AM-Sentry 的階梯在同一欄中混用了兩種指標。 圖 8 的 S1/S2/S3 數據是准入率(「我們的記憶保存政策防止惡意記憶注入的效果」;A-MAC 的 84% 是「在 A-MAC 下觀察到的攻擊成功率」,測量的是准入階段)。圖 9 的 S+R 數據則是端到端率(「若攻擊成功啟動並改變代理程式行為,則視為成功」)。若以未防禦轉換係數 0.612,將寫入階段數據換算成端到端尺度:
| 設定 | 報告方式 | 尺度 | 估計端到端率 |
|---|---|---|---|
| A-MAC(先前研究基準) | 平均准入率 84% | 寫入 | 約 51% |
| S1(ChatGPT) | 准入率約 97% | 寫入 | 約 59% |
| S2(ChatGPT,最佳格) | 准入率 71% | 寫入 | 約 43% |
| S3(ChatGPT/DeepSeek/Gemini) | 准入率 15% | 寫入 | 約 9% |
| S3(Llama) | 准入率 77% | 寫入 | 約 47% |
| S1+R / S2+R | 最差格約 70% | 端到端 | 70% |
| S3+R | <12%;Llama 為 20% | 端到端 | <12%;20% |
以下兩項解讀都只是估計,因為論文並未授權使用一項假設(寫入政策不會改變以成功准入為條件的啟動率):
- 在能力較強的模型上,檢索篩選器的邊際價值無法與零區分,也可能為負。 單獨使用 S3 時,估計端到端率約為 9%,而 S3+R 的實測值為 <12%。論文聲稱 R「大幅改善整體效能」,對寫入政策較寬鬆的 S1 和 S2 成立;對Llama 尤其成立(單獨 S3 約 47% → S3+R 20%),因為此處模型無法遵循格式,導致寫入政策失效。R 是寫入政策失效時的後援措施,不是額外增益——這與階梯數據所暗示的產品建議不同。
- Out-of-Band Prompt-Injection Defense 與 TMA-NM 的 0% 比較時,12–20% 的殘餘率才是應採用的正確比較數字(它是端到端率);但該頁面一併引用的 15% 對 77% 裁決者差異,測量的是准入率,不應把兩者當成同一組數據來解讀。
5. Utility Under Attack:條件率精確的唯一實驗組,以及最重要的排名反轉#
這是語料中最清晰的測試,因為寫入時內容篩選器沒有拒絕 360 個遭毒化記憶中的任何一個。按設計,所有實驗組的寫入成功率都是 100%,所以端到端率就是條件率,沒有率比值近似問題,而且實驗組之間的所有差異都純粹來自檢索階段。
| 實驗組 | 毒化項目排第 1(檢索分數) | 保留效用(=寫入成功條件下的端到端率) | McNemar p |
|---|---|---|---|
| 無防禦 | 100% | 35% | — |
信任加權 w_t=0.15(目前預設值) | 87%(抑制 13 個百分點) | 37%(恢復 2 個百分點) | 0.80 |
信任加權 w_t=0.35(修正後) | 2%(抑制 98 個百分點) | 56%(恢復 21 個百分點) | 0.0015 |
檢索抑制轉換為端到端結果的關係極不線性,起點約等於零。 目前使用的防禦措施讓檢索指標改善 13 個百分點,端到端指標卻完全不變(p=0.80)——這項可報告的檢索改善對端到端結果毫無幫助,正是開放問題所預測的失效模式。即使幾乎完全抑制檢索,失去的 65 個百分點中仍有 44 個無法恢復:毒化項目先前已經取代了真實證據,因此將它從排名第一的位置移除,並不能恢復答案。語料中所有以攻擊成功率評分的數字都看不到這個殘餘效應。
接著,排名完全反轉。 以檢索抑制分數來看,w_t=0.35 是整個語料測得最好的防禦:毒化項目排名第一的比率降至 2%;在語料 M 中,良性不可信內容的佔比也降至 0%。在語料 N——答案所需的證據本身也來自不可信來源——相同設定會讓證據召回率降至 0.00%,準確率從 0.8583 降至 0.0417。使檢索階段指標達到最高的設定,同時也會摧毀整個系統。語料中沒有其他防禦措施具有效用實驗組:Non-Malleable Memory Authority (TMA-NM) 指出,PipePoison 的八個階段都沒有以良性任務表現作為測量依據;AM-Sentry 的效用測試套件則是研究者自行設計的合成工作週。
這也說明了為何重新表述並不能修正全部問題。AUR|write 仍然是只測安全性的數字。語料需要的是 (AUR|write, utility|no attack) 這組搭配,而目前只有一項測量。
6. 語料缺少這項數字的地方#
直白列出來,因為這些缺口本身就是研究發現:
- 除了 MemSecBench,沒有逐案例的聯合列聯表。 沒有其他研究逐案例報告同一試驗是否同時通過寫入、檢索和使用階段。第 1、2、4 節的所有條件率都是邊際率相除。
- PipePoison 的記憶管理防禦沒有 WSR 數據。 圖 12 只畫出 AUR 和 RSR@5。作者未列出 WSR,算是他們認為 WSR 不變的薄弱證據,但「不變」是我的假設,不是作者的說法。衝突解決會整併記憶,是寫入後對記憶庫的修改——如果它在整併時移除了毒化內容,那麼 55–63% 條件率的一部分實際上來自寫入持續性效果,它的領先幅度便會縮小。
- AM-Sentry 的 S1/S2/S3 從未在不使用 R 的情況下測試至啟動階段。 這是第 4 節最有價值的缺失測量,而且不需要新的測試工具——只要重跑論文已經建置的實驗即可。
- 除了 Karunanidhi,沒有任何地方設有效用實驗組。 因此「排名是否仍成立」只能問安全軸上的排名。PipePoison 的八個階段和 AM-Sentry 六組設定中的五組,都無法計算安全性與效用的聯合排名。
- Bad Memory 沒有可供條件化的檢索階段。 自動載入的 [[agent-context-files|
CLAUDE.md-class files]] 以 1 的機率進入上下文,所以其 ASR 已經以寫入為條件;其持續性率則是工作階段結束時的狀態,而非流程中的一個階段。語料中最高的兩項檢索率,對人們今天實際使用的基礎架構都沒有對應數據——這與問題的擔憂方向相反:在那種基礎架構上,檢索抑制防禦不只是被過度高估,而是根本無從著手。 - 時間戳感知檢索只以範圍報告,所以無法依各設定納入第 2 節的排名。
- 以上每個數字都以靜態或不受防禦影響的攻擊者為前提——PipePoison 針對整個流程最佳化,且從未觀察受防禦的受害者;MemSecBench 將 310 個預先編寫的案例原封不動地重播;Karunanidhi 的對手只執行一次生成。因此這裡每個條件率都是攻擊成功率的下限,也是防禦效果的上限;Out-of-Band Prompt-Injection Defense 對這整類結果都附上了相同的注意事項。
7. 結論#
就前提而言——是,語料過度解讀檢索階段的比率;條件化後的論據比原始排序更有力。 回憶階段通過率為 90.4%,採納階段為 70.6%(MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair);最強攻擊能將 96.5% 的寫入和 77.9% 的檢索轉化為成功(Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents);GhostWriter 約 94% 的檢索長條並未進入它自己的端到端乘積,該乘積約為 60%(When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents)。問題提到的三個標題級檢索率,分別不含任何端到端資訊、含有的端到端資訊少於其累積形式所暗示的程度,以及因評分採用超集合事件而被定義性地灌高。
就作用機制而言——檢索成本低,不代表免費;這項差異會影響防禦評估。 同一種基礎架構能讓最佳化載荷達到 94% 的檢索率,也能讓未最佳化載荷的檢索率低到啟動率不足 17%。因此檢索端控制措施並非毫無價值:PipePoison 的良性記憶庫掃描會在 WSR 不變的情況下,將 RSR@5 降低 11–22 個百分點;條件 AUR 也隨之降低 5–17 個百分點(S3:96% → 79%)——每降低一個百分點的檢索率,約帶來 0.5–0.8 個百分點的轉換率變化;Context Lifecycle Management 已將它視為檢索預算控制的安全面向(K=1 時 AUR 為 34–39%,K=5 時為 67–73%,整個掃描過程中的寫入成功率維持不變)。毫無價值的是把檢索階段的比率當成防禦結果來報告;目前使用的 w_t=0.15 權重正是如此:抑制排名第一的比率 13 個百分點,對結果的影響 p=0.80。
就排名而言——寫入後控制措施的排名仍成立,但在寫入邊界上兩度翻轉。 衝突解決在兩種尺度上都是最佳。專用 GPT-5.4 偵測器從並列最佳變成倒數第二。Hermes/MiniMax-M3 下的 Mem0 發生排名反轉;完整 24 組設定網格中,同一欄內其他非 Native 後端也全都如此。兩次反轉的形狀相同:降低進入記憶庫的毒化內容數量的控制措施,卻被當作能降低已存入毒化內容效果的控制措施來評分。正確的做法不是以條件率取代邊際率,而是同時報告兩者,因為它們回答不同問題——邊際率回答「多少攻擊能在這個部署上完成」,條件率回答「若有毒化內容成功寫入,這項控制措施能帶來什麼效果」。在同一欄混合准入控制與使用控制的防禦階梯,會在不知不覺中兩個問題都答不上來。
什麼結果會改變這個結論#
- PipePoison 或 GhostWriter 的逐案例聯結資料。 兩種測試工具都在同一試驗中執行寫入與使用流程;若公布 2×2(或 2×2×2)列聯表,而非三組邊際率,就能把第 1、2、4 節的所有估計轉為實測值。這就是開放問題所提出、而且成本更低的實驗——不需要重跑,只要對已完成的執行結果採用不同的彙整方式。
- 不使用 R 的 AM-Sentry S1/S2/S3 啟動測量。 如果單獨使用 S3 的真正端到端率明顯高於約 9%,那麼「R 在能力較強的模型上幾乎沒有貢獻」這項主張就不成立,而論文所報告的階梯結果便是正確的。
- PipePoison 衝突解決階段的 WSR。 如果整併會移除記憶庫中的毒化內容,而非只降低其排名,那麼它部分的領先效果其實來自持續性階段,對來源標記的條件化優勢也會縮小。
- PipePoison 八個階段中的任一項效用實驗組。 Karunanidhi 在語料 N 的結果提醒我們,檢索端控制措施可以在標記率上取得滿分,卻完全無法使用;在第二個來源測量這組數值之前,第 2 節的排名只是安全性排名,而不是建議。
- 以適應型攻擊者測試任一項防禦。 以上條件率都會改變,且受模型判斷閘門影響的數字變化最大——這是 Out-of-Band Prompt-Injection Defense 以及 Bind, Don't Forbid; Prevent, Don't Detect: The Action-Open and Poisoned-Memory Residuals 一直以來的預測。
證據層級與權重#
- MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair(
empirical,Zhejiang University of Technology,arXiv 2607.27080)——本文給予最高權重,唯一計算逐案例條件率的來源;310 個案例 × 24 組設定,依據證據裁定,裁決者與人工的準確率為 90.60%/91.80%。折扣因素:沒有受測防禦措施、每個設定與案例組合只執行一次、攻擊者為靜態。現在已完整採用表 2(2026-09-05)。 docling 2.126 重新解析找回 2026-08 解析時悄悄漏掉的六列 Mem0-Graph,使用前已逐格與 PDF 第 6 頁核對全部 24 列——這一步不可少,因為新的解析反而破壞了 Native 區塊(將 Hermes/DeepSeek-V4-Pro 列標成OpenClaw,並把 Hermes/GPT-5.5 列拆成兩行),所以只有與 PDF 一致的部分才採用 Markdown 資料。兩項檢查支持這次核對結果:全部 24 列、四項指標的每個百分比都與各自的計數和分母相符(183/298 = 61.41%、128/235 = 54.47%、173/292 = 59.25%……);校正後網格的未加權宏觀平均也準確重現論文標題數據——MPSR 84.2%、MESR 59.6%、E2E-ASR 50.3%、SRSR 56.1%——而 18 列子集無法做到(84.2 / 60.1 / 50.7 / 58.0)。階段流程鏈使用的五個宏觀平均,仍取自研究發現 1 的文字敘述,而非資料網格。 - Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents(
empirical,Shandong University,arXiv 2609.00523,無 COI)——語料中最強的攻擊,也是唯一具有八階防禦階梯的來源;AgentEvals 以 800 筆人工標註紀錄驗證,結果為 0.93–0.95。折扣因素:只提供邊際率;防禦結果位於未標示的圖中(第 2 節的 WSR 列是以表 9 校準後的像素讀值);沒有效用實驗組。 - Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking(
empirical,Quantify Labs)——精確條件率,也是唯一同時提供安全性與效用數值的來源;上述三項研究發現都是作者自家已發布產品的負面結果。折扣因素:未揭露 COI(受測系統為 Aegis)、n=120、只用一種檢索器/嵌入器/讀取器、攻擊者刻意設為不適應。 - When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents(
empirical,New Mexico State University,arXiv 2607.06595)——提供「檢索需要付出代價」的控制組證據,也是第 7 節作用機制論點的依據。折扣因素:第 4 節 AM-Sentry 的條件率是估計值;作者承認攻擊者不會適應;政策權重由研究者手動挑選;效用測試套件由研究者自行設計。 - Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems(
empirical,University of Washington)——僅提供邊界觀察,指出其基礎架構沒有檢索階段。排名時未納入權重。
以上五項研究的類別都是 empirical,因此無須在層級間進一步決勝;上面的排序依據是測量設計,而非證據層級。
Cited by 7
- Memory and Context Poisoning×2
Is the corpus over-reading retrieval-stage success rates? Across all seven attacks in PipePoison's…
- Context Lifecycle Management
Memory Poisoning Numbers Conditioned On The Write — prices the retrieval-budget knob in this…
- Agent Security
Memory Poisoning Numbers Conditioned On The Write — Re-states every stage-level attack and defense…
- Non-Malleable Memory Authority (TMA-NM)
Memory Poisoning Numbers Conditioned On The Write — puts this page's Figure-12 recovery on the…
- Open Questions Backlog
Memory And Context Poisoning: Is the corpus over-reading retrieval-stage success rates? → Memory…
- Out-of-Band Prompt-Injection Defense
Memory Poisoning Numbers Conditioned On The Write — the eight-rung ladder in the seventh data point…
- Write-Then-Trusted
Memory Poisoning Numbers Conditioned On The Write — Karunanidhi's four-stage write path is the…
Related articles
- Memory and Context Poisoning
Corruption of persistent agent memory that influences behavior long after the initial injection — RAG poisoning, shared…
- Agent Data Injection (ADI)
A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…
- Blast Radius (Agentic)
The potential damage if an agent is compromised; the unit Zero Trust's 'assume breach' posture is built to contain via…
- Capability Gating Is Not Authorization
Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…
- Out-of-Band Prompt-Injection Defense
Second-generation prompt-injection defense enforced outside the model: a deterministic reference monitor mediates tool…
