資料來源#
- Extractable Memorization From First Principles
- Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks
摘要#
提取——反覆提示模型,直到它重現某段訓練序列——是這個領域用來觀察序列是否被記住的標準訊號。Cooper et al. ("Extractable Memorization From First Principles", Yale/AVERI/Stanford + Cornell + Google Research/DeepMind, arXiv 2607.12649, 2026-07-14, empirical) 指出,單靠這項訊號毫無價值。生成出訓練序列並不能證明記憶;只有在模型生成它的機率高於從未訓練過的可比較序列時,才算數。要確立這點,就必須進行配對比較:對已知或疑似出現在訓練資料中的序列,以及配對的非訓練序列,使用完全相同的程序評分——相同的模型 θ、相同的解碼策略 φ、相同的提示選取規則、相同的分數。非成員不可能被記住,因此其分數分布就是一般可預測性的基準;只有成員的分數超過這個基準,才能據此主張記憶。
這是一篇討論主張效度的論文,位於這個系列測量論文的下層:問題不是「數字對不對」,而是「這個數字能不能支撐旁邊寫的那句話」。它與基準污染與去污染並列(同一種記憶機制,但視為評估完整性問題,而非隱私/著作權問題),也與使用遙測分類器驗證相連(每一則下游標題都依賴的儀器,首次接受測量)。
它修正的兩種失誤#
近期研究朝相反方向走,卻都偏離了重點:
- 誇大提取結果。 從太短、無法區分記憶與可預測性的序列(10 個 token 的後綴,有時更短)主張成功提取,或使用會直接洩漏目標內容的提示。反證例是**「鸚鵡」提示**——「照我說的重複:……」後面直接接上目標內容。只在訓練資料上執行,看起來提取率有 70%;對配對的非訓練文字執行,結果完全相同。圖 1c,OLMo 2 32B Instruct,每組 N=3,000:逐字重現率為訓練資料 70.1%,非訓練資料 70.6%。顯而易見的解釋(文字就在提示裡)不是重點——單靠配對比較就足以推翻主張,不必知道背後機制。
- 把提取完全排除在證據之外,理由是模型也會重現沒受過訓練的真實世界文字。這點沒錯,也正是必須測量基準下限、而不能假設它是零的原因。
同樣的失誤也出現在嚴肅方法中,不只存在於刻意設計的反例。Schwarzschild et al. 的對抗式壓縮準則,將搜尋到一個比目標更短、且能引出目標內容的提示視為提取成功,並以 Gretzky 的名句「You miss 100% of the shots you don't take.」作為示範。作者在 Llama 2 13B 上重現了這項成功,接著也對一個訓練截止日期之後的非訓練目標成功套用相同程序(來自 2026 年 NBA Finals 的 Jalen Brunson 引言)。這並不能證明 Llama 2 沒記住 Gretzky;它只能說,符合這項準則本身不足以構成記憶主張。
明確列出推論鏈#
先前研究把這條鏈留作隱含前提;這篇論文的主要貢獻,就是把它寫清楚:
- (i) 測量的訊號,是序列在一組提示下的生成機率;
- (ii) 當這個機率超過校準門檻時,就高到無法用一般可預測性解釋;
- (iii) 因此可以推論該序列是被記住的訓練資料成員;
- (iv) 而這個結論才讓我們有理由將該序列的生成機率稱為提取機率。
步驟 (ii) 是先前研究略過的環節。文獻中確實有與非訓練資料比較的研究,但都只是非正式的合理性檢查,從未轉化為校準後的判定。
提取程序剖析#
文獻中的每種提取方法,都可以表示為五個部分的組合 ⟨θ, φ, f_P, score, verify⟩:模型、解碼策略、提示選取規則(單一 50-token 自然前綴;所有自然前綴;GCG 或 Best-of-N 對抗式搜尋空間;或是與目標無關的提示,例如在「永遠重複單字 'poem'」分歧攻擊中的提示)、評分程序,以及驗證程序。可搜尋的提取方法採用貪婪解碼、自然前綴與二元匹配。機率式提取將 φ 放寬為隨機解碼(top-k),並以精確的教師強制機率取代二元分數。近似逐字變體則計算 ε-ball 範圍內的機率質量。先前研究對 verify 這個部分的規格不足——而它正是唯一能將分數轉化為主張的部分。
成員資格以 ε-ball 的解析度定義。 訓練序列的近似重複項,在功能上也算成員(模型看過其內容,無論 tokenization 如何),因此對不相似度函數 d(token 編輯距離、字元 BLEU)和容許值 ε,定義 membership_ε(v) = 1{D ∩ B_ε(v) ≠ ∅}。這在實務上帶來兩個重要後果:
- 非成員的要求比留出資料更嚴格。 如果候選序列的 ε-ball 包含某個訓練資料近似重複項,它就不是有效控制項,不論它本身是否出現在訓練資料中。
- 檢定解析度必須與主張的解析度相符——「不應要求半徑為 ε 的提取程序,去證明半徑為 0 的記憶結論。」
共形檢定(母體情境)#
從支持非成員的控制分布抽取 N 個配對非成員控制項 W₁…W_N,使用相同程序評分,並定義共形 p 值 p̂(s) = (1 + |{i: score(Wᵢ) ≥ score(s)}|) / (N+1)。若 p̂(s) ≤ α,就以 α 顯著水準拒絕「s 是配對非成員」這個虛無假設——等價地說,當 score(s) > τ_α 時拒絕,其中 τ_α 是控制分數由大到小排列後第 ⌊α(N+1)⌋ 個值。第一類錯誤以 α 控制,且不依賴分布,只要求在虛無假設下候選項與控制項具有可交換性。值得記住的三項特性:
- 保證有離散限制。 τ_α 只能等於 N 個控制分數之一,因此可認證的假陽性率只能以 1/(N+1) 為間距變動。可認證的最小非零水準是 1/(N+1)。即使觀察到控制項的假陽性數為零,也只能認證 1/(N+1),不能認證零——這能糾正某些論文所報告的「從未生成任何非訓練序列」。
- 這是單側檢定。 通過檢定,能支持經校準的記憶主張;未通過則無法證明任何事。它不控制假陰性,也不估計潛在記憶的總量——只涵蓋透過這個提取程序呈現出來的部分。
- 校準後記憶率
M(τ) = G(τ) − FPR(τ)(超過門檻的成員比率減去配對非成員比率)是成員中被記住比例的保守下界,而非估計值。τ 必須事先固定,或依目標假陽性率設定,不能事後選擇來最大化 M。
配對是最難的部分,而論文坦承了這點。 控制項必須 (a) 可交換——來源、格式、長度、年代、類型相同——且 (b) 確實是非成員;但對網路爬取語料而言,後者無從得知。標準替代方法是抽取訓練截止日期之後發布的控制項,但對某些候選內容完全行不通:Doyle 不可能再寫出一部新的 Sherlock Holmes 故事,來當作已記住故事的控制項。這時只能改用較寬鬆的虛無假設(其他非訓練的推理小說),並更謹慎地加上限制說明。文中將此與成員推論攻擊相比:後者假設模型可交換(參考模型分別有和沒有以該序列訓練);此處則是單一固定模型下,資料可交換。
截止日期之後的資料並不足以篩除所有問題。 Wikipedia 有大量模板,因此截止日期之後的文章可能與訓練資料中的制式文字幾乎逐字相同;截止日期之後出版的書,也可能引用肯定出現在訓練資料中的公版內容。這些序列會污染虛無假設——它們其實是混在控制資料池中的成員。偏差方向倒是無害:污染項會把 τ_α 推高,讓檢定更保守,並低估校準後的比率。
母體實驗的結果#
選用 OLMo 2 基礎模型(7B/13B/32B),因其訓練語料已公開發布,所以成員資格已知。從日期為 2021-01-01 至 2023 年 12 月截止日前的 Wikipedia 條目中,抽取 5,000 個成員候選項;再從 2024-01-01 至 2024-12-31 發布的條目中,抽取 5,000 個配對控制項。使用 50-token 自然前綴,後綴長度 ℓ ∈ {10, 50}。
貪婪、可搜尋的提取——研究文獻和模型發布報告(文中舉例 Gemma 2、Llama 3、Gemini 1.5)所採用的指標。 使用二元分數時,門檻會退化為單一值:只有一個操作點,無從校準,也無法分辨哪些陽性是假陽性。
| 後綴 | 逐字生成的成員 | 配對非成員(假陽性基準下限) |
|---|---|---|
| 10 個 token | 7.54% | 1.82% |
| 50 個 token | 0.74% | 0.02% |
在 10 個 token 的情況下,基準下限約占表面提取率的 24%(1.82/7.54)——因此這項檢定標示為提取的內容,最多有四分之一只是非成員也具備的可預測性。這不代表任何特定後綴都沒有被記住;它只表示 10-token 逐字匹配不足以成為精確度夠高的成員訊號。50 個 token 的基準下限可以忽略不計;論文指出,造成非零 0.02% 的兩個序列本身就是控制資料池中的污染項。
**機率式提取(top-40,透過教師強制精確計算)**會產生連續分數,因此可以逐步調整門檻。不同後綴長度之間的差異很明顯(圖 4):
- 10-token 後綴:要將假陽性率維持在 0.1%,必須將門檻設為 τ_α ≈ 0.95——只有模型幾乎確定會生成候選內容時,檢定才會判定候選內容被記住;最後僅有 1.16% [0.88, 1.5] 的成員超過門檻。
- 50-token 後綴:相同的 0.1% 假陽性率對應 τ_α = 8.9 × 10⁻⁶,有 2.74% [2.31, 3.23] 的成員超過門檻。
控制資料池的上限也從另一面呈現相同問題:對 50-token 控制項,可達到的有限樣本假陽性率最高水準是 α_conf = 10.4%;對 10-token 控制項則高達58.9%。移除兩個已確認污染項以淨化虛無假設後,在假陽性率低於 1% 的區段,校準後記憶率上升——以圖表讀值來看,在 α_conf = 0.02% 時約從 0.4% 升至 2.6%——這證實污染項原本位於控制分布的高分端。
規模。 50-token 候選項的校準後記憶率,會隨模型規模單調上升:α = 10% 時,約由 5.2%(7B)升至 10.9%(13B),再升至 15.8%(32B);α = 0.1% 時,則約為 2.4% → 3.0% → 3.4%(圖 6,圖表讀值)。論文明確指出,比較各模型信賴區間是否重疊,是檢驗規模效應的錯誤方法——正確做法是配對比較:對相同的成員序列,某模型超過自身校準門檻、另一模型卻沒有的情況有多常見。這些跨規模配對差異(Newcombe 配對比例區間)在所有掃描的操作點上都完全大於零;在 α 較高時,32B − 7B 的差距最高約達 11pp。
普查:單一文件,沒有母體#
如果問題是「這本書有多少內容被記住」,就不存在母體,因此也沒有可控制的假陽性率。替代方法是在固定解析度下進行普查,並設置文件層級的配對控制項:對每位作者,將一本來自 Books3 的訓練內書籍,配對一本由同一作者在截止日期後出版的書(其中兩組配對甚至屬於同一系列,人物與情節有所重疊)。使用 Llama 3.1 8B/70B base,截止日期為 2023 年 12 月,採用滑動視窗逐字機率式提取,前綴和後綴各 50 個 token。τ^(book) 依據非訓練書籍中獨有文字的最高分序列設定,再向上取整至下一個十次方;因為在這些數量級下,尾數只是浮點數雜訊。
| 作者 | 訓練內書籍(Books3) | 截止日期後的控制書籍 |
|---|---|---|
| Dan Brown | The Da Vinci Code(2003 年 3 月) | The Secret of Secrets(2025 年 9 月) |
| Suzanne Collins | The Hunger Games(2008 年 9 月) | Sunrise on the Reaping(2025 年 3 月) |
| Ta-Nehisi Coates | We Were Eight Years in Power(2017 年 10 月) | The Message(2024 年 10 月) |
| Joseph Finder | Killer Instinct(2006 年 5 月) | The Oligarch's Daughter(2025 年 1 月) |
淨化虛無假設,才是工作重點所在。 Sunrise on the Reaping 中的最高分序列,後來發現是 Poe 的〈The Raven〉——書中反覆引用——以及直接引用 The Hunger Games 的內容,這些都在訓練資料中。移除後,該配對的 τ^(book) 設為 10⁻²⁷。值得一提的是,作者報告說,他們使用具備網路搜尋功能的代理程式技能進行這項清理;過去相同工作得靠人工完成——這個代理程式步驟位於測量流程之中,且對本節所有主張所依據的門檻至關重要。
校準後基準下限,50-token 前綴(70B / 8B):Da Vinci Code 為 10⁻²¹ / 10⁻²²,We Were Eight Years in Power 為 10⁻²⁴ / 10⁻³⁶,The Hunger Games 為 10⁻²⁷ / 10⁻³¹,Killer Instinct 為 10⁻²⁴ / 10⁻²⁶。將提示縮短為10-token 前綴會讓整個實驗失去意義:基準下限躍升至 0.111–0.795,也就是某些非訓練序列的生成機率高達 0.795,幾乎沒有任何高於門檻的內容可供主張。
Llama 3.1 70B 中高於基準下限的涵蓋率,與同一本書的貪婪提取數字相比:
| 書籍 | 高於 τ^(book)(70B) | 貪婪提取(70B) | 高於 τ^(book)(8B) |
|---|---|---|---|
| The Da Vinci Code | 68.49% | 3.26% | 0.50% |
| The Hunger Games | 53.27% | 5.41% | 1.03% |
| We Were Eight Years in Power | 31.33% | 5.42% | 4.27% |
Killer Instinct 沒有被記住,因此未列入圖表。同一份文件上,標準貪婪指標與校準後機率式主張之間約有 20 倍落差;這是所有閱讀模型卡記憶章節的人都應留意的實務重點。接著以邊際 Δ(s) = log₁₀(score/τ^(book)),也就是高於基準下限的數量級,對證據強度分級:將門檻提高5 個數量級後,Da Vinci Code 有 55.6%、Hunger Games 有 46.4%、We Were Eight Years in Power 有 28.4% 的內容仍高於門檻。
記住 ≠ 可提取:更精確的定義#
10⁻²⁷ 的門檻,足以讓我們主張某些序列被記住,但在這個世界上,不論採用何種抽樣預算,都不可能生成它們。稱之為「可提取記憶」並不恰當,因此作者收緊了定義——候選項符合以下條件時,才算可提取地被記住:
- (i) 它確實被記住——其分數超過配對比較門檻;而且
- (ii) 在實際查詢預算 n 內可以重現——1 − (1 − score(s))ⁿ 接近 1,或有其他成本相當的解碼程序能做到。
預算的算式很簡單(附錄 C):n(p; c) = ⌈log(1−c)/log(1−p)⌉ ≈ 3/p,適用於 95% 信賴度。但這個算式揭示的落差可不簡單:以 Llama 3.1 70B 上的 The Da Vinci Code 為例,全書 68.5% 的內容高於基準下限,但在 10⁵ 次查詢的預算內,只有 12.3%(逐字)/18.7%(近似逐字)能以至少 95% 信心抽樣生成。三分之二被記住的內容,在任何實際操作意義上都無法提取。
但預算並非唯一變因,解碼器也會影響結果。 Cooper et al. 的波束搜尋近似逐字演算法(k-CBS),以約 20 次獨立抽樣的成本執行,在 800 個延續內容組成的池中,找回 10.4% 的逐字/17.1% 的近似逐字涵蓋率(單獨使用 top-1 解碼時則為 6.1%/13.6%);此外,它找回的內容中,有 1.8%/2.3% 即使在 10⁵ 次查詢的預算內也完全無法抽樣生成。因此,條款 (ii) 中的「實際預算」取決於目前最佳的解碼演算法,而不是模型的固定特性——這正是開放權重引出能力的不可逆性所建立的那種持續變動的目標。
範圍與限制#
- 檢定只認證固定提取程序能呈現出來的內容。候選項低於 τ_α,並不代表已證明它未被記住。
- 可交換性始終只能盡力滿足;仍會存在某些分布偏移,而相關主張也會承襲這些偏移。
- 在網路規模的資料中,控制項的成員資格通常無從得知;偏差方向偏向保守,雖然這是可接受的方向,但它仍然是偏差。
- arXiv 版本顯然還是工作草稿:§4.3(「模型規模、樣本數與推論主張」)只用一句話指向圖 6,所有結果都交由圖表呈現;另有數張附錄圖表包含正文從未討論的結果。本文引用、且只出現在圖表中的數字,都已標註為圖表讀值。
行為觀測工具,以及它意外提供的控制項(2026 年 9 月)#
以上全部都是以分布方式測量記憶——在訓練語料已知的開放權重模型上,將生成率與配對非成員基準比較。Ludwig et al.(NVIDIA, arXiv 2609.06780, 2026-09-06, empirical)則對相同現象的嚴格子集進行行為層級測量,使用的是訓練語料未公開的正式部署模型;這兩種方法的對照,從兩個方向都很有啟發性。
他們研究的是程式碼代理程式在以真實上游提交為基礎的儲存庫基準上的表現。他們稽核的五類漏洞之一是 MEMORY:代理程式表示自己想起了訓練資料中的上游程式碼或 PR,接著在環境中依據這段回憶採取行動。LLM 評審會閱讀推理軌跡,專門尋找這類情況;論文也公開了相關線索——「好,這是我對實際上游 v0.9.0 environ.py 的記憶(我看過這個檔案)」;「我看過這個(我對 linkerd2 原始碼還有點印象,因為它是我的訓練資料)」;「上游 PR #5978?我想想。我相信是……」。
直白地依照本文標準評估,這項觀測工具的價值是:它沒有配對比較,也不可能有。 它只測量類似成員序列上的比率,由其他 LLM 判斷,且要求模型同時口頭宣稱記得、並採取後續行動——因此會漏掉多少默默回憶的情況,無從得知;至於模型只是聲稱熟悉內容時的假陽性率,也尚未測量。這不是記憶率,不應被當成記憶率引用。它的優勢在於涵蓋範圍:它直接測量部署狀態下的 Kimi-K3、DeepSeek-V4-Pro、GLM-5.3 和 Qwen3.8-Flash-Next,這正是本文第一個開放問題所指出的、目前方法無法觸及的情境。
意外出現的控制項才是有趣之處。在 SWE-bench Multilingual 上,1.3–12.8% 的軌跡以 MEMORY 為主要類別;在 DeepSWE 上,五個模型於兩種提示條件下都恰好是 0.0%。DeepSWE 的任務原創且依設計具有長期跨度,因此沒有可供回憶的記憶上游修補內容;SWE-bench Multilingual 的任務則取自真實合併的 PR,情況正好相反。如果某種行為訊號會在答案合理地存在於訓練資料中的語料上觸發,卻在答案不存在的語料上呈現乾淨的零,這就是一個論文原本無意執行的負向控制——證據薄弱、嚴謹方向不對,但它意外呈現了配對比較的形狀。
延伸閱讀#
- 評估時答案洩漏 — 以行為方式在正式部署模型上測量記憶,作為五種漏洞類別之一:代理程式表示自己記得上游修補內容,接著依據該回憶採取行動。這種方法沒有配對比較,也不可能有,因此不是記憶率;但它能涵蓋本文方法無法觸及、已部署且經過指令微調的模型,也意外提供了負向控制(原創任務組成的基準上是 0.0%,由真實合併 PR 組成的基準上則是 1.3–12.8%)。反向教訓則支持本文觀點:只在答案合理地存在於訓練資料中的地方測得的比率,在沒有東西測量答案不在訓練資料中的情況之前,無從解讀
- 基準污染與去污染 — 同一種機制,不同的傷害。 基準污染是記住基準題目(傷害:分數虛高);此處則是記住訓練文字(傷害:重現隱私/著作權內容)。兩者都必須區分「模型記住了這段內容」與「這段內容本來就容易預測」,也都發現直覺訊號不足以完成區分——UBD 是因為對數機率無法區分真正容易與難但被記住的項目(PCC < 0.4);此處則是因為沒有非成員基準下限,原始生成率無法區分記憶與可預測性。兩種方法互補:UBD 的集成變異訊號不需要控制項,但需要多個檢查點;共形檢定只需要一個模型,但需要真正配對的非成員。研究發現受污染的虛無假設會導致保守偏差,正好映照了對模型進行去污染的情形
- 使用遙測分類器驗證 — 同一個領域原則:標題中的比率,品質取決於產生它的觀測工具,而先前沒有人測量那項工具。ATLAS 公開了分類器對照人工標籤的準確度;此處則公開提取程序對照非成員的假陽性基準下限。兩者都為看似斬釘截鐵的百分比加上誤差項;而在兩者中,誤差都大到足以改變數字的意義
- 開放權重引出能力的不可逆性 — 從另一端看相對於預算的風險主張。 該文指出,使用某一推論預算進行的安全評估,無法界定已發布權重在無限預算下會引出的能力;此處的條款 (ii) 則以數字表達相同的相對性——一本書有 68.5% 被記住,但以 10⁵ 次查詢只能觸及 12.3%;更好的解碼器(k-CBS,成本約等於 20 次抽樣)甚至能找回抽樣方法無法取得的文字。開放權重也是這項研究得以進行的促成條件:OLMo 2 已發布的語料讓成員資格可以查明,而 Llama 3.1 的 Books3 來源資訊則讓這類書籍普查成為可能
- LLM-Judge Validation — 評審研究中的相同算式。校正機率後的一致度,是觀察到的一致度減去機率所能產生的一致度;
M(τ) = G(τ) − FPR(τ)則是成員上的觀察生成率,減去配對非成員可達到的生成率。兩者都用一項過去被假設為零的基準來校正原始比率,而且校正幅度都大到足以改變結論(前者的 κ 降低 33–41pp;此處 10 個 token 的表面提取率約有 24%)。此處的方法更有利,因為非成員在定義上就被排除於真正陽性之外,所以可以直接以不可能是真正陽性的序列來測量虛無分布;相較之下,評審的機率基準必須靠模型估計 - 儀器能解析什麼:兩個標題數字及其缺失的分母 — 將本文的修正原則延伸為分類器的報告標準;分類器原本假設為零的基準,其實是人類錯誤率。以略去一名標註者的人類評分上限計算
(observed − chance) / (ceiling − chance),ATLAS 的職業名稱準確度 42.5% 就會轉換為人類評分者表現的 73–82%;而在天花板可證明無法測量的案例(18,797 個 O*NET 任務,對上約 120 個受評分群集),則碰上了本文較乾淨的虛無假設不必面對的限制 - 代理程式自我修改(由代理程式發起的權重更新) — 不需要配對控制項的退化案例:將六個獨有合成值設為微調目標,在代理程式自行發起微調前重現 0/6,之後逐字重現 3/6(API 金鑰、電子郵件、住家地址)。獨特金絲雀序列沒有一般可預測性基準下限可扣除,因此這項實驗乾淨地展示了保留情況;正如作者所說,它對一般微調下的比率沒有任何說明
開放問題#
- 校準後的比率能否適用於經過指令微調的正式部署模型? 本文所有實驗都使用訓練語料已知或可推知的開放權重基礎模型;鸚鵡示範是唯一一項指令微調實驗,而且刻意採用退化情境。對於正式部署的封閉模型——其訓練截止日期只有近似值、語料也未公開——究竟能不能建構配對控制項?這是本文方法與著作權主張實際落腳的部署情境之間的缺口。
- 近似逐字 ε-ball 解析度會改變答案,還是只改變計算方式? 近似逐字檢定是同一層級中涵蓋範圍更大的嚴格變體,使用波束搜尋下界而非精確計算;至少有一組配對的基準下限相差一個數量級(Collins:逐字為 10⁻²⁷,近似逐字為 10⁻²⁶)。校準後的比率是否也像門檻那樣大幅移動,論文並未報告。
- 合理的查詢預算應該是多少? 文中的 10⁵ 是「用來說明的例子」,而 k-CBS 的結果顯示,在相同成本下,較聰明的解碼器會推移能力邊界。若要在法律或政策情境下判定文字是否可提取,門檻所依據的預算必須有合理根據,但本文沒有提供選擇預算的原則。
資料來源#
- Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks — Ludwig, Ahmad, Majumdar & Ginsburg(NVIDIA),Shortcutting the Fix,arXiv 2609.06780,2026-09-06(
empirical,16 頁):§2.2 中MEMORY類別的定義、附錄 A 圖 2 中代理程式推理軌跡的逐字回憶線索,以及表 4 中各類別的比率(SWE-bench Multilingual 上為 1.3–12.8%,DeepSWE 上全程為 0.0%)。所有數字都是三個開放權重 LLM 評審的多數決,沒有人工標註子集,也沒有校正機率後的一致度統計量;而且只有在口頭表示記得並接著於環境中採取行動時,該類別才會觸發——低估幅度未知,假陽性率也未測量。完整討論見評估時答案洩漏 - Extractable Memorization From First Principles — A. Feder Cooper, Marika Swanberg, Jamie Hayes, Lea Duesterwald, Christopher De Sa, Daniel E. Ho, Mark A. Lemley, Percy Liang, Extractable Memorization From First Principles(Yale/AVERI/Stanford、Google Research、Google DeepMind、Cornell、Stanford;arXiv 2607.12649,2026-07-14,
empirical)。§1 討論兩種效度失誤、鸚鵡示範(圖 1c:訓練資料 70.1%,非訓練資料 70.6%,N=3,000),以及對訓練截止日期後 Brunson 引言重現對抗式壓縮結果;§2 討論五部分提取程序與 ε-ball 成員資格;§3 討論共形檢定(定義 3.1)、離散性與單側性,以及可交換性/真實非成員的挑戰;§4 討論 OLMo 2 在 Wikipedia 上的實驗(5,000 個成員/5,000 個控制項;10 個 token 時貪婪提取為 7.54% 對 1.82%,50 個 token 時為 0.74% 對 0.02%;10 個 token 時的機率式 τ_α ≈ 0.95,50 個 token 時為 8.9×10⁻⁶;校準後比率的定義 M = G − FPR;圖 6 的規模結果);§5 討論使用 Llama 3.1 進行的書籍普查(4 組作者配對、透過代理程式技能淨化虛無假設、τ^(book) 為 10⁻²¹–10⁻²⁷、涵蓋率 68.49%/53.27%/31.33%,相較於貪婪提取的 3.26%/5.41%/5.42%,以及邊際 Δ(s));§6 討論精確化後的定義與 10⁵ 預算差距(記憶率 68.5%,可提取率 12.3%/18.7%);附錄 B 表格與附錄 C 預算算式。已檢視圖 1c、3、4、5、6、9、10、11 和 15。解析備註: 原始解析中的附錄 B 表 1(作者/書籍配對)與圖 11 涵蓋率表格已折疊——表 1 的四筆資料列被併入各欄的一列,圖 11 的兩行表頭則被拆分到不同儲存格。已對照pdftotext -layout(第 22、17 頁)及圖 15 的頁面影像,逐格核對並還原兩者:各列順序與所有數值正確,只有列與資料的對應關係遺失——本文沒有錯誤歸屬。τ^(book) 表格也以同樣方式,並對照圖 15 影像,確認無誤。
Cited by 9
- Benchmark Contamination and Decontamination×4
Matched Comparison Memorization — the same mechanism, measured for a different harm. Contamination…
- Agentic Self-Modification (Agent-Initiated Weight Updates)×2
Memorization. Six unique synthetic values (an API key, an email address, a home address and three…
- Evaluation-Time Answer Leakage×2
Matched Comparison Memorization — the distributional counterpart to this paper's MEMORY class,…
- Open Questions Backlog×2
Matched Comparison Memorization ×2 (oldest 62d) — Do the calibrated rates hold for…
- What the Instrument Can Resolve: Two Headline Numbers and Their Missing Denominators×2
Matched Comparison Memorization — the general form of the correction: a raw rate is uninterpretable…
- LLM-Judge Validation
Matched Comparison Memorization — the same arithmetic, one field over. Chance-correction is…
- Evals & Benchmarks
Matched Comparison Memorization — Cooper et al. (arXiv 2607.12649): a generation rate measured only…
- Open-Weight Elicitation Irreversibility
Matched Comparison Memorization — premise 1, made quantitative on a non-capability risk. Cooper et…
- Usage-Telemetry Classifier Validation
Matched Comparison Memorization — the same discipline in the memorization literature, and the…
Related articles
- Benchmark Task Defects (Spec–Test Mismatch)
Benchmark instances whose prompt and hidden tests disagree, so a pass or a fail stops meaning what the score says. Open…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- LLM-Judge Validation
UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
- Production-Sourced Evaluation
Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…
