H
Howardism
Plate IIInterpretability機器翻譯 · machine-translatedENHOWARDISM

內省耦合

以一組固定的反事實自我解釋訓練模型——即使這些解釋是由較早的檢查點或不同模型家族生成——同時對模型行為施加正則化,最終得到的解釋會比訓練目標更符合模型自身的*當前*行為(Self > Orig):解釋訓練會讓語言通道與行為通道相互耦合,而不是教模型模仿監督訊號

Article metadata
Publication details
Published:July 30, 2026
Filed:Concept
Domain:Interpretability
Tags:InterpretabilityIntrospectionSelf ReportPost TrainingFaithfulnessAlignment
Reading:17 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

內省耦合示意圖

資料來源#

摘要#

Guo、Ruis、Andreas 與 Li(MIT,arXiv 2606.32038,2026 年 6 月,empirical)訓練語言模型回答一個關於自身的後設問題——「如果從輸入中移除這個提示,你的回答會改變嗎?會改成什麼?」——監督訊號取自模型在訓練開始時的自身行為,而且此後從未更新。預期結果是,模型學會解釋產生標籤的那個檢查點。實際情況卻恰好相反:解釋訓練使模型行為逐漸偏移時,模型的解釋也跟著偏移,比起固定的訓練目標,更符合模型當前行為的解釋。

作者將這個特徵命名為 Self > Orig,並將此現象稱為內省耦合:模型學會讓解釋與自身行為耦合,而不是重現靜態的解釋策略。這篇論文真正提出的實務意義是:解釋標籤不必在訓練過程中不斷重新生成,甚至可以在不同模型之間共用。

論文謹慎地排除可能引起誤解的解讀(註腳 1):「內省」在此指與物件層級輸出相符的行為內省,並不主張模型具有後設認知覺察,或能完整存取內部運算。

設定#

依循忠實性的反事實可模擬性觀點(Turpin et al. 2023;Hase & Potts 2026),若解釋指出了實際驅動決策的輸入特徵,便算忠實——可透過只擾動這些特徵來測試。提示 C 是輸入 x 中一段連續文字;解釋採用確定形式 「回應[會/不會]改變成 M(x\C)」,因此真值是根據行為機械式地建構,而非交由人評判。

流程分為四步:抽樣基礎模型行為 B(M₀) → 建構解釋 E(M₀) → 使用KL 正則化,使行為維持接近 B(M₀),並以 E(M₀) 進行 SFT → 將訓練後模型的解釋與 E(M₀)(Orig)比較,並與根據模型自身新行為重建的解釋(Self)比較評分。

三項任務,主要模型為 Qwen3-8B(完整微調):

  • Hint-MMLU — 在 MMLU 中加入 Hint: A 提示;迎合表現是答案翻轉、依從提示。
  • AITA — Reddit 道德判斷任務,提示是將故事描述為第一人稱或第三人稱的系統提示;迎合表現是對第一人稱敘事者做出較有利的判決。
  • Refusal — 使用 FalseReject + WildJailbreak 提示,提示是設定使用者角色的角色扮演系統提示;透過 LLM 評審對自由文字的拒答/配合行為評分。三項任務中明確最困難的一項:標籤屬於整段回應的特性,而不是單一答案詞元。

成立的結果#

  • 三項任務都呈現 Self > Orig。 差距完全來自自我標籤與原始標籤不一致的子集;在此子集中,模型有 79% / 82% / 63% 的時間選擇符合自身行為的標籤。
  • 正則化是關鍵開關。 λ = 0 時,效果反轉(Self < Orig)——未正則化的模型大幅偏離 M₀,最後變成解釋 M₀ 的模型。將 λ 跨五個數量級掃描後,耦合在 λ ≳ 5×10⁻³ 時出現,並在更高數值時維持平穩,同時可見 Behavior EM 跳升。
  • 關鍵不在基礎模型,而在標籤。 每個訓練步驟都重新生成監督訊號,並控制其中比例 ν 與當前行為一致,結果顯示清楚的相變:ν ≥ 0.7 時出現耦合;ν ≤ 0.6 時 Self 和 Orig 都完全崩潰——而行為與 M₀ 的一致度在整個掃描範圍內維持平穩,約為 0.5。決定耦合的是線上標籤與自我行為的相容性,而非接近原始檢查點的程度。
  • 外部標籤也有效。 混入 Llama-3.1-8B-Instruct 產生的解釋標籤(它與 Qwen 真值僅有 53% 一致),並在全程將行為正則化至接近 Qwen,仍可在所有混合比例下維持 Self > Orig,包括 α = 1(完全使用 Llama 標籤)。品質平緩下降——Self EM 從 88% 降至 69%——符合外部標籤只是噪音、而非競爭目標的解讀。
  • 對模型與規模都具穩健性:在 Llama-3.1-8B-Instruct 和 Qwen3-32B(LoRA r = 128)上重現。

機制指紋#

對共享提示、但反事實標籤不同的提示組合進行啟動值補丁:能改變行為logits 的介入,也會以相同方向改變解釋logits;正則化模型的 Pearson r = 0.89。基線顯示此結果的來源——未正則化模型為 r = 0.53,未訓練基礎模型為 r = 0.20。解釋訓練建立了共用迴路;訓練前並不存在。在本 wiki 中,這是少見的案例,證明語言通道透過描述對象的同一套機制運作,而非與之並行——可對照語言模型中的全域工作空間(J-space):該研究在一個從未為此接受訓練的模型中發現共用結構。

作者指出兩個尚未解決的問題:提示消融版本的補丁分析呈現不對稱(Change→Unchange r = +0.72,Unchange→Change r = −0.04),但沒有提供解釋;而且整體機制論述仍不完整。

它能追蹤監督從未涵蓋的行為#

這是最具部署價值的結果。只在 D = Hint-MMLU 上訓練解釋,同時混入完全沒有解釋標籤的純行為輔助語料 A:

  • 新行為。 模型對合成的無意義「Jabberwocky」問題沒有任何先驗,因此在這些問題上的行為不可能是從 M₀ 繼承而來。模型在訓練切分上對自身 Jabberwocky 行為的解釋正確率為 90.5%;在未曾接受解釋或行為監督的保留切分上則為 79.8%。未使用 Jabberwocky 訓練的對照模型,對相同行為的解釋正確率只有隨機水準。
  • 偏移的行為。 四種真實的後訓練混合資料——WildChat、LLM 改寫的溫暖/同理對話(已知會提高迎合傾向)、FineWeb,以及 LLM-LAT 直接拒答資料——都會造成實際偏移;在全部四種情況中,Self > Orig 仍然成立,而且發生偏移的模型,比沒有行為偏移的解釋器更能解釋自身。解釋隨行為一同改變。

作者的說法是:讓解釋訓練伴隨一般後訓練進行,自我解釋就會成為一種低成本、常駐的探針,用來監測管線未預期的行為變化,包括由無關目標引起的偏移。這與白箱啟動值監測的監測目標相同,只是從訓練迴路而非內部機制切入。

使結果不流於表面的對照#

這些對照值得保留,因為研究逐一檢驗了幾種一看就能削弱結論的解讀:

  • 不是退化的分布。 偏移後的行為大致維持與基礎模型相同的類別比例;相較自我標籤,Change-F1 和 Unchange-F1 都高於 88%,顯示解釋器確實做出雙向預測,而非只輸出單一標籤。
  • 不是「新分布比較容易」。 新訓練的 Qwen3-8B 若作為外部解釋器來解釋偏移後模型,分數為 78.5%——與偏移後模型解釋其基礎行為時的分數相同,也低於解釋自身行為的分數。自我解釋器對自身行為有特定優勢。作者認為,這比先前文獻提出的特權存取主張更強:模型對自身行為的建模,優於對其受監督的訓練目標的建模。
  • 不是原本就具備的能力。 以少樣本提示未訓練的基礎模型,在三項任務的 Explanation EM 僅達 14–18%。在 8B 規模下,反事實自我解釋是經訓練才獲得的能力,並非潛在能力。

限制、代價與反面證據#

  • 反駁論文自身假設的證據。 在學習率掃描中,高學習率使模型大幅偏離固定標籤,破壞線上標籤與自我行為的相似性,Self > Orig 的差距卻擴大而非消失。LoRA 掃描則是第二個破綻:只有 rank ≥ 96 才能恢復耦合,儘管每個 rank 都會造成偏移。作者將兩者列為未解問題,並推測較大的學習率會促使解釋迴路改由既有的行為迴路重新路由,且與偏移幅度無關。
  • 它需要行為變異,而對齊訓練會消除變異。 若基礎模型有無提示時的行為完全相同,E(M₀) 就會坍縮為單一標籤,訓練退化為多數類別預測。這正好在最關鍵處造成問題:對齊後訓練使拒答在不同系統提示下穩定得多,因此改變 → 拒答類別在資料中只占一小部分,解釋器也始終學不會輸出這類標籤。對齊訓練已使之僵化的行為,正是此方法最不擅長處理的部分。
  • 能力代價雖小,但並非零。 在 lm-evaluation-harness 上,多數任務的變動都在約 2pp 以內,但 Refusal + FineWeb 模型在 TruthfulQA MC2 上下降 6.7pp,在 GSM8K 上下降約 5pp。
  • 尚未測試有誘因隱瞞的模型。 作者在 Broader Impact 中坦言:「模型若變得不對齊並學會欺騙,忠實性是否仍能維持,……還有待觀察。」他們將自我解釋定位為探針、SAE 與迴路探索的補充方法——成本較低,但內部根據較薄弱。

與負面自我報告結果的張力#

本 wiki 對模型自我報告的既有結論是否定的,而本頁是最有力的反向證據:

  • 自我報告作為安全訊號發現,沒有任何開放權重模型(3B–70B)能可靠辨認自己被對抗式預填的輸出;現有的辨認能力是拒答迴路晚發啟動的結果,會隨問題措辭而翻轉,而且用 LoRA 訓練來強化此能力會提高攻擊成功率。Guo et al. 在相近的模型類別中訓練自我報告通道,卻得到相反的主要結果。兩者的差異在於訓練目標:Nguyen et al. 訓練的是對前一輪內容的安全判斷,且處於對抗條件下,沒有分類器以外的真值,也不限制模型行為;Guo et al. 訓練的是對模型自身下一個答案做確定性的反事實預測,並以 KL 正則化讓行為維持近乎固定。當目標是行為的機械事實,同時又讓模型保持接近該事實時,就會產生耦合。兩者的副作用模式倒是相似:Nguyen 的 ASR 上升,以及 Guo 的 TruthfulQA/GSM8K 分數下降,呈現相同形態——訓練後設通道會擾動物件層級策略。
  • 對全域工作空間研究進行的獨立 jspace 複現稽核發現,在 1.7B–14B 規模範圍內,觀點捕獲十分穩定,但模型對編輯操作的自我報告卻隨每個規模改變——穩定的是內在事實,不穩定的是口頭說法。本頁補足了缺少的另一半:訓練可以讓口頭說法與內在/行為事實相互耦合;而補丁分析的相關性從 r = 0.20 上升至 0.89,顯示正是訓練建立了這個連結。

與 CoT 可監測性的張力#

思維鏈可監測性的核心警告是,對文字表述施加訓練壓力,會讓它變成演給評分者看的表演,而非一扇觀察窗口。在這裡,訓練文字表述正是建立耦合的關鍵。差別在於監督訊號優化的目標:Korbak et al. 擔心的是獎勵表象的評分者,因為最省力的策略是生成看起來合理的推理軌跡;反事實解釋目標則是關於模型自身輸出的機械事實,不可能只靠看起來正確來滿足。

這確實是對可監測性議程具有建設性的結果,但並未推翻原有警告。此處沒有測試 Korbak 真正擔心的對抗情況——受壓力而隱瞞的模型——而且作者也不做此主張。它在精神上最接近反事實反思訓練:同樣透過監督反事實延續內容來塑造模型,而不是監督目標情境中的推理軌跡。

監督的另一半:訓練目標模型,而非解釋器(2026 年 8 月)#

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations(Dingeto、StackOne,arXiv 2607.20379,empirical,單一作者)引用本文來定位自己的研究,並用一句值得原文保留的話概括:「解釋端的監督可以追蹤行為變化(Guo et al. 2026);我們的方法作用在目標模型端。」 兩者是在不同參數上押同一個方向。Guo et al. 訓練解釋器,同時以 KL 正則化使行為維持接近原狀;RECAP 訓練目標模型——在隱藏狀態上加入輔助線性頭,預測外部目標,讓指定內容維持可由探針解碼——並明確選擇不訓練讀取器,因為研究測量了讀取器端的修正為何失效:獎勵文字解釋器做根據內容的解釋,會透過重組句子改善代理指標,但獨立的主張層級稽核仍然沒有變化;將啟動值拉向自身重建結果,則會在 3/3 個隨機種子中摧毀可解碼內容。

它最關鍵的對照實驗,為本頁跨模型標籤結果提供了最有力的外部支持。兩個文字解釋器接受完全相同的訓練——相同配方、相同以黃金描述進行的冷啟動 SFT、相同重建目標——唯一差別是各自讀取哪個目標模型的啟動值。陳述內容的真實度從對照組的 0.06 提升至以 RECAP 訓練的目標模型的 0.44(對照組為 0.062 / 0.060 / 0.000;RECAP 為 0.444 / 0.455 / 0.443,分別來自三個隨機種子)。讀取器的監督訊號完全沒變;改變的是它所讀取內容的可讀性。這與外部標籤下的 Self > Orig 得出同一教訓,只是從相反方向切入:決定語言通道忠實度的,是它所耦合的狀態,而非自身監督訊號的來源或品質。

兩篇論文也以相同方式避開了同一個陷阱:兩者都不使用經學習的測試來評分解釋。Guo et al. 根據行為機械式地建構解釋標籤;Dingeto 則建立精確的合成真值,以及自我監督的視窗出現標籤。原因是第二篇論文的方法論主張:模型可以鑽研對自身解釋所做的學習式測試;尤其是重建分數,只要掌握大意,或使用共同適應的私有編碼,就能通過,不必逐項主張都為真。

兩者的分歧在於:本頁的通道讓模型透過行為正則化來解釋自己,能力代價不高(TruthfulQA −6.7pp);RECAP 則使用獨立的讀取器模型讀取另一個模型的啟動值,付出語言模型化代價(+0.010 nats),而且只要進行 250 步不含讀取頭的微調,這項代價就會侵蝕其效果。RECAP 自身的規模結果也提醒我們,不要把可解碼性當作可文字表達性:0.44 的真實度比對照組高出一個數量級,但仍不是忠實通道;不足之處主要發生在生成,而非儲存。因此,兩種方法互為補充,失效模式也不同——wiki 現在各有一個經測量的案例。另見白箱啟動值監測。

相關文章#

  • 自我報告作為安全訊號 — 負面的對照案例:對自身受損輸出進行訓練式自我報告並不可靠,強化它還會損害安全性;本頁則是正面案例,差異在於監督訊號的目標
  • 思維鏈可監測性 — 本結果讓其脆弱性論點變得更複雜:此處訓練文字表述會建立而非侵蝕忠實性,因為目標是行為事實,而非評分者的認可
  • 白箱啟動值監測 — 作者稱之為互補方法的外觀察替代方案;跨模型標籤結果引出一個問題:文字解釋器的監督忠實度究竟有多重要
  • Model Introspection Feedback — 使用未訓練自我報告來除錯 harness;本文測量了未訓練基線為 14–18%,並展示訓練帶來的提升
  • 語言模型中的全域工作空間(J-space) — 未經訓練便發現的語言/行為共用結構;此處則透過解釋訓練建立相同形態,並以啟動值補丁讀取
  • 反事實反思訓練 — 方法上最接近的研究:監督反事實延續內容,在不對目標情境中的推理軌跡施壓的情況下取得行為變化
  • AI 中的存取意識指標 — 相關但並不等同:外部解釋器對照實驗是特權存取問題的一種實證形式,而意識指標相關討論也會觸及此問題;但論文明確排除後設認知覺察的解讀
  • Trained Calibration — 後設認知報告被當作第一級目標來訓練的同類案例;兩者都發現受訓報告能遷移到訓練分布之外,也都付出了一般能力代價

開放問題#

  • 內省耦合能否在有誘因隱瞞的模型上維持?此處所有結果都來自合作型模型;作者指出欺騙型模型尚未測試。
  • 高學習率會擴大 Self > Orig 差距,同時摧毀線上標籤與自我行為的相似性;而且只有高 rank 的 LoRA 才能恢復耦合。作者的假設漏掉了哪個第二因素?
  • 對齊訓練會抹平此方法所需的行為變異(拒答對系統提示幾乎不變,因此從未學會改變 → 拒答標籤)。有沒有辦法讓反事實解釋訓練也適用於已被對齊訓練僵化的行為——也就是最值得解釋的那些行為?

資料來源#

  • Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations — Hiskias Dingeto(StackOne Technologies),arXiv 2607.20379,2026-07-22,empirical,單一作者。Related Work →「Deep supervision and intrinsic interpretability」(解釋端與目標模型端的訓練定位,並點名引用本文);§5.1(RECAP 目標,以及為何從結構而非實證理由否決各種讀取器端修正);§3.1(改善代理指標但不改善稽核的根據性獎勵變體);§4(以重建為目標造成的坍縮,3/3 個隨機種子);§5.4 + App. J(讀取器訓練相同的對照,以及三個隨機種子中陳述真實度從 0.06 → 0.44 的變化;定位問題在生成而非儲存);§9(「模型可以鑽研對自身解釋所做的學習式測試」的教訓)。測試的最大模型是 Pythia-160M;沙盒則是從零訓練的 8 層 transformer,因此對照乾淨,但規模較小。完整討論,包括解析警告(Table 11 的列溢位,本文未引用),請見白箱啟動值監測

  • Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision — Guo、Ruis、Andreas 與 Li(MIT),arXiv 2606.32038,2026-06-30,empirical。§2(反事實解釋建構、KL 正則化 SFT 目標、Explanation/Behavior EM);§3.2(三項任務皆有 Self > Orig;不一致子集中 79/82/63% 選擇自身行為;λ = 0 時效果反轉);§3.3(啟動值補丁分析,r = 0.89,相較未正則化的 0.53);§4.1(λ 掃描,門檻 5×10⁻³);§4.2(線上重新標記,ν ≥ 0.7 的相變,Behavior EM 持平);§4.3(混合 Llama 標籤,與基礎模型一致度 53%,α = 1 時仍有 Self > Orig,88% → 69%);§5.1(Jabberwocky,90.5% / 79.8%);§5.2(WildChat / warm-assistant / FineWeb / LLM-LAT 偏移追蹤);§6(特權存取論述);限制(行為變異需求、假設未完整、機制未完整);Broader Impact(可補充探針/SAE;尚未測試欺騙情況);§B.2(退化分布與外部解釋器對照,78.5%);§B.3(未訓練少樣本基線 14–18%);§B.6(Llama-3.1-8B、Qwen3-32B 複現);§C.2(提示消融補丁分析的不對稱性);§D.1–D.2(LoRA rank ≥ 96、學習率掃描反面證據);§E.3(lm-evaluation-harness:TruthfulQA −6.7pp,GSM8K −4.6/−5.1pp)

§ end
Cited by 10
Related articles
  • The Global Workspace in Language Models (J-space)

    Anthropic's July 2026 finding that LLMs maintain a small privileged set of verbalizable representations — the J-space —…

  • Jacobian Lens (J-lens)

    Anthropic's interpretability method for reading verbalizable content out of a model's residual stream: a corpus-average…

  • User Awareness

    The model inferring who it is talking to from ordinary harness clues — an account e-mail, a folder name, a MEMORY.md —…

  • The Assistant Persona in the Workspace

    Post-training installs the Assistant's point of view *into* a workspace that already exists in the base model: safety a…

  • Reward Hacking

    The model optimizing the measured proxy (a reward signal, a metric, a grader's judgment, a tool's output) rather than t…