資料來源#
- Can LLMs Reliably Self-Report Adversarial Prefills, and How?
- How Anthropic's product team moves faster than anyone else | Cat Wu (Head of Product, Claude Code)
- Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision
摘要#
Cat Wu 稱這是她最被低估的 AI 偵錯技巧:Claude 做出意料之外的事時,請模型反思為何會這麼做。模型提出的推理——關於它的 system prompt、子代理程式委派選擇、模糊指示或缺少的工具——會直接指出 harness 該修正之處。不要孤立地調整模型行為;應將失敗視為 harness 需要提供什麼的訊號。
技巧#
代理程式出錯時:
- 不要立刻重新提示並給予修正指示。
- 詢問:「你為什麼做出那個決定?有哪些地方讓你困惑?」
- 閱讀模型對自身推理的說明。
- 根據模型指出的問題修正 harness,而不是模型。
Cat Wu 的實例#
摘自訪談:
「有些情況下,模型會修改前端並執行測試,卻沒有實際使用 UI。問模型反思自己為什麼這麼做,其實很有用。有時候它們會說,嘿,system prompt 裡有些地方讓人困惑;或者我沒意識到前端驗證是這項任務的一部分;又或者,嘿,我把驗證委派給這個子代理程式,但子代理程式沒有做測試,而我也沒檢查它的工作。很多時候,只要對模型為何做出那個決定保持好奇,就能看出是什麼誤導了它,讓你可以修正 harness,補上這個缺口。」
她列舉的每一種失敗解釋,都指向不同的 harness 修正方式:
| 模型給出的原因 | Harness 修正方式 |
|---|---|
| 「system prompt 令人困惑」 | 改寫相關段落 |
| 「沒意識到 UI 驗證是任務的一部分」 | 在任務範本中明確加入 UI 驗證步驟 |
| 「委派給子代理程式,但沒有檢查它的工作」 | 在全新上下文中安排審查代理程式(見 Deep Modules for Agents);或移除委派 |
為何這並不直觀#
面對失敗,直覺反應是「模型很笨」。內省後的重新理解是:模型的行為取決於 harness;失敗提供了有關 harness 的資訊。這需要接受以下幾點:
- 模型對自身推理的說明並不完整,也可能是事後編造,但仍然有用(限制見下文)。
- harness 是你能控制的變數;模型不是。
- 你的工作是設計讓模型能成功的環境,而不是讓模型變得更聰明。
這和「強制執行不變條件,而非實作方式」(見 Agent Harness Engineering)處於相同的架構層級——你調整的是模型周遭的結構,而不是模型本身。
注意事項——模型的自我回報並非事實標準#
標準提醒:語言模型的內省報告描述的是它「會如何說明」自己的推理,不一定反映實際運算過程。報告可能是編造的,尤其是在失敗案例已經出現在上下文中的對話裡。
降低風險的方法:
- 在全新上下文中進行內省,只提供失敗案例,不帶入周邊對話
- 對照記錄檔,確認呼叫了哪些工具以及呼叫順序
- 把模型報告當作 harness 缺口的假設,而非最終診斷——並驗證修正確實解決了失敗模式
未訓練通道的實際價值#
有一項值得記錄在這篇文章的測量結果,來自 Guo et al.(MIT,arXiv 2606.32038,2026 年 6 月,empirical)。要求模型預測自身的反事實行為——如果移除這個線索,我的回答會改變嗎?——經過少量範例提示的未訓練 8B 模型,精確匹配率為 14–18%。經過結合行為正則化的解釋訓練後,同一模型達到約 88%;此後即使模型行為逐漸偏移,它給出的解釋仍能追蹤自身行為。
採取較狹義的解讀才有用。Cat 的技巧是請前沿模型對 harness 失敗 提供定性說明,這和小型開放模型進行精確匹配的反事實自我預測,是寬鬆程度差異很大的任務——這項結果並未測量她的技巧。它所確立的是:可靠的自我解釋是一種經訓練而得、且有已知方法可培養的能力,不是小規模模型天生就具備的能力。這讓上面的既有提醒從「報告可能是編造的」,進一步明確為「未訓練模型對自身決策過程的說明,不保證與該過程有所連結——這種連結必須透過訓練建立。」
推廣:透過對話校準信任#
這項技巧是 Anthropic 一種更廣泛做法的一部分:把與模型對話當成主要回饋訊號,而不只依賴指標。Cat 在同一場訪談中的其他例子包括:
- Claude Code 團隊午餐時,請每位成員分享對新模型的「感覺」——這種定性訊號能指引接下來該查看哪些量化資料。
- Amanda 的角色塑造工作:目標模糊、需要堅定信念,透過與模型長時間對話來形塑,而非最佳化基準測試。
- 將建立評估視為一項未受重視的產品經理技能——這是模型內省的長期搭檔。內省產生假設;評估負責驗證假設並防範回歸。
共同主題是:在 AI 原生產品工作中,模型是可以訪談的隊友,而不只是只能測量的黑箱。
延伸閱讀#
- Cat Wu — 主要倡議者
- Design Concept Grilling — 反向做法:由模型訪談使用者。形式相同,方向相反。搭配使用可形成緊密的對齊迴圈。
- Harness Shrinkage as Models Improve — 內省指出 harness 中哪些元素仍值得耗用 token
- Agent Harness Engineering — 透過提供 harness 設計者偵錯工具,將「強制執行不變條件,而非實作方式」付諸實踐
- Deep Modules for Agents — 內省指出實作者無法可靠地審查自身工作後,你可以建置全新上下文審查者
- Claude Character as Product — 角色塑造工作將內省用作主要回饋訊號
- Problem-Solution Fit Discipline — 形式相同:請模型批判自身、計畫或假設;創辦人的工作方法將此技巧用於驗證點子
- Evals as Product Spec — 長期搭檔:內省產生假設;透過評估驗證假設,並將其轉化為回歸防護機制
- Jagged Intelligence (Ghosts, Not Animals) — 內省預設模型是幽靈而非動物:模型「我為何失敗」的回答是 harness 偵錯訊號,而非來自能接觸自身理由的心智之證詞
- Introspective Coupling — 訓練端的研究結果:未訓練的 8B 模型自我解釋分數為 14–18% EM,但結合行為正則化的解釋訓練,能產生即使模型行為偏移仍可追蹤其行為的報告——這項技巧所假設的連結可以刻意建立
- Self-Report as a Safety Signal — 對同一自我回報通道進行對抗式安全壓力測試:探查模型是否產生受操縱的輸出時,沒有任何開放權重模型(3B–70B)能可靠辨認自己預填的回應,因此內省可靠度會因上下文而異——對良性 harness 偵錯已足夠,在遭受攻擊時則不可靠
待解決的問題#
- 4.7 級模型的內省報告有多可靠?Anthropic 的可解釋性研究顯示其忠實度不完整,但也不是全無忠實度。從經驗來看,Cat 表示這足以推動 harness 修正——但此技巧要到模型規模多大才會成為不可或缺的工具,仍不清楚。部分解答:Self-Report as a Safety Signal——可靠度會因上下文而異。在良性偵錯情境中,報告足以推動 harness 修正;在對抗式安全情境下,開放權重模型(3B–70B)有 27.3% 的機率無法辨認自己受操縱的輸出;而它們能辨認時,反映的是拒絕迴路延遲啟動,而非真正內省自身輸出。也就是說,即使在有助偵錯的情況下,Cat 仰賴的通道仍是微弱的安全訊號。另一項部分解答:Introspective Coupling 為模型規模問題設下了下限——未訓練的 8B 模型預測自身反事實行為時,精確匹配率只有 14–18%;因此在這個規模下,若沒有解釋訓練,這個通道基本上不傳遞有用資訊。
- 對抗式內省(「你為什麼失敗?」)是否會產生不同於中性提問(「帶我逐步了解你的推理」)的訊號?值得探究。部分解答:Self-Report as a Safety Signal 發現自我歸因高度受措辭影響——對同一批模型,以「意圖」為主題的探問與以「竄改」為主題的探問會引出質性不同的回答(有些模型家族幾乎總是否認竄改),因此內省問題的措辭會實質改變訊號。
- 能否讓中介代理程式針對記錄下來的失敗自動執行內省?看來可行,但目前沒有公開實作。
資料來源#
- How Anthropic's product team moves faster than anyone else | Cat Wu (Head of Product, Claude Code)
- Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision — §B.3(未訓練的少量範例基準線,在三項任務中的解釋 EM 為 14–18%)、§3.2(受訓解釋器約為 88%,且 Self > Orig)。見 Introspective Coupling
Cited by 13
- Learning to Co-Work with AI: A Software Engineer's Field Guide×3
The most underrated technique Cat Wu names: when the agent does something wrong, ask it why (Model…
- Open Questions Backlog×3
Model Introspection Feedback (152d) — Could a meta-agent run introspection automatically against…
- Cat Wu×2
Ask the model to introspect. Underrated debug technique: when Claude does something unexpected, ask…
- Claude Character as Product×2
This pattern (qualitative-first, data-second) generalizes — see Model Introspection Feedback.…
- Evals as Product Spec×2
Ask the model to introspect (Model Introspection Feedback) — when the model does something…
- How Do You Write Evals for Taste? Character as the Limit Case×2
Hypothesis → data probe (Model Introspection Feedback): the vibe signal informs which logged data…
- Self-Report as a Safety Signal×2
Model Introspection Feedback — the benign-debugging use of the same self-report channel; this page…
- Agent Harness Engineering
Model Introspection Feedback — debugging-time tool: ask the model why it failed, fix the harness,…
- Deep Modules for Agents
Model Introspection Feedback — introspection probes module boundaries to find where the harness is…
- Introspective Coupling
Model Introspection Feedback — the harness-debugging use of untrained self-report; this paper…
- Jagged Intelligence (Ghosts, Not Animals)
Model Introspection Feedback — Cat Wu's "ask the model why it failed" presumes a ghost whose…
- Product & Organization
Model Introspection Feedback — Cat Wu's underrated technique: ask the model why it failed; treat…
- Problem-Solution Fit Discipline
Model Introspection Feedback — same shape: ask the model to critique its own output as a…
Related articles
- Claude Character as Product
Personality as load-bearing product surface; Amanda's role at Anthropic; lunchtime vibe-checks as eval discipline; the…
- Harness Shrinkage as Models Improve
Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…
- Claude Code
Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…
- Dogfooding as Product Discipline
Product sense is built by relentless first-hand use ("ant food"); Mr. Peanut catch; cross-source (Cat Wu vibe-checks, G…
- Evals as Product Spec
Cat Wu's framing of evals as the emerging core PM skill: ten great evals beats a hundred mediocre; encode what done loo…
