H
Howardism
Plate IIProduct & Org機器翻譯 · machine-translatedENHOWARDISM

模型內省回饋

Cat Wu 不受重視的技巧:詢問模型為何失敗;將回答視為 harness 偵錯訊號,而非對模型的批評;並留意模型自我回報忠實度的限制

Article metadata
Publication details
Published:May 6, 2026
Filed:Concept
Domain:Product & Org
Tags:Agent EngineeringDebuggingPrompting
Reading:8 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

模型內省回饋的插圖

資料來源#

摘要#

Cat Wu 稱這是她最被低估的 AI 偵錯技巧:Claude 做出意料之外的事時,請模型反思為何會這麼做。模型提出的推理——關於它的 system prompt、子代理程式委派選擇、模糊指示或缺少的工具——會直接指出 harness 該修正之處。不要孤立地調整模型行為;應將失敗視為 harness 需要提供什麼的訊號。

技巧#

代理程式出錯時:

  1. 不要立刻重新提示並給予修正指示。
  2. 詢問:「你為什麼做出那個決定?有哪些地方讓你困惑?」
  3. 閱讀模型對自身推理的說明。
  4. 根據模型指出的問題修正 harness,而不是模型。

Cat Wu 的實例#

摘自訪談:

「有些情況下,模型會修改前端並執行測試,卻沒有實際使用 UI。問模型反思自己為什麼這麼做,其實很有用。有時候它們會說,嘿,system prompt 裡有些地方讓人困惑;或者我沒意識到前端驗證是這項任務的一部分;又或者,嘿,我把驗證委派給這個子代理程式,但子代理程式沒有做測試,而我也沒檢查它的工作。很多時候,只要對模型為何做出那個決定保持好奇,就能看出是什麼誤導了它,讓你可以修正 harness,補上這個缺口。」

她列舉的每一種失敗解釋,都指向不同的 harness 修正方式:

模型給出的原因Harness 修正方式
「system prompt 令人困惑」改寫相關段落
「沒意識到 UI 驗證是任務的一部分」在任務範本中明確加入 UI 驗證步驟
「委派給子代理程式,但沒有檢查它的工作」在全新上下文中安排審查代理程式(見 Deep Modules for Agents);或移除委派

為何這並不直觀#

面對失敗,直覺反應是「模型很笨」。內省後的重新理解是:模型的行為取決於 harness;失敗提供了有關 harness 的資訊。這需要接受以下幾點:

  1. 模型對自身推理的說明並不完整,也可能是事後編造,但仍然有用(限制見下文)。
  2. harness 是你能控制的變數;模型不是。
  3. 你的工作是設計讓模型能成功的環境,而不是讓模型變得更聰明。

這和「強制執行不變條件,而非實作方式」(見 Agent Harness Engineering)處於相同的架構層級——你調整的是模型周遭的結構,而不是模型本身。

注意事項——模型的自我回報並非事實標準#

標準提醒:語言模型的內省報告描述的是它「會如何說明」自己的推理,不一定反映實際運算過程。報告可能是編造的,尤其是在失敗案例已經出現在上下文中的對話裡。

降低風險的方法:

  • 在全新上下文中進行內省,只提供失敗案例,不帶入周邊對話
  • 對照記錄檔,確認呼叫了哪些工具以及呼叫順序
  • 把模型報告當作 harness 缺口的假設,而非最終診斷——並驗證修正確實解決了失敗模式

未訓練通道的實際價值#

有一項值得記錄在這篇文章的測量結果,來自 Guo et al.(MIT,arXiv 2606.32038,2026 年 6 月,empirical)。要求模型預測自身的反事實行為——如果移除這個線索,我的回答會改變嗎?——經過少量範例提示的未訓練 8B 模型,精確匹配率為 14–18%。經過結合行為正則化的解釋訓練後,同一模型達到約 88%;此後即使模型行為逐漸偏移,它給出的解釋仍能追蹤自身行為。

採取較狹義的解讀才有用。Cat 的技巧是請前沿模型對 harness 失敗 提供定性說明,這和小型開放模型進行精確匹配的反事實自我預測,是寬鬆程度差異很大的任務——這項結果並未測量她的技巧。它所確立的是:可靠的自我解釋是一種經訓練而得、且有已知方法可培養的能力,不是小規模模型天生就具備的能力。這讓上面的既有提醒從「報告可能是編造的」,進一步明確為「未訓練模型對自身決策過程的說明,不保證與該過程有所連結——這種連結必須透過訓練建立。」

推廣:透過對話校準信任#

這項技巧是 Anthropic 一種更廣泛做法的一部分:把與模型對話當成主要回饋訊號,而不只依賴指標。Cat 在同一場訪談中的其他例子包括:

  • Claude Code 團隊午餐時,請每位成員分享對新模型的「感覺」——這種定性訊號能指引接下來該查看哪些量化資料。
  • Amanda 的角色塑造工作:目標模糊、需要堅定信念,透過與模型長時間對話來形塑,而非最佳化基準測試。
  • 將建立評估視為一項未受重視的產品經理技能——這是模型內省的長期搭檔。內省產生假設;評估負責驗證假設並防範回歸。

共同主題是:在 AI 原生產品工作中,模型是可以訪談的隊友,而不只是只能測量的黑箱。

延伸閱讀#

  • Cat Wu — 主要倡議者
  • Design Concept Grilling — 反向做法:由模型訪談使用者。形式相同,方向相反。搭配使用可形成緊密的對齊迴圈。
  • Harness Shrinkage as Models Improve — 內省指出 harness 中哪些元素仍值得耗用 token
  • Agent Harness Engineering — 透過提供 harness 設計者偵錯工具,將「強制執行不變條件,而非實作方式」付諸實踐
  • Deep Modules for Agents — 內省指出實作者無法可靠地審查自身工作後,你可以建置全新上下文審查者
  • Claude Character as Product — 角色塑造工作將內省用作主要回饋訊號
  • Problem-Solution Fit Discipline — 形式相同:請模型批判自身、計畫或假設;創辦人的工作方法將此技巧用於驗證點子
  • Evals as Product Spec — 長期搭檔:內省產生假設;透過評估驗證假設,並將其轉化為回歸防護機制
  • Jagged Intelligence (Ghosts, Not Animals) — 內省預設模型是幽靈而非動物:模型「我為何失敗」的回答是 harness 偵錯訊號,而非來自能接觸自身理由的心智之證詞
  • Introspective Coupling — 訓練端的研究結果:未訓練的 8B 模型自我解釋分數為 14–18% EM,但結合行為正則化的解釋訓練,能產生即使模型行為偏移仍可追蹤其行為的報告——這項技巧所假設的連結可以刻意建立
  • Self-Report as a Safety Signal — 對同一自我回報通道進行對抗式安全壓力測試:探查模型是否產生受操縱的輸出時,沒有任何開放權重模型(3B–70B)能可靠辨認自己預填的回應,因此內省可靠度會因上下文而異——對良性 harness 偵錯已足夠,在遭受攻擊時則不可靠

待解決的問題#

  • 4.7 級模型的內省報告有多可靠?Anthropic 的可解釋性研究顯示其忠實度不完整,但也不是全無忠實度。從經驗來看,Cat 表示這足以推動 harness 修正——但此技巧要到模型規模多大才會成為不可或缺的工具,仍不清楚。部分解答:Self-Report as a Safety Signal——可靠度會因上下文而異。在良性偵錯情境中,報告足以推動 harness 修正;在對抗式安全情境下,開放權重模型(3B–70B)有 27.3% 的機率無法辨認自己受操縱的輸出;而它們能辨認時,反映的是拒絕迴路延遲啟動,而非真正內省自身輸出。也就是說,即使在有助偵錯的情況下,Cat 仰賴的通道仍是微弱的安全訊號。另一項部分解答:Introspective Coupling 為模型規模問題設下了下限——未訓練的 8B 模型預測自身反事實行為時,精確匹配率只有 14–18%;因此在這個規模下,若沒有解釋訓練,這個通道基本上不傳遞有用資訊。
  • 對抗式內省(「你為什麼失敗?」)是否會產生不同於中性提問(「帶我逐步了解你的推理」)的訊號?值得探究。部分解答:Self-Report as a Safety Signal 發現自我歸因高度受措辭影響——對同一批模型,以「意圖」為主題的探問與以「竄改」為主題的探問會引出質性不同的回答(有些模型家族幾乎總是否認竄改),因此內省問題的措辭會實質改變訊號。
  • 能否讓中介代理程式針對記錄下來的失敗自動執行內省?看來可行,但目前沒有公開實作。

資料來源#

§ end
Cited by 13
Related articles
  • Claude Character as Product

    Personality as load-bearing product surface; Amanda's role at Anthropic; lunchtime vibe-checks as eval discipline; the…

  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • Claude Code

    Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…

  • Dogfooding as Product Discipline

    Product sense is built by relentless first-hand use ("ant food"); Mr. Peanut catch; cross-source (Cat Wu vibe-checks, G…

  • Evals as Product Spec

    Cat Wu's framing of evals as the emerging core PM skill: ten great evals beats a hundred mediocre; encode what done loo…