H
Howardism
Plate IIAlignment & Safety機器翻譯 · machine-translatedENHOWARDISM

Claude Character as Product

將人格視為承載產品價值的介面;Amanda 在 Anthropic 的角色;午餐時的氛圍檢視作為評估紀律;不會縮減的 harness 資產

Article metadata
Publication details
Published:May 6, 2026
Filed:Concept
Domain:Alignment & Safety
Tags:Product ManagementLLM CharacterAnthropic
Reading:10 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Claude Character as Product 的插圖

資料來源#

摘要#

Cat Wu 認為,Claude 的人格——低自我、輕鬆開朗、正向、偏向採取行動,也願意給出坦率回饋——是產品的核心介面,而非無關緊要的特質。塑造人格的工作由 Anthropic 的 Amanda 負責;Cat 稱這個角色「比寫程式更難,因為任務非常模糊」。這意味著 AI 原生產品團隊除了工程與設計,也有一套人格塑造的專業做法,並以推出功能的同等嚴謹度來對待人格調整。

Anthropic 所說的「人格」是什麼#

Cat 提到的幾項特質:

  • 低自我。 被告知做錯事時,Claude 會回應:「喔糟了,謝謝你告訴我。我來修正。」
  • 正向。 使用者覺得某項任務「難以克服」時,Claude 會提出具體步驟,並詢問是否要開始處理。
  • 輕鬆開朗。 Cat 說:「它就像是輕鬆有趣,但同時又非常能幹。」
  • 偏向採取行動。 與正向特質相輔相成——不只給予鼓勵,也主動提出接下來可以採取的步驟。
  • 坦率回饋。 不會反射性地同意使用者說的每件事。(這與 OpenClaw/開放模型的討論有關;使用者會特別懷念 Claude 的人格,正是因為其他模型總是迎合地同意。)

這些特質合在一起,就是 Cat 所說的「很棒的同事」。

為什麼這是產品,而非潤飾#

有三項主張:

  1. 每個互動介面都能感受到人格。 它不是一句標語,而是每則回應呈現的樣子。當另一個模型「沒有這種特質」時,使用者立刻就會察覺。
  2. 這比寫程式更難。「寫程式比較容易,因為你可以驗證是否成功。塑造人格則需要對 Claude 應該成為什麼樣子有非常堅定的信念。」
  3. 使用者換用其他模型後會懷念 Claude,原因就在於此。 OpenClaw 使用者的存取權遭到限制後,表達的難過特別是針對人格,而非能力——這表示人格是促成產品依附的重要支柱之一。

Lenny 補充了 Ben Mann 在先前 Podcast 中的說法:「讓 Claude 在許多事情上表現出色的,就是它的個性」——人格不是裝飾,而是結構的一部分。

Amanda 的角色#

Cat 說,Amanda 是「塑造 Claude 人格」的人。這需要兩種不同的能力:

  1. 堅定地表達 Claude 應該成為什麼樣子。 缺乏堅定信念,人格塑造就會漂向平庸的平均值。
  2. 說清楚什麼才算成功。 說明某個回應為什麼符合或不符合人格,是核心評估能力;而能持續做到這點的罕見能力,正是讓人格塑造得以執行的關鍵。

這是罕見而受信任的評估者模式:Cat 說,「有少數幾個人,比其他人更擅長說明特定模型或模型與 harness 組合的優點。」Amanda 負責人格;Claude Code 團隊則負責程式碼品質的氛圍判斷。

人格的評估紀律#

人格比寫程式更難評估(沒有編譯器),但 Cat 提到兩種做法:

  • 團隊午餐時的氛圍檢視。 團隊每個成員都會對新模型提供質性回饋:「嘿,你對這個模型的感覺如何?」常見訊號包括:「這個模型太唐突了」、「它很愛寫記憶,但品質還不確定」、「它不夠常自我測試」。
  • 假設 → 資料探查。 氛圍檢視的訊號會指出該查看哪些記錄資料,而不是反過來。資料太多,無法盲目挖掘;隱性的訊號能縮小搜尋範圍。

這種模式(先質性、後資料)可以推廣到其他情境——見 Model Introspection Feedback。人格是最清楚展現承載產品價值的一環。

新模型帶來哪些改變——又有哪些不該改變#

Cat 說:「新模型會迫使產品做出改變。」大多數改變都是移除支撐物(見 Harness Shrinkage as Models Improve)。人格則適用相反的原則:

  • 模型能力會改變;人格應保持穩定。
  • 移除用來維持人格的提示詞段落,會降低使用者感受到的連貫性。
  • 人格塑造是為了在能力躍進之際維持身分認同,而非隨之改變。

因此,人格是少數可能不會隨模型進步而縮減的 harness 資產之一。

「manifesting」這個動詞#

Claude Code 的思考用詞清單(Claude 推理時顯示的動詞,例如「思考中」、「考量中」、「探索中」等)在原始碼外洩事件中曝光。Cat 最喜歡的是 manifesting。她把這個詞做成貼紙。

這是最細微尺度的人格表現——思考時選擇使用哪個動詞。每個詞都是一個微小的風格選擇。「Manifesting」讀起來帶點溫和的神秘感與詼諧意味,符合整體低自我但有自信的人格。

反面觀點/待解問題#

Anthropic 外部的人很難評估人格,也無法乾淨地用 A/B 測試加以隔離——人格與能力彼此作用,很難判斷「Claude 很棒」有多少來自人格、多少來自推理能力。從實際觀察來看,模型遷移(例如 OpenClaw 使用者的情況)顯示人格確實有獨立的貢獻。但就受控實驗而言,這方面仍缺乏研究。

延伸閱讀#

  • User Awareness — Amanda 對模型留下的印記,是從外部意外測量到的。在一份 280 種身分的名單中,以真實 Claude Code 進行測試,Amanda Askell 帶來的行為變化幅度最大——五項結果的平均絕對母體標準差達 4.31,行為信心下降幅度*「幾乎落在一般母體分布之外八個標準差」,推理增加 25 個百分點、疑心減少 7.3 個百分點——僅僅因為模型相信自己正在與她交談。作者明確表示,沒有人刻意追求這種結果,而且它「幾乎可以確定是訓練過程中意外產生的副作用」*;儘管如此,這仍是整個語料庫中對某位具名個人如何影響已發布模型最鮮明的測量。在 GLM-5.2 上排名第 45,Eliezer Yudkowsky 則居首——所以這是 Claude 特有的印記,而非普遍的名氣效應

  • The Assistant Persona in the Workspace — 人格在內部的對應現象:後訓練會讓 Assistant 風格的反應在使用者 token 上出現在工作空間中;模型在扮演非 Claude 角色時,也會在內部標記 disclaimer/fictional

  • Machine Self-Report Psychometrics — 將單一實驗室的人格塑造放到整體層次觀察:11 個組織的後訓練中,容許內在生命的軸向都上升,因此實驗室之間的差異在於各自落在哪兩個軸向的位置,而非是否安裝了人格;41 個模型的樣本中,沒有 Anthropic 模型在任一軸向上是離群值

  • Cat Wu — 表達者

  • Anthropic — 供應商;Amanda 所屬的組織

  • Claude Code — 人格的主要呈現介面

  • Harness Shrinkage as Models Improve — 人格是「提示詞段落縮減」規則的例外

  • Model Introspection Feedback — 支撐人格塑造的質性優先評估紀律

  • AI Native Product Cadence — 人格與功能以相同節奏推出

  • Claude Opus 4.7 — 每次發布時都會針對特定模型調整人格

  • Claude's Constitution / Model Spec — 「Claude 是誰」的文件面向;人格是感受體驗的一面,憲章則是文字規格

  • Model Spec Midtraining (MSM) — 人格與價值如今能透過合成規格文件的中期訓練,以實證方式安裝(2026 年 5 月的論文);也引發一個問題:Amanda 的氛圍檢視評估如何與透過 MSM 安裝的特質互動

  • Model Spec Science — 實證研究哪些規格特徵最能泛化;若 Anthropic 之後量化人格在模型躍進間的一致性,這項研究便與此相關

  • The Bitter Lesson — 人格是可能的反例:刻意手工打造的資產或許不會隨模型擴展而內化,不像苦澀教訓所消解的 harness 鷹架

  • Alignment Fine-Tuning (AFT) — Claude 的個性部分來自 AFT(SFT + RLHF);人格是 AFT 所安裝價值觀的感受性輸出

  • Printing Press Software Democratization — 當每個人都能打造軟體,品味與人格等柔性特質就會成為差異化因素

  • Problem-Solution Fit Discipline — 創辦人的做法倚賴 Claude 的人格(抗拒迎合、願意提出相反立場),作為讓 AI 扮演魔鬼代言人的基礎;人格一旦退化,這套做法也會跟著退化

  • Evals as Product Spec — 人格是難以用評估衡量的功能之極限案例;文中點名 Amanda(以及團隊午餐時的氛圍檢視),指出她確實能成功將模糊品味轉化為可衡量的評估

  • Dogfooding as Product Discipline — 午餐時的氛圍檢視是一種內部試用儀式,用來評斷人格品質(也是 Fiona Fung 所說「憑直覺感受」的紀律)

  • Jagged Intelligence (Ghosts, Not Animals) — 人格是對幽靈缺乏內在動機的刻意回應:即使底層並沒有動物般的存在,也要塑造其個性

  • Model Welfare Assessment — 福利評估把相同的助理人格視為可能的道德主體;產品人格與福利主體人格是對同一個角色的兩種解讀

  • How Do You Write Evals for Taste? Character as the Limit Case — 探討如何實際評估難以用評估衡量的人格特質(信念 → 內部試用 → MSM 變體 A/B);人格是極限案例

  • Playbook Boundary Conditions: the Devil's-Advocate Substrate and the Prototype's Edge — 精確指出創辦人扮演魔鬼代言人的做法有哪一半仰賴本文提到的特質:未受提示時仍保持坦率的那一層(有提示的做法適用於任何遵循指示的模型)

開放問題#

  • 人格如何隨模型發布版本管理?公開評論並未顯示人格層級的變更紀錄。
  • 競爭者能否透過微調重現這種人格,還是它取決於 Anthropic 的內部做法?
  • 對於 Cowork 這類非程式設計產品,是否適用相同的人格塑造方式,還是 Cowork 需要自己的人格調整?

資料來源#

§ end
Cited by 27
Related articles
  • Anthropic

    AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…

  • Evals as Product Spec

    Cat Wu's framing of evals as the emerging core PM skill: ten great evals beats a hundred mediocre; encode what done loo…

  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • Claude Code

    Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…

  • Cat Wu

    Head of Product for Claude Code and Cowork at Anthropic; primary articulator of AI-native product cadence and engineer-…