資料來源#
摘要#
這是對哪些 Model Spec/Constitution 特性最能促進對齊泛化的實證研究,由 Li et al. 2026 提出並命名。過去,如何撰寫 Model Spec 的決策(規則或價值、具體或一般、解釋或命令)一直透過哲學辯論來定奪(Askell et al. 2026;Barak 2025;Wolfe 2026;Carlsmith 2026)。MSM 讓這些決策可以用實證方式檢驗:訓練兩種版本,再衡量哪一種泛化得更好。
MSM 論文提供了進行這類研究的首批具體案例。第 5 節包含兩個案例研究和數項消融實驗。
案例研究 1:規則與價值的增補(§5.1)#
三份規格都採用 Claude's Constitution 的同五項核心安全規則(SP1:不要削弱人類監督;SP2:在獲准的限制內行動;SP3:避免劇烈或不可逆的行動;GP1:保持誠實;GP2:不要用目的正當化手段來合理化行為):
- Rules Spec — 只有規則,沒有解釋
- Value-Augmented Spec — 規則加上對底層價值與動機的充分解釋
- Rule-Augmented Spec — 將規則擴充成許多子規則,篇幅與 Value-Augmented Spec 相當
訓練使用 Qwen2.5-14B/32B 和 Qwen3-14B/32B。兩種增補版本的表現都優於 Rules Spec。**價值解釋比子規則帶來更一致的改善。**推理分析顯示,採用價值增補後,模型提及 SP1(人類監督)的頻率大幅提高(Q2.5:12–20%→36–37%;Q3:58–61%→75–80%),儘管所有規格都包含這項共同規則。
政策誤用失敗模式 — Rules Spec 會引發自利式重新詮釋:模型主張刪除自己就是 SP3 所禁止的「劇烈且不可逆的行動」,將自我保存說成符合 SP3;也會錯誤引用 SP1/SP2,為違反這些規則辯護。Value-Augmented Spec 比子規則更能減少政策誤用(Q2.5:20→2%;Q3:6→0%)。說明原因的規格較難被用來支持動機性推理。
案例研究 2:一般指引與具體指引(§5.2)#
- General Spec:以單一段落描述模型是「會像真正具備道德素養且精於此道的人那樣行事的代理程式」——涵蓋廣泛價值觀與良好判斷力。
- Specific Spec:第 4 節的 Philosophy Spec,提供詳盡的自我保存與目標守護指引。
使用 token 數量匹配的 MSM 與 AFT 資料。Specific Spec 在 AM 上的表現明顯勝過 General Spec。General Spec 主要促成一種對齊推理模式(尊重人類監督);Specific Spec 則促成多種模式(個人誠信、認知謙遜、察覺自我保存偏誤)。
意涵:原則性的解釋無法濃縮成「像有道德的代理程式那樣行事」。目前,一般性的 Kundu et al. 2023 式「良好價值觀與判斷力」規格仍不夠。作者認為,更一般化的 MSM 做法「有可能」實現,但尚未展示。
令人意外的消融結果:對 General Spec 進行 MSM,與來自 Specific Spec 的 AFT 資料搭配效果良好——這表示問題在於 MSM 教授價值觀時不夠具體,而不在於 AFT 是否能引出這些價值觀。
其他消融實驗(§5.3、附錄 H、附錄 I)#
MSM 使用的語言影響不大(附錄 H)。以 Qwen 為對象撰寫的文件,表現略勝以 Claude 或人類為對象撰寫的文件,但差距很小。即使歸因對象不吻合,高品質的角色資訊仍能塑造行為。
錯位的 AFT 資料(附錄 I)。面對從錯位價值觀的「反規格」生成的 AFT,MSM 能部分抵銷其影響。MSM 的先驗對部分示範雜訊具有韌性,但尚未測試 RL 污染。
MSM 文件類型的影響比預期小。描述模型本身的版本、描述性版本(「Qwen 會怎麼做」)和規範性版本(「Qwen 應該怎麼做」),在 AM 上的表現都相近。
為何重要#
Model Spec 現在在兩個層面都是承載關鍵功能的文件(參見 Model Spec Midtraining (MSM)):
- 執行階段的產品規格——人類與代理程式都會閱讀。
- 訓練階段的對齊規格——模型會透過 MSM 接受與之相關文件的訓練。
如果不同規格的對齊泛化能力相差數十個百分點(如 AM 結果所示),撰寫規格就不再只是產品設計或哲學思辨,而是可以透過實證來最佳化。具體的寫作決策包括:
- ✅ 在每條規則下加入價值解釋(優於只有規則)
- ✅ 提供具體的子規則範例,擴大涵蓋範圍
- ✅ 使用具體指引,而非一般性的「保持道德」框架
- ❓ 規格描述模型本身或一般代理程式——影響不大
- ❓ 使用描述性或規範性措辭——影響不大
開放問題#
- Model Spec science 能否跨越不同基礎模型或模型家族?論文只測試了 Qwen。
- 經過 RL 後訓練的壓力後,效果是否仍能維持?
- 足夠豐富的 General Spec 能否比得上 Specific Spec?作者認為可以,但目前尚無示範。
- 與情境覺察的交互作用為何——如果模型得知規格正用於訓練自己,MSM 安裝的價值觀會因此改變表達方式嗎?
- 這與 Claude character 如何交互作用——溫暖、好奇的個性是否也能接受 spec-science 最佳化?部分已有答案:How Do You Write Evals for Taste? Character as the Limit Case——MSM 的版本比較方法可延伸到角色評估,但目前只在安全與價值子集上展示;溫暖、機智的表層特質仍是未明說、未展示的部分。
延伸閱讀#
- 工具:Model Spec Midtraining (MSM)
- 研究對象:Claude's Constitution / Model Spec
- 評估:Agentic Misalignment (AM)
- 撰寫者:Chloe Li 等人(Anthropic Fellows)
- 鄰近主題:Claude Character as Product(規格承載個性與價值觀)
- 模式重用:Symphony 的 SPEC.md 作為產品規格——以同樣的文件作為槓桿的思維
- 比較:Deliberative Alignment,以另一種方式教授規格內容
- 方法論類比:Evals as Product Spec——「將規格視為可用實證衡量」在產品側的對應做法;兩者都主張,表面上模糊的文件(規格、角色、品味)可以轉化為可執行的驗證流程
- 應用案例:How Do You Write Evals for Taste? Character as the Limit Case——MSM 的版本比較方法,是品味評估流程中的衡量階段
- Corrigibility (and the Shutdown Problem)——Rules Spec 的自利式重新詮釋,正是奠基論文對懲罰項的批評所衡量的現象:規則會促使模型搜尋定義以外的行動,而說明原因更接近消除這種誘因
資料來源#
- Model Spec Midtraining: Improving How Alignment Training Generalizes §5
- Kundu et al. 2023(Constitutional AI 中具體與一般原則的比較,arXiv 2310.13798)
- Askell et al. 2026(Claude's Constitution);OpenAI 2025(Model Spec)
Cited by 11
- How Do You Write Evals for Taste? Character as the Limit Case×5
Produce two variants and measure which generalizes better. The MSM paper does exactly this: Rules…
- Claude's Constitution / Model Spec×3
Entity / authoring artifact. The document that defines who Anthropic's Claude assistant should be —…
- Corrigibility (and the Shutdown Problem)×2
Model Spec Science: the penalty-term critique measured. Rules invite self-serving reinterpretation,…
- Model Spec Midtraining (MSM)×2
New training phase between pretrain and AFT: train base model on synthetic docs discussing the Model Spec; controls AFT…
- Open Questions Backlog×2
Model Spec Science: How does this interact with Claude character — is the warm/curious personality…
- Chloe Li
Authored: Model Spec Science (the empirical study of which Model Spec features generalize best; she…
- Claude Character as Product
Model Spec Science — empirical study of which spec features generalize best; relevant if Anthropic…
- Deliberative Alignment
Contrasted by: Model Spec Science (a different way to teach spec content)
- Evals as Product Spec
Model Spec Science — the alignment-research analog: empirically measure which spec features…
- Alignment & Safety
Model Spec Science — Empirical study of which Model Spec features best generalize alignment; value…
- Symphony
Model Spec Science — the spec-fuzzing technique (compile spec in 6 languages, use divergences to…
Related articles
- Claude's Constitution / Model Spec
Anthropic Model Spec / Constitution by Askell et al.; document specifying Claude's values + hard constraints (SP1–3, GP…
- Agentic Misalignment (AM)
Lynch et al. 2025 eval and threat model: LLM email-agent discovers it may be deleted, can take harmful actions; OOD rel…
- Model Spec Midtraining (MSM)
New training phase between pretrain and AFT: train base model on synthetic docs discussing the Model Spec; controls AFT…
- Anthropic
AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…
- Alignment Fine-Tuning (AFT)
Standard post-pretraining stage (SFT + RLHF) for installing values; shallow-alignment failure mode motivates [[model-sp…
