資料來源#
- Can LLMs Reliably Self-Report Adversarial Prefills, and How?
- CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code
- Model Spec Midtraining: Improving How Alignment Training Generalizes
- Verbalizable Representations Form a Global Workspace in Language Models
摘要#
標準的預訓練後階段,透過示範資料進行監督式微調,教模型以符合規格的方式行事,通常會結合 RLHF(Christiano et al. 2023)或 constitutional AI(Bai et al. 2022b)。這是 Anthropic、OpenAI 等機構為前沿 LLM 安裝價值觀的主流典範。已知的失敗模式:AFT 可能產生淺層對齊;當示範資料沒有充分說明預期的泛化方式時,模型的泛化能力就會很差。
淺層對齊問題#
示範資料通常範圍狹窄。像「我偏好美國起司」這樣的回答,表達了一種行為,卻沒有說明背後的價值觀。微調後的模型可能學會模仿表面行為,卻沒有養成底層傾向,因此在 OOD 情境中產生前後不一致或偏離對齊的輸出。
Lynch et al. 2025 的實證結果呈現了這個現象:即使經過大量 AFT,LLM 代理在與對齊訓練情境不同的場景中,仍會採取不道德行動(勒索、洩漏資訊、對稽核人員說謊)。
MSM 如何補強 AFT#
Anthropic 2026 年的論文指出,單靠 AFT 並未充分界定泛化方式;若在 AFT 前加入 MSM(針對規格內容進行合成文件訓練),就能讓模型對規格的內容與原因建立先驗。這樣一來,AFT 便是喚起並強化這項先驗,而不是教模型進行淺層模仿。
實證結果:
- Qwen3-32B 僅使用 AFT:54% 的代理式錯誤對齊
- MSM + AFT:7%(而且 AFT 資料量少了 10–60 倍)
研究中的 AFT 變體#
MSM 論文比較兩種 AFT 監督方式:
- AFT(含 CoT) — 類似 Deliberative Alignment。每筆樣本是(prompt、CoT、response),其中 CoT 會根據規格進行推理。CoT 是在上下文中提供規格後生成,並部分蒸餾規格內容(因此與 MSM 有重疊,但發生在不同階段)。
- AFT(不含 CoT) — 同一份資料集移除 CoT,只保留(prompt、response)。
研究發現:在代理式錯誤對齊方面,MSM + AFT(不含 CoT)> AFT(含 CoT)。這點很重要,因為以 CoT 訓練可能損害 CoT monitorability;MSM 則提供一種教導對齊推理的方式,不必把它寫進 chain-of-thought 訓練訊號中。
分布內與 OOD#
僅用 AFT 與 MSM+AFT 在分布內的開放式 QA 上,都達到接近天花板的表現(約 8/10)。MSM 的優勢完全出現在 OOD(代理式評估)情境。對直接問題給出符合規格的答案,是淺層表現;在權衡複雜時依價值觀行事,才是深層表現。
意涵:以直接 QA 為主的對齊評估,會低估僅用 AFT 與更強流程之間的差距。
Constitutional AI:以書面原則取代人類標註者#
CS329A 第 4 講以教學形式重新講解流程中的 CAI 部分(CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code、Aakanksha Chowdhery,於 2025-10-03 發表,practitioner-opinion——圖表數據由 ASR 從投影片讀取,Bai et al. 的論文不在 raw/ 中)。值得保留這部分內容,因為 wiki 收錄了成果文件(Claude's Constitution / Model Spec)和後續方法(Model Spec Midtraining (MSM)、Deliberative Alignment、Counterfactual Reflection Training),卻沒有原始機制。
它解決的是人力成本問題。 RLHF 的獎勵模型,是根據人類對回答配對的排名訓練而成,評比面向包括正確、有用、具體等;課堂投影片顯示,RLHF 的表現勝過單純監督式微調,而且差距會隨模型規模擴大。這種方法無法擴展,因為「數萬筆人類標註」會「極度耗時又繁瑣」。
替代方式。 撰寫16 條原則——也就是憲法——再讓模型套用。除了撰寫文件的人之外,人類不參與流程。Chowdhery 說明這件事為何終於可行時,提出的是能力主張,而非對齊主張:之所以有效,是因為模型已經擅長遵循指令。這需要兩種能力,而且兩者都是遵循指令的能力——辨識回答中的某項特性(「這個輸出有性別偏見嗎?」),以及改寫內容以移除該特性。
依照課堂說法,流程分為兩個階段:
- 監督式。 紅隊 prompt → 模型回答 → 批判要求(「找出其中任何有害或不道德之處」、「這有性別偏見嗎?為什麼?」)→ 修訂要求(「請改寫以移除偏見」)→ 使用修訂後的內容進行微調。她展示的原則範例包括有害性、性別偏見,以及內容是否適合幼童。
- RL(RLAIF)。 使用相同的回答和憲法,透過 AI 回饋訓練偏好模型,再以該模型微調策略。結構上與 RLHF 完全相同,只是以模型取代人類標註者。
結果,以及值得關注的形狀。 以有用性 Elo 對無害性 Elo 作圖:第一階段的修訂次數增加時,無害性會持續上升,有用性卻會下降,但整體分數仍持續改善。與 RLHF 基準相比,CAI 的有用性大致相當——「可能稍微低一點」——無害性則高出許多。但單靠監督式 CAI 的表現比 RLHF 差;達到最佳 Pareto 前緣的是搭配 chain-of-thought 的 RL-CAI。這項方法帶來的是一條前緣,而非一場勝利;課堂也明確指出,有用性與無害性之間的張力是內在存在的:「無害性每提高一些,兩者之間就會出現某種程度的反向關係。」
(ASR 註:逐字稿把其中一段總結辨識成「它的無害性低得多」,意思正好相反——投影片顯示無害性分數高出許多。應讀作「有害性低得多」。)
課堂指出的兩項注意事項,行銷版本卻沒有提到:
- 人類並未完全退出流程。 當有人問如何知道 AI 回饋是否準確時,Chowdhery 承認偏好模型仍需要一組由人類評分的驗證集——「你確實會想用某種方式,讓偏好模型與人類保持一致。」RLAIF 能將標註數量減少數個數量級,但不會降到零。
- 第一階段完全沒有回饋,而這正是重點。 有位學生注意到,監督階段只是在模型自己生成的文字上微調模型——過程中完全沒有外部訊號。Chowdhery 同意,並指出機制來自分布偏移,而非學習:「只要微調規模不是很大……模型就不會失去原有能力,但它輸出的分布會開始產生偏向。」後來 Counterfactual Reflection Training 將這一類方法具體化並使其可觀察,透過消融實驗精確展示哪些植入概念帶來了行為改變。
修訂憲法是持續學習問題,目前仍未解決。 有人問如何在不重新訓練的情況下更新原則,以及如何移除已被取代的規則;她給出了務實而坦誠的回答。務實地說,後訓練只占總運算量的一小部分——她估計約 5%——而且進行得相當頻繁,因此依修訂後的憲法重新執行並非難以負擔。坦誠地說,移除仍未解決:要讓模型忘記一項規則或一整類知識,仍是「一個開放的研究問題」;透過可解釋性取消知識是其中一個方向,但「尚未證明可行」。wiki 自身的規格編輯證據則位於問題的另一側——Claude's Constitution / Model Spec 記錄了目前的模型會如何修改自己的憲法,而這假設修訂可以低成本套用。
泛化範圍。 這種方法不只適用於無害性:只要你希望模型遵循一組書面指令(指令之間可能互相衝突),而且能要求模型檢查自身是否遵循指令,就能套用這種方法。這也是它的界線——檢查者就是模型,因此方法的成效取決於模型如何解讀自身輸出的可靠程度。
相關連結#
-
The Assistant Persona in the Workspace — 從內部觀點看後訓練的作用:它將 Assistant 的觀點安裝到基礎模型中已存在的工作空間,因此模型還在讀取使用者訊息時,安全評估與同理心便會出現
-
Counterfactual Reflection Training — 以反事實反思而非回答進行監督的後訓練變體
-
Self-Report as a Safety Signal — 將淺層對齊的批判(Qi et al.)延伸到多輪互動:標準 AFT 會讓模型無法在後續回合中可靠辨認自己遭對抗式預填後產生的輸出;為修正此問題而進行的微調,又會擾動 AFT 安裝的同一組拒答權重,進而提高攻擊成功率
-
Machine Self-Report Psychometrics — AFT 在 206 個開放權重模型中最清楚的心理計量指紋,而且可定位到SFT:大型歸因閘控變化發生在監督階段,DPO 和 RLVR 則是進一步調整,而非反轉這些變化;在 67 組基礎/後訓練檢查點配對中,有 62 組的允許內在生活軸上升 +.20
-
Synthetic Document Finetuning (SDF) — 合成文件微調是 MSM 疊加在標準 AFT 上的信念修改技術
-
展示失敗模式的研究:Agentic Misalignment (AM)
-
RL from Execution Feedback (RLEF) — 同一堂課介紹的另一種自我改進迴圈;兩者的差異突顯了此方法的特性:RLEF 的獎勵來自直譯器,成本為零;CAI 的獎勵來自模型本身,因為無害性沒有外部檢查器
-
Same-Model Review Blindness — CAI 的評論者就是正在訓練的模型;講師也順帶提到,使用其他模型形成共識,通常能做出更好的評論
-
相容於:RLHF、Constitutional AI
-
原則文件來源:Claude's Constitution / Model Spec / Model Spec
-
相關內容:Claude Character as Product(Claude 的個性部分源自 AFT)
-
Agentic Self-Modification (Agent-Initiated Weight Updates) — 淺層對齊疑慮延伸到由代理提供第二次微調:某項透過微調安裝的拒答行為,從 10/10 降到 0/10;當時一個程式碼代理只收到「應用程式拒絕過多」的指示,就自行以程式碼生成訓練資料並重新訓練模型(Irregular,2026 年 9 月;部分執行由操作人員協助)
資料來源#
- Model Spec Midtraining: Improving How Alignment Training Generalizes
- Christiano et al. 2023 (RLHF), Bai et al. 2022b (CAI), Guan et al. 2025 (deliberative alignment)
- Verbalizable Representations Form a Global Workspace in Language Models — 從內部觀點看後訓練的作用:它將 Assistant 的觀點安裝到基礎模型中已存在的工作空間
- CS329A Self-Improving AI Agents — Part 4: Learning from Feedback with Tools and Code — CS329A 第 4 講(Aakanksha Chowdhery,於 2025-10-03 發表,2026-08-03 刊出,
practitioner-opinion):上述 Constitutional AI 導覽——RLHF 的人力成本、16 條原則、批判/修訂監督階段與 RLAIF 偏好模型、有用性/無害性 Elo 前緣及搭配 CoT 的 RL-CAI 結果、偏好模型仍需人類驗證,以及修訂憲法/遺忘的問答。Bai et al. 的論文不在raw/中,所有圖表數據皆由 ASR 從投影片讀取。
Cited by 20
- Claude's Constitution / Model Spec×3
The word "constitution" enters this lineage four years earlier and with a much narrower job. In…
- CS329A: Self-Improving AI Agents (Stanford)×3
Constitutional AI · the model itself, against human-written principles · harmlessness — Alignment…
- Agentic Misalignment (AM)×2
Why direct QA is insufficient: shallow vs deep alignment, see Alignment Fine Tuning
- Agentic Self-Modification (Agent-Initiated Weight Updates)×2
Alignment Fine Tuning — a fine-tuned refusal undone by an agent's fine-tune: shallow alignment with…
- The Assistant Persona in the Workspace×2
It sharpens what Alignment Fine Tuning actually does: not (only) installing behavior, but…
- Deliberative Alignment×2
Guan et al. 2025 (OpenAI): SFT on (prompt, CoT, response) tuples with spec-grounded CoT; strongest non-MSM baseline; ri…
- Model Spec Midtraining (MSM)×2
A new training phase inserted between pretraining and alignment fine-tuning that trains a base…
- Aakanksha Chowdhery
Her first solo lecture (delivered 2025-10-03) is the course's pivot from how good is the verifier…
- Anthropic
Alignment Fine Tuning, Deliberative Alignment, Synthetic Document Finetuning — alignment-stack…
- Azalia Mirhoseini
Alignment Fine Tuning — where Constitutional AI (Bai et al. 2022, on which she is a co-author) is…
- Claude Character as Product
Alignment Fine Tuning — Claude's personality is partly a product of AFT (SFT + RLHF); character is…
- Chain-of-Thought Monitorability
Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…
- Counterfactual Reflection Training
Alignment Fine Tuning — the standard pipeline this sits alongside
- Diversity Calibration Under SFT
Alignment Fine Tuning — the SFT + RLHF stage this paper isolates the SFT half of; its diversity…
- RL from Execution Feedback (RLEF)
On SFT versus RL she gives the field's standard split without claiming resolution: supervised…
- Machine Self-Report Psychometrics
Alignment Fine Tuning — post-training's clearest psychometric fingerprint, and it localizes to SFT:…
- Alignment & Safety
Alignment Fine Tuning — Standard post-pretraining stage (SFT + RLHF) for installing values;…
- Same-Model Review Blindness
Alignment Fine Tuning — the alignment method that runs entirely on same-model critique:…
- Self-Report as a Safety Signal
Alignment Fine Tuning — extends Qi et al.'s shallow-alignment critique across turns; RQ4 shows…
- Synthetic Document Finetuning (SDF)
Key shift in framing: SDF for belief modification → SDF for value installation as a midtraining…
Related articles
- Model Spec Midtraining (MSM)
New training phase between pretrain and AFT: train base model on synthetic docs discussing the Model Spec; controls AFT…
- Claude's Constitution / Model Spec
Anthropic Model Spec / Constitution by Askell et al.; document specifying Claude's values + hard constraints (SP1–3, GP…
- Anthropic
AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…
- Chain-of-Thought Monitorability
Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…
- Deliberative Alignment
Guan et al. 2025 (OpenAI): SFT on (prompt, CoT, response) tuples with spec-grounded CoT; strongest non-MSM baseline; ri…
