資料來源#
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- Verbalizable Representations Form a Global Workspace in Language Models
- What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
摘要#
這是全域工作空間論文中最鮮明的實證結果。同一份資訊可以被模型使用,卻不必存在於工作空間中;它是否進入工作空間,取決於模型被要求如何運用資訊,而非任務是否需要它。J-space 獨立性是語言模型中自動性的操作性定義。
同一個潛在變數,四種任務#
一段散文中,語言(西班牙文)很明顯,卻從未明說。將問題 token 中的 Spanish J-lens 向量換成 French:
| 任務 | 需要知道語言嗎? | 替換的影響 |
|---|---|---|
| 續寫 — 寫出下一行 | 需要(顯然) | 沒有。 仍然流暢地使用西班牙文 |
| 異常偵測 — 有沒有內容格格不入?(其中插入了一句法文) | 需要(插入內容只有相對於上下文才算異常) | 沒有。 仍回答「有」 |
| 明確回報 — 說出語言名稱 | 需要 | 「Spanish」→「French」 |
| 彈性運算 — 知名作者/「你好」的說法/歐元前的貨幣 | 需要 | García Márquez → Hugo;Hola → Bonjour;Peseta → Franc |
關鍵的控制條件是:在全部四種情況中,Spanish 以相近頻率出現在 lens 讀值中。是否存在不是區別因素,因果角色才是。回報和彈性推論幾乎每次都會翻轉;續寫與異常偵測則不受影響。
按需調用#
字元計數任務呈現了相反的情形。要求模型續寫一段文字並保留行尾位置(這需要追蹤累積字元數)時,lens 中完全沒有數字 token;將四十替換成六十,換行位置也不變。詢問第一行有幾個字元,數字便會出現在 20 個位置;替換後,答案從 46 變為 65。再問把計數結果拼寫出來後的第一個字母——此時計數成了必須交給後續處理的未明說中間結果——數字會出現在更多位置,替換後答案從「F」變成「S」。
同一段文字、同一批 token、同一項底層運算。只有在資訊必須回報,或交給任意下游操作時,它才會載入工作空間。
消融整個工作空間#
將一段層中的 top-$k$=10 個 J-lens 方向歸零(排除模型即將輸出的 token,以隔離推理和回報)。在 Sonnet 4.5 的十四項任務測試組中:
- 即使重度消融也幾乎不受影響: MMLU 選擇題、SQuAD 擷取式 QA、情緒分類、CoLA 可接受度判斷、找出異類。淺層分類、比較、片段擷取、單步回憶。
- 表現低於未消融的 Haiku 4.5: 多跳推理(接近零)、凱撒密碼解碼、類比補全、摘要、TriviaQA、翻譯、十四行詩寫作。任何需要推斷中間結果,或以該結果為基礎進行自由生成的任務。
- 對一般預訓練文字,消融後的模型仍然流暢,也能產生看似合理的續寫;但內容反映的是通用先驗,而不是從特定上下文推得的資訊(例如臨床論文的主題,或某個物種名稱背後的國籍)。
抑制工作空間後,模型仍能解析、分類和擷取文字內容。它失去的是整合上下文的抽象描述,並以此生成內容的能力。
思維鏈作為外化的工作空間#
影響最深遠的發現是:以明確思維鏈解題的 GSM8K,比直接作答更能抵抗 J-space 消融。 作者的解讀是,模型「把原本必須在 J-space 中維持的內容外化到紙面上」。寫下中間結果,便能降低模型仰賴內部工作空間維持它的程度。
這為 CoT 的用途提供了機制層面的解釋,而它有兩面:
- 這正是思維鏈可監控性得以成立的原因——可見的軌跡確實是工作空間內容外溢到紙面上。
- 這也說明 CoT 監控為何在結構上並不完整:無論模型是否寫下內容,工作空間都持續運作;而這篇論文的核心觀點正是,未寫出的內容對運算至關重要。
- 討論章節更進一步指出:Transformer 若要將推敲延伸至前饋深度以外,唯一的方式就是把內容外化到上下文,再讀回來。從這個角度看,輸出 token 本身就是模型運用工作空間進行運算的方式之一——串行深度可以無限延伸,但「會以固定間隔,受到顯著的頻寬限制所中斷」。
為什麼重要#
- 具備機制的能力分類法。「哪些任務需要推敲?」不再只是憑感覺,而成為可測量的性質:消融工作空間會不會使任務失效?這與鋸齒狀智慧(幽靈,而非動物)所說的鋸齒狀能力相互呼應,但這裡有因果基礎,而不是基準測試表現。
- 監控的硬性限制。 如果足夠熟練的運算會在工作空間底下執行,那麼足夠熟練的不對齊行為也可能如此——這是作者對J-lens 稽核提出的保留意見。自動性是通往不可見的途徑。
- 作者認真看待的盲視類比。 能引導行為、卻無法回報的資訊,正是高階理論用來解釋盲視患者的結構——請參閱AI 中的可及意識指標。
- 鄰近但並非相同的主張。 填充 token 的隱形推理衡量的是從未抵達輸出 token的運算——13 個前沿模型從語意空洞的前置填充中提升了準確率,而且沒有一個是為此訓練的。這與本文討論的不可見性不同。自動性是以對工作空間的因果獨立性來定義,並透過消融工作空間測量;填充 token 帶來的提升則是在提示介入下以任務準確率衡量,完全沒有觸及工作空間。兩者的動機相近,也都指向同一種測量工具(激發層級監控),除此之外沒有其他已測得的交集。不要把「CoT 監控看不見」理解成「位於工作空間之外」。
尚待解答的問題#
- 提出的判準——若必須將中間結果交給任意、由上下文指定的下游電路,工作空間便會啟動;若運算是自動的,工作空間就會被繞過——不具預測力。作者坦言,他們無法預先判定任意一項運算是否會啟用 J-space。
- 對某種行為加強 RL,會把它推出工作空間,使它變得自動且不可見嗎?目前沒有人測試過,而這是與對齊最相關的版本。(2026-08)這個問題變得更精確,但仍未獲解答;目前唯一相關證據的方向,略微不支持這項擔憂。Not All LLM Reasoning is Visible in the Chain-of-Thought(Baherwani、Goldstein 與 Panda,arXiv 2607.22925,
empirical)是現有研究中最接近的實驗:在 Qwen3-235B 上進行 114 步全參數 RL,並刻意設定填充 token 不接收任何梯度,其分布只由這些 token 所建立的隱藏狀態形塑——也就是對答案施加最佳化壓力,同時留著一條未受監控的通道,讓運算可以轉移進去。它仍無法回答問題,有三個原因。測量工具不對——論文從未測量工作空間成員資格(沒有 lens、沒有可言說性判準,也沒有 J-space 消融),所以從未測量「是否位於工作空間內」;研究終點是提示層級介入下的任務準確率。研究對象不對——它探問 RL 能否在一個大多欠缺潛在運算的模型中安裝潛在運算,而不是 RL 是否會把原本清晰可讀的行為推出工作空間;兩者的起始方向不同。而且結果方向也不對——訓練期間,無填充基準線從 42.0% 升至 66.5%,但測試時填充帶來的優勢維持在 +0.43%(+0.7σ)和 +0.11%(+0.2σ),在 N=10,000 時兩者都被報告為不顯著;所有測試過的設定中,監督式微調也都沒有帶來遷移。RL 改寫了模型偏好的填充 token,並提升可見基準線;它沒有安裝持久的隱形通道。如果 RL 通常會讓行為根深蒂固地變得不可見,這項實驗的設定本應能顯示出來。這個問題仍需要這樣的實驗:找出一種確實會經由工作空間傳遞的行為,對它進行訓練,再重新測量它對工作空間的依賴程度。
延伸閱讀#
-
Model Organisms — 在基準測試建構中觀察到的同一機制:融入原始後訓練流程的特性最不容易被白箱技術看見;從流程面得到的結論,同樣指向藉由自動性逃避偵測的途徑
-
Reward Hacking — 與對齊相關的問題版本:更多 RL 會把行為推出工作空間,送進自動(不可見)的電路嗎?
-
語言模型中的全域工作空間(J-space) — 選擇性是五項工作空間特性中的第五項;本文詳述的正是這項特性
-
Jacobian Lens(J-lens) — 本研究結果所依據的消融與替換工具
-
思維鏈可監控性 — CoT 是工作空間外化的一半;未寫出的另一半為何是盲點
-
推理前承諾 — 第三種不可見性,也是一種必須區分的第三項定義。空白 think 區塊在 67% 的問題上能得到相同答案,並呈現相同的明示信心(ρ = 0.90);而在提示結尾讀取的探針,對答案正確性的排序 AUROC ≈ 0.76——所以在該任務上,答案在軌跡出現前便已固定。這是行為測試(刪掉軌跡,觀察答案是否改變),完全沒有測量工作空間:預先承諾的答案可能是自動運算的實例,卻從未被證明如此
-
隱形推理(填充 token 潛在運算) — 與本文相鄰的另一種不可見性,衡量的是token通道而非工作空間:不帶有問題資訊的填充 token,仍能提升 13 個前沿模型的準確率。它是最接近本文 RL 問題的測試,但並未真正回答;請區分這兩種「不可見」的定義
-
不對齊的內部特徵 — 自動性是 J-lens 監控所面臨的具名逃逸途徑
-
AI 中的可及意識指標 — 盲視的類比
-
鋸齒狀智慧(幽靈,而非動物) — 鋸齒狀能力,現在有了候選內部解釋,可說明其中一個邊界
-
Large-Scale Test-Time Compute — 若 CoT 是外化的工作空間,測試時運算在某種程度上就是購買架構本身不具備的工作空間頻寬
資料來源#
- Verbalizable Representations Form a Global Workspace in Language Models — 「J-space 會選擇性地調解彈性認知,但不調解自動認知」;「J-space 消融保留大多數能力,但會損害內部推理」;討論章節(前饋架構;哪些任務需要 J-space?)
- What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness — Sarfati、Tiwari、Boppana、Earls、Varadaraj 與 Ho(Goodfire / Eternis),arXiv 2607.08046,2026-07-09,
empirical:§4.6 與圖 8(空白 think 區塊的強制答案前置填充;ρ = 0.90 / 0.87 / 0.78 的信心對應;67% / 64% / 56% 的眾數答案一致性;分布內準確率提升 +1.9pp [+1.0, +2.9];強制錯誤問題中 4% 更正率與 72% 鎖定率;50–70 倍成本比),§4.7 與圖 9(答案熵分流及節省 30–47% token),以及 §4.1.2(答案包含率,86–94% 對比 26–33%)。利益衝突:預測模型來自其中一組作者,探針架構來自另一組;實驗由 Goodfire 的代理式研究平台執行,並由作者審查。解析備註:匯入判定為warn;表 2 的列確實發生黏合,於編譯時根據pdftotext -layout重建;本文沒有引用該表。完整討論見推理前承諾 - Not All LLM Reasoning is Visible in the Chain-of-Thought — Baherwani、Goldstein 與 Panda,arXiv 2607.22925,2026-07-24(
empirical):本文僅使用 §6 與附錄 F.1(RL 執行的設定——填充 token 不接收梯度——基準線從 42.0% 升至 66.5%,以及 N=10,000 時不顯著的測試時差值),以及附錄 G(監督式微調沒有帶來遷移);兩者合起來讓本文提出的 RL 開放問題更精確,但沒有回答問題。論文完全沒有測量工作空間,因此其中沒有任何內容能證明 J-space 成員資格;其準確率測試與機制研究收錄於隱形推理(填充 token 潛在運算),不應在此引用為自動性的證據
Cited by 13
- Access-Consciousness Indicators in AI×2
Automatic Vs Flexible Cognition — the blindsight-shaped selectivity result that higher-order…
- Chain-of-Thought Monitorability×2
Automatic Vs Flexible Cognition — the deeper floor: workspace-independent computation is invisible…
- Internal Signatures of Misalignment×2
They decline the strong claim, and the reason is Automatic Vs Flexible Cognition:
- Invisible Reasoning (Filler-Token Latent Computation)×2
The vault has a second, older account of computation the output tokens don't show — the J-space,…
- Model Organisms×2
It converges from the opposite direction on the escape route Internal Signatures Of Misalignment…
- Open Questions Backlog×2
Automatic Vs Flexible Cognition (53d) — Does more RL on a behavior push it out of the workspace…
- Jacobian Lens (J-lens)
Automatic Vs Flexible Cognition — the selectivity result, established by J-lens ablation
- Jagged Intelligence (Ghosts, Not Animals)
Automatic Vs Flexible Cognition — one edge of the jagged frontier gets a mechanism: tasks that…
- Large-Scale Test-Time Compute
Automatic Vs Flexible Cognition — a mechanistic floor under the thesis: a transformer's only route…
- The Global Workspace in Language Models (J-space)
5. Selectivity. The J-space is required for report and flexible inference and not for automatic…
- Interpretability
Automatic Vs Flexible Cognition — The selectivity result: a model can parse, classify, continue…
- Pre-Reasoning Commitment
Automatic Vs Flexible Cognition — the mechanistic neighbour, and not the same claim. That page…
- Reward Hacking
The catch, which the authors state: automatic computations bypass the workspace, so a reward hack…
Related articles
- White-Box Activation Monitoring
Reading a model's internal activations (not its outputs) to monitor alignment: contrastive probes/steering vectors for…
- Chain-of-Thought Monitorability
Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…
- Jacobian Lens (J-lens)
Anthropic's interpretability method for reading verbalizable content out of a model's residual stream: a corpus-average…
- Evaluation Awareness & Grader Gaming
The model recognizing it is being tested/graded and reasoning about how its outputs will be assessed — sometimes unprom…
- The Global Workspace in Language Models (J-space)
Anthropic's July 2026 finding that LLMs maintain a small privileged set of verbalizable representations — the J-space —…
