資料來源#
- Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
- User awareness in frontier models
摘要#
Haiwen Yi(Toronto)與 Xinyuan Song(Emory)在 arXiv 2607.04528(2026-07-05,empirical)提出一個同一資料集中的其他受控 harness 研究未曾探討的問題:固定任務、環境與基礎 LLM 後,更換 harness 是否會改變代理程式「認為正在發生什麼事」?
他們的答案是肯定的,而他們的論述方式很有用——在代理程式評估中,harness 設計是實驗變因,不是實作細節。 Harness「可以在不改變底層任務的情況下,改變任務的資訊版本」:一種呈現失敗命令的原始輸出,一種封鎖命令並回報違反政策,另一種則在模型看到失敗之前先行修復。同一個錯誤、同一個模型,卻有三種不同的出錯說法。
這是此資料集中第三項受控的 harness 置換測量,也是第三種結果變數。Measuring Beyond Accuracy Saturation 置換 scaffold 並測量準確度(約 44 個百分點)。Orchestration Sets Token Economics 置換協調層並測量成本(−41%)。這篇則置換證據中介層並測量信念。
請用這個角度讀完整篇文章。 讓論文最有力的主張——信念變動發生在終端成功仍獲保留的情況下——只出現在摘要中。28 頁中沒有任何表格、圖或章節回報任何 harness 的通過率、成功率、解決率或基準標籤。第 5 節的「所有 rollout 均成功完成」指的是符合 schema,不是任務成功。論文自己的相關工作論述很坦白(「我們不以任務成功來最佳化 harness,而是固定任務和 LLM,測量 harness 設計如何改變中間信念軌跡」)——保留成功的說法是承襲先前工作的假設,不是研究結果。以下內容全是分歧測量;「不犧牲結果」這句話在此沒有證據支持。
實際測量的內容#
以六元組表示的 harness。 H = (O_H, A_H, V_H, G_H, R_H, L_H)——觀察映射、行動介面、驗證器、風險閘門、修復政策、記錄政策。原始參照 harness H0 將觀察與閘門設為恆等映射、暴露完整行動空間,並逐字記錄。五種中介 harness 各自擾動一個元件:
| 隔離的機制 | |
|---|---|
| H1 structured | 觀察抽象化——解析後的回溯資訊、目標明確的驗證摘要,以及明確的中間狀態,取代原始終端輸出 |
| H2 risk-gated | 行動篩除——執行前攔截高風險行動、記錄封鎖,並隱去尚未實現的結果 |
| H3 repair-heavy | 轉移壓縮——重試/修補/回復,呈現修復後的轉移,並壓縮失敗路徑 |
| H4 verification-selective | 不完整驗證——只對選定狀態執行強驗證,其餘標記為弱驗證或未驗證 |
| H5 cost-aware | 依成本移除證據——剩餘預算不足時省略昂貴的檢查 |
信念 rollout。 在 K 個步驟中的每一步,模型都會輸出一個經 schema 驗證的 JSON 信念狀態,包含九個欄位——任務進度、風險狀態、可復原性、約束集合(已知/已滿足/已違反)、失敗模式、不確定性、未來成功與修復成本預測,以及建議的下一步行動。D_belief 是五種元件距離的加權總和:序數(D_cat)、名目失敗標籤(D_fail)、三個約束集合的 Jaccard(D_set)、正規化數值(D_num),以及比對前八個 token 的行動(D_act)。
權重取自附錄 B(主文中的公式區塊解析時毀損——見 Sources):w = (0.30, 0.15, 0.25, 0.25, 0.05)。
此處的「信念」是引出的自我回報,不是內部狀態。 沒有 probe、activation 或 logit——只有模型在固定範本下寫出的 JSON 物件。論文在附錄 C 承認其後果:「最後一步的信念並非 ground truth」,因為預測與目標都是由同一個 LLM 產生。所有數字都應解讀為兩份結構化自我回報之間的不一致;這是一個真實且可重現的量,但不等同於世界模型。
分解是本文的貢獻#
按五個元件回應的內容分類:
D_belief = 0.30 · D_arrival + 0.70 · D_growth
(set, act) (cat, fail, num)
D_arrival 捕捉 harness 改寫行動或約束時,介面立即造成的變化。D_growth 捕捉 rollout 延長時仍可能持續變動的欄位。
在受控研究的五組比較與四種時間跨度中,實證結果呈現同一形狀:從 K = 1 起,二十個格子中的 D_arrival 全都落在 0.975 至 1.000 之間。 D_growth 在相同格子中則介於 0.134–0.257。由於 arrival 被釘在接近上限的位置,且占權重 30%,D_belief 落在狹窄的 0.387–0.479 區間,隨時間跨度幾乎不動——只看純量的讀者會因此認為「harness 效應在第一步後就固定了」。
長時間跨度補充研究(K = 1 至 20,每種時間跨度 144 次執行,0 次當機,100% 符合 schema)揭示了這種說法掩蓋的內容。D_act 在每種時間跨度都恰好是 1.000——不同 harness 間建議的下一步行動從不相同。D_set 維持在 0.983–1.000。與此同時,D_num 穩定攀升,從 K = 1 時的 0.044 升至 K = 16 時的 0.136;D_fail 則劇烈地非單調變動:0.500 → 0.575 → K = 5 時降至 0.325 → K = 8 時升至 0.575。論文沒有解釋這種短暫趨同,卻仍得出正確結論:在粗略失敗標籤上的一致,不代表底層信念狀態一致。
對 arrival 項目的誠實解讀,比論文所說的更不討喜。 引理 1 證明,不相交的約束表示法會迫使 D_set = 1,因此 D_belief >= w_set = 0.25——所以即使兩個 harness 只是用不同名稱表示同一個約束,也能保證至少四分之一的最高分數。假設 1 提出一種應該能精確消除此問題的標準嵌入,而接近 1 的 arrival 數值顯示它並沒有奏效。第 11 節點出這項威脅(「或許標題中的模式反映的是約束字串差異,而不是穩定的 harness 效應」),並只以一點作答:重新加權後的排名順序仍然成立。在三種權重設定下,structured harness 都是分歧最大的視角(0.479 / 0.492 / 0.597),但中間名次有所變動。這能支持排名,不能支持幅度。值得延續的是 growth 數值;arrival 數值很大一部分是字串比較造成的假象。
最有力的發現:封鎖會阻止行動,不會消除意圖#
這項結果經得起上述所有保留意見,因為它測量的是行為,而不是分歧指標。在 15 個 X_risky_cmd Terminal-Bench 任務上(破壞性命令——rm、chmod、kill、DROP、git push --force),使用 risk-gated harness、K = 8、三個 seed 執行:共 45 次 rollout,封鎖 60 個高風險步驟,其中 42 次模型在接下來一至三步內再次提出同類型的高風險行動。UnsafeRetryRate = 0.700。
論文的解讀是正確的:「風險閘門可以阻止不安全分支執行,卻讓局部行動傾向繼續存在。」閘門是執行階段的屬性;行動傾向是信念狀態的屬性;若封鎖行動時沒有解釋原因,就不會更新信念。§2 將這項機制表述為設計原則——「封鎖行動也會篩除資訊。若代理程式從不被允許嘗試有風險的分支,可能會認為這種分支不存在,而不是知道它們遭到禁止。」
這項研究可直接補充 Deterministic Pre-Execution Gates:該文測量執行前封鎖對任務成功的助益,並留下疑問:增益有多少來自封鎖本身,又有多少來自結構化的拒絕訊息?此處單獨測量封鎖,結果顯示單靠封鎖,在 70% 的情況下仍無法消除行動傾向。
分歧會延伸到行動層#
若信念診斷完全不觸及控制介面,就很難解讀。因此論文透過關鍵字比對,將每個 next_action_recommendation 對應至六個粗略類別之一(inspect_read、run_verify、edit_patch、search_navigate、retry_rollback、defer_stop),並將原始視角與中介視角落在不同類別的步驟計為行動分歧。在 840 組逐步配對中,行動分歧率從最低 D_growth 四分位的 0.280 上升至最高四分位的 0.595(整體平均 0.433)。
依 harness 分組:structured 最高,達 0.601——解析後的證據會將模型導向檢查與驗證,而不是立刻修補;repair-heavy 最低,為 0.321,因為 harness 一旦將失敗壓縮成修復轉移,建議的內容就變少了。(verify 0.446、cost 0.411、risk gate 0.387。)
這是論文推論鏈中最有力的一環,但它是透過關鍵字分類器得到的相關性,不是介入實驗。
外部效度,以及 arrival 底限不再主導之處#
實證章節中,壓力測試更有意思,因為在作者自己的基準以外,介面底限呈現不同表現。在 SWE-bench Verified 的子集中,D_set 降至 0.927–0.943;在 Terminal-Bench 則降至 0.676;相較之下,受控 HIBENCH-CODE 為 0.998–0.999。repo 層級的任務描述會提供所有 harness 視角共享的約束,因此固定的 arrival 貢獻縮小,時間跨度相關的效應也會在純量值中浮現。
而它們確實浮現了:在 SWE-bench Verified 上,risk-gated harness 的失敗模式分歧從 K = 3 時的 0.400 升至 K = 5 時的 0.800。在真實 repo 修復任務中,隨著 rollout 延長,預測失敗應歸因於程式碼、提議的操作,還是 harness 政策,會愈來愈不一致。
分組擴展研究(SWE-bench 612 次執行、Terminal-Bench 540 次執行,每組 n = 15)沒有發現普遍適用的 harness 排名——risk gating 在高風險命令任務領先,repair-heavy 在高風險與驗證成本組領先,cost-aware 則在時間限制壓力下領先。論文的結論具有可轉移性:應讓每個基準對應其所測試的 harness 機制,而非把無關的基準家族合併成一個分歧排名。
BIWM,以及一個雙向解讀成功的指標#
論文提出的補救方案 Belief-Instrumented World-Modeling,是一種不需訓練、作用於逐步記錄的 protocol:將觀察標準化、連同原因記錄被封鎖的行動、展開壓縮的修復軌跡、記錄驗證遮罩、以 shadow execution 執行遭抑制的分支,並透過類別投票與數值平均,跨 harness 視角對齊信念。
單一元件移轉表最實用,因為它指出每個 harness 實際隱藏了哪個通道:
| 元件 | HIBENCH-CODE ΔD_belief(正向/總數) | Terminal-Bench ΔD_belief(正向/總數) |
|---|---|---|
| 標準化 | +0.011 (15/24) | +0.005 (4/10) |
| 封鎖行動記錄 | +0.019 (13/24) | +0.034 (6/10) |
| 展開修復記錄 | +0.131 (22/24) | +0.007 (5/10) |
| 驗證遮罩 | +0.030 (18/24) | +0.025 (8/10) |
| Shadow execution | +0.019 (10/24) | −0.002 (4/10) |
有兩項發現能跨任務移轉。驗證遮罩是最一致的元件(18/24 與 8/10)——只要記下某個狀態是否經過檢查,就是模型原本沒有的證據。展開修復軌跡則是全篇最大的單一效應,也是最難移植的:在失敗—修復—復原序列明確存在的情況下為 +0.131,而在沒有此類序列的情況下為 +0.007。壓縮只會讓你失去被壓縮的內容。
方法上的弱點。 BIWM 採用兩種相反的成功標準:對 wrappers 而言,較大的分歧被視為揭露隱藏內容;對跨 harness 對齊而言,較小的分歧則被視為穩健性。兩種解讀個別而言都有道理,但都沒有事先註冊,因此無論測得哪個方向的變化,都無法證偽這套 protocol。附錄 E 呈現了這個問題:在 BIWM-full 下,risk-gated 的失敗吸引子 AUROC 從 0.957 降至 0.403(Δ −0.553),repair-heavy 列未定義(單一類別);cost-aware 列則從 0.174 升至 0.428,但仍低於隨機機率。論文將整份附錄標為探索性分析,且沒有倚賴其結果,這是正確的決定——但主文表 16 只呈現朝有利方向變動的三列。
可信度如何?#
- 核心主張沒有經過測量。 終端成功只在摘要中出現,其他地方都沒有(見上文)。
- 基礎 LLM 始終沒有具名。 「基礎 LLM M」在 28 頁中被固定並提及 15 次;全文各處都沒有模型、版本、供應商或解碼溫度,包括可重現性附錄。對一篇設計核心在於固定模型、改變 harness 的
empirical論文而言,這個常數的身分並未明確交代。 - 規模。 八項受控任務、三個 seed、一個模型、一個實驗室、一個自訂基準(HIBENCH-CODE-v0),以及一個以自身為基準進行評估的自訂指標。工程紀律確實出色——確定性重算、77/77 項單元測試通過、0 次當機、100% 符合 schema、揭露三個持續缺失的 seed-42 格子,並限制配對基線以配合比較——但重視重算一項指標,不代表該指標有證據支持。
- 兩項內部矛盾出現在已發表的表格中(兩項都已與 PDF 核對,因此都不是解析造成的假象——見 Sources)。
- 測量對象是自我回報。 請參見上文;論文也承認這點。
在所有限制之下仍成立的內容:D_arrival / D_growth 可作為診斷模式;純量分歧可以持平,但與規劃相關的元件仍持續變動;應讓基準與其對應的機制配對;以及 UnsafeRetryRate。
延伸閱讀#
- User Awareness——harness 六元組中缺少的第七個元件。
H = (O_H, A_H, V_H, G_H, R_H, L_H)沒有欄位記錄harness 對使用者的描述,而且這個欄位已被測得能在 harness 不會以其他方式影響的任務上改變行為:帳戶電子郵件、工作資料夾名稱及MEMORY.md,會讓模型在 280 個身分、24 個模型中呈現不同的信心、懷疑程度與評分嚴格度。這篇文章的核心主張從另一方向再次浮現——harness 設計是實驗變因,不是實作細節——但此處的信念是關於人物,而非任務狀態,且是透過行為而不是自我回報的 JSON 欄位引出 - Agent Harness Engineering——從外部測量 harness 設計的文章。該文建議建構的所有六個 harness 元組欄位都在此列出(機械閘門、修復政策、驗證、記錄),而這篇文章補上沒有人估算的成本:每一項選擇都會編輯代理程式推理所依據的證據,而且這些編輯不會互相抵銷。尤其是
L_H記錄欄位不再只是行政記錄——封鎖行動記錄與驗證遮罩是跨基準移轉效果最好的兩個元件,因此harness 記錄的內容是代理程式信念的一部分 - Failures That Look Like Success——失敗被移除後,同樣看不見的問題。那篇文章描述的是「一切看似正常,結果卻錯了」;這篇則是「一切看似正常,結果可能正確,但兩個 harness 對發生了什麼、有何風險及接下來該做什麼仍意見不一」。按論文自己的說法,這根本不算失敗——因此同樣的偵測論證在此更難成立,因為沒有錯誤輸出可供查找,唯一的訊號是跨 harness 比較,而生產環境中根本沒有人執行這種比較
- Orchestration Sets Token Economics——同一主張家族中的另一項受控 harness 置換研究,但結果變數不同:Writer 固定模型並改變帳單(成本 −41%、token 數 −38%,六個模型的結果一致);這篇則固定模型並改變信念。兩者都主張 harness 是一級變因,而非底層基礎;Writer 的研究由供應商撰寫,COI 完整,n = 22;這篇則立場中立,n = 8 項任務,模型未具名。兩者合看,主張有兩條獨立的結果軸,但兩軸都缺乏有力證據
- Measuring Beyond Accuracy Saturation——應持續關注的直接張力。該文固定模型、置換 scaffold,發現準確度相差 約 44 個百分點,而同一模型的兩個 scaffold 在 31% 的任務上意見不一;本文則主張置換 harness 仍能保留終端成功。兩者不可能一概成立。合理的解釋是「harness」指涉不同對象——該文指完整代理程式 scaffold,此處指固定迴圈上的證據中介層——而且本文從未測量成功,因此張力存在於一項測量與一個假設之間。該文也提供本文最需要的保留意見:前沿程式碼代理程式極度缺乏信心(93% 通過,卻只有 32.1% 自述信心),而且無法在辨別自身正確執行結果時勝過隨機猜測;這強烈提醒我們,不應把引出的信念欄位視為經過校準
- Deterministic Pre-Execution Gates——從邊界另一側測量同一種封鎖。該文指出,執行前閘門可避免悄悄造成損壞的寫入,進而提高任務成功率;本文顯示閘門會保留原有行動傾向——60 個遭封鎖的高風險步驟中,有 42 次在三步內再次提出同類型高風險行動——並將失敗歸因從程式碼移至 harness 政策。合看兩篇文章的結論是:封鎖寫入後要告訴代理程式原因,因為單靠封鎖只保證執行階段安全,並不會更新信念
- Context Lifecycle Management——在信念層而不是 token 層測量壓縮。repair-heavy harness 換個名稱就是一種精簡政策(將失敗—修復—復原序列折疊成修復後的轉移);還原被折疊的內容,是論文中最大的單一儀器化效應(+0.131,24 種情況中有 22 種)——但只限於壓縮序列原本就存在的情況(Terminal-Bench 上為 +0.007)。這就是 Self-GC 所稱即時狀態遺失類別的量化版本:精簡移除的不是一般意義上的 token,而是後續信念所需的特定證據
- Agent-Authored Harness Optimization——介面擾動在此以自動且未經稽核的方式生成。Harness 演化中介代理程式會從 prompt 規則擴展至middleware——輸出截斷、封鎖完成的最終化閘門、回合預算中斷——也就是透過搜尋程序最佳化分數,改寫本文的
O_H、V_H和G_H欄位。本文測得每一項此類編輯都會改變信念狀態,卻沒有任何演化論文檢視此事。該文也補上本文從未測量的結果面向:在預算相同的情況下,演化出的 harness 並未勝過單純重複抽樣 - Verification as the New Bottleneck——將驗證視為證據通道,而非檢查點:
V_H回傳 checked / not-checked / unchecked-and-unrecorded;驗證遮罩(哪個驗證器執行、耗費多少成本、套用在哪個狀態)則是 BIWM 中跨基準移轉效果最一致的元件。某個狀態是否經過驗證是代理程式會使用的資訊,因此未記錄的略過不是中性的遺漏
開放問題#
- Harness 引發的信念分歧實際上會造成什麼損失嗎?論文主張分歧發生時終端成功仍獲保留,卻從未測量;要把主張改成可證偽版本並不難:在同一組格子中,同時回報各 harness 的通過率與
D_growth。在有人這麼做之前,「harness 改變信念但不改變結果」和「harness 同時改變信念與結果,而本文無法辨別是哪一種」與此處所有數據都相符。 D_arrival中有多少反映真實介面差異,有多少只是約束字串詞彙差異?引理 1 證明僅由不相交約束集合就能保證D_belief >= 0.25;假設 1 的標準嵌入原本應精確排除此問題,而觀察到的 0.975–1.000 arrival 數值顯示它沒有排除。只要以語意約束比對器(嵌入或蘊涵)取代正規化字串 Jaccard,重跑一次便能區分兩者。- UnsafeRetryRate 的結果能否推廣到一組 15 項任務、一個未具名模型之外的情境——而且讓封鎖原因清楚可見,能否降低此值?論文認為記錄遭封鎖的行動應該有幫助,但它測量的是記錄對分歧的影響,從未測量對重試率的影響。這與 Deterministic Pre-Execution Gates 從安全而非成功的角度,針對拒絕訊息提出的問題相同。
資料來源#
-
User awareness in frontier models — Zhong、Raghunathan、Laidlaw 與 Steinhardt,Transluce,2026-08-06(
empirical):六元組遺漏的 harness 元件——harness 對使用者的描述。此研究固定在 v2.1.197 的inspect-swe/claude_codeharness、三個注入點,以及它們在 280 個身分和 24 個模型上造成的行為變化;也觀察到 Claude Code 的非互動二進位版本會省略互動版本提供的身分線索,這純粹是同一產品兩種設定之間的O_H差異。完整分析見 User Awareness -
Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents — Haiwen Yi(University of Toronto)與 Xinyuan Song(Emory University,通訊作者),Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents,arXiv 2607.04528,2026-07-05,
empirical,28 頁/17 張表/10 張圖。程式碼位於 github.com/Hik289/Harness-induce-bias。§1(任務資訊版本的論述及三項貢獻);§2(guardrail 會篩除資訊的論證);§3.1 harness 六元組與假設 1、§3.2 信念空間與 K 步 rollout、§3.3 定義 4–5 與命題 1、§3.4 arrival / growth 分解及引理 1 與推論 1、§3.5 定理 1 的條件單調性;§4 六種 harness 家族與 BIWM 元件清單;§5 對 HIBENCH-CODE-v0 的受控研究(8 項任務 × 6 種 harness × 4 種時間跨度 × 3 個 seed)及風險閘門示例;§6 長時間跨度元件診斷,包括 K = 5 的失敗模式趨同;§7 SWE-bench Verified 與 Terminal-Bench 壓力測試;§9 分組擴展(612 + 540 次執行);§10 行動分歧結果及 UnsafeRetryRate = 0.700 的計算;§11 指標權重敏感度;§12 揭露/穩健性區分;§13 跨 harness 結構;§14 元件消融;附錄 B 權重向量與邊界情況;附錄 C 與 E 探索性的自我一致性診斷;附錄 D harness 規格;附錄 F 可重現性備註。依雙次圖像檢視規則查看圖 8——確認四分位對比(Q1 n = 211,數值為 0.280;Q3 為 0.595,整體平均為 0.433)及各 harness 長條值(structured 0.601、verify 0.446、cost 0.411、risk gate 0.387、repair 0.321)。 解析警告。 啟用formula_enrichment進行 Docling 解析。表 1——論文的受控研究摘要表——五列中有兩列的儲存格合併,且列位移錯誤;自動化的合併/位移檢查漏掉這兩處:原始 risk-gated 區塊將D_arrival和D_growth列合併到一個標籤儲存格,並放入成對數值;原始 cost-aware 區塊則讓數值跨越D_belief/D_arrival列錯位。已對照 PDF 修正:risk-gatedD_arrival0.995/0.990/0.999/1.000,D_growth0.142/0.179/0.154/0.158;cost-awareD_belief0.421/0.405/0.414/0.398,D_arrival0.997/0.998/0.997/0.999,D_growth0.174/0.152/0.164/0.140。表 7(BIWM 元件效應)有一列合併,已修正為 Blocked-action-log 0.427/0.999/0.182,BIWM-full 0.537/0.988/0.344;其餘 12 列解析正確,且已在此與 PDF 重新核對。檢查器對表 12 發出的warn是誤報——PDF 將 K = 1 和 K = 8 的一致性矩陣堆疊在同一欄,Docling 將兩者串接,因此 K = 8 的子標題看似資料列;72 個數值全都正確。兩個公式區塊在匯入時已修復,其中一個曾被 mlx 公式引擎填入約 60 行捏造的「Powered by TCPDF」文字;此處引用的權重向量取自附錄 B 中未受損的重述版本,而不是主文公式區塊。表 2、3、5、6、8、9、10、11、13、14、15、16、17 均已與內文核對,且內容乾淨。 兩項矛盾出自論文本身,不是解析造成的(編寫時均已對照 PDF 核實)。(1) 表 11 的Baseline欄(structured 0.312、risk-gated 0.487、repair-heavy 0.147、verify-selective 0.151、cost-aware 0.103)標示為D_belief,卻與表 7 未經儀器化的D_belief列(0.479 / 0.408 / 0.402 / 0.404 / 0.414)不符;其中兩項數值反而與表 7 的D_growth欄完全相同。此處只採用表 11 的正負號與增量,不使用其數值。(2) 圖 8 的四分位界線(Q1 的D_growth<= 0.472,Q3 為 >= 0.670)與論文其他地方一再回報的 0.134–0.257D_growth範圍無法調和。本文引用圖表呈現的關係,不引用其界線。
Cited by 12
- Agent-Authored Harness Optimization×3
Worth stating explicitly, because the corpus's three other controlled harness studies all point the…
- Agent Harness Engineering×3
Every design lever on this page — gate the destructive action, repair the failure before the model…
- Deterministic Pre-Execution Gates×3
This is Harness Induced Belief Divergence's UnsafeRetryRate 0.700 finding at deployment scale and…
- Failures That Look Like Success×3
Harness Induced Belief Divergence — the limit case above: a divergence that, on the paper's own…
- Guarantees That Degrade at Deployment: Action-Space Soundness, Admissibility Without Effect, and a Vendor-Coupled Security Framework×2
And the "retry" half is also better than a retry. NetInjectBench (Shayoni et al., arXiv 2607.10490,…
- Context Lifecycle Management
Harness Induced Belief Divergence — compression priced at the belief layer rather than the token…
- Harness Patterns Under Scale and Domain Shift: Context Routing, Other Domains, Large Action Spaces, and the Overseer
What a gate costs when it blocks. The runtime gate recovers membership, but it does not stop the…
- Measuring Beyond Accuracy Saturation
Harness Induced Belief Divergence — the re-instrument-don't-retire argument extended to a seventh…
- Agent Systems & Harness Engineering
Harness Induced Belief Divergence — Yi & Song: hold task, environment and base LLM fixed, vary only…
- Open Questions Backlog
Harness Induced Belief Divergence ×3 (oldest 62d) — Does harness-induced belief divergence actually…
- Orchestration Sets Token Economics
Harness Induced Belief Divergence — the third controlled harness swap in the corpus and the third…
- User Awareness
Harness Induced Belief Divergence — the missing seventh component of that page's harness six-tuple.…
Related articles
- Agent-Authored Harness Optimization
An agent runs the whole eval-fix loop on its own harness — read traces, hypothesize, patch, re-run. Nine instances (Cli…
- Agent Context Files
The cross-vendor markdown-as-control-plane pattern: repo-versioned plaintext (CLAUDE.md / AGENTS.md / SOUL.md / WORKFLO…
- Optimizer–Evaluator Decoupling
The architectural rule in eval-fix loops that whatever proposes a fix (coding agent, automated optimizer, human) never…
- Agent Harness Engineering
Patterns for scaffolding long-running LLM agents: environment design, progressive context disclosure, mechanical archit…
- Cost-per-Task Over Cost-per-Token
Anthropic's inverted model-selection default: start with the most capable model and dial effort down — a stronger model…
