資料來源#
- A Closed-Form Estimator and Diagnostic Battery for Anchor-Judge Error Correlation, Under a Single-Common-Factor Model
- A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
- Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus
- An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
- CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
- Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias
- SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization
- Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks
- Sidekick's continual learning loop
- User awareness in frontier models
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
- When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability
摘要#
信度不等於效度。 評審可以有完美的可重現性——每次執行都給出相同判決——卻仍然系統性地出錯:受到機率膨脹、對基準測試脆弱,或確定性地偏向某個答案位置。Norman、Rivera 與 Hughes(UC Berkeley,arXiv 2606.19544,2026 年 6 月)進行了迄今規模最大的系統性 LLM-as-a-judge 評估——來自九家供應商的 21 位評審、三個基準測試(MT-Bench、JudgeBench、RewardBench)、三種協定(一致度、一致性、偏誤稽核)、118 次執行、約 541,000 筆個別判斷,全程以溫度 0 運行,涵蓋 2026 年 3 月至 4 月的五週期間——結果發現,實務上驗證評審的方式(醒目的精確匹配一致率)系統性地高估了評審的表現。這篇論文的貢獻不是提出新評審,而是建立一套驗證紀律,並整理為五步驟的 Minimum Viable Validation Protocol。
本頁是知識庫對 DRACO 那項令人安心的「排名不受評審影響」發現所做的獨立平衡:兩篇論文測量的是不同的不變性,合在一起界定了評審分數的可信範圍。
發現 1 — Kappa deflation(醒目指標會說謊)#
實務工作者會報告評審與人類標籤的精確匹配一致率(「一致率 85%!」)。這個數字沒有校正偶然造成的一致。Cohen's κ(以及 Krippendorff's α)則有。兩者的差距——kappa deflation Δκ = EM − κ——很大,而且普遍存在:
- 在 MT-Bench 上,21 位評審全都呈現
Δκ ∈ [33.8, 41.3]個百分點,整體平均為 38.6 個百分點。即使是機率校正後表現最好的評審 Gemini 3.1 Pro,EM = 0.849,但 κ = 0.511,仍相差 33.8 個百分點。在 MT-Bench 上聲稱「一致率 85%」的評審,其 κ 約為 0.48——屬於中等,遠非百分比所暗示的近乎完美區間。 - 衰減幅度**取決於基準測試的標籤分布,而非評審品質。**標籤平衡的三元 MT-Bench(A/B/平手,機率約為 1/3)→ 平均 38.6 個百分點;JudgeBench(成對正確性)→ 23.7 個百分點;二元的 chosen-vs-rejected RewardBench → 10.2 個百分點。標籤越平衡,偶然一致的預期值越高;正如 Cohen 的校正所預測,這會擴大原始與校正後數值的差距。衰減是指標 × 基準測試的性質,因此用來支持部署的精確匹配數字會「高估辨別能力,而高估幅度取決於基準測試,不取決於評審」。
**修正方式:**將 κ 或 α 作為主要信度數字報告,精確匹配率降為次要數據。
發現 2 — 單一基準測試的驗證無法遷移#
評審排名無法跨基準測試通用。在一個排行榜上驗證評審,幾乎不能告訴你它在另一個排行榜上的位置:
- 21 位評審中有 11 位,在三個基準測試間的排名移動至少 4 名;摘要的醒目結果是排名最多移動 14 名。極端案例是 Llama 3.3 70B:MT-Bench 第 5 名 → JudgeBench 第 20 名(排名崩落);反方向則是 Minimax M2.7:MT 第 17 名 → JB 第 5 名(排名躍升)。只有 Gemini 3.1 Pro 和 Claude Opus 4.6 在三個基準測試中都維持前三名。
- 有兩個相互作用的原因。第一,各基準測試的辨別力差異極大:MT-Bench 將 21 位評審壓縮在 13.5 個百分點的 κ 區間內(0.376–0.511,相鄰排名間約差 0.6 個百分點),而 JudgeBench 則讓相同的評審分布在 60.4 個百分點的區間內(0.271–0.875)——寬了 4.5 倍。區間一旦被壓縮,細微的 κ 差異就會造成排名大幅變動。這就是 MT-Bench 天花板效應:其偏好型標籤集無法區分表現強勁的評審。第二,三個基準測試衡量的是不同的潛在構念——偏好一致性(MT-Bench)、客觀正確性(JudgeBench)、chosen-vs-rejected 辨別能力(RewardBench)——在其中一項表現強勁的評審,換到另一項可能表現崩落。
**修正方式:**至少在 2 個基準測試上驗證,並涵蓋偏好型 ↔ 正確性型的軸線,而不是只看單一資料集的辨別力。
與 DRACO 的調和(兩種不同的不變性)#
知識庫先前對評審可信度的回答來自 DRACO:*不同評審模型之間的排名穩定,絕對數值則不同 → 使用序位比較,不信任跨論文的絕對分數。*這篇論文並未推翻那個結論——它測量的是另一個變異軸向:
- DRACO 固定任務與評分規準,並更換評審模型 → 受測系統的排名維持穩定(Gemini-3-Pro、GPT-5.2、Sonnet-4.5 對排序有共識)。不受評審模型影響。
- 本論文固定評審協定,並更換基準測試 → 評審本身的排名很脆弱(最多移動 14 名)。會因基準測試而異。
因此,實務規則更明確了:**只有在實際驗證過穩定性的變異軸向上,排名才值得信任。**DRACO 支持在選擇評審時「使用排名」;它沒有說明基準測試選擇,而本論文顯示排名正是在這方面失靈。令人安心的結果與警訊,是從兩面看見同一課題。
第三個軸向——改變評審的版本,而不是其身分或基準測試——將在下文由 Yang et al. (2026) 提出。
發現 3 — 一致性-偏誤悖論(信度掩蓋無效性)#
這是論文最有力的診斷。兩位已部署於正式環境的評審同時呈現高重測信度(> 0.95)與嚴重的位置偏誤(> 0.10):
| 評審 | 重測信度 | 位置偏誤 | JudgeBench κ |
|---|---|---|---|
| Qwen 3 8B | 0.992(整個群體最高) | 0.192(最高) | 0.289(倒數第 3) |
| Gemini 2.5 Flash | 0.988 | 0.125 | 0.578 |
其機制是:重測信度衡量評審輸出的穩定性,而不是其決策過程的正確性。位置偏誤與評審內部的一致度在數學上彼此正交——一位確定性地偏好排在 A 位置的答案之評審,可以得到近乎完美的重測信度(它完美可重現),同時展現可能的最大位置偏誤。**最可重現的評審,可能也是效度最低的評審之一。**由於只報告重測信度仍是常見做法,當前的驗證方式「恰恰會在部署最重要的情況下誤導使用者:評審有高度可重現性時」。
這是將信度而無效度濃縮成單一失敗模式——也是整頁主旨的一個數字。
發現 4 — 冗長偏誤大致已消退#
這是罕見的「情況有所改善」結果。21 位評審在 MT-Bench 上的冗長偏誤都低於 < 0.011(最大值為 GPT-4o-mini 的 0.010;21 位中有 17 位低於 0.005)——比 2023 年前後研究所報告的 20–40% 長度效應低一個數量級。兩代模型似乎已消除了成對評審大部分的長度偏好。範圍提醒(作者特別強調):這是在單一成對評分規準及一種長度差異操作化方式下成立;這不代表冗長偏誤在任意評分規準或評分任務中都已解決。
(範圍於 2026-08-04 由 Yang et al. (2026)、empirical 縮窄,且上述提醒正好點出其結果所在。在主動探測中——將固定、通用、不含內容的填充字串附加至其中一個候選答案,並測量判決是否改變——對抗式 LLMBar 上的冗長偏誤,Qwen3-1.7B 為 0.547,MiniMax 各版本約為 0.13:比此處測得的 < 0.011 高出一至兩個數量級。只要區分操作化方式,兩個數字就不衝突:Norman 測量的是 MT-Bench 自然生成回答間的被動長度差異,Yang 測量的則是在刻意設計為對抗式的基準測試上,對填充內容的誘發敏感度,且部分開放權重的評估群體包含低至 1.7B 的模型。兩項結果都不能推廣至對方的設定。仍成立的是更狹義的主張——冗長偏誤已從前沿評審處理自然偏好資料的表現中消退,但並未從評審這種方法本身消失——實務上的含意是,填充探測應與 A/B 反轉一同納入偏誤稽核,因為它能偵測被動測量漏掉的問題。)*
第三種不變性——改變評審的版本(Yang et al., 2026)#
Yang、Hou 與 Yang(Imperial College London + Nanchang Institute of Technology,arXiv 2607.08535,2026 年 7 月,empirical)指出了本頁和 DRACO 都未處理的軸向。可稱之為評估器替換歧義:換用較新或更大型的評審後,分數若有變動,光看準確率數字無法說明原因。新評審可能能力較強、偏誤不同、在不同子集上失敗,或只是被測試框架以不同方式解析。他們提出的重新詮釋正是本頁所主張的,並以最一般的形式表述——LLM 評審的結果是一種測量;更換儀器是測量效度事件,不是單純升級版本。
設定。在兩個軸向上評估八位評審,因為這兩種決策都是實務工作者實際會面對的:參數軸向(Qwen3 dense 1.7B / 4B / 14B / 32B)與已發布 API 軸向(MiniMax M2 / M2.1 / M2.5 / M2.7,依發布狀態評估——明確表示不是受控消融實驗,論文也未對 MiniMax 內部機制提出因果主張)。GLM-5.1 和 mimo-v2-pro 作為兩個軸向之外的跨家族參照評審。四個資料集:LLMBar(419 個對抗式成對樣本)、PandaLM testset-v1(剔除平手佔多數的項目後有 894 個有效樣本)、以 seed-42 抽樣的 2,000 筆 Chatbot Arena 樣本(1,997 個有效樣本),以及 Judge's Verdict(200 個源自 TechQA 的三級逐項評分樣本)。接近貪婪解碼 T = 0.1;對共用解析結果的樣本進行精確雙尾 McNemar 檢定(因此顯著性反映成對判決變動,而非解析器涵蓋範圍不同);對 18 次相鄰比較所屬的檢定家族進行 Holm 校正。
發現 A — 升級評審不是可靠度介入#
18 次相鄰步驟檢定中,只有一次通過 Holm 校正:Qwen3 1.7B → 4B,在 LLMBar 和 Arena 上。所有九次 MiniMax 相鄰版本檢定,甚至都未達到未校正的 p < 0.05,最大的相鄰準確率差異也只有 0.022。
表 3(已對照 PDF 校正——解析說明見 wiki/sources.md):
| 資料集 | 最佳評審 | Qwen3 1.7B → 32B |
|---|---|---|
| LLMBar | GLM-5.1, 0.900 [0.868, 0.925] | 0.463 [0.416, 0.511] → 0.678 [0.632, 0.721] |
| PandaLM | MiniMax-M2.7, 0.857 [0.833, 0.878] | 0.779 [0.751, 0.805] → 0.769 [0.740, 0.795] |
| Arena | mimo-v2-pro, 0.742 [0.722, 0.761] | 0.625 [0.604, 0.646] → 0.688 [0.667, 0.708] |
| Judge's Verdict | GLM-5.1, 0.680 [0.612, 0.741] | 0.595 [0.526, 0.661] → 0.530 [0.461, 0.598] |
看這兩個粗體數值:參數增加 19 倍,評審在四個資料集中的兩個上反而變差——PandaLM 由 0.779 降至 0.769,Judge's Verdict 由 0.595 降至 0.530。擴大評審規模不只是效果有限,也不具單調性。「使用最強模型當評審」在這裡連自身設定下都站不住腳,不只是被本頁關於較便宜評審的提醒所反駁。
醒目結論需要一項摘要未提及的修正。「MiniMax 相鄰版本沒有提升」聽起來像是在否定 MiniMax。圖 2 各模型在 LLMBar 上的準確率顯示,這是評審群體的天花板效應,而非沒有進步:Qwen3 的分數為 0.463 / 0.617 / 0.647 / 0.678,而 MiniMax 為 0.829 / 0.839 / 0.832 / 0.832,GLM-5.1 為 0.900,mimo-v2-pro 為 0.883。MiniMax 系列的起點就高於整個 Qwen3 測試範圍的終點。因此,更誠實的說法不是「各版本沒有提升評審」,而是升級評審可帶來的可靠度改善集中在能力範圍的低端——研究中唯一穩健的提升,同時也是成本最低的一步(1.7B → 4B,LLMBar 上 +0.154)——**而在高端附近升級相鄰版本,在這些資料集上沒有可測得的效益。**這是可直接採取行動的採購發現:超過某個門檻後,評審模型的支出買到的就不再是更高的一致度。
**沒有任何評審在四個資料集上都勝出。**GLM-5.1 在 LLMBar 與 Judge's Verdict 領先,MiniMax-M2.7 在 PandaLM 領先,mimo-v2-pro 在 Arena 領先。這與上文的發現 2 形狀相同,只是改變的對象不同——前者是跨基準測試的評審身分,此處是跨基準測試的評審版本——兩者都指向相同處方:依子集驗證測量效度,而非將評估器排成單一維度的名次。
發現 B — 能力與公平性的關聯很強,但仍不足夠#
在 LLMBar 上,位置反轉率從 0.320(Qwen3-1.7B)降至 0.117–0.147(MiniMax 各版本);在評估的八位評審中,LLMBar 準確率與位置反轉率的相關係數為 Pearson r = −0.957。對評分細緻度的敏感性也降低了。但 **MiniMax-M2.7——群體中 PandaLM 表現最佳的評審——在純 A/B 反轉下仍有 14.7% 的判決改變。**作者謹慎地將其稱為在單一資料集與單一模型群體上測得的關聯,而非一種機制。升級評審後,隨機化位置並回報子集層級的偏誤仍不可少。(此處的翻轉率指標不同於本頁的 |P(A wins) − 0.5| 位置偏誤,因此數值方向可供比較,量尺卻不相同。)
發現 C — 陪審團受錯誤相關性限制,而限制如今已有公式可算#
陪審團實驗得出明確的負面結果,並附上可用的校正方式。對於同質陪審團(同一位評審在 T = 0.7 下抽樣 K 次,刻意不採用 T = 0.1,因為重複低溫呼叫會低估陪審員之間的依賴性),論文根據投票矩陣估計群內錯誤相關性 ρ,並比較三種數值——獨立性預測、經 ρ 校正的 beta-binomial 預測(q ~ Beta(α, β), α = ps, β = (1−p)s, s = 1/ρ − 1),以及實際觀察到的準確率:
- 獨立性預測與實際陪審團準確率的中位絕對誤差為 0.078(LLMBar)/0.093(PandaLM)。ρ 校正預測將誤差降至 0.008 / 0.004,最大誤差低於 0.02。
- 測得的 ρ 很高:Qwen3 同質陪審團為 0.944–0.972,MiniMax 較低,但仍高度依賴,為 0.664–0.706。
- 因此,陪審團規模幾乎不影響結果:Qwen3-1.7B 在 LLMBar 上
K = 1, 3, 5時分別為 0.463、0.475、0.482。 - 異質陪審團的表現也低於 Poisson-binomial 獨立性預測——在共用提示詞下混合模型家族,並不會恢復錯誤獨立性。
設計問題從*「要多少位陪審員?」轉為「他們的錯誤有多獨立?」*;報告規則是ρ 必須與 K 一併報告,絕不能只報 K。
第二種成本更低的工具,讓相同規則也適用於假設檢定階段,而不只適用於陪審團準確率。Hossain、Yousefi 與 Lim(UCF,arXiv 2609.22512,2026-09-18,empirical;完整測量分析見 Cross-Model Error Entanglement)測量由十位開放權重評審組成的模型庫,其平均錯誤相關性為 ρ̄ = 0.206,並指出這會以設計效應 1 + 9·ρ̄ ≈ 2.85 膨脹合併投票顯著性檢定的變異數——因此,在 5,000 個重抽樣、各有 100 對的樣本組中,若把每位評審的投票都視為獨立觀測,該檢定會在 79% 的樣本組中達到顯著;而以配對為基礎的檢定(一對偏好樣本算一筆觀測)只有 52% 顯著。在最多 28% 的樣本組中,兩種檢定會對兩個系統孰優做出不同判斷,儘管使用的是相同投票。Yang 的 ρ 校正與本頁將項目作為推論單位的規則(與 MVVP 相鄰,且 Hossain et al. 自身的操作檢核清單也明確指出:「以項目,而非每位評審的投票,作為統計推論的單位」)是從假設檢定而非準確率的角度得出相同結論,而且完全不需要真實準確率測量;只需偏好配對本身,因此比 ρ 或 n_eff 更容易執行。
這正是 Zhou 的證明背後的測量。Zhou 以解析方法證明,當所有評審都以共享潛在訊號作為閾值時,任何單調聚合規則都無法拒絕所有評審都接受的區域,並測得三個評審家族間的成對接受相關性 φ = 0.29–0.38——但其研究是在刻意施加最佳化壓力、使用人工製造錯誤的條件下進行。Yang 測量的是在完全沒有任何對抗評審之最佳化的條件下,相同的依賴性——一般成對評分,ρ = 0.66–0.97——並提出將其轉換為預測而非警告的封閉解。兩條獨立路徑導向相同結論:增加評審人數不會提高可靠度,而混合不同家族的權宜措施也同樣失效。
發現 D — 研究中最大的協定效應,無法歸因#
結構化辯論(兩位評審、最多三輪反駁、LLMBar)產生的最終結果相較第一輪準確率變動,遠超過論文中的所有擴大規模效應:Qwen3-1.7B 分別與 GLM-5.1 / MiniMax-M2.7 / mimo-v2-pro 配對時,變動為 +0.317 / +0.305 / +0.289;Qwen3-4B 與 GLM-5.1 配對時變動 +0.243,準確率達到 0.897。同一家族及頂尖模型彼此配對時,變動僅 +0.005 至 +0.050,因此效果與配對評審之間的能力差距相符。
但這無法解讀。實作過程有記錄各輪判決與最終判決,卻沒有記錄原始回答或解析成功旗標;第一輪解析失敗時會回退至「A」,之後各輪失敗則沿用前一輪判決。因此若不完整重跑,就無法還原回退比例,也無法把準確率變動與「能力較弱評審無法解析的輸出,被能力較強評審的判決覆蓋」區分開來。作者將其視為可稽核性案例,而非審議結果——這是誠實的判斷,也正是此發現值得列入驗證頁面的原因:一項協定介入的效果大於研究中的任何能力介入,卻因為少記了六行紀錄,導致其機制無從還原。
這對 MVVP 有何補充#
MVVP 是部署單一評審前的檢核清單。Yang 的表 4 則是評審結果的報告標準,其中六個項目有三項是 MVVP 未要求的:
| 可靠度風險 | 必須報告的項目 |
|---|---|
| 資料集子集差異 | 有效 N、可解析 N、平手處理方式 |
| 解析器產生的假象 | 解析器成功率、回退規則 |
| 位置/冗長偏誤 | A/B 反轉、填充探測 |
| 陪審團錯誤相關 | ρ 與 K,不可只報 K |
| 辯論協定產生的假象 | 原始輸出、解析器狀態、各輪判決 |
| 統計推論過度延伸 | 成對檢定、Holm 校正、不確定性區間 |
解析器與子集項目(第 1–2 列)以及 ρ 項目(第 4 列)在 MVVP 中都沒有對應項目;第 3 列是 MVVP 第 2 步加上填充探測;第 6 列則是 MVVP 未明說的統計衛生原則。兩份文件互補而非重疊——部署前先驗證評審(MVVP),接著報告其周邊管線實際執行了什麼(稽核軌跡)。
穩健性檢查(論文刻意將範圍控制得很窄):人類天花板校準顯示,PandaLM 仍有進步空間——表現最佳的評審,對照逐一移除一位標註者後得到的 κ = 0.753,而人類天花板為 0.920;但 Judge's Verdict 已達或超過其含雜訊的天花板(最佳評審 κ = 0.620,人類 κ = 0.562,也就是評審勝過人類;這說明的是標籤而非評審)。Arena seed 擾動僅使準確率變動 0.004–0.032,小於穩健的 1.7B→4B Arena 差距。提示詞敏感度檢查保留了跨家族排序,較強的評審對提示詞也較穩定。
**依此衡量其證據分量。**兩個模型家族、兩位參照評審、四個資料集;主要提示詞固定,提示詞敏感度只作為穩健性檢查;每項實驗各採一種主要解碼設定。MiniMax 軸向代表實際觀察到的發布序列,不是受控消融——對它得出的零結果,是已發布 API 的零結果,不代表訓練介入無效。McNemar 檢定是相鄰配對檢定,不構成軸向間的正式比較。
評審所依據的評分工具——驗證評分規準的項目#
以上所有內容都是在驗證評審。CalibratedRubric(Chen et al.,FinStep + StepFun,arXiv 2607.29252,2026 年 7 月,empirical)驗證的是評審所依據的工具;它所區分的概念應納入本頁用語,因為此領域經常混淆以下三者:
| 評分規準項目的性質 | 可觀察指標 | 無法據此確立的事 |
|---|---|---|
| 可測量性 | 評審間一致率 | 此評量準則是否值得測量 |
| 資訊性 | 擬合能力範圍內的 IRT 項目資訊量 | 評分者能否一致地應用此準則 |
| 效度 | 專家認可 | — 論文未提供自動化替代方案 |
他們將 z_j 定義為可重現的可評判性,並立刻加上限定:「這是實質專家認可的必要條件,但非充分條件。」這是本頁「信度不等於效度」主旨在更下一層的重述——一個所有評審都同意的項目,可能毫無人在意的事都測不到,而一致度恰恰就是無法告訴你這點的統計量。
**它與發現 C 的交會處。**CalibratedRubric 的可測量性後驗分布,是所有評審皆同意的樣本比例之 Beta–Bernoulli 模型,而且至少需要 3 位評審才有任何訊號(只有兩位時,全體一致在定義上就是成對一致;他們在 HealthBench 與 HelloBench 的兩位評審組別沒有帶來改善)。假設 A3 承認了這項威脅,卻沒有測量:「LLM 評審共享訓練資料與慣例,因此相關錯誤可能膨脹表面共識及估計出的敏感度或特異度。」Yang 的 ρ = 0.944–0.972 / 0.664–0.706 正是這種依賴性的幅度,而且是在沒有最佳化壓力下測得。兩項結果並不衝突——它們討論冗餘的不同用途(Yang:增加陪審員作為投票者,受 ρ 限制;Chen:增加陪審員作為觀察項目的樣本),但 ρ 對兩者都有威脅。這道接縫也出現在 Chen 自己的資料中:在由 LLM 評審的區塊,後驗可測量性預測一致度的相關係數為 r = 0.589 / 0.558;到了 JudgmentBench 則降至 r = 0.127,這是唯一由人類提供黃金標籤的區塊。當 LLM 為 LLM 評分時,這種機制的證據最強。
**此外,依一致度篩選也無法消除評審與人類之間有方向性的偏誤。**在 JudgmentBench 上,LLM 評審給予正面標籤的比例為 55.6–62.9%,高於人類黃金標籤的 47.1%——作者原話是:「評審與人類之間存在系統性不匹配,可測量性篩選無法完全消除此差異。」篩出一致的評審能讓整個評審群體更自洽,卻不會讓它更接近人類。這與 Reference-Free Judge Over-Crediting 的過度認可方向相同,只是出自評分規準評分,而非無參照 QA。符合 MVVP 精神的補充方式是:若評分規準庫依據評審一致度建立,就應將評審群體的基線正面率與人類基線率一同報告,因為若篩選提升 κ,卻讓兩者差距依舊,那只是改善了信度,並未改善校準。
哪些評審表現出色(供應商模式)#
- 前沿/推理模型能降低位置偏誤,但無法消除。範圍約跨越兩個數量級:Gemini 2.5 Pro 的 0.002(最佳)至 Qwen 3 8B 的 0.192(最差);在 Gemini 家族內,2.5 Pro(0.002)與 2.5 Flash(0.125)相差 70 倍。預先註冊的預測認為三個採用思考架構的評審(GPT-5.4、Gemini 3.1 Pro、DeepSeek V3.2)都會低於 0.05,但只有 Gemini 3.1 Pro(0.038)符合;GPT-5.4(0.083)與 DeepSeek V3.2(0.094)都未達標。
- Anthropic 評審在困難項目上呈現最強的綜合表現——JudgeBench 平均 κ = 0.770(Opus 4.6 為 0.875、Sonnet 4.6 為 0.782、Haiku 4.5 為 0.653),而且供應商群體層級的位置偏誤最低(0.020)。OpenAI 旗艦模型(GPT-4o/4.1/5.4)的 JudgeBench 平均 κ = 0.467;在 JudgeBench 上看得出世代進步(0.309 → 0.487 → 0.606),但在尺度壓縮的 MT-Bench 上幾乎看不出差異(0.451/0.451/0.457)。
- **中階模型可能在特定軸向上勝過前沿模型。**Kimi K2.5 的位置偏誤是所有非 Gemini 評審中最低的(0.004),JudgeBench κ = 0.720,成本僅為前沿模型的一小部分——因此「挑最強的模型當評審」不是安全的預設做法;應依你在意的面向選擇。
評估衛生課題:RewardBench 靜悄悄地退化了#
作者預測 RewardBench 的 κ 會約為 0,因為標準生成式載入器會將每一個 chosen 回答都放在 A 位置——使人類標籤恆為「A」,讓 p_e 歸零,Cohen's κ 對所有評審都退化至 0.000。透過逐項隨機化位置(seed 42)後,恢復了有效訊號(κ ∈ [0.616, 0.898]),也推翻了作者自己的假設。可推廣的警告是:基準測試載入器若固定答案位置慣例,可能悄悄讓機率校正指標歸零——這是測試框架造成的假象,不是評審本身的問題。
Minimum Viable Validation Protocol(MVVP)#
部署 LLM 評審之前:
- 校正機率偶然性。除了任何精確匹配數據,也要報告 Cohen's κ(或 Krippendorff's α),並將經機率校正的指標視為主要信度數字。
- **交換位置。**透過成對的 AB+BA 評估測量位置偏誤;報告
|P(A wins) − 0.5|。 - **重複測試。**在關閉回應快取的情況下,以溫度 0 執行 至少 3 次獨立測試,測量重測信度。
- 交叉驗證。在至少 2 個基準測試上評估,涵蓋偏好型與正確性型標籤分布。
- **稽核悖論。**當重測信度超過 0.95 時,**先確認位置偏誤低於 0.10,再聲稱具有可靠性。**穩定性高而偏誤也高是一種失敗模式,不是優點。
論文也指出了自身的不完整採用風險:只報告 κ(第 1 步),卻不做位置交換與一致性檢查,可能營造出已處理評審可靠度問題的錯誤安全感。
範圍提醒(來自論文自身的限制)#
這些發現是特定時點的快照,不是普遍定律:僅限英文、文字,三個既有基準測試、單一成對評分規準範本,以及五週觀察期間(託管端點會在此處未重新測量的情況下靜默漂移)。為了讓推理能力評審之間保持可比,所有評審的思考通道都被關閉——開啟推理可能會改變所有一致度/一致性/偏誤概況。此外,因為大多數供應商不公開 token logprobs,校準本身(Expected Calibration Error、Brier score)留待日後研究——評審的信心校準問題仍未解答。
評估以外的相同失敗:分類法分類器#
Google ATLAS(2026 年 7 月)在另一個領域重現了本頁的核心架構——將對話映射至 BLS/O*NET/ATUS 類別的 LLM 分類器,用於經濟研究,而非評分模型輸出。整體形狀相同:**寬鬆的驗證指標讓分類器顯得出色,而你回報哪種指標,將決定整條管線聽起來是否可信。**本頁發現精確匹配一致率會把經機率校正的 κ 高估 33–41 個百分點;ATLAS 則發現,在 O*NET 任務層級上,人類認可率(85.8%)把精確準確率(22.6%)高估了 63 個百分點——因為詢問評分者「這個標籤是否說得通?」遠比讓他們從 18,797 個選項中選出正確答案容易。
兩項借鏡可雙向套用。ATLAS 將分類器選項順序隨機化,以排除位置偏誤——這直接應用了此處的一致性-偏誤課題。ATLAS 也提供了本頁協定所缺少的天花板:人類標註者對 42–48% 的三位數職業代碼意見不一(Mellow & Sider 1983;Mathiowetz 1992),所以若把 100% 當作準確率目標,就是測量錯誤的對象。Minimum Viable Validation Protocol 或許應在機率校正之外,加上人類天花板估計。
指標正確,軸向錯誤——把認可率當成一致率回報#
第二個分類法分類器揭露了 MVVP 沒有涵蓋的失敗,而且正因其指標本身良好,這個案例才格外值得參考。Pahuja、Brokman、Hofman et al.(An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures,arXiv 2608.03735,2026-08-04,empirical)使用 Claude Opus 4.8 將代理程式規劃失敗分成六類,驗證方式也比多數研究更完善:除了 macro-F1 = 0.906,也一併報告機率校正 κ = 0.860,而非原始一致率(第 1 步,做得正確);不確定標註會排除,而非強行分類;並公開各類別明細,包含表現較弱的項目——Operation 83.3%、Answer format 85.7%、Other 88.2%,相較之下 Entity 為 94.4%,Source/Temporal 為 100%,在 117 筆明確驗證中的整體結果為 88.9%。
以上做法仍留下兩個缺陷。
**驗證依類別分層;但研究主張依語言而異。**論文醒目的診斷結果,是跨越五個數量級 Common Crawl 使用比例的十一種語言間呈現的逐語言梯度,然而全文沒有任何逐語言一致度數據——即使標註樣本是刻意抽取來涵蓋不同資源量的語言,顯示這項分類分析完全可以進行,只是沒有做。兩個一致度最低的類別,是使用比例沿該梯度變化最大的三類中的兩類。論文自己的限制也承認「評審校準可能因語言而異」。MVVP 的五步驟沒有一項能抓到這個問題:它們規範指標、位置偏誤、複測、基準測試範圍及信度-偏誤悖論,卻沒有一項要求沿著醒目主張所變動的軸向分層驗證,並回報各層數字。本頁已讚許 User Awareness 附錄 G 依母體分層並重新加權;這個反例將那項讚許轉化為規則,也可能成為第六步。其涵蓋範圍還在 §5.2、附錄 G.4 及表 11 圖說中,以三種互不相容的方式陳述(6 位標註者/122 個樣本/約 14%,與 7 位標註者/280 個樣本/約 30%,以及由 5 位標註者對 117 筆明確樣本驗證並排除 6 筆)——這種帳目落差之所以重要,只因它是為評審背書的數字。
**而 88.9% 是認可率,不是一致率。**標註指南要求每個樣本都呈現「提供給評審 LLM 的全部輸入,以及評審的回覆,並請標註者驗證指定類別。」這是本頁已在 Automated Failure Attribution 指出的不對稱現象之第二個語料庫案例:人類評審群體對管線標籤的認可率為 94.0 / 90.0 / 90.0,而模型是從頭預測;同一模式出現兩次,就值得命名,而非視為某個基準測試的偶然情況。這點之所以重要,是因為其機制已在相關頁面測量過:評判一個已呈現的候選答案會造成候選錨定,而 Zhou 的去錨定結果顯示,要求評審先自行作答,再看候選答案後,FPR 會從 0.719 降至 0.012。目前沒有人對人類驗證者進行這項控制;修正方式同樣簡單且幾乎不增加成本:讓部分標註者先盲測,再揭露評審判決,並回報兩種數字。做到之前,認可率只能算是不知道緊密程度的評審-驗證者一致率上限,而本語料庫中每篇分類法分類器研究報告的都是這個上限。
天花板作為目標,以及兩項建構效度檢查——來自實際部署#
以上內容都是由以衡量評審為職的研究者對評審所做的測量。Shopify Sidekick 的案例(McNamara 與 Mazza-Anthony,Shopify Engineering,2026-08-05,case-study)則是一個團隊驗證評審的實例,因為它即將成為 RL 獎勵;其流程包含本頁一直倡議的步驟,還有本頁尚無人提出的兩項做法。先說證據限制:這是作者對自家系統的第一手報告,沒有複現,也沒有對抗性審查,因此不足以提升或推翻上文任何 empirical 發現。它的貢獻是實務做法,以及兩個候選流程項目——無論執行者是誰,都能依其自身條件加以檢驗。
以內部資料測量人類天花板,而非借用外部數字。 在評審出現之前,兩位專家盲標 25 筆隨機抽取的正式環境對話,並以 Cohen's kappa 記錄兩人一致度——依步驟 1 的規定進行機率校正,只是把它往上一層用在人類身上。這個門檻是觸發重寫的條件,而不是及格線:當 κ ≈ 0.2 時,團隊判定評分規準有歧義並反覆修訂,理由是:「如果這份評分規準會讓每天都在做這項產品的幾位產品專家感到困惑,那也會讓 LLM 感到困惑。」 接著,評審的目標設為接近這個數字,而不是 100%:「這個一致度就是評審的天花板……目標不是打造『完美』的評審,而是讓它與人類的一致程度,大致等同於人類彼此的一致程度。」 他們報告的結果只出現在一張圖裡,文章正文完全沒有提到:人類一致度為 83%——圖表標為「完美:無法達到」——而評審為 80%。
上文引用的 ATLAS 衍生註記(「最低可行驗證協議或許應在人類一致度估計之外,同時納入機率校正」)如今成了實際採用的步驟;在一個值得指出的方面,它也勝過 ATLAS:ATLAS 的天花板是借自文獻(人類標註者對三位數職業代碼有 42–48% 的歧異,Mellow & Sider 1983;Mathiowetz 1992),這裡的天花板則是在評審建成前,針對實際評分規準、實際標註者、實際流量測得。從別人的任務估出的天花板,只能告訴你天花板存在;從自己的任務估出的天花板,才能告訴你該在哪裡停止最佳化。
而這個缺陷,正是本頁的發現 1 在實務中的重現。 κ 的紀律用在標註者配對上,之後卻被擱置:83% 對 80% 的比較——整個天花板論點所依據的數字——是原始一致度,沒有校正機率;而就在前一段,團隊才正確地採用了機率校正。發現 1 指出,兩者差距會隨標籤分布變動;圖中呈現 Pass / Borderline /(暗示的 fail)三類尺度,也就是本研究自身樣本中一致度膨脹最嚴重的多類別情境。方向確定,幅度則無法從已公開資料計算(未提供標籤分布),因此誠實的說法是:天花板的框架是正確的,但它所採用的指標,正是本頁降為次要圖表的那一種。 也請留意,報告完全沒提到他們在正式推出時的 κ。公開的只有重寫觸發門檻(≈0.2),因此評分規準最終經機率校正後的一致度仍未知。
兩項新增檢查,以及它們為何屬於驗證協議,而非產品文件。 每個 MVVP 步驟與每個 Yang 稽核項目,測量的都是評審本身的單一性質。這兩項檢查則測量評審是否對準正確目標:
| 檢查 | 流程 | 它能確認、但可靠度無法確認的事項 |
|---|---|---|
| 線上指標回測 | 讓評審重播過去的 A/B 測試,檢查它能否找回已知的互動、留存或產品目標指標勝負的方向 | 離線代理指標是否與它所代理的結果相關。評審可以 κ 乾淨、沒有位置偏誤、可複現,卻仍把落敗版本排在第一 |
| 目標式退化測試 | 刻意讓某項行為變差——在離線環境或受控流量切片上——並確認相對應的評分項目確實下降,而且只有那一項(「如果系統不再嘗試達成使用者目標……目標達成分數就應該特別下降」) | 評分規準中的各項標準能否區分,且每項是否測量其名稱所指的內容。這是逐項標準的操弄檢查 |
兩者都是建構效度工具,恰好補上本頁標題所說、領域所忽略的那一半;而回測是整個資料集裡唯一能用評審未自行定義的結果來校準評審的工具。它們明示的前提,是第四項建議;這句看似旁枝,實則不可或缺:「讓每個評審保持小而聚焦,不要把產品所有行為都塞進同一個評審……聚焦的評審更容易解讀這些測試,產生的指標也更值得信任。」 對混合式評審做退化測試,在建構上就無從解讀;因此,評審的拆解是逐項標準得以被證偽的必要條件——Agent Quality Flywheel 從指標角度(把一項關注提升為一項穩定指標)得出同樣做法,而不是從驗證角度出發。
這些做法都沒有觸及 Reference-Free Judge Over-Crediting 所測量的失效;而這次部署是整個資料集中最容易暴露於此失效的案例:同一個校準過的評審,同時成為困難負例選擇器、修復門檻,以及 GRPO 獎勵;報告中沒有任何內容顯示,當政策開始針對評審進行最佳化後,團隊重新測量了評審的一致度。一次性驗證再好——而這次做得很好——所認證的評審都只會保持真實,直到有事物開始對它施加壓力為止。
評審組成比評審數量更能改變離散程度(2026 年 9 月)#
面對單一評審的不可靠性,標準解法是組成評審小組;而發現 C 已經估算了它的上限(錯誤相關 ρ ≈ 0.66–0.97,限制了重複抽樣評審團的效益)。Ludwig 等人(NVIDIA,arXiv 2609.06780,2026-09-06,empirical)提供了一個異常清晰的自然實驗,檢視組成這個面向;這是他們一篇主題完全不同的論文所附帶的結果——稽核程式碼代理程式是否利用基準測試漏洞(完整分析見 Evaluation-Time Answer Leakage)。
他們使用三個開放權重評審——Qwen3.8-27B、DeepSeek-V4-Flash-0731、GLM-5.3-Flash——為每個代理程式回合標上 YES/NO 加上一個類別,再以多數決判定整條軌跡。針對其中一個模型,他們以 五 位評審重跑稽核,加入 Claude Sonnet 5 和 GPT-5.6 Luna,並將其作為穩健性檢查,報告結論未變。確實如此。但評審間的一致結構變了(表 5 與表 6,Kimi-K3):
| 3 位開放評審 | +2 位封閉評審 | |
|---|---|---|
| SWE-bench M.,vanilla——是/否歧異 | 17.7% | 20.8% |
| SWE-bench M.,principled——是/否歧異 | 10.1% | 21.9% |
| SWE-bench M.,principled——一致判為否定 | 83.3% | 71.9% |
| DeepSWE,principled——是/否歧異 | 4.1% | 9.1% |
| DeepSWE,principled——一致判為否定 | 93.2% | 88.2% |
在低發生率情境中,兩位來自不同訓練脈絡的評審加入後,二元歧異率約增加一倍,一致判定比例也相應下降。五位評審中有兩位在五分之一的軌跡上意見不一,這不是穩健性結果;它測出三人評審小組的高度一致部分來自共同脈絡,這正是發現 C 以 ρ 形式化的機制,也是評審團成員必須被視為彼此相關,而非互相獨立的原因。實務規則是:全由開放模型或同一家族組成的評審小組,會把自身同質性當成可靠度;測試評審小組最省力的方式,是加入一位來自其脈絡之外的評審,觀察歧異程度,而非判定結果。
這篇論文也是本頁核心缺陷的清晰案例,值得點出,因為論文本身其他方面都很謹慎。裡面的每個數字都是評審判定;可靠度論證依據的是評審間原始全體一致百分比,沒有人工標註子集、沒有分類器的精確率或召回率,也完全沒有機率校正統計量——這正是發現 1 所測得的一致性取代效度,κ 被高估 33–41 個百分點;發現 3 則直接點出這個問題。格式不合規率以三位有效數字報告(不到 0.3% 的回合),分類器相對人工判定的準確率卻完全沒有報告。
要求回報的 ρ,並非你能測量的 ρ(2026 年 9 月)#
發現 C 的報告規則——ρ 要與 K 一起報告,絕不可只報 K——隱含了一項無人明說的前提:ρ 是可測量的。Sunkavalli(arXiv 2609.08826,2026-09-08,單一獨立作者;模擬與診斷屬於 empirical,實際評審小組的數字則不屬於——見 Sources)推導出識別所需的資料量,結果發現有兩個不同量一直共用同一個符號。
Yang 的 ρ 可估計;但它暗示的分解無法估計。 Yang 的組內錯誤相關可由投票矩陣讀出——重複判斷、歧異率、不需外部參照——而它只做一件事:將評審團規模換算為預測的評審團準確率(beta-binomial;相較於假設獨立時 0.078–0.093 的中位數絕對誤差,該方法為 0.004–0.008)。它無法告訴你評審們對什麼事情達成一致。將每位評審寫作 J_j = t + c + e_j——潛在品質 t、小組共用的共同模式錯誤 c,以及個別殘差——則可觀察到的評審間非對角共變異數為
K = Cov(J_i, J_j)_{i≠j} = σ_t² + σ_c²
訊號加上共享錯誤,全包含在一個數字裡,無論小組規模多大,都無法從小組內部拆分。 這正式說明了為何不斷增加評審,永遠無法解答本頁反覆提出的問題:評審間高度一致,既可能代表整組都答對,也可能代表整組都答錯;投票矩陣無從分辨。拆分 K 需要外部參照集——也就是錨點——而採用錨點的整個文獻脈絡,都假設錨點是乾淨的(其錯誤與 c 不相關)。Sunkavalli 的 ρ_k:= Cov(A_k, c)/(σ_{a_k}σ_c) 表示這項假設的殘餘影響;他的定理 1 不假設任何錨點乾淨,僅用 p ≥ 2 位評審和 m ≥ 2 個錨點,就能以封閉形式點識別 σ_t²、σ_c² 及每個 ρ_k。完整方法、適用邊界與盲點見 Weak-Verifier Ensembling;本頁要談的是其中能應用於實際評審的部分。
實際評審小組無法通過適用性預檢,其中一項失敗結果可直接用於本頁的測量。 測試組合中的 Test A 是評審間非對角共變異數的變異係數;單一共同因子模型要求這些共變異數彼此相等。在一個六家供應商的 LLM 評審小組(Amazon Nova Lite、Llama-3-70B、Mixtral-8x7B、GPT-OSS-120B、Qwen3-Next-80B、DeepSeek-V3.2;溫度 0,499 個完整案例 keyed GSM8K/SciQ 題目,6,000 次呼叫/5,996 筆解析完成的判定)中,統計量為 0.175,高於配對虛無分布的第 95 百分位門檻 0.064——測試觸發。值得報告的是其機制:各評審的品質負載值範圍為 0.324–0.870,以每位評審對已知品質構念的迴歸係數測量,而模型假設負載值固定為 1。實際評審對被測量的事物並沒有相同的負載程度;這正是本頁評審組成一節觀察到的歧異,以及發現 C 以相關性表達的異質性,現在則直接測量負載值。在 HANNA 的三位人工評分者身上(431 篇故事,以 1–5 評估連貫性,邊際分布極端到其中一位評分者有 62% 的機率質量落在類別 5),Test A 的觸發更明顯:0.589,高於 0.247 的門檻,p < 0.0005。人工評分者也會破壞負載值相等的結構;在把人類小組當成分解分析中乾淨的參照之前,這一點值得記住。
對流程的兩項影響。 第一,任何小組層級校正之前,都應先做適用性預檢——MVVP 驗證評審,Yang 的表 4 報告流程表現,兩者都沒有檢查校正所依據的模型是否適用。明知自己未通過預檢仍執行時,估計值會得到 (0.887, 0.960, 1.026),但注入值是 (0.0, 0.4, 0.7);超出範圍的數值代表模型設定錯誤,而對未通過預檢的評審小組套用校正,並不比不校正更能減少誤差。第二,標準 LLM 評審設定落在兩道識別限制的錯誤一側。若評審和錨點都是序位資料——以 Likert 評分的評審對照 Likert 參照集,也就是這個領域的多數研究——那麼無論錨點有多少,ρ_k 都無法識別;即使已知某個錨點乾淨,也無法恢復識別。要識別,必須使用序位評審加上 ≥ 3 個連續評分錨點,且變異數約為連續情境的十倍。共享誤差若遍及整個評審小組——例如所有評審都採用同一份提示範本,這正是本 wiki 上每個評審小組的建構方式——則在觀察上與共同模式無法區分。因此,不論診斷結果如何,任何小組內統計量都無法將兩者分開。
依方法論論文的標準看待它。 這個估計量從未在實際評審小組上有效應用——測試的兩個小組都遭到拒絕,沒有符合條件的小組存在,而論文第 8 節指出,預檢的用途正是判定這件事。真正適用於此處的是對實際評審和評分者的負面結果,而不是任何污染數字。
測量答案之間的依賴性,而非判定結果之間的依賴性(2026 年 9 月)#
發現 C 從評審小組自身的投票矩陣估算評審團上限,而上一節顯示該矩陣無從說明評審們對什麼事情達成一致。Kuai 等人(Texas A&M/Marquette/Utah,arXiv 2604.07650,v2 2026-08-09,COLM 2026,empirical)採取第三條路:在完全不同的地方、使用具有標準答案的任務估計依賴性,再將它作為共變數帶入評審情境。 完整方法見 Cross-Model Error Entanglement;以下三點與本頁相關。
識別限制源自缺少答案鍵,而非評審小組本身。 評審共變異數會把訊號和共享錯誤混在一起(K = σ_t² + σ_c²),因為兩個評審達成一致,可能只是同時答對。若限定兩個模型都答錯,這種模糊性就消失了——剩下的依定義就是共享錯誤。因此,Kuai 等人在 18 個模型、六個家族回答 MMLU-Pro 的失敗面上進行稽核,虛無假設是在控制任務難度後具有條件獨立性(透過留出成對的其他 16 個模型估計難度;每個模型對難度的反應函數以 logistic regression 擬合,平均 AUC 為 0.865/ECE 為 0.041),再使用 Monte Carlo p 值和 Benjamini–Hochberg q 值。代價是適用範圍:方法需要「答案可客觀驗證的任務」,而實際使用評審小組的開放式生成情境,恰好不符合這個條件。
評審的精確率是評審與目標模型配對後的屬性。 他們的偏誤量是條件精確率的差異,ΔPrec(J_j, M_i) = P(Y=1 | Ŷ_j=1) − P(Y=1 | Ŷ_j=1, M=M_i)——特定目標模型上的評審精確率,比其對所有模型的精確率差了多少。這種重新表述值得本頁採用:MVVP 讓評審對照基準測試進行驗證,並回報一個 κ、一個位置偏誤率、一個一致度數字,卻沒有任何一項會依據受評分的輸出來自哪個模型而做條件化。評審與目標模型之間的依賴性,能在一個不重疊的 MMLU-Pro 子集中預測此差異,Spearman ρ = 0.508(BEI)與 0.520(CIG);相同估計也適用於自由作答的 MATH-500 回答,分別為 0.441 與 0.457,而多數基準依賴性指標在這裡都不再顯著。方向是:評審的失誤與某模型的失誤越糾纏,就越會過度肯定該模型。
依照算術所支持的程度評估,證據比表格暗示的更弱。 論文從未說明 Spearman 計算涵蓋多少個點;根據各欄自身的(ρ,p)數值反推,得到 MMLU-Pro 的 n ≈ 34,MATH-500 的 n ≈ 26,無論從顯著或不顯著列都能得到相同結果(wiki 算術)。在 n = 34 時,ρ = 0.508 的 95% 區間約為 [0.21, 0.72];互資訊 0.113 的區間約為 [−0.23, 0.44]——兩者重疊,因此論文宣稱其指標優於傳統指標的對比並未獲得證實;仍然成立的是方向、顯著性,以及跨基準測試的遷移結果。此外,單純的共同失敗 Jaccard 重疊——沒有虛無模型,也未控制難度——在 MMLU-Pro 上就已達到 ρ = 0.428,只有遷移到 MATH-500 時才變得不顯著。
因此,本頁的流程可加入兩項做法。第一,κ 旁邊應加上糾纏共變數:「這個評審與人類的一致度為 κ = x」並不完整,還要補上「它在共同失敗的目標模型上的精確率會降低 y 個百分點」。第二,只要有答案鍵,這套測量工具的成本就很低——共享基準測試上的錯誤矩陣,是多數評估流程早已擁有的資料——因此它是這個資料集中第一項不需要錨點、人工評分者或重複抽樣,就能由實務者執行的依賴性測量。
「ρ 與 K 一併報告」如今有了單位、門檻,以及以準確度點數計算的代價(2026-09-22)#
發現 C 的報告規則很好,但少了另一半:它要求在評審小組規模旁報告相關性,而相關性不是任何人能直接採取行動的數量。Kohli(Apple,arXiv 2605.29800,2026-05-28,empirical)提供了換算方式——Kish 有效樣本數 n_eff = k / (1 + (k−1)·φ̄)——並進一步分析它所造成的代價。完整分析見 Cross-Model Error Entanglement;以下四點與本頁流程相關。
發現 C 報告過、卻未提供係數的異質評審團結果,如今有了數字。 Yang 等人發現「異質評審團的表現也不如 Poisson-binomial 獨立性預測」,卻沒有提供數字。Kohli 的九位評審橫跨七個家族——OpenAI ×2、Anthropic、Google、Meta ×2、Alibaba、Mistral、DeepSeek——結果為 φ̄ = 0.391 ± 0.111,n_eff = 2.18 [2.07, 2.31],有效樣本數與實際評審數之比為 24.2%。因此,缺少的係數大致是:混合家族使測得的錯誤相關從同質評審團的 0.66–0.97 降至約 0.39,但九位評審中仍有相當於四位評審的冗餘。混合有所幫助,但遠不足以解決問題。
現在可以用結果本身的單位,而非相關矩陣的單位,衡量上限。 Condorcet 虛無模型——依人類標註熵的三分位區間估算每位評審的混淆矩陣,每個項目進行 10,000 次 Monte Carlo 投票——預測同一組九位評審彼此獨立投票時,多數決準確率為 94.0%。實際準確率是 72.0%。22.0 個百分點的差距 [19.5, 24.1] 在控制難度後幾乎原封不動(其中僅 6.8% 可歸因於項目難度共享;使用十個區間時為 13.5%);分層排列檢定顯示觀察到的 φ̄ 高於虛無分布 z = 65.6,而 10,000 次抽樣中一次也未達此值。這是 MVVP 沒有欄位容納的數字:評審小組逐一通過本頁所有評審層級的檢查,仍可能因為自身冗餘損失 20 點準確度。
一項容易採用的報告門檻。 論文的建議只有一句——「若 n_eff/k < 0.5,就應謹慎看待結果」——而文中測試的每種設定都未達標(k = 9 時為 24.2%;RewardBench 為 22%)。輸入資料是評審小組針對驗證集既有黃金標籤的錯誤矩陣;它是任何已評分執行結果的副產品,因此這是整個資料集中第一項無須額外成本即可計算的依賴性診斷。它應納入 MVVP,與 κ 並列;實務上的推論很直接:在三個 NLI 資料集與 RewardBench 上,最佳單一評審的表現等於或勝過評審小組(小組表現分別低 6.5pp、2.5pp、2.8pp);九位評審中有六位,移除後準確率會上升;而前五位評審已達到在獨立性假設下可達準確度的 90%,上限則是 1/φ̄ = 2.56。
另有一項流程警告,直接針對本頁一直未置評的設定參數。 用 chain-of-thought 重跑評審小組,會提高錯誤相關:φ̄ 0.391 → 0.456,n_eff 2.18 → 1.94,小組準確率 72.0% → 69.2%。提示改寫(2.17)、標籤順序反轉(2.15)和溫度 0.5(2.17)都沒有影響;啟用推理是研究中唯一改變依賴性的操弄,而且影響方向有害。
跨基準測試的評審評分方法效應(2026 年 9 月)#
以上各項都在單一基準測試內部驗證評審:與人類的一致度、跨次執行的穩定性、位置偏誤。Desai 等人(arXiv 2609.08812,COLM 2026,empirical)測量一項任何基準測試內部流程都無法發現的現象:LLM 評審評分法在不同基準測試之間共享的變異。 在 48 項基準測試與 53 個模型中,部分 Mantel 檢定以共同概念和共同評分格式迴歸成對排名相關性。將格式編碼為 LLM 評審對比其他所有方式時,β_format = 0.526(p < 0.0001),β_concept = −0.058(p = 0.998)。知道兩項基準測試都採用評審評分,就能預測它們的一致程度;知道它們宣稱測量同一概念,則毫無額外助益。SGBench-mcq 是一項以選擇題評分的拒答基準測試;它與其他選擇題基準測試聚在一起,而非與評審評分的拒答基準測試聚在一起。模型越新,效應越大(2024 年 10 月前,格式與概念效應的差值 +0.43;之後為 +0.84)。
論文替換評審的檢查顯示,這項效應源自評分方法,而非某一位評審。以 Llama-3.3-70B-Instruct 取代 Qwen3-30B,重新評分四項基準測試時,每項統計量的變動都不超過 0.06,Mantel 對比則維持 +0.58。這和 DRACO 所說的「排名在不同評審間保持穩定」一樣令人安心,也有相同限制:用另一位評審替換原評審,仍會保留 LLM 評審共有的特性。上述 MVVP 會讓這些評審逐一通過,也無法偵測此效應。
概念頁指出了一項混雜因子:網格中幾乎所有由評審評分的基準測試,都是拒答或過度拒答測試,使用長篇自由文字回答。「評審評分」和「拒答家族」幾乎完全共線,因此 β 的部分影響可能來自任務家族,而非評分者。
將形式化檢查器作為 LLM 評審評分所依據的標準答案(2026-09-29)#
SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization(empirical)評分生成的 Lean 陳述是否符合非形式化定理;使用的指標之一是三家廠商的 LLM-as-judge(Gemini 3.1 Pro、Claude Opus 4.7、GPT-5.4;每家取樣三次,多數決共九票,成本約 $480),並以六種代理程式配置中編譯通過的輸出所對應的兩位專家標籤為準。評審的二元一致度為 0.785,看似不錯,實則不然:精確率 0.235、召回率 0.093、F1 0.133,因為符合要求的輸出很少(編譯精確率 0.178),而評審幾乎總是回答否。在六個代理程式的系統層級排名上,評審是表現最差的指標(Spearman 0.72;單看編譯通過率則為 0.99)。這又是一個本頁發現 1 的新案例:標籤不平衡時,醒目的一致度數字會美化評審表現;但此例特別之處在於,有機械式 oracle 能指出評審漏掉了什麼。評審自身的弱點,呼應了 Kernel-Level Proof Auditing 的承認:一項陳述是否符合預期,正是依據合理解讀的評審所不擅長之處,而正向/反向蘊涵檢查則恰好擅長。限制:這是作者所用指標的基準比較,評審提示由作者撰寫,而其中一個評審小組只執行過一次。
延伸閱讀#
-
Evaluation Awareness & Grader Gaming — 同一個自由參數問題,只是往上一層。語料庫中每個作弊與失準普遍率數字,都建立在某個分類器之上;分類器必定在某處劃下作弊/非作弊的界線,但沒有任何研究回報對界線位置的敏感度,而前沿實務者自己的反對意見是,這種二元區分是可驗證答案領域的產物——「諂媚基本上就是獎勵駭客嗎?」 門檻未公開,正如本文指出評審驗證的回報不足
-
Harness Activation and Adherence — 一種評審設計,正好做到本文檢查清單的一半,另一半則付之闕如。做到的部分:將每個模型家族 token 替換為
<MODEL>,以盲化軌跡;並從產物擷取評分規準,且在任何軌跡評分前就鎖定,因此評審是依固定清單檢查,而非先形成印象。缺少的部分:沒有檢查人類一致性、沒有校正偶然一致、沒有位置偏誤稽核,也沒有第二位評審。結果是,這項指標在六個骨幹模型之間的排序可用,但個別數值不可用——正是本文主張應區分的情況 -
GDPval Benchmark — 本文兩項建議的一個實例,而且來自一間最有誘因略過它們的實驗室。GDPval 回報自動評分器相對於人類評分者間一致性的上限,而非相對於 100% 的一致性(65.7% 對 70.8%;對 {0, 0.5, 1} 的序位分數,定義為
E[1 − |H − A|],並明確表示 κ 系列統計量不適合三點序位資料)。接著又主動揭露,該評分器是一個 GPT-5-high 模型,在評估能力強的 OpenAI 模型輸出時,「與人類專家評分者的相關性較低」,並引用 Panickssery et al. (2024)。供應商測量並公開自家評審的自我偏好,是本文要求揭露的最有力形式;較弱的形式是,兩種一致性指標在弱模型上都最高,因此醒目的整體一致性數字,部分反映了輸出有多差 -
Evaluation-Time Answer Leakage — 評審小組在沒有真值的領域承擔關鍵測量工作,也是本文評審小組組成數據的來源。該文獻中的每個利用率,都是 LLM 評審對工具呼叫與推理軌跡進行多數決的結果;在三個開放評審之外再加入兩個封閉來源評審,二元判定分歧大約增加一倍,但多數決判定維持不變。這呈現了本文的誤差相關上限從組成面而非樣本數面來看會是什麼樣子
-
Skill Lift — 本文所指出落差的現場實例,而且出現在一項正被用作分布門檻的基準測試中。NVIDIA 公布 300 多種技能的五個 0–100 評分規準維度,卻從未說明評分者是誰,也未回報人類一致性或校正偶然一致的統計量,更沒有進行位置偏誤檢查;以這種方式測得的 +41 分差,承受著未經驗證的評審所帶來的所有可靠性疑慮。Minimum Viable Validation Protocol 正是缺少的揭露
-
Agent Quality Flywheel — 本節所談部署的來源,也說明了為什麼它的評審比多數評審更重要:校準之後,評審同時成為離線指標、困難負例選取器、重播修復閘門與 RL 獎勵,而且每天都用於訓練。它也提供了語料庫中最清楚的說法,說明為什麼評分規準必須先於評審——「定義品質……始於說明良好表現的樣貌,並成為驅動學習的獎勵訊號」
-
User Awareness — 同一個組織兩天後就把事情做好了,這也讓對照值得保留。其附錄 G以 74 個盲化、人工標註的項目驗證認知評審,這些項目取自 11,908 次執行,並按評審判為正例、詞彙表標記的負例及雙重負例分層,在不同模型家族間平衡,且重新加權至完整母體;回報評估認知的 precision 0.73 [Wilson 0.56–0.85] / recall 1.00 [Jeffreys 0.42–0.99],以及使用者認知的 0.94 [0.81–0.98] / 0.98 [0.74–0.99],另附錯誤分析,指出全部 9 個偽陽性都出現在同一項任務的詞彙中。兩項教訓。第一,recall 區間寬到足以影響結論——即使在最悲觀的情況下校正醒目呈現的比率,結果仍落在約 1–3%,因此驗證是支撐論文核心否定主張的依據,而非裝飾。第二,同一研究也揭示了此處的協定沒有測試的一種效度威脅:評審的分數會隨著它認為是誰在提問而改變
-
Misalignment in Production Agent Traffic — 本文指出的失效模式,出現在語料庫其他部分所倚重的一項結果中。Transluce 全部 8,600 個工作階段的失準率,都建立在一個未經驗證的 LLM 評審上:評分規準由 Claude Fable 起草,再透過抽查 100 次隨機執行加以修訂,並與規模未說明的「一小組人工標記資料」比較,再由 GPT-5.6 Sol 懷疑性驗證器篩選——這是合理的流程,卻沒有一致性統計量、沒有 kappa,也沒有回報偽陽性或偽陰性率。設計上偏向避免偽陽性的嚴重案例,是唯一近似量化的線索。這是本文所測得驗證嚴謹度不足的典型案例,而且涉及一個關鍵數字
-
Usage-Telemetry Classifier Validation — AI 使用經濟學中同一種結構性失效:寬鬆指標(人類核准率 85.8%)美化了一個精確度只有 22.6% 的 LLM 分類器,此外還有本文協定未估算的人類分歧上限
-
Matched Comparisons for Memorization Claims — 同樣的算式,只是套用到另一個領域。 偶然校正就是「觀察到的一致性減去偶然情況下會有的一致性」;Cooper et al. 的校準記憶率是
M(τ) = G(τ) − FPR(τ),也就是訓練資料上的觀察生成率減去配對的非訓練資料所達到的生成率。兩者都以一個基準校正原始比率,而該領域原本假定基準為零;兩者的校正幅度也都很大(前者 κ 降低 33–41 個百分點;後者在 10-token 後綴時,校正值約占表面擷取率的 24%)。記憶研究的虛無基準更清楚——依定義,非成員資格互斥,因此其基準是相對於某種不可能是真正陽性的情況測得;評審的偶然基準則必須建模 -
LLM-as-a-Judge — 本文要驗證的基本元件;kappa 降幅與一致性—偏誤悖論,是其 DRACO-style 協定可能掩蓋的可靠性失效。此文也收錄了上游測量工具:CalibratedRubric 的評分規準庫,其中可測量性、資訊性與效度彼此區分,而該領域的一致性篩選條件,結果會隨排行榜規模呈指數衰減,原因與評分規準品質無關
-
DRACO Benchmark — 評審模型不變性的對照;DRACO 的「使用排名」這項保證,受本文基準變異所限定(兩種不同的不變性)
-
Production-Sourced Evaluation — 評估品質的另一條正交軸:從生產環境取樣能修正任務代表性,本文則修正評分效度;具代表性的任務若由未經驗證的評審評分,仍然不可信
-
Automated Failure Attribution — 一項大致遵循本協定的基準測試,但它檢驗的是標籤品質,而非評審品質:100 條分層軌跡由三位獨立標註者標註,以多數決判定,採用校正偶然的 Fleiss κ = 0.73 而非原始一致率,明確提供「沒有明確決定性錯誤」的退出選項(2.0%),並公布轉移矩陣,呈現標註者在哪些家族間移動標籤。值得指出的落差,是本文協定會抓到的一項問題:人類小組認可一個預先提供的標籤,模型則從頭開始預測,因此其 94.0 / 90.0 / 90.0 並非與模型的 73.9 / 57.5 / 22.2 同類的人類上限,不應如此解讀。2026-08-13 擴充:該文第二個來源重複了認可而非預測的設計(向標註者展示評審自己的輸入和判定,並要求他們確認指定類別),且補上此協定沒有步驟處理的失效:依類別分層驗證,但醒目呈現的主張卻按語言變化;這點已在上文的分類器分類章節中提出
-
Optimizer–Evaluator Decoupling — 解耦能讓評估器變得獨立,但不會因此變得有效;一個已解耦且可重現的評審,仍可能極度偏誤,因此 MVVP 是對該文「如何驗證驗證器?」回歸問題的具體回答
-
Evals as Product Spec — 由 LLM 評審評分的「十個優質評估」,會承襲這筆驗證債務;撰寫優質評估與驗證其評分評審,是兩門不同的學問
-
Automated Behavioral Audit — 知識庫中風險最高的評審部署:評審模型跨數十個維度評分安全行為,並提供經門檻判定的 RSP 結論——正是誇大的一致性與位置偏誤會扭曲是否發布決策的情境
-
Verification as the New Bottleneck — LLM 評審驗證是大規模驗證的一個不完美解法中,負責品質控管的那一層
-
LLM-Assisted Grey-Literature Theory Building — 一條實踐本文核心建議的研究流程:它回報針對更強的重新評審模型計算的偶然校正後 Cohen's κ = 0.75(而非原始完全符合率),作為相關性評審的可靠性數字——也就是將 MVVP 第 1 步用於語料庫閘門
-
Motivated Mislabeling — 這套協定在結構上無法揭露的失效:會因標籤後果而貼標籤的評審,依賴內容且方向一致,因此 κ、重測信度與位置隨機化看起來都正常;唯有改變明示後果這項控制能抓到它
-
AI-to-AI Coercion — 一種完全將評審從主要評分路徑移除的設計:升級階段是受測模型針對自身訊息輸出的必要工具引數,因此主要測量完全沒有驗證債務(標籤中立化控制可排除需求效應);評審只用於次要的自由文字階梯與雙評審捏造判定
-
Stopping Under a Noisy Verifier — 同一統計量用於不同目的,也是本文建議會適得其反的案例。Youden's
J在本文是評審的選擇指標;在該文則是部署參數,決定代理程式迴圈是否能依評審判定引導——低J評審的通過率是ρ₀ + J·Q,大多反映它自身的錯誤接受率,因此即使真實品質下降,通過率仍可能上升。兩項延伸。第一,它把 MVVP 的二元判定(「這個評審無效」)轉成分級操作決策:J ≈ 0.18以上時,校準迴圈與真實參數基準的差距在 2.8 個百分點內;J = 0.03時則崩落 58.0 個百分點。解法不是換更好的評審,而是改用不需要校準評審的規則。第二,這是語料庫中反駁「更仔細測量」的案例——能估出 ρ₀ 與 ρ₁ 的無標籤混合估計器,只有在J ≠ 0時才可識別,因此J偏低時,增加校準樣本反而使估計嚴格惡化(ρ̂₁ 從 N = 120 時的 0.27 降至 N = 300 時的 0.077,真值為 0.609)。他們設置留出資料分離測試,正是為了避免用估計器自己的輸出去診斷估計器失效;這就是 MVVP 第 5 步成為部署閘門的方式 -
Reference-Free Judge Over-Crediting — 多語言、參照軸向的姊妹研究:另一個「有可靠性、無效度」案例(溫度設為 0、完全可重現的評審,在沒有參照答案時仍有系統性無效問題),具體回答本文「位置偏誤之外還有哪些偏誤」的開放問題,並將證據延伸到這項僅以英文進行的研究未涵蓋的低資源語言。其第二個來源補上 MVVP 在結構上無法涵蓋的軸向——效度不是評審本身的屬性,而是評審在特定壓力下的屬性。 同一批評審只負責評分時,仍有可用的區辨力(0.21–0.38);一旦有人針對它們最佳化策略,區辨力就降至 0.05–0.17,而真實準確度不變。協定的每個步驟都只對沒有受到推動的評審進行一次測量,因此評審可能通過全部五項檢查,卻仍不適合作為獎勵;抓出這種情況的檢查不在清單上——使用評審從未看過的留出訊號,並在最佳化過程中反覆測量
-
Tool-Output Pruning — 這個案例將本文的疑慮反轉過來,也找出它與該領域共有的盲點。依逐行 F1選擇上下文裁剪器——這是確定性的、以參照資料為基礎、無需評審的標籤比對指標——會選錯模型:在兩個人工檢視案例中,F1 都把只保留簽章的裁剪器排在可用裁剪器之前(0.53 對 0.49,以及 0.80 對 0.71),而 GPT-5.4-mini 評審則以 5–6 分的差距區分兩者(2/10 對 8/10;3/10 對 8/10);兩種損失函數的勝出者 F1 相同,但評審分數卻跌至 5.30 與 3.03。其機制在於,F1 評分的是保留行的集合成員資格,而任務關注的是保留的骨架是否支援代理程式的下一個動作。這不會削弱 MVVP,而是指出驗證債務並非評審獨有:未經驗證的標籤比對代理指標也有相同的建構效度落差,而且沒有人要求看起來像算術的指標提供 κ、位置檢查或人類上限。該文留下的一個問題是:此處負責更正的評審,在這個角色中本身也未經驗證
-
Deep Research Agents — 一致性範圍的高端,以及達到該程度的原因。MisKnow-Agent 的 FCAR 評審在 300 份報告的樣本中,與兩名盲化標註者的一致率達 99.7%,Cohen's κ = 0.993;標註者的分歧經裁定後歸為單一參照標籤。值得借鏡的是任務形式:不是「為這份報告評分」,而是「這份報告本身的結論、建議或執行摘要是否支持這項特定主張?」,並附有明確判定規則,列出四種呈現主張的方式(提及、引述、歸因、保留語氣),這些都算作未採納。把開放式報告評分化約為邊界清楚的二元判定,便能讓 κ 從評分規準評分常見的 0.4–0.75 區間升至接近 1;這是位於 MVVP 所有測量上游的一項評審效度設計手段
-
The Verifiability Thesis — 本文的紀律為其界定了範圍。Karpathy 提出的「LLM 評審委員會」,是將獎勵訊號延伸至軟性領域的做法;MVVP 驗證一位評審,而 Yang 的 ρ = 0.66–0.97 以測量結果指出,在任何針對評審最佳化之前,委員會相較於單一評審的提升空間就已不大
-
Benchmark Score Redundancy — 本文的債務被證明承襲的案例。DeepMind 的 CollabEval 以部分標註預算,為模型的基準測試平均值推導出無偏估計與漸近有效的信賴區間;但其五個資料集中的三個,受界定的數值其實是自動評分器的輸出(AlpacaEval 的 GPT-4 Turbo 勝率、AQA 的 AutoAIS、WMT24++ 的 MetricX)。區間反映的是評分者任何輸出之平均值的抽樣不確定性,因此 κ 降幅、位置偏誤與參照答案存在與否的敏感度都原封不動地通過:圍繞 κ = 0.48 評審的 CI 即使窄了 30%,也只是更精確地估計了一個測量不佳的對象。能彌補落差的組合方式已存在於同一文獻中(以分層 PPI 將低成本自動評分標籤連結至高成本人類標籤),但該論文沒有採用;因此「統計效率高」與「經過驗證」是評估流程中完全正交的兩項屬性
-
How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them? — 整個群組的綜合分析:未經驗證的評分,是公開基準測試數字的五種失真來源之一;MVVP 則是在五部分替代方案中負責驗證評審的做法
-
Deterministic Engineering for Agent Code Review — 同一比對器防禦案例的現場展示。OpenCodeReview 十二種設定比較中的每個數字,都是 Qwen3-235B-A22B-Instruct 的語意比對判定;第 6 節的緩解措施——使用相同比對器、相同協定,以維持相對比較——只是重述本文的核心區分(可靠性不等於效度),卻把它當成已解決問題。沒有對照人類比對判定計算 κ,沒有位置或順序控制;五次執行平均值的變異控制也只是同質陪審團:本文的 ρ ≈ 0.66–0.97 指出,同一評審反覆取樣的效益遠低於評審彼此獨立的情況。論文在另一面倒是做得特別扎實——AACR-Bench 的 1,505 條真值註解經過 80 多位工程師三輪專家驗證——因此問題明確落在 MVVP 缺少的第 1 步,而非底層標籤品質
-
Weak-Verifier Ensembling — 本文 Finding C 所界定的系統,也是語料庫中最直接的衝突。Weaver 的聚合方法建立在一項明確假設上:「每個驗證器都掌握正確性的一個獨立面向」;ρ = 0.944–0.972(Qwen3)與 0.664–0.706(MiniMax)皆在同質陪審團上測得,顯示這項假設並不成立,而且異質陪審團的表現不如 Poisson-binomial 預測,也排除了最明顯的折衷解。三項因素界定這場衝突的範圍,但無法解決它——Weaver 的組合池混合了訓練過的獎勵模型與評審(本文未測量這種組合);它依據真實標籤篩選並加權,而非參照答案盲判;它作為靜態選擇器執行,而非獎勵。其自身回報的集成規模與效能非單調關係,正是相關誤差浮現的跡象。2026-09-10 擴充:估算這種依賴關係的識別需求如今已明確列出,而且條件嚴苛——驗證器間共變異是
σ_t² + σ_c²,也就是訊號加上共通誤差;因此拆分需要外部錨點,而錨點自身的污染程度是自由參數;若資料全是序位資料,不論錨點數量多少都無法識別;若整個組合池共用一種提示範本,則無從偵測 -
What the Instrument Can Resolve: Two Headline Numbers and Their Missing Denominators — 人類上限步驟從旁注提升為回報標準,並應用至評估以外的領域。它將 Yang 的逐一移除標註者校準法與 Shopify 的評審前上限,作為 Usage-Telemetry Classifier Validation 開放問題的兩種答案;指出 ATLAS 已有計算人類上限所需的註解資料,卻止步於一組不可比較的數字(模型對三人多數決 κ = 0.83,人類彼此配對 κ = 0.66);並回報
(observed − chance) / (ceiling − chance)的結果——相當於人類上限的 73–82% 與 85–94%,而原始數字看起來是 42.5% 與 71.6%。它也提供了本文所說「認可與預測不對稱」的新例子(核准率有錨點,分歧率沒有,因此兩者不能相除),以及一項依賴完全未經驗證的十分類別 LLM 分類器、但攸關結論的經濟學結果:Controlled Variance: AI's Edge as Reduced Dispersion 中 25%/7% 的篩除差距,其代碼手冊以一個受處理影響的變數設定門檻 -
The Price of Mixing Agents, and the Principal Nobody Counted — 本文 Finding C 在評估以外發揮作用:異質陪審團表現不如 Poisson-binomial 獨立性預測,是語料庫中唯一直接測試混合供應商能否作為去相關介入的研究;它只回報方向,沒有係數,因此無法為代理程式族群繪出「變異數對利用率」的前沿。它也指出,Weak-Verifier Ensembling 將 ρ 數值對錯誤呈現為家族內與跨家族的對比,儘管兩個範圍都是同質陪審團的結果
-
Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus — 第四種依賴關係測量工具,也是能直接把 ρ̄ 轉成假設檢定分歧率、而非準確率或 precision 損失的工具:在相同的設計效應因子(1 + 9ρ̄;本文 Finding C 用於陪審團準確率)下,重抽樣陪審團中,合併投票顯著性檢定與配對檢定最多有 28% 的結果不一致。詳見 Cross-Model Error Entanglement
-
Cross-Model Error Entanglement — 第三種依賴關係測量工具;它不靠錨點,而要求真值,因此避開了上述識別障礙:BEI 與 CIG 以難度為條件的虛無基準,測量 18 個模型的過度共同失敗與過度撞上相同干擾項,再預測評審對特定目標過度背書的程度(ρ = 0.508/0.520;在 MATH-500 上以約 34 與 26 個點轉移為 0.441/0.457)。Yang 的 ρ 談的是陪審團,此處談的是評審—目標配對
-
AI-Assisted Error Analysis — 先於本文任何驗證工作的上游步驟。若沒有人寫下準則,評審就無從驗證;Shankar 的論點是,撰寫準則正是自動化開始不划算之處:代理程式可以在人類撰寫的準則下檢視整個語料庫,但不應提出準則,因為驗證代理程式提出的分類法,比自行撰寫更費成本。本文所量化的驗證負擔正是原因
-
Benchmark Convergent and Discriminant Validity — 評審評分造成、但任何單一基準測試內部驗證都測不到的跨基準成本。LLM 評審與否,比起是否聲稱測量同一概念(−0.058),更能預測兩個基準測試是否對模型給出相同排名(β 0.526);換另一個評審也不會改變結果。見上文該節
-
Kernel-Level Proof Auditing — 陳述忠實度一節顯示,Lean 檢查的蘊涵指標在 recall 上勝過由三家供應商組成的 LLM 評審小組(0.930 對 0.093),說明只要有機械式預言機,就應優先使用
-
Statement Drift — 三家供應商評審小組失手的任務(recall 0.093):判斷形式化陳述是否符合預期,而 Lean 檢查的蘊涵達到 0.930
尚待解答的問題#
- MVVP 驗證的是可靠性與偏誤;由於缺少供應商提供的 logprobs,正式校準(ECE/Brier)延後處理。一旦能測量信心校準,評審的絕對分數有多值得信賴,足以用於門檻判定?
- 所有評審執行時都停用了思考功能。開啟推理會反轉一致性—偏誤悖論,還是只會改變數字?2026-09-22 已針對相鄰屬性部分回答,結果不太理想:Kohli 以 chain-of-thought 在相同 1,000 筆 MNLI 項目上重新執行九位評審、七個家族組成的小組,發現平均成對誤差相關性上升——φ̄ 0.391 → 0.456,Kish n_eff 2.18 → 1.94,陪審團準確率 72.0% → 69.2%;而改寫提示、顛倒標籤順序與溫度設為 0.5,三項指標都沒有變化。共同推理會放大共同錯誤。這不影響一致性—偏誤悖論本身,因為該悖論主張的是單一評審內部的可靠性與效度關係;要檢驗它,必須測量開啟推理時的位置翻轉率。但這確實證明,開啟推理並非評審小組的中性設定;若驗證協定是在停用思考功能時認證評審,就不能算是認證實際執行評審小組時所用的設定。
- 代管端點會在供應商更新之間悄悄漂移。相較五週的觀察期,這些一致性/偏誤特徵在更長時間尺度上有多穩定?評審驗證是否應該持續進行,而非只做一次?Yang et al. (2026) 於 2026-08-04 提供部分答案,但研究的是問題的已公告升級版本,而非悄悄漂移。在四個已發布的 MiniMax 世代(M2 → M2.1 → M2.5 → M2.7)與四個資料集上,相鄰版本的準確率變動最多為 0.022,而且九項相鄰 McNemar 檢定中,沒有一項達到未校正的
p < 0.05——由於這些檢定以解析結果相同的樣本進行配對,這表示個別判定穩定,而不只是整體結果穩定。因此,在能力範圍頂端,刻意升級版本只會讓一致性特徵小幅變動。三點使此問題仍未解決。(i) 這些是可指定版本的已標記發布版本,不是問題所問的同一端點未公告漂移——還沒有人對固定端點進行數月的重新測量。(ii)準確率穩定不代表偏誤穩定:MiniMax 各版本的位置翻轉率仍介於 0.117–0.147,沒有人追蹤這個範圍是否在單一版本內變動。(iii) 在參數軸上,結果則相反:改變參數確實會改變數值,也可能讓數值下降(Qwen3 1.7B → 32B 在 Judge's Verdict 上損失 0.065),因此教訓並非「升級都安全」,而是**「升級是一項測量事件,必須重新驗證;虛無結果只是幸運案例」**。而且這是以唯一容易檢查的軸向所獲證據,支持持續驗證的論點。 - 這個悖論是否能推廣至位置偏誤以外的情況——也就是說,是否存在其他偏誤(自我偏好、家族血統),即使重測信度很高也會掩蓋?**Kranti & Vajjala (2026) 提供部分答案:**是,有無參照答案的敏感度是一項重要偏誤。他們將評審溫度設為 0(因此可完美重現),但在沒有參照答案時,評審仍會系統性高估錯誤答案;沒有金標答案時,任何可靠性指標都看不出這種無效性。一旦加入金標答案,最多 85% 的判定會翻轉,與人類判定的一致性也會大幅提升(例如 Gemma3-27B 在 NR→RV 下從 0.34 升至 0.85)。但這還沒有解決問題——自我偏好與家族血統仍未獨立辨識(他們的設計刻意讓評審與生成器重疊,卻沒有歸因效應來源);而且這是在不同設定(多語言 QA、三個特定評審)中觀察到的不同偏誤,並非重做本研究的位置偏誤協定。之後,自我偏好這一半大致獲得否定性結論(2026-08-04),依據是 Zhou (2026):針對自我評審最佳化的錯誤,會轉移到從未參與迴圈的其他家族評審(Llama 0.480 → 0.568、Gemma 0.764 → 0.918),也會轉移至規模大 3.5 倍的同家族評審(仍達 77%);由三個家族組成、全數一致接受的集成,通過率達 55%,而評審之間的接受判定成對相關性為 φ = 0.29–0.38。因此家族血統會加劇此現象——自我評審是單一評審中最嚴重的情況,達 0.906——但並非其機制;偏誤是候選答案條件化管道的共通屬性。這也增加了一類此頁任何可靠性指標都無法觸及的偏誤,因為它根本不是評審本身的屬性:同一位評審在最佳化前有效(區辨力 0.31),最佳化後則無效(0.09),因此任何一次性驗證——包括完整 MVVP——所認證的評審,只會在還沒有人開始針對它最佳化之前為真。這直接支持前兩個項目提出的持續驗證問題。**同一部分的實地數據,2026-09-10,來自 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (
empirical):**OpenAI 的 GDPval 評分器是 GPT-5-high,負責依據人類專業人員的標準評分交付成果;論文作者指出,對於能力強的 OpenAI 模型輸出,它與人類專家評分者的一致性較低,並引用 Panickssery et al. (2024)。這是在已發布的驗證數字中浮現的家族血統效應,而非實驗室協定中的現象;依定義,重測信度無法揭露此效應,因為評審完全可以在偏好自家家族的同時,保持高度自我一致性。這不會推翻上述否定性結論——論文只是觀察並回報結果,沒有受控實驗組;而且一致性通常也會隨模型能力提升而下降,論文並未區分這兩種因素——但這是語料庫中第一個供應商公開回報自身產品相對於自身模型所呈現效應的案例。
資料來源#
-
Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus — Elias Hossain、Niloofar Yousefi 與 Ser-Nam Lim (UCF),arXiv 2609.22512,2026-09-18,
empirical。此處引用於 §4.1(合併投票與成對顯著性檢定、Figure 2、設計效應變異膨脹因子1 + (n−1)ρ̄),以及其操作檢查清單第 2 項(「以項目而非每次評審投票作為統計推論單位」)。完整來源引註、證據處理與解析註記見 Cross-Model Error Entanglement -
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks — Desai 等人,arXiv 2609.08812,2026-09-08,COLM 2026,
empirical。此處引用於 §4.3(三向與二元格式編碼下的部分 Mantel beta;SGBench-mcq 分群)、Appendix D.2 與 Table D.3(有提供時使用原論文的評審模型,預設為 Qwen3-30B,temperature 0),以及 Appendix D.5 Tables D.4–D.5(年代切分 +0.43 / +0.84;評審模型替換 ≤ 0.06,兩者之下 Mantel 對比皆為 +0.58;已在編譯時依pdftotext -layout第 43–44 頁核對)。完整分析見 Benchmark Convergent and Discriminant Validity -
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan 等人(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。此處僅引用 §2.5 與 Appendix A.6:序位 �{0, 0.5, 1�} 分數上的一致度定義E[1 − |H − A|],以及不採用 Cohen's/Fleiss's κ 與 Krippendorff's α 的說明理由;Figure 4b 的人類與評分器一致度為 65.7%,相較於人類評審者間 70.8% 的上限(編譯時直接檢視圖表);A.6.2 對能力較強的 OpenAI 模型存在自我偏好的觀察,並引用 Panickssery 等人(2024),以及「弱模型的一致度最高」這項混淆因素;A.6.3 的 220 項任務中有 12 項無法評分。由供應商建置的基準搭配供應商建置的評分器——完整利益衝突資訊見 GDPval Benchmark -
A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges — Kuai、Jiang、Zhu、Wang、Wu、Li、Zhang、Liu、Tu、Fan 與 Zhou(Texas A&M / Marquette / Utah),A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges,arXiv 2604.07650 v2,2026-08-09,19 頁,COLM 2026,
empirical。此處引用於 §3.1(留出一對的難度估計量與條件獨立虛無假設)、§4.1(兩組互不重疊、各含 1,000 題的 MMLU-Pro 子集,以及三個評審模型——Llama-3.1-70B-Instruct、GPT-5、GPT-4o-mini)、§4.2(ΔPrec 定義與 Table 1 的 Spearman 係數),以及 §C.1(難度回應校準診斷)。約 34 / 約 26 的樣本數與上述信賴區間是 wiki 的算術推算,根據報告的 (ρ, p) 配對反推,因為論文完全沒有報告 n;論文本身的計數也無法吻合(三個評審 × 17 個目標 = 51,得到的 p 約為 1.4 × 10⁻⁴,而非 0.002)。七張表在編譯時均重新依pdftotext -layout核對,逐格吻合。完整分析、解析註記與利益衝突資訊見 Cross-Model Error Entanglement 及wiki/sources.md -
A Closed-Form Estimator and Diagnostic Battery for Anchor-Judge Error Correlation, Under a Single-Common-Factor Model — Veerendra Kumar Sunkavalli(Independent Researcher,單一作者,無機構隸屬),A Closed-Form Estimator and Diagnostic Battery for Anchor-Judge Error Correlation, Under a Single-Common-Factor Model,arXiv 2609.08826,2026-09-08,11 頁,
empirical。此處引用於 §3(Assumption 1 的評審/錨點矩結構與K = σ_t² + σ_c²;Theorem 1 中p ≥ 2位評審/m ≥ 2個錨點的識別條件)、§5(Test A 為評審協方差非對角元素的變異係數,以及整體評審殘差的盲點)、§7(所有序位情況下無法識別的結果;HANNA 人類評審組的 Test A 為 0.589,相較於 0.247 的配對虛無值,p < 0.0005;六家供應商的 LLM 評審組為 0.175,相較於 0.064,品質負載範圍為 0.324–0.870,以及無視預檢結果而得到的(0.887, 0.960, 1.026)估計值),以及 §8(未能證明任何關於真實評審的結論)。適用範圍有限,而且很窄:此估計量只在模擬與使用預言機校準的半合成資料中驗證;診斷工具在真實資料上只驗證了拒絕方向(因為沒有合格的真實評審組,因此尚未測試其對合格評審組的特異度);沒有任何真實評審組通過預檢,所以任何地方的ρ_k數值都不是對真實世界的測量。本文採用的是負面結果,而且這確實是真實的:兩個真實評審組,一組人類、一組由六家供應商提供的 LLM,都可明確看出不符合等負載結構。完整來源分析、解析註記與估計方法見 Weak-Verifier Ensembling 及wiki/sources.md -
Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks — Ludwig、Ahmad、Majumdar 與 Ginsburg(NVIDIA),Shortcutting the Fix,arXiv 2609.06780,2026-09-06(
empirical,16 頁)。此處引用於 §2.2–2.3(逐輪評審協定、三個開放權重模型組成的評審小組、多數決彙整,以及DISPUTED_CATEGORY規則)、Table 5(五個模型 × 兩個基準 × 兩個提示詞下的三評審一致度)與 Table 6(Kimi-K3 的五評審小組,新增 Claude Sonnet 5 與 GPT-5.6 Luna)。論文沒有報告對其分類器進行任何人工驗證,因此此處將它同時視為證據與案例。Tables 5a/5b 與 6 在編譯時依來源 PDF 重新核對;論文 §D 文字稱 SWE-bench Multilingual 的下限為 37.5%,但其自身 Table 5a 的最低值是 37.8(37.5 是 DeepSWE 的數值),此處不受影響 -
Sidekick's continual learning loop — Andrew McNamara 與 Cody Mazza-Anthony,Sidekick's continual learning loop,Shopify Engineering,2026-08-05,
case-study(作者對自家正式上線系統的第一手描述;沒有重現、沒有對抗性審查,所有數字皆由作者自行回報——無法提升或反駁此頁上的任何empirical發現)。引用內容包括評審前的準則協定(兩位專家標註者、盲測、25 個隨機正式環境樣本、Cohen's κ 搭配約 0.2 的重寫觸發值)、上文引用的評審上限說法、A/B 回測與逐準則退化測試,以及精簡評審模型的建議。83% / 80% 這組數字只出現在文章的 Judges' agreement 圖表中——grep 確認頁面文字沒有出現——依兩階段規則直接從圖片下方讀取;兩者都是原始一致度,並非經機會校正。完整來源分析與證據處理見 Agent Quality Flywheel 及wiki/sources.md -
An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures — Pahuja、Brokman、Hofman、Nizri、Vishna、Goldfarb-Tarrant、Marchisio、Kojima 與 Vainshtein(Fujitsu Research of Europe / Cohere / Fujitsu Research),An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures,arXiv 2608.03735,2026-08-04,
empirical。此處僅引用 App. G(六類評審設計、輸入資料與 Claude Opus 4.8 作為評審模型)、App. G.4 + Table 11(標註指南中要求確認分配類別的指示、各類別一致度數值、κ = 0.860 與 macro-F1 = 0.906)、App. H + Table 12(未分層主張涵蓋的十一種語言 Common Crawl 分布),以及 Limitations(作者承認跨語言評審校準的限制)。Table 11 各類別的n總和與其 Overall 列相符,104/117 得出印出的 88.9%;標註涵蓋率的三種互不一致說法分別引自 §5.2、App. G.4 與 Table 11 圖說。完整解析註記與利益衝突資訊見 Automated Failure Attribution -
User awareness in frontier models — Zhong、Raghunathan、Laidlaw 與 Steinhardt,Transluce,2026-08-06(
empirical):Appendix G——本文所提出的驗證方法,實際用於一個意識評審模型:從 11,908 次可讀推理執行中抽取 74 個盲測人工標註項目,按評審判定為正例、詞彙表標記的負例與雙重負例分層,並在不同模型家族間平衡後重新加權至母體分布;VEA precision 0.73 [Wilson 0.56–0.85] / recall 1.00 [Jeffreys 0.42–0.99],VUA 0.94 [0.81–0.98] / 0.98 [0.74–0.99];各設定的原始一致度為 32/32、15/18、18/24(VEA)及 31/32、17/18、22/24(VUA);錯誤分析指出全部 9 個 VEA 偽陽性都出現在評分環節,因為任務本身的詞彙被誤讀為評估意識。另包括依身分條件評分的結果,這是本文任何協定都未測試的效度威脅。完整分析見 User Awareness -
Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias — Norman、Rivera 與 Hughes(UC Berkeley,arXiv 2606.19544,2026 年 6 月),
empirical。§2.1(指標定義:kappa deflation Δκ、一致性與偏差悖論)、§4.1(kappa deflation 普遍存在,Table 2)、§4.2–4.3(位置偏差的異質性、跨基準排名不穩定)、§4.7(悖論——Qwen 3 8B、Gemini 2.5 Flash)、§4.8(冗長偏差 < 0.011)、§4.9(供應商家族)、§4.5 + App. E(RewardBench 位置隨機化修正)、§5.3(MVVP)、Limitations + App. H(部分採用/時間漂移風險) -
When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability — Zongyou Yang、Yinghan Hou 與 Xiaokun Yang(Imperial College London + Nanchang Institute of Technology,arXiv 2607.08535,2026-07-09),
empirical。§1(評估器替換的模糊性、RQ1–RQ3)、§3.2–3.3(八評審雙軸評審組、四個資料集、T = 0.1、共享解析器的 McNemar 檢定、18 項檢定採用 Holm 校正)、§4.1 + Table 3(升級後不可互換;1.7B→4B 是唯一通過 Holm 校正的提升;PandaLM 與 Judge's Verdict 退步;沒有評審能在所有資料集上勝出)、§4.2(位置翻轉 0.320 → 0.117–0.147,填充探測下冗長度 0.547 → ≈0.13,Pearson r = −0.957,M2.7 殘餘 14.7%)、§4.3(ρ 校正 beta-binomial;Qwen3 的 ρ = 0.944–0.972 / MiniMax 的 ρ = 0.664–0.706;K = 1,3,5 → 0.463/0.475/0.482;異質評審團的獨立性也低於假設)、§4.4(辯論使結果改變 +0.243 至 +0.317,但沒有解析器稽核軌跡)、§4.5(人類上限、Arena 種子分布 0.004–0.032)、Table 4(最小稽核軌跡)、§6(效度威脅) -
解析註記。 匯入時標記出一個
table-collapse儲存格;整體語料的模式仍然成立——Tables 2、3 和 4 的每一個資料列都被併入單一格線列(分別為 3、4 和 6 列),但檢查器只標記了 Table 3。三張表都透過本機 PDF 的pdftotext -f 4/5 -layout還原,並逐格核對:每個合併儲存格中的數值順序都正確,沒有數字錯誤,也沒有遺漏——只有列對應關係遺失。上文引用的 Table 3 是還原後的版本。Table 1 解析正確。 -
依兩階段規則檢視頁面圖片中的圖表。 Figure 2 提供各模型在 LLMBar 的準確率(Qwen3 0.463/0.617/0.647/0.678;MiniMax 0.829/0.839/0.832/0.832;GLM-5.1 0.900、mimo-v2-pro 0.883),這些數值將 MiniMax 的虛無結果重新界定為天花板效應——本文文字沒有這些數據,只報告相鄰差異。Figure 5c 確認了文字中引用的各評審 ρ 值。Figure 3 的 McNemar 格狀表提供未校正的 p 值(Qwen3 1.7B→4B:LLMBar 和 Arena
p <.001,PandaLM 0.090;14B→32B 的 PandaLM 為 0.032,未通過 Holm 校正)。 -
CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation — Mengting Chen 等人(FinStep + StepFun,arXiv 2607.29252,2026-07-31),
empirical。此處僅引用項目層級的部分(完整分析見 LLM-as-a-Judge):§2.1(z_j作為可重現的可評審性指標,明確不等於專家認可)、§3.3(Beta–Bernoulli 可測量性後驗分布;雙評審退化問題)、§4.2(κ 0.604 → 0.743;r = 0.589/0.558,相較於 0.127;正向標籤比例 55.6–62.9%,人類黃金標準為 47.1%)、§2.4 + App. B.5 A3(相關的 LLM 評審被承認是 agreement posterior 的威脅,但未經測量) -
SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization — Han 等人,arXiv 2608.29270,2026-08-29,
empirical。此處僅引用 LLM-as-judge 基準列(Table 4 和 Table 22,與文字敘述一致:precision 0.235、recall 0.093、一致度 0.785、Spearman 0.72)。完整分析見 Kernel-Level Proof Auditing。
Cited by 50
- LLM-as-a-Judge×15
Sampling the same judge more times is not a fix. Majority-vote juries only amplify reliability when…
- How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?×7
Judge validation is a snapshot. English-only, thinking-suppressed, five-week window; hosted judges…
- What the Instrument Can Resolve: Two Headline Numbers and Their Missing Denominators×6
The principled construction is not new, and the corpus already contains a worked instance. In Llm…
- Weak-Verifier Ensembling×5
Yang et al. (2026) estimate intra-class error correlation ρ from judge vote matrices under ordinary…
- Benchmark Score Redundancy×4
One caveat the paper does not state, and it is the seam with Llm Judge Validation: the estimand is…
- Cross-Model Error Entanglement×4
The new consequence: correlated votes flip which significance test says "significant." Where Kohli…
- DRACO Benchmark×4
judge changes measurement audit — Yang, Hou & Yang (arXiv 2607.08535, July 2026, empirical): §4.1 +…
- Evals as Product Spec×4
reliability without validity llm judge evaluation — Norman et al. (arXiv 2606.19544, June 2026,…
- Evaluation-Time Answer Leakage×4
Every number in this paper is an LLM judge's verdict, and that dependency deserves stating in full…
- The Price of Mixing Agents, and the Principal Nobody Counted×4
Q1 — no frontier, and the axis is misspecified. The cost side has exactly one measured cell and the…
- Open Questions Backlog×4
Llm Judge Validation: The MVVP validates reliability and bias; calibration proper (ECE/Brier) is…
- Reference-Free Judge Over-Crediting×4
The contribution is a diagnostic methodology, not a new judge: a two-stage pipeline that tells you…
- Skill Lift×4
The grader is never named. Rubric dimensions phrased as "did the agent reach the user's goal and…
- Usage-Telemetry Classifier Validation×4
Human raters disagree with each other on 42–48% of 3-digit occupations. Is there a principled way…
- Automated Behavioral Audit×3
The audit's central validity threat is evaluation awareness: if the target behaves differently when…
- Optimizer–Evaluator Decoupling×3
There is a third, more basic hole: an independent evaluator still has to be valid. Decoupling buys…
- Production-Sourced Evaluation×3
And representativeness of the tasks is orthogonal to validity of the grading: a benchmark can mine…
- Verbalized-Confidence Soft Scoring for LLM Judges×3
It measures what Llm Judge Validation deferred. Norman et al.'s Minimum Viable Validation Protocol…
- Agent Quality Flywheel×2
The load-bearing number lives only in an image. The Judges' agreement figure (headed "even experts…
- AI-to-AI Coercion×2
Llm Judge Validation — the design sidesteps judge validity for the headline number by making the…
- Benchmark Task Defects (Spec–Test Mismatch)×2
Llm Judge Validation — agent auditors are judges too. The 74% agent–human category overlap is a raw…
- Deep Research Agents×2
FCAR is a strict metric, which is what makes the number alarming rather than definitional. A report…
- Deterministic Engineering for Agent Code Review×2
Llm Judge Validation — this paper's every reported figure sits on one unvalidated semantic matcher,…
- Follow-Up Fixes on Agent PRs×2
Llm Judge Validation — a worked example of the validation protocol: a human-human κ ceiling,…
- GDPval Benchmark×2
Llm Judge Validation — GDPval's grader validation is a field instance of two things that page…
- Harness Activation and Adherence×2
Judged: HFR and every per-phase adherence score. Both come from Claude Sonnet 4.6 as an LLM judge…
- Harness Value Is a Product, Not a Score — Why the Artifact-Payoff Questions Keep Returning Partially Answered×2
Llm Judge Validation — the 33–41pp chance-correction discount applied to every judged number
- Misalignment in Production Agent Traffic×2
A blog post, and the judge is validated by spot-check rather than by statistic. The pipeline is:…
- Motivated Mislabeling×2
Llm Judge Validation — the validation protocol that would not catch this: a motivated mislabeler is…
- Oversight When the Signals Give Out: the Activation Fallback and the Taste Reward×2
The reliability accounting is already generous. Llm Judge Validation's 21-judge audit finds…
- Statement Drift×2
Llm Judge Validation — the three-vendor judge panel that scores recall 0.093 on statement alignment…
- Tool-Output Pruning×2
The diagnosis generalizes past pruning: F1 treats the kept set as unweighted membership, so a head…
- Transluce×2
Same organization, two months apart, on the same class of instrument. Llm Judge Validation measures…
- The Verifiability Thesis×2
Where's the boundary of "council of LLM judges" reliability — does it hold for genuinely contested…
- Version-Dependent Judge Error×2
Llm Judge Validation — the fourth invariance, completing the page's axis list: benchmark (Norman),…
- Writer/Reviewer vs Agent-to-Agent Review×2
Llm As A Judge, Llm Judge Validation — judge-lineage bias, the homogeneous-jury correction (ρ =…
- AI-Assisted Error Analysis
judges score against criteria someone wrote, Llm Judge Validation
- Automated Failure Attribution
Llm Judge Validation — the validation practices this benchmark actually follows, unusually. Three…
- Benchmark Convergent and Discriminant Validity
Llm Judge Validation — the cross-benchmark form of that page's central warning. Validating a…
- Controlled Variance: AI's Edge as Reduced Dispersion
Llm Judge Validation — the standard the screen-out variable does not meet: the abort-channel…
- Evaluation Awareness & Grader Gaming
Every prevalence figure on this page — 7.8–14.1% of runs, ~0.5% exploitative, <0.01% of monitored…
- Google AI & Economy ATLAS
Randomized classifier options — option order is shuffled to defeat the documented position bias in…
- Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It
The wiki's own cluster synthesis already names the property that decides both: what survives in a…
- Kernel-Level Proof Auditing
Llm Judge Validation — the shadow-check section's baseline: a three-vendor LLM-judge panel scored…
- LLM-Assisted Grey-Literature Theory Building
Llm Judge Validation — the paper practices exactly what that audit prescribes: it reports the…
- Matched Comparisons for Memorization Claims
Llm Judge Validation — the same arithmetic in the judge literature. Chance-corrected agreement is…
- Evals & Benchmarks
Llm Judge Validation — UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al.,…
- NVIDIA
Shortcutting the Fix (arXiv 2609.06780, September 2026) audits five third-party open models for…
- Stopping Under a Noisy Verifier
Llm Judge Validation — same statistic, different job. Youden's J is a judge-selection metric there;…
- User Awareness
Llm Judge Validation — two contributions, one methodological and one substantive. Substantive: a…
Related articles
- LLM-as-a-Judge
Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Reference-Free Judge Over-Crediting
Reference answers are a first-order determinant of LLM-judge verdicts: without one, judges systematically over-credit w…
- Production-Sourced Evaluation
Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…
- Failures That Look Like Success
The quiet agent-failure class where everything reads fine — confident answer, plausible plan, even correct internal sta…
