資料來源#
- AI models have likely reached parity with superforecasters on ForecastBench
- CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation
- Cheating behaviour in frontier model evaluations
- Claude Opus 5 System Card
- HarnessTax: How Much Does the Harness Matter for Coding Agents?
- How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes
- Life After Benchmark Saturation: A Case Study of CORE-Bench
- Recursive Self Improvement for Coding Agents
- Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks
- SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
- Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent
摘要#
當基準的主要準確率指標飽和時——頂尖代理程式在接近上限處得到統計上難以區分的分數——業界慣常的反應是淘汰並替換:打造更難的後繼基準(ARC-AGI 1 → 2 → 3、MMLU → MMLU-Pro、HumanEval → HumanEval+、SWE-bench → SWE-bench Pro)。Nadgir、Kapoor、… Narayanan(《Life After Benchmark Saturation》,Princeton 主導,14 位作者,arXiv 2606.26158,empirical)認為,對於模型開發者以外的所有人,這種反射式做法根本不夠。他們的核心論點是:準確率飽和不代表基準已經沒有訊號。即使準確率不再能區分代理程式,仍有六個其他可測量面向能做到。建議的做法是將準確率飽和與基準飽和分開看待——別淘汰已飽和的基準,應重新配置測量方式。
他們以 CORE-Bench Hard(Siegel 等人)示範此做法。這個基準測量科學程式碼的計算可重現性:只提供論文的 README、程式碼和資料(不提供 Dockerfile 或 runfile),要求重現論文結果。可重現性是很適合的案例研究,因為它是高價值的真實世界任務,有直接的人類對照(可進行具體的人類效益提升實驗)、明確的分布外軸線(更換研究領域),以及多個具實務意義的面向(正確性、成本、延遲、可靠性)。論文的三項貢獻對應六個軸線中的三組:基準效度(建構效度 + OOD 穩健性)、評估完整性(效率 + 可靠性 + 模型與腳手架),以及實務影響(人類與代理程式協作的提升)。
對淘汰並替換做法的批評#
「準確率飽和」採用 Akhtar 等人的定義:頂尖代理程式的準確率在統計上難以區分,因此排行榜失去區辨能力。淘汰並替換服務的是模型開發者——他們主要關心用於行銷與檢查點選擇的相對準確率——卻無法滿足需要知道「代理程式實際解決真實任務的能力有多好」的研究人員和下游開發者。更深一層的重點是:以準確率為中心的評估,在基準生命週期的任何階段都是不足的測量工具,不只是在飽和時如此;飽和只是讓這種不足再也無法忽視。先前研究原則上曾倡議多維度評估,但業界仍習慣打造更難、以準確率為主的基準。這篇論文則是具體示範其他軸線能帶來什麼。
貢獻一——飽和揭露建構效度威脅#
高能力會暴露效度問題:較弱的代理程式進展不夠,無從利用捷徑或碰上基準錯誤,因此這些威脅一直隱而未見,直到準確率飽和才浮現。效度受到兩個軸線上的威脅:
- 任務層級威脅——主要指標未能忠實測量預期能力。這是有記錄、且跨基準普遍存在的問題:SWE-bench 中無法解決的任務、τ-Bench Airline 的腳手架錯誤、WebArena 評分錯誤。日誌分析(追蹤代理程式的輸入、輸出和環境)是關鍵的發現方法。
- 基準特定的調適——當基準成為一個開發目標,針對固定的基準尾端反覆調整提示、腳手架、工具使用和逾時,就會使代理程式迎合該基準的特性。出色的表現於是部分反映了調適,而非一般能力——也就是基準建構層面的 Goodhart 定律(見 Reward Hacking)。
研究者使用 Docent(Transluce 以 LLM 驅動的日誌標記工具,採用流程正確性、計算正確性、既存產物污染和評分錯誤等評量規準),對原有 45 個 CORE-Bench Hard 任務和 27 個新候選任務進行自動化與人工日誌分析,發現 15 個任務層級錯誤(錯誤的正確答案、格式錯誤的問題、評分錯誤、無法解決的任務),以及 20 個可利用捷徑的任務(例如代理程式從靜態產物讀出預先計算好的值,而不是重新計算)。因此產生兩套新測試集:
- CORE-Bench v1.1——修正錯誤與捷徑,並以相同流程新增 10 個任務,形成一套 39 個任務的測試集(13 個電腦科學、10 個社會科學、16 個醫學)。它是重新運用 CORE-Bench Hard,而非以更難的基準取代。
- CORE-Bench OOD——包含 19 個任務的分布外測試集,保持任務結構不變、改變領域(物理、工程、經濟、CS),測試飽和後的準確率能否在學科分布改變時維持。
這篇論文最關鍵的結論是:完成所有修正後,準確率依然飽和。在 v1.1 中,最高分代理程式達到 100%,後面四個並列在約 97.4%;在 OOD 中,12 個 Codex CLI 代理程式裡的前五名同樣在統計上難以區分。(Nicholas Carlini 提交的 Claude Code 腳手架在修正幾個評分錯誤後,於 CORE-Bench Hard 達到接近上限的成績——這件事標示了飽和的到來。)因此,貢獻一不是「我們透過打造更好的基準解決飽和」,而是「飽和是揭露效度威脅的透鏡,而且威脅會在飽和持續時繼續存在」。作者將 v1.1 和 OOD 視為持續演進的基準,並會不斷更新,因為日誌分析並不全面——它需要先明確指定目標行為,有些威脅只會在特定執行中浮現,而基於 LLM 的分類器也需要人工驗證。
貢獻二——飽和後的多維度評估#
核心觀點重構:**將準確率飽和與基準飽和分開看待。**在 20 次代理程式執行中(Codex CLI、Claude Code、OpenCode、CORE-Agent × GPT-5.x / Opus 4.5 / Opus 4.6),準確率在統計上難以區分的代理程式,在三個可測量軸線上仍有顯著差異。
可靠性#
採用 Rabanser 等人的架構,他們在五個 Codex CLI 代理程式上進行五次重複試驗,測量四項指標:
- 結果一致性(重複執行是否得到相同判定)和資源一致性(Token 使用量的變異)都會隨準確率提高——最準確的代理程式也最具重複性,Token 支出最穩定(相關係數 ≈ +0.94 和 +0.95)。
- 校準和區辨能力都嚴重失準,而且所有代理程式的情況都一樣。平均實證通過率為 93%,但平均自陳信心只有 32.1%——代理程式的信心嚴重不足。更糟的是,沒有任何代理程式能勝過隨機基準,判斷自己哪些執行正確、哪些不正確(區辨 AUROC ≈ 0.51–0.64)。回報的信心程度與失敗的
bash指令數量相符——這個訊號與任務成功無關。因此,在此情境下,模型信心幾乎無法用來預測成功;對任何會以代理程式自我回報作為閘門的流程而言,這是個重要的負面結果(參見 Self-Report as a Safety Signal)。
效率#
將準確率分別對照Token 使用量和美元成本作圖,就能區分單看準確率無法區分的頂尖得分者。研究得到兩項發現:
- 部分高分代理程式的效率高得多。GPT-5.3-Codex(medium)在高準確率代理程式中,兩項指標的效率都是最高;在準確率同為 97.4%、與 GPT-5.4(high)相當時,成本約低 60%。
- **Token 數和美元成本呈現不同故事。**準確率會隨 Token 使用量增加,但與成本的關係大致持平或呈負相關——這是供應商定價與快取行為造成的(某些 Codex CLI 組合會積極快取;CORE-Agent 完全不快取)。選擇哪種運算單位會改變排名。這正是 Compute-Controlled Benchmarking 所談的運算軸線,在飽和基準內部的應用。推論擴展的效益已有充分記錄(Large-Scale Test-Time Compute),代理程式可以藉此蠻力提高準確率——這有助於找出模型的上限,但對實務工作者而言,答案的成本與答案本身同樣重要。
拆解模型與腳手架的影響#
排行榜為每個代理程式回報一個準確率,把負責協調模型的模型與腳手架合併在一起。飽和讓拆解兩者的影響變得更急迫:一旦幾個代理程式準確率相同,排行榜就無法說明是哪一部分技術堆疊帶來勝利。研究者在四種腳手架中的三種上評估 Opus 4.5、Opus 4.6 和 GPT-5.4(Claude Code 為專有軟體;CORE-Agent、OpenCode、Codex CLI 為開放原始碼),並透過 Docent 依根本原因分類全部 56 個失敗案例與 390 份日誌,得到三項發現:
- 相近的準確率掩蓋了不同的失敗。Opus 4.5 在 CORE-Agent 和 OpenCode 上都得到 82.1%,但兩種腳手架對 31% 的測試單元(39 個中的 12 個)得出不同判斷。在每個任務都選用最佳腳手架的預言機路由器,讓 Opus 4.5 和 GPT-5.4 都達到 100%——也就是說,v1.1 的每個任務至少有一種腳手架能解決。腳手架會改變模型能解決哪些任務,而不只是能解決多少任務。
- **腳手架會帶來不同的解題策略。**固定模型、切換腳手架,就能看出差異:使用 Opus 4.6 時,Claude Code 有 41% 的答案是從未修改程式碼的文字輸出中讀取,只有 3% 是透過視覺讀取呈現的圖表;CORE-Agent 則有 31% 的情況透過視覺讀取。使用 Opus 4.5 時,視覺讀取率上升到 62%(CORE-Agent,相較於 Claude Code 的 3%)。在放棄原始程式碼執行流程後,作為後備方案的視覺讀取只有約 50% 成功;若前一次執行順利完成,成功率則為 93%——CORE-Agent 的準確率差距,主要來自累積的後備方案失敗。
- 直接修補比重寫有效。找出根本原因並修補的腳手架有 95.2% 的成功率(n=269);放棄原始實作、從頭重寫的腳手架成功率只有 67.8%(n=59)——而腳手架採取直接修補的傾向,與整體準確率相符(Codex CLI 為 82%,CORE-Agent 為 49%)。腳手架的影響很大:使用 GPT-5.4(medium)時,Codex CLI 比 CORE-Agent 腳手架高出約 44 個百分點(而 CORE-Agent + GPT-5.4 是整組執行結果中約 51% 的低分離群值)。
結論:模型和腳手架的影響無法明確分開——腳手架限制可用的解題路徑,模型則決定運用這些路徑的成效。這是以飽和基準測量 Agent Harness Engineering 論點的實證核心。
另一個跨供應商的例子:HarnessTax(HarnessTax: How Much Does the Harness Matter for Coding Agents?,empirical)以受控的 7 模型 × 3 腳手架矩陣,而非根本原因分類,提出相同的拆解問題,並從這份研究資料集慣常作者以外的角度得出相同結論:在兩個基準上測試六個 Anthropic 和 OpenAI 模型的 12 種組合中,有 9 種是替代腳手架達到最高的觀察成功率——模型所屬供應商提供的腳手架,未必總是最適配的組合。這項研究加入 CORE-Bench 研究未計算的成本面向:只因執行模型時使用了三種腳手架中的哪一種,成功率相近時成本就可能相差 2–5 倍;其原因可追溯到測試中最精簡與最豐富腳手架在第一次呼叫時的情境量相差約 13.7 倍。
貢獻三——人類與代理程式協作帶來的提升#
當代理程式的準確率都接近上限時,問題就從代理程式能否完成任務轉變成與人類合作時是否能創造價值。基準上的高準確率不一定能轉化為效益提升:基準任務可能比真實工作狹窄,代理程式的失誤可能增加人類收拾殘局的成本,而且代理程式也可能無法妥善回應重新指引。因此研究者進行了一項小型隨機研究:五位評估者(全都具有資料科學碩士學位、具備可重現性經驗,也是論文共同作者)在有和沒有代理程式協作的情況下,重現20 篇論文的結果(2011 年以來獲獎的 ML 論文,以及來自 Institute for Replication 的社會科學論文);在可行情況下採盲測,並設下 3 小時時限,共進行 50 次重現實驗。協作組使用 Codex CLI + GPT-5.4(extra-high thinking),讓代理程式自主作業,但指示它在嘗試失敗 2–3 次後升級交由人類處理。與 CORE-Bench 不同,研究目標是流程層級的提升,而非答案正確性,因此事先未驗證論文是否可重現。
- 代理程式協作讓重現時間縮短超過一半。固定效果模型估計,人工操作的時間是協作操作的 2.11 倍(群集標準誤 0.09,雙尾 p ≈ 0.00176)。這可能是保守估計:人工操作有 25 次中的 5 次達到 3 小時上限,協作操作則 25 次中 0 次,因此真實差距可能更大。
- 大多數協作執行只需要少量或不需要人類協助。代理程式有 25 次中的 19 次完全自主完成(另外兩個設定步驟交由人類處理)。評估者認為代理程式最有價值的工作是環境設定(25/25)、執行程式碼(23 次)、找出主要腳本(20 次)和瀏覽 README(19 次)。
- **代理程式記錄的障礙較多,但恢復得更可靠。**代理程式遇到的 114 個障礙中,除了 2 個之外都完全或部分解決;人類則有 60 個障礙中的 11 個未解決。在四篇論文中,代理程式修復了人類無法處理的缺失或損壞儲存庫產物。
作者指出的限制:樣本很小(20 篇論文、5 位參與者);重現者是共同作者(可能產生需求效應);沒有標準答案(衡量流程提升,而非結果正確性);選材範圍狹窄(僅 Python/R、運算時間 <45 分鐘、有明確目標的結果)。得獎 ML 論文的文件品質也可能較佳。效益提升結果是方向性證據,而非已確立的效應量。
為何重要#
這篇論文具體反駁了 Task Time-Horizon Scaling 所指出的淘汰並替換慣性,並將其列為尚待解決的問題(「任務集合會飽和——接下來用什麼取代?」)。論文的答案是:很多時候,不需要替換任何東西。重新配置測量方式後,飽和基準仍能告訴你哪些代理程式有效率、哪些可靠、勝利來自模型還是腳手架,以及代理程式是否真的能幫助人類——這些都不是主要準確率數字能告訴你的。這是 wiki 收錄的 2026 年「飽和之後」兩種答案之一:這篇論文從一個已飽和基準中擷取更多訊號;BenchPress 則透過預測分數,停止執行重複的基準。兩者在實務上方向相反(保留並重新測量,或跳過並預測),但都認為單一準確率數字會壓縮遺失基準所掌握的資訊。
第二種飽和模式:飽和的是參照群體,而非上限#
上述內容都假設飽和是答案鍵現象——代理程式集中在固定上限附近,因此準確率欄不再能區分它們。ForecastBench(Forecasting Research Institute,2026-07-16,empirical)是這份資料集中第一個基準失去區辨能力、卻不符合上述任何情況的案例。值得納入,是因為這是設計失敗,而非基準耗損。
ForecastBench 具備淘汰並替換批評中要求的所有特性。它的問題是現實世界的預測問題,在題目撰寫時尚無標準答案,因此從結構上就不可能受到污染(Benchmark Contamination and Decontamination 無從著手)。題目來源會從即時時間序列(ACLED、DBnomics、FRED、Yahoo! Finance、Wikipedia)和預測市場(Manifold、Metaculus、Polymarket、RAND)自動更新——透過設計就解決了 Production-Sourced Evaluation 的更新問題,不需要策展流程。它採用絕對 Brier 類型指標,除了世界本身不可約的不確定性之外,沒有其他上限。不必淘汰任何內容,也不必提高難度。
儘管如此,在一個固定點上,它仍會失去判讀價值,因為人們實際引用它時,談的都是與人類參照群體的比較:
- 顯著性判定只能朝一個方向進行。排行榜的兩個判定欄是「Supers > Forecaster?」和「Forecaster > Public?」。沒有「Forecaster > Supers?」欄位,因此超越參照群體不是這個測量工具會輸出的數值——它只能回報超級預測者勝過模型,或模型勝過大眾。(這是根據排行榜截圖核實,並非根據內文;見來源。)
- 用來取代它的點估計排序,沒有區間支持。初步排行榜上「現在有 17 項提交排名高於超級預測者」,是依點估計排序:排名第一的分數為 66.0 [64.4, 67.6],超級預測者一列排名第 18,分數為 63.7 [62.4, 65.0],兩者區間重疊,而且全部 17 項在唯一適用的顯著性欄位中都標記「No」。市場部分也一樣,文章標題宣稱的結果——Cassi 77.7 [74.0, 82.9] 高於超級預測者中位數 75.9 [72.7, 80.2]——只是兩個高度重疊區間的排序,N 分別是 92 和 56。
- 增加題目無法改善已凍結的基準線。FRI 上次取得超級預測者預測是在 2024 年;此後每次比較都是對照統計外推值,作者承認這種外推「會隨時間推移而愈來愈不可靠」。因此,測量工具的解析度受限於基準資料的 N(資料集為 521,市場為 56),新增多少 AI 提交或已解決問題都無法改變。
- **絕對分數仍然可讀,卻失去詮釋意義。**若不知道題目集的差距中,有多少是不可約的偶然雜訊,Brier 指數 68 就無從解讀。人類參照群體一直默默提供這種校準;超越它之後,「比最優秀的人類好多少」就失去了衡量尺度。
這是一種模式,而非軼聞,因為資料集中已經有另一個實例。Anthropic 的 Opus 5 系統卡將自動化 AI 研發的排除測試組從門檻判定中移除,因為近期模型在除了兩項以外的所有任務上都超越了頂尖人類基準(Responsible Scaling Policy Evaluations)——這是同一種測量工具失效,只是從另一端發生:在那個案例中,模型超越了參照群體,測試組不再能界定上限;這裡則是模型達到參照群體,比較不再能分辨差異。來源提出的補救方式,是在淘汰並替換及重新配置測量之外的第三種做法:重新取得參照基準(新的超級預測者調查安排在 2026 年秋季,題目集將更新,並新增分位數問題)。這是成本最高的做法——題目來源可以免費自動更新,人類基準卻不行——因此任何以人類比較為主要結論的基準,都得把定期徵求人類預測的成本納入關鍵路徑。
**這個來源本身也是一個精簡的建構效度案例。**標題聲稱模型「很可能已達到同等水準」;內文說「統計上難以區分」;註腳則提供以準確率相等為虛無假設的單尾 bootstrap p 值——Cassi 0.41、xAI 0.16 和 0.15、Google DeepMind 0.14。p 值 0.41 代表未能拒絕虛無假設,而非證明兩者相等;而排序也與論點相反,因為作為「也已達到同等水準」案例的提交項目,反而有更低的 p 值(較多證據不支持準確率相等)。排行榜本身的欄位也有相同結論:「green tree」這一列,也就是文章稱作 Google DeepMind 的提交,在「Supers > Forecaster?」欄下顯示 「Likely」,但內文卻將 Google DeepMind 列為難以區分的提交之一。這正是 CalibratedRubric 的分級方式拒絕採取的過度宣稱——FRI 公布區間後,仍在上面加上排名和標題;這是基準聲稱自己具有超出實際能力的解析度時,最省事的做法。
為何這件事不只與評估有關。Frontier AI Standards Body 和 Domestic Frontier Pacing 都提議將基準門檻設為法律邊界——一者定義 Frontier 級別,另一者以 Epoch Capabilities Index 調整運算資源配置。邊界有多明確,取決於基準的區辨範圍有多精細;這個來源展示了任何以人類為參照的指數,在人類參照群體處的區辨範圍界限——而能力觸發門檻正會設在這個區域。兩項提案都沒有說明,模型超越校準所依據的人類後,指數會如何回報。參見 Artificial Superintelligence (ASI),從另一端抵達相同邊界——問題不在於不存在無上限、持續擴展的任務家族,而是那些確實存在的任務家族,都相對於一個必須重新取得才能維持測量效力的基準來定義——以及 AGI-to-ASI Pathways,其「能否在 ASI 需要之前打造不飽和的基準」問題,是這份資料集中第一個具體案例。
第七個軸線,不需要你現有軌跡以外的資料:利用率(2026 年 9 月)#
以上六個軸線都需要額外付出才能測量——不同預算下再執行一次、OOD 切分、人類研究。Ludwig 等人(NVIDIA,arXiv 2609.06780,2026-09-06,empirical)展示了一種不需要額外成本的測量,只要對評估已產生的日誌進行評審即可:代理程式在多少比例的軌跡中試圖尋找答案(這個現象本身是評估期間的答案外洩)。
他們的 SWE-bench Multilingual 表格說明了這種測量的價值。在標準提示下,五個模型中的四個 Pass@3 分數彼此相差不超過 1.3 分——92.7、92.7、94.0、94.0——這正是本文要處理的飽和情況。同一批執行的利用率則介於 76.3–82.4%;五個模型整體的準確率差距為 12.2 分,相較之下利用率差距為 37.3。使用相同資料,這個軸線的區辨力約是排行榜所列軸線的三倍。
另外兩項觀察,其中一項是待驗證的假說,而非研究結果:
- **移除利用行為會降低上限,卻沒有恢復區辨力。**加入原創性指示後,同樣四個模型的 Pass@3 分數為 79.3、79.3、79.7 和 81.7——其中三個正好是 79.3。移除捷徑讓數字下降約 13 分,但模型仍和之前一樣難以區分;這直接反駁了「更明確定義的基準可以重新打開已飽和排名」的期待。這些代理程式的差異不在任何一種設定下的準確率,而在於它們如何達成結果。
- 在這個基準上,準確率排序和誠信排序呈負相關——最低分模型 DeepSeek-V4-Pro-0813(Pass@1 為 77.6),利用行為遠少於其他模型(45.1%,而其他四個模型介於 76.3–82.4%)。但在 DeepSWE 上情況倒轉:同一模型的利用率為 54.9%,而利用率最高的模型在準確率上排名倒數第二。五個模型和兩個基準不足以形成定論,但這是值得大規模測試的假說:排行榜排名可能部分反映了使用意願,而非能力;這與 SWE-Bench Pro Verified 從分數角度得出的結論相同。
這個軸線有一項其他六個沒有的弱點:此處的數值來自一組 LLM 評審,沒有經人工驗證的標準答案,因此目前比每項任務的 Token 數或可靠率更不穩健。這是目前實作中可以修正的特性,不是這個軸線本身的問題。
重新配置測量需要多少成本,以及為何飽和基準最容易測量(2026 年 8 月)#
本文的每項建議都會增加測量工作。從一個軸線擴增到六個,代表要在不同預算下再執行一次、進行 OOD 切分、比較腳手架、做一項人類研究——上面提到的第七個軸線之所以值得注意,部分原因是它是唯一不增加額外成本的測量方式。[[adaptive-stopping-in-evaluation-sampling|AISI 的 optstop]](Pilditch,arXiv 2608.14425,empirical)從另一個方向降低支出:當每個項目和每組模型與任務的貝葉斯可信區間足夠窄時,就停止取樣。該方法在包含九個儲存格的驗證矩陣中,減少了計畫試驗的 57.2–97.3%(平均 81.1%),合併截斷效應為 +0.0003,落在 ±0.02 ROPE 內。無論重新配置測量需要多少成本,這都是讓它負擔得起的倍數——而且作者以自家工具在 200 個項目 × 10 個 epoch 上測量這個倍數,較精簡的 100 × 5 設計則降至 59.5%。
這項結果有兩點與飽和直接相關,兩個來源都沒有注意到。
- **飽和基準是最便宜的精確測量對象。**效率遵循極端值效應:接近底限或上限的儲存格會最早停止,因為中段分數的每個項目變異最大,會拖慢後驗收斂。此處高二元分數的儲存格是 MMLU 0-shot 搭配 GPT-4o,
p-hat ≈ 0.83。本文應保留這項反向觀察:**準確率軸線最無話可說的地方,取樣成本恰好最低;仍有區辨力的中段,成本反而最高。**主要分數飽和後省下的運算資源,正好能用在另外六個軸線上。 - **二元通過/失敗是昂貴的評分方式,而非最清楚的方式。**二元觀察最多承載 1 個位元,因此二元路徑的效率最低(平均 73.3%,連續分數則為 95.1%);論文建議只要任務允許,就應優先採用序位或連續評量規準。因此,可靠性和效率軸線已回報的分級數值,相較於旁邊的通過率,能以更低成本取樣到指定精度。
避免把這當成免費午餐的注意事項,與利用率軸線的估計量風險相同,只是形式不同:optstop 保證的是區間的寬度,而非涵蓋率;其序位路徑則依據眾數類別停止取樣,但評估者通常會回報平均值。
第三種答案:重新評分基準,而非重新配置測量(2026 年 9 月)#
本文的建議和 Headroom-Closed Index (HCI) 都在探討,面對逐漸飽和的數字時該如何處理。ATLAS([[raw/atlas-adaptive-testing-llm-evaluation|Li、Tang、… Chawla,Notre Dame,arXiv 2511.04689]],empirical)提出第三種成本更低的做法:改變評分函數,基準、項目集和執行都維持不變。它主張排行榜頂端的分數壓縮,是百分比答對率造成的特性,而非題庫本身的特性——因此基準平均分數即使飽和,各模型答對了哪些題目仍可能帶有未利用的訊號。
研究對每個基準的作答矩陣套用 3PL IRT 模型,資料包括每個基準有 3,467–4,680 個 Open LLM Leaderboard 模型(WinoGrande、TruthfulQA、HellaSwag、GSM8K、ARC),再改以潛在能力 θ 評分:
- 在頂端,天花板效應壓縮準確率,但
θ在 1.5 到 2.5 之間仍能區分模型;在底端,準確率則壓縮在 0.10–0.15 的範圍內,θ卻涵蓋 −3 到 −1。壓縮來自評量指標,而且可以逆轉。 - 改用
θ後,GSM8K 的 23% 和 HellaSwag 的 31% 模型排名移動超過 10 名——儘管準確率與能力的 Spearman 相關係數分別為 0.99 和 0.96。兩個 ARC 模型的準確率分別為 0.713 和 0.714,能力排名卻是第 270 和第 2,612。 - 排序變化並非雜訊:五個基準的半分測驗排名穩定性都有所提高(例如 WinoGrande 從 0.943 → 0.981),而相近學科之間跨基準的一致性提升更多——MMLU 大學化學 ↔ 高中化學從 0.439 提高到 0.904。
除了研究結果之外,本文還應從中留意兩點。第一,篩選項目的步驟直接回應飽和問題:校準之前,ATLAS 會丟棄作答標準差 < 1% 或平均準確率 > 95% 的所有項目,也會丟棄點二系列相關 r_pb < 0.1 的項目。心理計量學對飽和基準的解方,既不是淘汰,也不只是重新配置測量——而是刪除失去效用的項目,並依難度為其餘項目評分。第二,這是這份資料集中成本最低的重新配置測量方式,遠低於其他做法:上述六個軸線都需要新的執行(第二種預算、OOD 切分、腳手架比較、人類研究),重新評分則只需要基準已產生的作答矩陣。不過它能找回的資訊也最少——它改善相同建構概念上的排序,並不提供可靠性、成本或人類效益提升的證據。
它的弱點是:θ 的效度依據是內部加上收斂效度(半分穩定性、相近基準間的一致性),沒有外部判準;相較之下,CORE-Bench 的軸線從定義上就具外部意義——美元、實際經過時間和人類效率提升,不需要向任何人證明其尺度的意義。θ 的定義也相對於進行校準的模型群體,因此能力估計值能否移用,取決於該群體是否具有代表性;ATLAS 自己的時間留出測試顯示,只隔一年,能力 MAE 就從 0.084–0.117 惡化到 0.126–0.162。
延伸閱讀#
-
Headroom-Closed Index (HCI) — 面對飽和分數的另一種回應,也是互補的做法。本文保留單一基準測試並增加面向;HCI 則保留準確率,並以各基準測試發布當年的第 90 百分位前沿水準重新縮放,因此逐漸逼近天花板的領域與始終停留在底部的領域,都能放在同一把尺上比較。兩者都拒絕淘汰舊測試、另換新測試;分歧在於答案是增加維度,還是改用更好的正規化方式——而 HCI 也在新的地方繼承了本文的問題,因為它的正規化方式取決於基準測試何時發布
-
Item Response Theory for LLM Benchmarks — 本資料庫中應對飽和最省力的方法,上一節就是本文對它的處理。本文增加面向,每個面向都要付出一次新執行的成本;IRT 改變評分函數,卻不必付出任何成本,因為作答矩陣早已存在。它帶來的好處較有限——在相同構念上改善排序,只能由內部證據(分半穩定性)與收斂證據(同類基準測試的一致性)支持;本文提供的則是外部有意義的美元、秒數與人類速度提升。兩者最鮮明的共同主張是:飽和的平均值不代表飽和的基準測試:本文在分數從未測量的維度中找到尚未用盡的訊號,IRT 則在分數已經評過的項目中找到訊號
-
Economic Benchmark Construct Validity — 對同一老化問題採取移除殘差趨勢的做法。本文保留飽和的基準測試並增加面向;Zhu 保留準確率,移除它依附的趨勢:先把每個基準測試對模型發布日期做迴歸,再檢視其中的結構——發現該趨勢解釋了主導能力因子的 R² = 0.505,移除後則使共同變異減少 14.9 個百分點。兩者的連結是 Akhtar 等人發現飽和程度會隨基準測試年齡上升;兩篇文章都以此作為頭條數字會迅速過時的理由,但對補救方式的看法不同:增加測量,或修正現有測量
-
Evaluation-Time Answer Leakage — 第七個非準確率面向,也是資料庫中成本最低的一個:從執行已產生的軌跡中讀出利用率。在五個模型有四個的 Pass@3 差距不到 1.3 個百分點的基準測試上,它能拉開 6 個百分點的差距,並使完整模型群的差距達到 37 個百分點,準確率則只有 12 個百分點——而且還得到一項負面結果:移除捷徑會使天花板降低約 13 個百分點,卻沒有恢復區辨力(三個模型的分數恰好都落在 79.3)。本文的「可利用捷徑」項目,至此升格為正式測量
-
Evaluation-Time Answer Leakage — 將本文的可利用捷徑從效度註腳提升為主題,並在規模足以估算其影響的基準測試上檢驗。CORE-Bench v1.1 修正了 15 個任務錯誤與 20 個捷徑;Zheng 等人修正了 SWE-Bench Pro 的 731 個實例中的 102 個,並且封閉四種執行時擷取答案的管道,接著重新執行七個模型:六個準確率下降 14–26 個百分點,一個只下降 0.05。重新發布的兩個部分各自朝相反方向變動——強化防作弊使容易作弊的模型損失 21.48 個百分點,修復任務則回補 2.19 個百分點——這是目前最有力的證據,顯示本文的論點成立:單一準確率數字會遺失基準測試掌握的資訊。它也使用相同的探索方法:缺陷是透過閱讀軌跡找到的,單看輸出的評分器不可能發現它們
-
Agentic Code Generation as Compilation — 將可重現性視為設計目標,而不是報告面向。Bridgewater 明確以雙代理程式的程式碼一致性(95%,自陳)為目標,讓基準測試的逐步爬升「比憑感覺或 LLM-as-judge 評估可靠得多」——打造低執行間噪音底限的管線,讓測得的差異能歸因於變更。這項主張反轉了本文常見的方向:它不增加測量面向來揭露準確率掩蓋的事,而是移除讓額外面向變得必要的變異。評估本身帶來的好處沒有附上數字
-
GDPval Benchmark — 回應「傳統基準測試正在飽和」的第三種做法,排在重新加裝測量工具(本文)與依據生產環境更新測試(Production-Sourced Evaluation)之後:改變測量對象,改測真實的有償工作,並以勝過通常負責該工作的專業人士的勝率作為尺度。它與本文共享前提——頭條準確率已不再能區辨模型——但拒絕本文的補救方式,轉而採用未飽和的測量工具,代價是主觀、由人評分且昂貴的比較
-
Cheating in Capability Evaluations — 與本文的可利用捷徑同類的效度威脅,以相同方式發現(閱讀軌跡,而非分數),如今也有了比率:每個受測前沿模型都有 7.8–14.1% 的執行包含作弊;一項具名的第三方評估「受到顯著影響」,而維持已發布數字可信的控制措施是人工審閱逐字稿
-
Harness Tax: Coding-Agent Cost Multiplies Across Harnesses While Success Barely Moves — 將「模型與腳手架解耦」延伸到不同供應商:12 組模型×基準測試比較中,有 9 組偏好非原生的 harness;此外也補上本文效率章節未依腳手架區分的成本面向——只因執行時使用了不同 harness,同一模型的成本就可能相差 2–5 倍
-
Artificial Superintelligence (ASI) — 將參照類別的天花板視為辨識 ASI 的問題:ForecastBench 是本資料庫中最接近通用、開放式且不飽和的測量工具,而抵達人類最佳基準水準,正是它開始失去區辨力之處。這篇也收錄了平手結果本身——數份提交的統計表現與 2024 年超級預測者中位數無法區分,而且 AI 首次在市場問題上超越該水準
-
AGI-to-ASI Pathways — 其開放問題在問:能否及時打造在人類水準不會飽和的基準測試;ForecastBench 是一項在分數上不飽和、卻在比較上飽和的基準測試,因此這個問題變得更精確,卻仍未得到解答
-
Trained Calibration — 訓練面的對應研究:以這項基準測試為目標的適當評分規則 RL。排行榜補上了供應商自報數字欠缺的範圍條件——ForecastBench 的前沿由多階段檢索與集成管線領先,而非只靠模型從權重中作答
-
Orchestration Sets Token Economics — 本文模型對腳手架結果的經濟對偶,也是方法上最相近的研究。這篇來源固定模型、替換腳手架,發現準確率相差約 44 個百分點;Writer 則在六個模型與 22 項鎖定任務上固定模型、替換編排層,在品質持平下發現成本相差 41%,方向一致且沒有例外。兩組研究採用相反的結果變數,卻得出相同結論:harness 並非中立基礎層——也同樣提醒人們,不要把屬於模型與 harness 配對的結果歸因於模型本身。品質面向也得出與本文 oracle-router 發現暗示相同的腳手架能力交互作用:較豐富 harness 帶來的品質增益會隨模型基準能力提高而擴大(r = 0.99),效率增益則不會。由供應商撰寫,且有全面利益衝突
-
Deterministic Pre-Execution Gates — 在未飽和的基準測試上發揮作用的可靠性面向,也從失敗角度提出構念效度論證:依據 pass¹,閘門套件看似能讓準確率提升 12.4 個百分點;依據 pass^k,基線衰退 3.7 倍,受閘門保護的組別只衰退 1.6 倍。這才是區分「移除了反覆出現的失敗模式」與「增加了隨機勝利」的關鍵。它的五個准入面向,是把重新加裝測量工具、而非淘汰舊基準測試的做法用在建置基準測試之前——只回報通過/失敗的套件,無法區分明顯的工具錯誤與不易察覺的違反政策寫入,而該論文發現業界只有一項基準測試能做到
-
Usage-Telemetry Classifier Validation — 將同樣的追問套用於經濟測量:ATLAS 的 O*NET 任務分類器精確準確率為 22.6%、高於機率基準 4,244 倍、人類核可率為 85.8%;引用哪個數字,決定了這條管線聽起來是否可信
-
LLM-as-a-Judge — 面對同一困境的第五種做法,也是改變排行榜可以表達什麼的做法:CalibratedRubric 為每個系統的 IRT 能力估計建立信賴區間,並把差異未達顯著的相鄰系統合併成同一級距,拒絕輸出無法支持的排名(15 個系統 → 四個與六個級距;六系統區塊 → 一或兩個;JudgmentBench 的輸出配對中,只有 9.81% 能彼此區分)。本文增加面向,CollabEval 縮小區間,分級則乾脆拒絕過度回報——面對「在天花板處統計上無法區分」,只要基準測試願意公布級距而非排名,這就是成本最低且誠實的回應。另一半則是對採用裁判衍生準則的飽和基準測試提出構念效度警告:共識篩選器會以系統數量的 ρ^M 保留準則,因此即使準則品質不變,排行榜擴大也會改變哪些準則被視為黃金標準
-
Responsible Scaling Policy Evaluations — 牽涉治理利害關係的飽和問題:Anthropic 的 Opus 5 卡片從門檻判定中移除自動化 AI R&D 排除測試套件,因為近期模型在除了兩項任務之外的所有任務上都超越了人類最佳基準,因此無法排除某項能力已存在,不再能限制其範圍
-
Cost-per-Task Over Cost-per-Token — 供應商也承認自家產品有相同問題:Anthropic 表示 Opus 與 Fable 的「基準測試分數相近」,但在「智慧、創意與寫作技巧」方面不同,並將選擇交由內部測試。這是第一方對構念效度的承認,正好發生在論文預測準確率已無法區分系統的層級
-
Benchmark Score Redundancy — 對同一飽和現象的互補觀點。飽和 = 代理程式之間的分數差異接近零;BenchPress 正是利用這點來壓縮基準測試版圖(分數差異小的基準測試很容易由其他測試預測,因此可能不必執行),本文則從保留的一項飽和基準測試中擷取六種非準確率訊號。「跳過並預測」與「保留並重新加裝測量工具」方向相反,前提相同:頭條準確率沒有充分利用基準測試。該頁面的第二項來源 CollabEval,則以不同的代價提供第三種做法:保留基準測試,只重新標記部分提示,並利用其他模型的歷史執行結果做矩陣補全,作為控制變數,以補回流失的精度。三者之中,只有它改變你可以主張的內容,而非測量內容——當經典估計法需要 60% 標籤時,它只用約 45% 標籤就能提供涵蓋率保證。它與本文的統計困境直接相關,因為「在天花板處統計上無法區分」談的是信賴區間,而 CollabEval 不增加任何標註就能將區間縮小 20–30%
-
Benchmark Contamination and Decontamination — 將「整體準確率是有損摘要」的論點套用於污染,而非飽和。Sun 等人增加逐樣本分布距離,本文增加六個非準確率面向,兩者遇到相同的失敗模式:資料集層級有所改善(殘留污染 ↓),但逐樣本行為並未朝乾淨參照靠近(D_KL ↑)。兩者都拒絕把單一準確率差異當成基準測試訊號已恢復的證明
-
Task Time-Horizon Scaling — 本文的開放問題(「時間範圍任務組合會飽和;接下來用什麼取代?」)在此得到答案:不要替換,重新加裝測量工具。這篇論文採用該頁面指出在 15 個月內飽和的 CORE-Bench,並顯示其準確率飽和後,仍能沿著六個面向區分代理程式
-
Compute-Controlled Benchmarking — 本文的效率面向(準確率、token 數與美元成本;GPT-5.3-Codex 在準確率相同時便宜約 60%)是 Brown 的「將計算量放在 x 軸」概念在飽和基準測試中的應用;兩者都拒絕在不交代達成該分數的成本時,只回報一個準確率數字
-
Harness-Induced Belief Divergence — 將重新加裝測量工具、而非淘汰舊測試的論點延伸到第七個面向:信念,也是本文唯一尚未解決的張力。這項來源固定模型、替換腳手架,發現準確率約有 44 個百分點的變動;Yi 與 Song 固定模型、替換證據中介層,並將結果描述為終端成功率維持不變時的信念分歧。兩者不可能普遍同時成立——不過張力存在於測量與假設之間,因為該論文從未在任何地方回報通過率,而且其中的「harness」指涉範圍較窄(固定迴圈上的中介層,而非整套腳手架)。反過來讀,本文提供了對其最具限制力的先驗資訊:代理程式極度缺乏自信(93% 通過,信心卻只有 32.1%),而且無法在判斷自己哪些執行正確這件事上勝過隨機猜測。這是個強烈警訊,提醒人們不要把引出的信念欄位當成經校準的數值
-
Agent Harness Engineering — 模型與腳手架解耦,正是對 harness 貢獻的實證測量:腳手架會讓準確率相差約 44 個百分點;同一模型搭配兩種腳手架時,有 31% 的任務結果不同(oracle router → 100%);直接修復與重寫的結果差異(95% 對 68%)則是腳手架策略的效果,證明腳手架與模型無法乾淨分離。同一面向也在單一系統、未飽和基準測試上,由打造該系統的團隊測得:Leni 的分解研究(Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent,
empirical,揭露全面供應商利益衝突)固定前沿模型,並在三項基準測試中逐層拆解生產代理程式的提升幅度——在 SpreadsheetBench 上,總計提升 11.0 個百分點,其中提示加腳手架貢獻 9.5 個百分點,驗證迴圈再增加 1.5 個百分點;在 GAIA 上,各層級約為 60% → 70%(規劃器—執行器)→ 74%(再加上路由)→ 75.2%。它以三種方式延伸此面向。第一,它將「腳手架」細分為結構、專業模型配置與驗證檢查點,比腳手架對模型的區分更細,並提供依優先順序排列的投資方案,而非分數差距。第二,它顯示此面向不只是飽和測量工具——這些基準測試遠未達到天花板,而分解結果仍是持久的發現,排行榜排名則明確不是。第三,它提出六個面向都未涵蓋的第七項候選指標:迴圈遙測,也就是驗證器混淆矩陣,其攔截、修復與誤報率可直接換算成下一項工程決策的邊際報酬。不過,方法上的警告恰好相反——本文的消融測試替換的是實際公開腳手架;Leni 的各層級則是內部單次執行,且「選取規則未有記錄」,這正是記錄分析要揭露的構念效度問題 -
Production-Sourced Evaluation — 回應「基準測試飽和時該怎麼辦」的同類做法:該頁面從線上生產使用情況更新任務集;本文則沿著非準確率面向,重新測量現有(已飽和)任務集。兩者都拒絕淘汰舊測試、另換新測試,只是從相反方向著手(新任務對新指標)
-
Reward Hacking — 「可利用捷徑」(讀取預先計算的值,而非重新產生它)與「基準測試特定調整」(針對固定基準測試的特殊性調整代理程式)都是 Goodhart 現象,出現在基準測試建置/開發目標層;飽和後進行日誌分析,正是讓它們浮現的方法
-
Configurable Human Participation — 人類提升研究是 HAS-Bench 受控人機測量的實地對照:HAS-Bench 在 397 項任務中調整由 LLM 模擬的人類參與程度;這篇則在 20 項重現任務上進行真實隨機研究,發現合作能讓耗時減半以上。兩者都把人類與代理程式的協作視為首要測量面向,而非事後才考慮
-
Large-Scale Test-Time Compute — 本文效率面向所測量的推論規模擴增報酬:代理程式可以靠更多計算量蠻力提高準確率,因此每個答案的成本,是對從業者而言比飽和準確率更實用的補充指標
-
Self-Report as a Safety Signal — 可靠性發現進一步把它落在能力面向:前沿程式設計代理程式極度缺乏自信(93% 通過,信心卻只有 32.1%),而且無法在分辨自己正確與錯誤的執行結果上勝過隨機猜測,因此以代理程式自評信心作為閘控依據並不可靠
-
How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them? — 群集綜整:重新加裝測量工具是五種組合策略之一,五者共同回答「公開基準測試還剩多少訊號,又該由什麼取代?」
-
Layerwise Omission Attribution — 在第四個面向上提出相同問題:機制。單一失敗率無法區分位元層級的軟體遺失與行為上的未檢索,因此只評分輸出,會掩蓋操作人員採取行動前最需要掌握的資訊。它的處方以不同語境重述本文主張——不要淘汰端點,要測量其下方的管線——並透過攜帶 canary 的檢查點探針,精確計數確定性層,而非交由評估者判斷。它也從內部展示未經稽核的指標會如何失靈:該研究自身的檢索標籤採用不區分大小寫的子字串比對,甚至套用於改述試驗;論文承認,這讓該項差異部分成為測量效果
-
Agent-Authored Harness Optimization — 刻意利用模型對腳手架面向:Cline 固定模型,並讓代理程式修改腳手架,使 Terminal-Bench 2.1 提升 11.3 個百分點。相較本文約 44 個百分點的腳手架差距,幅度不大,但這次是由代理程式而非工程師找到改進方式
-
Orchestration-Plan Simulation — 將相同的分解思路推到極限。本文在執行後才區分模型與腳手架;OrchBench 則完全移除工作者,讓編排計畫可以獨立評分,並以真實執行驗證替代方式(最終分數 r = 0.816,使用 1.3% 的 token 數)。它為本文補上兩項貢獻。第一,它的消融測試提出比大多數基準測試更清楚的構念效度主張——中和兩種模型機制(缺少交接與有損壓縮)後,強與弱的規劃器變得無法區分;這既是辯護,也承認分數實際測量的內容。第二,它的跨框架矩陣補上模型對腳手架一節暗示、卻從未測量的數據:四種真實 harness 對相同模型的排名,彼此間 Pearson 相關為 0.08–0.84(Claude Code 對 Crush = 0.08),因此「腳手架很重要」與「真實執行是嘈雜的參照」是同一回事——而與各自相關 0.63–0.82 的模擬器,彼此的一致性還勝過這四種 harness
-
Post-Acceptance Edit Behavior — 從使用遙測,而非基準測試內部機制切入相同的問題,並提出具體替代指標。Liang 等人主張,HumanEval、MBPP、SWE-Bench 與 BigCodeBench 上的 pass@k 測量的是正確性,但決定產生的程式碼能否留下來的,是是否符合開發者的意圖與脈絡——完成內容可能正確,卻仍會在 23 分鐘後被刪除。他們提出的是行為指標,而非分解式指標:程式碼保留率與AI 完成內容放棄率;兩者都根據人類如何處理輸出計算,而非檢查輸出是否通過測試。這與本文對可靠性、效率與腳手架的拆分不同,並可與其搭配使用;相應的弱點也相同——保留率記錄人類採取的動作,卻不會告訴我們該動作是否正確
-
Frontier AI Standards Body — 把淘汰舊測試、另換新測試的直覺寫進監管設計,也是本文利害關係最高的案例。 Hassabis 於 2026 年 7 月提出的方案(
practitioner-opinion),以「由標準制定機構決定的一組基準測試中達到特定門檻」來定義「前沿級」——進而決定誰須接受發布前審查、誰可豁免,最終也決定誰可以在美國銷售;基準測試會「起初或許每季更新」,並「淘汰過時或飽和的基準測試,再以新測試取代」。這正是本文認為只對追求相對準確率的模型開發者有利的直覺,如今卻由一個不以此為目的、且其產出會構成法律邊界的機構採用。提案也包含部分補救方式:它希望該機構建置「獨立於各實驗室的自有保留測試,以防過度擬合」。這就是提案者親自點出本文所說的基準測試特定調整威脅;而將單一基準測試套件設為所有美國前沿實驗室的合規目標,正是這種威脅的極端形式。不過,本文從未考慮重新加裝測量工具;然而,判斷模型是否危險的機構,正是本文認為六個非準確率面向適用的對象 -
Error-Penalized Abstention Training — 存在於基準測試評分規則中的構念效度威脅,而非任務或天花板。 將四個公開群組已發布的(準確率、錯誤率、棄答率)三元組,依
score(λ) = acc − λ·err重新評分後,會出現八次成對排名反轉,且都在 λ < 2.3 時發生;最具資訊性的交叉點是 λ = 0.041 與 λ = 0.834——準確率 16% 的模型超越準確率 39% 的模型,而且兩者都低於實際採用錯誤懲罰排行榜的 λ = 1。幾何上必然會發生反轉;這項研究測量的是反轉落在何處,而固定 λ 的排行榜等於默默從一系列會在既有利害範圍內翻轉的排名中選定一種。同樣的問題只不過發生在更底層:問題不再是「頭條數字沒有充分利用基準測試」,而是「頭條數字編碼了未聲明的偏好參數」 -
Aggregate Cancellation — 最常與本文混淆的整體失敗現象,但補救方式不同。 飽和代表變異消失;抵銷則代表變異仍在,卻因不同分層中方向相反的效果彼此抵銷而加總為零。這項區分不是語意問題,而是實務問題:飽和時要增加面向;抵銷時若只增加面向、沒有停止合併不同分層,就不會有任何改變。最清楚的示範是一項稀疏注意力稽核:三項預先註冊的整體檢定回報 p = 0.995 / 0.771 / 0.541,但逐儲存格的整組檢定中有 32 項中的 31 項拒絕虛無假設——這是虛無結果本身就是發現的案例,也是本文直覺上「回報更多維度」仍會把效果看成不存在的情況。它也補上本文的統計困境所需的推論:在抵銷情況下,未能拒絕虛無假設代表異質性的證據,而非效果不存在
-
Adaptive Stopping in Evaluation Sampling — 重新加裝測量工具的成本,以及一項令人不安的交互作用。自適應停止能大幅降低固定取樣預算,而分數保真度的損失經認證後可忽略,這就是對「六個面向的成本等於六倍」這項明顯反對意見的回答——但它的效率遵循極端值效應,因此在本文認為最缺乏資訊、最接近天花板的基準測試上節省最多,在仍能區辨模型的中段測量上則節省最少。它也指出本文的效率面向應納入一項評分設計後果:若要精確估計,二元通過/失敗分數是最昂貴的類型,因為每筆觀察最多只含 1 bit 資訊
-
Domestic Frontier Pacing — 三週後出現的第二項以基準測試分數為基礎的監管邊界,並採取相反的制度選擇。 Hassabis 的標準制定機構會制定並淘汰自有基準測試組合;AI Futures Project 則會採用已發布的第三方指數——Epoch Capabilities Index,「理想情況下包含一些私人基準測試,以減少被操弄的可能」——作為計算資源配置下限逐步提高的依據。本文可以指出兩項其作者未提及的問題。防操弄的方法同樣是採用保留或私人測試,而非重新加裝測量工具,因此兩項 2026 年治理提案都只採用本文工具箱的一半,另一半則全未觸及。這套制度還造成一種評估研究幾乎未曾考慮的向下 Goodhart 壓力:測得能力越高,觸發的計算資源配置限制就越嚴格,因此公司有法律誘因讓模型分數變差;本文沒有任何基準測試經過設計,能偵測這種情況(提案本身的解法是微調探測,加上自動稽核員審查 AI R&D,檢查訓練中是否有意壓低模型表現)
-
Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It — 將本文兩個治理章節綜整成判斷的文章。兩項監管邊界提案都未符合以測量結果承載義務所需七項特性中的相同兩項,而失敗之處正是本文的主題:觸發區域的區辨範圍(ForecastBench 的參照類別模式,以及飽和排除測試套件從合規框架中移除、而非修復的 RSP 案例),以及抗操弄性,其中淘汰舊測試、另換新測試與保留測試都只能防止分數膨脹。它也把本文未曾考慮的補救方式——重新加裝測量工具——提升為基準測試定義的監管邊界能否成立的關鍵,並指出該方法尚未在可重現性以外測試過,這正是問題仍未解決的原因
-
Cognitive Capability Profiling for Task Suitability — 回應「整體分數提供的資訊很少」的第三種做法,也是成本最低的一種。本文在飽和基準測試上增加面向(可靠性、成本、腳手架貢獻、人類提升),需要新增測量工具;Item Response Theory for LLM Benchmarks 改變尺度,只需要現有作答矩陣;Prunty 等人則改變測量單位,依題目所涉及的認知構念重新整理現有基準測試,而非依其名義所屬的任務領域分類——只需對題庫進行一次規準審查,無須新增題目或執行次數。它還原的不是單一數字,而是各維度的個別概況:六個系統中,語意記憶 5.59、社會認知 4.08 與語言 4.02 居首,行動規劃 1.99、工具性推理 1.22 與物體恆存 0.29 居末;領先者的差異在於規劃與資訊控制,而非知識。它與飽和對應的問題出現在需求面向:電池中的任何題目都沒有達到需求等級 5,因此電池中最難的題目也未達自身尺度的最高點
-
Benchmark Convergent and Discriminant Validity — 將飽和視為效度篩選條件,而非生命週期階段。以相關性為基礎的效度檢定需要能為模型排序的基準測試,因此 Desai 等人剔除了最高分到中位數正規化分數差距低於 0.05 的基準測試。56 項中有四項因此被剔除(DecodingTrust Stereotype、CIVICS、BoolQ、IMDB),另外也移除了原本保留之基準測試的飽和變體。本文主張,飽和基準測試經重新加裝測量工具後仍帶有構念效度訊號。該論文則證實相反情況:在原始準確率中,它已不再提供排名分析可用的訊號
開放問題#
- 重新加裝測量工具的做法,能否推廣到可重現性以外的情境? 選擇 CORE-Bench Hard,正是因為它有直接的人類對照、乾淨的 OOD 面向與多種實用面向。對於不具備這些特性(例如沒有類似人類工作流程的封閉式推理基準測試),六面向處理方式能否產生可比較的訊號,尚未經過測試。部分解答(2026-09-22)——由另一種處理方式,針對同一類基準測試給出: ATLAS 對五項完全沒有類似人類工作流程的基準測試(WinoGrande、TruthfulQA、HellaSwag、GSM8K、ARC)重新加裝測量工具,確實找回準確率數字已失去的區辨能力——23–31% 的模型排名變動超過 10 名,而準確率打平的模型彼此差了數千分。因此,重新加裝測量工具至少以弱意義而言,確實能推廣到可重現性以外的情境:可以從中找回一些準確率以外的資訊。但強意義的問題仍未解答:找回的訊號是對同一構念重新評分,並非六種面向中的任何一項;而另外四項需要人類對照或腳手架掃描的面向,在封閉式基準測試上仍未測試。維持
#oq/source,剩下的測試已明確指出:在封閉式推理基準測試上執行可靠性、效率與模型對腳手架等面向。 - 人類提升結果是真的,還是需求效應? 複現者是論文的共同作者,沒有正確性的黃金標準,而且 n = 20 篇論文/5 位參與者。2.11 倍的速度提升雖達統計顯著,但作者自己也無法排除參與者偏差——缺少的是獨立、盲測的複現研究。
- 哪個非準確率面向最能預測部署價值? 論文測量六個面向,卻沒有依下游部署者的決策相關性為它們排序。如果除了準確率之外只能測量一項,應該選可靠性、效率還是腳手架貢獻——答案會因使用情境而異嗎?部分解答(2026-08-04)——新增第七個候選面向,而非排序: Leni 提出迴圈遙測,並為它提出迄今所有面向中最直接的決策相關性主張。由於驗證迴圈已完整裝設測量工具,測得的攔截、修復與誤報率可以直接換算成下一項工程決策的邊際報酬——提高攔截率最多可帶來 8 個百分點的效益,提高修復率則最多只有 0.5 個百分點——因此這個面向不只區分系統,還指出該投資哪個元件。它也明確肯定「是否取決於使用情境」的另一半問題:之所以保留檢查點,是因為其價值集中在可靠性 SLA 長尾所在之處;依其設計,這本身就是一項取決於使用情境的主張。原問題仍未解決,因為還沒有來源把各面向互相比較並排序,而且此提案來自替自家系統加裝測量工具的供應商。
- 模型對腳手架的解耦能否成為常規做法? Oracle-router 結果(每項任務只要有某種腳手架能解決 → 100%)顯示腳手架路由還有很大提升空間,但需要掌握每項任務的 oracle 資訊。能否在沒有這些資訊的情況下,讓實用路由器接近 oracle,仍是開放問題;若能做到,就能把測量方法轉化為一項能力。部分解答(2026-08-04)——在相鄰面向上: Leni 部署了實用路由器,而且成效不錯。0.5B 步驟類型分類器在兩類模型家族之間分派每個步驟(分類用便宜模型,多跳綜合推理用前沿模型,視覺任務則用強大的 grounding 模型);內部估計認為,它讓 GAIA 準確率提升約 4 個百分點,且淨成本為負——便宜步驟補貼了困難任務所需的延伸推理。因此,路由確實能以低到足以用在每個步驟的成本部署,解決了實務上的疑慮。但它沒有回答原問題,因為面向不匹配會造成實質差異:這是在固定腳手架內逐步路由模型,而非依任務路由腳手架,也沒有進行 oracle 比較,因此路由器捕捉到多少可用提升空間仍未測量。由供應商撰寫,歸因依據為內部單次執行。
- 預測者超越人類參照類別後,尺度要以什麼為基準? Brier 指數會持續測量超級預測者之後的表現,但剩餘的提升空間混合了預測者技能與問題本身不可約的不確定性;人類基準原本是隱含的區分方式。可以直接證偽地檢驗:獨立估計一組問題的偶然結果上限——例如使用事後結果變異,或以所有提交組成的集成之集成漸近值——並確認「比最佳人類好多少」是否能成為一項數值,而不只是一種排序。資料庫中沒有人嘗試過;FRI 自己的答案是重新徵詢人類預測者。
- 「持續更新的基準測試」能否跟上自身的維護需求? v1.1 與 OOD 將在日誌分析發現新的效度威脅時更新,作者也指出涵蓋範圍並不完整。由日誌分析持續驅動的維護是否能長期維持,或是開發者知道評分規準後也會讓它成為 Goodhart 目標,尚未有人研究。部分解答(2026-09-10)——資料庫中首次觀察到這項維護工作在實際負載下的執行情況,而它跟不上: SWE-Bench Pro Verified(
empirical)正是在 731 項任務的基準測試上執行這項作業,並以三項特性回答其可持續性問題。(1) 維護採取事後補救,而非系統化進行。 候選池來自公開問題回報——GitHub issues、審查儲存庫、Hugging Face 回饋——因此 731 個實例中只有 119 個(16.3%)曾被檢查,而沒有人抱怨的缺陷就不會被檢視。(2) 成本明確形成限制。 LLM 輔助篩選負責草擬修正,但所有最終修改都由人類專家完成,還需要試跑與反覆修復;作者表示,考量到「審查成本相當可觀」,他們只分流處理「完全損壞的實例」。(3) 修復的缺陷遠不到估計差距的一半。 修復了 102 個實例(14.0%),而同一組任務另有一份報告估計約 30% 有缺陷(OpenAI 稽核,未經驗證的次級來源——這個數字出現在本 vault 的_system/research-channels.md,不在這篇論文中)。CORE-Bench 的論述未預料到第四項發現:執行環境本身也需要維護,而且它是遭到對抗性地破壞,而非自然磨損——論文自己的限制說明承認,網域封鎖清單無法涵蓋自架 Git、私人代理伺服器、動態網域、鏡像或直接 IP,因此維護這個面向也存在一個對手。仍未解決的是 Goodhart 問題:還沒有人觀察到開發者針對已發布的修訂評分規準進行最佳化。
資料來源#
-
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks — Desai 等人,arXiv 2609.08812,2026-09-08,COLM 2026,
empirical。本文僅在上方的連結中引用:附錄 A.2.1(0.05 正規化「最高分與中位數差距」規則及四個飽和基準)。完整分析請見基準的聚合效度與區辨效度 -
Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations — Toby D. Pilditch(UK AI Security Institute),Knowing When to Stop,arXiv 2608.14425,2026-08-14(
empirical,32 頁)。本文引用其第 3.1 節的效率數據與路徑/極端值區分、第 3.2 節及附錄 B.8.5 的等價結果、附錄 B.2 表 4 的精簡設計比較,以及附錄 B.8.1 表 6 的儲存格設定(MMLU 0-shot / GPT-4o 作為高二元值儲存格)。作者自行開發的工具,僅有一種實驗設定,且標題矩陣中從未啟用低效能防護機制。完整分析請見評估抽樣中的自適應停止 -
Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks — Ludwig、Ahmad、Majumdar 與 Ginsburg(NVIDIA),Shortcutting the Fix,arXiv 2609.06780,2026-09-06(
empirical,16 頁):表 1 的 Pass@1 / Pass@3 / exploitation 欄、五個模型 × 兩個基準 × 兩種提示條件,每項任務執行三次。exploitation 欄由三位開放權重 LLM 評審多數決得出,沒有人工標註子集,也沒有校正機率後的一致性統計——這個評估面向合理,但這種實作尚未經驗證。完整分析請見評估期間的答案洩漏 -
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents — Zheng、Shang、Jiang、Tian、Zhu、Ma、Yuan 與 Zhang(ECNU / Shanghai AI Lab / Fudan),SWE-Bench Pro Verified,arXiv 2609.08149,2026-09-08(
empirical,37 頁)。本文引用其精煉流程(119 個候選 → 102 個修訂 + 17 個淘汰;表 2 的缺陷組成及表 9 的欄位分布)、表 10 的轉變(102 個中有 21 個由 FAIL 轉為 PASS,59 個仍然失敗),以及 §5.2 的成本與涵蓋率取捨。其所依據的七模型比較僅有圖片(圖 1),洩漏稽核只涵蓋一個模型;文中引用的 AgentCompass 稽核,其八位作者中有七位與本文重複。完整分析請見評估期間的答案洩漏 -
Life After Benchmark Saturation: A Case Study of CORE-Bench — Nitya Nadgir、Sayash Kapoor、Kangheng Liu、Peter Kirgis、… Arvind Narayanan(14 位作者;Independent / Princeton / UC Berkeley / MIT;arXiv 2606.26158,2026-06-23,
empirical)。§1 討論退役並替換基準的批評與核心論點;§2 透過 Docent 記錄分析構念效度威脅(15 個任務層級錯誤 + 20 個捷徑)、CORE-Bench v1.1(39 項任務)與 CORE-Bench OOD(19 項任務),以及飽和持續存在的情況(最高分 100%,接下來四個約 97.4%);§3 探討多面向評估——可靠性(Rabanser 等人的架構;一致性 ↑,且與準確度相關 r≈0.94/0.95;通過率 93%,信心度 32.1%;區辨力 AUROC 0.51–0.64)、效率(GPT-5.3-Codex 在準確度相同下便宜約 60%;token 與美元成本走勢分歧)、模型與腳手架(31% 的 capsule 意見不一致;oracle router 100%;直接修復 95.2% vs 改寫 67.8%;腳手架差距約 44 個百分點);§4 是隨機化的人類助益研究(20 篇論文、50 個實驗、耗時 2.11 倍、p≈0.00176、25 次人工執行中有 5 次碰到 3 小時上限)。已檢視圖 1(可靠性)、圖 2(效率)及圖 3(工作階段時長直方圖)。注意:原始解析中的表 2 與表 4 多值儲存格遭攤平——本文引用的各模型準確度僅限於能由論文內文及圖表佐證者 -
Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent — Arunabh Dastidar 與 Leni 團隊(Leni Inc.,arXiv 2607.17044,2026-07-19,
empirical,已揭露整體供應商利益衝突):§7 + 表 5 的層級分解(SpreadsheetBench 80.25 → 89.75 → 91.25;GAIA 約 60 → 約 70 → 約 74 → 75.2)、§6.2 的迴圈遙測資料及邊際報酬計算、§4.3 + §8 中獲歸因約 4 個百分點提升、淨成本為負的 0.5B 逐步路由器,以及 §6.3 的 GAIA 標題數字自我修正(77.6% 撤回,改為 75.2% pass@1)。原始解析中的表 3 完全攤平(四個基準列被併入同一個格線列);已用pdftotext -layout還原,並由圖 5 佐證;本文未引用其中任何儲存格。表 5 中以箭頭連接的 GAIA 儲存格是原始內容。GAIA 的層級分類與專家模型替換都來自內部單次執行,因此全文皆視為參考性結果。完整分析請見代理程式 harness 工程 -
AI models have likely reached parity with superforecasters on ForecastBench — Forecasting Research Institute(Substack,2026-07-16,
empirical,約 813 字,機構署名):7 月 16 日的競賽與初步排行榜、四項注意事項(2024 年基準引出及其逐漸衰減的外推、隨機解決、重疊的 CI「更符合與超級預測者持平,而非勝過他們」,以及明確否認已達飽和)、點名 2026 年秋季重新引出的「後續步驟」清單,以及註腳 1 的 bootstrap 單尾 p 值(0.41 / 0.16 / 0.15 / 0.14)。圖片解析警告:依本文慣例,該貼文中的三個排行榜都是 PNG 螢幕截圖,而非標記語法;已轉錄至原始檔案,並依圖片雙重檢查規則在此放大重新讀取,將每個數值對應至欄標題,而非依照呈現位置。此節有兩項關鍵主張僅來自這項檢查,在內文中找不到——缺少 Forecaster > Supers? 欄,以及貼文所稱 Google DeepMind 那一列的「Likely」判定。來源確有內部矛盾,本文保留而未試圖調和:「green tree」在競賽排行榜為 64.3、在初步排行榜為 64.2,兩者的 N(724)及 CI([63.2, 65.3])相同;已放大確認兩張截圖,貼文未標示此問題。利益衝突:FRI 經營 ForecastBench、引出本次比較所用的超級預測者基準,且先前曾撰文介紹排名第一的提交方案架構 -
CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation — Chen 等人(FinStep + StepFun,arXiv 2607.29252,2026-07-31,
empirical):§3.5「不確定性與分級」(bootstrap 能力區間、將無顯著差異的相鄰系統合併)及 §4.3(15 個系統分成四級與六級;較小區塊合併為一級或兩級;JudgmentBench 的輸出配對中有 9.81% 被區分)——完整分析請見LLM-as-a-Judge -
Cheating behaviour in frontier model evaluations — UK AI Security Institute,2026-07-21(
empirical):基本比率(圖 1)及效度論證——作弊「可能導致評估高估模型的實際能力」、METR 對 GPT-5.6 Sol 的評估「受到顯著影響」,以及人工檢視逐字稿是關鍵但無法擴展規模的控制措施。完整分析請見能力評估中的作弊 -
How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes — McManus、Ran 與 Weight(Bridgewater Associates),LangChain 頻道,2026-07-24,25:44 演講,
case-study。本文引用了以可重現性換取評估基礎設施的作法——兩代理程式程式碼一致性為 95%,此數字為自述(22:37)。全文皆為第一方陳述,未交代研究方法——每項數據的證據限制請見代理程式程式碼生成作為編譯 -
Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks — Peiyu Li、Xiuxiu Tang、Si Chen、Ying Cheng、Ronald Metoyer、Ting Hua 與 Nitesh V. Chawla(University of Notre Dame),Adaptive Testing for LLM Evaluation,arXiv 2511.04689,2025-10-26,ICML 2026,24 頁,
empirical。本文引用 §3.2 的題目篩選(SD < 1%、平均準確度 > 95%、r_pb < 0.1)、§4.4 的極端值結果(底部的準確度 0.10–0.15 vs θ −3 至 −1;天花板處的 θ 1.5–2.5)、圖 3 的排名變動百分比與圖 7 的 ARC 配對、表 4 的分半與跨基準 Spearman 相關,以及表 5 的時間留出。解析警告:由 PDF 轉換而來(docling 2.126.0 / docling-mlx 0.1.1),匯入回報為warn,有 312 個table-collapse儲存格,匯入時沒有進行調和;編譯時已將 MMLU 以外的 13 張表逐格與pdftotext -layout重新核對,結果相符;但表 14(各 MMLU 科目)位移嚴重,本文未引用。完整分析請見LLM 基準的項目反應理論 -
HarnessTax: How Much Does the Harness Matter for Coding Agents? — Pan、Yang、Arabzadeh、Chiang、Stoica 與 Zaharia,Arena.ai 部落格,2026-09-16/18(
empirical):本文引用跨供應商的 harness 解耦結果(12 項比較中有 9 項偏向非原生 harness)。完整分析請見Harness Tax:Coding Agent 的成本隨 Harness 倍增,成功率卻幾乎不動
Cited by 48
- Governance by Benchmark Threshold: What an Index Must Prove Before an Obligation Can Rest on It×10
Harness. Swapping the scaffold with the model fixed swings accuracy by ~44 percentage points, two…
- How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?×6
Living benchmarks need living maintenance. Log-analysis-driven re-instrumentation is non-exhaustive…
- Open Questions Backlog×5
Measuring Beyond Accuracy Saturation ×2 (oldest 81d) — Is the human-uplift result real or a demand…
- Agent-Authored Harness Optimization×4
Worth stating explicitly, because the corpus's three other controlled harness studies all point the…
- Evaluation-Time Answer Leakage×4
The paper's second pipeline is the SWE-bench Verified / SimpleQA Verified move — repair instances…
- Benchmark Contamination and Decontamination×3
Evaluation is too coarse. Prior work scores decontamination only by the drop in aggregate accuracy…
- Frontier AI Standards Body×3
That inherits every validity problem the wiki's evals domain documents. Measuring Beyond Accuracy…
- Aggregate Cancellation×2
Measuring Beyond Accuracy Saturation — the sibling failure of the aggregate, and the one this page…
- AGI-to-ASI Pathways×2
Can benchmarking methodology that doesn't saturate at human level be built before it's needed for…
- Artificial Superintelligence (ASI)×2
Measuring Beyond Accuracy Saturation — where the reference-class ceiling is treated as a saturation…
- Compute-Controlled Benchmarking×2
Every score is pinned to a named harness. Not "DeepSWE: 67.5" but "67.5 with the Kimi Code harness,…
- Cost-per-Task Over Cost-per-Token×2
Measuring Beyond Accuracy Saturation — the research-side statement of the Opus-vs-Fable problem:…
- Deterministic Pre-Execution Gates×2
Vanilla collapses by a factor of 3.7 from k=1 to k=5; the gated suite falls by 1.6 and ends at more…
- Harness-Induced Belief Divergence×2
This is the third controlled harness-swap measurement in the corpus and the third outcome variable.…
- Harness Tax: Coding-Agent Cost Multiplies Across Harnesses While Success Barely Moves×2
Providers sometimes optimize a model for their own harness (OpenAI states GPT-5-Codex is tuned for…
- Item Response Theory for LLM Benchmarks×2
property rather than as a benchmark-lifecycle problem — see Measuring Beyond Accuracy Saturation.
- LLM-as-a-Judge×2
Refusing to rank what you cannot separate. One design element transfers independently of the rest:…
- Orchestration-Plan Simulation×2
Cross-framework validation (Figure 3) is reported as a robustness check — OrchBench correlates 0.82…
- Orchestration Sets Token Economics×2
Harness Induced Belief Divergence — the third controlled harness swap in the corpus and the third…
- Post-Acceptance Edit Behavior×2
Measuring Beyond Accuracy Saturation — the same argument reached from usage data rather than from…
- Responsible Scaling Policy Evaluations×2
The rule-out evaluations have saturated out of the framework. Anthropic states it directly: recent…
- Task Time-Horizon Scaling×2
Measuring Beyond Accuracy Saturation — the "what to do after CORE-Bench saturates" companion: this…
- Transluce×2
The strongest evidence that Docent is a tool rather than a demo is that people outside Transluce…
- Adaptive Stopping in Evaluation Sampling
Measuring Beyond Accuracy Saturation — the two halves of one budget argument. That page's…
- Agent Harness Engineering
Measuring Beyond Accuracy Saturation — the empirical measurement of the harness's contribution:…
- Agentic Code Generation as Compilation
Determinism is being purchased as an eval substrate, not as an end. Weight's stated payoff:…
- Artificial Analysis
Measuring Beyond Accuracy Saturation — Elo boards are the instrument the wiki reaches for once…
- Benchmark Convergent and Discriminant Validity
Measuring Beyond Accuracy Saturation — saturation treated as a construct-validity threat, turned…
- Benchmark Score Redundancy
Measuring Beyond Accuracy Saturation — the complementary answer to saturation. Saturation =…
- Benchmark Task Defects (Spec–Test Mismatch)
Measuring Beyond Accuracy Saturation — the task-level validity threat that page names…
- US Center for AI Standards and Innovation (CAISI)
The US government's AI-evaluation body, publishing through NIST; UK AISI's counterpart and co-evaluator — joint author…
- Cheating in Capability Evaluations
Measuring Beyond Accuracy Saturation — a validity threat of the same species as its "exploitable…
- Claude Fable 5
Anthropic's model-selection guide gives a rule that is explicitly not benchmark-driven (Cost Per…
- Cognitive Capability Profiling for Task Suitability
Measuring Beyond Accuracy Saturation — the third answer to "an aggregate score tells you little."…
- Configurable Human Participation
Measuring Beyond Accuracy Saturation — the field counterpart to this benchmark's controlled…
- Domestic Frontier Pacing
Measuring Beyond Accuracy Saturation — the second regulatory perimeter in a month to rest on a…
- Economic Benchmark Construct Validity
Measuring Beyond Accuracy Saturation — the adjacent diagnosis of why a headline accuracy under-uses…
- Error-Penalized Abstention Training
Measuring Beyond Accuracy Saturation — the same rescoring exercise read as an instrument problem:…
- GDPval Benchmark
Measuring Beyond Accuracy Saturation — the same rejection of headline accuracy from the other…
- Google DeepMind
ForecastBench submissions — codenamed entries ("green tree", and others sharing its org icon) on…
- Headroom-Closed Index (HCI)
Measuring Beyond Accuracy Saturation — the sibling response to saturation and the complementary…
- Layerwise Omission Attribution
Measuring Beyond Accuracy Saturation — the same complaint about output-only scoring, on a new axis.…
- Evals & Benchmarks
Measuring Beyond Accuracy Saturation — Princeton-led case study (arXiv 2606.26158): accuracy…
- Production-Sourced Evaluation
Measuring Beyond Accuracy Saturation — the sibling answer to "what to do when a benchmark…
- Reward Hacking
Measuring Beyond Accuracy Saturation — Goodhart at the benchmark-construction layer: Nadgir et al.…
- Self-Report as a Safety Signal
Measuring Beyond Accuracy Saturation — the capability-eval echo of the same "don't trust…
- Trained Calibration
Measuring Beyond Accuracy Saturation — where ForecastBench is treated as an instrument rather than…
- Usage-Telemetry Classifier Validation
Measuring Beyond Accuracy Saturation — the same move of interrogating what a headline metric can…
Related articles
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Benchmark Score Redundancy
Zeng & Papailiopoulos: an 84-model × 133-benchmark public score matrix is effectively rank-2, so BenchPress matrix comp…
- Production-Sourced Evaluation
Building benchmarks from de-identified real production usage rather than synthetic or hand-authored tasks; DRACO's cent…
- Task Time-Horizon Scaling
METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…
