H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

受運算資源控制的基準測試

Noam Brown 的批評:單一數字的基準測試表格已經失效,因為它忽略了測試時運算量——應改為繪製效能與成本預算的關係;基準測試刷分、保留的私人測試集,以及讓表格持續存在的 Goodhart 均衡;揭露範例(Kimi K3 的註腳、Gemini 的價格列);首度針對一類明確命名的方法進行預算匹配測試;以及 DarwinX 如何把未定義的努力程度層級當成運算量控制。FrontierMath Erdős(2026-09)是第一個讓預算構成分數本身而非僅列為揭露項目的基準測試,也公布了更高預算的測試結果,卻拒絕以該名稱標示。

Article metadata
Publication details
Published:July 9, 2026
Filed:Concept
Domain:Evals & Benchmarks
Tags:LLM ArchitectureCapability EvaluationBenchmarksGoodhartEvaluation Methodology
Reading:78 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

受運算資源控制的基準測試插圖

資料來源#

摘要#

Large-Scale Test-Time Compute 帶來的評估後果是:如果能力取決於推論預算,那麼不附上預算的基準測試數字就毫無意義。Noam Brown 的文章正面批評所謂的**「基準測試表格」**——標準的發布形式,基準測試位於 x 軸、模型位於 y 軸,每個儲存格只有一個分數。他提出的修正方式是:**把運算量放上 x 軸。**將效能表示為 token 數、成本或時間的函數;或固定預算,在預算內進行比較(practitioner-opinion)。

引發討論的事件是:GPT-5.5 推出時,表格顯示它只比 GPT-5.4 高出幾個百分點,最初的反應是懷疑它是否真的有明顯進步。事實上有——5.5 只是運算效率高得多,用少得多的思考量就能給出相同或更好的答案。5.4 在最高設定下每次回應都會思考更久。若控制思考時間,5.5 就是「大幅躍進」;使用者實際體驗一段時間後,也正好印證了這點。表格掩蓋了這項進步,因為它沒有讓運算量一致。

基準測試刷分:用支架灌高分數#

更尖銳的疑慮是,表格上的分數可以輕易灌高。基準測試刷分是 Brown 對一種支架技巧的稱呼:在運算量相同的情況下,沒有真正提升能力,卻讓基準測試分數上升。做法包括讓模型跑五次後取最佳答案,或加入 LLM 評審從 N 個候選答案中選出最好的。這些技巧「紙面上的表現好看得多,但在控制測試時運算量後,實際上並沒有變好」。這相當於把 Goodhart's law 從訓練迴圈搬到評估報告層:衡量指標(表格分數)成為目標後,就不再測量能力,而是測量是否願意投入推論資源進行 best-of-N 搜尋。

防止模型朝著某項基準測試最佳化(而非提升背後技能)的常見防線,是使用保留的私人測試集,不對外公開。Brown 表示,OpenAI 盡量避免針對特定基準測試最佳化,但「一旦你發布了基準測試,它就永遠面臨被人專門拿來最佳化的風險」。

不良均衡#

Brown 將基準測試表格持續存在的原因描述為協調失靈,而非意見不合。私下裡,研究人員都認同 x 軸應該是成本、token 數或時間——「對,這說得通,我們應該這麼做。」但公開發布的答案卻是「大家期待我們發布表格」,而人們之所以這麼期待,正是因為每家公司都發布表格。所有人都知道這是不良均衡,卻沒人想率先改變。撰寫這篇文章,就是明確試圖讓整個領域有理由打破慣例:讓「下次有模型發布時,公司可以放心不公布表格,至少不把它放在最顯眼的位置」。這裡的 Goodhart 被界定為集體行動問題,而非個人誘惑。

獨立採用:UK AISI 報告曲線,而非分數(2026 年 7 月)#

Brown 提出批評;UK AI Security Institute 則將其付諸實行。身為政府評估機構,而非競爭中的實驗室,它是最適合率先打破表格慣例的一方。該機構 2026 年 7 月的研究屬於 empirical,結論幾乎原句重現了 Brown 的主張:「評估應報告能力曲線,尤其是在效能可能仍持續上升時」,而且「若不知估算能力時使用的運算預算,就無法解讀代理程式的能力」。AISI 警告,設有上限的分數可能「使模型比較失去公平性」,並「悄悄誤導」決策者,讓他們把資源不足的評估結果當成模型能力低落的證據。

這項主張如今已是 AISI 的實務做法,而不只是建議。它會在多個預算下評估前沿模型(最難的任務也會使用非常大的預算),並報告相對於預算的可靠性與任務觸及率,同時正在制定**「最低資訊量預算」**——只有當模型的觸及率不再隨更多運算量而上升時,才宣告該預算足夠。這正是「多少才夠?」的實務解答,而單一表格數字從來無法回答。

同一評估機構三週後的揭露底線(2026-07-23)#

上一節呈現的是 AISI 在預算軸上的最佳表現。它與 CAISI 聯合發布的 Kimi K3 評估報告 (UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities,empirical),則呈現同一機構在另外兩個面向上的最差表現,而且這兩項缺失都不是本文提及的任何廠商表格所犯的錯:

  • 比較對象匿名。所有美國數據——ExploitBench 階梯分數 76.2%、41 項中有 20 項成功的任意程式碼執行題目,以及 32 步網路靶場中的第 28.5 步——都歸因於「網路能力最強的美國模型」,但文件從未在任何地方列出這些模型。圖 2 將這種不對稱視覺化:十個逐一列名並繪出的中國實驗室模型,對比一條沒有標籤的美國整體趨勢線。廠商會挑選要展示的競爭對手;這份報告一個也沒列,理由相同,因此更糟:如同沒有預算的表格比有預算的表格更差,其中的資訊無從查核。沒有人能將 76.2% 與任何已發布的模型卡相互核對。
  • **預算只有一個數字。**唯一的支出說明是「在 100M-token 上限內」和「標準 100M token 上限」,沒有說明是每個任務還是每次嘗試的上限;而提出「沒有估算時所用的運算預算,就無法解讀設限分數」的正是這個機構。語料中另一個來自 AISI 的 100M 數字,是 Opus 5 在同一靶場中 10 題解出 8 題;那是每次嘗試的預算,報告很可能也是這個意思,但文件並未說明。

值得精確記錄這點,因為反方論據確實存在,卻不能完全解釋問題:安全研究的發布,確實存在基準測試表格沒有的揭露取捨;公開哪些美國模型曾解除安全防護,更接近發布能力發展路線圖。這解釋了為何比較對象匿名,卻解釋不了預算單位為何匿名。

標準化執行紀錄,以及「已驗證」何時不再有幫助(2026-09-22)#

前面兩節的 AISI 資料是單篇論文的揭露:先是漂亮的曲線,接著是匿名的比較對象。下一次發布改變了資料單位:AISI 與 EvalEval Coalition 合作發布 (How UK AISI and EvalEval Are Making Benchmark Results Reproducible,empirical,HF 部落格),提供經驗證的 Evaluation Cards——依據 EvalEval 的 Every Eval Ever (EEE) 結構,將基準測試、執行紀錄與模型設定標準化——涵蓋五項基準測試(HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0)與六個模型(Claude Opus 4、4.5、4.6;GPT-5、5.2、5.4),另包含兩項使用部分重疊模型組合的網路安全評估。這些卡片伴隨 AISI 新論文 How Inference Compute Shapes Frontier LLM Evaluation 發布,延續上文 2026 年 7 月研究的測試時運算量曲線研究脈絡,如今將成果整理成機器可讀的執行紀錄,而不只是一篇部落格文章;論文也明確採用 AISI 過去自行建立的效率與嚴謹度工具(OptStop、HiBayES)。

這次發布的一份資料,是本文已追蹤的某種曲線的直接案例,並附上明確的不可比較警告。HLE 軌跡圖以最低觀察到的成功 token 數為橫軸、以累計解題數為縱軸(取自 100 題樣本),採用擴大預算、預言機回饋的流程——模型每次嘗試後都會收到正誤回饋,並隨預算增加持續重試:Claude Opus 4 和 Opus 4.6 都達到 100/100,GPT-5.4 達到 95,GPT-5 達到 88,GPT-5.2 達到 71,Claude Opus 4.5 達到 70。來源明確指出,這些不是標準固定預算下的 HLE 準確率分數,不應與已發布的 HLE 數字比較——預言機回饋和擴大預算本身就是研究變因,而不是新的評分慣例。

Terminal-Bench 2.0 的發布更能檢驗「標準化紀錄」究竟帶來什麼。圖表以研究本身的分數(菱形,分為無回饋與有預言機設定,並附標準誤差誤差線),對照從 EEE 擷取、來自同五個模型(Claude Opus 4.5/4.6、GPT-5/5.2/5.4)的圓點——「其他地方沒有 Claude Opus 4 的可比較資料」——這正是本文下方開放問題所要求的跨來源檢查。但圖表是由用戶端程式渲染;對不打算撰寫程式讀取 SVG/canvas 的讀者而言,它只顯示座標範圍(30.0%–80.0% 二元成功率)和圖例,無法從發布頁面取得各模型的數值。此處的**「已驗證」**表示紀錄來源可供查核——包括明確的基準測試版本、執行設定與模型設定——並不表示不用工具就能讀懂數值;這比下文執行紀錄稽核所主張的範圍更窄。

實例:Gemma 4 的標題表格(2026 年 7 月)#

Brown 在 2026 年 6 月發表這項批評。三週後,Gemma 4 發布了相關成果;這份報告值得一提,因為除此之外它相當謹慎(empirical,共十六張表格)。

表 5——報告中最常被引用的表格,也是「效能躍進」主張的依據——比較思考模式下的 Gemma 4與不思考模式下的 Gemma 3 27B。AIME 2026 的分數從 20.8 升至 89.2;Codeforces Elo 從 110 升至 2150。文件中完全沒有出現同一個 Gemma 4 模型在思考與不思考模式下的消融比較。因此,世代進步與推論預算增加,在標題數字中混為一談,而報告也從未說明允許的思考預算。

這個案例之所以值得借鏡,而非只是令人失望,是因為同一份報告在其他地方確實做了控制,卻沒有特別說明:

  • **表 9(長上下文)兩組都以「不思考」模式執行。**這是論文中唯一乾淨的世代比較,其進步幅度確實大且明顯(LOFT Text Retrieval @128k:8.6 → 79.5)。
  • **表 6(視覺)重複了混淆:**思考模式下的 Gemma 4,對上不思考模式下的 Gemma 3 27B,並採用 Pan & Scan。

因此,這並非作者做不到,而是做法前後不一,且從未標示。這就是 Brown 所說的不良均衡,而非意見不合——同一份 PDF 裡既有控制運算量的表格,也有未控制的表格,因為沒人期待總覽表控制運算量,人人卻期待長上下文表格做到。

這篇論文還有一項特有的次級代價。Gemma 4 真正的貢獻在於推論效率——KV cache 縮小 37.5%、次 GB 量化,以及 drafter head。這些正是運算量未受控制的表格無法呈現的成果,就如同表格掩蓋了 GPT-5.5 相較於 5.4 的效率優勢。報告採用標準表格,反而遮蔽了自己最好的成果。

廠商半途打破慣例:Inkling 發布自己的曲線(2026 年 7 月)#

Inkling 的發布,是本語料中第一份部分做到 Brown 所要求之事的廠商成果。TML 將可控制的努力程度旋鈕從 0.2 調到 0.99,並發布 Terminal Bench、HLE 與 IFBench 的效能與平均生成 token 數關係圖:這正是 AISI 所主張的能力曲線,說明方式也呼應 Brown(「觀察完整成本曲線,能讓開發者為每個使用情境選擇最佳模型」)。曲線呈現了表格儲存格無法顯示的資訊:Inkling 使用約三分之一的 token,就能在 Terminal Bench 上達到 Nemotron 3 Ultra 的表現。

之所以只是半途打破慣例,是因為呈現方式不對稱:競爭模型只以預設運作點呈現——也就是 Inkling 曲線旁的單一點,而主要基準測試表格仍是 effort=0.99 的標準表格。只替自己畫曲線、其他模型只給點,是對不良均衡的改善,但也讓配有旋鈕的模型更好看:Brown 的批評真正要求的比較方式(每個模型都沿著自己的預算軸逐一測試)仍未公開。現在還多了一個問題:這個努力程度旋鈕是訓練出來的能力(Inkling),而不是服務參數,因此只有訓練它的廠商才能低成本地掃描該旋鈕(vendor-claim)。

揭露 harness 不等於控制運算量:Kimi K3 的註腳(2026 年 7 月)#

Kimi K3 的模型卡(vendor-claim)是本語料中評估揭露最細緻的一份,也是最鮮明的例子,說明細緻度與控制是不同的軸。它有 45 列的標準表格,但底下的資料完全不標準。

它揭露的資訊,在同類文件中首屈一指:

  • **每個分數都對應到具名 harness。**不是只有「DeepSWE:67.5」,而是「使用 Kimi Code harness 時為 67.5,使用 mini-SWE-agent 時為 67.3,測試集是 DeepSWE v1.1」。每個基準測試都逐項列出各模型所用的 harness——Claude 模型使用 Claude Code、OpenAI 模型使用 Codex、K3 使用 Kimi Code——因為 harness 如今已成為分數中的一級變因,正如模型與支架的貢獻拆分所主張的那樣。
  • **逐模型列出推理努力程度。**除了 GPT-5.5 為「xhigh」以外,其餘模型都是最高設定;K3 在單步任務上使用 temperature 1.0、top-p 0.95,在代理程式任務上使用 top-p 1.0。
  • 揭露對廠商自身不利的評分端混淆因素。Fable 5 在 SWE-Marathon 評估中「有 35% 的任務觸發 fallback」,「可能降低了測得的效能」。在 Kimi Code Bench 2.0 上,Fable 5 的 80 項任務中有 13 次 fallback 和 1 次拒答;80 項中有 10 項觸發 GPT-5.6 Sol 的網路安全防護;GPT-5.5 拒答 3 項。在 Agents' Last Exam 上,排行榜中的 Fable 5 有 40% 的任務「被標記為降級」。廠商主動表示競爭對手的數字受到對手自己的安全機制影響而降低,這正好與基準測試刷分相反。
  • **說明基準測試的修改。**SWE-Marathon 是在針對 H20 重新校準的 v1.1 前任務分支上執行(Docker 映像、效能門檻與參考預言機都針對 H20 重新校準;正確性與反作弊驗證器則維持不變)。PostTrainBench 則改用 H20 而非官方指定的 H100 重跑。
  • **公布一個降低自身表現的數字。**在自家的 Kimi Code Bench 2.0 上,K3 使用競爭對手的 Claude Code harness 得分為 73.7,使用自家的 Kimi Code 則為 72.9——而模型卡在表格中列出的是 72.9。同樣地,BrowseComp 的分數是採用 300K-token 壓縮策略時的 91.2,並同時揭露使用完整 1M 視窗且不做上下文管理時的 90.4。

**它沒有做到的事——而這才是重點。**全文沒有 token 數、美元成本、實際經過時間或曲線。「推理努力程度 = max」是個設定,不是預算:它表示所有模型都被要求努力思考,不代表它們實際花費了相近的運算量;Brown 對 GPT-5.5 與 5.4 的軼事正說明了為何「max」這種說法毫無資訊量。比較方式在結構上也不對稱——K3 使用 Moonshot 自家的 Kimi Code harness 評估,競爭對手則引用「各 harness 中的最佳分數」,或取自由第三方在未知預算下執行的排行榜。相較於 Inkling 替自己發布曲線、替其他模型列出點,Moonshot 替所有模型公布來源資訊,卻讓自己使用主場 harness。

此處還有另一項屬於安全而非評估的發現:這些 fallback 比例,是第三方首次測得Fable 5 的分類器 fallback在一般技術工作中觸發的頻率。

揭露落差的量化:harness 是未揭露的預算面向(Arena.ai,2026-09)#

Kimi K3 的模型卡為每個分數列出 harness,卻沒有公布預算。HarnessTax(HarnessTax: How Much Does the Harness Matter for Coding Agents?,empirical)測量了這項缺漏的代價:固定模型,只變更 harness(Claude Code、Codex CLI、Pi),在 SWE-bench Lite 上測試 21 種組合,結果是同一模型達到相同成功率,依所用 harness 而定,成本最高可差 2 倍——Claude Fable 5 使用 Claude Code 的成功率為 97.8%($1.329),使用 Pi 則為 96.7%($0.666)。排行榜若只列 harness 卻不列成本——正是 K3 揭露資訊的形式——就忽略了一項可讓帳單相差 2–5 倍、而成功率仍在 ±2–5% 範圍內的變因。這就是本文主張在 harness 選擇上的體現:表格控制了模型與任務,卻很少控制支架本身的預算,而支架預算的份量原來很大。

表格中的價格軸:Gemini 3.5 Flash-Lite(2026 年 7 月)#

DeepMind 的 Gemini 3.5 Flash-Lite 模型卡(2026-07-21,vendor-claim)做了一件其他資料都沒做的事:基準測試表格的前兩列是價格——每 1M token 的輸入與輸出價格——而且比較中的每個模型都列了價格,包含廠商自家模型與競爭對手。不是註腳、不是附錄、也不是獨立的價格頁面,而是放在 SWE-Bench Pro 上方、買家閱讀的同一張表格裡的成本列。

這是本語料中首度出現的對稱成本揭露。Inkling 替自己發布曲線、替其他模型列點;Moonshot 替所有模型發布來源資訊,卻讓自己用主場 harness;DeepMind 則在四個欄位中為所有模型公布相同的成本數字,在這個軸上沒有給自己特殊待遇。

但這仍不算控制運算量。每個 token 的價格是一種費率;買家需要知道的是費率 × 每項任務使用的 token 數。模型卡沒有報告任何一個模型的 token 數、實際經過時間、思考預算或努力程度設定——所以表格雖然多了成本欄位,卻仍無法算出成本。這個落差並非無關緊要:它正是 Brown 的 GPT-5.5 與 5.4 軼事所涉及的量。一個費率只有一半、但輸出 token 數是三倍的模型,其實更貴;這張表卻會把它顯示成比較便宜。因此,只加上價格而不提供 token 數,可能讓表格更有把握地誤導讀者,甚至比完全不含成本資訊的表格更糟,因為它引誘讀者進行數據不支持的計算(每項任務成本高於每 token 成本)。

另一項與運算量無關、值得分開討論的缺陷是:比較對象的選擇。DeepMind 的 2026 年 7 月模型,拿來與 GPT-5.4 mini 和 Claude Haiku 4.5 比較,而自家比較對象則是緊接的前一代模型。本語料已追蹤 GPT-5.5、GPT-5.6 Sol 和 Claude 4.8/5 世代數週;模型卡沒有註明競品的日期、是否有任何一家實驗室推出更新的效率級模型,也沒有說明競品分數的收集時間。運算量控制與比較對象是否最新,是表格誠實度的兩個獨立軸;廠商可以在一個軸上打破慣例,同時悄悄忽略另一個。

因此,目前語料中有四種廠商半途打破慣例的形式:Inkling 提供曲線卻沒有競爭對手;Kimi 提供競爭對手的測試條件卻沒有曲線;DeepMind 的 Gemini 系列提供所有人的價格卻沒有任何人的 token 數;Gemma 4 在總覽表中什麼也沒提供,卻在後面的表格悄悄控制了條件。四者都沒有做到 Brown 所要求的事。不良均衡之所以持續,並非廠商拒絕揭露——Moonshot 揭露的資訊甚至超過 AISI 所需,DeepMind 也把美元價格放進標題表格——而是因為沒有人放上頁面的軸,正是掃描它最花錢的那一軸。發布價格不花成本;測量每項任務的 token 數則要花成本。

選擇軸:METR 主張用美元,並測量原因(2026 年 7 月)#

上面每份資料都在回答「要不要設一個軸?」;METR 的支出時間跨度說明(2026-07-21,empirical),則是本語料中第一份探討該選哪個軸,並以測量結果支持選擇的資料。它的答案是美元,理由並非記帳習慣:

  • **在代理程式式 AI 研發任務中,token 成本只占少數。**六次代理程式執行 NanoGPT speedrun,每次最高花費 $10,000;結果顯示,多數軌跡中,實驗運算約占成本的 70–90%——也就是執行及驗證候選訓練配方所花的 GPU 時間,而非模型推論。若此任務只用 token 數作為 x 軸,實際上呈現的只有支出較少的 10–30%,還會把省 token 卻大量執行實驗的代理程式排在耗 token 但少做實驗的代理程式前面。只有美元能同時納入兩者。
  • 美元是實際決策所用的單位。「支出帶來的回報,直接衡量 AI 研發實驗室在選擇投入人力或代理程式勞動時,真正關心的經濟變數。」Token 數和實際經過時間都無法與薪資比較,美元則可以;因此 METR 能把人類曲線放到同一個軸上。

最後這點是實質上的延伸,也是上面四種半途打破慣例的作法都沒嘗試的事:**METR 將人類的支出回報曲線和代理程式曲線畫在同一個軸上,並報告兩者的交會點。**Brown 要求標示預算;AISI 報告預算對應的觸及率與可靠性;METR 則加上第二條比較曲線,讓 x 軸代表人類勞動的單位,而不只是一筆支出。以 NanoGPT 為例,這項校準約為每提升 1% 速度需花費 $2,500,六次代理程式執行的花費介於 $0 至 $3,300。

本文應記錄兩項取捨,因為它們是選用此軸所付出的代價:

  • **美元軸會納入 harness 效率不彰的成本。**METR 的代理程式持續使用 4 個 H100 節點,並可自由執行實驗,70–90% 的成本比例就是由此而來;METR 稱自家 harness「可能效率不佳」,預期最佳化後的 harness 能以較低成本達成同等最佳化。因此,以美元表示的曲線測量的是代理程式加 harness,兩間實驗室的曲線比較也會把它們的 harness 一併比較。METR 的辯護是,將曲線水平移動「不會大幅改變支出時間跨度」;這是根據曲線右端的平緩程度得出的判讀,並未透過更便宜的 harness 進行測試。
  • **以金錢為單位,就帶入了價格假設。**每提升 1% 速度需花費 $2,500 的人力成本假設,建立在每小時 $150 的工資上;METR 自己的敏感度表顯示,對某個模型而言,將人力成本假設調整 10 倍,計算出的時間跨度就會從 $120 變成 $14,400。美元軸誠實呈現實際花了多少,但也帶入了勞動價值多少的假設——這項假設不會出現在 token 軸上。

路由與共識也面臨相同的預算問題#

這項批評同樣適用於把支架當成核心價值主張的廠商。路由/共識層(將每項子任務交給合適的模型,或彙整多個模型的答案)確實可能在基準測試上勝過任何單一模型。但 Brown 的原則會把表面上的勝利化為同一個問題:在測試時運算量相同的條件下,路由後的模型集群是否勝過讓同一個模型多思考一會兒?模型間共識只是另一種投入推論資源的方式;若不在固定預算下比較,也不證明它能在實際使用情境中奏效,而非只在為其調校的基準測試上有效,那麼效能提升可能只是投入更多資源或過度配合評估的結果。

基準測試刷分的實測:預算匹配下的 harness 演化(2026 年 7 月)#

Brown 認為支架技巧會灌高分數,原本只是論點。Wang、Zhu、Hu 等人(arXiv 2607.12227,Ai2 / UW,2026-07-14,empirical)將這項主張針對明確命名的方法類別進行實驗;這是本語料中首次附上數據的相關批評。

研究對象是自動 harness 演化——代理程式依據基準測試回饋反覆改寫自己的支架,並在同一基準測試上報告最終分數(Agent-Authored Harness Optimization)。讓它成為運算量控制問題的關鍵觀察是:*harness 演化本身就是一種搜尋程序,會反覆評估候選方案,並根據任務回饋進行修改。*因此,它應與平行取樣和循序精煉採用同一個比較軸,公平的比較必須讓三者的回饋與推論預算一致。過去沒人這麼做。

在三個前沿模型上,Terminal-Bench 2.1 的每種方法都固定 K = 5,結果排序與已發布結果相反:平行取樣的平均 pass@1,在沒有單元測試回饋時為 72.3,有回饋時為 86.0;harness 演化則是 67.4 和 75.8——在第一種設定下,演化方法甚至低於什麼都沒做的基準(68.2)。在保留任務上演化 harness,只帶來 +0.6pp 的遷移效果。

有兩點可推廣到 harness 演化之外:

  • **pass@1 與 pass@k 的差距,是可移植的基準測試刷分診斷方式。**harness 演化的 pass@5(86.2)與平行取樣的固定 86.0 相當,但它的 pass@1(75.8)落後十個百分點。作者推論:「如果 harness 修訂真的帶來更好的 harness,我們預期改善會反映在 pass@1 上。實際上,只有能從多條軌跡中選擇時,優勢才會出現。」若提升只在 best-of-N 選擇下出現,那就是 best-of-N,不管論文如何稱呼——現在更有了能區分兩者的測試,正好驗證 Brown 的指控。
  • **搜尋集與評估集重疊,是第二項獨立混淆因素。**當方法最佳化的任務和它回報成績的任務相同時,改善「可能反映了對特定任務模式的適應」。這是基準測試污染與去污染的資料外洩論點,透過支架而非訓練資料呈現;補救方式也相同,採用 Brown 主張的保留私人測試集——但將其用在最佳化迴圈,而不只是模型上。

這項結果同時支持也限制本文的主張,論文本身也有提到。§5.2 承認 Terminal-Bench 可能不是合適的測量工具——代理程式的得分已經很高,而且「只要最小配置,包括 shell 工具和基本提示詞,就足以完成大多數可解任務」,因此支架沒什麼可以改善的空間。若基準測試沒有可提升的餘裕,即使預算匹配的比較也可能無法提供有用資訊;這是運算量控制研究第一次必須說明的限制:控制預算能消除一項混淆因素,卻無法憑空創造基準測試原本沒有的敏感度。

最純粹的例子:未定義的努力程度層級,卻被稱為控制(DarwinX,2026 年 7 月)#

在上述論文發表十七天後,DarwinX(arXiv 2608.07545,Salesforce AI Research,2026-07-31,empirical)在同一基準測試上報告了相反結果,也犯了上方 Kimi 章節提醒的問題,而且多了一項令人不悅的差異。Moonshot 公布的是努力程度設定,從未宣稱那就是預算。DarwinX 公布層級名稱,以**「提升來自 harness,而非運算量」為章節標題,並將比較稱為「努力程度受控的比較」**。這是本語料中第一份明確宣稱廠商層級標籤就是運算量控制的資料,也因此成為最清楚的案例,呈現本文想指出的混淆。

全文查核發現:

  • **層級從未定義。**結果表格中反覆出現「medium」、「high」和「xhigh」,但在 33 頁文件中,沒有任何地方提供 token 數、回合數或實際經過時間上限。附錄 B 的各基準測試流程表——基礎模型、演化資料、報告資料、選擇訊號、報告指標——完全沒有運算量欄位。論文中也沒有美元數字。
  • 因此,這項「控制」比較的是不同廠商的層級名稱。「中立 harness 在較高努力程度下(Terminus-2,xhigh)只達到 78.0%,低於 DarwinX 在 high 努力程度下的 83.2%,因此另一個 harness 增加原始努力程度並不能重現這項提升。」這確實描述了在不同 harness 中提高層級的結果,但並非經過標準化的預算,因為沒有任何資訊能證明某個 harness 的 xhigh 與另一個 harness 的 high 代表相近的運算量——這正是 Brown 以 GPT-5.5 對比 GPT-5.4 所提出的觀點。
  • 論文自己的標題成對數字沒有對齊層級。它稱為關鍵證據的同模型提升,比較的是 GPT-5.5 / default(75.5%)與 GPT-5.5 / high(83.2%)。表中唯一真正層級相同的一對數字,是 DarwinX 的 84.7% 對比 OpenAI 自家的參考結果 81.8%;兩者都是 GPT-5.6 Sol / medium——+2.9 個百分點,是標題中的最小提升。
  • 論文在 §9 承認這項落差(「資料集、父代選擇器、重組算子和推論努力程度都沒有各自獨立隨機化」),也值得肯定的是,它在 §3.2 說明「公開排行榜上的結果採用不同模型和努力程度設定,因此只能提供背景資訊,並非受控比較」。論文知道問題所在,但摘要與 §4.1 的標題沒有保留這項限制。
  • 論文中唯一真正的運算量數字,是測得的中位數,而非宣告的預算——在六個新解出的任務上,token 數為 380K 對 89K,回合數為 22 對 11;對於已解出的 69 題,則從圖表而非文字可讀出 172K 對 125K。這些是正確的測量項目,但論文只把它們當成額外支出用途的診斷資訊,並非兩組比較都遵守的上限。

可推廣的重點,也是比上述四種半途打破慣例多出來的第三個軸:**層級名稱是要求,預算是上限;當論文把層級印在與分數相同的欄位時,兩者的差異就變得看不見。**Moonshot 的模型卡至少讓「推理努力程度 = max」看起來像它本來的樣子:一項設定。若把相同的東西當作控制,就把單純揭露轉成揭露本身無法支持的主張;結果便是失控的比較看起來像已經回答預算問題。如今,發布層級名稱的慣例也需要補上 Brown 從一開始就要求的對應資訊:凡是公布層級,就應同時公布所花費的 token 數。

同一篇論文還有另一項較不明顯的運算量控制失誤,值得獨立討論,因為它涉及的是搜尋而非推論。harness 演化是一種搜尋程序,因此比較時也必須固定它本身的預算;然而 DarwinX 沒有公布任何相關數字:TB2.1 迴圈只說會「經過多個世代」,沒有世代數、rollout 總量或成本;與它結論相反的論文則把搜尋限制在 K = 5 個回合。同一基準測試上有兩項 empirical 結果,搜尋支出相差四個數量級,卻都沒有換算成共同單位(Agent-Authored Harness Optimization)。

作者表示,在值得關注的規模下,這項控制無法負擔(2026 年 9 月)#

本頁提出的做法——固定預算並在預算內比較,或畫出完整曲線——假設這種比較負擔得起。Brown(Dwarkesh Podcast,2026-09-17,practitioner-opinion)談到自己的旗艦成果時表示,在前沿規模下做不到:

「我們確實在已發表的部落格文章中測到大約 16 個代理程式。問題是,要把這項研究推進到 10,000 個代理程式非常困難,因為成本實在太高。」

而這項成果所引出的特定對照實驗,他更是直接拒絕:「我們不知道單一代理程式解出 Navier-Stokes 要花多久,因為我們還沒做過那項實驗。」他表示計畫先做 64 / 128 / 256 個代理程式的消融實驗,再據此推論;但也承認:「要一路推到 10,000 個代理程式,並確切知道相較於使用 1,000 個代理程式,使用 10,000 個代理程式究竟帶來什麼好處,會非常困難。」

這正是本頁論點抵達自身界線的時刻,值得精確說明,因為這不是常見的失敗類型。這裡的供應商並未隱瞞預算——預算就是標題:10,000 個代理程式、1,300 億個 token、88 小時。缺少的是不同預算下的反事實比較,而這正是受運算量控制的比較所需的另一半。部落格文章測量的範圍是 1 / 4 / 16 個代理程式;對外公布的數字是 10,000;掌握運算資源的一方表示中間區段將會空白。因此,這項成果同時是資料集中揭露最充分、控制最不足的標題性成果。

三項後果:

  • 揭露與控制是兩回事。本頁每個揭露範例(Kimi K3 的註腳、Gemini 的價格列、Inkling 發布的曲線)都把公布預算當作解方。這個案例完整公布了預算,卻仍無法解讀,因為沒有測試相鄰預算。「報告運算量」是必要條件,但在極端情況下仍不充分——讀者需要的是曲線上的兩個點,而其中一個點的成本可能高過成果本身。
  • 這讓「畫出完整曲線」這項建議有了價格上限。METR 的美元軸論點與 optstop 的樣本截斷,都假設曲線上的各個點個別而言負擔得起。若要用 10,000 個代理程式跑 88 GPU 小時,這些點就負擔不起;因此,誠實的建議應改成「能測量的地方就畫出曲線,並標示外推區段」。
  • **這也對本頁和 Large-Scale Test-Time Compute 都列為待解問題的「從低成本執行結果預測高成本表現」寄予厚望,構成嚴峻考驗。**Brown 自己的計畫正是這種預測——測到 256 個代理程式,再推論到 10,000 個——而提出計畫的人自己也不相信這樣就能解決問題。

原始文件同一週公布,讓論點更尖銳,而非更緩和(2026-09-21)。OpenAI 自己的公告(On the Navier–Stokes Millennium Prize Problem,2026-09-08,vendor-claim)就是 Brown 所描述的來源,而且揭露的內容比他所說的更多:在 Navier–Stokes 上使用約 10,000 個並行代理程式、88 小時、270 萬則代理程式間訊息、約 1,300 億個輸出 token;所有嘗試過的問題合計則有 490 萬則訊息 / 約 3,000 億個輸出 token。本頁應記錄三點觀察。

第一,揭露採用四種單位,沒有一種是美元——代理程式、時數、訊息、token。這是資料集中最詳盡的預算揭露,卻仍無法與 FrontierMath Erdős Benchmark 的 300 美元或 METR 的美元軸比較,因為內部模型每個 token 的價格未公開,模型本身也未公開。用別人不採用的單位報告預算,這種揭露無法流通。

第二,文章確實包含一組相鄰設定,比訪談承認的多了一組:同一輪研究中的 Euler 結果使用「近 100 個代理程式……約 50 小時」。這不是對照組——問題不同、模型在研究過程中重新訓練,而且大型執行是以小型執行的輸出為種子——但值得原樣記錄,因為它看起來像對照組。想從這篇文章取得曲線上兩個點的讀者,可能會拿到這兩點,卻得出錯誤結論;本頁應像指出缺少對照一樣大聲點出這種失敗模式。

第三,這輪研究按設計在執行途中改變了設定:代理程式從其他問題調派過來,收到 Euler 解法的重新提示,有了進一步訓練的檢查點後便升級使用,並透過 Codex 交叉傳播成果。因此,即使唯一公布的點也不是在固定設定下取得的——不存在某個預算,能讓「10,000 個代理程式解出 Navier–Stokes」成為可重現的說法;而完整的揭露讓這一點清楚呈現,沒有將它藏起來。

寫進分數定義的預算,以及拒絕採用更好看標題的作者(2026 年 9 月)#

以上每個範例都把運算預算視為應該連同分數一起揭露的資訊。FrontierMath Erdős(Epoch AI、Announcing FrontierMath Erdős、empirical)是本資料集中第一個把預算定義為分數構成要件的基準測試:每題一次作答,每次推論花費 300 美元、工作時間 72 小時,並將 harness 和題目清單開源。不同預算下的執行結果不是揭露較不完整的分數;它根本不是分數。

值得效法的,是這樣做帶來的示範。Epoch 使用同一個尚未發布的模型,以不同代理程式設定和更高預算,在協定外執行,結果更好——花費超過 220,000 美元解出 68 題中的 5 題,而依照協定則是花費約 20,000 美元解出 68 題中的 2 題。它完整公布這些執行結果和每題解答的成本,接著用粗體明確拒絕給它們分數標籤:「這些嘗試不算 FrontierMath Erdős 分數。」標題數字維持在 3%。這正是上述不良均衡所預測沒人會做的事——基準測試作者握有自己產生的更大數字,卻拒絕將它當成結果報告。之所以做得到,靠的是結構而非道德:預算寫進了定義,因此較好的執行結果是依定義自動失去資格,而不是作者必須對抗自身誘因才能作出的判斷。

另有兩項特性,一項優點、一項限制:

  • 協定外資料以資料形式公布,而非遭到壓下,讓讀者取得前一節所說通常缺少的階梯:各題嘗試次數(7/7、5/5、2/5、1/4、1/4),以及每題解答成本,從 47 美元到 1,384 美元;題目和模型都相同。因此,基準測試可以同時執行預算限制,並提供相鄰預算的反事實比較,只要兩者標示清楚。這解決上述 Navier-Stokes 問題的成本,比表面上看來低——那裡負擔不起的是前沿規模下曲線上的第二個點;而這裡第二個點的成本是第一個點的 11 倍。
  • **座標軸只有美元。**沒有 token 數量、各模型的 API 價格,也沒有 72 小時上限以外的實際耗時。就下文的 x 軸問題而言,對於使用者需要決定是否投入資金研究某個問題的基準測試,這是符合買方需求的選擇;但這代表每個 token 成本下降的模型,在這裡會顯得能力嚴格提升,而且 3% 無法拆解為「推理更好」或「每美元能買到更多 token」。

同一位作者公布曲線,而非只有上限(OEIS Open,2026-08)#

上述協定將預算固定在單一點並在該點計分,回答的是「300 美元時能力如何?」除此之外,對曲線形狀沒有說明。六週前,同一位作者發布了 OEIS OPEN(OEIS Open: How many conjectures can language models turn into theorems?,arXiv 2608.11941,empirical),同時做到兩件事:上限是構成要件(492 題集合每個猜想 50 美元,100 題子集中每個猜想 200 美元),並且公布完整支出曲線——對每次執行,依各個猜想獲得解答當下的支出,呈現已解猜想比例,因此讀取曲線在 $x$ 的位置,就能估算上限設為 $x$ 的執行結果。八次執行的曲線上升大致與對數支出呈線性,在支出每增加十倍時約升十個百分點,且達到上限時仍未趨於平緩。

這是目前最有力的做法,回應本頁一直以來的批評:單一數字隱藏了預算。只要記錄每次解答的時間,就能從一次有上限的執行中免費公布完整曲線,無須額外運算。這有兩項誠實的限制,其中一項論文明確指出,另一項則未提及。論文明確指出:「由於代理程式會被告知預算,可能影響其行為,因此估算並不完美」——得知預算是 50 美元的代理程式,行為不會和得知預算是 200 美元的代理程式在前 50 美元內的行為相同,所以重建的曲線並不等同於一系列各自設定上限的獨立執行。未提及的限制是:曲線在上限處受到右設限,因此只能顯示上限以下尚未趨於平緩,永遠無法顯示何時開始趨於平緩。

它也提供本頁另一個 Epoch 範例所缺少的價格對比,來自同一季、同一評估者:這裡每個已解猜想平均 6–10 美元,最高 47 美元;FrontierMath Erdős 則每題解答成本為 172 到 1,384 美元,邊際成本約 67,000 美元。同一套工具、相同單位、兩個分母——這正是美元軸的用途。

在前沿模型橫斷面上勝過運算量的變數:發布日期(2026-09-22)#

本頁所有內容都把運算量視為缺失的控制變數。Zhu(Oxford Internet Institute,arXiv 2608.29420,empirical,單一作者、未經同儕審查的預印本)在一份雜湊值固定、涵蓋十二項基準測試的 Artificial Analysis 快照上測量了另一個控制變數,發現其影響更大;並且發現把運算量納入後,效果反而更差。

這十二項基準測試中的主要能力因子,與模型發布日期的關聯呈邏輯斯 R² 0.505(OLS 0.477);先將每項基準測試依日期取殘差,再重新擬合,該因子占共同變異的比例便從 74.5% 降到 59.6%。在 58 個已知運算量的模型子集中,單獨按日期調整會消除同樣的 16.5 個百分點;同時加入訓練運算量的對數,合計只消除 9.3 個百分點——合理的解釋是,較晚發布的模型通常也較大,因此兩個預測變數分攤了彼此共享的變異。先前針對分數矩陣的心理計量研究(Kearns;Ilić & Gignac;Ruan et al.)都會控制規模;本文的主張是,在前沿模型快照上,「跨世代比較時,日曆時間承載了規模所承載的資訊。」

這對本頁有兩項後果,而且方向相反。

控制運算量仍是防止基準測試刷分的正確做法,因為這是單次執行內的公平性:透過隱藏的最佳 N 次設定所產生的分數,不能與單次執行的分數直接比較;只有清楚說明預算,兩個數字才有相同意義。本文並未影響這一點。

控制運算量並非確保跨模型可比性的正確做法,而排行榜的一列實際上要回答的正是這個問題。在前沿模型橫斷面上,發布日期相隔九個月的兩個模型,大多差在日曆時間;研究若控制參數或 FLOPs,卻不控制發布日期,就等於移除了影響較小的兩個混淆因素之一,最後還可能只得到一個縮小了的校正值。本研究要求揭露的項目,不是任何排行榜會視為關鍵、卻是所有排行榜都已有的資訊:發布日期。建議是,解讀同時期模型的小幅差距之前,先依日期校正,或把比較限縮在同一發布時段內。

這篇論文的限制也適用於整份研究:完整案例 n = 96、單一評估者、單一日期、主要估計值 14.9 個百分點的 bootstrap 信賴區間為 ([−5.3, +32.7]),無法與零區分;作者並將該假設報告為不成立,而非推廣通過檢驗的模型設定。

預算之下的揭露項目:按「每題」計算,還是共用(2026-09-22)#

本頁的核心論點是,沒有預算資訊的分數並無明確定義。Fan et al.(arXiv 2608.07968,UMD,empirical)揭露了一項從未有人明說、因為也沒人察覺的先前選擇:**資料集中每項基準測試都讓每個題目各有自己的預算。**這是 harness 的設定選擇,而且並不中立。

直接測量結果(附錄 B、評分方式一致、七個推理模型):讓模型為 N 題共用一份預算,而非每題分配 B/N,分數就會改變——N=5 時,因前置投入讓模型有把握地完成幾題,分數增加 2.6 個百分點;N=10 時下降 0.4 個百分點;N=20 時,七個模型的分數都下降 5.0 個百分點。同一模型、相同 token 總量、相同題目;唯一差別在於由 harness 還是模型自行分配預算。作者謹慎指出,均等預算組並不是預言機——獨立提示也消除了題目間的干擾——但趨勢方向與隨 N 增加而呈現的單調性都毫無疑問。

對一篇探討揭露的文章而言,這帶來三項後果:

  • 逐題預算是所有分開施測的基準測試中一項不明說的加成;而真實部署交給模型的批次越大,這項加成就越大。排行榜上的分數,是在最有利於模型的情境中測出來的。
  • **這個評測網格完全看不出這項能力。**傳統的一次評一題不會在問題之間形成取捨,因此無法在問題間分配資源的模型,分數會和能做到的模型一樣。論文的說法——整體預算分配「未被傳統的逐題評測捕捉」——將本頁對運算量的批評再往上推了一層:問題不再只是「預算是多少?」,還包括「預算分配到什麼單位?」
  • **這篇論文實踐自己要求他人做到的事,但只做到一部分。**文中數學領域的預算 B,全文從未提供數值;只有程式碼領域的 B = 3,000 有明確說明,並校準為單題參考成本中位數的約 3 倍。這項研究的主題是預算壓力,卻在報告主要領域結果時,沒有提供決定結果的常數——這是本頁追蹤的揭露落差,在一篇主張依預算評測的論文中清楚呈現。

延伸閱讀#

  • 共用預算下的運算分配 — 預算問題底下的單位問題:這裡每項基準測試都默默採用逐題預算;把相同 token 總量改成一份共用預算,在 N=20 時會讓全部七個受測模型各少 5.0 個百分點,N=5 時則增加 2.6 個百分點

  • Interactivity Benchmarks — 本頁問題在語音領域的實例:跨供應商圖表在每個長條上標出推理力度設定,讓自家模型跑 High,競爭對手跑 Medium,並在具名工作負載上列出實測成本,而非價格表中的數字

  • 經濟基準測試的構念效度 — 本頁未曾點名的控制變數,與本頁建基其上的控制變數相比較。發布日期對主要能力因子的解釋力為 R² = 0.505;日期校正再加入運算量對數,反而縮小校正幅度(同一批 58 個模型中,16.5 → 9.3 個百分點)。揭露運算量仍是防止基準測試刷分的答案;調整發布日期才是確保跨模型可比性的答案。這是兩個不同問題,卻常被混為一談。見上文

  • OEIS Open 基準測試 — 相同的建議,但公布的是曲線,而非只有上限:設定具構成性的預算上限(每個猜想 50 / 200 美元),再依每題在有上限的執行中獲得解答的時間,重建解答率與支出的關係;每增加十倍支出,解答率約升 10 個百分點,尚未趨於平緩。只需一次執行就能免費取得,但曲線在上限處受到右設限,且會受到代理程式已知預算的影響

  • FrontierMath Erdős Benchmark — 將本頁的建議貫徹到底:300 美元 / 72 小時的預算是分數定義的一部分,而非註腳;作者也公布自己以更高預算執行的結果(花費超過 220,000 美元解出 68 題中的 5 題,相較於約 20,000 美元解出 68 題中的 2 題),並明確拒絕將它稱為分數

  • Epoch AI — 制定該協定的第三方評估者,也是資料集中最清楚展現基準測試作者如何抵抗自身標題性數字誘因的案例

  • Navier–Stokes AI 主張 — 該標題背後第一方公布的預算資料,以四種單位呈現,沒有美元;另有一組看似對照、實則不是的相鄰設定(Euler 上約 100 個代理程式 / 約 50 小時)

  • Autonomous Scientific Discovery — 同時是資料集中揭露最充分、控制最不足的標題性成果:Navier-Stokes 執行完整公布預算(10,000 個代理程式、1,300 億個 token、88 小時),卻沒有相鄰預算;因此「報告運算量」雖已做到,數字仍無法解讀

  • 評估期限與發布節奏 — 本頁預算問題在日曆時間上的版本,也是任何揭露規範都無法觸及的問題:成本軸能為曲線標價,卻無法說明下一個模型發布之前是否有時間跑完評估

  • 多代理程式集體智慧 — 無法負擔消融實驗所造成的影響:這條路徑的核心量化期待是多代理程式縮放定律,而唯一有能力在修辭上最引人注目的規模下測量的單位,表示不會在該規模測量

  • Harness 稅:不同 Harness 讓程式碼代理程式成本倍增,成功率卻幾乎不變 — 衡量具名但未列預算的 harness(上文 Kimi K3 的揭露形式)實際成本:同一模型、相同成功率,只因使用三種 harness 中的哪一種,美元成本最高可相差 2 倍

  • RSI 自主性等級(B0–L5) — 2026 年 9 月的 RSI 調查對本頁主張的兩項延伸。該調查 §3.3.4 對效度問題提出最精闢的說法——「基準測試一旦以適應性方式查詢,實質上就會成為最佳化目標面的一部分,而不再是被動的測量工具」——其 L5 評估協定也將預算問題延伸到本文未涵蓋的方向:原始與修訂後的改進機制,必須在相同總預算下比較,其中包括評估機制的成本,不能只算執行機制的成本。同一調查的 L3 章節要求在自我訓練文獻中補上相同預算的對照組(理由引導式自我訓練(STaR)),但至今尚未實施——建議的實驗組做法,是固定課程的學習者狀態輸入,或以不依賴學習者的排程取代適應性選擇,並使資料取得加上學習的總預算相同

  • Headroom-Closed Index(HCI) — 資料集中唯一將本頁所主張的供應商來源折扣量化的工具:基準測試擁有者表格加權 3、獨立共用 harness 評估為 2.5、合併報告為 2、模型作者表格為 1,而第一方數值還要再乘上 0.75。它為本頁要求的揭露訂價,卻又重現本頁核心的遺漏:每個 HCI 數值都匯總了測試時預算未知且不相等的分數,全文沒有任何運算量軸

  • 評估期間的答案洩漏 — 本頁對認證問題從環境面提出的答案,也是上文所述揭露項目的來源:基準測試分數不只需要運算預算才能定義,也需要產生分數所用的提示,以及該提示允許的利用率。在標準代理程式提示中附上一段文字,在某項基準測試中可讓 Pass@1 朝一個方向最多增加 13.3 個百分點,在另一項基準測試中最多朝反方向增加 3.5 個百分點,同時讓評判認定的利用行為減少 41–73 個百分點——這種未受控制、足以比肩 harness 的變數,沒有任何評測網格會記錄

  • 評估期間的答案洩漏 — 分數缺少時同樣無法定義的另一項條件,也是第一個有人正式認證的條件。本頁的規則是,沒有運算預算的數字毫無意義;Zheng et al. 顯示,沒有沙箱邊界的數字也毫無意義;在 SWE-Bench Pro 上,邊界的影響大於多數預算差異——七個模型中有六個,分數差距達 14–26 個百分點。方法上的借鏡也可以反向運用:他們的認證並非對分數本身作出主張,而是提供公開程序加上軌跡稽核(列明操作類別、各類別前後計數、確認存取次數),這正是「未刷基準測試分」聲明應有的形式

  • Skill Lift — 符合本頁部分揭露門檻,卻未符合其餘要求的供應商基準測試。它固定快照的 commit、提供嘗試次數(85% 為單次嘗試),並明確表示沒有報告信賴區間;但未列出各實驗組的成本或努力預算。這點在此尤其重要,因為有技能與無技能的實驗組實際花費了不同數量的 token——一項技能減少 76.9%,另一項則增加 120.3%。依本頁的定義,兩個實驗組花費不同的消融比較,就是運算量未受控制的比較

  • Inference-Time Architecture Search — 一個遵循本頁原則一半、體現其批評一半的案例:Archon 僅輸出一個最終回應(pass@1,不是 pass@k),並在內部最佳化準確度對推論呼叫次數的取捨前沿,接著報告比 GPT-4o 和 Claude 3.5 Sonnet 高 14.1%,卻沒有把這些基線放在同一個座標軸上。提升是真的;但它是多層、多模型堆疊,拿來對比的是單次呼叫,正是基準測試刷分的典型樣態

  • Continuous Self-Modification Under Review — SOTA 主張的比較組只是排行榜引用。Ouroboros 在 Terminal-Bench、OSWorld 和 CL-Bench 的領先幅度,是和不同模型、不同 harness 的已公布基線比較,並未重新執行基線;稽核後的 Terminal-Bench 分數約高於其中最強基線兩個二項分布標準誤。唯一重新執行基線、採用相同協定的實驗組(SWE-bench Pro,經對稱去污染後配對 655 項任務),結果在統計上無法與基線區分

  • Open-Ended Discovery Harnesses — 同一張表中,有一個基線受控制,另一個沒有。SwarmResearch 和多代理程式基線 CORAL 都在相同執行環境及模型下,以每項任務 50 美元為上限;演化基線 EvoX 則執行 100 次迭代,平均每項任務約 23.50 美元——支出大約只有一半,而報告的領先幅度也在這個實驗組最大。第二項實驗在更低一層重複了相同模式:勝出的編排器引導實驗組,使用的編排器模型比固定縮放基線任何部分所用的模型都強

  • Large-Scale Test-Time Compute — 根本原因:能力會隨推論預算提升,因此沒有預算的分數無法定義

  • Reward Hacking — 基準測試刷分是評估報告階段的 Goodhart 現象,是訓練迴圈中 reward hacking 的同類問題

  • Evaluation Awareness & Grader Gaming — 在模型內部操弄測量指標的版本;基準測試刷分施加的是相同壓力,只是由評估者而非模型造成

  • Latent Capability Overhang — 同一座標軸的另一面:若評測網格因支出不足而低報能力,已發布模型就保有尚未有人付費揭露的能力

  • 基準測試分數冗餘 — 基準測試數量座標軸上的同類成本縮減:本頁透過列出每項基準測試的運算預算來壓低評估成本;該頁則預測模型在保留基準測試上的分數,只需約 5 個探測項目(矩陣秩為 2)。它指出的問題是,BenchPress 正好使用本篇批評所針對的未受控制公開評測網格,因此會繼承該網格的異質性與供應商樂觀偏誤。其第二個來源 DeepMind 的 CollabEval 則開啟第三種成本軸——單一基準測試內的標註預算;略過一個提示既不需推論,也不需評分——而它正是對未受控制網格的回應,而非繼承該問題的方案:五個分數矩陣中有三個是在單一實驗室、使用統一 harness 執行,該方法所利用的相關性在這些矩陣中最強。值得留意的是發展方向:它能減少評估支出,卻不影響本頁要求報告的逐題運算量,因此兩者可自然結合(先列出預算,再用該預算測較少題目)

  • Task Time-Horizon Scaling — 受運算量控制的後繼指標:在特定預算下可靠完成的任務長度,而非未說明預算下的準確度;兩者都面臨基準測試飽和

  • 支出期限 — 回答並延伸座標軸的問題:以美元計價,因為實驗運算量占代理程式研發軌跡成本的 70–90%,而且人類的報酬曲線可以用美元軸繪製,無法用 token 軸繪製——兩者交叉之處就是分數

  • Responsible Scaling Policy Evaluations — 安全評估中同樣的要求:未報告運算預算的威脅模型判定,和未充分界定的能力分數一樣

  • Gemma 4 — 實際範例:在自己的標題表格中,使用思考模式的模型與不使用思考模式的前代模型比較

  • 鋸齒狀智慧(幽靈,而非動物) — 這項混淆因素也跨越模型大小:Gemma 4 在推理上的勝過十倍大型前代模型,部分來自額外推論;而知識上的損失則無法以這種方式彌補

  • 推論效率作為能力 — 未受控制的評測網格在結構上無法呈現的提升,因此高效率模型一向未獲充分肯定

  • 開放權重前沿差距 — Arena Elo 也有相同缺陷:人類偏好是在未具名的推論預算下評分

  • Open-Weight Elicitation Irreversibility — 未列預算的判定涉及安全、且權重公開時的風險

  • UK AI Security Institute / US Center for AI Standards and Innovation (CAISI) — 實際採納「報告能力曲線」的獨立評估者,三週後卻公布了資料集中匿名程度最高的比較對象;既是整體批評的實證佐證,也是揭露方面的反例

  • Noam Brown — 該文章的來源與作者

  • 超越準確度飽和的測量方法 — 將此批評延伸到飽和的基準測試之中:Nadgir et al. 的效率軸以 token 與美元成本繪出準確度(GPT-5.3-Codex 比同等準確度的模型約便宜 60%;token 成本與美元成本對代理程式的排名不同),這是「把運算量放在 x 軸上」的改述——並進一步主張,除了運算預算,還應報告可靠性以及模型與 scaffold 的貢獻

  • 基準測試污染與去污染 — 另一項基準測試信任議題,針對不同的混淆因素:本頁說未命名的運算預算會讓分數失去意義;該頁說訓練資料洩漏也會讓分數失去意義(因為記憶能力會抬高分數)。兩者都反對只看標題數字,並都提出恢復單一數字隱藏的資訊(這裡是能力曲線;那裡是未受污染的逐樣本分布)

  • Kimi(Moonshot AI) — 揭露軸另一端的例子:逐項基準測試固定 harness、具名努力設定、自我降低分數的數字,還主動公布對手的備援 / 拒答比例——這些資訊都沒有運算預算

  • 依能力觸發模型備援 — K3 的註腳意外從 Anthropic 外部測得的安全機制觸發率

  • 每項任務成本勝於每個 Token 成本 — 價格列為何不等於成本:帳單是費率 × 每項任務使用的 token 數,而公開的永遠只有費率

  • 公開基準測試還能提供多少訊號——又該如何取代? — 相關研究的綜合:未命名的運算預算是五種污染途徑中的第一種,而在標示明確的預算下公布能力曲線,則是五部分替代方案中「將運算量放到 x 軸上」的做法

  • 代理程式撰寫的 Harness 最佳化 — 本頁批評的兩個層面都在同一方法類別中出現,而且這個方法類別的研究結果如今也有爭議。Cline 的標題是未控制 harness 的比較(在針對該基準測試調校 17 小時的 harness 上,以 49.8 美元達到 88.8%;旁邊列出 Fable 5 的 552 美元和 GPT-5.6 Terra 的 400 美元,設定卻未說明);Wang et al. 在上文執行相同預算實驗之前,整個方法類別都未受運算量控制;那項研究讓基準測試刷分從一種論點變成測量結果。接著 DarwinX 在同一基準測試上提出相反結果,卻未執行對照實驗,主張其額外運算量分配得更好(在新解出的題目上使用 4.3 倍 token),而不是保持相同;這是另一項主張,也是本頁最新一節所剖析的內容

  • 程序與結果 reward model — 相同要求從 reward modelling 領域提出;一位講師如此表述,卻無法滿足:「要進行良好的蘋果比蘋果比較,ORM 和 PRM 通常應來自相同資料」;此外,固定預算該如何分配給生成器樣本與驗證器運算量,也仍是未解問題。該領域 ORM 與 PRM 的標註效率比較明確未受控制——ORM 每題需要 k 個標籤,PRM 則需要 k × 步驟數

  • Weak-Verifier Ensembling — 少見的半套實踐:Weaver 以總推論 FLOPs 為 x 軸繪製成功率,而非只報告單一數字,已勝過多數研究;但它與專有模型的標題比較並未使用該座標軸

  • 代理程式軌跡上的樹搜尋(LATS) — 發布的標題性成果未列出本頁堅持要求的座標軸:LATS 將測試時運算量轉化為品質,過程涵蓋擴展、 rollout、評判與備份;其講師自己也承認,「論文其實沒有真正分析成本效益」

  • 評估抽樣中的自適應停止 — 同一機構正在建立的另一個成本槓桿,也是本頁最容易與上文所述預測研究混淆的一項。AISI 的 [[raw/optstop-bayesian-optimal-stopping-llm-evaluations|optstop]](Pilditch,arXiv 2608.14425,empirical)不會從低成本執行結果預測高預算下的表現:它固定預算,減少精確估計每個點所需的抽樣;當每個題目及每個模型任務組合的貝葉斯可信區間窄於預先設定的門檻時,就停止抽樣。跨運算量座標軸外推,與單一點內部截斷,是兩種不同操作,保證也不同;該方法的等效性檢驗只認證後者。兩者可以結合——自適應停止能讓完整曲線的測量更負擔得起——但經驗證的截斷無法證明預測也經過驗證

  • 以基準門檻進行治理:指標必須證明什麼,義務才能以此為據 — 將本頁的要求改述為法律起草要求。依照明確預算進行第二方重現,是具義務效力的基準測試所需七項特性之一,也是 wiki 顯示目前只有兩項可實現的特性之一:AISI 的最低資訊量預算與 Kimi K3 的逐項基準測試 harness 固定,是尚無人組合完成的邊界協定兩部分。最容易延伸的是「等級不等於預算」這項發現——監管者若把供應商宣稱的努力等級視為運算控制,就會重蹈 DarwinX 的錯誤,並將市場准入決策牽涉其中

  • AI-Assisted Error Analysis — 有一項主張正等待本頁所要求的對照實驗。初步且未發表的基準測試(Husain & Dasgupta)指出,通用程式碼代理程式比專用評估探索平台更全面地找出失敗模式,但兩種方法都未報告預算或努力等級——這正是本頁指出的努力等級未定義模式,而且提出比較的作者也販售另一種方案

開放問題#

  • 能否認證「沒有刷高基準測試分數」——確認回報的分數使用的是明確、可重現的運算預算,而非隱藏的最佳 N 次腳手架?進一步聚焦(2026-09-10)——可行的認證對象是環境,而不是分數:Zheng et al.(empirical)認證了同類產物的另一種分數屬性,並展示認證奏效時的樣貌。他們公開了程序(將儲存庫重建至單一提交、停用 Git hooks 後刪除測試產物、雜湊執行個體 ID、列出具名主機封鎖清單),接著稽核執行已產生的軌跡:十一種具名本機操作類別和六種線上操作類別,逐類列出前後操作及任務數;另有一項高精確度路徑檢查,顯示本機 103 項任務及透過網路 49 項任務在處理前確實存取了答案檔,處理後則降為零。這些結果都不必仰賴回報者對自身腳手架的描述——軌跡就是證據,持有軌跡的第三方可以重新推導每個數字。這個問題可沿用的形式是:認證執行紀錄,而非分數,並要求提供日誌,而非只接受說法。尚未解決的缺口在於誰持有軌跡——這是自我稽核,論文也承認,有決心的對手可以繞過封鎖清單。兩天後再次聚焦,新增了本頁原先沒有的揭露項目:Ludwig et al.(NVIDIA,empirical)只改了代理程式提示中的一個段落——其他一切都不變,包括同一個 harness、相同模型、相同預算——SWE-bench Multilingual 的 Pass@1 最高相差 13.3 個百分點(DeepSWE 則介於 −3.3 到 +3.5,甚至連變化方向都不固定)。這個差異與本頁已視為未受控的腳手架效應同一量級,卻是由排行榜從不回報、任何運算軸也捕捉不到的變因造成:harness 提示是預算揭露範圍的一部分,但沒有人揭露它。這也為認證問題提供了另一種較便宜的產物,可與執行紀錄並列——公布利用率與通過率,因為沒有利用率的分數,就像沒有運算預算的分數一樣規格不足;兩者都可以從評估者已持有的軌跡中還原。讓問題繼續懸而未決的限制是:他們的利用率本身是由 LLM 評審判定,沒有經過人工驗證,因此其認證力低於 token 計數。2026-09-21 從第三個方向得到部分解答,而且這次是定義上的解答,不是證據上的解答:Announcing FrontierMath Erdős(empirical)把預算納入分數的定義——每題 300 美元、72 小時、每題僅嘗試一次,harness 和題目清單皆開放原始碼——因此隱藏的最佳 N 次腳手架不會產生虛高分數,而是不會得到分數。作者接著以自身為例展示這項性質:其自身以更高預算進行的非規範執行,花費超過 220,000 美元解出 68 題中的 5 題,對照之下,約 20,000 美元解出 68 題中的 2 題;所有細節連同每題解答成本都完整公開,但作者明確拒絕授予該成績標籤。這種認證無須花費任何成本就能驗證,因為根本沒有東西需要證明——「此結果是在所述預算下產生」這項主張若不成立,該數字就根本不是 FrontierMath Erdős 分數。這並未解決原本提出的問題,具體缺口是:沒有任何機制能阻止第三方把非規範數字當成正式分數回報;唯一有能力查核的一方是 Epoch,但 Epoch 無法重跑競爭者的私有 harness。可移植的教訓應與「認證執行紀錄,而非分數」並列,而非取而代之——將預算定義在指標之中,再把遭取消資格的執行結果當作資料公布——而且這種做法只有在基準測試作者也負責執行每次評估時才便宜;供應商提交結果的排行榜並非如此運作。2026-09-22 從標準化而非稽核的方向延伸:How UK AISI and EvalEval Are Making Benchmark Results Reproducible(empirical)由 UK AISI 與 EvalEval Coalition 合作,根據 Every Eval Ever (EEE) schema,發布經驗證的評估卡——標準化的基準測試、執行紀錄與模型設定——涵蓋五項基準測試和六個模型,並配合 AISI 的 How Inference Compute Shapes Frontier LLM Evaluation。這是第三種紀錄方式,與前兩種不同:既非 SWE-Bench Pro Verified 對軌跡進行自我稽核,也非 FrontierMath Erdős 設定定義上的預算上限,而是透過共用 schema,讓不同發布者之間的基準測試、執行紀錄與模型設定三元組可供查核,而不只限於單篇論文內部。這次發布本身也顯示了這項承諾的上限:Terminal-Bench 2.0 的比較圖將本研究分數與從 EEE 擷取、使用相同模型的圓點並列——這正是預期的跨來源查核——但已發布的圖表只顯示座標軸範圍和圖例;不使用腳本處理其 SVG/canvas 的讀者,無法看到各模型的數值。此處的「經驗證」表示紀錄的來源可供查核,而非其數值不借助工具也清晰可讀——這種標準的認證力低於上述軌跡稽核,但也因此更容易大規模製作。
  • 運算有好幾種單位(tokens、美元、實際經過時間)。它們並不一致(效率更高的模型在成本上勝出,但 token 數不一定較少)。哪個 x 軸才誠實?答案會因買方而異嗎?(AISI以對數軸呈現tokens,並指出每 token 成本下降時,揭露能力所需的高額預算會逐漸變得更便宜。)部分解答(2026-08):METR主張應看美元,並提供足以支撐這項主張的測量結果,而非只提出論點——在一項代理式 AI 研發任務中,實驗運算約占軌跡成本的 70–90%,因此 token 數與美元並不成正比,token 軸會漏掉大部分支出。研究也指出這個軸是供哪種買方使用(在人工與代理式勞動力之間做選擇的實驗室,只有美元能用來衡量價格),並展示其好處:美元軸上可以畫出第二條、人工曲線,token 軸則不行。但仍有兩方面待解——此結果只適用一類任務(實驗運算負荷沉重、具長時間跨度的最佳化;聊天或單次執行的基準測試可能呈現相反比例),而美元軸雖然帶來可比性,代價是引入工資假設和評估者自身 harness 的效率。2026-09-21 以第二類任務和第二種買方延伸,兩者都選擇美元:Announcing FrontierMath Erdős(empirical)以每題美元成本計價,評估開放研究數學基準測試——每次嘗試 300 美元、每題解答成本介於 47 至 1,384 美元、68 題執行約 20,000 美元,對照之下非規範的逐步增加預算方案超過 220,000 美元——而且完全沒有回報 token 數。此處提到的買方,不是在人工與代理式勞動力之間做選擇的實驗室,而是決定是否讓模型嘗試尚未解決問題的人;對這類買方而言,解出一題的價格就是問題的全部。這份資料增加了兩點,而非重述舊說。第一,沿著實驗運算軸來看,這類任務與 METR 的情況恰好相反:沒有訓練執行,也沒有 GPU 實驗,幾乎全是推論,但仍選擇美元軸——這削弱了「只有因為實驗運算占主導地位,美元才勝出」這種解讀。第二,它從另一面凸顯這項選擇的代價:沒有 token 數,這裡無法區分每 token 成本下降的模型與推理能力提升的模型;2026 年 9 月以 300 美元達到的 3%,也無法與一年後以 300 美元達到的 3%相比。這就是純美元軸長期面對的反對理由,現在它以具日期的實際產物呈現,而非只是疑慮。2026-09-21 以鏡像案例延伸;這個案例除了美元以外,每種軸都採用(On the Navier–Stokes Millennium Prize Problem,vendor-claim):OpenAI 回報其 Navier–Stokes 專案使用的代理程式數、時數、代理程式間訊息和輸出 token 數(問題本身約 10,000/88/270 萬/約 1,300 億;整個專案則為 490 萬/約 3,000 億),但完全沒有提到美元金額。這兩者並列才最有參考價值。Epoch 的美元能跨供應商比較,卻會隨價目表改變;OpenAI 的 tokens 和訊息不會過時,但先天無法比較——模型尚未發布,所以不存在每 token 價格,第三方也無法換算。因此,如今「哪個軸」的誠實答案顯然取決於誰能在各軸之間換算:美元軸以價格公開為前提,token 軸以模型資訊已知為前提,而第一方回報內部系統時兩項條件皆不成立。這也新增了原問題未涵蓋的單位——代理程式間訊息,一種通訊量軸,在單一代理程式預算中找不到對應指標,現有資料集也沒有方法為它估價。
  • 以運算量控制的評估制度,會不會讓有能力負擔完整曲線的前沿實驗室,勝過負擔不起的學界和第三方評估者?進一步聚焦(2026-07):政府評估單位(AISI)確實執行了完整曲線——因此資金充足的公共機構負擔得起——但 AISI 自己也指出,「資訊量最高的評估可能很昂貴」,並正研究如何從低成本執行預測高預算下的表現,正是為了減輕這項成本。對有經費的第三方來說,成本仍是主要限制,只是還不至於使其無法執行。從相鄰軸得到部分解答(2026-07):BenchPress顯示,基準測試數量軸上類似的成本問題大致可解決——只需約五項探測,就能以約 3.93 分的誤差還原某模型完整的 133 項基準測試成績表——但這只是減少需要執行哪些基準測試,並未降低本問題所問的每項基準測試運算量,因此它減輕評估成本的軸向與本問題不同。部分解答(2026-08-14)——本問題等待的可負擔性研究已發布,而且結果有利大型評估者。同一評估單位發布了 [[raw/optstop-bayesian-optimal-stopping-llm-evaluations|optstop]](Pilditch,arXiv 2608.14425,empirical),這是一套開放原始碼的自適應停止框架,在九格驗證矩陣中減少了57.2–97.3% 的預定試驗(平均 81.1%),合併截斷效果為 +0.0003(97% HDI [−0.002, +0.003],ROPE ±0.02)。因此,第三方執行曲線的成本確實在下降;在示範設定中約降至原來的五分之一,而且以公開形式發布,並未只留在內部——這不支持「前沿實驗室因此取得優勢」的假設。關鍵在於論文自己提出的條件:**節省幅度取決於原設計的過度取樣程度。**研究宣傳的是 200 個項目 × 10 個 epoch 的設計;相同框架用於更精簡的 100 個項目 × 5 個 epoch 設計,在相同門檻下可節省 59.5%;論文也承認,較精簡的設定能提前終止的空間必然較小。原本就負擔得起每項目跑 10 個 epoch 的評估者可節省 81%;而本問題所擔心的那一方——本來就採取精簡執行方式的評估者——節省幅度明顯較小;至於在代理式任務上只執行 1–3 個 epoch 的情況,則尚未測試。成本減輕確實存在,但最受惠的是最不需要減輕成本的一方。以運算預算軸本身來說,問題依然未解;本問題最初提及的預測研究仍未發表。
  • Gemma 4 在長上下文表格中控制運算量,卻沒有在主打表格中控制,而且沒有加以說明。不完整的控制會比完全不控制更糟嗎——會不會讓未控制的表格借用其公信力?
  • 有價格列、卻沒有 token 數的表格,是否比完全沒有成本資訊的表格更容易誤導?可以直接證偽:在一項代理式基準測試上執行 DeepMind 表格中的四個模型,記錄每項任務的 token 數,再檢查價格所暗示的成本排名是否依然成立。從語音領域得到部分解答(2026-09-21),但它只補上其中一半,另一半仍缺失。Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(Google,vendor-claim)重現了 Artificial Analysis 的圖表,標題為 Cost per Hour of Input Audio,資料取自 Big Bench Audio 子集——這是特定工作負載下實際發生的成本,而不是費率:Gemini 3.8 Live 為 0.84 美元,Gemini 3.1 Flash Live minimal 為 1.50 美元/high 為 1.75 美元,Gemini 3.8 Live Extended Thinking 為 3.50 美元,Grok Voice Think Fast 2.0 為 4.80 美元,GPT-Live-1 Astra 為 5.83 美元。這正是本問題要求的實際資料,由第三方而非供應商產生;而發布「有價格列、沒有 token 數」表格的,也正是重現這張圖表的同一間實驗室。它仍未能解決問題,有兩個原因。分母是一小時輸入音訊,由使用者固定,不是任務也不是 token——因此價格暗示的排名是根據時長基準來檢驗;這對對話式產品容易理解,對本項目所指的代理式基準測試卻毫無意義。分子也沒有揭露:沒有資料說明後端 tokens、輸出音訊或思考時間是否計入其中,而且圖表上的方法註腳指向供應商自己的頁面,而非評估者的資料。儘管如此,一般性的教訓仍值得保留:只要註明工作負載,成本欄就能接受查核;供應商選擇哪種分母軸,本身也是一項揭露決策。這對本頁的主題也有參考價值——該篇文章四張圖表中的每根長條都明確標示了推理強度(High/Medium/Minimal),提供的運算量揭露比多數跨供應商表格都完整;但自家模型以 High 強度呈現,競品卻以 Medium 呈現,沒有任何解釋,這正是本頁要探討的運算控制缺陷,竟出現在唯一一張有標示設定的表格裡。
  • Moonshot 表示 Fable 5 在 35% 的 SWE-Marathon 任務和 40% 的 Agents' Last Exam 任務中觸發 fallback,並遭「降級」。若在停用防護措施後重跑,排名會改變嗎?排行榜應公布有防護措施、沒有防護措施的分數,還是兩者都公布?**部分解答(2026-07-23),回答的是「應該怎麼做」;資料來自 UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities。**政府評估單位遇到這項選擇後,採用其中一種做法:評估美國閉源權重模型時「停用系統層級防護措施,以減少拒答並能測量最大能力」,並用一句話說明公開版本仍啟用這些防護措施。因此實務上的答案是:公布未受防護的分數,並加上標示——若評估目標是模型的能力上限,這做法有其合理性,但也帶有本問題預想的缺陷:比較組中的開放權重模型是以託管版本執行,並未停用防護措施,因此單一表格混用了兩種做法。至於「排名會不會改變」仍未經測量——尚無人公布同一模型在同一套評估項目上,有防護與無防護兩種分數的成對結果。

資料來源#

  • One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation — Louis Yiven Zhu(Oxford Internet Institute,唯一作者,未經同儕審查的預印本),arXiv 2608.29420,2026-08-29,25 頁,empirical。本文引用此來源討論上方的發布日期段落:§5.2(logistic 日期 R² = 0.505,相較 OLS 0.477;74.5% → 59.6% 的調整及其 [−5.3, +32.7] bootstrap 區間;14.9/24.1/16.5 個百分點的規格比較;日期與 log-compute 聯合納入後下降 9.3 個百分點)、§2(本文反轉的「以規模作為控制變項」脈絡),以及 Appendix N(固定版本快照和遭拒的 Data API 請求)。除 Table 4 外,引用皆不涉及表格;Table 4 已透過 pdftotext -layout 核對。完整分析見 Economic Benchmark Construct Validity

  • Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations — Toby D. Pilditch(UK AI Security Institute),Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations,arXiv 2608.14425,2026-08-14(empirical,32 頁)。本文僅引用其區分:在固定預算下提前截斷取樣,與預測未實際付費的預算下模型表現,是兩回事;另引用 §3.1 的效率數據和 Table 4 中較精簡的設計比較(100 個項目 × 5 個 epoch 節省 59.5%,相較之下 200 個 × 10 個節省 81.1%),用於上方的開放問題註記。作者使用自己的工具,隸屬自己的機構,也僅有一種實驗設定。完整分析見 Adaptive Stopping in Evaluation Sampling

  • Noam Brown – Agent swarms, alignment, & recursive self-improvement — Noam Brown(OpenAI)與 Dwarkesh Patel,Dwarkesh Podcast,2026-09-17(practitioner-opinion)。僅引用 §00:00:00:5.6 Ultra Mode 的 1/4/16 張圖(四個代理程式「快兩倍」,成本「多兩倍」)、科學研究無法推進至 10,000 的說法、未曾執行的單代理程式 Navier-Stokes 反事實,以及附有自身限制說明的 64/128/256 消融計畫。raw/ 中沒有被引用的部落格圖表,因此本文的 1/4/16 數據引自圖表的口頭描述,沒有座標軸、基準測試名稱或誤差線——這是最薄弱的規模擴張主張來源,本文如實記錄。完整分析見 Multi-Agent Collective Intelligence

  • Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks — Ludwig、Ahmad、Majumdar 與 Ginsburg(NVIDIA),Shortcutting the Fix,arXiv 2609.06780,2026-09-06(empirical,16 頁):§2.1 中成對的 vanilla/principled 提示設計(harness、模型和預算相同,只改一個段落),以及 Table 1 中五個模型 × 兩項基準測試的 Pass@1/Pass@3/利用欄位。利用率是由三個開放權重 LLM 評審以多數決判定,沒有經過人工驗證。完整分析見 Evaluation-Time Answer Leakage

  • SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents — Zheng、Shang、Jiang、Tian、Zhu、Ma、Yuan 與 Zhang(ECNU/Shanghai AI Lab/Fudan),SWE-Bench Pro Verified,arXiv 2609.08149,2026-09-08(empirical,37 頁)。本文引用其認證形式——公開的隔離程序和 Tables 5–7 的操作類別軌跡稽核——以及它揭露的未受控制條件效應規模。自行稽核,資料外洩表格僅深入檢視一個模型。完整分析見 Evaluation-Time Answer Leakage

  • Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI's Noam Brown — No Priors 訪談(2026-06-26);基準測試表格批評、刷高基準測試分數、劣質均衡論述,以及路由/共識論證(practitioner-opinion)

  • Rethinking the Evaluation of Harness Evolution for Agents — Yike Wang、Huaisheng Zhu、Zhengyu Hu 等(Allen Institute for AI/University of Washington,arXiv 2607.12227,2026-07-14,empirical):摘要中的兩項指控(回饋與推論預算配對;搜尋與評估共用一項基準測試)、§3 的統一預算形式、§4.2–4.3 的 Tables 1–2 和 pass@1 對 pass@5 診斷、§4.4 的 Table 3 保留測試集劃分,以及 §5.2 對 Terminal-Bench 可能缺乏公平測試所需能力餘裕和 harness 敏感度的承認。Tables 1–3 在匯入時已直接對照 PDF 精確核對(未折疊、未位移);Figure 1 重現 Table 1 的平均值。完整分析見 Agent-Authored Harness Optimization

  • DarwinX: Evolving Agent Harnesses Through Natural Selection — Zhang、Dai、Tan、Yang 等(Salesforce AI Research/Agentforce,arXiv 2608.07545,2026-07-31,empirical,33 頁):§4 與 Table 2 中 Terminal-Bench 2.1 排行榜資料列及其 Model / effort 欄;§4.1 自述的「effort-controlled comparison」和 Figure 5 實測的每任務運算量中位數;§3.2 論文自身承認排行榜資料列「提供脈絡,而非受控比較」;§9 指出「推論強度 [未] 獨立隨機化」;Appendix B 的 Table 8 列出各基準測試的規範,卻沒有運算欄。文件任何地方都未定義強度等級,也未列出美元成本;匯入時已查閱全文及附錄核實。Tables 1–5 已逐格對照 pdftotext -layout 核對(乾淨:未折疊、未位移、標題均位於上方);canary-recall 20/20,recall 1.00。Figure 5 依照兩階段圖像規則查閱,提供了原文未提及、已解決的 token 中位數(125K → 172K)。利益衝突:Salesforce 評估自家專有代理程式。完整分析見 Agent-Authored Harness Optimization

  • Gemma 4 Technical Report — Table 5(跨世代的 thinking 與 non-thinking 比較)、Table 9(受控長上下文比較)、Table 6(視覺能力重現的混淆因素)(empirical)

  • More compute, more capability: Why AI agent evaluations need to account for test-time compute — UK AISI(2026-07-02,empirical):「回報能力曲線」;多預算評估、可靠度/預算下可達程度,以及作為採行做法的「最低資訊量預算」

  • UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities — UK AISI/US CAISI,2026-07-23(empirical,政府聯合評估):同一評估者揭露的最低限度——文件中代稱「Top U.S. Models」的比較模型,涵蓋所有美國數據(76.2%、20/41、步驟 28.5);Figure 2 以未標示的美國總體趨勢線對照十個具名 PRC 模型;「100M-token 限額」未說明單一任務或單次嘗試的單位;以及「Detailed Results」以一句話說明停用防護措施的做法。三張圖表皆依兩階段圖像規則查閱;Figure 2 沒有標示數據,只能根據格線估讀,無法讀取任何精確數值

  • Inkling: Our Open-Weights Model — 強度掃描圖:供應商公布自家能力曲線,並與競品預設操作點比較(vendor-claim)

  • Gemini 3.5 Flash-Lite Model Card — Google DeepMind,2026-07-21(vendor-claim):2026 年 7 月評估表格中,四個模型的前兩列是每百萬 input/output 的美元價格;全文沒有 token 數或強度設定;跨供應商比較模型則為 GPT-5.4 mini/Claude Haiku 4.5

  • On the Navier–Stokes Millennium Prize Problem — OpenAI(無署名),"On the Navier–Stokes Millennium Prize Problem",openai.com,2026-09-08,2026-09-10 更新,約 1,900 字,vendor-claim。本文僅引用其預算揭露:Navier–Stokes 問題上約有 10,000 個並行代理程式、88 小時、270 萬則訊息和約 1,300 億個輸出 tokens;所有問題合計 490 萬則訊息和約 3,000 億個輸出 tokens;另包括約 100 個代理程式/約 50 小時的 Euler 設定,以及執行期間更換模型的情況。**文章全篇沒有美元金額,而模型也尚未發布,因此第三方無法把其單位換算成其他人的單位。**第一方描述自家系統,內容有爭議,尚未驗證。完整分析見 The Navier–Stokes AI Claim

  • Announcing FrontierMath Erdős — Adamczewski 與 Burnham(Epoch AI),2026-09-01(empirical,網路文章,約 2,250 字):將 300 美元/72 小時/每題僅嘗試一次的規範定義為分數,而非揭露項目;五個模型的分數表格;以及已公布但不具資格的非規範成本階梯(花費 >220,000 美元解出 68 題中的 5 題,對照之下約 20,000 美元解出 68 題中的 2 題;每題解答成本介於 47 至 1,384 美元)。**限制:**唯一非零分數來自尚未發布、Epoch 以外無人能重新執行的 GPT-6 Astra;完全沒有 token 數,因此此處的美元軸不可換算;評分執行中每題只嘗試一次,因此 2/68 與 0/68 之差來自兩個事件。完整分析見 FrontierMath Erdős Benchmark

  • Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT — Cunningham、Shetty、Cheng 與 Rush(METR,2026-07-21,empirical):「以金錢還是時間校準」一節,以及實測代理程式軌跡中實驗運算占比為 70–90% 的結果——這是資料集首次提出並測量「應採用哪個 x 軸」的答案,並以疊加人工曲線將預算軸轉化為比較工具。完整分析見 Expenditure Horizon

  • Kimi K3 Model Card — §3 註腳 1–4(2026-07-26,vendor-claim):各基準測試對應的 harness 組合、具名推理強度設定、經 H20 重新校準的 SWE-Marathon 分支、73.7 對 72.9 的跨 harness 揭露、BrowseComp 在 300K 壓縮前後的結果,以及 Fable 5、GPT-5.6 Sol 和 GPT-5.5 的 fallback/拒答比例

  • OEIS Open: How many conjectures can language models turn into theorems? — Tom Adamczewski(Epoch AI),arXiv 2608.11941,2026-08-12,27 頁,empirical。本文引用其 50/200 美元的構成性上限、Figure 2 中的支出曲線及其約每十倍增加 10 個百分點的斜率(根據圖像判讀;論文內文也敘述該斜率)、註腳 9 的每題解答成本數字,以及論文自身所述「代理程式會得知其預算」的限制。未引用任何表格資料列。完整分析見 OEIS Open Benchmark

  • HarnessTax: How Much Does the Harness Matter for Coding Agents? — Pan、Yang、Arabzadeh、Chiang、Stoica 與 Zaharia,Arena.ai 部落格,2026-09-16/18(empirical):本文引用成本與成功率表格;該表格顯示,在成功率相同時,具名 harness 未揭露的預算可令成本相差 2–5 倍。完整分析見 Harness Tax: Coding-Agent Cost Multiplies Across Harnesses While Success Barely Moves

  • How UK AISI and EvalEval Are Making Benchmark Results Reproducible — Ghosh、Chim、Joshi、Srishti、Kennedy、Solaiman(EvalEval Coalition)與 McFadyen、Tan、Coz(UK AI Security Institute),HuggingFace 部落格,2026-09-22(empirical):五項基準測試和六個模型的聯合評估卡/Every Eval Ever 發布資料;本文引用 HLE 預言機回饋軌跡數據(並附上來源自身所述、不可與標準固定預算 HLE 比較的警告),以及 Terminal-Bench 2.0 將本研究與 EEE 比較的圖表。兩項資料視覺化都是由客戶端呈現的 iframe 嵌入內容;依照原始資料自身的來源註記,在頁面載入後使用無頭瀏覽器讀取 body.innerText 並轉錄。Terminal-Bench 圖表各模型的數值無法從該次擷取還原,只有座標軸範圍和圖例文字以文字形式呈現。完整分析亦見 UK AI Security Institute

§ end
Cited by 56
Related articles
  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Measuring Beyond Accuracy Saturation

    Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…

  • Task Time-Horizon Scaling

    METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…

  • Open-Weight Elicitation Irreversibility

    A wiki-drawn synthesis of Brown and Gemma 4: if dangerous capability scales with inference budget, then an open-weight…