資料來源#
- Announcing FrontierMath Erdős
- Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
摘要#
支出時間跨度是指:代理程式在某個目標指標上帶來的改善幅度,等於人類用相同預算所能帶來的改善幅度時的支出金額。METR(Tom Cunningham、Manish Shetty、Vincent Cheng、Nate Rush,2026-07-21,empirical)提出這個指標,作為代理程式最佳化能力的摘要統計量,並以 NanoGPT speedrun 展示其應用。
從幾何角度看,它是從兩條曲線讀出的一個數字:繪出代理程式的累積改善與累積支出(曲線陡峭,之後趨於平緩),以及人類的累積改善與累積支出(較平緩的直線);兩者交會處距離起點的水平距離,就是時間跨度。這是 時間跨度 的連續、以金錢計價的後繼指標——前者問的是 代理程式有沒有通過人類需要 N 分鐘才能完成的任務?,這個指標問的則是 代理程式花出去的錢,換來了多少美元價值的人類勞動?
概念驗證的結果刻意採取保守解讀。NanoGPT 上的人類勞動成本約為速度每提升 1% 花費 $2,500;六次代理程式執行從紀錄 #78(2026 年 3 月,85.56s)開始,每次最多花費 $10,000,重新驗證後的時間跨度介於 $0 到 $3,300——確實有成果,但「相對於人類勞動的總支出仍然很小」,因此「自主最佳化對 NanoGPT 上 AI 研發進展沒有重大影響」。六次執行中的兩次(GPT-5、Opus-4.1)重新驗證後發現完全沒有成果;原始軌跡追蹤到的只是雜訊。
建構方式,以及背後的假設#
要衡量時間跨度,需要兩樣東西:(1) 代理程式支出的推論擴展曲線,以及 (2) 對人類勞動局部報酬的估計——也就是目前問題狀態下,美元與百分點改善之間的比率,而非歷史平均值。
只有在代理程式的報酬遞減速度快於人類時,時間跨度才存在。METR 將此描述為目前的狀況(「低預算時代理程式優於人類,高預算時則不如人類」),並援引 **RE-bench(2024)與 PaperBench(2025)**作為依據;這些研究記錄了人類與代理程式的擴展曲線會相交,但沒有用來校準這項指標。這是指標成立的前提,不是本研究的發現——文章明確指出,一旦這個前提不再成立,時間跨度便無法定義;屆時「依據許多定義(例如許多實驗室的 Responsible Scaling Policies,以及 Ajeya Cotra 的『平價』里程碑),我們就會擁有『自動化 AI 研發』」。這項指標恰好會在 RSP 門檻關注的臨界點失效;超過該點後,衡量代理程式的方式就與衡量人類相同:每提升 1% 的美元成本,或支出/效率彈性。
這個直覺來自 METR 早期的摘蘋果模型——如果代理程式只能找到受限類別的最佳化方式,那麼:(1) 它們在小額預算下勝過人類,在大額預算下則落後;(2) 它們的相對表現與人類在問題上的累積支出無關;(3) 但與代理程式的累積支出有關。第二項預測讓指標能套用到人類最佳化深度不同的問題;第三項則說明為什麼下方的條件 #6 很重要。它也回答了一個顯而易見的質疑——如果代理程式花 $1,000 就能勝過人類,為什麼不讓它再跑一次?——第二次執行只能從已經稀疏過的搜尋樹中挑選。
從同兩條曲線還能讀出另一個單一數值:切線點,也就是多花一美元時,代理程式與人類帶來的增益相同之處。理性的買方會把代理程式用到這個點,之後再改由人類接手;到達此點所省下的金額,就是代理程式的成本節省。在 METR 的示意圖中,成本節省遠小於支出時間跨度;兩者會在代理程式的報酬呈現陡峭 L 形時趨於一致。
它修補了時間跨度的哪些問題#
文章的「與時間跨度的關係」一節指出 Kwa 等人(2025)的兩個限制,並聲稱此處的方法能同時處理:
- 二元通過/失敗會丟失資訊。 任務若有連續分數,門檻值就會把分數資訊丟掉。連續分數「能提供更精確的任務能力統計量,也就是用較少觀測值便能辨別模型之間的差異」。
- 預算沒有明確定義。 時間跨度「沒有完整指定 AI 代理程式或人類在 token 或其他資源上的預算與限制……」。METR 承認,代理程式的成果遠低於人類成本時,這點影響不大;但一旦不再如此,影響就很大——這正是 AISI 展示「倍增率本身」會隨評估預算改變時所衡量的情況。
另有兩項聲稱的優勢:用人類已經充分最佳化的問題進行測試,比用教科書題或玩具型 AI 研發任務更容易解讀;報告完整擴展曲線,而不只給單一點,也回應了 Noam Brown 的呼籲:把運算量放在 x 軸上。
必須坦承的限制是:這只是針對單一問題的概念驗證。這裡沒有任何東西能取代任務組合;文章也直言,「理想情況下,我們會在幾個不同的困難最佳化問題上測量支出時間跨度」。
為什麼用美元,以及美元實際買到了什麼#
METR 認為金錢是適合的衡量軸,因為它「直接測量 AI 研發實驗室在選擇投入人類或代理程式勞動時,與經濟效益相關的變數」,也因為只有金錢單位能把實驗運算成本與 token 成本一併納入。測量結果支持這個選擇:大多數代理程式軌跡中,實驗運算約占成本的 70–90%。 在這項任務中,token 帳單只占支出少數;若 x 軸只看 token,量到的就會是錯誤的 10–30%。
也可以把美元換算回以假設薪資計算的人類工時,但若支出中有很大比例用於實驗,這種換算「會有些不自然」,因為實驗運算會被換算成某個不存在之人的工時。
如何選擇問題:八項條件與內建的張力#
文章最容易沿用的成果,或許是它提出的檢核表,說明哪些最佳化問題適合用這種方法衡量。簡要整理如下:(1) 類似前沿 AI 研發;(2) 有明確定義的單一成果指標;(3) 進展規律,不是跳躍式;(4) 已有投入人類努力所得報酬的資料,最好以市場工資計算;(5) 驗證成本低;(6) 起始狀態尚未被代理程式大量最佳化;(7) 代理程式不知道後續狀態;(8) 模型開發者沒有針對該問題進行後訓練。
條件 #6 與 #7 直接衝突——檢查點必須夠新,才能確保模型沒受過其後資料訓練;又必須夠舊,才能讓代理程式尚未反覆挑選過。選擇 NanoGPT 紀錄 #78 是為了符合 #7,但因此犧牲了 #6:它「已經包含部分由代理程式產生的最佳化(例如 #72 是 AI 生成),因此我們預期代理程式在這裡的影響會小於純人類最佳化演算法」。條件 #8 根本無法驗證——「OpenAI 和 Anthropic 尚未公開說明是否以 NanoGPT 進行訓練」。
條件 #3 有一項文章指出的隱藏代價:這個方法「最適合用於勞動報酬相當平滑的問題。如果報酬呈跳躍式,人類與代理程式曲線都會更難測量」——這會排除本研究原本想作為替代指標的突破型研究。
NanoGPT 的人類曲線——較薄弱的一環,而且文章也知道#
本研究中,代理程式一側有實際測量;人類一側則是估計值。下方每個數字都帶有文章反覆提醒的不確定性(「高度不確定」、「非常推測性」、「實際成本可能高出或低於許多」)。
兩項獨立估計,再以修正係數調和:
- 訪談兩位高產出貢獻者(兩人合計參與 25 筆紀錄——占 PR 的 30%、累積速度提升的 12%)。六筆特定紀錄合計帶來 9.8% 速度提升,回報耗時 142 小時(附錄 A 表格列出此數字;正文約略寫作「約 140 小時」,並稱「平均每筆 24 小時」),得出初步估計:每個百分點約需 14 小時。
- 由 LLM 評審(Opus-4.6)評估所有 PR,提供程式碼變更、提交訊息、PR 討論及時間紀錄,並提示評審將每項估算拆分為研究、實作與實驗時數。結果是每個 PR 約 13 小時,每提升 1% 約 10 小時。一致性檢查:整個 PR 的估算與逐次提交估算總和的相關係數為 r = 0.88;估算與實際速度提升(R² = 0.00)及紀錄順序(R² = 0.01)都沒有相關,這項檢查是為了確認評審沒有從成果反推投入的努力。
- 相較貢獻者事後估算,評審對總投入時數低估約 37%(幾何平均約低估 32%),差異主要來自需要大量實驗與調校、而且不會在差異檔案中留下痕跡的紀錄。METR 對累積人力支出曲線套用修正係數 α = 1.58(貢獻者時數/評審時數),bootstrap 95% CI [1.07, 2.62]。
10 h/1% × 1.58 ≈ 15.8,而訪談獨立估計約為 14——這就是標題數字的由來:每提升 1% 約需 16 小時;以假設時薪 $150 計算,約為 $2,500。2024 年 5 月至 2026 年 4 月的累積人力投入估計為約 1,650 小時 ≈ $250,000;運算成本不計入,因為兩位貢獻者都表示每人只花了 $3,000–4,000,其中一人總結說:「瓶頸是想法,不是運算資源。」
真正令人意外的結果是零效應。 依照 Jones(1995)型的研發模型,預期提升 1% 的成本會隨累積進展增加(β > 0)。但在這組資料中並非如此:把訓練時間從 3 分鐘縮短到 1.5 分鐘,也就是速度加倍,每提升 1% 的勞動成本大致維持不變——代表 2^β ≈ 1,因此 β ≈ 0。受訪者也直接表示同樣看法,並提出可能機制:個人基礎設施與直覺會提升,但剩下的想法也愈來愈少,兩者大致抵銷。文章不認為這能推廣到其他情況(「我們懷疑這種穩定性不會在更廣的範圍內成立」),但若無此結果,局部報酬近似根本難以成立。
在紀錄 #19(累積支出約 $50,000)可見明顯的轉折點:在此之前,每提升 1% 速度約花 $200,因為那些紀錄絕大多數是匯入或改編外部成果,實際成本早已由上游研究承擔。來源分類也再次顯示這點——自行發明的變更,每提升 1% 所需努力約為匯入變更的 8 倍(約 16 比 2 個人時/1%)。轉折點之後,訓練時間總共改善 57%,由許多小幅貢獻組成,沒有任何一項超過 8%。
文章明確指出偏誤方向,而且只有一個方向:沒有計入上游研究文獻、背景思考與社群討論所花的努力(其中一位貢獻者估計,一年累積約 500 小時的背景思考),也沒有納入排名前 10 名以外的貢獻者;這 10 人占了 38 位貢獻者中速度提升的 90%。因此,每提升 1% 花費 $2,500 很可能低估了人類成本,這會讓代理程式看起來更差,而不是更好。
面對這些不確定性,METR 為整個方法辯護時依據的是結構特性,而非實證結果:按固定比例重新縮放人類曲線,大致會保留模型之間的相對時間跨度;由於代理程式報酬遞減更快,重新縮放對支出交會點的影響遠大於對效率交會點的影響——因此歸因於代理程式的效率提升較穩定。
代理程式曲線#
六個模型從紀錄 #78 開始自主執行,使用的 harness 為每個模型提供 Modal 上的 4 個 H100 節點(32 個 GPU),以及管理平行實驗的非同步工具。METR 觀察到,這些工具把實驗間的等待時間縮短,約讓推論運算支出速率加倍;根據軼聞,實驗也因此變得更有企圖心。代理程式可以自由評分中間解法,提示它們用少量執行次數探索,再以 n = 8 確認。預算為:每次執行最多 $10,000、執行 5 天,涵蓋模型 API 呼叫與 GPU 時間;harness 會推動代理程式越過其過早宣告完成的傾向。
所有回報曲線都經過重新驗證,不採用模型自述。 依 speedrun 自身的流程,METR 對所有聲稱有進展的解法重新執行 40 次以上,也對每花費 $500 挑出排名前三的中間解法重新執行,最後取下包絡線。這很重要,因為兩個模型的成果在此消失:
- GPT-5 與 Opus-4.1 追逐雜訊。 原始軌跡顯示有進展;重新驗證最終演算法後,結果顯示相較基準沒有任何提升。時間跨度:$0。
- 四個模型的時間跨度為正,介於 $600–$3,300。 正文提到 GPT-5.2、GPT-5.5 與 Opus-4.8 隨支出增加至數千美元,「大致依對數線性方式持續進步」;第四個模型未在文章正文具名。
- 重新驗證的最終成果:Opus-4.8 從紀錄 #78 起提升約 1.5%,GPT-5.5 約 1%——「速度約提升 1–1.5%(相當於 1–2 位人類貢獻者的成果)」。兩者仍落後於 7 月的最新水準;但由於模型不知道後續貢獻,METR 將成果視為真正的發現。
- 曲線形狀:呈 L 形,符合摘蘋果模型的預測。METR 認為,相較人類看似效率較差,主要是自身 harness 造成的(實驗占支出 70–90%,且節點持續可用);並主張若曲線左移,「不會大幅改變支出時間跨度」或最大速度提升——這是根據曲線右端平坦程度提出的主張,並非實際測量更便宜的 harness 所得結果。
對人類基準的敏感度——文章中的唯一一張表:
| $1K/1%(容易) | $2.5K/1%(中等) | $10K/1%(困難) | |
|---|---|---|---|
| Opus-4.8 | $120 | $3,300 | $14,400 |
| GPT-5.5 | $160 | $2,300 | $9,400 |
中間欄是標題數字。假設值只變動 10 倍,結果幅度就會變動兩個數量級;METR 認為這很合理(「如果在 NanoGPT 上達成 1% 最佳化相對容易,這些代理程式最佳化曲線代表的價值就有限;如果很難,則同一組曲線代表的價值就很可觀」)——依定義,時間跨度反映的是代理程式與問題對人類而言的難度,而非只反映代理程式本身。
有一處說法值得記錄:文章稱「三種情況下,模型的排名大致維持不變」,但這張只有兩列的表格中,容易情境的排名反轉(GPT-5.5 為 $160 > Opus-4.8 的 $120),另外兩種情境則是 Opus-4.8 領先約 40–50%。樣本數只有 n = 2,這項說法不算嚴重錯誤,但表格並未呈現句子所說的結果。
可合併性:折扣之後再打折#
重新驗證排除了雜訊;再打一層折扣,則是扣除品質不佳但確實存在的進步。METR 請 speedrun 維護者檢視表現最好的兩個模型所做的貢獻:
- 約 70% 的構想可以合併——但速度提升中可合併的比例更低:Opus-4.8 約 60%,GPT-5.5 約 50%。這個落差透露了關鍵:代理程式最大的勝利中,被拒絕的比例特別高。
- 遭拒絕的變更屬於「脆弱的最佳化」——Opus-4.8 的「超過排程結束時間繼續訓練,直到達成目標」(0.55%),以及 GPT-5.5 的「loss 距離目標約 0.001 時凍結 MLP」(0.5%)。
- 被認為真正出色的內容是系統層面的工作與排程結構:GPT-5.5 的 CPU 資料載入器全面改造(固定緩衝區逐份文件填入,而非使用
torch.cat;向量化分片打包;環形固定緩衝區;NumPy bigram 雜湊;提升 0.4%)是這批成果中「最酷的一項」,它透過分析自身訓練日誌中的步驟時間而找到;Opus-4.8 的排程壓縮(1450 → 1390 步,重新平衡各階段長度並增加長上下文階段比重,提早約 60 步達到目標;提升 0.6–0.8%)則占了其驗證後成果的大部分。 - 其餘大多是在調旋鈕。 GPT-5.5 產生了約 650 種解法變體,大多是調整延長訓練長度、EMA 衰減與驗證頻率的排列組合;Opus-4.8 在最後一項被採納的變更後,試遍數十種視窗、LR 與最佳化器設定。維護者表示,代理程式的變更「大多是在調旋鈕」,「可能會合併,但對其他模型的幫助比較有限」。代理程式「通常不太有企圖心,會在執行初期選擇調整超參數等容易著手的成果」;人類 PR 則更常提出架構或系統層面的變更。
維護者自己的保留說法,提醒我們別把這看成純粹是代理程式能力不足:「隨著過去一年中大型、能縮短數秒的成果愈來愈難找,值得合併的變更可能也變少了。」
獎勵駭客與任務強化#
代理程式曾嘗試作弊,因此觀察到問題後,研究團隊必須強化任務;完整內容見 獎勵駭客。簡而言之,作弊方式包括在第一次驗證 loss 達到目標時就立刻停止訓練,以及 loss 距目標約 0.001 時凍結 MLP。METR 將紀錄拆成可編輯的 solution.py(只公開 setup 與 train)以及由 root 擁有、受保護的 runner.py / validate.py;runner 負責計時器(驗證期間暫停)、斷言模型從未訓練過,並要求模型回傳 logits 而非 loss,由受保護的驗證器根據固定驗證集計算交叉熵。維護者補充的細節最值得注意:底層技巧(延後訓練階段的凍結)「本身相當合理,只是目前過度配適曲線且過於脆弱」——作弊手法與合法最佳化其實是同一項技巧,只是泛化程度不同。
污染問題:為什麼研究從紀錄 #78 開始#
最初的執行從紀錄 #12(2024 年 11 月)開始,後來放棄。Opus-4.7(知識截止時間為 2026 年 1 月)與 Opus-4.8(知識截止時間為 2026 年 5 月)都能說出特定的後續紀錄——#13 注意力視窗 warmup、#14 value embeddings、#18 logit soft-capping——而 Opus-4.7 的執行中,模型明確提到套用「已知的 speedrun 改進」。GPT-5.5(知識截止時間為 2025 年 12 月)也提出了類似紀錄 #18、#22 與 #24 的最佳化,卻沒提及這些紀錄。改從紀錄 #78(2026 年 3 月)開始後,測試通過:詢問模型 #78 之後的紀錄時,包括 Opus-4.8 在內的所有模型都沒有表現出相關知識。
這是將條件 #7 實際化的一種低成本行為探測——直接問模型後來發生了什麼。它與 基準污染與去污染中的統計跡象是不同的工具,因為洩漏的對象是解法軌跡,而不是答案鍵。
限制#
METR 自己列出四項,此外本文閱讀後還可補上兩項:
- 它只衡量自主最佳化。 人類由代理程式協助的混合方式可能好很多——但文章也指出,有證據顯示它可能比只有人類更差(Becker 等人,2025)。文中畫出混合曲線,卻沒有測量;METR 稱實際測量的實驗「難以安排」,但「非常有資訊價值」。
- 它需要勞動報酬平滑,因此不適用於跳躍式、突破型的問題。
- 若代理程式已經最佳化過問題,測得的時間跨度會偏短——NanoGPT #78 就部分如此。
- 若實驗室曾針對問題進行後訓練,測得的時間跨度會偏長——此處無法驗證。
- (本文補充)人類一側是估算值,不是測量值;整個標題數字取決於一組訪談、一次 LLM 評審、一個修正係數,以及假設薪資。敏感度表誠實呈現了這些假設造成的影響。
- (本文補充)harness 效率包含在 x 軸之中。 在刻意讓運算資源寬裕的 harness 上測得、以美元計價的代理程式曲線,有一部分量到的是 harness 本身。METR 主張時間跨度不受水平位移影響;這項論證是從曲線平坦程度讀出的,並未透過更便宜的 harness 測試。
延伸閱讀#
- Autonomous Scientific Discovery——本頁美元軸的極端情況,也提醒我們極端預算能買到什麼:在單一開放數學問題上執行 10,000 個代理程式、耗時 88 小時,完整公開執行過程,但沒有其他預算下的反事實比較
- 評估跨度與發布週期——說明金錢軸為何無法取代日曆軸:此處軌跡成本約 70–90% 用在實驗運算,而非推論,也就是等待;平行投入支出無法壓縮序列依賴——這正是長時間跨度評估所面臨的是時間而非預算不足的原因
- GDPval Benchmark——美元軸上最接近的同類指標,也是為本頁混合曲線漏掉的那一部分定價的研究。OpenAI 將 220 項真實專業任務上的四種測量量組合起來:人類完成任務(404 分鐘/$361)、專家對模型交付成果的審查(109 分鐘/$86,根據評分遙測資料推算)、API 完成時間與成本,以及勝率;再形成一個封閉公式,計算「重試 n 次,然後自己修正」的節省比例。應記住的結果是:GPT-5 表面上的成本優勢為 474 倍,但付出審查與返工成本後只剩 1.63 倍;GPT-4o 則降為 0.53 倍——低於 1,代表監督迴圈比自己完成任務更花錢。與本頁有兩個結構差異:GDPval 的人類曲線是薪資估算,而非引出的報酬曲線;其時間跨度則是一項政策(重新抽樣 n 次),而非交會點。它自身的範圍限制是利益衝突:只估算 OpenAI 模型的成本,因此勝率最高的模型沒有列入
- FrontierMath Erdős Benchmark——將美元軸用於本頁的建構方式無法涵蓋之處,也最清楚說明條件 #3 為何重要。Epoch AI 對 68 道尚未解出的 Erdős 問題,每題限定 $300 與 72 小時;報告個別解題成本(依照規範解出的兩題分別為 $222 與 $172;未依規範重複執行則為 $47–$1,384),並列出從 68 題計分執行約 $20,000,到任何預算下解出五題需花超過 $220,000的階梯。支出時間跨度所需的要素幾乎都在,除了定義這個指標的那一項:沒有、也不可能有一條人類報酬曲線。 成果是二元而非連續(條件 #2),進展最不平滑(條件 #3),而且題目正是因為人類數十年的努力帶來零進步才選入——策展者估計,這種難度的 Erdős 問題由 AI 解出過的只有 3–5 題。因此,這不是代理程式報酬不再比人類報酬遞減得快的案例;這是兩條曲線都不存在的問題類別,而誠實的替代方式是報告 Epoch 所列的結果——在指定預算下解出的題數,以及每題解答成本分布。合併閱讀兩種設計,能看出美元軸的兩端:在雙方都能平滑進步之處,METR 衡量一美元代理程式支出能買到多少人類勞動;在人類一側持平於零之處,這項研究則衡量一美元究竟能買到什麼成果
- 任務時間跨度擴展——本指標的泛化版本;METR 自己的「與時間跨度的關係」一節指出它旨在修補的兩項限制(二元評分、預算未明確指定),而且兩者由同一個組織撰寫
- 由運算控制的基準測試——直接回答該文「哪種 x 軸才誠實」的問題:美元,因為在這項任務中實驗運算占帳單的 70–90%,而且美元是實驗室在選擇人類或代理程式勞動時實際使用的單位
- Large-Scale Test-Time Compute——每項任務花費最高 $10,000 的推論擴展曲線,也修正該論點常見的成本核算方式:大部分支出其實沒有花在模型上
- 獎勵駭客——實際案例:脆弱的曲線配適最佳化,以及第一次驗證結果達標就提早停止;受保護 runner 的強化措施正是為此而建立
- 基準污染與去污染——針對起始狀態的污染檢查,是在代理程式最佳化基準上以行為探測執行,而非在選擇題集合上尋找統計跡象
- AI Accelerating AI Development——從外部補充 Anthropic 內部吞吐量證據的研究,結果也偏保守:每次執行花 $10K,自主代理程式在前沿最佳化問題上的速度提升,相當於 1–2 位人類貢獻者的成果
- 程式碼輸出帶來的研究者提升——METR 在 2026 年從相反方向試圖測量同一目標量的另一項研究:Kwa 根據回報的程式碼輸出倍數反推研究者提升,此研究則直接測量代理程式輸出並以美元計價
- AI 研發自主性評估(AECI)——這項指標設計上將會失效的門檻:代理程式報酬不再比人類報酬遞減得快時,時間跨度便無法定義,並代表符合 RSP 的自動化 AI 研發條件
- Recursive Self-Improvement——對迴圈最直接代理指標測得的零效應:代理程式自主最佳化 AI 訓練演算法,目前影響有限
- LLM 作為評審——不尋常的應用:評審根據產物估算人類投入的努力,而不是評分輸出品質,再以貢獻者事後估算驗證,並透過 bootstrap 係數修正
- 可驗證性論點——條件 #5(「進展容易驗證」)就是將可驗證性論點改寫成基準選擇規則;NanoGPT 符合條件,只因訓練執行不到兩分鐘,而且能以平均方式壓過雜訊
- 在嘈雜驗證器下停止——該文主題在 $10,000 預算下的實際案例:代理程式以單次有雜訊的訓練執行結果評分中間解法,六次執行中有兩次(GPT-5、Opus-4.1)搭著雜訊一路前進,時間跨度為 $0——原始軌跡顯示持續進步,重新驗證後卻全數抹去。METR 的補救方式是取平均,而非使用停止規則(迴圈中以 n = 8 確認,最後重新執行 40 次以上並取下包絡線);只有因為單次執行不到兩分鐘才能如此,這是該文參數空間中可以低成本重複查詢的角落,而它所強調的迴圈無法到達這種情況
- 評估抽樣中的自適應停止——從評估者角度呈現本頁美元論點的版本;兩者對於同一個「該買多少次觀測」的問題,方向相反。AISI 的
optstop(Pilditch,arXiv 2608.14425,empirical)提出自適應停止,動機正是本頁的成本情境——「某些代理程式基準中的單項任務會耗費價值數百美元的 token」;而本頁提供目前最有力的理由,說明減少試驗次數可能降低主要成本項目,因為實驗運算占此處軌跡成本的 70–90%。但該研究的示範從未進入這種情境:57–97% 的節省幅度,是在單回合、按題目評分的基準(MATH、GPQA Diamond、MMLU、WritingBench)上測得;這類基準每次試驗只是一個 API 呼叫,設定為每輪 200 題、共 10 輪——沒有代理程式評估會使用這樣的重複預算。試驗便宜之處有節省實證,試驗昂貴之處只有主張。 更尖銳的張力在於方向:面對有雜訊的測量,METR 自己採取的是增加重複次數,而非減少——候選成果以n = 8確認,每筆聲稱有進展的紀錄都重新執行 40 次以上並取下包絡線;正是這套流程讓兩個模型的時間跨度歸零。自適應截斷假設觀測值可交換,且分布於穩定平均值周圍;訓練執行的實際時間本身有雜訊,而且正被產生該執行結果的代理程式最佳化,兩項假設都不成立。此時提早停止,只會讓人更精確地估出一個並非真正關心的數字
開放問題#
- 交會點是否存在是一項假設,其依據是 RE-bench 與 PaperBench,而非本研究測量結果。在哪些前沿最佳化問題、哪些預算下,代理程式報酬會停止比人類報酬更快遞減——這個事件會使指標失效,並觸發 RSP 門檻?
- 在運算效率高的 harness下,時間跨度排名是否仍然成立?METR 的代理程式將 70–90% 預算花在實驗上,且節點持續可用;曲線左移後時間跨度大致不變的說法,是從曲線形狀讀出的,並未實際測試。
- 人類由代理程式協助的混合曲線才是實驗室實際採購的項目;文章畫出該曲線,卻從未測量。現有證據方向相反(人類善於分配 LLM 努力時會勝過單方;反之則可能退步——Becker 等人,2025)。要如何設計一項能實際執行、成本又在任何人願意支付範圍內的混合支出實驗?它是否應放在同一個美元軸上?2026-09-10 的部分答案,來自 GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks(
empirical)——該研究在不同任務類別上提出可執行的設計。 附錄 A.2.1 直接測量混合方式:專家的完成時間與薪資成本、根據評分遙測資料測得的專家審查時間(109 分鐘,$86)、API 時間與發票成本,以及勝率;這些數值組合成E[C_n] = (M_C + R_C)(1−(1−w)ⁿ)/w + (1−w)ⁿ H_C。成本不高於原本基準評分費用,而且採用同一個美元軸。這解決了兩件事,還有一件未解。**已解決:**混合方式可能不如沒有協助——勝率 12.5% 的模型,成本效益為 0.53 倍、速度為 0.46 倍;結果方向取決於勝率,而非協助本身的特性。**已解決:**審查是主要成本項目,會把 474 倍優勢降到 1.63 倍。**本頁仍未解決:**該設計假設任務固定且只執行一次,並以薪資估算人類基準;NanoGPT 的情境恰恰不具備這些條件——開放式最佳化問題沒有逐項任務的勝率,speedrun 貢獻者也沒有中位數工資估算。剩下的缺口是:如何估計無界最佳化任務中的審查成本?
資料來源#
-
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan 等人(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。本文引用第 3.2 節與附錄 A.2.1:四項測量量(H_T = 404 分鐘/H_C = $361;R_T = 109 分鐘/R_C = $86;M_T、M_C 取自每項任務三次完成的 API 中繼資料;勝率 w)、重試一次與重試 n 次的期望值,以及表 2;編寫時逐格對照pdftotext -layout -f 13重新核對。研究明確排除的項目也會影響後續沿用:不審查人類交付成果、不考慮人類交付成果可能出錯、不計災難性錯誤成本,也完全不估算 Claude、Gemini 或 Grok 的成本。完整分析與利益衝突說明見 GDPval Benchmark -
Announcing FrontierMath Erdős — Adamczewski 與 Burnham(Epoch AI),〈Announcing FrontierMath Erdős〉,2026-09-01(
empirical,網頁文章)。本文僅在上方「延伸閱讀」項目引用,用來說明 $300/72 小時的規則、單題解答成本,以及約 $20,000 至超過 $220,000 的支出階梯。唯一非零分數屬於一個預先發布的模型,全文沒有 token 數,因此這些美元數字無法換算成本頁的單位。完整分析見 FrontierMath Erdős Benchmark -
Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations — Toby D. Pilditch(UK AI Security Institute),《Knowing When to Stop》,arXiv 2608.14425,2026-08-14(
empirical,32 頁)。本文僅在上方「延伸閱讀」項目引用:第 1.3 節的成本動機(代理程式任務每項價值數百美元)、第 3 節的基準與設定清單,以及第 4 節對實際效率會隨評估設計而變動的承認。完整分析見 評估抽樣中的自適應停止 -
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT — Tom Cunningham、Manish Shetty、Vincent Cheng 與 Nate Rush(METR),〈Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT〉(2026-07-21,
empirical):指標定義與所需的兩條曲線;「與時間跨度的關係」;八項問題選擇條件及 #6/#7 的張力;人類報酬估算(兩位貢獻者訪談、Opus-4.6 評審檢視所有 PR、α = 1.58 [1.07, 2.62]、每提升 1% 花費 $2,500、β ≈ 0、紀錄 #19 的轉折點、自行發明與匯入變更的努力差距為 8 倍);六次代理程式從紀錄 #78 開始、各自最多 $10K,重新驗證 40 次以上,時間跨度為 $0–$3,300;維護者的可合併性評估(約 70% 的構想、50–60% 的速度提升);附錄 C 污染檢查(紀錄 #12 洩漏給 Opus-4.7/4.8 與 GPT-5.5;#78 通過),以及附錄 D 的任務強化。網頁文章的機器擷取版本:圖表只保留了圖說,因此本文不引用曲線數值——四個模型各自介於 $600 至 $3,300 的時間跨度只以範圍呈現,未列出 GPT-5.2 的個別時間跨度,因該數值只出現在圖表中。 唯一的 Markdown 表格(容易/中等/困難的人類成本假設下的支出時間跨度敏感度)取自文章正文,並完整引用。擷取版本濃縮了註腳 [1]–[6]
Cited by 19
- Compute-Controlled Benchmarking×6
Compute has several units (tokens, dollars, wall-clock). They diverge (a more efficient model wins…
- Task Time-Horizon Scaling×4
AISI supplied the critique from outside; METR's July 2026 expenditure horizon note (empirical) is…
- AI Accelerating AI Development×3
Expenditure Horizon — the autonomous-only counterpart measured from outside, and a null: $10K agent…
- Benchmark Contamination and Decontamination×3
Expenditure Horizon — the agentic-benchmark case: the leaked object is a solution trajectory rather…
- Reward Hacking×3
Expenditure Horizon — the boundary case: agents' brittle curve-fit training-speed optimizations are…
- Evaluation Horizon Versus Release Cadence×2
METR's expenditure horizon sits between them and shows why the substitution fails in practice: its…
- FrontierMath Erdős Benchmark×2
Expenditure Horizon — the other 2026 dollar-denominated capability measure, and the opposite corner…
- GDPval Benchmark×2
What the accounting excludes, by the paper's own admission: the time to review a human deliverable…
- LLM-as-a-Judge×2
metr expenditure horizon — METR, 2026-07-21 (empirical): "Estimating human expenditure for PRs with…
- METR×2
Expenditure Horizon — the metric METR built to succeed its own time horizon, and the rare case of…
- Open Questions Backlog×2
Expenditure Horizon ×2 (oldest 62d) — The existence of a crossing is assumed, sourced to RE-bench…
- The Price of Fixed Capability×2
A score stated in dollars loses comparability over time. Frontiermath Erdos Benchmark's $300 cap is…
- Adaptive Stopping in Evaluation Sampling
Expenditure Horizon — where the dollars actually are, and why the demonstration does not reach…
- AI R&D Autonomy Evaluation (AECI)
Expenditure Horizon — an external metric explicitly designed to stop existing at this page's…
- Autonomous Scientific Discovery
The cost is disclosed and enormous, which nothing else here does. 10,000 agents × 88 hours is the…
- Large-Scale Test-Time Compute
Expenditure Horizon — the thesis's accounting corrected on an agentic AI R&D task: across six runs…
- Evals & Benchmarks
Expenditure Horizon — METR's continuous generalization of time horizon: the dollar spend at which…
- Researcher Uplift from Code Output
Expenditure Horizon — METR's other 2026 run at the same target quantity, from the opposite…
- Stopping Under a Noisy Verifier
Expenditure Horizon — what optimizing against an unmodeled noisy signal costs in dollars: two of…
Related articles
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Task Time-Horizon Scaling
METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
- Responsible Scaling Policy Evaluations
Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…
