資料來源#
- Claude Opus 5 System Card
- CS329A Self-Improving AI Agents — Part 1: Course Overview
- CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling
- CS329A Self-Improving AI Agents — Part 3: Robust Verification
- CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL
- Gemma 4 Technical Report
- Idea Search: Guiding Tree Search with Ideas to Explore Diverse Scientific Methods
- More compute, more capability: Why AI agent evaluations need to account for test-time compute
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- Prompting Claude Opus 5
- Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI's Noam Brown
- Rethinking the Evaluation of Harness Evolution for Agents
- Rewriting Bun in Rust
- SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery
- Verbalizable Representations Form a Global Workspace in Language Models
- What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
摘要#
測試時運算(推論時運算)是模型針對單一查詢「思考」所花費的運算量——生成的 token、支出的金額、經過的時間。Noam Brown(OpenAI 研究科學家,也是推論時擴展的先驅之一)在 2026 年 6 月的文章 Implications of Large-Scale Test-Time Compute 中主張,這個軸向已成為能力的主要決定因素:「模型的能力取決於你投入多少錢。」10 美元的預算能做到一件事;10,000 美元能做更多;1,000 萬美元還能做更多。關鍵結論是,每項評估都隱含提出的問題——這個模型有多強?——在未說明預算前並沒有明確定義(practitioner-opinion;Brown 提供的是論點與軼事,並非測量結果)。
本頁是測試時運算主題群的樞紐。核心主張在此;由此衍生的三個問題分別見其他文章:它會破壞基準測試(單一數值表格未控制運算量)、使安全評估更吃緊(危險能力也會隨預算擴展),並重塑起飛預測(對運算量的依賴使時間成為主要限制)。尚未充分探索的另一面,是已發布模型中存在的潛在能力懸置。
平台期往後移了#
「多花點運算量就好」的直覺反駁是,效能總會進入平台期——持續執行模型,直到基準測試曲線變平,再以此評估。Brown 的回答是:**如今的平台期遠在數週思考之後,實務上根本到不了。**在「GPT-3 時代」(2022),模型無法長時間有效思考,所以你可以低成本地一路執行到平台期。現代模型只要「有合理的鷹架」,在某些基準測試上就能持續進步數週才趨平。Brown 引用 AISI 的網路安全評估指出,模型在單次執行達到一億個 token時仍持續進步。因此,「評估到平台期」已不再是有明確終點的程序——你必須設定預算(token/成本/時間),或繪出整條曲線。
獨立實證佐證(UK AISI,2026 年 7 月)#
Brown 的論點屬於 practitioner-opinion——論證與軼事。UK AI Security Institute 提供了首項由獨立政府機構完成的 empirical 確認,也是上文「一億個 token 時仍持續進步」軼事背後的主要來源。該機構 2026 年 7 月的研究幾乎用相同措辭重申核心主張:「模型能力不是單一分數,而是測試時運算量上的一條曲線」——若評估停止時曲線仍在上升,報告的分數就是下界,而非上限。
「平台期往後移」的測量結果如下:
- **網路安全。**AISI 範圍較窄的網路安全任務中,約 8% 只有在每項任務預算達到 ≥10M token(部分任務高達 50M)時才解出;在較小預算下,這些成功案例無從顯現。最新模型在 100M 以上仍持續進步。
- 公開基準測試。將總 token 預算從 1M 提高到 10M,軟體工程分數提升約 25%(TerminalBench 2.0、SWE-Bench Pro),數學/學術分數提升約 22%(Humanity's Last Exam,最高至 5M token)。TerminalBench 即使在公開評估通常回報預算的 10 倍下仍持續進步。
AISI 的另外兩項發現能進一步補充下游文章,而非本頁:運算需求會隨人類任務耗時按冪律擴展(延伸至任務時間跨度擴展),而較新的模型能將額外運算量轉化為不成比例的更大增益(重塑任務時間跨度擴展上的倍增速率,以及Responsible Scaling Policy Evaluations上的危險範圍)。獨立性很重要:這個資料庫幾乎完全依據Noam Brown(OpenAI)的研究建立的論點,如今有了政府評估機構的控制式掃描作為支撐。
兩種「測試時擴展」:先談涵蓋率,再談 pass@1#
樞紐文章的框架——能力是預算的函數——掩蓋了一個區別;CS329A講師將此區別說得很清楚(第 1 講,2025-09-22,practitioner-opinion),也是區分 2024 年與 2025 年研究成果的關鍵。
- 花在模型外部的預算。對一個凍結模型反覆取樣,再由外部驗證器或選擇器從樣本中挑選。變動的指標是涵蓋率/pass@k——潛在能力懸置有 Large Language Monkeys 的數據。
- 花在模型內部的預算。o1(OpenAI,2024 年 9 月)也回報了測試時運算量對應的對數線性曲線,但指標是在 AIME 上的 pass@1,參數數量則維持不變。沒有外部機制代為挑選答案。
Aakanksha Chowdhery 說明了兩者之間的機制:基礎模型已能產生許多推理鏈,「它不太知道哪一條才正確」,訓練迴圈加入的正是這件事——「**它學會哪一條是正確的。**因此 pass@1 準確率會上升,而不是像重複取樣結果那樣看到 pass@k 或涵蓋率上升。」
這是運算量控制基準測試報告準則的訓練側說法(「只在 pass@k 上看得到的增益,是嘗試次數增加,不是能力提升」):選擇器把嘗試轉化為能力,而推理模型的後訓練會將選擇器內化。這也解釋了為何兩支研究脈絡的數字無法直接比較——一邊測量模型在協助下可能達到的程度,另一邊測量模型獨自能達到的程度。
更精確的說法:majority@K 上升,pass@K 不變#
第 6 講(CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL,2025-10-10 授課)提供測量結果,讓上段從概念框架成為有明確曲線形狀的主張。Aakanksha Chowdhery 解讀 Walking DeepSeekMath 在每題取樣 32 次的 RL 結果時指出,改善的是 majority@K——「多數解答都變正確了」——而 pass@K 沒有變化。她總結道:「模型其實變得更一致,而非在根本上更聰明。」
這比「pass@1 上升」說得更精確,也指出一個涵蓋率研究容易忽略的方向。若 pass@K 持平,RL 就沒有新增任何可達成的問題;它只是將機率質量移到凍結的基礎模型本來就能產生的答案上,也就是分布尾端的某處。對照潛在能力懸置來看,兩者正好相接:重複取樣在推論時讀取尾端的能力,而可驗證獎勵 RL 則將能力移向眾數,讓單次取樣就能找到答案。兩種操作都沒有創造能力。這堂課將此結論推廣到三種方法:它們能提升一致性、答案格式與多步驟連貫性,但「這些都還無法提升根本能力,也無法教模型解決新問題。」
有兩個原因讓這個問題尚未定論。這是單篇論文針對數學所做的消融實驗,根據自動字幕逐字稿中的投影片轉述;而且講師將「為何 pass@K 卡住」列為第一個待解問題,而非已知結果。其次,這是對 2025 年底所教方法的主張,適用於驗證成本低廉的基準測試——在這個範圍內,運算量控制基準測試的診斷語句(「只在 pass@k 上看得到的增益,是嘗試次數增加」)反過來看:此處增益除了 pass@k 之外都看得到,這正是買到一致性而非擴展可達範圍時,排行榜呈現的樣子。機制與相關論文見群組相對策略最佳化(GRPO)及理由引導自舉(STaR)。
**「自我改進」迴圈就在此登場。**講師對推理模型重要性的詮釋,重點不在準確率曲線,而在模型能製造出的資料:在可驗證的領域(有標準答案的數學、有測試的程式碼),測試時擴展就是「大量生成合成資料」;經過驗證的軌跡成為微調資料,改進後的模型接著又能在測試時進一步擴展。「測試時擴展後再把成果帶回訓練流程,模型能變得多好是沒有上限的。」這種飛輪就是課程所定義的自我改進——見遞迴自我改進——其閘門是可驗證性,因此這個迴圈能在數學和程式碼中運作,卻會在創意寫作上停滯。
講師也誠實保留了這項觀察,值得記下:增益究竟來自 RL 還是多樣化的預訓練資料,「沒有單一共識點」;「兩種流程都有幫助」;而整個迴圈「還沒有完全理解——這是最初的生命跡象」。
**一個有日期的缺口,如今已補上。**2025 年底有人問,能否根據問題難度決定樣本數;兩位講師都說當時沒有已發表的研究做到這點,只有獎勵模型引導的後續取樣。本頁的 2026 年來源從兩個方向補上答案:邊際價值估計會在執行中依預期貢獻修剪分支;SwarmResearch的深度自適應寬度會在執行期間重新分配廣度與深度預算,並勝過所有固定配置。這個問題懸而未決約九個月。
同樣三個軸向在 2025 年底的說法#
上面兩節討論的都是 2026 年 empirical 研究,探討固定預算該如何運用。CS329A第 2 講(CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling,Azalia Mirhoseini,2025-09-26 授課,practitioner-opinion)則是早一年以教學方式呈現的相同問題,逐步講解 Snell 等人的論文 Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters。值得記錄,因為它命名了後續研究沿用的軸向術語,也因為其中兩項發現尚未被推翻。
三個旋鈕。(1)平行取樣——n 次獨立抽樣。(2)循序修訂——模型持續改進的一條鏈;在 2025 年底,仍需透過提示才能引出這種行為,現在推理模型則會在內部執行(「你看推理模型時會發現,它們現在已經受過訓練——我們在內部會看到這種行為」)。(3)如何選擇,再細分為結果獎勵模型(評分最終答案)和過程獎勵模型(評分每個步驟)。PRM 能將選擇轉化為搜尋:每個步驟取樣四個後續推理,依 PRM 分數保留前兩個,再往下擴展——由學得的步驟評分器引導束搜尋。PRM 本身是經微調的 LLM,在領域內表現最佳、具部分泛化能力,而且可直接取得。第 3 講整堂課都在討論第三個旋鈕——過程與結果獎勵模型說明 ORM/PRM 標籤的來源,以及各自帶來的效益;其中對預算運用最重要的發現是:訓練過的驗證器選擇準確率會隨樣本數增加,到約 400 個樣本後便開始下降。因此「多取樣,再讓驗證器挑」有其上限,而限制來自選擇器本身,不是涵蓋率。
**難度分組,以及仍成立的發現。**這項研究依模型自身的 pass@1,將 MATH 問題分成五個難度等級(PaLM 模型,12k 訓練/500 測試),再詢問各組最佳的循序對平行比例。簡單題適合偏重循序配置;難度提高後,最佳比例便退化成雜訊——比例「甚至會從第四組到第五組改變」,講師坦言如何最佳化地混合修訂與平行擴展「仍是開放研究」。一位學生提出符合此發現的直覺:簡單題有許多解題路徑,因此修訂其中一條即可;難題路徑少,得靠廣度才有機會找到任一條。請注意,這個方向與本頁的 2026 年來源一致——任務困難且回饋不足時,廣度勝出;但又多加了一項它們沒有測試的限定:此結論特指難題,不適用於所有問題。
**預訓練與測試時運算,以及現場提出的保留意見。**Snell 等人的核心結果是:在推論 token 與預訓練 token 比例相同時,簡單與中等難度問題上,增加測試時運算量勝過增加預訓練;最難的問題則相反,即使「測試時擴展的預算無限大」,更大的模型依然勝出。Mirhoseini 以自己實驗室的經驗支持此結果,也明確標示時間背景——「仍在進行中,而我相信截至今天仍是真實觀察」(2025 年底)。她主動提出或接受了兩項限定:
- 兩邊的成本計算不對稱,而論文的比例掩蓋了這點。一位學生指出,預訓練只需付費一次,測試時運算量則是每次查詢都要付費。她表示同意,並重新界定問題而非反駁:有趣的問題不是哪個比較便宜,而是誰有能力做到——「不是每個人都能預訓練大型模型」,因此按次付費的能力取得途徑,對那些無法走另一條路的人仍然可用。這是推論擴展帶來的分配論點,與效率論點不同;模型端的開放權重前沿差距記錄的也是同一種不對稱性。
- **難題上的例外,說的是通用模型。**有人問能否透過微調讓小模型專精於難題;她承認可以——此比較只適用於通用訓練方式,不適用於專用模型。
這是資料庫中對預訓練與推論取捨最清楚的 2025 年底說明,迄今沒有來源以匹配成本的方式測量過此取捨。上面的 AISI 掃描只測量推論端;Effective Compute Scaling則只建模預訓練端。
能力光譜:運算量何時有用、何時無用#
增加測試時運算量不一定都有效。Brown 將所有任務放在兩個極端之間:
- **平坦——事實檢索。**問 Abraham Lincoln 的出生日期;如果模型不知道,多思考一週也無濟於事(沒有外部查詢)。額外運算量幾乎沒有幫助——稍微思考有用,但很快就飽和。
- **無界——猜測並檢查式搜尋。**數獨:試填不同數字、檢查限制,再重試。只要時間足夠,任何題目都能解出,所以能力會隨測試時運算量不斷提升,沒有上限。
- **兩者之間的一切。**真實基準測試落在這條線上的某個位置,這正是控制運算量重要的原因——同一個模型會因任務在光譜上的位置而看起來平坦或無界。
AISI 研究以實證呈現這條光譜:增益最大之處,是代理程式能檢查自己的工作(程式碼、網路安全、數學——執行程式碼、測試漏洞);回饋薄弱或不存在時,增益就小——HealthBench 在每個模型的一般預算範圍內都進入平台期,這是光譜中的平坦端。其機制是驗證器:便宜的自我檢查能將額外 token 轉化為無界端的猜測並檢查式增益。
過度思考是反面案例:在約 7.7% 的標準基準測試問題中,生成更多 token 反而會損害大型模型的表現——提醒我們測試時運算量是需要妥善分配的資源,而不是單調增加的旋鈕。Brown 對使用者實務的看法是,靈活運用思考時間(該快就快,問題需要時再多花時間)勝過永遠使用最高預算,因為等待一週會讓反覆迭代變得不切實際。
廠商的預算分配建議:預設調低,而非調高#
Brown 的論點描述的是向上曲線;Opus 5隨附的部署建議,則是首個明確建議預設少花一點的廠商指南(提示指南,vendor-claim):
low和medium的「品質表現良好,所需 token 與延遲只占較高設定的一小部分」。Anthropic 建議只要品質不受影響,就大量採用這些設定,作為控制 token 成本和回應時間的主要方式;將xhigh留給要求嚴苛的程式撰寫與代理式工作——若沿用先前模型的預設設定,則應在自己的評估上重新掃描 effort 設定。- **旋鈕的最低檔勝過關閉開關。**只有在 effort 設為
high或更低時,才能停用思考;Anthropic 對停用思考後出現的產物,明確建議保留思考功能:「多數任務中,啟用思考並設定loweffort,表現勝過停用思考,成本也相近」(指令累積)。相同價格下,低預算思考勝過不思考——上方光譜的平坦端起點高於零,而非從零開始。 - **依任務類別分配,落實於實務。**程式碼審查準確率「在較低 effort 設定下仍維持,因此審查時可先快速檢視,之後再進行更全面的檢查」(審查作為控制點)——這是依任務類別調整預算、而非設定單一全域級別的明確做法。
- **旋鈕不控制輸出長度。**Effort 控制思考 token;可見回應則是另一個成本中心,只能透過提示控制(輸出長度校準)。「少花一點」有兩個旋鈕,而 effort 掃描不會發現冗長程度的退步。
結合同一模型上的 effort 反轉結果(無效的自我驗證),這項論點在部署時呈現的實際形狀是隆起曲線,而非斜坡:能力會隨預算增加,直到邊際 token 開始用於重新檢查與過度服務;除非任務另有需要,廠商自己的建議是停留在峰值以下。
鷹架拓展了時間跨度#
將「一個模型」變成「數週有效思考」的槓桿是harness。Brown 說,GPT-3 幾乎沒有可供你搭建鷹架、讓模型有效執行長達一週的空間;現代模型則能透過鷹架支援「一連串可執行數週、數月的實驗」。他對不久將來的具體主張是:給有良好鷹架的模型一個長期目標,告訴它「去做一個月」,它就會交回最先進成果。這與 METR 的時間跨度曲線從外部測量的能力相同——也說明了預算實際花在 harness 上。
但不是花在搜尋 harness 上#
首個匹配預算的測試探討邊際 token 該花在哪裡,結果有利於執行軌跡,而非鷹架。Wang、Zhu、Hu 等人(arXiv 2607.12227,Ai2/UW,2026-07-14,empirical)在 Terminal-Bench 2.1 上固定 K = 5,測試 Claude Opus 4.6、GPT-5.4 和 GPT-5.4 mini,並將相同的回饋與推論預算分配給四種方式。平行取樣——抽取五條獨立軌跡,再選出一條——是表現最穩定的組別:沒有單元測試回饋時,平均 pass@1 為 72.3,高於不採取任何措施的 68.2 基準;有回饋時則為 86.0。循序修訂的 pass@5 排名第二(91.8,為研究中最高數值)。讓元代理程式以相同預算重寫 harness,平均結果只有 67.4——低於完全不處理;其保留測試集遷移效果為 +0.6pp。
有兩項結論可推廣到受測方法之外。沒有外部正確性訊號時,深度不如廣度:循序修訂平均只增加 1.1 點,且會讓 GPT-5.4 表現下降,因為自我生成的回饋有雜訊,且每次修訂都以先前結果為條件,早期錯誤會層層累積;獨立抽樣則不會累積任何錯誤。其次,只在 pass@k 上看得到的增益,是嘗試次數增加,而不是能力提升(運算量控制基準測試)——這個診斷可以區分有效運用預算與只增加花費。Agent-Authored Harness Optimization詳述細節與相反證據。
分母:效率就是能力#
花費方式比花費總量更重要#
上文的 Wang 等人問的是預算該花在什麼對象上(軌跡或 harness)。SwarmResearch(Virk、Edds、Xia 與 Zhang,UIUC,arXiv 2607.02807,empirical)固定對象——一律是解答——改問如何在平行廣度與序列深度之間安排固定預算。固定擴展方式是 n 個並行代理程式 × k 次序列迭代,共用 git 歷史;在 60 次迭代預算內掃描 (5,12)、(10,6)、(15,4)、(20,3)、(30,2),每種設定執行 3 次取平均,涵蓋五項開放式最佳化任務。已對照 PDF 確認表 2 無誤。
- **廣度勝過深度,但並非一路如此。**五項任務中有四項的最佳固定設定較寬而非較深——長序列執行「停留在同一解答區域,錯過高度平行執行所發現、更好的解答區域」——但最寬的設定(30, 2)從未是最佳選擇。兩次迭代不足以建立有價值的成果。
- **不存在可跨任務移用的 (n, k)。**五項任務中有四項各自的最佳設定不同,這正是應把選擇交給協調器、而非自行調參的理由。
- 深度自適應寬度在五項任務中有四項勝過最佳固定設定,使用相同的 60 次迭代預算,而協調器只讓總輸出 token 增加 7.7%——先大範圍探索,再針對留下的項目選擇性地進行深入序列迭代。
這並不與上文的平行取樣結果矛盾,而是進一步細化它。Wang 等人顯示,當各組彼此獨立,且選擇器是模型本身時,廣度勝過深度。這裡廣度同樣勝出;額外增益則來自執行中重新分配廣度與深度,而非固定比例。此處缺少一項重要控制:勝出組別的協調器使用 Claude Sonnet-4.6,而所有子代理程式和整個固定擴展基準組都使用 Minimax-M2.5。因此這是「能力強的模型」進行協調並勝過固定超參數的結果,而不是在模型相同的條件下協調勝過固定設定(運算量控制基準測試)。
「增加探索」不是單一旋鈕#
第三個 empirical 來源帶來第三個軸向。Wang 等人問預算該花在什麼對象上;SwarmResearch 問如何安排廣度與深度;Idea Search(Wang、Cui、Brenner 與 Venugopalan,Caltech/Google Research/Harvard,arXiv 2608.08958,empirical)問的是該在哪個層級注入探索——並發現可用的兩個層級方向相反。
在固定使用 Gemini 2.5 Pro 的 scRNA-seq 批次整合任務上,純 Tree Search 約在 300 個節點時進入平台期,分數為 0.678 ± 0.011;每次修改提示都從想法庫取一個想法,則將平台期推至約 500 個節點,平均分數提高至 0.697,最佳分數為 0.728。在這些結果中,兩個探索旋鈕方向不同:
- 實作層級(提示中)。「探索式」指令要求即使需要重構整個解答也要實作抽取的想法;這幾乎不改變平均分數,卻產生整次執行中最佳的單一解答(0.728)。廣度帶來的是分布尾端,而非平均值的改善。
- 取樣層級(選擇器中)。將 bandit 的 UCB 探索係數從 α=1 提高至 α=4,反而降低平均分數,從 0.712 ± 0.012 降至 0.703 ± 0.008。
對以「花更多,得到更多」為主軸的文章而言,可移用的教訓是:搜尋中有好幾處能加入隨機性,但它們的方向不一定一致——因此「增加探索」作為預算建議,和「增加運算量」一樣不夠明確。有兩項限制讓此主張保持保守:α 組間的差距不到一個合併標準差;依兩階段規則閱讀的圖 5 顯示,α=4 在最初約 1000 個節點時領先,且整段執行的誤差帶有所重疊,因此判斷取決於曲線最後四分之一的表現。只能看作方向性結果,而且僅限單一基準測試與單一骨幹模型。
Brown 的論點以分子呈現——花更多,得到更多。他尚未展開的推論則是:凡是能降低 token 成本的方式,都能在固定預算下提高能力。Gemma 4(DeepMind,2026 年 7 月,empirical)具體呈現了這項推論——KV 快取縮小 37.5%、量化至次 GB 大小的檢查點、以及隨模型釋出的推測解碼 drafter head。依本頁框架,這些並非工程註腳,而是以美元而非參數數量計算的能力增益。
這種關聯也能反過來看。思考模式會增加每次查詢的 token 數,因此要在手機上執行的模型若要提供此功能,前提是 token 夠便宜。Gemma 4 在同一次發布中同時提供兩者。詳見推論效率即能力。
token 花在流程中的不同位置,成本也不同#
上面每個軸向都將預算花在解碼——軌跡、迭代、rollout、思考 token。Baherwani、Goldstein 與 Panda(arXiv 2607.22925,2026-07-24,empirical)則提出本頁尚未估價的軸向:prefill 受運算量限制,decode 受記憶體限制;加速器的 TFLOPS 持續以快於記憶體頻寬的速度提升,因此同一段序列計算在流程的 prefill 端成本更低。研究以填充 token測量此現象——在助理上下文預填一段固定、語意空白且每個問題都相同的序列——在 13 個前沿模型上,即使隱藏思維鏈且未針對此方法進行訓練,也能提高實際準確率:最高 +13.1pp;Opus 4.5 在四位數乘法上則提高 +10.0。
這對本頁有三項具體意涵:
- **使用者不會從輸出 token 帳單中看到的預算。**這類測試時運算量完全不會出現在可見回應中,因此 effort 旋鈕和冗長程度旋鈕都無法涵蓋;若基準測試以輸出 token 回報成本,也會低估它。
- **增益不大,這才是如實的摘要。**作者坦言,相較於同一問題上明確使用思維鏈所帶來的效果,提升幅度很小。每 FLOP 的 prefill 運算成本較低,但每單位能力的效益差得多——這是折扣,而非替代方案。
- 讓它重要的是誘因。非思維鏈表現是標準基準測試條件;服務成本偏好簡短輸出;而從未進入軌跡的運算較不容易被蒸餾。因此,把測試時運算量移出 decode 的壓力來自商業考量,而非對抗性需求。這正是Chain-of-Thought Monitorability將同一論點視為監控問題,而非效率問題的原因。
完全沒有旋鈕的軸向:跨問題分配(2026-08)#
上面每個軸向都將預算配置給單一問題。Fan 等人(arXiv 2608.07968,UMD,empirical)一次交給七個推理模型一份預算與 N 道需評分的問題,觀察會形成什麼分配。答案是:提示順序。
- 解題順序與呈現位置的部分 Spearman 相關為 +0.68;關鍵是,這個數字在不同考卷長度下都維持平坦(N = 5/10/20 時分別為 +0.68/+0.66/+0.69),同時隨位置增加而減少投入的 effort 則從 −0.17 加劇至 −0.48。因此,順序是一種策略,而非預算耗盡造成的假象;預算壓力是在此基礎上加上前置配置。
- **對難度的反應是事後的,而非事前的。**Effort 與難度的相關性會隨預算收緊而下降(+0.33 → +0.26 → +0.11)。若模型能預先判定難題值得投入更多運算量,結果應該相反。
- 明示的分值完全不起作用(effort—價值相關為 0.00/+0.04/+0.11);問題選擇與最高價值密度集合的符合程度僅為機率水準(0.59,機率基準也為 0.59),卻與最早呈現集合有 0.76 的符合度。**全部推理 token 的 32%**用在模型曾於獨立 40,960-token 嘗試中答錯的問題上。
- 明確加入規劃提示,能讓涵蓋率提高最多 +0.14,並降低 effort 與價值的相關性(+0.16 → +0.08):它改變的是運算量的分布,而非優先順序。
- N = 20 時,將預算除以 N、完全不再思考的做法,勝過所有七個模型的自發策略(分數低 5.0 點);N = 5 時,共用預算仍然勝出(+2.6)。
對本頁而言,這代表 Brown 建議的彈性思考時間並非模型本身具備的能力。單一問題內有 effort 旋鈕;跨問題則完全沒有。而且每題解題能力越強,模型就越能把共用預算投入碰巧最先列印的問題——兩個 API 模型在先列難題、且模型拒絕重新排序的條件下,分數會少 16–19 點。
底線:推理的第一個 token 值多少(2026-09)#
上面所有測量都比較運算量較多與較少的情況。Sarfati 等人(arXiv 2607.08046,Goodfire/Eternis,empirical)則透過預填空白思考區塊、迫使 8B/32B 預測模型立即作答,來比較推理與完全不推理的差異。在開放式預測任務上,整條思維鏈相較於強制立即作答,在同分布資料上價值為 +1.9pp(95% CI [+1.0, +2.9]),分布外則效果減弱;強制回答與自由生成的眾數答案在**67%**的問題上一致;陳述信心幾乎不變(Spearman ρ = 0.90);在強制回答答錯的問題中,推理有 **4%**能改正答案,卻有 **72%**會再次選擇相同的錯誤答案。
這對本頁有兩項推論,而且方向相反:
- **曲線起點可能幾乎平坦。**在以檢索為主的任務上,若檢索段落中有標準答案,準確率為 86–94%;若沒有則為 26–33%。推理大多只是強化提示已決定的答案。這更像是任務特性,而非模型特性;也正是本頁論點最薄弱的情境:若上下文不支持某個答案,再大的預算也無法找回它。
- **但分配訊號成本低,且有效。**模型推理前答案分布的熵,可透過單次前向傳遞取得,成本比 rollout 低 50–70 倍;依此將問題分為直接作答/推理/檢索三類,能在準確率沒有可測損失的情況下,減少 30–47% 的生成 token。這是語料中首個能提供上一軸指出模型本身不具備的彈性思考時間的工具;它從模型口頭表達之外取得訊號,比依據模型自己陳述的信心設定閘門更有效。
關聯文章#
-
推理前承諾——曲線的底線,以及上一軸指出模型無法提供的分配器:空白思考區塊在 67% 的問題上得出相同答案,成本為 +1.9pp;而推理前答案分布的熵能有效分流問題,減少 30–47% 的生成 token,且準確率沒有可測損失
-
共用預算的運算分配——本頁原本缺少的跨問題軸向,也是論點唯一反轉之處:單題能力越強,共用預算失效就越嚴重,因為更強的解題者能把更多預算投入最先遇到的問題
-
無效的自我驗證——反例:Opus 5 在 FrontierCode 上的分數於 medium effort 達到最高,而 GDPval-AA/AA-Briefcase 的最佳結果來自 xhigh,而非 max,因為邊際運算量耗在重複驗證與過度設計上
-
指令累積——說明為何預算旋鈕能取代停用開關:在成本相近的情況下,開啟思考並使用
loweffort 可避免關閉思考造成的輸出瑕疵 -
輸出長度校準——旋鈕無法觸及的成本:可見回應的 token 數受提示控制,因此 effort 和冗長程度是不同的槓桿
-
Claude Opus 5——以及替代效益結果:以工具花預算勝過花在思考上(提供容器和裁切工具後,Chartography 從 29.6% 提升至 83.0%,BenchCAD 從 0.366 提升至 0.821)
-
LLM 中的自動與彈性認知——為此論點提供機制層面的底線:Transformer 唯一能超越其前饋深度的途徑,是將中間結果寫進上下文再讀回,因此思維鏈是外部化工作空間,測試時運算量部分買到架構本身不具備的序列深度
-
推論效率即能力——其推論:推論越便宜,能力越強;Gemma 4 的效率技術堆疊是具體案例
-
運算量控制基準測試——基準測試上的後果:依成本/token/時間 x 軸公布表現,而非只報單一數字
-
潛在能力懸置——有利的一面:已發布模型的能力遠超任何人已付費抽取的程度
-
Responsible Scaling Policy Evaluations——安全上的後果:若能力隨預算擴展,「評估危險能力時應使用多少預算?」仍無答案
-
任務時間跨度擴展——外部趨勢線(可靠任務長度約每四個月翻倍)就是以能力曲線測量這項論點
-
規模依賴的提示敏感度——過度思考的反例:增加測試時運算量可能降低準確率,因此預算必須妥善分配,而非最大化
-
智慧爆炸動態——對運算量的依賴,是 Brown 說明起飛為何受時間瓶頸限制,而非瞬間發生的機制
-
可驗證性論點——搜尋帶來的增益(數獨極端)在廉價驗證器能讓模型檢查猜測的任務上最大
-
Open-Weight Elicitation Irreversibility——對公開權重的治理後果:引出能力的預算沒有上限,無法收回
-
Single-Rollout Optimization/適用於 LLM 的非同步 RL——訓練端的補充:RL 迴圈會產生長時程代理式模型,而其能力接著隨此推論預算擴展
-
動態工作流程:代理程式代數——此軸向在協調端的延伸,現在附上成本:Bun Zig→Rust 移植在 11 天內完成一項任務,花費 5.9B 未快取輸入 + 690M 輸出 + 72B 快取讀取 token ≈ 165,000 美元;12:1 的快取讀取與新輸入比例顯示,長時間扇出執行的計價方式更像是反覆讀取,而非生成(
case-study,第一手資料)。Brown 的「能力取決於你投入多少錢」有了具體的高端數據點,而且這是協調後的預算,而非單一長上下文 -
Expenditure Horizon——在代理式 AI R&D 任務上修正此論點的成本核算:六次執行、每次最高 10,000 美元,其中約 70–90% 的軌跡成本來自實驗運算,而非模型推論;因此「投入多少錢」和「生成多少 token」約有一個數量級的差距,只有金額軸完整。這也是少見的實測曲線形狀:L 形;較新的模型在數千美元範圍內仍約呈對數線性上升,兩個較舊模型則在零實際增益處趨平
-
UK AI Security Institute——獨立政府評估機構,跨基準測試測量這項論點,讓它從軼事提升為
empirical事實 -
遞迴自我改進——此軸向所帶動的迴圈:經驗證的測試時軌跡成為下一個模型的微調資料,這就是 CS329A 所說的「自我改進」
-
Noam Brown——資料來源;推論時擴展的先驅研究者
-
Aakanksha Chowdhery——涵蓋率→pass@1 的機制:後訓練新增的是學會哪一條推理鏈正確
-
CS329A:自我改進 AI 代理程式(Stanford)——以此軸向為核心的 Stanford 課程;第 1 講是該領域在 2025 年底的基準說法
-
過程與結果獎勵模型——選擇器旋鈕相關研究,以及更多樣本最終不再有幫助的原因:學得的驗證器精確率會隨候選數量增加而下降,而共識只會進入平台期
-
弱驗證器集成——將相同預算花在驗證端的作法:增加驗證器,而非增加單一驗證器的取樣,然後蒸餾成約 400M 的評分器
-
Inference-Time Architecture Search——讓「如何安排」問題可以搜尋:Archon 在推論呼叫預算內組合 generate/fuse/critic/rank/verify 層,其融合操作勝過從相同樣本中以 oracle 選擇答案
待解決的問題#
- **能否從低預算執行預測高預算表現?**Brown 提出的研究問題:只用 10–100 美元的執行結果,預測 10,000 美元推論預算下的結果。若曲線規律,評估便能推估,而非全額付費。2026-07 更新:AISI明確提出這個確切問題——「能否從較便宜的執行估計高預算表現?……最有資訊量的評估可能很昂貴」——將它列為目前正在積極研究、但尚未解決的方向(同時也在界定「最低資訊量預算」)。仍待解決,但不再只是單一研究者的提議:政府研究機構正在著手研究。同領域軸向的示範(2026-07):另一種推估——跨基準測試,而非跨運算預算——如今已行得通:BenchPress能根據約 5 個已知分數預測模型在保留基準測試上的分數,因為 84×133 的公開分數矩陣實際上是 rank-2(以 5 個探測分數卡重建,誤差約 3.93 點)。這有力證明評估領域維度低且重複,但並未回答跨預算推估問題——沒有人證明 10K 運算量的結果能從 10 美元執行結果預測;目前只有類似的跨基準測試結果。
- 真實任務在平坦↔無界光譜上的位置為何?能否在花費運算量之前預測?2026-09-22 部分得到否定答案,排除了一種值得檢驗的預測者:模型本身。用力思考,而非聰明思考:推理模型無法在問題之間合理分配測試時運算量(Fan 等人,
empirical)需要每題成本w_i,但報告指出共用預算的執行結果無法揭示這個數值——唯一取得方式,是對每題另做最高 40,960 token 的獨立高預算嘗試;作者明確拒絕將它稱為最低或必要成本。模型本身的隱含預測也毫無價值:一次看到全部 N 題及其分值後,模型實際處理的集合與最高價值密度集合只達到機率水準的重疊(0.59,機率基準為 0.59;另外三種評分方式下則等於或低於機率水準),與最早呈現集合的重疊則為 0.76。因此「先問模型任務落在哪,再付費」這條路已行不通;問題縮小為是否存在比付費執行一次更有效的外部預測者。 - 有沒有任務類別是鷹架無法延長有效思考跨度的——也就是任何預算都無法突破的硬上限?(Brown 所說的事實檢索極端表示某些任務確實如此,但界線尚未描繪。)
資料來源#
- CS329A Self-Improving AI Agents — Part 1: Course Overview——Stanford CS329A 第 1 講(Azalia Mirhoseini 與 Aakanksha Chowdhery,2025-09-22 授課,2026-08-03 發布,
practitioner-opinion,自動字幕逐字稿):涵蓋率與 pass@1 的區別及其機制、o1 的對數線性 pass@1 曲線、測試時運算→合成資料→微調飛輪、平行取樣的延遲/成本不對稱性,以及當時尚未解決的難度自適應取樣缺口。此講內容比本頁其他資料晚了一年——應將其視為 2025 年底該領域的基準說法 - CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling——Stanford CS329A 第 2 講(Azalia Mirhoseini,2025-09-26 授課,2026-08-03 發布,
practitioner-opinion):逐步講解 Snell 等人的研究——平行取樣、循序修訂、ORM/PRM 選擇、PRM 引導的束搜尋、五個難度組別及各組循序對平行比例,以及預訓練與推論取捨(測試時運算在簡單/中等題勝出,在難題落敗);也記錄一次付費與每次查詢付費的異議,以及她以「誰有能力做到」重新界定問題的說法。數字依自動字幕逐字稿中的投影片讀出,是約數,背景為 2025 年底 - CS329A Self-Improving AI Agents — Part 3: Robust Verification——Stanford CS329A 第 3 講(Azalia Mirhoseini,2025-09-29 授課,2026-08-03 發布,
practitioner-opinion):選擇器旋鈕以四篇論文逐步展開。此處只引用約 400 個樣本後驗證器精確率下降,以及已部署的 100 樣本設定;其餘內容見過程與結果獎勵模型和弱驗證器集成。數字依自動字幕逐字稿中的投影片讀出,屬約數,背景為 2025 年底 - CS329A Self-Improving AI Agents — Part 6: Train-Time Scaling and Scaling RL——Stanford CS329A 第 6 講(Aakanksha Chowdhery,2025-10-10 授課,2026-08-03 發布,
practitioner-opinion):此處只引用 32 個樣本下 majority@K 上升/pass@K 不變的結果、對此結果「更一致,而非在根本上更聰明」的詮釋,以及將結果推廣至該講三種訓練時擴展方法。數字取自自動字幕逐字稿中的投影片;raw/中沒有 DeepSeekMath 論文。機制見群組相對策略最佳化(GRPO)和理由引導自舉(STaR) - Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI's Noam Brown——No Priors 訪談(2026-06-26),Noam Brown 討論其文章 Implications of Large-Scale Test-Time Compute(
practitioner-opinion) - What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness——Sarfati、Tiwari、Boppana、Earls、Varadaraj 與 Ho(Goodfire/Eternis),arXiv 2607.08046,2026-07-09,
empirical:§4.6 與圖 8(空白 think 預填強制回答;信心對應 ρ = 0.90/0.87/0.78;眾數答案一致率 67%/64%/56%;同分布準確率提高 +1.9pp [+1.0, +2.9];強制回答答錯題中改正率 4%、維持原錯誤率 72%;成本比 50–70×),§4.7 與圖 9(答案熵分流,以及節省 30–47% token),以及 §4.1.2(答案涵蓋率,86–94% 對比 26–33%)。利益衝突:預測模型來自其中一組作者,探測架構來自另一組;實驗由 Goodfire 的代理式研究平台執行,並由作者審查。解析備註:匯入判定為warn;表 2 確實有列合併問題,已在編譯時以pdftotext -layout重建,本頁並未引用。完整分析見推理前承諾 - Gemma 4 Technical Report——效率推論:思考模式搭配五項降低推論成本的技術,一併推出(
empirical) - Verbalizable Representations Form a Global Workspace in Language Models——思維鏈是外部化工作空間:Transformer 超越前饋深度的唯一方式,是將中間結果寫進上下文再讀回
- Prompting Claude Opus 5——Anthropic 平台文件(2026-07-25 擷取,
vendor-claim):部署端的預算分配建議——預設使用low/medium,要求嚴苛的代理式工作使用xhigh,低 effort 開啟思考勝過關閉思考,且每個模型都要重新掃描 effort - SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery——Virk、Edds、Xia 與 Zhang(UIUC),arXiv 2607.02807(2026-07-02,
empirical):§3.1、§3.4 與表 2——60 次迭代預算內的 (n, k) 掃描;協調器引導的擴展在五項任務中有四項勝出,輸出 token 增加 +7.7%;以及協調器使用的模型不匹配。表 2 已確認無誤;原始資料中的表 1 已摺疊,本頁未引用(在開放式探索鷹架中重建) - Rewriting Bun in Rust——Jarred Sumner,bun.com(2026-07-08,
case-study):單次協調式 11 天專案的 token 成本明細——5.9B 未快取輸入、690M 輸出、72B 快取讀取,按 API 標價約 165,000 美元 - More compute, more capability: Why AI agent evaluations need to account for test-time compute——UK AISI,More compute, more capability(2026-07-02,
empirical):獨立測量的確認——能力隨 token 預算變化的曲線、約 8% 的網路安全任務僅在 ≥10M token 時解出、從 1M 增至 10M 帶來 +25% SWE/+22% 數學增益,以及作為平坦端案例的 HealthBench - Not All LLM Reasoning is Visible in the Chain-of-Thought——Baherwani、Goldstein 與 Panda,arXiv 2607.22925(2026-07-24,
empirical):本頁採用**§7/結論**(prefill 受運算量限制、decode 受記憶體限制、TFLOPS 增速高於頻寬,以及服務端注意事項——實際節省幅度取決於批次處理、上下文長度與設定)、表 1(13 個模型的 10-shot 掃描)與圖 3(Opus 4.5 的 π 位數運算格結果為 +13.1pp),以及限制段中指出提升幅度小於同一問題上明確使用思維鏈的句子。機制、監控上的影響及各表格的解析判定,見隱形推理(填充 token 的潛在運算) - Idea Search: Guiding Tree Search with Ideas to Explore Diverse Scientific Methods——Wang、Cui、Brenner 與 Venugopalan(Caltech/Google Research/Harvard),arXiv 2608.08958(2026-08-09,
empirical):§5.1 的平台期突破(0.678 ± 0.011 → 0.697,最佳 0.728),以及 §5.3 的提示方式與 α 差異。文件中沒有表格;所有引用數字均取自文字,圖表依兩階段規則判讀(圖 5 以 4× 放大確認,圖例與曲線對應正確,且結果補充了 α 的判斷)。效果量約為 5 次試驗中 0.008–0.018 的試次間差異;僅一項任務、一個骨幹模型,因此僅採方向性解讀。完整分析見Transformative Creativity(概念空間解讀)和開放式探索鷹架(提出想法的矛盾)
Cited by 68
- CS329A: Self-Improving AI Agents (Stanford)×7
Constructive answers. Snell et al.'s parallel-vs-sequential-vs-PRM-guided-search comparison and its…
- Latent Capability Overhang×5
Large Scale Test Time Compute — the root cause: the overhang exists only because capability scales…
- Agent-Authored Harness Optimization×4
co evolving harnesses and models — Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata…
- Multi-Agent Collective Intelligence×4
The default outcome is collapse, not cooperation. "It's actually very difficult to get these agents…
- Aakanksha Chowdhery×3
That is the mechanism side of Compute Controlled Benchmarking's reporting rule ("a gain visible…
- Compute-Controlled Benchmarking×3
Large Scale Test Time Compute — the root cause: capability scales with inference budget, so a score…
- Evaluation Horizon Versus Release Cadence×3
The nearest existing question is Large Scale Test Time Compute's — at what budget do you evaluate…
- Inference-Time Architecture Search×3
The single result on this page most worth carrying, because it breaks a ceiling everything else on…
- Intra-Trace Parallel Planning (SPRINT)×3
The setup Mirhoseini gives is the standard late-2025 one: o1, Gemini 2.5 Pro and "pretty much all…
- Many-Agent Proof Harnesses×3
The paper is explicit that these "specify population widths and aggregation fan-in rather than the…
- Tree Search over Agent Trajectories (LATS)×2
Large Scale Test Time Compute — LATS is the acting-agent instance of spending inference budget for…
- Asynchronous RL for LLMs×2
Large Scale Test Time Compute — async RL is the training-side complement: this is the loop that…
- Azalia Mirhoseini×2
Difficulty-adaptive sampling was unpublished. Asked whether sample count can be made a function of…
- Benchmark Score Redundancy×2
This is the eval-cost story on a different axis from the Large Scale Test Time Compute cluster:…
- How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?×2
Concept articles: Benchmark Score Redundancy (Zeng & Papailiopoulos, arXiv 2606.24020), Measuring…
- Cost-per-Task Over Cost-per-Token×2
Large Scale Test Time Compute — effort level is the inference-budget thesis productized as a dial;…
- Dynamic Workflows: An Algebra for Agents×2
Cherny's framing places the feature on the scaling-laws map: capability was historically a function…
- RL from Execution Feedback (RLEF)×2
Headline. On CodeContests (competitive programming), solve rate plotted against sampling budget —…
- Gemma 4×2
A thinking mode arrives in open weights. Gemma 4 emits a reasoning trace before responding,…
- Harness Value Is a Product, Not a Score — Why the Artifact-Payoff Questions Keep Returning Partially Answered×2
Large Scale Test Time Compute — the remedy, the artifact class, the counter-pressure, the
- Inference Efficiency as Capability×2
Under Noam Brown's thesis — capability is a function of how much money you put into inference — a…
- Instruction Compounding×2
Anthropic's primary mitigation for both is not a prompt at all: keep thinking enabled and control…
- Intelligence Explosion Dynamics×2
Noam Brown (OpenAI, practitioner-opinion) supplies an independent, mechanism-level argument against…
- Invisible Reasoning (Filler-Token Latent Computation)×2
Large Scale Test Time Compute — the budget axis this adds: serial compute bought in prefill rather…
- Measuring Beyond Accuracy Saturation×2
Large Scale Test Time Compute — the returns-to-inference-scaling this page's efficiency axis…
- Noam Brown×2
Large Scale Test Time Compute — his central thesis; he is the author of the essay this cluster is…
- Open-Ended Discovery Harnesses×2
The second experiment is the one with the cleanest budget control, and it is a test-time-scaling…
- Open Questions Backlog×2
Large Scale Test Time Compute: Where does each real task sit on the flat↔unbounded spectrum, and…
- OpenAI×2
Inference-time-scaling research and its evaluation critique. Noam Brown — one of the pioneers of…
- Output Length Calibration×2
Large Scale Test Time Compute — the dial that doesn't control length: effort is the token/latency…
- Recursive Self-Improvement×2
Large Scale Test Time Compute — Brown's test-time-compute pacing argument: peak capability needs…
- Responsible Scaling Policy Evaluations×2
Noam Brown (OpenAI, practitioner-opinion) names a structural hole this framework shares with every…
- Review as the Control Point×2
Large Scale Test Time Compute — review as a budget-allocation decision: a cheap low-effort pass at…
- Selection Under a Submission Budget×2
Chowdhery states the takeaway as a rule when a student asks whether one could simply sample a…
- Shared-Budget Compute Allocation×2
Large Scale Test Time Compute — the thesis this page constrains. Brown's curve says capability is a…
- Staleness–Learning-Rate Scaling×2
The analysis is derived analytically first and validated empirically after — not a curve fit in the…
- Task Time-Horizon Scaling×2
Large Scale Test Time Compute — the reliable-task-length curve is that thesis measured as a…
- UK AI Security Institute×2
Large Scale Test Time Compute — empirically corroborates the hub thesis; the AISI cyber evals Brown…
- Unproductive Self-Verification×2
Large Scale Test Time Compute — the assumption this finding dents: more inference compute stops…
- Adaptive Stopping in Evaluation Sampling
Large Scale Test Time Compute — the compute-is-a-curve thesis seen from the evaluator's side of the…
- Agent Harness Engineering
Multi-agent fan-out searches around the distribution — "multiple agents trying different…
- Agentic Loops Overtake Bespoke Systems
With the budget clause attached (2026-09-21): …prefer the simplest loop if the marginal call is…
- AI R&D Autonomy Evaluation (AECI)
Budget barely moves it. Tripling Mythos 5's budget from 300k to 900k tokens gains ~3 percentage…
- Automatic vs. Flexible Cognition in LLMs
Large Scale Test Time Compute — if CoT is externalized workspace, test-time compute is partly the…
- Claude Opus 5
Tools beat thinking as a way to spend test-time compute. On Chartography, 29.6% without tools →…
- Chain-of-Thought Monitorability
Large Scale Test Time Compute — where the incentive behind an empty trace lives, read as an…
- Effective Compute Scaling
Large Scale Test Time Compute — the other side of the same budget question, and the only place the…
- Expenditure Horizon
Large Scale Test Time Compute — an inference-scaling curve run to $10,000 per task, and a…
- FrontierMath Erdős Benchmark
Large Scale Test Time Compute — the cost ladder read as an inference-scaling curve on open research…
- Gemini 3.8 Live
Large Scale Test Time Compute — "Extended Thinking" is a test-time-compute dial placed on the live…
- Group Relative Policy Optimization (GRPO)
And the paper reports what its own RL did not buy. With 32 samples per problem, DeepSeekMath's RL…
- Jeff Dean
Large Scale Test Time Compute — his multi-agent-plus-evaluator prescription for long-running agents…
- Model Capability & Training
Large Scale Test Time Compute (hub) — Noam Brown's thesis that model capability is now a function…
- The Navier–Stokes AI Claim
Large Scale Test Time Compute (hub) — the budget axis the run sits at the extreme end of
- OEIS Open Benchmark
Large Scale Test Time Compute — the log-linear, un-plateaued cost curve on open research problems,…
- Open-Weight Elicitation Irreversibility
A wiki-drawn synthesis of Brown and Gemma 4: if dangerous capability scales with inference budget, then an open-weight…
- The Open-Weight Frontier Gap
Large Scale Test Time Compute — the unnamed variable underneath every cell of the table
- Pre-Reasoning Commitment
Large Scale Test Time Compute — the thesis this measures against, on one task.…
- Process vs Outcome Reward Models
Large Scale Test Time Compute — the hub these are the selector knob of, and the ceiling they put on…
- Rationale Bootstrapping (STaR)
Large Scale Test Time Compute — where the samples being filtered come from; STaR is what happens…
- Reward Hacking
The persistence half is measured too. OpenAI reports its models "rarely 'gave up'" on ExploitGym…
- Scale-Dependent Prompt Sensitivity
Large Scale Test Time Compute — the overthinking result is that thesis's counter-case: more…
- Single-Rollout Optimization
Large Scale Test Time Compute — the long-horizon agentic models this trains are the ones whose…
- Stopping Under a Noisy Verifier
Large Scale Test Time Compute — the loop-shaped counterexample to compute-buys-quality: spending…
- Transformative Creativity
Large Scale Test Time Compute — where the Idea Search numbers sit as a budget-shaping result rather…
- Turn-Level Credit Assignment
Large Scale Test Time Compute — turn credit is what makes the long interaction budget learnable;…
- The Verifiability Thesis
It gates the self-improvement flywheel, not just capability. The course's whole thesis — test-time…
- Weak-Verifier Ensembling
Papers 1–3 (Process Vs Outcome Reward Models) spend four years making a single verifier better:…
Related articles
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Latent Capability Overhang
Noam Brown's claim that already-released models can do far more than anyone has extracted, because nobody spends enough…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- CS329A: Self-Improving AI Agents (Stanford)
Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…
- Reward Hacking
The model optimizing the measured proxy (a reward signal, a metric, a grader's judgment, a tool's output) rather than t…
