H
Howardism
Plate IIModel Capability & Training機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

潛在能力未開發空間

Noam Brown 主張,已發布的模型能做到的遠比任何人實際發揮出來的更多,因為沒有人投入足夠的推論時運算:OpenAI 以低成本推翻了 Erdős 單位距離猜想,而同一結果後來也透過鷹架引導 GPT-5.5 得出($1K–$100K);該猜想是 Erdős 問題 90,其 Lean 形式化花了 120 萬行,對照之下,散文證明只有 18 頁;每次發布都讓成本下降 10–100 倍,助長了「等下一個模型」的迷因;Boris Cherny 提出的產品側對應概念——「設限」與「產品未開發空間」——則把同一道落差定位在產品設計,而非預算

Article metadata
Publication details
Published:July 9, 2026
Filed:Concept
Domain:Model Capability & Training
Tags:LLM ArchitectureTest Time ComputeCapability TrajectoryLatent Capability
Reading:31 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

潛在能力未開發空間的插圖

資料來源#

摘要#

如果能力會隨推論預算增加而提升(Large-Scale Test-Time Compute),但沒有人投入大量預算,那麼已發布的模型所能做到的,遠超過任何人曾展示的程度。Noam Brown 直接指出:「沒有人充分探索過,若投入價值 $100,000 的運算資源到[已發布的模型]上,會發生什麼事。」能力之所以潛伏著,不是因為它不存在,而是因為要把它挖掘出來,需要金錢與耐心,而幾乎沒有人願意投入(practitioner-opinion)。

實例:Erdős 單位距離猜想#

OpenAI 使用內部模型推翻了Erdős 單位距離猜想。Brown 說,這在數學界「相當重大」;許多數學家都曾投入大量心力研究,這是其中第一個被解決的問題,而且是在「非常便宜的預算」下完成的(他們訓練了一個新模型,出於好奇,以低預算執行)。揭示關鍵的是後續發展:結果公布後,人們發現,只要給它鷹架引導,就能從已公開的 GPT-5.5 得到相同的反證——不是直接提問,而是要求它列出攻擊策略、指示它探索有希望的策略,再反覆迭代。Brown 估計,一套能得出該反證的通用鷹架,成本約為「一千到 $10,000,再到 $100,000」——雖然昂貴,卻做得到,而且在 OpenAI 做到之前就做得到。這種能力早已存在於已發布的模型中,只是沒有人付費把它挖出來。

這個問題有編號,形式化也有成本(2026-09-21)。Epoch AI(Announcing FrontierMath Erdős,empirical)將該猜想列為 Bloom 目錄中的Erdős 問題 90,讓本文的軼事能對應到任何人都查得到的條目,並補上原軼事缺少的資訊:讓結果可檢查所需的成本。模型以自然語言寫出的證明長達 18 頁;之後另有一項形式化工作,使用 Lean 寫成 120 萬行——因為論證引用了一項標準函式庫中沒有的「深層」結果,散文可以直接引用,形式化則必須從第一原理推導。因此,這個故事中便宜的部分確實便宜;昂貴的不是能力,而是後續由人類完成的認證。請留意這裡的方向:這項未開發能力是以「非常便宜」的預算挖掘出來的,而對挖掘成果進行驗證的成本,卻高於挖掘本身。

這是 DeepMind 的 Lean-verified Erdős work 在非正式但可檢查層面的對應案例:DeepMind 解決了形式化的 Erdős 問題,由編譯器認證每一步;OpenAI 的反證則由通用模型在人工引導下產生,事後才完成驗證。兩者都是 2026 年前沿模型參與開放數學研究的證據——一者透過可靠的驗證器,另一者透過推論時運算搜尋。

經驗研究的先驅:Large Language Monkeys(2024)#

Brown 在 2026 年以預算來描述這種未開發空間。相同主張早在兩年前就出現在投影片上,當時用的是取樣的說法;這也是 Azalia Mirhoseini 在 CS329A 教授推論擴展起源時引用的成果(第 1 講,2025-09-22 授課,practitioner-opinion 轉述她實驗室的 empirical 論文——Large Language Monkeys: Scaling Inference Compute with Repeated Sampling,Brown、Juravsky、Ehrlich、Clark、Le、Ré 與 Mirhoseini,arXiv 2407.21787)。

設定刻意保持精簡:固定模型,在非零溫度下對同一問題多次取樣,再使用驗證器或選擇器(程式碼情境下即單元測試)從樣本中挑選。報告的指標是涵蓋率——至少有一個樣本解出的問題比例:

  • 在數學與程式設計基準上,將每題樣本數從 1 → 10,000 逐步提高,涵蓋率持續按對數線性方式上升;在測試範圍內沒有趨平。
  • Llama-3-8B 和一個 7B 模型,單次取樣時都不如 GPT-4o;擴大取樣後,兩者在所有測試基準上都超越 GPT-4o 的單次取樣分數——較弱、較便宜的模型加上反覆取樣,勝過只問一次的較強模型。
  • 有些問題在 10,000 個樣本中只有三、四個正確。這種能力確實存在,只是出現率低到一般評估都會判定它不存在。

Mirhoseini 對此的解讀正是本文的核心論旨,而且在本文的來源出現之前就已提出:模型「其實已經知道的東西,比你只問一次時能從它們身上得到的多得多。」參數完全沒有改變——「我們沒有碰模型的任何參數。」

挖掘這種未開發空間時,有兩個細節值得注意:

  • **延遲成本低,金錢成本高。**平行樣本會同時執行,「所以從延遲角度來看,問題沒那麼大」——真正受限的是成本前沿。這與後來出現在編排層的延遲換成本權衡相同:平行分派多個代理能縮短實際耗時,但會增加 token 帳單(Large-Scale Test-Time Compute)。
  • **多樣性是燃料,但有上限。**重複取樣之所以有效,是因為生成具有隨機性;溫度是調節旋鈕,超過約 1.2 後,額外多樣性便會退化成胡言亂語。因此,「多取樣」受限於模型能產生多少真正有用的變化。

Brown 的說法與此一脈相承:以 10,000 個樣本計算的涵蓋率,以及價值 $100K 的能力,其實是同一種測量,只是單位不同,相隔兩年。這期間改變的是選擇器變得足夠好,能留下正確的樣本——參見 Large-Scale Test-Time Compute。

為何曲線呈冪律:困難問題的長尾#

第 2 講(CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling,2025-09-26 授課)補上單看涵蓋率數字無法解釋的部分,也是這堂課最能廣泛應用的內容。

單一問題的計算很簡單,而且不是冪律。對於每次取樣成功機率為 p 的單一問題,取樣 k 次的涵蓋率是 1 − (1 − p)^k——一條漸近飽和的指數曲線。然而,對基準中的問題彙總後,涵蓋率與樣本數的關係符合冪律;依照課堂投影片的寫法是 c ≈ exp(a·k^(−b))。這個擬合在 Llama 3(8B 與 70B)、Gemma 和 Pythia 上都成立,模型規模橫跨7,000 萬到 700 億個參數、相差四個數量級,也適用於數學、程式設計與代理領域。70M 模型呈現出與 70B 模型相同的擴展行為。

兩者能相容,是因為分布必須滿足特定條件;課堂將它明確說成必要且充分條件:**基準必須包含困難問題的長尾。**大多數問題很簡單,在 pass@1 就能解出;難度增加時,每題的 p 下降,而每題 pass@1 的直方圖必須以適當形狀衰減,指數曲線的混合結果才會彙總成冪律。實證上,真實基準確實呈現這種樣貌。

這對如何理解未開發空間有兩個推論:

  • **依照定義,未開發空間存在於長尾中。**重複取樣解鎖的正是低 p 的問題——而課堂給出的低點相當驚人:有些最難解出的問題,在 10,000 個樣本中只有一到三個正確。這就是為何任何評估都看不見這種能力,也解釋了為何任何頻率式選擇器都看不見它。
  • **未開發空間的規模可預測。**如果涵蓋率曲線符合擬合後的冪律,那麼「需要多少樣本才能達到涵蓋率 c」就成了預測,而不是實驗——這是從取樣角度部分回答本文提出的開放問題:如何不必付出抵達上限的成本,就估計上限。不過,它預測的是涵蓋率,而非可用系統實際交付的 pass@1;兩者之間的距離正是 The Verifiability Thesis 所談的落差。

課堂還補充了一個涵蓋率測試領域,因為它附帶免費且完美的驗證器:CUDA kernel 生成(KernelBench)。只要將生成的 kernel 輸出與來源 PyTorch 在任意輸入上的輸出比較,就能檢查結果。這個領域的涵蓋率也隨樣本數提高;同一論點也適用於任何語言到語言的轉換,因為參考實作本身就是驗證器。這正是 Azalia Mirhoseini 實驗室所走的「AI 作為編譯器」方向。

有個代理領域的數據點值得獨立列出,因為它把「弱模型加取樣勝過強模型」的主張延伸到 2024 年基準之後:在 SWE-bench 上,DeepSeek(依課堂說法為 v3)取樣約 1,000 次,解出的問題比 Claude 3.5 Sonnet 或 o1-preview 各取樣一次還多——以單元測試作為選擇器,讓開放權重模型能透過端對端自動化流程達到前沿模型級的涵蓋率。這是 2025 年底的模型,衡量的是涵蓋率,而非 pass@1。

有測量,不只是軼事(UK AISI)#

Erdős 故事屬於 practitioner-opinion——單一且經過重建的軼事。UK AI Security Institute 在 2026 年 7 月的研究(empirical)提供了已發布模型的實測未開發空間,而且形狀正如本文預測:標準固定預算的評估永遠不會揭露的能力,因為沒有人投入足夠預算。

  • AISI 狹義網路安全任務中,約 8% 只有在每項任務預算達到 ≥10M tokens 後才解得出(部分任務最高需要 50M)。「預算較低時,這些成功案例都不會被看見。」最新模型在 100M+ 時仍持續進步。
  • 「The Last Ones」(約 20 個人類工時)在預算達到 ≥30M tokens 前,所有受測模型都無法解出——整類能力都藏在線下方。
  • 公開基準也呈現相同情形:1M→10M tokens 可讓軟體工程表現提升約 +25%,數學/學術任務提升約 +22%。

這是將未開發空間量化,而非僅僅宣稱,而且研究來自政府第三方,獨立於以 OpenAI 為主的敘事:對於已發布模型,一般評估預算會留下可測量的一部分真實能力未被發現,原因正是挖掘它需要花費沒有人願意出的 token。

同一機構如今也已為別人的模型投入預算,且在權重發布前就完成了(2026-07-23)。UK AISI 和 US CAISI 對 Kimi K3 網路安全能力的聯合評估(empirical)在其 API 發布與權重發布之間的 11 天窗口內,對一個開放權重模型進行網路安全範圍評估,token 上限為 100M。這以明確答案補上本文的審核問題——見下方「已解決問題」——而答案出乎意料:不是實驗室挖掘自家模型的未開發能力,也不是開放權重論述所說的「任何人都能稽核」,而是兩個政府透過供應商 API 付費進行黑箱測量,並在下載連結上線前四天公布結果。剩下的問題是,單一預算的發布前數字,正是本文認為無法界定能力上限的產物;下方對上限的提問仍未解決。

發布週期的影響:為什麼沒人費心#

未開發空間之所以持續存在,是因為有理性的反向誘因。每次模型發布週期(每兩到三個月)都會讓特定能力的成本下降 10–100 倍,所以今天花 $100K 挖掘某項能力,往往不如等下一個模型用一小部分成本完成。這就是「去度個假,兩個月後回來,成本就便宜一千倍」的迷因——也是為下一個模型打造產品的悲觀對偶。Brown 部分認同這說法:OpenAI 正「處於進展非常快速的時期」。

但 OpenAI 的機構選擇反而朝另一個方向,而且有其理由:它積極勸阻數學家與物理學家把所有時間都花在把目前模型推向極限、解決開放問題上。公開說法背後的邏輯是前沿領域的機會成本——「重點應該是如何打造更有能力的模型……讓全世界的科學家都能使用這些模型,自己解決問題。」挖掘未開發空間會分散擴大它的注意力。

產品側的對應概念:設限與產品未開發空間(Cherny)#

Boris Cherny(YC 訪談,2026 年 7 月,practitioner-opinion)從產品側為同一道落差命名,提出一組配對概念:設限——產品主動妨礙模型發揮;以及產品未開發空間——當前模型擁有「我們尚未實現」的能力,因為沒有產品能引出這些能力。Brown 的未開發空間以預算計價(沒有人花 $100K),Cherny 的則以產品設計計價(沒有人打造能讓能力展現的介面)。他以 Claude Code 的起源故事作為經典案例:Sonnet 3.5 早已能寫出整個檔案,但當時所有程式設計產品不是自動補全,就是唯讀聊天——「沒有真正能充分引出模型能力的產品……所有東西都只是在妨礙它。」Claude Code 賭的是,移除鷹架本身就是產品。

他挖掘能力的建議,與 Brown 的機構立場相反(OpenAI 認為挖掘未開發空間會分散擴大它的注意力):交給模型稍微超出能力範圍的任務——說明任務、護欄與退出條件,而不是列出步驟——並且在每一代新模型推出時,把尚未解決的問題再丟給它(Build for the Next Model;Bun Zig→Rust 改寫在每個前代模型都失敗後,從「Fable」開始終於成功——參見 Dynamic Workflows: An Algebra for Agents)。挖掘機制在於玩耍:Anthropic 員工發現,提供 OpenCV 後,Opus 5 可以畫圖——肖像、動物、風景——這項能力從未受過訓練,是「隨手試著做些有創意的事」才發現的。他的假設是:「今天的模型大概還有幾十種、幾百種這樣的機會,至今沒人發現。」

造成的評估盲點#

未開發空間也解釋了為什麼沒有人知道目前模型的能力上限。把模型推到極限要花兩到三個月;每兩到三個月就有新模型推出;因此,每個模型都在有人投入足夠時間確認它能做到什麼之前就退役了。Brown 舉例:某項長時程代理能力推出時,人們直到耗時超過一週的執行終於完成後,才意識到它很重要——也就是發布一週之後。測量延遲是結構性的,並且加劇了安全評估落差:如果你無法在下一個模型問世前負擔起找出模型的能力上限,就同樣無法找出它的危險能力上限。

相鄰的落差:能力已挖掘卻未公開(2026 年 9 月)#

本文談的始終是已發布但尚未挖掘的能力——任何人都能取得預算,只是沒有人願意花。Brown(Dwarkesh Podcast,2026-09-17,practitioner-opinion)在描述本文這種落差三個月後,談到了它的鏡像落差;兩者不應混為一談:

「我們的情況是,我們內部有一個非常強大的模型,目前不對外開放,它能解決驚人的數學問題。不只是千禧年大獎問題。人們已經能從這個模型得到許多尚未解決問題的解答……這是不公平的優勢。這裡有一些取捨。我不知道該如何適當衡量這些取捨。」

**差異在於誰能消除落差,以及如何消除。**只要有人付錢,未開發空間就能被填補;稀缺的是引出能力的方法,這就是為什麼本文「發布週期的影響」一節將未開發空間解釋為一種理性的不支出(等下一代模型,成本就會便宜 10–100 倍)。只有實驗室發布模型,才能消除能力遭扣留的落差。公開更便宜的引出方法會消除未開發空間,卻無法改變存取界線,因此兩者需要相反的介入方式;討論世界有多少能力尚未使用時,應分開計算。

讓這件事也與本文相關,而不只是治理問題的原因,是兩種落差透過評估窗口具有因果關聯。Brown 對差距存在原因的解釋是,安全評估需要時間,而目前模型的運作時程已長於發布間隔(Evaluation Horizon Versus Release Cadence)——因此,「模型發布週期應該放慢」正是讓這種落差擴大的解方。語料庫中對同一權衡的另一種表述,是位於相反極端的 Open-Weight Elicitation Irreversibility:發布權重後,引出能力所能投入的預算將無上限而且永久。扣留與發布是同一旋鈕的兩端,而語料庫中沒有任何資料為中間地帶定價。

兩週後,遭扣留的一側落差進一步加深,並產生第一個公開產物(2026-09-21)。 OpenAI 關於 Navier–Stokes 的公告(On the Navier–Stokes Millennium Prize Problem,2026-09-08,vendor-claim)表示,成果背後的模型是「能力顯著超越 GPT‑6 Astra 的內部模型」,自 8 月 28 日起訓練,執行期間仍持續進步。這對本文有兩項影響,方向相反。

這道落差至少比語料庫先前記錄的深了一個世代。FrontierMath Erdős Benchmark 在 $300 上限下,測得一個發布前的 GPT‑6 Astra 解出 68 道精選開放 Erdős 問題中的 2 道——根據這項說法,基準公布時,這個模型在內部已被更新的模型取代。因此,外界能引用的最新數字只是下限的下限:一個尚未發布、但已經測量的模型,落後於一個尚未發布、也未經測量的模型。無論本文如何估算世界尚未使用的能力,帳冊中遭扣留的一側都在增長。

而且,它也提供了本文唯一一種測量工具的第二個實例。Erdős 案例是在相同結果能從公開模型重現之後,才落後地測量遭扣留的能力。這次實驗室發布輸出,而不是模型——一份說明、兩份 PDF 和一個 Lean 存放庫——這是另一種更弱的工具:它讓結果可以受檢視,卻無法讓能力接受測量,而且發布什麼由供應商決定。不過仍有用,因為任何人都可以檢查這項產物,而截至 2026-09-21,語料庫中還沒有人這麼做。

而且,按其定義,外界根本看不見它,這也讓人難以如實掌握。本文的 Erdős 故事是語料庫中唯一能用來測量這類落差的模式:OpenAI 的內部模型推翻單位距離猜想,之後又有人透過鷹架引導,以 $1K–$100K 的成本從公開模型誘導出相同結果。這種測量只能事後進行,而且只適用於最終證明能夠重現的結果——工具效力很弱,卻也是目前唯一可用的工具。

延伸閱讀#

  • Shared-Budget Compute Allocation——本文的悲觀鏡像。未開發空間主張已發布模型能做到的遠超過任何人付費挖掘的程度;Fan 等人則把預算交給模型,讓它自行挖掘,結果模型按照閱讀順序投入——選擇與最高價值密度問題的吻合度是機率水準(0.59,對照機率基準 0.59),與最早呈現問題的吻合度則為 0.76。未開發空間確實存在,而模型並不是消除它的代理
  • Evaluation Horizon Versus Release Cadence——相鄰落差及其成因:能力已挖掘卻遭扣留,而非已發布卻尚未挖掘;扣留的理由是評估窗口收窄的速度快於模型時程增長
  • Large-Scale Test-Time Compute——根本原因:只有在能力會隨著沒有人投入的預算而擴展時,未開發空間才會存在
  • Compute-Controlled Benchmarking——報告層面的對應概念:基準網格因為投入預算不足而低估能力,正是本文視為潛在上行空間的同一軸線
  • The Navier–Stokes AI Claim——遭扣留的一側落差又深了一個世代,並出現第一個公開產物:OpenAI 稱其為「能力顯著超越 GPT‑6 Astra」的模型,其輸出(說明、PDF、Lean 存放庫)已公開,模型本身則沒有——能受檢視,但無法測量
  • FrontierMath Erdős Benchmark——在單一模型內測量本文論旨,而非僅提出主張:每次嘗試固定 $300 時,發布前的 GPT-6 Astra 解出 68 道開放 Erdős 問題中的 2 道;脫離規範、提高預算並反覆嘗試後,同一模型解出 5 道,總成本超過 $220,000,對照之下,規範測試約為 $20,000——這種未開發空間真實存在、可以購買,但每多得到一項結果的邊際價格約為 $67,000。此研究也指出本文的實例是 Erdős 問題 90,並將其 Lean 形式化成本定為 120 萬行
  • AI-Driven Formal Proof Search——DeepMind 經 Lean 驗證的 Erdős 結果;與 OpenAI 非正式單位距離反證相對應的正式證明案例
  • Build for the Next Model——產品策略的反向選擇:「等下一個模型」(晚點挖掘,成本更低),或「為下一個模型打造」(現在就製作原型,讓新版本填補落差)
  • Task Time-Horizon Scaling——沒有人能測量的上限:發布週期短於把模型推向極限所需的時間
  • Responsible Scaling Policy Evaluations——盲點所造成的安全代價:未測量的能力上限,也是未測量的危險能力上限
  • Open-Weight Elicitation Irreversibility——沒有撤回機制的未開發空間:權重發布後,引出能力的預算便無上限而且永久
  • Inference Efficiency as Capability——每一代成本下降 10–100 倍,並拆解促成這種下降的各種因素
  • UK AI Security Institute——測量未開發空間的政府評估者:約 8% 的網路安全任務只有在 ≥10M tokens 時解出;「The Last Ones」則只有在 ≥30M 時解出
  • Noam Brown——來源人物
  • Azalia Mirhoseini——Large Language Monkeys 的資深作者;該 2024 年成果以涵蓋率表述了本文的核心論旨
  • CS329A: Self-Improving AI Agents (Stanford)——教授重複取樣是推論擴展起源的 Stanford 課程
  • Inference-Time Architecture Search——取得樣本後的處理方式:Archon 組合樣本,而不是從中選擇;其融合操作勝過完美選擇器
  • The Verifiability Thesis——挖掘未開發空間的關卡:長尾中蘊含涵蓋率,驗證器決定你能保留多少
  • OpenAI——推翻猜想,而且選擇不挖掘未開發空間的實驗室
  • Boris Cherny——產品側的陳述:「設限」/「產品未開發空間」、Claude Code 起源故事中解除 Sonnet 3.5 的限制,以及透過玩耍發現 OpenCV 繪圖能力
  • The 1% Rule for Wedge Selection——這項規則的主要失效模式就在未開發空間:創辦人若從已發布模型讀到 0% 成功率,測到的可能是尚未引出的能力,而非缺失的能力,並據此建立一間公司,利用兩者之間的落差
  • Dynamic Workflows: An Algebra for Agents——讓長時程編排能力得以展現的產品介面;其 Bun 改寫案例曾被解讀為本文「每一代都重新丟出任務」的建議奏效,但第一方說法(Jarred Sumner,case-study)描述的是一次性實驗,而非每代模型都測試——只有在某類工作的成本明顯崩跌時,未開發空間才被挖掘,而非依照固定時程(參見 Build for the Next Model)
  • Process vs Outcome Reward Models——試圖把涵蓋率轉化成準確率的選擇器,以及它們無法做到的兩個不同原因:共識看不見稀有但正確的答案,而訓練過的驗證器在候選項超過數百個後,精確率會下降。建設性的反向證據是,據報由人類標記的 PRM 能觸及正確樣本低於 5% 的問題——稀有度機制指出頻率式選擇在這種情況下做不到
  • RL from Execution Feedback (RLEF)——以樣本購買涵蓋率之外的訓練時替代方案。RLEF 的主要圖表以對數軸呈現解題率與取樣預算的關係;它會抬高整條曲線,讓更少樣本就能達到相同解題率——CS329A 第 2 至第 3 講主張把重複取樣轉移到訓練中,而 RLEF 則在驗證器免費的領域展示了這種做法
  • The Data Wall and the Validation Commons Are One Supply Constraint——將溫度約 1.2 的多樣性上限,從取樣細節提升為合成資料供應的限制:重複取樣與自我訓練仰賴相同燃料,而語料庫以三種方式各自指出上限(本文的溫度限制、AlphaCode 的分群注意事項、Multiagent Finetuning 的多樣性崩跌),都無法靠運算預算買到
  • Selection Under a Submission Budget——以符合現實的嘗試次數限制涵蓋率曲線。CS329A 第 7 講的 AlphaCode 示範指出,即使只有十次提交,對數線性趨勢仍然成立(曲線會下降,但不會趨平),並說明外推時的限制:取樣數增加 10 倍毫無幫助,除非新增樣本真的多樣化;而衡量這件事正是流程中分群步驟的用途

開放問題#

  • 如果每次發布都能讓成本降低 10–100 倍,那麼現在花大錢挖掘能力,什麼時候才有理性?(若實驗室要搶在競爭者之前取得特定結果,那就是「現在」;其他人很少會這麼做——因此未開發空間才不斷累積。)
  • 特定已發布模型的未開發空間有多大——有沒有辦法不必付出抵達上限的成本,就估計上限?(這是從安全工具角度解讀 Large-Scale Test-Time Compute 的預測問題。)補充(2026-07):AISI 正積極處理問題的兩個部分——根據較便宜的執行結果預測高預算下的表現,以及定義「最低資訊預算」(只有當投入更多運算仍不會讓可觸及的能力上升時,才算預算足夠;這正是「是否已抵達上限?」的測試)。問題尚未解決,但如今已是政府積極推動的研究計畫,而非尚未實現的願望。**2026-09-21,Announcing FrontierMath Erdős(empirical)部分回答了「上限有多高」,但完全沒有回答「如何不付費估算」。**Epoch 讓一個發布前的前沿模型,對 68 道精選開放 Erdős 問題各執行兩輪:採用固定規範($300 與 72 小時,每題一次嘗試)時解出 2 道;脫離規範、提高預算並反覆嘗試、採用不同設定時解出 5 道,總花費超過 $220,000,而規範測試約花 $20,000。因此,對這類任務來說,$300 預算以上的未開發空間已經測量出來,而且幅度小、成本高:總支出約增加 11 倍,只多解出 3 題,每多一項結果的邊際成本約為 $67,000,對照之下,便宜規範找到的兩題各花 $172–$222。內部細節最有參考價值——額外解出的三題每題都花超過 $300 上限,且每次嘗試成功率分別為 1/4、2/5 和 1/4;便宜找到的兩題則分別為 7 次全中與 5 次全中——因此,更高預算買到的多半是不可靠的解答,這正是估計上限時必須外推的形狀。問題仍未獲解答,而且仍是原本所問的那個問題:這些數字都不是事先預測,而是付費後才得到;其他四個模型也從未以超過 $300 的預算執行,因此仍沒有任何工具能從低成本執行結果讀出能力上限。Epoch 將缺少的實驗列為未來工作:測量每次嘗試的解題數如何隨預算增長,以及解題數如何隨嘗試次數增長。

已解決問題#

  • 鑑於同一項反向誘因也會阻止人們花預算找出潛在的危險能力,誰會稽核已發布模型的這類能力?**UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities 已於 2026-07-23 回答:**政府評估者會共同公開執行——UK AISI 與 US Center for AI Standards and Innovation 對 Moonshot 的 Kimi K3 進行評估,token 上限為 100M,並在模型 API 發布與開放權重發布之間公布結果。這個問題提到的反向誘因確實存在,但不適用於公共機構:兩個機構都不發布模型,因此不必面對等待下一代模型的權衡;這項評估之所以獲得資助,是因為模型發布本身觸發了評估,而非因為已知其能力。答案也必須附上三項限制,而非視為反證——稽核是透過供應商 API 進行的黑箱評估(並未使用權重),任務集因託管環境限制而具有「選擇性」,而且報告只呈現單一預算下的結果。因此,「由誰稽核」已經有答案;稽核是否能界定能力上限,則是上方尚未解決的問題。

資料來源#

  • CS329A Self-Improving AI Agents — Part 1: Course Overview——Stanford CS329A 第 1 講(Azalia Mirhoseini 與 Aakanksha Chowdhery,2025-09-22 授課,2026-08-03 發布,practitioner-opinion):Large Language Monkeys 的講解——1→10,000 個樣本、涵蓋率按對數線性成長、8B/7B 模型超越 GPT-4o 單次取樣分數、10,000 個樣本中有 3–4 個正確、溫度約 1.2 的多樣性上限,以及「模型其實已經知道的東西,比你只問一次時能從它們身上得到的多得多。」這是對 empirical 論文(arXiv 2407.21787)的課堂轉述;數字是從自動字幕逐字稿中的投影片讀取,應視為近似值
  • CS329A Self-Improving AI Agents — Part 2: Test-Time Compute Scaling——Stanford CS329A 第 2 講(Azalia Mirhoseini,2025-09-26 授課,2026-08-03 發布,practitioner-opinion):涵蓋率冪律及其困難問題長尾條件(70M→70B 個參數、Llama 3/Gemma/Pythia)、最難題目的稀有度為 10,000 次中僅 1 到 3 次成功、以輸出等價性驗證檢查 KernelBench CUDA 涵蓋率,以及 DeepSeek 在 SWE-bench 上以約 1,000 個樣本取得超過 Claude 3.5 Sonnet 與 o1-preview 的涵蓋率。數字取自自動字幕逐字稿中的投影片;為近似值,並記錄於 2025 年底
  • Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI's Noam Brown——No Priors 訪談(2026-06-26);Erdős 單位距離反證、「對已發布模型投入 $100K」的觀察、每個週期成本下降的迷因,以及 OpenAI 選擇不挖掘未開發空間(practitioner-opinion)
  • Noam Brown – Agent swarms, alignment, & recursive self-improvement——Noam Brown(OpenAI)與 Dwarkesh Patel,Dwarkesh Podcast,2026-09-17(practitioner-opinion)。僅引用 §01:01:18:未向外界發布、內部數學模型的存在、「不公平的優勢」這項判斷,以及沒有衡量權衡的方法。第一方說法,結構上無法外部查證——主張是 OpenAI 之外的人無法使用某個模型,因此沒有外部工具能檢驗。完整討論見 Evaluation Horizon Versus Release Cadence
  • On the Navier–Stokes Millennium Prize Problem——OpenAI(無署名),openai.com,2026-09-08,2026-09-10 更新,約 1,900 字,vendor-claim。本文僅引用一項主張:成果背後的模型「能力顯著超越 GPT‑6 Astra」,自 2026-08-28 起訓練,執行期間仍持續訓練——這些時間點為本節所述已挖掘但遭扣留的落差標示了日期,也使其進一步加深。結構上無法外部查證,與訪談相同:主題是 OpenAI 之外的人無法執行的模型。完整討論見 The Navier–Stokes AI Claim
  • Announcing FrontierMath Erdős——Adamczewski 與 Burnham(Epoch AI),〈Announcing FrontierMath Erdős〉,2026-09-01(empirical,網路文章,約 2,250 字):確認單位距離猜想是Erdős 問題 90、18 頁/120 萬行的形式化數字(形式化是由人類主導的獨立工作,github.com/plby/Erdos90),以及在 68 道開放問題上的 $300 規範測試與超過 $220,000 成本階梯。成本階梯所用模型是發布前的 GPT-6 Astra,因此這是對尚未發布模型未開發空間的測量;與本文討論的已發布權重中潛在能力相鄰,但並不相同。完整討論見 FrontierMath Erdős Benchmark
  • More compute, more capability: Why AI agent evaluations need to account for test-time compute——UK AISI(2026-07-02,empirical):已發布模型未開發空間的實測——約 8% 的網路安全任務只有在 ≥10M tokens 時才解出(部分需 50M),「The Last Ones」只有在 ≥30M 時才解出;1M→10M tokens 讓表現提升 +25%/+22%
  • Boris Cherny: We Cut 80% of Claude Code's Prompt——Cherny,YC 訪談(2026-07-27,practitioner-opinion):設限/產品未開發空間、Claude Code 解除限制的起源故事、交付稍微太難任務的建議,以及 OpenCV 繪圖能力的發現
  • UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities——UK AISI/US CAISI(2026-07-23,empirical,政府聯合評估):本文稽核問題的實例答案——第三方以 100M-token 上限測量開放權重模型的危險能力,並在 API 發布(7 月 16 日)與開放權重發布(預計不晚於 7 月 27 日)之間公布。透過 Moonshot 託管環境進行黑箱評估,採用託管環境允許的「選擇性網路安全評估項目」,且未個別指名美國比較對象
§ end
Cited by 32
Related articles
  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Compute-Controlled Benchmarking

    Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • CS329A: Self-Improving AI Agents (Stanford)

    Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…

  • The Open-Weight Frontier Gap

    Arena Text, June 2026: the top closed model leads the best open model by 33 Elo and the best *dense* open model by 57;…