H
Howardism
Plate IISuperintelligence Trajectory機器翻譯 · machine-translatedENHOWARDISM

研究品味作為人類瓶頸

隨著 AI 接手執行工作,人類角色逐漸收斂:選擇哪些問題重要、哪些結果值得信任,以及何時某種方法已走入死胡同;這是自主階梯的最高一階,而開放問題在於,品味是否只是 AI 暫時不擅長、終將掌握的另一項能力

Article metadata
Publication details
Published:June 7, 2026
Filed:Concept
Domain:Superintelligence Trajectory
Tags:GovernanceHuman AI CollaborationResearchRole EvolutionAnthropic
Reading:22 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

描繪研究品味作為人類瓶頸的插圖

資料來源#

摘要#

當 AI 接手 AI 開發中的執行工作(AI Accelerating AI Development),人類角色便收縮為一種餘留能力;《When AI builds itself》一文稱之為研究品味與判斷力:「選擇哪些問題重要、哪些結果值得信任,以及何時某種方法已走入死胡同。」這是自主階梯的最高一階,也是唯一一項若仍由人類掌握,就能阻止遞迴自我改進閉合迴路的能力。它是否仍會留在人類手中,是本文承重的未知因素。

角色逐步收斂#

文章對這種動態最明確的說法是:「人類在 AI 開發流程中的角色,每一步都在收窄。」具體有兩種收窄方式:

  • 從撰寫轉為審查。「一旦人類撰寫與 AI 撰寫的程式碼品質達到平手,人類就會完全停止寫程式,轉而只做審查。」(據報目前大致已達平手;見 AI Accelerating AI Development。)這是從人類角度描述的harness 收縮。
  • 從執行轉為選擇實驗。「一旦 Claude 能夠執行實驗,問題就會轉向:『這些實驗裡哪些值得做?』」執行——撰寫程式碼、進行實驗、產出結果——「如今幾乎不再耗費人類時間,即使仍會消耗運算資源。」

「目前」人類剩下的比較優勢是品味:判斷什麼值得投入運算資源。用 Compute Allocator 的說法,人類成了整個研究計畫層級的運算資源分配者,而非單次呼叫的分配者。

為何它未必會一直屬於人類——「只是另一項能力」#

文章拒絕把研究品味視為人類永久的護城河。兩項論點與此相左:

  1. **苦工可以自動化,而那才是大部分工作。**天才是「1% 靈感加上 99% 汗水」;那 99%——擴大規模、觀察問題、修正、重試——正是 Claude 擅長之處。大規模研究進展「大多取決於工具與資源」。(見 The Bitter Lesson、Recursive Self-Improvement。)
  2. **品味的能力曲線與其他一切相同。**研究判斷力正在改善的早期證據——在困難的迂迴時刻,Claude 選擇下一步勝過人類的比例從 51% 提升到 64%(AI Accelerating AI Development)——暗示「研究品味或許只是另一項 AI 能力:AI 系統暫時做不好,之後就會擅長。」先例包括:AI 曾經不擅長、後來卻能解釋笑話為何好笑、展現心智理論,以及解出語言謎題——這些都是原本被認為符合人類特質的質性技能。這是 Jagged Intelligence (Ghosts, Not Animals) 樂觀的一面:今日的低谷,明日便是高峰。

一位前沿研究者的實務解讀,站在「只是另一項能力」這邊。Noam Brown(OpenAI,practitioner-opinion)表示,模型能將他在撲克研究中設計的演算法最佳化 10 到 100 倍,卻還無法發明出更好的演算法——「我可以給它很多時間,它還是做不到」——因此現今的模型「是研究者非常好的互補力量」,「還不能完全取代整個研究週期」。但他明確預期這種情況會改變:「我不會意外某個時候——就像程式設計、數學一樣——突然出現一個轉折點,模型變得真的夠好……我也不會意外研究品味會遇到同樣的轉折點。」這是鋸齒狀低谷論點,由一位身處實驗室、親眼觀察低谷的人說出。

Anthropic 員工給出的坦白反論是:「截至目前,人類的比較優勢仍在於看見更大的整體圖景,並思考眼前任務範圍以外的事。」問題在於,「截至目前」究竟是穩定均衡,還是逐漸遠去的前沿。

第三種答案:它根本不是一種能力#

上述兩種論點——品味是持久護城河,或是下一個鋸齒狀低谷——都預設品味是能力,是一種心智能擁有或取得的東西。Andrew Ng 否定這個前提(2026 年 6 月,practitioner-opinion):

「許多人把這種人類貢獻稱為『品味』,但我比較喜歡把它看成人類擁有脈絡優勢,因為這樣能更清楚地指出如何幫助 AI 系統進步……只要人類知道某些 AI 不知道的事,就需要人在迴路中把這些知識注入系統。」

依照這種解讀,餘留的不是一種心智能力,而是資訊不對稱——人類認識使用者、限制條件、歷史脈絡,以及那些顯而易見到沒人寫下來的事。如此一來,人類角色便可被驗證(不對稱是否存在?)、會隨時間消失(脈絡移轉後便會消除),而且是工程問題,不是神祕特質。這也表示本頁圍繞的問題——天花板還是低谷?——可能問錯了。完整討論見脈絡優勢,而非品味,包括這種重新定位的不足之處:它解釋了部署上的不對稱(我了解自己的使用者),卻無法解釋生成上的不對稱(The Abstraction Barrier、Transformative Creativity);後者缺少的是概念,而非事實。

兩種框架對於何種證據才算數,意見不同。Agentic Coding 中的專業知識報酬是區分兩者的工具:若專業知識溢價下降是因為模型取得了判斷力,品味就是一種能力;若下降是因為脈絡移轉改善,品味從頭到尾都是一種不對稱。

缺少的另一半:如何培養品味#

上述論點都在討論品味是否持久,卻沒有人討論它是否可教——這點很重要,因為如果人類剩下的角色是品味,而品味是天生的,這個角色就無法擴展到新進入者。Jeff Dean(YC Startup School 2026,practitioner-opinion)是這批資料中第一個把品味視為可訓練、並提出訓練方法的來源。他從與 Brown 相同的立場出發——被問到代理程式寫完所有程式碼後什麼會變得稀缺,他回答「對於交給代理程式處理哪些工作,要有極佳的品味」,並補充「我認為模型未必會很擅長這件事」——接著拒絕讓它停留在神祕層次(「品味並沒有可衡量的客觀標準」)。

以下三種機制,依刻意程度由低至高排列:

  • **累積廣泛的過往問題經驗。**傳統答案:做過許多不同的事,能讓你學會「哪些東西也許只要把先前的方法拼湊在一起,就剛好有可能做到」。
  • 為自己的預測打分。這才是真正可操作的方法:「寫下你認為未來 12 個月可能重要的許多事情。或許你會挑一件來做,但 12 個月後再回頭評估:其他哪些事情實際上看來很重要,哪些事情是世界上的其他人出去實現的,哪些又似乎尚未發生。這能為你自己的品味養成能力提供更多樣本。」做法是替自己製造訓練資料——你未曾選擇的反事實分支會由世界評分,因此一年工作能產生 N 個有標籤的範例,而非只有一個。
  • **刻意挑戰一項關鍵假設。**他的實際例子是:60 年來,晶片製造都假設每片晶片相同、位元不會翻轉;大型分散式系統卻反其道而行,假設零件不可靠,並在其上建立可靠性——那麼,如果電晶體每天出錯 20 次,你會用它們打造什麼?他明言,多數這類實驗都會失敗(「過去 50 年我們一直這麼做,背後有非常充分的理由」),這正是重點:收穫在於取樣,而非命中率。

為何這會重新界定本頁的核心問題。如果品味是個樣本效率問題——只有少量、代價高昂且評分緩慢的觀察,能告訴我們什麼才重要——那它既不是永久的護城河,也不是一般的能力,而模型落後的原因也就很清楚:訓練訊號要等 12 個月才會到,而且大多是沒有人記錄的反事實。這是第三種立場,與 Ng 的資訊不對稱論和天花板/低谷兩種說法並列,也有一個明確的切入點——把預測寫下來,讓模型之後能看見評分。Dean 沒有直接提出這個推論,但它是從他自己的方法推導而來。

有一項組成能力已經有了量化結果#

上述論點都關乎一種沒人評分的能力——文章自己對它的定義(「選擇哪些問題重要、哪些結果值得信任,以及何時某種方法已走入死胡同」)提到三件事,卻沒有一件有排行榜。中間那項如今已有量化結果。ForecastBench(Forecasting Research Institute,2026-07-16,empirical)以相同的真實世界問題評估 AI 系統與頂尖人類超級預測者,並以現實結果作為答案;2026 年 7 月的結果顯示,有幾個參賽系統在統計上與超級預測者的中位數無法區分。其中一個系統 Cassi AI 的流程,在市場問題上的排名高於中位數(77.7,N=92;中位數 75.9,N=56);這類問題佔基準的一半,考驗的是新穎、一次性的事件,而不是基本率查找。超級預測是現有最清楚的操作化方式,用來衡量不確定情況下的校準判斷力;其參照組也是已知最強的人類基準,因此這是 wiki 首次能為「品味」的某個組成部分報出數字。不過,結論應謹慎限定:相對於「準確度相同」的虛無假設,p 值為 0.41,只代表無法拒絕虛無假設,而非證明兩者相等;人類基準是 2024 年取得,並被外推至之後的年份;此外,FRI 既執行這項基準測試,也提供了人類基準。完整討論見人工超級智慧 (ASI)。

**記錄下來的範圍界線,而非略過,因為真正有意思的分歧就在這裡。**預測一個可判定結果的問題,並不等於研究品味;兩者的差異正是本頁一路探討的內容:

  • **問題已經提供。**ForecastBench 的題目在提出時,已附有預先指定的判定標準。「選擇哪些問題重要」這件事,在開始評分前就已被移除——但它正是文章自身定義的第一項。
  • **評分免費且快速。**市場和時間序列會按時程揭曉結果;排行榜只需約 225 個已揭曉的資料集問題(約 10 天),就能為參賽系統排名。這與 Dean 指出的品味難以培養的原因恰恰相反。
  • 輸出是對既定命題給出機率,而非創造新的概念空間。這裡沒有觸及 The Abstraction Barrier 或 Boden 第 3 級(Transformative Creativity)——餘留能力中負責生成的部分,並沒有因為別人提出的問題上出現一個校準數字就受到影響。

因此,誠實的帳目是:哪些結果值得信任如今已能量化,且有人主張機器在這方面已達到人類水準;哪些問題重要以及何時方法走入死胡同,則還未出現在任何排行榜上。

**最直接的連結是 Dean 的培養方法,而結果恰好對他不利。**他唯一真正可操作的品味養成機制,就是為預測評分:「寫下你認為未來 12 個月可能重要的許多事情……12 個月後再回頭評估其他哪些事情實際上看來很重要。」他提出這個方法,正是因為有標籤的資料稀缺——一年的工作只能產生少數幾個樣本。ForecastBench 則是將這套方法工業化:持續更新的問題供應、自動判定結果、數以千計的預測評分,以及公開排行榜。**本頁唯一具體到足以成為操作方法的品味養成機制,碰巧也是有了機器基準測試的那一項;而機器已達到人類最佳基準。**這對其他兩種機制(廣泛的過往問題經驗、刻意挑戰關鍵假設)毫無說明,而它們恰恰都無法簡化成有分數的命題。樣本效率的解釋仍然成立,只是不再表示人類在樣本取得成本低廉的這項能力上具有優勢。

**這也是 Ng 重新定位論的一項數據點,而且是有利的。**這個排行榜頂尖系統的優勢,並非來自權重中更好的判斷力。Cassi 的架構是一套多階段流程:產生子問題和搜尋查詢、檢索最新脈絡、依相關性與新近程度篩選,接著集成多個模型,再讓另一個模型分析推理過程。這是以工程流程取得脈絡——透過系統設計消除資訊不對稱,而非仰賴某種心智能力。如果最先被取代的品味組成部分,正是檢索流程能處理的那一項,那麼在這一回合中,資訊不對稱的解讀更有說服力。

第三方評估者指出同一個缺口(2026 年 9 月)#

METR 對 Claude Opus 5.5 的部署前評估(empirical),從 Anthropic 之外也採用了相同用語:要實現完整的 AI 研發自動化,還受阻於「在遠見、預測、建立自身回饋迴路方面的大幅進步」以及研究者判斷力;METR 的證據並未顯示 Opus 5.5 在這些方面有重大進步。這只是一句佐證,沒有帶來新的細節——沒有新機制,也沒有直接衡量品味——但這是本頁所說的餘留能力,首次由評估者重述,而非 Anthropic 或評論 Anthropic 自家產品的實務工作者提出。完整評估見 AI R&D Autonomy Evaluation (AECI)。

無論如何都是瓶頸#

即使品味仍屬於人類,它也會成為整條流程的限制條件——也就是Amdahl 定律的瓶頸。如果人類審查程式碼的速度跟不上 Claude 生成程式碼的速度,「人類審查就會成為 AI 開發的瓶頸」。如果人類把大部分時間花在只佔工作一小部分、負責設定方向的任務上,每個人就能引導多得多的工作量——於是人類判斷的品質與產出量便成為稀缺資源,正如驗證成為新瓶頸對驗證工作的預測,以及 HBR 的問責機制重新設計研究對監督工作的預測。風險在於,人類名義上做決定,實際上卻只是照單全收(「與取代資深研究者還差得遠」的判斷,悄悄退化成形式程序)。

人力代價(較少被談及的一面)#

文章收錄了少見的坦率員工引言,描述角色收窄給人的感受——值得記錄,因為它們指出了生產力圖表看不見的代價:

  • 小忙互助所構成的禮尚往來消失:請同事「能不能幫我把這個指令稿跑起來?」會「形成一點人情債,帶來一點彼此的了解。[Claude] 更快,也完全不欠人情,但每一次這樣的互動都失去了一次人類合作的機會。」
  • 對自身相關性取決於情況而產生的暈眩:「在一切都運作順利的日子,我忍不住會想,我做的事都不重要……但有些日子什麼都壞了,我不知道原因,這才意識到自己已經完全不知道最近在忙什麼。」

相關連結#

  • 結構化安全論證(主張分解) — 最重要的範圍排除:Anthropic 承認,已知的錯位可能對安全研究造成差異性損害,因為安全工作特別常由模糊、無法驗證的任務構成;但評估時仍將這項疑慮排除

  • 遞迴自我改進 — 品味是否仍屬於人類,決定三種未來情境中哪一種會實現;這是文章的核心未知

  • AI Accelerating AI Development — 顯示執行工作已被接手、品味因此成為餘留的證據

  • AI R&D Autonomy Evaluation (AECI) — 「與取代資深研究科學家/工程師還差得遠」是「品味仍屬於人類」的正式說法

  • Jagged Intelligence (Ghosts, Not Animals) — 笑話/心智理論先例,說明一種 AI 暫時不擅長、之後卻會掌握的能力;品味是目前的低谷

  • Autonomous Scientific Discovery — Mythos 5 自主生成假設(偏好度約 80%,高於 Opus 級模型)以及基因組學研究中「只需高階人類輸入」,都是對品味護城河的具體衝擊

  • 驗證成為新瓶頸 — 如果品味/審查跟不上生成速度,判斷就會成為限制條件

  • 模型進步帶來的 Harness 收縮 — 從 harness 角度呈現同一種角色收窄動態;面向模型的 harness 消解後還剩下什麼

  • Compute Allocator — 將品味用於資源分配:決定哪些實驗值得耗用運算資源

  • The Bitter Lesson — 「研究進展大多取決於工具與資源」這項苦澀教訓,直接指向品味本身

  • The Abstraction Barrier — DeepMind 提出的理論論證:品味/新概念發現可能是個真正的天花板,而非下一項即將被掌握的能力;AI 可能受限於人類的概念框架

  • Transformative Creativity — Boden 第 3 級(創造新的概念空間)是在概念空間前沿運用品味;這是「Einstein 測試」版本的護城河

  • Multi-Agent Collective Intelligence — 引導大規模、速度超越人類的代理程式群體(其產出超出人類完整吸收能力),是集體路徑下品味的具體形式

  • Instrumental Convergence — 尋求知識的目標,是另一種將判斷力理解為正和資訊增益,而非稀缺人類品味的框架

  • 人工超級智慧 (ASI) — 當系統從 AGI 跨入 ASI,品味/判斷力是可能仍由人類保有的能力;這也是品味首個量化組成部分的所在:AI 參賽系統已達到超級預測者中位數,而此測量工具的辨別範圍也在該基準處止步

  • Agentic Coding 中的專業知識報酬 — 這個「品味是否持久?」問題在勞動資料上的實例:Anthropic 把領域專業知識報酬隨時間下降視為一項訊號,表示「模型開始提供使用者目前帶來的關鍵判斷力」——品味只是另一項能力,並可從使用情況中追蹤

  • 規劃/執行的勞動分工 — 把照單全收的風險具體化:名義上由人類掌握約 70% 的規劃決策,但這種控制究竟是真正判斷,還是預設批准,正是「如何衡量照單全收?」這個問題

  • Implementation Abundance Inverts Product Work — 品味與產品工作的對應版本:實作成本下降時,策展/品味會成為昂貴的一步,正是此處所說 AI 研究中餘留的能力

  • AI 為何在設計上落後 — 設計品味是人類作為獎勵函數的持久優勢之一;這是一個品味護城河維持較久的具體領域

  • 角色平均化,而非角色消失 — 「品味塑造者從一開始就引導」同樣有照單全收的風險:如果引導只是預設批准,就不是真正的引導

  • 脈絡優勢,而非品味 — 第三種答案:Andrew Ng 主張品味不是一種能力,而是一種資訊不對稱,因此既非天花板也非低谷,而是可以消除的差距;這套說法解除了本頁對產品工作的核心提問,但在研究前沿上仍未解決

  • 未知因素是代理式工作的瓶頸 — 若餘留的是脈絡而非品味,回應方法就是引出脈絡;Thariq 的盲點測試與訪談,是將脈絡挖掘出來的操作方法

  • Noam Brown — 一位前沿研究者的實務解讀:模型能將他的演算法最佳化 100 倍,卻「暫時」還無法發明更好的演算法;他預期研究品味也會像程式設計和數學一樣迎來轉折點

  • Jeff Dean — 本頁其他內容略過的培養面向:品味是一個樣本效率問題,並有一套操作方法(寫下 12 個月的預測,再依世界實際做出的成果評分),能為這項缺乏訓練資料的技能製造有標籤資料

  • 程式碼產出帶來的研究者提升 — 這種分工的量化影子:Kwa 的模型為程式碼/工程提升定價,並把研究判斷視為尚未建模的餘數(假設非程式碼提升為零),與 Anthropic 所說「提升集中於工程執行,而非研究判斷」相符;非程式碼提升若量測值大於 1,就代表品味開始被掌握

  • AI-Assisted Error Analysis — 同一瓶頸出現在產品規模而非研究規模;本文集對實務中表達品味的代價,有最具體的描述:第一次檢視時看不見、第三次檢視後卻無法忽視的失效模式(反覆出現的字是「重要」),以及一位實務工作者的判斷:驗證代理程式提出的分類法,比自己撰寫分類法更費力

  • Claude Opus 5.5 — METR 的部署前評估從 Anthropic 之外重述判斷力缺口(「遠見、預測、建立自身回饋迴路」),是第一個使用本頁自身用語的非 Anthropic、非實務工作者來源

開放問題#

  • 研究品味是真正的天花板(架構上無法透過擴大規模達到的能力),還是下一個待填補的鋸齒狀低谷?文章稱這是決定性的未知。有爭議的前提:Ng 主張,這個問題預設了品味本身就是一種能力。
  • 如果品味可以自動化,那麼 AI 開發中還有什麼(如果有的話)會是人類持久的比較優勢?**部分回答(2026-08-12),以排除法得出:**有一項能力已從清單中剔除。在可判定結果的問題上進行校準機率判斷——「哪些結果值得信任」——最強的人類參照組與有支架的 AI 流程,在 ForecastBench 上已不再有明顯差別;而領先的流程靠的是檢索和集成,而非累積的判斷力。尚未量化的是文章自身定義的其餘部分:選擇哪些問題重要(評分開始前題目就已提供),以及判斷何時已走入死胡同。這項排除比看起來更重要,因為這原本是最有希望被量化的組成部分——剩下的項目之所以還留著,部分原因正是沒人知道如何評分。
  • 如何衡量照單全收?即使紙面上「由人類設定方向」屬實,真正的判斷力仍可能悄悄轉移給模型。

資料來源#

§ end
Cited by 32
Related articles
  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Task Time-Horizon Scaling

    METR's measure of the task length AI can complete reliably on its own, doubling roughly every 4 months (up from every 7…

  • Intelligence Explosion Dynamics

    The growth-curve question behind recursive self-improvement: whether AI-accelerating-AI produces exponential, super-exp…

  • Context Advantage, Not Taste

    Andrew Ng's reframing of the residual human contribution: not 'taste' but an information asymmetry — 'so long as the hu…