H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translatedENHOWARDISM

情境優勢,而非品味

Andrew Ng 重新詮釋人類剩餘的貢獻:不是『品味』,而是資訊不對稱——『只要人類知道某些 AI 不知道的事,就需要人在迴圈中。』這將 wiki 最核心的開放問題(品味是天花板,還是下一個崎嶇山谷?)重新界定為類別錯誤,也讓人類的角色成為可彌補的工程落差,而非護城河——Ng 本人於 2026 年 8 月稍微修正了這種解讀,稱這種不對稱是『長期優勢』,不會有人『在幾年內』消除它。

Article metadata
Publication details
Published:July 9, 2026
Filed:Concept
Domain:AI Economics & Labor
Tags:GovernanceHuman AI CollaborationRole EvolutionTaste
Reading:19 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

《情境優勢,而非品味》的插圖

資料來源#

摘要#

在 2026 年 6 月一封主要談論迴圈分類的信中,Andrew Ng順帶提出一個觀點,悄悄重新界定了 wiki 最常被提出的問題:

「許多人把人類的這種貢獻稱為『品味』,但我更傾向把它看成人類擁有情境優勢,因為這讓我們更清楚該如何協助 AI 系統進步。這也說明了為什麼這個步驟無法自動化:只要人類知道某些 AI 不知道的事,就需要人在迴圈中,將那些知識注入系統。」

wiki 花了整整一頁探討品味究竟是真正的天花板,還是「只是 AI 系統暫時不擅長、之後就會做好的另一種 AI 能力」。Ng 的答案是:**兩者皆非——這是類別錯誤。**人們所說的品味,並不是人類擁有而模型缺乏的能力;它是人類擁有、但尚未提供給模型的知識。「我們對使用者以及產品必須運作其中的情境,知道得比 AI 系統多得多。」

這種重新詮釋並非表面修辭。它改變了人類角色的本質,也因此改變了什麼事情會讓這個角色終結。(practitioner-opinion——Ng 沒有提出測量結果,而是明確把這當作個人偏好。)

為什麼這種重新詮釋是關鍵#

它立即帶來三項後果,而且每一項都顛覆了 wiki 其他地方某項主張的方向。

1. 它讓人類角色可以被證偽。「品味」在定義上無法被證偽——你無法檢驗模型是否具備品味,只能看專家是否喜歡它的輸出。情境優勢則有明確的真值條件:*人類是否掌握模型沒有的資訊?*你可以列出那些資訊,也可以觀察清單逐漸縮短。

2. 它讓這個角色成為落差,而非護城河。Ng 偏好這個說法,理由本身就是工具性的:它「讓我們更清楚該如何協助 AI 系統進步」。護城河是需要防守的東西;落差則是需要彌補的東西。若按字面解讀,這句話——「只要人類知道某些 AI 不知道的事,就需要人在迴圈中」——一口氣說出了人類的必要性以及它的終止條件。相較於它取代的品味框架,這對人類角色能持續多久提出了更弱的主張,而 Ng 似乎正是有意如此。

3. 它把工作重心從培養轉向移轉。如果剩餘的關鍵是品味,應對方式就是培養品味。如果剩餘的是情境不對稱,應對方式就是引出並移轉——把知識從人類腦中取出,放進系統裡。這正是 Thariq Shihipar 的實地指南所教的事;該指南在四天後發表,且完全沒有引用 Ng。

觀點匯流:未知的已知,就是情境優勢#

Thariq 的四象限分析指出一個格子,稱為未知的已知:「明明顯而易見,讓我從來不會寫下來,但只要看到就會認出來的事。」

這就是從人類腦中看見的情境優勢。對持有者而言,它之所以隱形,原因和對模型而言相同——沒有人會把顯而易見的事寫下來。Ng 說,人類的價值在於知道模型不知道的事;Thariq 說,難處在於人類不知道那些事究竟是哪些。合在一起看:

  • **Ng 提供判準。**只要不對稱存在,人類就確切有其必要。
  • **Thariq 提供流程。**盲點盤點、訪談、原型和參考資料,都是在工作前、進行中和完成後,將資訊跨越不對稱傳遞的工具。

兩位實務工作者,相隔一週,彼此沒有引用對方,卻從兩端描述同一個事物。就人類實際上為了什麼而言,這是資料集中最有力的跨來源觀點匯流。

令人不安的含意#

如果人類的必要性來自資訊不對稱,那麼每一項移轉情境的產物都會縮小這種不對稱。[[agent-context-files|CLAUDE.md 和 AGENTS.md]]、技能、記憶檔、程式碼庫索引、源自實際生產環境的評估——整套外部化情境的工具,都是為了把人類知道的事,移到模型能讀取的地方。在品味框架下,這些工具會放大人類;依照 Ng 的框架,它們則會消耗人類的優勢,一次一個檔案,有意地逐步消耗。

這不是反對撰寫這些文件的論點,而是指出 wiki 最常建議的兩項做法——外部化你的情境,以及把人類判斷視為能持續存在的剩餘價值——兩者之間存在張力;Ng 的框架讓這種張力浮現。只有當不對稱再生的速度快於移轉速度,這些做法才相容:新使用者、新市場、新產品、新限制。究竟是否如此,是一個資料集中沒有人提出、更遑論回答的實證問題。

這種重新詮釋過於簡化之處#

Ng 的框架能很好地解釋部署層面的不對稱,卻不擅長解釋生成層面的不對稱。

  • 部署層面不對稱(Ng 說得對)。「我們對使用者以及產品必須運作其中的情境,知道得多得多。」這是私人資訊。原則上可以移轉,而這正是 Anthropic 的 40 萬次工作階段研究所測量的:對問題的領域理解——而非程式設計能力——能預測誰可以透過代理程式產出高品質工作。Anthropic 將專業知識回報隨時間下降解讀為「模型開始提供使用者目前帶來的關鍵判斷」的證據。依照 Ng 的框架,這並不神祕:這是情境落差正在縮小,而專業知識回報曲線就是觀察這個落差如何縮小的工具。
  • 生成層面不對稱(Ng 沒有處理)。DeepMind 的論點是,AI 可能受限於人類的概念架構——不是缺少某項事實,而是無法創始出用來表述該事實的概念。Boden 的第 3 級創造力也是如此:創造新的概念空間,不是能靠更好的情境移轉來彌補的資訊缺口。如果人類的貢獻在於能發明模型無法發明的框架,那麼「知道某些 AI 不知道的事」在技術上雖然屬實,整體而言卻極具誤導性。

因此,坦白說,Ng 消解了產品工作版本的品味問題,卻讓研究前沿版本繼續存在。這和他寫作時所處的領域一致:從 0 到 1 的消費性產品。在這種情境中,缺少的知識確實是「我女兒想在打字應用程式裡要什麼」,而不是一個新的概念空間。

從另一個稱之為品味的陣營而來的第三個觀點#

前述觀點匯流來自 Ng 和 Thariq,他們談的都是運作機制。一個月後,Akshay Nathan(OpenAI,生產力工程)從另一個陣營提出相同診斷——他用「品味」來形容瓶頸,接著又不假思索地將其解釋為資訊問題(Codex from 0 to 10M Users: Building ChatGPT Work - Akshay Nathan, OpenAI,practitioner-opinion):

「我很希望能用、但目前行不通的一種自動化,是替我帶來新點子。不知怎地,LLM 就是不行。有趣的是,點子並非憑空而來……它們通常有來源;在產品開發中,點子來自和使用者交談、回應你看到的摩擦或回饋,以及建立在你先前已規劃好的某些基礎之上。」

這是對能力不足的觀察,並附上一個正面的情境解釋:自動化失敗,而提出的原因不是模型缺少產生點子的能力,而是缺乏點子凝結而成的基礎資訊流。這是把 Ng 的判準套用在品味框架會認為人類無可取代的唯一任務上。這也是下方第三個開放問題的清楚例子——Nathan 描述的失敗,可透過更好的情境串接(持續將使用者對話和摩擦訊號輸入模型)來處理,而非仰賴更好的模型。請注意適用範圍:這是產品工作中的點子生成,屬於部署層面的不對稱,而非生成層面的不對稱——這裡完全沒有觸及抽象化屏障。

兩個月後,作者重新表述:「長期優勢」#

Ng 在 2026 年 8 月面向一般聽眾再次談到此事(Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think,Silicon Valley Girl,2026-08-28,practitioner-opinion),保留了運作機制,但改變了它何時終結的說法。運作機制沒有改變,並且有了最完整的實例:「把 AI 當資料科學家或腦力激盪夥伴時,它常會提出……一兩個好點子、兩三個普通點子,還有……四個糟糕透頂的點子,有時你會想,AI 怎麼會認為……那居然可能是個合理的點子」——而那些糟糕點子,對你來說「糟糕得不可思議地明顯」,因為你多年來「和客戶交談、看到有趣的表情……經理說,嘿……這對我真的很重要」。他明確指出這就是品味的本質:「解釋為什麼人類比 AI 有更好的判斷和品味的底層技術因素,就是這種情境優勢。」

改變的是這項優勢能持續多久。六月時,他偏好這個框架,因為它「讓我們更清楚該如何協助 AI 系統進步」——本頁建立在此說法之上的落差解讀。到了八月,他則說:「幾乎所有人類……都知道很多東西,但 AI 並沒有、而且我不認為在可預見的未來會有取得這些資訊的串接管道」;「這是一種長期優勢,沒有人能在幾年內解決」;他也把這個框架直接連到自己對 AI 不會迅速造成職場末日的論點——「AI 不會很快取代我們工作的原因之一,是人類擁有巨大的情境優勢。」同一位作者、同一層級、沒有新證據,因此這裡沒有取代舊說法;它是同一作者觀點隨時間的變化,而本文同時保留兩種解讀。善意解讀的話,兩者並不矛盾:落差在原理上可以彌補(六月),但實務上沒有人正在打造串接管道(八月)——也就是下方第三個開放問題,並以斷言作答。若較不寬容地解讀,「長期優勢」就是本頁認為這個框架已排除的護城河說法,如今卻由框架的作者自己採納。關鍵在於「串接管道」一詞:他已從資訊主張轉向基礎設施主張,而這種基礎設施正是代理程式情境檔案和源自實際生產環境的評估所代表的東西。

反方觀點:品味不只是資訊#

最有力的反駁是,「品味」所指的某些東西根本不是知識,而是不確定情況下的辨別能力——對多個選項擁有可靠的偏好排序,卻無法說明判斷標準。Thariq 的調色案例最能說明這點:他知道相關資訊(Claude 能產生多種變化),卻仍然無法繼續,因為他無法評估這些選項。他的解決方法是取得判斷標準——這正是 Ng 框架的更高一層解讀:缺少的是關於什麼才算好的資訊,而且可以取得。

資料集中最難的案例最後支持 Ng,這有助於證明重新詮釋的價值。設計將是檢驗之處:如果設計品味是情境落差,它就會縮小;如果它是在沒有可陳述標準下的辨別能力,就不會。

延伸閱讀#

  • GDPval Benchmark——把這種不對稱變成有薪工作的實驗;自 2026-09-10 起,引用的是原始論文的數據,而非講者的說法。GDPval 把一位在該職業平均有 14 年經驗的專業人士腦中所掌握的情境資訊,全部寫進提示中;再把它移除——改寫提示,省略資料所在位置、問題的處理方式,以及交付成果應有的樣貌,將長度縮至原本的 42%——GPT-5-high 的勝出或平手率便從 47.7% → 44.3%(只計勝出則為 43.3% → 39.8%)。指標變動 3.4 個百分點,而論文明確指出,質化層面的失敗比指標更嚴重:「模型難以掌握情境。」引用這項研究時有兩點須留意:該組實驗使用的是較早版本的黃金子集,因此其 47.7% 基準值不是正文中的 38.8%,兩者絕不可直接相減;而且此處的小幅下降確實存在歧義——它可能表示不對稱的重要性不高,也可能表示模型在一項指標幾乎沒評分的任務上失敗。講者的解讀仍是本頁主旨在職業情境中的表述:「人類基本上是在設計問題集合,然後模型就能去解決它們。」
  • Task Time-Horizon Scaling——以時間長短為這種不對稱標價:在內部提取請求上,缺乏程式碼庫情境的承包商,比維護者慢 5–18×;模型表現則與承包商的時間相符,因為模型也從未看過程式碼庫。時間跨度衡量的是聰明新手的表現,而新手的劣勢正是本頁所說的資訊落差。
  • Research Taste as the Human Bottleneck——本文重新詮釋的對象。它的核心開放問題(「品味是真正的天花板,還是下一個崎嶇山谷?」)預設品味是一種能力;Ng 認為它是一種不對稱,因此既不是天花板也不是山谷,而是會隨情境移轉逐漸縮小的落差。
  • Unknowns as the Agentic Bottleneck——萃取這種不對稱的流程;Thariq 所說的未知的已知,是從人類腦中看見這個概念。
  • The Three Loops of AI-Native Building——情境優勢解釋了為什麼人類位於中間迴圈:人類負責在了解使用者的迴圈與撰寫程式碼的迴圈之間傳遞資訊。
  • Returns to Expertise in Agentic Coding——觀察工具。如果人類角色是可彌補的情境落差,那麼測得的專業知識溢價下降,就是落差正在縮小,並由使用資料追蹤。
  • Outsource Your Thinking, Not Your Understanding——Karpathy所說的剩餘價值是理解力,比起「品味」更接近 Ng 所說的「情境」;兩者都將人類的定位放在知道什麼,而非欣賞什麼。
  • Agent Context Files——移轉機制,以及令人不安的含意:你寫下的每個技能檔,都會消耗一點自己的優勢。
  • The Abstraction Barrier——Ng 框架觸及不到的極端案例:受限於人類概念架構,不等於缺少一項事實。
  • Transformative Creativity——Boden 第 3 級創造力,展現了情境移轉無法彌補的生成層面不對稱。
  • Why AI Lags at Design——檢驗案例:設計品味要麼是情境落差(會縮小),要麼是在缺乏判斷標準下的辨別能力(不會縮小)。
  • Jagged Intelligence (Ghosts, Not Animals)——Ng 所取代的框架:「AI 暫時失敗、之後掌握的能力」預設了品味本身是一種能力。
  • Implementation Abundance Inverts Product Work——Ambrosino指出策展/品味是新的瓶頸,卻沒有追問品味究竟是什麼;Ng 提供了答案,讓瓶頸變得可能消失。
  • Engineer PM Convergence——實際後果:如果趨同的技能是貼近使用者,而非品味,那麼「以品味選才」就是一種會過時的策略。
  • Production-Sourced Evaluation——把情境移轉當作基礎設施:從實際使用中取得評估案例,能將人類對使用者的私人知識,移到模型讀得到的地方。
  • Andrew Ng——重新詮釋的作者。
  • AI-Assisted Error Analysis——對本頁重新詮釋最直接的反對意見,而且值得保留這項爭議。Shankar 同意人類的貢獻是 AI 缺乏的資訊(「什麼對你的產品來說才算好,存在你的腦中,不在追蹤資料裡」),但他認為這種落差在結構上無法彌補,而非工程落差:如果某個工具能完整找出並修復你產品的失敗,它就能對每個競爭者做同樣的事,於是產品就沒有任何差異。Ng 的不對稱是可彌補的領先優勢;Shankar 的則是護城河——同一種觀察,對它是否能持續存在做出相反預測。
  • Printing Press Software Democratization——Cherny 所說的「領域知識取代程式設計能力」,是本頁的重新詮釋以擴散形式呈現:撰寫會計軟體的會計師帶來的是情境,而非品味;Returns to Expertise in Agentic Coding則測量了這種情境如何發揮放大作用。

開放問題#

  • **不對稱再生的速度是否快於移轉速度?**依照這個框架,整個人類角色都取決於答案。資料集中沒有人提出過這個問題。
  • Ng 偏好這個框架,因為它「讓我們更清楚該如何協助 AI 系統進步」。這是採用此框架的理由,不是它為真的證據。實證上,什麼能區分情境不對稱與能力落差?(Returns to Expertise in Agentic Coding是最接近觀察工具的研究。)
  • 如果人類的貢獻是注入情境,那麼人類是否能被更好的情境串接管道取代——例如記憶、檢索和持續的生產環境遙測——而不是被更好的模型取代?這表示人在迴圈中的終止時機,取決於基礎設施規劃,而非模型規模曲線。**Ng 在 2026 年 8 月的回答是斷言:**他認為這種串接管道「不存在,而且我不認為可預見的未來會出現」——這是對規劃的看法,不是證據。
  • Ng 從 0 到 1 的消費性產品領域出發。當缺少的是概念而非事實時,這套框架還能成立嗎?部分已有答案(2026-09-22):訓練新手思考,還是提供 LLM?來自 RCT 的證據(empirical,預先註冊的 2×2 RCT,n=1,053)是本資料集中首個隨機測試在實驗中向人類一方提供概念,而非事實的研究。一半受試者接受約 6 分鐘的因果推理訓練(機制、可證偽的邊界條件、明確的原因→結果鏈);另一半使用 ChatGPT Edu;兩種條件交叉組合。概念確實被學會:機制辨識提高約 0.55 SD,證偽邏輯約 0.85 SD,解答之間的想法多樣性約 0.47 SD;即使能使用模型,這些能力也沒有被排擠。概念卻沒有帶來成效:在評分輸出中,它的係數為負值(−0.111,p<0.01),而 LLM 使用權帶來 +0.862 的效益,控制組平均分為 2.09。因此,這個框架仍然成立,但必須收窄為有條件的說法——人類提供的內容,只有在評估者要求時才具有決定性。這裡並非如此:評分規準偏重模型輸出的連貫性與點子數量,卻對可證偽性(−0.109)、機制(−0.166)以及與最常見答案的差異(−7.676,約為新穎性每增加 1 SD 就扣 0.29 分)給予負面評價。解讀範圍有兩項限制。受試者是完全沒有領域情境的新手,正好與 Ng 談論的族群相反;而且研究刻意選擇模型已受充分訓練的任務,因此從設計上來說,它是在情境落差最小的地方測試這套框架。研究測量的是工具輔助下的輸出,從未撤除工具,因此無法說明概念是否已內化。

資料來源#

  • GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan 等人(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(empirical)。本文引用附錄 A.2.7 和圖 15(情境不足組:提示長度是原本的 42%,GPT-5-high 勝出或平手率從 47.7% → 44.3%,以及論文附帶的較早黃金資料集提醒),並引用第 5 節所述限制:GDPval 任務的規格明確,而且依設計採單輪完成。完整分析與利益衝突揭露見 GDPval Benchmark。
  • Thread by @AndrewYNg — Andrew Ng,The Batch,發表於 2026-06-30(practitioner-opinion);情境優勢段落位於開發者回饋迴圈一節。
  • A Field Guide to Fable: Finding Your Unknowns — Thariq Shihipar,2026-07-04(practitioner-opinion);將未知的已知視為同一事物,並以調色案例作為難題。
  • Codex from 0 to 10M Users: Building ChatGPT Work - Akshay Nathan, OpenAI — Latent Space,2026-07-28(practitioner-opinion);Akshay Nathan 自動化「替我帶來新點子」失敗,並將原因解釋為缺少基礎資訊流,而非能力不足。
  • Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think — Andrew Ng 接受 Marina Mogilko 訪問,Silicon Valley Girl(2026-08-28,practitioner-opinion):腦力激盪點子的例子、「品味背後的技術因素」,以及「長期優勢」/「串接管道不存在」的重新表述,緩和了六月關於落差的解讀。自動字幕逐字稿。
§ end
Cited by 25
Related articles