H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

受控變異:AI 的優勢在於降低離散程度

Jabarian 與 Henkel(arXiv 2607.28222):一項預先註冊的自然場域實驗,將 70,884 名求職者隨機分派給 AI 語音面試官或人類招募人員——錄取率 8.70%→9.73%(+12%),到職率 +18%,一個月留任率 +18%,生產力沒有下降,而且兩組的每項聘用決策都由人類做出。作者將其機制稱為 *受控變異*:AI 更一致地遵循公司的面試流程(主題順序 τ 0.53 vs 0.33、問題相似度 0.59 vs 0.43,跨面試變異顯著較低),同時仍會依每位求職者調整,並使用 *更豐富* 的詞彙——AI 勝在離散程度較低,而非能力更強。這是 wiki 中唯一一項關於 AI 在專業對話任務中取代人類的隨機因果估計

Article metadata
Publication details
Published:August 4, 2026
Filed:Concept
Domain:AI Economics & Labor
Tags:WorkforceEconomicsHuman AI CollaborationMeasurementEmpirical
Reading:33 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

《受控變異:AI 的優勢在於降低離散程度》插圖

資料來源#

摘要#

受控變異是 Brian Jabarian 與 Luca Henkel 對一種機制的命名:AI 代理在一項高度仰賴人力的任務中勝過人類專家,不是因為它在任何一場面試中都更聰明,而是因為它能以較低的跨面試離散程度執行相同流程,同時在每場面試中保持因應能力。主張是,AI 在資訊蒐集上的優勢是一種變異特性,而非平均能力特性——「AI 可以藉由降低資訊蒐集的變異,改善公司的成果」。

證據來自一項預先註冊的自然場域實驗(AEA RCT Registry #15385、UChicago IRB),由 PSG Global Solutions(Teleperformance 旗下的招募流程外包子公司)於 2025 年 3 月 7 日至 6 月 7 日進行:菲律賓入門級客服職缺共 70,884 份申請,其中 67,056 份隨機分派至三組——AI Interviewer(40,103)、Human Interviewer(13,557)、Choice of Interviewer(13,396)。每一組的逐字稿、音訊和測驗分數都由人類招募人員審閱,並由人類做出聘用決定。只有誰進行面試有所不同。這項設計正是整個研究的關鍵:它清楚區分資訊蒐集階段(自動化)與評估階段(未自動化),並測量只將第一階段交由 AI 處理時,公司成果如何改變。

證據說明。 empirical,也是本知識庫經濟學分類中因果設計最紮實的研究:隨機分派、預先註冊、以行政資料記錄成果(錄取、到職、留任、離職、績效分數),並連結面試逐字稿——不是遙測資料、不是問卷,也不是推估。另有兩點應一併考量。(1)揭露事項:預先註冊的資料蒐集於 2025-06-07 結束;兩個月後,也就是 2025-08-01,Jabarian 接受合作公司無薪首席經濟學家職務,並依原有出版權利將研究合作延長五年。合作方提供資料,但沒有參與分析或出版決策。這項職務是在資料蒐集後才開始,但不是在文章撰寫後才開始。(2)研究從未指出 AI 系統的身分——沒有模型、供應商或版本資訊。Google Cloud 提供基礎設施與工程支援。因此,研究結果無法歸因於任何具名模型,也無法以任何具名模型重現。

實驗證明了什麼#

以下數字皆來自論文正文(見 Sources 中的解析說明)。無條件樣本比較所有隨機分派至 AI Interviewer 與 Human Interviewer 的人——這是意向治療對比,因此已包含 AI 本身的失敗。

結果(所有隨機分派的求職者)人類AI效果
收到工作錄取8.70% (1,179/13,557)9.73% (3,904/40,103)+1.03pp, +12%, p<0.001
開始工作5.65%6.71%+18%, p<0.001
任職 ≥1 個月4.97%5.85%+0.88pp, +18%, p<0.001
任職 ≥2 個月——+17%, p<0.001
任職 ≥3 個月——+16%, p=0.003
任職 ≥4 個月——+17%, p=0.015

只看接受錄取的人——這會排除錄取率管道,並檢視 AI 來源的邊際新進員工是否較差——增幅雖縮小,但在較短期間仍然存在:到職率 68.84% → 73.36% (p=0.003),任職 ≥1 個月 60.60% → 64.32% (p=0.025),≥2 個月 55.62% → 59.13% (p=0.038)。三個月與四個月時,條件差異仍為正(+5%、+7%),但在縮小的樣本中已不再顯著(p=0.16、p=0.25)。因此,效果不能簡單解讀為「多錄取了較差的候選人」。

有三項比標題數字更重要的檢查:

  • 穩健性。 加入性別、申請來源、處理前互動分數、重複申請者狀態,以及週/招募人員/城市/職缺刊登固定效果,估計值幾乎不變(錄取效果 0.0104 → 0.0101)。將標準誤的群聚層級從求職者改為招募人員會使標準誤擴大,但錄取、到職與一至三個月留任仍達顯著;四個月效果在招募人員群聚後不再顯著(0.0038,ns)。長期效果尾端是結果中最薄弱的部分。
  • 不是少數離群招募人員造成。 各組招募人員層級的錄取率相關係數為 ρ=0.87,且69% 的招募人員對 AI 面試的求職者給出較高錄取率。效果相當普遍,並非由少數 AI 擁護者帶動。
  • 在處理組內有 12% 失敗率的情況下仍達成。 7% 的 AI 面試因語音代理技術故障而中止,另有 5% 的求職者因不願與 AI 對話而掛斷電話。這些失敗都計入 AI 組,並拉低意向治療估計值。+12% 是扣除這些失敗後的淨效果。

研究沒有證明什麼#

這裡能否精確解讀,正是正確閱讀論文與過度解讀之間的差別。

  • 錄取率上升不等於聘用品質提高。 論文的品質代理指標是留任 ≥1 個月,作者坦承這只是代理指標——其理由是高流動率 BPO 市場中雙方摩擦都很低(年離職率最高約 60%),公司會迅速解雇表現不佳者,員工離職也不會受罰。還有一點並非題外話:這也是公司領取報酬所依據的指標:客戶依據至少留任一個月的聘用人數向 PSG 支付報酬。改善的結果,正是招募人員自身的營收指標。
  • 生產力結果是沒有差異,不是提升,而且只涵蓋子樣本。 對有觀測資料的員工而言,平均處理時間、雇主品質保證分數或顧客滿意度分數都沒有顯著差異。論文自己的解讀恰如其分:這些效果「沒有伴隨員工生產力下降」。這表示沒有證據顯示受損,而非證明品質有所改善。離職組成也未改變(自願離職:人類 58.25% vs AI 58.81%,p=0.95)。
  • 研究沒有測量超過四個月的結果,而四個月估計值正是在招募人員群聚後失去顯著性的那一項。沒有升遷、薪資成長、客戶價值或長期績效結果。
  • 機制是描述性的,不是因果性的。 隨機分派識別的是處理對錄取、到職與留任的效果。逐字稿分析——主題涵蓋、順序遵循、求職者語言特徵——只是對兩組差異的觀察性描述,論文也始終使用「相關」一詞。受控變異是對原因最合理的解釋,但本身並未被識別。

機制:一致但不僵化#

公司提供結構化指引——14 個可能主題、建議順序、範例問題——同時保留相當大的客製空間。AI 代理取得相同指引。以下數據來自 34,109 份逐字稿:

面試官行為人類AI
涵蓋 14 個主題的比例38%45% (p<0.001),且變異較低(Levene p<0.001)
遵循指引主題順序(Kendall τ)0.330.53 (p<0.001),變異較低
提問與指引問題的相似度0.430.59 (p<0.001)
面試官詞彙豐富度6.667.64 (p<0.001),分布較集中

表格中有兩個特徵構成這個概念。首先,雙方都不會機械式照稿念——τ=0.53、相似度 0.59 代表 AI 經常偏離指引,依每位求職者客製追問。一致性存在於不同面試之間,而非單場面試之內。其次,一致性並未以語言變得更平板為代價:AI 的詞彙豐富度高於人類。標準化與因應能力只能二選一的常見取捨,在這裡似乎不存在。

數字清楚顯示,變異主張需要加上一項限定。 Figure 2 的分布顯示,AI 的主題涵蓋並未緊密聚集,而是明顯雙峰:約 20% 的 AI 面試落在最低區間(涵蓋 0–10% 主題),約 42% 集中於單一高區間(70–80%),兩者之間的觀測很少。人類分布較廣,但也更平滑。主題順序遵循度也呈現相同形狀(τ 0.75–1.00 約有 46% 的尖峰,接近零的區間則約佔 26%)。因此,AI 的一致性是有條件的:只要通話正常運作,它就能非常一致地執行流程;一旦失敗——7% 技術中止、5% 拒絕 AI,以及無法聯絡和未投入的求職者——主題涵蓋便接近零,而不是逐步劣化。「較低變異」是以高集中峰值與離散失敗模式的混合分布衡量,和「在所有情況下都更可靠」並非同一件事。對公司而言,這或許是更好的形狀(失敗明確可見,也容易以低成本轉交人類處理),但它並不是這個詞組所暗示的平滑變異降低。

與個別人類招募人員的分布相比,AI 代理在問題與指引的相似度上勝過 100% 的招募人員,在主題順序遵循度上勝過 83%,在主題涵蓋與詞彙豐富度上則分別勝過較適中的 61%/64%。它在任何一項指標上都稱不上超人,但在所有指標上都能穩定高於中位數。

研究以兩步設計提出語言與錄取之間可能的關聯:(1)在人類組內,以八項標準化語言特徵對錄取結果進行迴歸——交流輪數、求職者詞彙豐富度與句法複雜度都能正向預測錄取;回應性附和線索與求職者提出的問題則是負向預測因子;(2)比較兩組特徵——正向預測因子在 AI 組較高,負向預測因子則在人類組較高。結構越多 ⇒ 招募人員偏好的訊號越多。

替代模型無法定價的那項差異#

有必要直白指出這點,因為探討 AI 何時取代工作者的正式文獻,建立在另一種差異上。Banerjee 與 Singh 的 HAT 模型(arXiv 2607.20781,practitioner-opinion,沒有資料)把每項替代決策都化約為風險調整後純量的比較——C'_ik + λR'_ik < C_ij + λR_ij——而這個條件無法表達變異優勢:

  • 假設產出品質相同。 目標函數從 V = B − C − λR 推導,並因為「B 對特定任務而言是固定的」而略去 B。依模型設定,兩種代理交付相同效益,只有成本與風險不同。受控變異主張的是產出品質在多次重複中的離散程度,而模型既沒有重複,也沒有品質變化。
  • R 是水準值,而非二階動差。 C + λR 看似均值-變異數函數,但 R 被定義為人類的錯誤/離職/缺勤,以及 AI 的可靠性/遵循規範/聲譽失誤——也就是預期損失水準。論文中沒有變異數項。
  • 即使寬鬆地納入編碼,差異仍會消失。 設定 R' < R 表示 AI 更可靠——但這只是有效成本的平均值移動,和 AI 比較便宜無法區分。模型無法區分「平均表現較好」與「離散程度較低」,但這正是本實驗區分的內容:AI 在主題涵蓋和詞彙豐富度上勝過 61%/64% 的個別招募人員,在問題與指引相似度上則勝過 100%,順序遵循度上勝過 83%。

方向問題更加尖銳。論文中的每個實例都設定 R' 明顯高於 R(校準值為 $20k vs $5k),而其七項預測全部取決於 λ(R' − R) > 0——AI 是風險較高的一方,其風險懲罰會延後替代。在本研究中,AI 的可靠性是產品本身,而非障礙。另一項結構性結果也同樣不符合證據:該模型的最適解位於極端點(整項任務交給一種代理;只有成本相同或外部限制才會產生混合),但實際帶來 +12% 錄取的安排是依階段拆分單一任務——AI 蒐集資訊,人類做決定——模型只能把它表示成外加於最佳化之外的限制。

論文未能分離的管道:自行決定中止#

將逐字稿分成十種面試類型後,浮現出一個遠大於任何語言差異的缺口:25% 的人類面試屬於「篩除」——招募人員因求職者不符合要求而結束面試;AI 面試則只有 7%。(完整面試的比例接近:人類 39% vs AI 42%。)

論文將這點納入標準化的解釋。但值得將其獨立提出,因為這是不同的機制:人類招募人員運用裁量權停止面試,會在測驗與評估階段之前將求職者移出流程,因而機械性地壓低錄取數;AI 遵循流程,大多不會中途停止。依此解讀,+12% 的一部分來自「AI 不會放棄」,這是裁量權差異,而非資訊品質差異。它仍屬變異降低——招募人員的停止規則正是在人與人之間高度變動的裁量行為——但「我們取消了面試官提早放棄的選項」,比「AI 蒐集到更好的資訊」更容易套用到其他情境,也比較不會讓人覺得是在美化介入方式。論文報告了這項數字,卻從未拆解這兩個管道。見下方的待解問題——並請注意(2026-08-17),新增資料後,「AI 不會放棄」這種解讀便不成立:AI 組自身的早期終止類型(未投入 12%、無法聯絡 14%、技術故障 7%、拒絕 5%)合計 45%,人類組則為 43%,因此兩組失去的面試比例相近,差別只在於由誰、基於什麼資訊結束面試(這項工具能解決什麼:兩個醒目數字及其缺失的分母)。

招募人員給 AI 較高評分,信任程度卻較低#

人類評估者的反應,是論文最有趣的行為發現,而且同時指向兩個方向:

  • 評分較高。 平均面試分數由人類主持的 1.90 升至 AI 主持的 2.01,p<0.001——這完全是評分由 1 轉為 2 所致,評為 3 的比例則不變。AI 拉高了底線,而非上限。招募人員自由文字理由的情緒也呈現相同方向(正面 24% → 31%;負面 38% → 28%)。
  • 權重較低。 以標準化面試、語言測驗與分析測驗分數對錄取進行迴歸後,AI 組面試分數對錄取的預測力顯著較低(交互作用 −0.047;加入控制變數後 −0.029,兩者皆顯著),而語言測驗分數的預測力則較高(+0.028/+0.022)。而且折扣正好集中在理論預期的位置:只有那些在問卷中表示面試表現比測驗分數更重要的招募人員,這項差異才達顯著。

所以,招募人員一方面對 AI 蒐集的面試給予較正面評分,另一方面在做決定時更仰賴獨立訊號。他們降低了 AI 訊號的權重——論文的結論是,這項互補能力尚未建立:「要充分實現自動化的回報,人類在決策時如何依賴 AI 訊號,也必須配套調整。」

他們的預測也錯在一個明確方向。在結果揭露前,36% 的招募人員預期 AI 面試求職者的錄取率會較低(49% 預期相同,15% 預期較高),48% 預期留任率較低,61% 預期 AI 主持的面試品質較差。只有 12% 的招募人員預期 AI 對自己整體會有正面影響;求職者則有 47%。既有專業經驗預測錯了方向。

自動化面試反而拉長聘用流程#

將聘用所需時間拆解(Remote mode,僅計成功聘用者),得到本知識庫中最明確、經因果識別的瓶頸轉移實例:

階段人類(中位數)AI(中位數)
表達興趣 → 面試0.51 天0.32 (p<0.001)
面試 → 錄取決定2.62 天7.24 (p=0.005)
錄取 → 到職12.00 天13.00 (p=0.55, ns)
端到端20.00 天24.00 天 (p=0.033)

自動化面試讓排程幾乎即時完成(代理全天候待命),卻讓人類評估階段慢了約 2.8 倍,因為招募人員現在得審閱一段自己沒有參與的對話。整體而言,流程變長了。公司改善了人才漏斗品質,卻在未自動化的階段付出延遲代價——驗證成為新的瓶頸所觀察到的現象,這次是在隨機分派下測得,而非從遙測資料推論。

求職者:沒有反彈、自然度較低,且歧視感受與結果分歧#

  • 錄取接受率在統計上沒有差異:人類 93.64% vs AI 92.14%(p=0.086——方向上較低,但未達 5% 顯著水準)。NPS 為 8.84 vs 8.97(p=0.25)。
  • 感知品質大致相同,只有自然度例外。 感知壓力、舒適度、追問流暢度、回饋頻率、招募人員知識或公平性均無差異。AI 提問被評為稍微更相關(p=0.044)。AI 互動被評為顯著較不自然(p=0.014),使綜合面試品質指數偏向人類組(p=0.076)。
  • 回報的性別歧視幾乎減半:人類 5.98% → AI 3.30%,p=0.020。但實際錄取差距沒有變化。 人類組女性收到的錄取比男性少 20%(7.94% vs 9.86%),AI 組則少 17%(8.98% vs 10.87%)——加入控制變數、固定效果與測驗分數後,兩者差距都消失,代表差異來自組成,而非招募人員歧視。坦白的總結是:AI 將受到歧視的感受減半,卻沒有改變測得的差距;這既不符合「AI 會加劇偏見」的擔憂,也不能宣稱 AI 修正了任何問題。感受題目的樣本很小(62/1,818 和 22/346)。
  • 開放式回答的情緒傾向 AI(正面 71% vs 52%,p=0.005),但只有 9.6% 作答,而且論文也指出選擇偏誤的風險。

選擇與負向排序#

在可以選擇的情況下,78.4% 的求職者選擇 AI(現場面試 69.3%,遠端面試 81.6%),整個實驗期間都相當穩定。態度可以預測選擇:在預期 AI 對職場影響正面的問卷受訪者中,77% 選 AI;持平者中 72%;負面者中 65%。女性選擇 AI 的比例略高於男性(80% vs 76%,p<0.001)。

但選擇者在測得能力上呈現負向排序:選 AI 的求職者在語言測驗(滿分 6 分,3.14 vs 3.37)和分析測驗(滿分 100 分,47.54 vs 49.77)都得分較低,且差異皆顯著。若將選擇者與被分派給相同面試官的人比較,差異會減弱(四項差異中有三項在加入控制變數後失去顯著性),所以排序確實存在,但幅度不大。對提供選擇的公司而言,實際意涵是:讓 AI 受歡迎的便利性,對公司最不想聘用的求職者最具吸引力。

經濟效益實際取決於什麼#

論文的成本附錄比較九種薪資 × AI 價格組合。靜態分析中,AI 面試在 9 種情境中的 8 種具成本效益;低薪環境約進行 8,500–24,000 次面試後損益兩平,中薪環境約 4,500–7,000 次,高薪環境約 2,000–3,000 次。加入 5% 失敗率後,損益兩平所需次數增加 7–57%,在薪資中等、AI 價格偏高時增加最多。因此,若只看成本,「人力昂貴的地方,AI 採用擴張得最快」。

實驗本身在三種環境中人力成本最低的一種進行——菲律賓客服職位,月薪 ₱16,000–25,000(約 $280–435)。在這種環境,純粹以人力成本為由自動化的論點最弱。這家公司不論獲得什麼效益,主要都不是靠壓低薪資取得的。

作者指出的適用條件:效益應集中在「高工作量、高流動率的環境,任務重複、成果能快速觀察,而且尤其重要的是,人類表現的變異會造成成本」;而仰賴「隱性知識、關係推論或高度專業技能篩選」的情境,則可能更適合由人類篩選。這些條件在本研究情境中無一不成立,在資深或專業職缺的招聘中則多半不成立。結果適用於入門級、高工作量、成果能快速觀察的篩選;不應被解讀為適用於一般面試。

同一任務,改以觀察而非隨機分派#

Kalff 與 Simbeck 對德國 HR 部門進行的 N=410 問卷調查(arXiv 2607.13839,empirical)以相反的研究工具探討同一功能領域。兩者與其說互相矛盾,不如說回答了不同問題。本實驗詢問:在具備導入條件、且已選定的場域中,部署後是否有效?問卷則詢問:在大多數尚未導入的企業中,企業是否會部署?在德國,求職者預先篩選(Bewerber:innen-Vorauswahl)是採用率第二高的 HR AI 工具,比例為 35.6%;但本實驗隨機測試的特定介入——由 AI 進行對話(Virtuelle Gespräche)——採用率只有 17.1%;候選人配對為 14.9%,面試問題生成為 10.5%。

企業表示不採用的原因,是這項設計透過場域選擇而固定下來的一項變數:勞動市場的供需方向相反。 德國企業表示不願投資 AI 排名或篩選,因為「複雜的 AI 篩選系統可能無意間排除合適的候選人,而這些產業本來就苦於找不到合格人選」——他們「擔心錯失稀缺人才,或認為此類投資的經濟理由有限」。這是不同錯誤類型之間的成本不對稱:求職者稀缺時,代價較高的錯誤是錯拒,而非聘錯人。

這幾乎逐字對應到本文自己的適用條件。作者預期效益出現在「任務重複、成果能快速觀察,而且尤其重要的是,人類表現的變異會造成成本」的地方——例如菲律賓入門級 BPO,年離職率最高約 60%,三個月內有 70,884 份申請,留任情況數週內即可觀察。將每項條件反轉,就會出現德國的情況:每個職缺的求職者較少、成果需要較久才能觀察,而且離散造成的成本主要由流失的候選人承擔。當你要收窄的分布,是圍繞著一個公司承受得起的門檻時,受控變異最有價值。 德國還多了一項實驗場域沒有遇到的限制——由 AI 進行選拔面試屬於 EU AI Act 的高風險類別,而任何評估現有員工的系統都會觸發 BetrVG §87(1) no. 6 的職工委員會共同決定權。

這項比較有兩個限制:問卷是自陳且為橫斷面資料;其採用率描述的是整體德國 HR,而非本研究聲稱適用的高工作量入門級職位——德國也可能只是較少這類職位,而非企業拒絕在這類職位導入工具。重點不是實驗離開原場域就失效,而是研究結果與採用率由不同變數主導,而公司實際能決定的只有後者。

關聯閱讀#

  • AI 決策中的程序價值——這是陳述偏好的對照研究,也說明了為何本實驗中78.4% 選擇 AI並不等於表面看來那種求職者背書。Wang、Sturgis 與 de Kadt 的預先註冊 conjoint 研究(n=1,919 名美國求職者)估計了決策權的價值——本設計從未變動的要素,因為兩組都是人類做決定——其選擇機率增加 +0.272,約等於將錯誤拒絕率從 30% 降到 10% 的價值(+0.285,差異的 95% CI [-0.007, 0.033])。因此,本研究的求職者是在決策權不變的前提下選擇面試形式,這與他們潛在偏好由人類決策者相容。該頁也提供了理解本文選擇統計所需的提醒:申請意願高於對系統正當性的信念(3.24 vs 2.85,p<0.001),有 7.8% 的人同時對正當性評價偏低、申請意願偏高——以手上有實際申請為利害關係的人所做的行為衡量,不等於接受度

  • 遙測與問卷測量——第三種工具,也是唯一能識別因果關係的工具。本研究在單一設計中使用三種工具,結果卻不一致:行政紀錄顯示 AI 面試的求職者收到較多錄取,留任時間也較長;求職者問卷顯示 AI 面試較不自然,綜合品質評分也較低(p=0.076);招募人員問卷則預測面試品質較差(61%),與實際實驗結果直接矛盾。由隨機分派裁決——其證據層級高於該頁討論的遙測與問卷問題

  • 曝險分類:觀察到、理論推測、回報與預期——對 Frey 與 Osborne 2017 及 Brynjolfsson 2018 中人際互動瓶頸假設的直接實驗測試。面試是一項具關係性、對話性且仰賴判斷的任務,而 AI 語音代理執行時帶來的公司成果優於受訓的人類招募人員。Steele 與 Cruz 透過查詢建構的工具已在使用次數上將社會類工作排在前面;這項研究則針對其中一類任務提供以結果衡量的因果證據——論文自己的適用條件(隱性/關係性/專業篩選仍偏向人類)也保留了舊有直覺仍然成立的範圍

  • AI 的組織互補條件——論文結尾的主張,且是一個格外清楚的例子:能力足以改善面試,卻不足以改善流程。招募人員降低 AI 訊號的權重,人類評估排隊時間也從 2.62 天延長至 7.24 天,因此端到端聘用時間變差。缺少的互補條件有明確描述——「人類在決策時如何依賴 AI 訊號,也必須配套調整」。本知識庫中的 HAT 替代模型也收錄於該頁,而本文的機制超出該模型的範圍:2.62 → 7.24 天的評估階段,是該模型協調參數 r'_0 高於人類對應值的一個實測案例,正好與模型需要成立的方向相反

  • Human-AI Accountability Redesign——本設計正是五支柱處方要求的決策權拆分:AI 蒐集資訊,人類做決定,代理揭露其人工智慧身分,並說明將由人類做出決定。該頁提出的建議在 70K 規模實際落地;結果顯示這種拆分能改善成果,同時也浮現成本:人類決策階段成為排隊瓶頸

  • Configurable Human Participation——這是 HAS-Bench 受控掃描的場域對照。HAS-Bench 在 397 項任務中改變 LLM 模擬人類的參與程度;本研究將參與方式固定於一種設定(代理蒐集資訊,人類保有全部決策權),並以此處理 67,056 位真人。兩者從真實性/控制程度取捨的兩端,皆發現設定方式才是關鍵

  • 單人署名回彈——對照兩種情況中剩餘工作的變化。本研究保留的人類判斷階段擴大了 2.8 倍(2.62 → 7.24 天);另一項研究中,接手共同作者執行工作的研究者最終涵蓋的內容範圍少了 23%(廣度 0.089 vs 0.115),也沒有拓展到新的領域。替代可能使人類剩餘的一半工作變多或變少,兩者互不預示——但本研究有隨機分派,另一項則是沒有未處理單位的中斷時間序列

  • 角色平均化,而非角色消除——平均化的一個實測案例:招募人員的工作沒有消失,而是少了面試這一半,保留評估這一半;後者每次聘用的中位工作時間從 2.62 天增至 7.24 天。論文自己的說法是「將招募專業知識重新導向評估」——角色重新組合,人類保留承擔判斷的部分

  • AI Employee Framing——鏡像對照,方向正好相反。本研究明確將 AI 定義為工具(通話開始時揭露身分,也明確告知由人類決策),人類因此提高了對獨立訊號的審查——正好與員工框架引發的問責擴散相反。這只是提示,並非測試:研究沒有操弄框架

  • 自動化與樂觀的關聯——在 AEI 偏向科技業的樣本之外,觀察信念如何連結至委派:在菲律賓入門級客服族群中(女性占 60%),47% 預期 AI 對職場的影響會是正面,19% 預期負面;這種信念可以預測是否選擇 AI 面試官(正面/持平/負面者分別為 77%/72%/65%)。既有從業者——招募人員——則悲觀得多,只有 12% 預期正面

  • 代理程式編碼中的專業回報——少見的專業經驗梯度反例:131 位資深招募人員預測錯了效果方向(36% 預期錄取率較低,48% 預期留任率較低,61% 預期面試品質較差)。他們累積專業的那項任務,正是自動化後運作順暢的任務;而專業得以轉用的評估任務仍由人類執行,並成為瓶頸

  • 這項工具能解決什麼:兩個醒目數字及其缺失的分母——利用本文數字界定中止管道的影響:兩組失去的面試比例幾乎相同(人類 43% vs AI 45%),因此對兩組施加對稱的完成條件校正後,效果升至 +16%;只校正人類篩除則會反轉為 −10%,只校正 AI 自身 12% 失敗管道則升至 +27%。該頁也估算損益兩平界限(r* = 5.8%,相當於人類基準錄取率的三分之二),並指出分類分解所需的面試類型變數,是未經驗證的十分類 LLM 分類器;其編碼手冊以主題數量設定門檻,而此變數正是本處理會改變的項目

  • Agent Behavioral Homogeneity——相同的離散特性,但方向相反。本研究中,低變異是 AI 面試官的賣點(流程一致,τ 0.53 vs 0.33,帶來 +12% 錄取);另一頁中,它使整個代理程式群體一起失敗,因為彼此只有脈絡、鷹架與模型不同。一致性是單一代理程式的優點,也是整個群體的風險;這兩頁是 wiki 中對此最清楚的說明

延伸至主題中心(單向)#

  • 驗證成為新的瓶頸——經隨機分派測得的瓶頸轉移:自動化資訊蒐集將排程時間縮短至 0.32 天,卻使人類評估時間從 2.62 天膨脹至 7.24 天,令端到端流程顯著變長(20 → 24 天,p=0.033)
  • LLM-Judge Validation——篩除變數未達到的標準:中止管道分解必須依賴 LLM 指派的標籤,但該標籤從未與人類編碼者驗證,而且其編碼手冊以 topic_count 設定門檻;這個數值本身會受到處理影響
  • Usage-Telemetry Classifier Validation——另一項研究中相同的缺陷:標題比率是以設計假設的分母計算,而非實際測量的分母;兩者都只能透過估計人類上限,而不是拿分數與 100% 比較,才能校正
  • 增強/自動化的區分是否決定職場技能?——本實驗是本知識庫中唯一透過隨機分派觀察職場技能累積的研究:招募人員的技能沒有被掏空,而是將判斷力重新部署到未自動化階段(面試分數對錄取的預測力降低 −0.047/−0.029,語言測驗的預測力則提高 +0.028/+0.022);2.62→7.24 天的評估階段也表示,自動化任務讓他們在剩餘判斷工作上投入更多時間,而非更少——這是以工作而非對話為單位的增強型結果。讓研究無法定論的限制是:沒有測量未經輔助的技能,而且招募人員自己的預測方向也錯了

待解決的問題#

  • +12% 有多少來自資訊蒐集中的受控變異,又有多少來自取消面試官自行決定中止的裁量權?人類招募人員在面試途中篩除求職者的比例為 25%,AI 則為 7%;這會在評估階段前機械性地壓低人類組的錄取率。可驗證的作法:在兩組都完成面試的子樣本中重新估計處理效果,或對篩除決定使用工具變數。論文報告了兩項數字,卻從未分解兩者。部分解答(2026-08-17)見這項工具能解決什麼:兩個醒目數字及其缺失的分母——方向和問題預期的相反。將本文各種面試類型比例加總後可見,兩組因提早終止而失去的面試幾乎相同(人類 43%——25 篩除 + 9 未投入 + 9 無法聯絡;AI 45%——7 + 12 + 14 + 7 技術故障 + 5 拒絕)。差異在於組成,而非數量:人類組由招募人員發起終止,並以明確的不合格條件為依據;AI 組則由求職者或系統發起,且未依據任何適配資訊。因此,問題提出的校正方式是不對稱的——只移除人類篩除後為 11.60% vs 10.47%(−10%,方向反轉);只移除 AI 的技術故障與拒絕後為 8.70% vs 11.06%(+27%);兩組都移除所有提早終止類型後則為 15.26% vs 17.70%(+16%,高於發表的 +12%)。損益兩平界限:如果被差異篩除的求職者轉換率為 r* = 1.03/18 = 5.8%,那中止管道便足以解釋全部效果,也就是人類組自身 8.70% 基準錄取率的三分之二——對因不可妥協要求(地點、簽證、再聘狀態)而被淘汰者而言,這似乎不太可能;然而論文並未公布提早/中途/晚期篩除的細分,而晚期篩除按定義已接近完成面試。仍有三項未解,而且都需要論文未報告的資料:(i)r 本身,以及依組別與類型區分的提早終止面試錄取率;(ii)各組以隨機分派人數為分母的可評估紀錄比例——25%/7% 是以 34,109 份逐字稿計算,論文稱其為「所有已進行面試的一部分」,而 AI 組的面試對象很可能有更多人能實際參加,因為從接受面試到完成面試的時間由 0.51 降至 0.32 天;(iii)AI 代理是否根本具備中止操作——分類器編碼手冊要求「招募人員說明因不合格而結束通話的原因」,論文卻從未說明代理是否獲准淘汰求職者。上述所有校正都會以處理後變數為條件,因此只能界定管道的效果範圍,不能識別因果;使用工具變數處理篩除決定仍是唯一能識別的設計。
  • AI 系統從未具名——沒有模型、供應商或版本資訊,只說 Google Cloud 提供基礎設施。「受控變異」是這家公司提示詞下、2025 年一代語音代理的特性,還是普遍適用於 AI 主持的面試?論文沒有提供任何資訊,讓後續重現研究知道自己要重現什麼。
  • 留任 ≥1 個月既是品質代理指標,也是招募公司向客戶領取報酬的依據。AI 優勢能否在仲介公司沒有報酬的結果上繼續成立——例如客戶端 12 個月績效、升遷或薪資成長?四個月估計值已是最長的測量期間,且在招募人員群聚後失去顯著性。

資料來源#

  • Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — Brian Jabarian(Chicago Booth)與 Luca Henkel(Erasmus Rotterdam),Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews,arXiv 2607.28222(2026-07-30;119 頁,27 張表;empirical)。§2 設計與樣本(70,884 份申請、67,056 份隨機分派、三組,全程由人類評估);§3.1 錄取/到職/留任效果與條件樣本;§3.2 離職原因與三項生產力無差異結果;§4.1 面試類型分類(篩除比例 25% vs 7%;技術故障 7%,AI 拒絕 5%);§4.2 招募人員行為指標與個別招募人員基準比較;§4.3 兩步語言特徵設計;§5 求職者接受度、NPS、感知品質、歧視回報、選擇與負向排序;§5.4 性別異質性;§6 面試評分、情緒與訊號權重交互作用;§7 聘用時間拆解與九種情境成本基準;§8 結論(受控變異、適用條件)。已檢視並核對圖表:Figure 2(依組別呈現主題涵蓋/主題順序/問題相似度的六幅分布圖——確認正文平均數,也揭示 AI 分布為雙峰,如上所述)及 Figure 5(累計平均聘用時間,其三個數字點與正文平均值完全相符:AI 0.58/14.50/29.19 天,人類 1.86/9.28/23.14 天)。依本知識庫慣例,本頁不從圖表讀取任何數字;所有數字均來自正文。預先註冊:AEA RCT Registry #15385;UChicago IRB #IRB24-1894/#IRB25-1002。揭露事項:通訊作者在資料蒐集結束兩個月後,接受合作公司的無薪首席經濟學家職務;合作方沒有參與分析或出版決策。
  • The Human-AI Substitution Principle: When will you be replaced by AI in your organization? — Banerjee 與 Singh,arXiv 2607.20781(2026-07-22;practitioner-opinion,正式模型,沒有實證資料)。本文僅引用其成本條件能表達與不能表達之處:§5.1(固定每項任務 B 的 V = B − C − λR 等式)、§3.2–3.3 與 Table 1(R 對兩種代理都定義為預期損失水準)、§4.2.2 Theorem 5、§4.2.3 Theorem 6(極端點最適性)、§5.7(校準的 R' = $20k vs R = $5k)。完整分析與 P1–P7 對照表見AI 的組織互補條件
  • AI-Augmented Human Resource Management? Insights from German companies — Kalff 與 Simbeck,arXiv 2607.13839(2026-07-15/v2 07-20;empirical,N=410 名德國 HR 經理,另有 14 場專家訪談)。本文引用其對同一功能領域採用情形的觀察:§4.1 與 Figure 1(工具使用比例——求職者預先篩選 35.6%、虛擬面試 17.1%、候選人配對 14.9%、面試問題生成 10.5%),§4.2(技能短缺使企業不願投資 AI 排名/篩選;AI Act 與共同決策限制)。匯入時進行字形層級修復(docling 將所有數字與 DOI/URL 標籤輸出成字形名稱;已逐一還原並對 PDF 複核),因此所有數字都能追溯至該修復;Table 1 列位錯置,本文未引用;Table 2 已核對無誤。完整分析見AI 的組織互補條件
  • 解析警告——處理效果係數完整無誤,但帳務列有問題。 所有點估計值均已與 PDF 衍生表格逐一核對,完全一致;本頁所有數字皆取自論文正文。原始資料中有三張表損毀,不應直接解讀:Table 1(工作績效)將三組依變數欄標合併成一組重複欄標,因此無法判斷各欄對應哪個依變數——上文的生產力無差異結果取自 §3.2 正文與表格註釋。Table B.5 Panel B 的 AI Interviewer 列標準誤遭移除,並接到下一列前面;校正後的 AI Interviewer 數值為 0.0078***(0.0021), 0.0074***(0.0021), 0.0074**(0.0031), 0.0061***(0.0020), 0.0058***(0.0019), 0.0058**(0.0029), 0.0037**(0.0015), 0.0038***(0.0015), 0.0038(0.0024)——最後一欄是四個月效果在招募人員群聚後失去顯著性的地方。Table B.6 Panel A 的 Controls/Clustering/Observations/R² 各列順序混亂(正確內容:Controls -/Yes/Yes/-/Yes/Yes;Clustering App./App./Rec./App./App./Rec.;Observations 4,708/4,575/4,575/4,708/4,575/4,575;R² 0.0018/0.0700/0.0700/0.0011/0.0611/0.0611),且Panel B 的標準誤列整列遺失。Table B.5 Panel A 與 Table 2 已核對無誤。
§ end
Cited by 23
Related articles
  • Organizational Complements to AI

    The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…

  • The Tragedy of the Cognitive Commons

    Lovett (HRD Review, July 2026): professional expertise is a profession-level commons whose regeneration mechanism — ent…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • AI Adoption in Scientific Work

    Three instrument families on one profession. Google ATLAS telemetry + survey: scientists are the economy's heaviest AI…

  • The Automation–Optimism Link

    AEI Cadences survey finding: people who use Claude in more automated ways are MORE optimistic across all six job-qualit…