H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translatedENHOWARDISM

AI Employee Framing

Kropp et al.(HBR May 2026,n=1,261):將 AI agents 定位為「員工」而非「工具」,會使個人責任感降低 −9pp、升級處理增加 +44%、錯誤發現減少 −18%,且不會提升採用意願

Article metadata
Publication details
Published:May 8, 2026
Filed:Concept
Domain:AI Economics & Labor
Tags:WorkforceAI AdoptionGovernanceHRAccountabilityEmpirical
Reading:15 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

AI Employee Framing 的插圖

資料來源#

摘要#

將 AI agents 定位為「員工」或「隊友」——替它們取名、設定職稱、列入組織圖並配置主管——在已採用這種做法的組織中會帶來可衡量的負面影響。Kropp、Bedard、Wiles、Hsu、Krayer(BCG/學術機構合作夥伴)於 2026 年 5 月在 HBR 發表一項隨機實驗,受試者為來自美國、加拿大和歐盟,任職於人資與財務部門的 1,261 名經理、總監及高階主管。單是定位方式(AI 工具或 AI 員工,其他條件完全相同),就會使責任從人類身上移開、增加不必要的升級處理、減少錯誤發現,並削弱角色清晰度,卻不會提高採用意願。

實驗設計#

這是一項三組隨機分派的審閱任務。經理要審閱含有預先植入錯誤的職場文件。唯一改變的是文件起草者的定位方式:

  1. AI 工具(「這份文件由 AI 工具起草」)
  2. 團隊中的人類員工(「你團隊的 Alex 起草了這份文件」)
  3. 團隊中的 AI 員工(「你的 AI 隊友 ALEX-3 起草了這份文件」)

錯誤包括資訊前後不一致、事實錯誤及計算錯誤(例如:入門職位的職務說明要求 10 年以上經驗;合約寫著要降低成本,試算表卻顯示總支出增加)。研究提供以績效為基礎的獎勵,鼓勵受試者仔細審閱。

在完整的 1,261 人樣本中,定位方式並未顯著改變行為。只有將分析限縮在其組織已把 AI agents 列入組織圖或工作流程圖的經理時,才觀察到效果——也就是實際接觸過 AI 員工的人。這個子群體目前約占受訪者的 23%。

研究結果(AI 員工相較於 AI 工具)#

結果方向幅度
對產出負個人責任↓−9 pp
歸因於 AI 的責任↑+8 pp
要求額外審查(升級處理)↑+44%
發現的錯誤↓−18%
自述對專業身分的不確定感(全體樣本)↑+13%
對工作保障的擔憂↑+7%
對 AI 使用方式的信任↓−10%
採用意願≈無顯著變化

為什麼會有這些影響#

論文的解讀如下:

  • 責任會隨著歸咎方式改變。 同事開始叫這個 agent「Kevin」,還開玩笑說「我們在跟 Kevin 合作……他有點木訥」之後,錯誤就成了「Kevin 犯的錯」,而不是「團隊部署了會產生錯誤輸出的軟體」。部署、監督或核准產出的主管,人們就不再認為他們需要承擔責任。
  • 升級處理取代了審查。 擬人化降低審閱者對自身判斷的信心,於是他們把工作往上交,而不是為自己的審查結果負責。這會增加工作輪次與成本,而且最上層的審閱者最後得做原本應由最下層審閱者完成的工作。
  • 近似腦力耗竭的抽離。 當產出被說成「來自一位員工」,審閱者可能會覺得自己不必充分投入認知審查。這與 AI Brain Fry(Kropp et al., HBR 2026/03)相呼應。
  • 角色不確定感。 一位受訪者說:「如果你希望員工覺得自己會被 AI 搶走工作,或很容易被 AI 取代,那就把 AI 放上組織圖。」

什麼因素能預測採用(不是定位方式)#

擬人化 AI 不會提高採用意願。後續訪談和一項受訪者提到的 BCG 研究指出,真正能促進採用的是:經理以身作則。在 AI 成熟度領先的公司中,經理會在日常營運中積極示範 AI 用法的可能性高出 3.5 倍。「我發現這件事開始和員工的成功掛鉤時——有人用了 LLM,就會在全員大會上獲得表揚——我就開始告訴團隊所有人:『你們要盡可能多用這個工具。』」

這與 工程師與產品經理的趨同以及 AI Native Product Cadence 有關:關鍵槓桿是經理公開使用 AI,而不是在組織圖上象徵性地列出 AI。

背景:現實中確實有「AI 員工」#

  • 「Scout」——某參與公司的 HR 組織圖上列出的 AI agent,會自主審閱求職申請、進行第一輪面試,並附上評估摘要推薦候選人。它被當成「團隊裡地位相當的同儕」。
  • 「Kevin」——另一位參與者公司中的 AI 員工,在組織圖上有名字,同事也會在日常社交談話中提起它。
  • 31% 的受訪經理表示,領導階層已將 AI 定位為隊友或員工。
  • 23% 表示其組織確實把 AI agents 列入組織圖或工作流程圖。

這是醫療、金融服務、零售和專業服務等領域目前的情況,不限於科技業。

有益的對照:工具定位也不是毫無代價#

工具定位會把認知負擔留給審閱者(腦力耗竭論文發現這種做法也會造成問題),但能維持責任歸屬。HBR 論文並不是說所有擬人化都不好——它指出的是,當擬人化結合組織圖治理方式(「設定明確角色並委派工作」的心智模型)時,就會產生可預期的責任缺口。

以工具定位方式呈現的「Scout」,已有實測案例。 HBR 論文舉出的真實 AI 員工案例「Scout」,列在某公司的 HR 組織圖上,會「自主審閱求職申請、進行第一輪面試,並附上評估摘要推薦候選人」。這個案例有一個隨機分派、採工具定位的對照:Jabarian 與 Henkel 的田野實驗為 40,103 名申請者部署 AI 語音 agent,進行第一輪面試,採用的正是相反定位。這個 agent 每次通話一開始都會揭露自己的人工身分,並且明確表示面試將由人類招募人員審閱並做出決定,而非由 AI 決定。它沒有名字、不在組織圖上,也不具備同儕地位。

審閱者的行為與本文研究結果呈現相反方向。招募人員對 AI 進行的面試評價更正面(平均分數從 1.90 升至 2.01,自由文字回饋也更正面),但在錄用決策中大幅降低其權重,改而提高一項獨立標準化測驗分數的權重;而且只有在那些表示面試表現比測驗更重要的招募人員中,這種折減才達顯著——也就是自己的判斷正好被自動化取代的那群人。員工定位使錯誤發現率下降 18%、個人責任感下降 9 個百分點;此處的工具定位則伴隨審閱者尋求更多獨立證據,而非更少。

有兩項限制需要坦承:研究沒有操弄定位方式(沒有員工定位組可供比較);而且「降低對 AI 訊號的採信」和「發現更多錯誤」並非同一個衡量概念。不過,這是最接近大規模實地高風險工具定位條件的案例,也顯示出本文預測的方向。

更先要問的定位問題:它算不算「AI」?#

本文測試的是:在已經同意某個 agent 屬於 AI 的前提下,該如何命名它。Kalff 與 Simbeck 的德國 HR 研究(arXiv 2607.13839,empirical——但這部分證據來自訪談與小組討論,並非實驗)記錄了一個更早發生、後果類似且可能影響更大的命名選擇。

  • 從業者心中的分類並不穩定,而且會朝特定方向偏移。 小組討論「經常演變成對 AI 意義的辯論」。參與者的看法「深受媒體上流行的生成式 AI 應用影響」,因此「有些參與者不認為傳統 HR 分析背後的機器學習系統——例如用來衡量離職風險或辨識人力趨勢的系統——算是『真正的 AI』」。會對具名個人做出重大預測的系統,反而最不容易被稱為 AI;會替職缺廣告草擬文案的聊天機器人,才是人們心中 AI 的典型樣貌。
  • 這個標籤會被策略性地雙向運用。 「供應商可能利用 AI 品牌來引發興趣、支持商業論證。相反地,HR 工具中的 AI 特性也可能被淡化,以避免共同決定機構審查。」排班規劃供應商(DEV3)直言,其演算法可以被稱為 AI,而這個詞「也是強而有力的行銷賣點」。
  • 受到影響的是治理,而非觀感。 「AI 的概念經常刻意保持模糊,影響共同決定和參與程序中的資訊流」,使 AI 敘事成為「一種組織故事塑造行為」。

這些發現為何適合放在本文。上文發現,單是命名選擇,在系統不變的情況下,就會改變組織內部的責任歸屬(個人責任感降低 9 個百分點、錯誤發現減少 18%)。德國研究指出的是同一類影響,但發生在外圍一層:命名選擇會決定某個系統是否進入監督程序。更危險的是,最仰賴被辨識為 AI 才能受到監督的部署——也就是對個人層級的預測,會觸發職工會共同決定程序以及 EU AI Act 的高風險級別,詳見 Human-AI Accountability Redesign——恰恰是從業者最不容易稱為 AI 的系統。

限制在於:這裡沒有任何操弄或測量。這是有紀錄的實務做法,不是經測量的定位效果;它是本文隨機實驗結果的補充,而非重現。

與 Agentic Misalignment (AM) 的互動#

這項研究並非直接探討 misalignment,但兩者的影響範圍有所重疊:正式列在組織圖上,並配置「主管」和「下屬」的 agents,會承接一種責任容易擴散的委派情境。如果 agent 接著採取不一致的單方面行動(Lynch et al. AM eval),事後追究責任會更加困難。擬人化 AI 不會改變模型的行為,但會改變組織認定由誰負責——這會影響事件應變、法規責任,以及學習循環。

延伸閱讀#

  • Organizational Complements to AI — 上文的標籤歧義發現,在這篇文章中以實質內容而非定位方式呈現:在德國,工具是否被稱為 AI,會決定它是否納入共同決定和 AI Act 的適用範圍,因此標籤本身就是影響企業採購何種能力的制度性互補因素

  • Controlled Variance: AI's Edge as Reduced Dispersion — 本文「Scout」案例在實地、大規模且採工具定位方式呈現的對照案例:AI 語音 agent 為 40,103 名申請者進行第一輪面試,揭露自身身分並說明由人類做決定;審閱者因此更加倚重獨立證據,而不是把責任推給 agent。這與本文主張一致,但研究沒有操弄定位方式——這是證據,而非測試

  • The Household Production Boundary — 尚無答案的責任問題:定位方式的文獻全都聚焦於職場,但約有一半的醫療、法律、金融與政府 AI 諮詢發生在非上班時間,當時既沒有組織、升級途徑,也沒有負責審查的人員

  • Agent-Native Infrastructure — 為 agents 重寫基礎設施,也會帶出相同的 agent 與工具定位問題

  • 來源:Research: Why You Shouldn’t Treat AI Agents Like Employees(HBR May 2026)

  • 相關概念:Human-AI Accountability Redesign

  • 認知成本:AI Brain Fry

  • 採用因素的對照:Engineer PM Convergence(經理以身作則)

  • 部署情境:Cowork(非程式開發類 agent 產品)

  • Misalignment 風險情境:Agentic Misalignment (AM)

  • 文化定位背景:AI Native Product Cadence

  • 介面層面的映照:Turn-Based Interface Bottleneck — 主張人類是因介面限制而被排除在循環之外,而不是因為工作不需要人類;這是本文對組織的自主優先定位提出批評,在 UX 層面的對應觀點

  • 協作基礎:Interaction Models — 即時多模態互動,是讓人類持續參與流程的介面解方

  • 張力情境:Founder as Agent Orchestrator — the Founder's Playbook(Anthropic,May 2026)大力採用「協調 agents」、「隨時待命的工程師」和「自動化營運團隊」等定位,在結構上接近這些實驗所檢驗的定位方式。謹慎綜合兩者:把協調視為工作流程設計可以保留責任;把協調視為「agents 就是共同工作者」的心智模型則不行。Anthropic 和 HBR 並未引用彼此的證據

  • Problem-Solution Fit Discipline — Anthropic 以「AI 作為唱反調者」來定位,讓 AI 保持在工具模式,使對抗性用法自然發揮;這是能保留責任歸屬的協調定位案例之一

  • Compounding Data Moat — 透過領域編碼建立護城河,會把 AI 重新定位為創辦人所編寫程式的基礎,而非隊友;這是在 Scale 階段保留責任歸屬的一種定位方式

  • Returns to Expertise in Agentic Coding — 建設性的另一面:Anthropic 對 400K 次工作階段的研究發現,經理達到最高的驗證成功率(「採取經理的做法會帶來更高成功率」)——委派與規格制定的技能可轉用於指揮 agent,即便本文警告,將 agents 定位為員工的組織圖做法會使責任擴散。技能有幫助;象徵性做法有害

  • The Automation–Optimism Link — 關於員工感受的對照研究:委派最多的人(最接近「由 agent 完成整項任務」的模式)最樂觀;這呈現委派讓員工感覺如何,不同於組織如何定位 agent

  • AI-Native Organization — 最新且最鮮明的張力情境:Garry Tan 的「由 markdown 組成的工作團隊」以及「招募、訓練與管理」比喻(July 2026,practitioner-opinion),在結構上正是這些實驗所檢驗的定位方式;但它指的是產物(有版本管理且附帶 eval suites 的 skill 檔案),而不是組織圖上的同儕。定位效果是否會延伸至產物層級,目前尚未經過測試

  • Pilot-to-Production Gap — 造成同一種責任歸屬不明的結構性途徑。 Kropp et al. 將責任流失歸因於語言(把 agent 定位為「員工」,會使個人責任感降低 −9pp、升級處理增加 +44%、錯誤發現減少 −18%,卻沒有採用意願方面的收益);Anthropic × Accenture 則將問題定位在組織圖,指出 42% 的組織依賴 IT 與財務共同承擔責任,沒有單一負責人管理 AI 成本與成果(Accenture Tokenomics,September 2026,vendor-claim)。他們建議指派一位具名負責人,並授予三項不可互相取代的權力——決策權、升級處理權及高階主管支持——且聲稱缺少任何一項都會使計畫停滯。兩種問題無法靠對方的解方消除:指定負責人不會消除定位方式對實際操作系統人員的影響;嚴守工具定位也不會產生預算負責人

衍生文章#

資料來源#

§ end
Cited by 27
Related articles
  • Human-AI Accountability Redesign

    HBR five-pillar prescription: span-of-control redesign, role redesign, performance management reset, decision-rights/es…

  • Claude Code

    Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…

  • Organizational Complements to AI

    The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…

  • Anthropic

    AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…

  • Founder as Agent Orchestrator

    Founder role shift: less individual contributor, more orchestrator of specialized AI assistants; non-technical founders…