H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

GPT-Live

OpenAI 第三代語音系統(2026 年 7 月):全雙工語音模型,可同時聆聽與說話——音訊路徑中完全沒有回合偵測器——並透過非同步委派路徑諮詢後端文字模型,不會打斷對話;經過無聲的正式環境影子測試後,取代 Advanced Voice Mode;為 ChatGPT Voice 提供動力,包括桌面電腦控制與代理程式協調——自 2026-09-10 起,並以 **GPT-Live-1 in the API** 推出,前端語音層單獨計費為每分鐘 $0.05,後端模型(GPT-6 Astra / Terra / Luna 或第三方模型)另行選擇及計費,提供 12 種語音、電話服務,以及 OpenAI 所報告、歸因於此配對的提升:Tau3 Pass@1 為 86.2%,Full Duplex Bench v1.5 Interactivity 為 80.10%,相較之下 GPT-Realtime-2.1 分別為 45.7% 和 45.4%

Article metadata
Publication details
Published:August 4, 2026
Filed:Entity
Domain:Entities
Tags:Type/entityLLM Model
Reading:13 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

GPT-Live 插圖

資料來源#

它是什麼#

OpenAI 的第三代語音系統,於 2026 年 7 月推出——一種全雙工語音模型(Full-Duplex Interaction),能同時聆聽與說話;其周邊的即時服務系統歷時六個月打造(Live-Path Minimalism)。關鍵設計選擇是:**掌控對話的是語音模型,而非 harness。**音訊會持續流入模型並從模型輸出;音訊路徑中完全沒有回合偵測器。

它走完的三代演進#

OpenAI 對這條技術脈絡的說法:

  1. 串接式——語音轉文字 → LLM → 文字轉語音,依序處理。這種排序增加延遲,也丟失了語氣和節奏。
  2. 語音對語音(Advanced Voice Mode)——模型直接處理音訊,保留轉錄時會遺失的細節——但推論仍需等待獨立的回合偵測器:「猜得太早,使用者就會被打斷;猜得太晚,回應又會顯得遲鈍。只有等偵測器做出判斷,更大型的 LLM 才能開始工作。」用該篇文章的話說:「模型處理了更多互動,但互動仍然以回合為基礎。」
  3. GPT-Live——全雙工;偵測器消失了;回合交替成為模型行為。這正是 Turn-Based Interface Bottleneck 對這個元件所預測的消解。

兩個模型,一場對話#

需要深入推理或使用工具時,GPT-Live 會委派給後端文字模型——例如 GPT-5.5 等前沿模型(*已由 2026-09-10 的 Build more natural voice experiences with GPT‑Live‑1 in the API 取代,該文列出 GPT-6 Astra、Terra 和 Luna,並允許使用第三方模型)——透過非同步路徑進行。OpenAI 稱之為「實際上將『說話』與深入『思考』解耦」。這是獨立發展、並以 ChatGPT 規模推出的互動/背景模型分離:語音模型會短暫維持對話進行,同時由前沿模型推理,再把結果融入對話而不打斷流程。這個委派迴圈依延遲預算打造(預先暖機並預填的推論工作階段、工作階段親和性、提示快取——詳見 Live-Path Minimalism)。

部署#

  • 透過無聲影子測試驗證:逐步提高比例,將正式環境中部分 ChatGPT Voice 工作階段同時鏡像至 Advanced Voice Mode(仍在為使用者提供服務)和以唯讀模式執行的 GPT-Live,讓它在任何使用者聽見之前,先面對真實用戶端、網路、工作階段長度和地理環境。
  • 為 ChatGPT Voice 提供動力,包括新推出的功能:可透過 ChatGPT 桌面應用程式控制你的電腦並協調代理程式——語音是代理程式能力的介面,而非獨立功能。
  • GPT-Live API 即將推出(已於 2026-09-10 取代:API 已推出——請見下一節);OpenAI 將這種架構定位為「更廣泛的即時互動平台」,涵蓋更多裝置、應用程式和模態。

API 世代:GPT-Live-1,2026-09-10#

發布文章(Build more natural voice experiences with GPT‑Live‑1 in the API,vendor-claim)將 7 月的架構變成可購買的產品,而產品的形貌正是架構本身的接縫。

銷售的內容,以及不銷售的內容。OpenAI 以每分鐘 $0.05銷售前端語音層;後端模型和代理程式 harness 由開發者自行提供,與它「配對」並分開計費。因此,Live-Path Minimalism 所述的媒體/應用程式分離,同時也是產品邊界和價格邊界——即時路徑按分鐘計費,其後所有內容則按 token 計費。文章列出的後端選項:GPT-6 Astra(複雜推理)、Luna(排程或訂單更新等高流量任務)、Terra(用於工具呼叫基準測試)——「或第三方模型」。

開發者可控制的項目。對話背後的模型、工具和代理程式 harness;透過系統提示設定語氣、節奏和對話風格;回合偵測,原生支援「雖然 GPT-Live-1 並非回合制模型」,因此應用程式仍可使用明確的回合邊界建構。模型除了音訊,也會原生輸出 ASR 轉錄文字和回應文字,並支援字母數字理解和關鍵字偏置。隨產品推出 12 種新語音(Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder);自訂語音須透過業務銷售管道申請。支援電話服務,這是 OpenAI 介面以外首個明確列出的部署目標。

**委派邊界有了公開的線路格式。**文章中的唯一一段程式碼範例,透過 live.send({ type: "session.commentary.append", delegation_id, content }) 將後端答案傳回即時工作階段——依委派 ID 非同步追加內容,而「連線設定和委派處理……略」。範例中使用的是 Codex SDK 執行緒,也就是開發者端的任意代理程式。這是任何實驗室首度展示互動/背景交接的呼叫簽章;NVIDIA 公布了模型內 token 機制,OpenAI 則公布了面向應用程式的 RPC。

**OpenAI 對此提出的主張(全為第一方數據,並與自家先前模型比較)。**七張基準測試卡將 gpt-live-1 與 gpt-realtime-2.1 和 gpt-realtime-2 比較;其中四張指出 GPT-Live 設定使用的後端,另外三張沒有說明(這本身也有參考價值——見下文)。以下均為 OpenAI 報告的主要數據:

基準測試(指標)gpt-live-1gpt-realtime-2.1gpt-realtime-2使用的後端
Tau3 語音智慧(Pass@1)86.2%45.7%42.4%Astra(medium)
Tau Banking 語音知識(Pass@1)32.0%12.4%10.3%Astra(medium)
Artificial Analysis 對話動態(平均)97.3%95.7%95.3%—
Full Duplex Bench v1.5 互動性(平均)80.10%45.4%47.8%—
Full Duplex Bench v1 回合交替延遲(越低越好)0.798 s1.41 s1.63 s—
Full Duplex Bench v3 工具呼叫(Pass@1)87.0%60.0%58.0%Terra(low)
Full Duplex Bench v3 回應品質90.0%88.0%81.0%Terra(low)

表格支持兩種讀法,但文章本身沒有明說。第一,有星號的列是委派設定的分數,不是語音模型本身的分數——每個智慧與工具呼叫數字,都是 gpt-live-1 搭配具名後端和具名推理強度的成績,因此這是資料庫中第二個案例,顯示這種分離能作為能力介面運作(見互動/背景模型分離)。第二,沒有星號的列,才是前端本身發揮影響的地方,而且各項變化很不一致:Full Duplex Bench v1.5 互動性幾乎翻倍(45.4 → 80.10),回合交替延遲約減半(1.41 → 0.798 秒);Artificial Analysis 對話動態則從 95.7 升至 97.3——這項基準測試在量程頂端已近乎飽和。

**無法完全對上的主張。**文章以「提升 30 個百分點」作為 Full Duplex Bench 的標題主張;但已公布的單項測試都沒有呈現 +30(v1.5 互動性 +34.7、v3 工具呼叫 +27.0、v3 回應品質 +2.0),因此這個標題數字是未說明計算方式的綜合值。客戶數據是轉述,並非 OpenAI 實測:Speak 在早期評估中表示,與先前的回合制系統相比,「打斷情況減少近 80%」,但未說明比較基準;某家未具名公司的共同創辦人表示,對照串接式建置,GPT-Live-1「讓我們的程式碼庫簡化了 80%,並刪除了 23K 行程式碼」(見 Harness Shrinkage as Models Improve);Yelp 表示 Yelp Host 和 Hatch 的通話處理率有所改善。四則客戶推薦中,有三則(Speak、Fin、Cognition)未能從擷取的 DOM 呈現,在本 wiki 的任何地方都未重現。

文章只以文字聲稱、沒有任何測量的內容:「無聲的情境管理」(處理背景噪音和靜默時「不打斷對話,也不把每個步驟都大聲說出來」)、「長時間工作階段的可靠性」(在長時間互動中保留情境),以及持續保持對話的特性——「這讓對話能在背景工作進行時繼續」。這是本資料庫中第三次有獨立來源聲稱能邊說邊思考,也是第三次沒有附上任何測量數據(互動/背景模型分離追蹤此項計數)。

由競爭者評分,採用 OpenAI 未挑選的排行榜(2026 年 9 月)#

API 發布五天後,Google 的 Gemini 3.8 Live 文章(Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking,2026-09-15,vendor-claim)將 GPT-Live-1 Astra 列入四張第三方排行榜——這是該產品首次有任何數據出自 OpenAI 以外,即使數據仍是經由競爭廠商進入本 wiki。以下內容全依 Google 的說法;雙方的排行榜都未在原始來源端查閱。

  • **Artificial Analysis Speech to Speech Index:**GPT-Live-1 Astra(medium)為 81.5,排名第二;Gemini 3.8 Live Extended Thinking(high)以 82.6 領先,高於 Grok Voice Think Fast 2.0 的 81.3。兩者相差 1.1 分,但本資料庫中沒有任何地方公布該指標的組成。
  • **Artificial Analysis τ-Voice(代理程式型):**67.9,再次排名第二,略低於同系列產品的 68.6。
  • **Sierra τ³-Banking:**32.0——與 OpenAI 自家的「Tau Banking Voice」卡完全相同,gpt-realtime-2 的 10.3 也同樣一致。兩家立場相反的廠商公布相同的兩筆數據,表示雙方引用的是 Sierra 的排行榜,而非自行測試;這既是本資料庫首次出現跨廠商數據相互佐證,也是這種佐證的原因。
  • Artificial Analysis 每小時輸入音訊成本:****$5.83,是圖表中最昂貴的系統——相較於 Gemini 3.8 Live 的 $0.84 和 Extended Thinking 的 $3.50。這是對配對產品實測的成本,並非 OpenAI 前端每分鐘 $0.05 的價格;兩者的算術關係,以及為何這是推論而非發現,詳見 Cost-per-Task Over Cost-per-Token。

**無法對上的那一列,才是耐人尋味之處。**OpenAI 自家的測試卡指出,gpt-live-1 + Astra(medium)在「Tau3 Voice intelligence (Pass@1)」上為 86.2%;Google 的圖表則指出,相同產品搭配相同具名後端、採用相同聲明的推理強度,在「Agentic Performance (τ-Voice)」上為 67.9%。既然銀行業的數據列完全相同,這就不是轉錄錯誤——這兩個名稱幾乎可以確定是不同的測試工具,而兩家廠商都沒有公布測試協定。這不能證明任何一方的數字有誤,但提醒我們,在解讀任何語音排行榜數據時,必須確認其基準測試版本。完整對照分析見 Interactivity Benchmarks。

還有一項觀察,僅作為提醒,並非指控:Google 的圖表將 GPT-Live-1 標為 Medium 推理強度,而 Google 的旗艦模型則標為 High。OpenAI 自家的測試卡對 Astra 註明的設定也是 Medium,所以這可能只是公布的設定——但跨廠商圖表中,自家模型的推理強度高於比較對象,就不是受控比較。

相關連結#

  • OpenAI — 建置者;這篇文章是 OpenAI 的第一方建置說明
  • Live-Path Minimalism — 為此打造的服務架構:「語音必須流暢」
  • Full-Duplex Interaction — 實際部署中提供的互動特性(僅限音訊;TML 將其推廣至影片/文字的版本仍是研究預覽)
  • Interaction / Background Model Split — 它獨立發展出的雙模型「說話/思考」架構
  • Turn-Based Interface Bottleneck — 它消解的 harness 元件,以及回合仍可作為衍生的應用程式層檢視方式存在的細節
  • Interactivity Benchmarks — 收錄其七張廠商報告基準測試卡之處,以及為何 0.798 秒的延遲數據不能與其他實驗室自行報告的數據直接競比
  • TML-Interaction-Small — 研究預覽版本:Thinking Machines Lab 早兩個月得出的相同架構結論,延伸至音訊以外,並揭露內部細節
  • Gemini 3.8 Live — 五天後推出的競爭產品,並在四個第三方排行榜上為它評分
  • Artificial Analysis — 為其對話動態測試卡評分,也為 Google 用來評分它的四張圖表中三張評分的評測機構

資料來源#

  • How we built a realtime system for responsive voice AI in six months — OpenAI 工程部落格,2026-07-29(case-study,第一方):系統架構說明。資料庫未收錄另一篇獨立的「Introducing GPT-Live」發布文章;本文對能力和產品的主張,僅限於工程文章明確陳述的內容。
  • Build more natural voice experiences with GPT‑Live‑1 in the API — OpenAI,「Build more natural voice experiences with GPT-Live-1 in the API」,2026-09-10(vendor-claim,約 1,670 字,無個人署名):API 發布、前端每分鐘 $0.05 的價格和後端分開計費、具名後端、12 種語音、電話服務,以及全部七張基準測試卡。以上每個數字都是 OpenAI 以自家先前模型為比較對象來測量自家模型,沒有第三方或獨立測試;七張卡中有四張標明所用後端,另外三張沒有標明。**擷取說明:**圖表卡是以延遲載入方式掛載的 JS 元件,後來以文字形式取出,而非圖片,因此這些數字是讀取所得,並非轉錄;四則客戶推薦中有三則未能呈現,故未收錄。
  • Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google,2026-09-15(vendor-claim):競爭者重現四張出現 GPT-Live-1 的第三方圖表。僅引用 GPT-Live-1 為主體的數據列,並一律註明來自 Google;不以此比較兩款產品的排名——兩家廠商的代理程式型數據列在兩個基準測試名稱下相差 18 分
§ end
Cited by 13
  • Interaction Models×6

    The framing says one model. Google ships two named models, 3.8 Live and 3.8 Live Extended Thinking,…

  • Full-Duplex Interaction×5

    OpenAI's Gpt Live ships audio full-duplex at ChatGPT scale: "its voice model is full-duplex, which…

  • Gemini 3.8 Live×4

    The launch is argued almost entirely on third-party boards rather than internal evals — Artificial…

  • Interaction / Background Model Split×4

    The three bracketed references are Thinking Machines' interaction models, Qwen-audio-agent, and Gpt…

  • OpenAI×3

    gpt live 1 in the api — OpenAI, "Build more natural voice experiences with GPT-Live-1 in the API",…

  • Artificial Analysis×2

    Conversational Dynamics · Interactivity Benchmarks, Gpt Live · near-saturated: 95.3 → 95.7 → 97.3…

  • Interactivity Benchmarks×2

    Gpt Live — the first shipping commercial voice product scored against FD-bench in public, by its…

  • Live-Path Minimalism×2

    The serving-side architecture behind Gpt Live, stated by OpenAI as one principle: "the voice must…

  • Turn-Based Interface Bottleneck×2

    Two months after TML's argument, OpenAI shipped its conclusion: Gpt Live "removes the turn detector…

  • Content-Driven Intervention

    Gpt Live — production audio full-duplex, untested by this protocol; and, from September 2026, a…

  • Google DeepMind

    A sixth posture, and the lab's first appearance in the interaction/multimodal domain: Gemini 3.8…

  • Entities — People, Orgs, Tools & Projects

    Gpt Live — Entity. OpenAI's third-generation voice system (July 2026): a full-duplex voice model…

  • Native Multimodal Modeling: Fusion Depth and I/O Duality

    Nothing from the interaction-model line appears at all: no Tml Interaction Small, no Inkling, no…

Related articles
  • Interaction Models

    Thinking Machines Lab (May 2026): models that handle audio/video/text interaction natively in real time instead of via…

  • Interaction / Background Model Split

    Dual-model architecture: a time-aware interaction model stays present while an async background model handles deep reas…

  • Interactivity Benchmarks

    FD-bench, Audio MultiChallenge + TimeSpeak/CueSpeak (proactive audio) and RepCount-A/ProactiveVideoQA/Charades (visual…

  • Full-Duplex Interaction

    Perceive-and-respond simultaneously across modalities — a property of scheduling, not of emitting in speech; proactive…

  • Gemini 3.8 Live

    Google's September 2026 live-dialogue pair — 3.8 Live (scale/cost) and 3.8 Live Extended Thinking (high-complexity), sh…