H
Howardism
Plate IIInteraction & Multimodal機器翻譯 · machine-translatedENHOWARDISM

Interaction Models

Thinking Machines Lab(2026 年 5 月):能原生即時處理音訊/視訊/文字互動的模型,而非透過 harness 實現;只有當互動性存在於模型之中,才會隨智慧一同擴展——OpenAI 的 GPT-Live(2026 年 7 月)也獨立在正式環境推出了相同結論中的音訊部分

Article metadata
Publication details
Published:May 13, 2026
Filed:Concept
Domain:Interaction & Multimodal
Tags:LLM ArchitectureMultimodalHuman AI Collaboration
Reading:27 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Interaction Models 插圖

資料來源#

摘要#

互動模型是能以「原生」方式處理互動的模型——持續接收音訊、視訊與文字,並即時思考、回應及採取行動——而非透過外部 scaffolding(VAD、回合偵測、對話管理 harness)模擬即時行為。Thinking Machines Lab 於 2026 年 5 月以研究預覽形式發布此構想,並推出首個名為 TML-Interaction-Small 的模型。

核心賭注是:**互動性應與智慧同步擴展。**若互動屬於模型的一部分,擴大模型規模就能讓它既更聰明,也成為更好的協作者。若互動存在於人工打造的 harness 中,The Bitter Lesson 指出,harness 的進步會被通用能力的成長甩在後頭。

一句話說明論點#

「若要讓互動性隨智慧一同擴展,它就必須成為模型本身的一部分。」

這是將 harness 收縮論(參見 Harness Shrinkage as Models Improve)套用到互動層:VAD、回合邊界預測、對話狀態機——這些「智慧程度明顯低於模型本身」的機制——都應融入模型行為。一旦如此,harness 無法支援的能力(主動插話、邊聽邊說、對視覺線索做出反應)便會成為模型行為的特例,並隨規模提升而改善。

解鎖的能力(而非 harness 功能)#

  • 流暢的對話管理——模型能隱性追蹤說話者是在思考、讓出發言權、自我修正,還是在邀請回應。不需要獨立的對話管理元件。
  • 語音與視覺插話——模型會在情境需要時加入對話(「我說錯時打斷我」、「我寫出 bug 時提醒我」),而非只在回合結束時回應。
  • 同步發言——使用者與模型同時說話(即時翻譯)。
  • 時間感知——直接感知經過的時間(「我跑一英里花了多久?」)。
  • 同步呼叫工具/搜尋/生成式 UI——模型在聆聽與說話的同時,也能同步搜尋、瀏覽、生成 UI,並將結果融入對話。

這些能力的展示與衡量方式,請參見 Full-Duplex Interaction 與 Interactivity Benchmarks。

為何回合制介面成為瓶頸#

如今的模型「以單一執行緒體驗現實」:它們會在使用者打字或說話時閉目等待,直到使用者結束;接著又會在生成期間盲目輸出,直到完成或遭到打斷。這是協作的狹窄通道——它限制了使用者有多少知識、意圖與判斷能傳達給模型,也限制了模型工作的可理解程度。原文以此類比:透過電子郵件而非當面解決關鍵分歧。完整討論見 Turn-Based Interface Bottleneck。

架構(三項關鍵構想)#

  1. Time-Aligned Micro-Turns——輸入與輸出都是連續串流,以 200ms 區塊處理/生成,不設人為回合邊界。沉默、重疊與打斷都留在脈絡中。
  2. Interaction / Background Model Split——具時間感知能力的互動模型維持即時在場;非同步背景模型負責持續推理、使用工具及較長期的工作。互動模型會以豐富的脈絡套件(完整對話,而非單獨的查詢)委派工作,並在適合使用者當下活動的時機穿插回傳結果。整體效果是:「推理模型的規劃、工具使用與代理工作流程,搭配非思考模型的回應延遲。」
  3. Encoder-Free Early Fusion——採用最低限度的前處理,而非大型獨立編碼器/解碼器:音訊以 dMel 加上輕量嵌入輸入;影像透過 hMLP 切成 40×40 區塊;音訊輸出則透過 flow head。所有元件都與 transformer 從頭共同訓練。

此外還有工程設計:使用串流工作階段,以低額外成本頻繁執行小型 prefill/decode(已 upstream 到 SGLang);針對延遲調校的 MoE kernel(使用 gather+gemv,而非 grouped gemm);透過 batch-invariant kernel 達成位元級 trainer-sampler 對齊(<5% 額外成本),提升穩定性與可除錯性。

趨同:OpenAI 推出音訊部分(2026 年 7 月)#

OpenAI 的 GPT-Live 從相反方向得出相同架構結論——著眼於正式環境中的延遲工程,而非押注規模化研究——並以 ChatGPT 規模推出。對照三大支柱:由全雙工模型掌控對話,不使用回合偵測器(僅音訊;跨模態泛化仍是 TML 的部分);委派工作給前沿模型作為背景處理(Interaction / Background Model Split,背景槽位使用 GPT-5.5);微回合內部機制則未公開——OpenAI 的說明轉而聚焦服務端(Live-Path Minimalism):有狀態的串流推論、無縫的執行個體交接,以及將壓縮作業移出即時路徑。兩家實驗室相隔兩個月,一家提出論點(「若要讓互動性隨智慧一同擴展,它就必須成為模型的一部分」),另一家則推出最有力、可檢驗的推論(回合偵測器已消融——參見 Turn-Based Interface Bottleneck)。

第三種推導:語音研究實驗室的觀點(2026 年 9 月)#

Hu et al.(NVIDIA,arXiv 2609.19334,2026-09-16,empirical)從第三個方向得出支柱 2,而且只得出支柱 2:串流 ASR 與全雙工語音研究,背後沒有規模化論點,也沒有服務架構改寫。他們提出的動機是容量論點,而非延遲考量(「音訊 token 會消耗參數與脈絡預算,而純文字 LLM 可將這些資源用於……工具呼叫能力」);他們的貢獻則補上了先前兩種說法都未公開的部分:已發表的委派訊號——agent-text 通道中的 <tc bos>/<tc eos> 控制 token 配對,結果則透過 prefill-and-repeat 傳回(Interaction / Background Model Split 說明了其機制,以及與 TML 說法不同的三個地方)。

這篇論文也盤點了趨同現象,因此除了其自身系統之外,對本文也很有參考價值。論文列出具有相同架構形態的同期設計:KAME、MoshiRAG、本文介紹的 Thinking Machines 研究、Qwen-audio-agent、GPT-Live、NVIDIA 的 Nemotron Voice Agent,以及 LiveKit 的 EXA Deep Researcher;另有 DuplexSLA,代表未採用的路線:在 Moshi 式雙工模型內部設置專用通道來呼叫工具。因此,這種分離架構目前已有七個左右的實例,以及一個被點名的現行替代方案。這就是一種設計模式尚未確定是否會長久存在之前的樣貌。

這份資料沒有佐證論點的其他部分。它的前端是雙工語音轉文字模型,搭配獨立的串流 TTS;僅支援音訊,沒有視訊,也沒有跨模態泛化;而且它採用委派方式,不會持續在場。因此,這是支持該架構的證據,而非支持「互動性隨智慧一同擴展」的證據。

第四家實驗室,首次未提及分離架構(Google,2026 年 9 月)#

Google 推出 Gemini 3.8 Live(Gemini Audio Team,2026-09-15,vendor-claim),是本文資料集中第四個前沿即時語音系統,也是第一個公開說明中完全沒有架構資訊的系統——值得記錄的是,這種缺席有其特定樣貌,因為文章的兩種說法指向相反方向。

說法呈現的是單一模型。Google 推出兩個具名模型:3.8 Live 與 3.8 Live Extended Thinking。後者「專為高複雜度任務打造,具備更高智慧與多步驟推理能力」,並表示它能**「同時推理與說話」,同時「維持不中斷的對話流程」。每根基準測試長條都標示推理努力程度**——High、Medium、Minimal——而且是附加在即時模型本身。這是單一模型搭配思考調節鈕的用語,與 OpenAI 的模型卡形成精確對照:OpenAI 在註腳標明後端模型名稱與努力程度(Astra 為 medium,Terra 為 low)。兩家供應商,兩套語法:Google 的努力設定是你正在對話的對象本身的屬性;OpenAI 的設定則是背後系統的屬性。

用語卻呈現兩個模型。同一篇文章寫道:「它會在背景中執行工具與 API 呼叫,同時繼續對話,因此模型可以確認收到請求,並在背景任務完成期間繼續聊天」,另有「早期語音提示,例如*『我來查查看……』*」,以及「即時進度旁白,在多步驟背景任務進行時逐步向使用者說明」。背景執行、確認用填充語、步驟旁白,是委派系統的三個可觀察特徵——等待時使用的短語只是換了名稱的 NVIDIA 約 1 秒填充語,而進度旁白正是 OpenAI 以「不存在」為賣點的行為。能邊說邊推理的單一模型,顯然不需要其中任何一項。

這證明了什麼,又沒證明什麼。它證明第四家供應商以內化分支的方式呈現產品——單一即時模型、模型上有努力程度調節鈕、沒有具名後端,也沒有後端定價。這是本文資料集中首次有任何一方公開以這種方式描述前沿語音產品。但它無法證明實作方式:文章沒有提及任何元件、未公布委派訊號、未提供延遲數據;而 EVA-Bench 執行結果的註腳則指出測試是在「Gemini Enterprise Agent Platform」上的 Live API 執行——那是平台,不是模型。文章指向的 DeepMind 模型卡尚未納入資料;根據調查者的說法,除了「以 Gemini 3 Pro 架構為基礎」、128K 脈絡與 2025 年 1 月的知識截止時間,沒有其他架構資訊。因此,分離架構的問題只多了一種呈現方式,沒有新增披露;這正是最容易被過度解讀的證據類型。本文將其視為單一供應商的產品呈現選擇,在下方的待解問題中如實記錄,不將其計為任一分支的實例。

**它確實解答了一個更小的問題。**委派式架構不是所有人共同採用的公開說法:三家實驗室描述了分離架構,一家沒有。因此,若談的是供應商如何描述產品,「所有人都趨同採用分離架構」已經言過其實,不論實際系統採用何種做法。

安全性角度#

即時互動帶來的安全性壓力,與回合制交流不同。TML 的研究聚焦兩個面向:

  • 符合模態特性的拒答——以 TTS 生成的拒答/過度拒答訓練資料,讓語音拒答聽起來自然,但立場同樣堅定。
  • 長期穩健性——自動化紅隊測試 harness 生成多回合拒答資料,維持與文字模型拒答行為的一致性。

限制(依原文說明)#

  • 長時間工作階段——連續 A/V 會快速累積脈絡;串流工作階段設計能妥善處理短/中時長工作階段,但很長的工作階段需要謹慎管理脈絡(與 Context Window Smart Zone 的問題相似)。
  • 運算與連線——低延遲 A/V 串流需要穩定連線;沒有穩定連線時,效能會大幅下降。
  • 規模——TML-Interaction-Small 是 276B MoE/12B active;目前較大型的預訓練模型在此使用情境下服務速度太慢;承諾「今年稍晚」推出更大型模型。
  • 背景代理——研究承認代理智慧至關重要,但相較即時互動仍探索不足。

第五種推導:不販售產品的調查研究(2026 年 5 月)#

上述每一種推導都來自推出即時語音系統的實驗室。An, Lu, Dong et al.(Tencent Youtu Lab + 5 所大學,arXiv 2605.25343,practitioner-opinion)從相反方向得出論點——這是一份 52 頁的架構調查,涵蓋 43 個開放多模態模型,當中完全沒有互動產品——其 §8.4 結論以架構術語重述了本文論點:真正原生的互動代理需要「從設計之初就具備串流能力,而非在自迴歸主幹外事後套上包裝。」事後套上的包裝就是 harness;從設計之初便具備,就是「模型本身的一部分」。

這份調查補充了供應商推導無法提供的兩件事。

**它提供機制,而不只有結論。**調查的 §5 指出,融合深度會迫使訓練方式呈現特定特徵:在中期融合中,一旦梯度到達編碼器,就必須採用差異化學習率;在早期融合中,z-loss 與 QK-Norm 會成為先決條件(沒有 QK-Norm 時,Chameleon 在訓練約 20% 後開始發散),而模態混合排程則取代差異化 LR。若這是正確的,「將互動放進模型」就不是某家實驗室可自行採用、另一家可拒絕的設計偏好——這項承諾會一路傳遞到最佳化器。本文的 bitter-lesson 論點一直聚焦於結果;這是資料集中首個從訓練機制切入論證的來源。

**它從供應商以外的角度標示了差距出現的時間。**同一節指出,品質一致、穩定可部署且低延遲的全雙工系統仍是「尚待解決的產業問題」,並將 Moshi、ELLSA 與 FireRedChat 列為線索而非解決方案。這是 2026 年 5 月的中立說法,指出當時尚未達成目標;本文上文整理的 2026 年 7 月至 9 月產品宣稱,可與此對照閱讀。

**值得明確指出的限制。**這份調查僅盤點開放原始碼模型,以及架構經過驗證的技術報告,因此 TML-Interaction-Small、Inkling、GPT-Live 與 Gemini 3.8 Live 都未納入——**它是一種從未檢視過互動模型的論點推導。**兩者之間唯一的橋樑是 Moshi;唯一量測的互動數值是基準測試目標(Moshi Eval 的 200 ms、SoulX-Duplug-Eval 的 240 ms),不是實際結果。

延伸閱讀#

待解決的問題#

  • 互動/背景模型分離架構能否泛化,還是只是一種過渡性產物,直到單一模型同時具備足夠速度與深度?部分解答(2026-08-04):此架構已跨實驗室泛化——GPT-Live 在正式環境推出相同分離設計(全雙工語音模型委派工作給 GPT-5.5),並獨立從延遲工程推導而來。分離架構究竟是永久設計還是過渡方案,仍無定論;兩種實作只能證明趨同,不能證明它會永久存在。延伸(2026-09-21)——泛化的部分已有定論,過渡性的部分則更明確。Hu et al.(NVIDIA,empirical)是第三種起點(語音-ASR 研究,動機是參數容量論點,而非延遲或服務架構)出發的第三種獨立推導;其相關工作一節又列出四個同期實例,以及兩個串接式正式環境系統。三家實驗室、三種理由、一種架構:泛化不再是尚待解答的部分。兩項新事實與過渡性有關。反對過渡性的證據:分離架構表現得像一個能力介面——將後端從 Qwen2.5-7B 換成 Qwen3-30B-A3B,再換成 Qwen3-235B-A22B,在互動端權重完全不變的情況下,EVA-Bench 任務完成率從 40.4 升至 57.3;若腳手架預計會被吸收,就不會刻意設計出這種特性。支持過渡性的證據:此實作的代理能力,來自放棄分離架構本身的前提——前端在委派期間會保持靜默,而不是持續在場;另一分支則是現行且具名的替代方案,DuplexSLA 在雙工模型內部化工具呼叫。可推翻原假設的測試仍未改變,而且已具體化:單一雙工模型不必靜默,就能達成與委派系統相同的工具呼叫準確度。再次延伸(2026-09-21)——能力介面的證據如今來自商業產品,代表另一種耐久性。OpenAI 於 2026-09-10 將分離架構作為產品推出(vendor-claim):前端語音層定價為每分鐘 $0.05,後端由開發者選擇並付費,文章也明確表示後端可以是「第三方模型」。若供應商打算吸收這種腳手架,就不會圍繞前端推出價目表,不會為任意開發者端代理發布委派呼叫簽章(session.commentary.append 搭配 delegation id),也不會邀請競爭對手的模型加入後半段。即便如此,這仍只是過渡性問題上的另一項宣稱——OpenAI 有銷售前端服務的利益;供應商自己的基準測試註腳也顯示,分離架構正承擔實際工作(智慧卡背後是中等努力程度的 Astra,工具呼叫卡背後是低努力程度的 Terra),而非由前端獨自填補差距。要解決問題的兩項事實,雙方都仍未提供。第三度延伸(2026-09-21),這次是減去證據而非增加。Google 推出 Gemini 3.8 Live(vendor-claim)是第四個前沿即時語音產品,也是首個公開說明未描述分離架構的產品:兩個具名即時模型以附加在模型本身的努力程度設定區分,沒有具名後端,也沒有後端定價;Extended Thinking 等級則「同時推理與說話」。若將其視為支持過渡分支的證據,力度不強,但它是首例:供應商以內化替代方案作為正式推出的產品呈現,而不再只是 DuplexSLA 研究中未採用的路線。仔細閱讀,這只是呈現方式,並非架構披露:同一篇文章也說模型會「在背景中執行工具與 API 呼叫,同時繼續對話」,販售確認用填充語(「我來查查看……」)與多步驟背景任務的即時進度旁白,並在註腳中指出代理基準測試是在 Gemini Enterprise Agent Platform 上執行。背景執行、等待短語與步驟旁白,是委派的三種表面特徵;因此,文章既符合未公開分離架構的說法,也符合單一模型邊說邊思考的說法,無法區分兩者。這對問題改變的是可推翻原假設的測試形式,而非其內容:現在很明確,供應商的產品說法無法解答這個問題——仍需透過量測或披露進行驗證,而 Google 兩者都沒有提供。第四度延伸(2026-09-23),這次是量測結果,而非產品說法。NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities(NVIDIA,empirical)是由同一間在兩天前發表委派式系統的實驗室打造並進行基準測試的內化替代方案,因此是此問題至今最接近反事實比較的一例。上文提出的可推翻條件——單一雙工模型不必靜默,就能達成委派系統的工具呼叫準確度——如今已對兩個部分進行測試,結果都未達標,且原因值得注意。準確度方面,內化模型在路由欄勝出,卻在任務上落敗:在 Full-Duplex-Bench 3.0 中,它的工具選擇 F1 為 82.5,高於委派系統的 71.7–74.6 工具準確度;但論元準確度為 42.2,低於 52.8–55.2,Pass@1 為 33.0,也低於 44.0–48.0(兩篇論文對路由指標的稱呼不同,一篇用 F1,一篇用準確度,因此請看第二與第三欄)。在不靜默方面,它甚至無法打平:工具執行期間,它會播放預先設定且依工具而異的確認語、填充 agent-text 通道,而且——比委派式前端的讓步更進一步——停止根據輸入音訊調整回應生成,因此呼叫期間無法插話。這項研究證明:內化工具呼叫並不能恢復即時路徑;而分離架構實際提供的能力是論元依據與多步驟組合,不是工具選擇。仍待解答的問題和之前相同——沒有人在相同的後端延遲分布下比較兩者,再詢問使用者偏好哪一種——而內化分支如今也有了已發表的能力上限(每個工作階段最多五種工具,同時呼叫多種工具並不可靠)。目前統計:三家實驗室描述分離架構,一家拒絕描述任何架構;唯一同時打造兩種分支的實驗室,推出了 Pass@1 較佳的委派式版本,並以開放權重發布內化版本。
  • 「互動性隨智慧一同擴展」仍是主張;2026 年稍後推出更大型模型時,便是檢驗時機。部分解答(2026-09-21)——測量了一個面向,結果卻朝相反方向。Peng et al.(empirical)測試五種開放全雙工語音家族的七種設定,但沒有提供任何一種模型的智慧或任務能力分數,因此無法從此來源讀出跨家族的能力與互動性相關性;真正的預測測試——推出更大型的 TML 模型——仍未進行。這項研究提供了目前最接近的替代指標,而且結果為負。兩種對齊互動性的 RL 分支——Moshika-RL 與 PPlex-RL,以暫停處理、輪流發言、附和與打斷進行後訓練——在內容上都變得更安靜,而非更主動:Moshika-RL 的中性開口率從 .07 降至 .03,直接問題開口率維持在 .15,沉默開口率則從 .12 升至 .18;錯誤事實與危險情境的開口率降至 .01/.01,低於自身基準。PPlex-RL 的中性開口率從 .10 降至 .01,問題/中性的差距從約 3.4 倍拉大至約 21 倍,而錯誤事實與危險情境則分別為 .02/.04。這迫使原始主張作出實用區分:輪流發言意義上的互動性(回應能力,以及精確判斷何時輪到自己說話)可以透過訓練學會,也確實能藉由特定後訓練改善;而自行判斷是否開口意義上的互動性(內容有需要時主動發言)不會隨之而來,甚至可能退步。原主張中的一個詞承擔了兩種不同含義。完整討論見 Content-Driven Intervention 頁面。延伸(2026-09-21):新增首個供應商內部資料,顯示在主張失效之前,量測工具就已經失靈。Google(vendor-claim)在同一個即時架構上推出兩個等級,並以單一第三方綜合分數評分:Gemini 3.8 Live 在 Artificial Analysis Speech to Speech Index 得分 76.0,Gemini 3.8 Live Extended Thinking 得分 82.6。若照字面解讀,這正是主張預期的樣貌——智慧提升、互動性分數更高、屬於同一模型家族,且 harness 沒有改變。但三點使其無法成為證據。第一,綜合分數壓縮了原本想呈現的效果:唯一另外公布的單項指標 τ-Voice 代理圖表,在同樣兩個等級之間從 30.1 升至 68.6,增加 38.5 分,而綜合分數只增加 6.6 分,顯示該指數主要受幾乎沒有變動的因素影響。第二,綜合分數與該單項指標對兩個模型的排名順序相反——在指數上,High 努力程度的 3.8 Live 勝過 Gemini 3.1 Flash Live(76.0 對 71.5);在 τ-Voice 上卻輸給它(30.1 對 37.7)。第三,資料集中沒有任何內容說明此指數如何組成或加權,圖表上的方法註腳指向供應商自己的頁面,而非評估者的頁面。因此,問題等待已久的數據雖然出現,卻來自無法承載該論點的量測工具。更精確的說法是:必須將智慧與互動性拆成不同項目評分,才能檢驗此主張;唯一推出兩級比較的供應商,反而只公布一個數字。完整討論見 Interactivity Benchmarks 頁面。
  • 已宣布提供互動性基準測試研究補助——視訊主動性會有什麼 FD-bench 對應測試?部分解答(2026-09-21)——問題中的音訊部分已有答案,視訊部分則尚無。Peng et al.(empirical,arXiv 2609.19596)是資料集中首個第三方、可重現的主動性量測工具:脈絡一致的獨白只改變觸發語句;根據輪流發言理論衍生出十種條件;將詞間停頓縮短至 0.12 s,避免發言機會干擾發言理由;採用分母明確的單一開口率標量;並公開刺激資料與評估程式碼。這正是問題所要求的形式——但它只涵蓋音訊,包含 40 段英文獨白,由兩種合成 TTS 聲音朗讀。它也讓視訊版本需要做到的事更加明確,因為兩個關鍵設計步驟不依賴特定模態:固定脈絡,只改變觸發條件;以及將發言機會與發言理由分開控制。RepCount-A、ProactiveVideoQA 與 Charades 都沒有做到這兩點——它們各自提供固定指令,再測量發言時機,這測到的是有明確指示的情況。這裡的資訊無法說明研究補助是否會產生視訊量測工具,因此觸發條件並未改變。

資料來源#

§ end
Cited by 30
Related articles
  • Interaction / Background Model Split

    Dual-model architecture: a time-aware interaction model stays present while an async background model handles deep reas…

  • Turn-Based Interface Bottleneck

    Why current AI interfaces limit collaboration: single-thread turn-taking is a bandwidth bottleneck; humans pushed out b…

  • Full-Duplex Interaction

    Perceive-and-respond simultaneously across modalities — a property of scheduling, not of emitting in speech; proactive…

  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • Interactivity Benchmarks

    FD-bench, Audio MultiChallenge + TimeSpeak/CueSpeak (proactive audio) and RepCount-A/ProactiveVideoQA/Charades (visual…