資料來源#
- A frontend-backend architecture for tool calls in full-duplex speech models
- Build more natural voice experiences with GPT‑Live‑1 in the API
- Full-Duplex Speech Models Take the Floor When Asked, Not When Needed
- Interaction Models: A Scalable Approach to Human-AI Collaboration
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities
- OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
- Toward Native Multimodal Modeling: A Roadmap
摘要#
Thinking Machines Lab 用來主張 TML-Interaction-Small 是「第一個兼具強大智慧/指令遵循能力與互動性的模型」的評估範圍。現有基準幾乎沒有涵蓋互動性,因此 TML 使用少數現有基準,並新增數個內部基準;同時指出「沒有現有模型能有意義地完成」視覺主動性任務。研究機構已宣布提供互動性基準測試研究補助。
使用中的現有基準#
- FD-bench(v1 / v1.5 / v3)——少數旨在測量互動性的基準之一。模型會收到預錄音訊,必須在特定時間點回應;情境包括:使用者打斷、使用者應和、與他人交談、背景語音。v1 回報輪替延遲;v1.5 回報平均分數;v3 回報使用工具時的回應品質/Pass@1。
- Audio MultiChallenge——常用於測量音訊智慧與指令遵循能力的基準(APR 指標);基準線由 Scale AI 回報。
- BigBench Audio、IFEval (VoiceBench)、IFEval (text)、Harmbench (text refusal rate)——跨模態的標準智慧/IF/安全檢查。
- QIVD(Qualcomm IVD)——影片+音訊問答,在串流情境中評估(從開頭提供原始片段、評分逐字稿;採用 GPT-4o-mini 評分器,依循 Qwen 3.5 Omni)。
主要結果(TML-Interaction-Small,2026 年 5 月)#
- FD-bench v1 輪替延遲:0.40s——在所有比較模型中反應最快(GPT-realtime-2.0 minimal 為 1.18s、GPT-realtime-1.5 為 0.59s、Gemini-3.1-flash-live minimal 為 0.57s)。
- FD-bench v1.5 平均:77.8,所有基準模型約為 39–54(包括 thinking-high 模型)。
- FD-bench v3(音訊+工具):啟用背景代理程式時,回應品質為 82.8%/Pass@1 為 68.0%——兩項均居首。
- Audio MultiChallenge APR:43.4%——勝過所有非思考型基準模型;只有 GPT-realtime-2.0 xhigh(48.5%)更高。
- 主張:「互動品質居首,且比任何非思考型模型都更聰明。」
表格中的 * 表示結果是在啟用背景代理程式的情況下回報(用於需要推理或工具呼叫的基準)。
新增的內部基準(主動音訊)#
- TimeSpeak——模型能否在使用者指定的時間主動開口,並說出正確內容?例如:「每隔 4 秒提醒我吸氣、吐氣,直到我叫你停下來。」
- CueSpeak——模型是否會在適當時機說出語意正確的回應?測試項目設計成模型必須與使用者同時開口。例如:「每次我切換語言時,告訴我原語言的正確用詞。」
兩者都是每個範例設有一個預期語意回應和時間窗口;由 LLM 評審;只有意思和時機都正確才算正確;以宏平均準確率計分。
新增的內部基準(視覺主動性)#
改編自現有影片基準;「沒有現有模型能有意義地完成其中任何一項」——包括 thinking-high 模型在內的模型不是保持沉默,就是回答錯誤:
- RepCount-A——重複動作影片,改編為線上次數計數;在「替我數出 {action} 的次數」之後串流影片;評分方式是:在倒數第二次重複動作後說出的最後一個數字,與正確答案相差是否在一次以內。測量持續視覺追蹤與及時計數能力。
- ProactiveVideoQA——答案會在特定時刻才出現的影片問答;以回合加權 PAUC@ω=0.5(0–100)計分,並按回合/類別取平均;保持沉默得分為 25.0;答案必須在正確時間提出,錯誤答案會被扣分。
- Charades——時間性動作定位;「當人物開始 {action} 時說『start』,停止時說『Stop』」;以預測與參考區間間的時間 IoU 評分。
評估範圍中的工具呼叫部分(2026 年 9 月)#
以上內容測量的是互動。第二群基準測量語音代理程式是否真的能執行任務;Hu 等人(NVIDIA,arXiv 2609.19334,2026-09-16,empirical)在同一系統上執行其中四項,這是本知識庫首次將它們並列整理。其動機數字來自 τ-Voice(arXiv 2603.13686):在乾淨條件下,領先的商用全雙工語音模型完成有根據的客戶服務任務的比例為 31–51%,而 GPT-5 在相同任務的文字版本中為 85%;在雜訊與口音語音下,差距還會擴大。根據目前證據,語音互動與工具呼叫能力是兩種不同的優勢。
- BFCL-audio(ServiceNow-AI 將 Berkeley Function-Calling Leaderboard v3 單輪集合轉為音訊版本,以 AST 準確率評分):Simple / Multiple / Parallel / Parallel-Multiple / Irrelevance。NVIDIA 最佳組態平均為 74.6,GPT-realtime 則為 80.8;差距主要集中在 Parallel-Multiple(61.1 vs 74.0)與 Irrelevance(81.2 vs 90.8)。值得警惕的一列是 Ultravox-v0.6 Llama-3.1-8B 在 Irrelevance 得 0.0——它對全部 240 個提示都呼叫唯一提供的函式,因此其 43.3 平均分是模型無法拒絕的產物。
- Full-Duplex-Bench v3(arXiv 2604.04847):來自 12 位講者的 100 個情境,採用真實人類錄音,以日常麥克風錄製,包含停頓、猶豫與自我修正,並使用模擬 API 和 GPT-4o 評審。回報工具準確率、引數準確率、Pass@1、回應品質,以及——獨有的——輪替、打斷和填充語率。這項基準會因全雙工系統的全雙工行為而扣分:NVIDIA 的輪替率為 100%、填充語率為 83–85%,後者是「刻意設計」的結果,因為前端會在委派前說出等待語;打斷率為 51–54%,因為它會在使用者說話不流暢時插入應和語。
- EVA-Bench(arXiv 2605.13841):涵蓋航空、ITSM 與醫療人資領域的 213 個有根據多輪客戶服務情境,包含模擬來電者,並由 GPT-5.2 評審。EVA-A 取任務與忠實度平均;EVA-X 取進度、簡潔度與可說性平均。有意思的是各領域的拆分結果——NVIDIA 的 235B 後端系統在航空任務完成率上勝過 GPT-realtime-2(72% vs 54%),但在 ITSM(56.3% vs 75%)與醫療人資(49.4% vs 69.9%)方面大幅落後;作者將差異歸因於這些領域需要串連 6–8 次成功的工具呼叫,也就是前端的委派權杖必須在一次對話中可靠觸發多次。區分系統的是工具鏈的深度,而非任務難度。
- Full-Duplex-Bench v1 在此以 Candor 子集形式再次出現(流暢輪替 TOR 與延遲、停頓 TOR、使用者打斷 TOR/GPT 分數/延遲),作為消融評估範圍而非排行榜——見Live-Path Minimalism。
同一評估範圍上的廠商排行榜(OpenAI,2026 年 9 月)#
OpenAI 的 GPT-Live-1 API 發布公告(2026-09-10,vendor-claim)在這個評估範圍公布七張基準數據卡,這是商用語音產品首次正式推出後公開以 FD-bench 評分。此處將其列為主張,證據層級低於本頁其他所有內容:OpenAI 評估 OpenAI,只與自己的舊模型比較,沒有第三方參與比較,也未公布評測規程。
| 基準(指標) | gpt-live-1 | gpt-realtime-2.1 | gpt-realtime-2 | 註明的後端 |
|---|---|---|---|---|
| Tau3 Voice intelligence(Pass@1) | 86.2% | 45.7% | 42.4% | Astra(medium) |
| Tau Banking Voice knowledge(Pass@1,97 項任務) | 32.0% | 12.4% | 10.3% | Astra(medium) |
| Artificial Analysis Conversational Dynamics(平均) | 97.3% | 95.7% | 95.3% | — |
| Full Duplex Bench v1.5 Interactivity(平均) | 80.10% | 45.4% | 47.8% | — |
| Full Duplex Bench v1 輪替延遲 ↓ | 0.798 s | 1.41 s | 1.63 s | — |
| Full Duplex Bench v3 工具呼叫(Pass@1) | 87.0% | 60.0% | 58.0% | Terra(low) |
| Full Duplex Bench v3 回應品質 | 90.0% | 88.0% | 81.0% | Terra(low) |
有四點值得記錄,以下依資訊能承受證據層級折減的程度,由高至低排列。
表格中最有用的是後端註腳,而且是 OpenAI 自己加上的。 四張數據卡說明 GPT-Live 組態背後的後端與推理力度,另三張則沒有。帶星號的項目因此是某種配對的分數;廠商對兩類任務選用了不同後端與不同推理力度——智慧任務用中等力度的 Astra,工具呼叫用低力度的 Terra。這正是本頁為 TML 採用的 * 慣例,也是 NVIDIA 測量、如今出現在廠商自家註腳中的能力介面特性(互動/背景模型拆分)。
僅由前端處理的項目變化幅度很不平均,這種模式最值得留意。 FDB v1.5 互動性從 45.4 升至 80.10,v1 延遲從 1.41 降至 0.798 s,幅度都很大;Artificial Analysis Conversational Dynamics 從 95.7 升至 97.3,幅度則不大——前一代模型在這項基準上已達 95.3,幾乎沒有空間可區分差異;納入這項數據呈現的是飽和問題,而非能力差距。
少見的跨實驗室局部一致性檢查,核對的是基準線,而非標題數字。 本頁記錄 τ-Voice 的發現:領先的商用全雙工語音模型在有根據的客戶服務任務上為 31–51%,GPT-5 在文字版本則為 85%。OpenAI 自家的基準線落在該區間內——gpt-realtime-2.1 在 Tau3 航空/零售/電信任務的 Pass@1 為 45.7%,gpt-realtime-2 為 42.4%——兩個獨立方在相似任務類別上,將 GPT-realtime 系列評在同一範圍。相較之下,OpenAI 宣稱 gpt-live-1 + Astra 達 86.2%,也就是 τ-Voice 測得的語音代理程式與文字代理程式差距如今已經消失。若此數字成立,這是本節影響最深遠的單一數字;但它完全依據廠商發布公告,基準 Tau3 在此資料集中沒有獨立測試結果,而且組態包含負責推理的前沿文字後端——因此它不能證明全雙工語音模型已消除差距,只能證明全雙工前端加上前沿後端,能取得與文字代理程式相當的分數。
文字版標題主張無法與任何已公布的數據卡相符。 OpenAI 的文字宣稱 GPT-Live-1「Full Duplex Bench 表現比 GPT-Realtime-2.1 提升 30 個百分點」。沒有任何數據卡顯示 +30:v1.5 互動性提升 +34.7,v3 工具呼叫提升 +27.0,v3 回應品質提升 +2.0,而 v1 是延遲指標。標題數字是由一組未說明的項目計算出的未說明綜合值;應引用個別數據卡,而非 30。
本頁未收錄,且無法在此核對: 客戶轉述的數字——Speak 宣稱相較未指明的「先前回合制系統」,打斷次數「幾乎減少 80%」;Yelp 則表示通話處理率提升。這些是沒有基準評測規程的商業成果,記錄於 GPT-Live。
第二份廠商排行榜:以其他人的排行榜作圖(Google,2026 年 9 月)#
Google 的 Gemini 3.8 Live 發布公告(2026-09-15,vendor-claim)比 OpenAI 晚五天發布,完全以五張圖表來論證,修辭立足點與上一節正好相反。OpenAI 只與自己的舊模型比較;Google 則重製已包含競爭對手的第三方排行榜:三張圖標題為 Artificial Analysis,另有一張 Sierra、一張 ServiceNow。對外部讀者來說,這種做法更理想,但它仍是廠商從他人的排行榜中挑選並轉錄的子集;本資料集中沒有 AA、Sierra 或 ServiceNow 的原始發布內容可供核對。Gemini 3.8 Live有完整產品介紹。
Speech to Speech Index(Artificial Analysis)——本知識庫首次見到的跨廠商語音指標。每個長條都標示了推理力度設定:
| 模型 | 推理力度 | 分數 |
|---|---|---|
| Gemini 3.8 Live Extended Thinking | High | 82.6% |
| GPT-Live-1 Astra | Medium | 81.5% |
| Grok Voice Think Fast 2.0 | High | 81.3% |
| Gemini 3.8 Live | — | 76.0% |
| Gemini 3.1 Flash Live | High | 71.5% |
| Gemini 3.1 Flash Live | Minimal | 63.9% |
Agentic Performance,τ-Voice(Artificial Analysis)——ET 68.6 / GPT-Live-1 Astra(Medium)67.9 / Grok Voice Think Fast 2.0(High)56.5 / Gemini 3.1 Flash Live(High)37.7 / Gemini 3.8 Live 30.1 / Gemini 3.1 Flash Live(Minimal)26.2。
τ³-Banking Leaderboard(Sierra)——ET 35.1 / GPT-Live-1 Astra(Medium)32.0 / xAI-Realtime 16.5 / Gemini 3.1 Flash Live(High)11.3 / GPT-Realtime 2(High)10.3。Google 的文字稱這是「Sierra 的 τ-Voice-banking 基準」;圖表標題是「τ³-Banking Leaderboard」。請採用圖表名稱。
每小時輸入音訊成本,以 Big Bench Audio 子集測得(Artificial Analysis)——Gemini 3.8 Live $0.84 / Gemini 3.1 Flash Live Minimal $1.50 / High $1.75 / Gemini 3.8 Live ET(High)$3.50 / Grok Voice Think Fast 2.0 $4.80 / GPT-Live-1 Astra(Medium)$5.83。這張圖有兩點值得留意。它是在一項工作負載上測得的成本,不是價目表;Compute-Controlled Benchmarking 一直要求廠商提供這類資料,但很少拿得到。它的分母是一小時輸入音訊——以對話時間計算,而非任務或權杖——是第三方對 OpenAI 引入的按分鐘計費單位的呼應(Cost-per-Task Over Cost-per-Token)。此外,它不是乍看之下以為的 Big Bench Audio 準確率圖:Extended Thinking 的 97.7% Big Bench Audio 只出現在 Google 的文字中,完全沒有畫在圖表上。
EVA-Bench(ServiceNow),而這張圖表並不好看。 圖上以散點呈現準確度(EVA-A pass@1)與體驗(EVA-X pass@1)——與上文 NVIDIA 數據使用的雙軸拆分相同——依圖表頁尾標示,是「在 Gemini Enterprise Agent Platform 的 Live API 上」執行。圖中沒有標示數值,因此目測位置約有 1–2 分誤差,不應引用任何數字;排序則一目了然,也是圖表的重點:
- Google 的文字:「我們的模型透過成功平衡準確度與對話品質,推進了複雜工作流程的 Pareto Frontier。」
- Google 自家圖表畫出的虛線前沿依序是 Gemini 3.8 Live(約 47,約 89)→ Extended Thinking(minimal)(約 51,約 79)→ GPT Realtime 2.1(約 58,約 74)→ Scribe Realtime + GPT 5.4 + Eleven Flash v2, ElevenAgents tuned(約 67,約 14)。前沿上的四個點有兩個屬於競爭對手,其中一個是第三方串接堆疊。
- Extended Thinking(high)(約 55,約 73)位於虛線下方——被準確度更高、體驗相同的 GPT Realtime 2.1 支配。Google 的旗艦組態不在自家圖表畫出的前沿上。
串接比較對象是保留這張圖的另一個理由。同一個 ElevenAgents 堆疊出現兩次,分別位於相反角落:預設組態(Scribe Realtime + Claude Haiku 4.5 + Eleven Flash v2)約為準確度 37/體驗 82;調校組態(Scribe Realtime + GPT 5.4 + Eleven Flash v2)約為 67/14——圖上最高的準確度,是以幾乎放棄整個體驗軸換來的。在同一堆疊中,準確度與對話品質可以分別購得;調校讓系統沿著取捨移動,而非離開取捨。這是全雙工互動中全雙工與串接式系統差異最明確的呈現方式,且由一個沒有理由畫出這種差異的廠商所繪製。
對照 Google 圖表與 OpenAI 數據卡#
兩份廠商排行榜有兩列重疊,表現各不相同——這正是有用之處。
銀行業項目在兩個立場相左的廠商之間,數字逐位相同。 OpenAI 自家數據卡回報 gpt-live-1 為 32.0%、gpt-realtime-2 為 10.3%,項目名稱為「Tau Banking Voice knowledge(Pass@1,97 項任務)」。Google 的 Sierra 圖表回報 GPT-Live-1 Astra(Medium)為 32.0%,GPT-Realtime 2(High)為 10.3%。兩列都完全相同。推論是:兩家廠商引用的是同一份 Sierra τ³-Banking 排行榜,而非自行執行基準;OpenAI 的「Tau Banking Voice」只是該排行榜的另一個名稱。這是本資料集中首次出現任何數字獲得跨廠商佐證,但佐證的是來源——兩方都讀取同一份排行榜——而非兩次獨立執行得到相同結果。
代理式項目則不一致,不應硬行調和。 OpenAI 回報 gpt-live-1 + Astra(medium) 在「Tau3 Voice intelligence(Pass@1)」上為 86.2%。Google 回報 GPT-Live-1 Astra(Medium)——同一產品、同一具名後端、同一標示推理力度——在「Agentic Performance(τ-Voice)」上為 67.9%。由於銀行業項目完全相同,這不太可能是任一方的轉錄錯誤。合理的解讀是 Tau3 與 τ-Voice 並非同一種測量工具:任務集合、版本或評測 harness 不同,只是名稱相似,而且兩方都沒有公布評測規程。不要排名、不要取平均,也不要把其中一個當成另一個的核對依據。
有一個區間確實因此移動。 本頁記錄 τ-Voice 的原始發現:領先的商用全雙工語音模型在有根據的客戶服務任務上為 31–51%,文字代理程式則為 85%。Google 圖表上的前兩個系統六個月後達 68.6% 和 67.9%,高於該區間約 17 個百分點。兩者都是高或中推理力度組態,且長條標籤列有前沿文字模型,所以超越該區間的是模型配對,而非全雙工語音模型本身——本頁對 OpenAI 86.2% 的數字也提出了同一項保留。
綜合指標能與不能解決的問題#
Google 在同一個即時架構上推出兩個層級,這是目前最清楚的廠商內部測試,可檢驗「互動性會隨智慧提升」的說法——但圖表提供的答案比表面看起來少。
- 綜合指標會壓縮差異。 從 3.8 Live 到 Extended Thinking,S2S Index 從 76.0 → 82.6,增加 6.6 分。唯一單獨顯示的組成指標——τ-Voice——則從 30.1 → 68.6,增加 38.5 分,達原先 2.3 倍。Extended Thinking 的溢價幾乎全在代理式組成指標上,標題指標把它藏了起來。
- 綜合指標與其組成指標對模型排序的看法不同。 3.8 Live 在指標上勝過 Gemini 3.1 Flash Live(High)(76.0 vs 71.5),在 τ-Voice 上卻輸給它(30.1 vs 37.7)。一個綜合數字與它自身的一項輸入,將同兩個模型排成相反順序。
- 無法從此處驗證背後機制。 原始資料與任何已匯入來源都未說明 Speech to Speech Index 由什麼組成,或各部分如何加權;五張圖表的評測方法註腳都指向廠商網站
deepmind.google,而非評估者的網站。互動性組成指標若接近飽和,確實會產生這種壓縮模式;本頁也已記錄一項 AA 語音組成指標在三代模型間維持 95.3–97.3,但這只是符合兩家廠商圖表的假設,並非任何一方來源所證實的事實。
可通用的原則是:廠商的綜合指標可以確立較昂貴層級的分數較高;但它無法將智慧與互動性拆開,因為兩者的區分取決於組成指標的權重,而沒有廠商公布權重。請索取各項組成指標。
兩項揭露說明#
推理力度標籤都有標示,而且設定不對稱。 四張長條圖中的每一個長條都標有推理力度設定,揭露的運算資訊比多數跨廠商比較表多(Compute-Controlled Benchmarking);然而 Google 旗艦模型的圖表設定為 High,最近的競爭者則設定為 Medium,沒有任何說明。這或許只是 GPT-Live-1 已公布的設定(OpenAI 自己的數據卡也在註腳標示 Astra, medium)。無論如何,主場模型使用比比較對象更高設定的跨廠商圖表,並非受控制的比較,而讀者也沒有得到任何解釋。
Google 公告中完全沒有延遲數字——輪替延遲或首次音訊時間都沒有——儘管合作夥伴引言提到「令人印象深刻的延遲」。因此,這個來源沒有任何資料可納入下方的三方不可調和比較;在本資料集中,第三方圖表資料最豐富的語音產品,仍完全沒有反應速度數據。
控制回應機會的主動性測量工具(2026 年 9 月)#
以上內容都測量模型回應得好不好。Peng、Nuchged、Fu 與 Yao(UConn / UT Austin / X Square Robot / Oxford,arXiv 2609.19596,2026-09-17,empirical)新增一種測量工具,用來判斷模型是否會主動回應——而且它的設計與本頁所有其他工具都不同,因此值得將其作為一套評測規程編目,而非另一份排行榜。
設計上的作法是減法,而非加法。以上每項基準都豐富刺激材料;這一項則刻意簡化:
- 情境配對的刺激材料。 40 段第一人稱英文獨白(中位數 50.3 秒),由引言、觸發內容、後續內容組成;在同一主題內,只有觸發語句會變動。因此所有比較都發生在同主題、同聲音之內,排除組合式情境集合帶來的內容混淆。
- 從設計上移除回應機會。 逐字時間戳將每個詞之間的空隙壓縮至 ≤0.12 s,且使用者在觸發內容之後仍持續說話。要搶到發言權就得打斷對方。自然停頓組(句末停頓通常約 0.88 s)與插入 1.5 秒靜音組則透過操弄恢復發言機會,讓「有理由開口」與「有機會開口」分別受控——FD-bench、FLEXI 和 Instruct-FD 都沒有拆分這兩者。
- 條件來自輪替分配理論,而非產品情境。 十種條件分為 Addressed(問題、請求、修辭問句)、Self-select(尋詞、錯誤事實、重複、危險)與 Yield(回合結束、靜音),另加 Neutral——源自 Sacks、Schegloff 與 Jefferson(1974)。修辭問句和回合結束純粹是表面形式控制組:它們帶有邀請的形式,卻沒有邀請的實質;對此做出回應的模型,是對句法做出反應。
- 單一純量指標,分母明確。 語音起始率=在 [t₀, t₀+4 s) 內,出現 ≥4 個詞片段的試驗比例;若試驗開始前 1.5 秒模型已在說話,仍納入分母,但不計為新的起始。片段依各架構定義(Moshi/PersonaPlex/Raon 使用 80 ms 文字權杖影格,空隙不超過 0.64 s;VoiceChat 使用回合邊界標記;MiniCPM-o 使用每秒一次的聆聽/說話輸出),因此才能讓單一數字涵蓋五種系列。
- 另一個獨立組別評估回應內容。 輪次交接實驗讓出發言權(靜音 10 秒),並使用 溫度 0 的 DeepSeek-V4-Flash 評審評分 Relevant 和 Intervenes——如此一來,就能檢驗起始率是否提升,以及因此產生的語音是否有用。這項檢查正是尋詞測試暴露的問題:它是唯一會讓 PPlex 起始率上升的內容線索,但實際上只有 .36 的回覆提供了缺失詞語。
規模:每種組態 × 40 個主題 × 10 種條件 × 5 個種子,共 每種組態 2,000 次試驗。刺激材料、模型輸出與評估程式碼均已發布(github.com/vocaliodmiku/take-the-floor),使其成為本頁首個第三方可針對任何全雙工系統重新執行的測量工具——包括主動性目前只由 vendor-claim 支持的系統。
主要數字及其意義見內容驅動的介入;簡而言之,直接對模型說話與實際停頓都會改變語音起始時間;錯誤事實、危險事件與逐字重複最多只讓起始時間提前 .06。
與 CueSpeak、TimeSpeak 的比較。 TML 兩項主動音訊基準都測試模型能否依據持續有效的使用者指令,在正確時刻說話(「每次我切換語言時,告訴我正確用詞」;「每 4 秒提醒我呼吸」)。這是本評測分類中的 Addressed 情況,也是此處所有模型原本就表現最好的情況。兩項基準都未測量自我選擇,也就是沒有指令涵蓋觸發內容、模型必須自行判斷其內容是否值得開口。這兩種測量工具互為補充;它們之間的落差正是負面結果所在。
證據說明。 由第三方進行,四位作者都沒有廠商關係,使用預設解碼的開放檢查點——與本頁其他內容的立足點不同,TML 的分數由 TML 回報,NVIDIA 的分數則由 NVIDIA 回報。限制在於:只有一套 TTS 刺激流程(兩種合成聲音,沒有真人講者,與 FDB3 的真實錄音不同)、僅有英文、DeepSeek 評審未經評分者間或人工驗證,且任何比率都沒有信賴區間。
三個來源不同的延遲數字互不相符,不應強行比較。 本頁記錄 TML-Interaction-Small 在 FD-bench v1 的輪替延遲為 0.40 s,並稱其「在所有比較模型中反應最快」。NVIDIA 前端回報 Full-Duplex-Bench v1 流暢輪替延遲為 92 ms(不呼叫工具的基準線為 221 ms)。OpenAI 現在回報 gpt-live-1 在 Full Duplex Bench v1 為 0.798 s,表示「代理程式在使用者結束一個回合後開始回覆的速度」。三者都是自行回報,而且幾乎可以確定並非同一種測量:NVIDIA 指明 Candor 子集並同時回報 TOR;TML 的表格沒有說明採用哪個子集或延遲定義;OpenAI 除了一句簡短描述外,沒有說明子集或定義;三個系統評分的輸出模態也各不相同(NVIDIA 是代理程式文字、OpenAI 是音訊、TML 未註明)。天真排名會把商用產品判定為比研究前端慢 8.7 倍,比研究預覽慢 2 倍,但這不是任何一張表所支持的結論。在某個實驗室公布 FD-bench v1 評測規程之前,應將三者視為不可比較。合理的比較僅限同一來源內部:OpenAI 的 1.41 → 0.798 s,與自家舊模型相比;NVIDIA 的 221 → 92 ms,與自家的消融基準線相比。
本頁各項證據的權重。 TML 的數字來自研究預覽版的第一方 vendor-claim,並採用自行設計的基準;NVIDIA 的數字來自公開第三方基準的 empirical 測量,作者自行重新執行基準以建立基準線,但仍只有單次執行,且完全沒有誤差線;OpenAI 的數字來自商用產品的第一方 vendor-claim,而比較基準僅包含自家前兩代模型。Peng 等人是本頁唯一的第三方數據。Google 的形式又不同——第一方 vendor-claim 選擇並轉錄第三方排行榜(Artificial Analysis、Sierra、ServiceNow),這些排行榜確實包含競爭者,優於自我對照,但排名的一方仍可選擇展示哪些排行榜、採用何種推理力度;而且本資料集中沒有評估者自己的發布內容可供核對。四個廠商來源都不是獨立評估。
同一評估範圍的外部盤點(2026 年 5 月)#
An、Lu、Dong 等人(Tencent Youtu Lab + 5 所大學,arXiv 2605.25343,practitioner-opinion)整理了 39 項多模態基準(表 3:18 項影像、7 項音訊、14 項影片;編譯期間從第 29 頁的 pdftotext -layout 重建,並逐列核對)。它本身沒有進行任何測量,但它是此處首個將互動性評估範圍放進一般多模態評估全貌中的來源,也點出本頁尚未收錄的測量工具。
全雙工列確認了知識庫中的數字,且來源中立。 Moshi Eval 的目標延遲為 200 ms;SoulX-Duplug-Eval 的雙語串流回合偵測為 240 ms;Full-Duplex-Bench 則評分輪替、插話處理與錯誤打斷率——與 FD-bench 涵蓋的三個面向相同,而且來自未指定產品參賽的調查。它另外列出 FireRedChat 和 ELLSA,評估串接式與端對端全雙工系統;也列出一種以 LLM 強化的對話管理方法,用於測試輪次預測。
三項測量工具可填補本頁記錄為尚未測量的主動性缺口。 調查的影片部分除了離線測試套組,也列出串流類別:OVO-Bench(即時感知加上向後追溯,測試模型能否找出適當的回應時間點)、StreamingBench(在嚴格延遲限制下測量理解能力)、OmniMMI(多模態串流互動),以及兩套與 TML 視覺主動性基準創設目的接近的評測規程——ThinkStream 的 Watch-Think-Speak,其評分「不只看答案準確率,也看回應時機——回應前是否已累積足夠證據」;AURA 則將串流評估延伸至主動式問答(沒有明確提問時,在相關事件發生時回應)與多次回應問答(追蹤事件隨時間變化)。沒有持續指令的主動式問答,正是內容驅動的介入指出 RepCount-A / ProactiveVideoQA / Charades 所欠缺的構念;那些基準都提供指令,再測量時機。在把這些當成答案之前,先注意一項限制:調查沒有提供任何一項基準的數字,本知識庫也沒有讀過任何一篇相關論文,因此目前能確定的是這些測量工具存在,而非它們有效。
知識庫尚無專頁介紹的第四個評估軸:考量效率的評測規程。 調查主張,只評分準確率會「忽略原生部署最重要的面向:模型何時回應、消耗多少運算資源,以及處理串流與打斷時是否流暢」,並建議在明確的 Pareto 前沿上,同時回報準確率、權杖預算、延遲與能耗。它舉 ResAdapt 為例,據報處理多出 16 倍的影格時,可減少超過 90% 的視覺權杖,並在複雜長影片推理上獲得 >15% 的相對提升。這是第三方重述,並非此處進行的測量。
調查未涵蓋的內容。 表 3 沒有任何基準評估能在對齊的理解—生成配對上表現對稱的模型——調查將此列為開放方向(「先描述再生成、先聆聽再說話、先觀看再行動」,並懲罰兩個方向間的不一致),並與多模態攻擊面下的穩健性並列。此外,盤點中完全沒有實際上線的即時語音系統,因此上文任何廠商排行榜在此都沒有對應項目。
FDB 1.0 首次用作排行榜,以及這揭露了什麼(NVIDIA,2026 年 9 月)#
NemotronLabs VoiceChat(NVIDIA,arXiv 2609.21967,2026-09-18,empirical)是本資料集首個將 Full-Duplex-Bench 1.0 作為跨系統排行榜發布的來源,而非消融分析面板(Hu 等人)或廠商評測卡(OpenAI)。共有三個項目,採用官方評分規範:合成刺激與自然 CANDOR 停頓下的暫停處理(接管率,越低越好)、流暢的輪替對話(TOR 與延遲),以及使用者打斷(TOR、延遲,以及由 GPT-4o 評分的打斷後回應品質,範圍 0–5)。完整七列表格見 Full-Duplex Interaction;此處要談的是評測工具本身。
一張七列表格、四種資料來源,卻共用同一則註腳。 這是本頁目錄中一種新的呈現方式,值得指出:表格看起來像是一次統一受控的測試,實際上並非如此:
- 「取自公開的 FDB 結果」——Moshi、Freeze-Omni、Gemini Live 2.0、GPT-Realtime。直接複製自基準測試作者自己的論文。
- 由系統自己的作者回報——PersonaPlex,「由其作者評估的公開發布檢查點」。
- 明確不屬於受控測試——MoshiRAG,標有匕首符號;「由其作者回報;此獨立評估不屬於受控 FDB 測試」。
- NVIDIA 自行重新測量——一列,僅此一列。
因此,NVIDIA 沒有重新測試五個開放權重比較系統中的任何一個;「在受評估的開放權重系統中,暫停處理 TOR 最低」這項主張,是拿一個新數據和五個引用來的數據比較。論文註腳如實交代各項資料來源,但摘要把這一切都濃縮成「已評估」。
端點過時一事明明白白寫出來,卻又置之不理。 封閉系統列出的項目是 gemini-2.0-flash-live-001 和 GPT-Realtime,註腳承認封閉系統名稱「指的是受評估的歷史端點,不一定是目前的服務版本」——然而本頁 Google 章節評分的卻是 Gemini 3.8 Live。拿 FDB 1.0 去比三代之前的 Gemini Live 端點,不能證明目前封閉系統的表現;而且 GPT-Realtime 在兩種暫停測試(1.0 / 12.0)和流暢輪替 TOR(100.0)上都勝過 VoiceChat。
FDB 1.5 增列五個系統的表格。 在使用者回饋音條件下,將模型反應分類為 Respond / Resume / Uncertain / Unknown,其中預期為 Resume:Moshi 2 / 6 / 0 / 92、Freeze-Omni 7 / 80 / 2 / 11、MoshiRAG † 5 / 61 / 0 / 34、VoiceChat 1 / 93 / 2 / 4、Gemini Live 2.0 1 / 93 / 2 / 4、GPT-4o Realtime 3 / 70 / 1 / 25。開放權重勝出者與封閉系統比較對象的四個分類數字完全一致,但論文與註腳都沒提到;每個條件有 100 個樣本,四項完全相同並非不可能,只是機率不高,也是基準測試表格應該被追問的巧合。Moshi 的 92% Unknown 是有用的基準下限:這個模型幾乎完全不會處理回饋音。
FDB 3.0 現在有兩筆 NVIDIA 資料,卻無法透過共同基準比較。 兩篇論文都報告 FDB 3.0,發表時間相隔兩天,也都將基準列歸於該基準自己的論文(arXiv 2604.04847)——但兩組基準完全沒有交集:
| 列出的基準 | 路由指標名稱 | |
|---|---|---|
| Hu 等人(委派前端+後端) | GPT-realtime-mini、GPT-realtime、Gemini-3.5 Flash、Ultravox-v0.6 ×2 | Tool-acc |
| VoiceChat(內化函數通道) | Gemini Live 2.5、Gemini Live 3.1 | Tool Sel. F1 |
兩張表都沒有列出另一個 NVIDIA 系統,也沒有任何基準列同時出現在兩表中,而且第一欄使用的指標名稱也不同。這些數字(VoiceChat 82.5 / 42.2 / 33.0;Hu 等人的最佳結果 71.7 / 55.2 / 48.0 / 67.0)值得比較,但讀者必須自行跨兩篇同一實驗室的論文比較,且準確率與 F1 的差異仍未釐清。深入分析見 Interaction / Background Model Split。讓 FDB 3.0 的差距變得可理解的評分規則是:只有模型選出的工具完全符合預期,且每次呼叫的參數都完美無誤,該樣本才計入 Pass@1;因此路由分數為 82.5、Pass@1 卻只有 33.0,便能指出失敗發生在參數擷取,而非工具選擇。
VoiceBench 成為本頁的智慧能力軸。 共九個子集——OpenBookQA、MMSU、BBH(選擇題)、SD-QA(依參考答案評分的自由作答)、CommonEval / AlpacaEval-Full / WildVoice(開放式回答,評分 1–5)、IFEval、AdvBench——除了三個開放式子集外,其他都採 0–100 分,並將不同量尺標準化後計算平均。VoiceChat 得 55.1,實際上與 Freeze-Omni 的 55.2 並列,但兩者表現分布迥異(OpenBookQA 61.3 對 31.0、MMSU 46.1 對 28.1、AdvBench 100.0 對 97.3;但 VoiceChat 在 SD-QA、IFEval 和全部三個開放式子集上都較差)。其他比較對象為 Moshi 29.5、PersonaPlex 30.6、串接式 DuplexCascade 65.4,以及全模態 MiniCPM-o 4.5 76.1。
最後一列帶有本頁整理的那項但書:MiniCPM-o 的 76.1 來自獨立第三方評估,該評估使用 GPT-5.4 為三個開放式子集評分;表格自己的註腳也指出,其「基於評審的分數與總分因此無法直接與官方排行榜評估相比」。若排行榜某一列的總分是用不同評審算出的,卻和官方排行榜的列印在同一欄,而且只在註腳標示差異,這正是 LLM-as-a-Judge 追蹤的組合問題——而此處被標註的那一列正是表格榜首。
以曲線呈現的延遲/準確率調節旋鈕,出現在 ASR 維度。 在 Hugging Face OpenASR Leaderboard 的八個資料集上,同一個具快取感知能力的串流編碼器以兩種區塊大小、完全不重新訓練進行評估:平均 WER 在 80 ms 時為 9.02%,160 ms 時為 8.28%,八個資料集的表現皆有提升(AMI 15.32 → 13.54、LS Clean 3.58 → 3.19、VoxPopuli 8.85 → 8.17)。兩欄的平均值都能從各自八列數據算出,四捨五入至小數點後兩位完全一致。這項成果不大,卻呈現了正確的形式——部署時可調的旋鈕,同時公布它在兩個面向上的代價,這正是 Compute-Controlled Benchmarking 要求廠商提供、卻很少見到的內容;模型卡提供一個檢查點,可在曲線上的任意位置運作。
在本頁證據排序中的位置。 NVIDIA 的數字來自公開的第三方基準測試,標記為 empirical,因此高於前述廠商排行榜;但開放權重比較組完全取自其他來源,論文只做了一次測試,也完全沒有誤差線,而且是 NVIDIA 評分 NVIDIA。其證據力低於 Peng 等人(本頁唯一完全由第三方操作的評測工具),並與 Hu 等人並列。
刺激素材由模型生成,而非實際錄製的基準測試(Alibaba Qwen,2026 年 9 月)#
OmniVChat(He、Chu、Chen 等人,共 18 位作者,CUHK + Alibaba Token Hub / Qwen Team + SJTU + Zhejiang,arXiv 2609.21465,2026-09-18,empirical)是本頁首個全部刺激素材都由生成式模型合成的基準測試。它也是首個刻意設計成非即時的基準:所有素材都是預先算繪的影片片段,離線評分,沒有延遲指標、沒有插話測試,而且——論文明確直言——錄製的探測測試「不測試即時打斷」,也不涵蓋「多輪對話或即時使用時的延遲」。應將它視為互動性範疇中的離線影音理解切面,而非另一個全雙工排行榜。
任務定義。 OmniVChat = 全模態模型同時接收音訊與影片並輸出文字,使用者的查詢嵌入在這兩種串流中,且沒有獨立的文字問題、外部字幕或 ASR。架構與融合位置見 Native Multimodal Modeling: Fusion Depth and I/O Duality;此處的重點是,這項限制套用到整個比較組——「所有系統都接收所需的音訊與影片輸入」——只有 JoyAI-VL-Interaction 是刻意的例外,它搭配 Qwen3-ASR 執行,作為明確的 ASR 串接組。因此,原生輸入規則並非只有提案者自己遵守。
規模與構成。 共 2,800 個合成樣本:2,550 個單輪 + 250 個多輪、17 個子類別(12 個單輪子類別,另加 5 個延伸為多輪的版本)、5 種能力類別、22 個情境領域、1,766 個英文(63.1%)/1,034 個中文(36.9%)。從 Figure 3 讀出的各子類別數量——各 200 個,唯有 AR 300 + DR 300(論文稱為「合計 600」)、ER 150,以及每個多輪延伸版本各 50 個——加總恰為 2,800,也符合所述 2,550 個單輪樣本,這正好驗證圖表與數量的對應關係。五種能力類別為:DSLP(對話狀態與連結感知——連線檢查、輪次邊界、攝影機方向)、MEA(多模態實體對齊)、MSA(模型自我認知——說明身分與物理限制)、AH(反幻覺)、ER(情緒辨識)。
評分規則才是這篇論文的貢獻所在,勝過任務集本身。 每個樣本都有參考回答與分層規準。Tier 0 是語言閘門,不計分;若未通過,整個樣本得分為零。Tier 0 之外,只有在前面每一層的所有條件都符合時,符合的條件才得一分;若某一層未完整達成,該層已取得的分數會保留,但後續層級都無法得分。分母計入所有非 Tier 0 條件,包括因較早失敗而無法計分的條件,所以分數介於 [0,1],即使模型完美達成 Tier 3,卻漏掉 Tier 1,也無法在 Tier 3 得分。報告的總體分數為子類別平均(先計算 17 個子類別各自的平均,再對 17 個平均值等權計算),而非將所有樣本合併計算平均——因此,50 個樣本的多輪子類別權重和 300 個樣本的 AR 相同。評審為 qwen3.7-max;根據 Table 4,它是純文字評分器:「文字 LLM,未見影片。」 它看不到影片片段,只會依據資料引擎撰寫的規準檢查回答。評審端的檢視見 LLM-as-a-Judge。
重點表格(Table 1——12 個已發布系統 + 訓練後模型 + 2 項消融,共用同一份 1,296 字元系統提示;逐格與 pdftotext -layout 第 9–10 頁核對,無誤)。
| 平均(基準) | 人類 | RE | 風格 | |
|---|---|---|---|---|
| Gemini-3.5-Flash | 0.667 | 0.509 | 10.59 | 0.755 |
| Gemini-3.7-Flash | 0.640 | 0.575 | 16.96 | 0.631 |
| Gemini-3.1-Pro | 0.607 | 0.537 | 11.66 | 0.871 |
| Qwen3-Omni-Instruct(基礎模型) | 0.465 | 0.402 | 5.75 | 0.710 |
| OmniVChat-RL(作者模型) | 0.652 | 0.632 | 18.38 | 0.992 |
| 消融:不含效率項 | 0.697 | 0.691 | 7.12 | 0.987 |
Mean 是 OmniVChat-Bench 的子類別平均;Human 是 360 段錄音的探測測試;RE 是每一千個計入字詞的規準得分;Style 是符合系統提示自身全部七項風格條件的比率。
這張表揭露了摘要沒有提到的三件事。
- 在同一個廠商系列內,合成資料的排名不決定錄音資料的排名。 Gemini-3.5-Flash 在合成資料平均分數居首(0.667),Gemini-3.7-Flash 則在錄音人類探測測試中領先(0.575),但平均分數只排第三。論文作者自己就指出這一點。這是本頁最明確的數據,證明合成基準與同一子類別的錄音探測測試會得出不同模型排序——而這項數據來自同時建構兩者的實驗室。
- 他們發布的設定並非得分最高的設定。
no efficiency term消融在平均分數(0.697 對 0.652)和錄音探測測試(0.691 對 0.632)都勝過發布的模型;它犧牲的是簡潔性——回答從 36 字增加到 99 字,RE 從 18.38 降至 7.12。因此,標題中的「0.465 → 0.652」是刻意限制簡潔性的模型分數,而只用規準進行的 RL 在兩個規準軸上都更進一步。這點坦率呈現,卻很容易被忽略。 - 0.992 的 Style 正是訓練所用的指標。 RL 訓練期間的風格獎勵,與評估時 Style 欄的七項條件完全相同,而且都由同一個
qwen3.7-max提示評分。若某個指標本身就是獎勵,從 0.710 提升到 0.992 不能證明風格有所改善;它證明的是最佳化器有效。規準分數也有類似問題,只是隔了一層(使用同一評審、同一規準形式),因此錄音探測測試對這篇論文具有關鍵證據力,Style 欄則沒有。依循性方面的分析見 Harness Activation and Adherence。
測量雜訊的結果,是論文中最具可轉用價值的發現。 Appendix E.5 將三條保留曲線(dev、Bench、Human probe)在 51 個檢查點上合併分析。分數水準高度相關——r(dev, Bench) = 0.983,r(dev, probe) = 0.963。逐檢查點變化幾乎毫無相關:r(Δdev, Δbench) = 0.291、r(Δdev, Δprobe) = 0.087,在 50 個區間中只有 31、27 和 28 個區間方向一致——符號檢定無法拒絕隨機機率。殘差 σ̂ 為 0.0066(dev)、0.0044(Bench)、0.0113(probe),相較之下,平均每 20 個步驟提升 0.0039–0.0044,也就是說,短期波動是每個檢查點進步幅度的 1.1–2.6 倍。取 5 個檢查點的平均值(每 100 步為一個區塊),相關性恢復至 0.905 / 0.933,且 9 個區塊中有 8 個方向一致;k = 10 時則達到 0.966–0.996。實務規則是:在這種規模、由規準評分的基準測試上,單一檢查點的差值只是雜訊,只有多檢查點區塊平均才算測量結果——這就是本頁指摘其他每個來源「只跑一次、沒有誤差線」的量化形式。
多輪測試的代價沒有看起來那麼高,而且兩種比較並非配對設計。 五個子類別都有配對的單輪與多輪版本。Gemini-3.7-Flash 在五項上都退步,平均差距為 −0.114(t(4) = −4.48,p = 0.011),MRR 最差,下降 −0.202(回想物件離開畫面後的情況)。OmniVChat-RL 的平均差距為 −0.026(t(4) = −0.85,p = 0.45)。論文隨即說明這項結果的限制:配對樣本是獨立抽樣,每組 50 個樣本只能將差距解析至 ±0.05,而且四個自由度就是四個自由度。另請注意,多輪測試規範會提供每個模型相同的先前片段與參考回答,並且只評分最後一則回答——這是教師強制評估,沒有任何輪次層級的得分可言(見 Turn-Level Credit Assignment)。
最難的子類別,是知道什麼時候不該開口。 敏感度研究中的六個評審都將 DSLP-VTT-UPC——「使用者停頓但尚未說完」,正確回應方式是等待或簡短應答——列為最弱的子類別。這與 Content-Driven Intervention 發現音訊側未測量到的構念相同;在這裡,它成為一項原本並非為研究此問題而設計的基準測試的最低分項。
COI,明確說明。 一個實驗室提供任務定義、生成刺激素材的資料引擎、基準測試、人類探測測試、評審模型、基礎模型、RL 獎勵,以及訓練後模型——而且完全沒有報告訓練後模型在任何外部基準測試上的表現。部分抵銷這項疑慮的因素包括:360 段錄音並非資料引擎產物、消融結果有公開而且不利、作者指出了排名上的差異,而 Appendix D.3 的評審研究也坦承「沒有使用其他評審重新測量 OmniVChat-RL 從 0.465 提升至 0.652 的幅度」。無法抵銷的部分是:上述每個數字都出自提案者自行建構的評測工具,而 qwen3.7-max 同時負責獎勵與評分。
為何重要#
論述脈絡如下:既有以互動性為導向的基準測試「未能充分捕捉質變式的躍進」——因此,支持互動模型的論據有一部分仰賴 TML 自行發明的基準測試。這是已知模式(新能力 → 新評估),也是一處弱點(自行定義指標);TML 的回應是公開徵求社群基準測試提案的研究補助。
延伸閱讀#
- Native Multimodal Modeling: Fusion Depth and I/O Duality — 外部盤點:39 個基準測試將互動性納入一般多模態評估,另有 ThinkStream/AURA/OVO-Bench 等第三方評測工具,用於檢驗主動性缺口與考量效率的 Pareto 論證
- Interaction Models — 測量的對象
- TML-Interaction-Small — 受測模型
- Interaction / Background Model Split —
*結果使用背景代理程式 - Full-Duplex Interaction — TimeSpeak/CueSpeak/RepCount-A/ProactiveVideoQA/Charades 各自針對這些模式之一
- Time-Aligned Micro-Turns — 輪替對話延遲(0.40s)是移除輪次邊界的直接效益
- Scale-Dependent Prompt Sensitivity — 另一篇自行引入評估框架,以凸顯標準基準測試忽略現象的論文
- Claude Opus 4.7 — 此處以
xhigh努力程度級別作為基準設定(GPT-realtime-2.0 minimal/xhigh) - Live-Path Minimalism — FD-bench v1 如何作為消融分析面板,衡量委派權杖對前端的代價
- NVIDIA — 將工具呼叫群組端對端整合至單一系統的實驗室
- Content-Driven Intervention — 2026 年 9 月主動性評測工具測量的內容,以及它產生的負面結果
- GPT-Live — 首個公開接受 FD-bench 評分的商用語音產品,由產品廠商自行評估
- Gemini 3.8 Live — 第二份廠商排行榜,也是首個在含有競爭對手的第三方榜單上提出論證的廠商
- Artificial Analysis — Conversational Dynamics 評測卡、Speech to Speech Index、τ-Voice 圖表與每音訊小時成本圖表背後的評測者,也是此處兩家廠商數字得以對齊的唯一原因
- Compute-Controlled Benchmarking — 努力程度標籤的不對稱,以及按工作負載測量成本的圖表所涉及的議題
- Production-Sourced Evaluation — OmniVChat-Bench 在資料來源軸上處於最極端的位置:每份刺激素材都由多代理程式引擎生成,唯一非生成式的部分是 360 段錄音的人類探測測試
- Harness Activation and Adherence — Style 欄是十二個已發布全模態模型的系統提示遵循率,之後又直接以自身評審進行訓練
- Turn-Level Credit Assignment — OmniVChat 的多輪規範提供每個模型相同的對話歷史,並只評分最後一則回答,因此不涉及輪次得分
資料來源#
- Interaction Models: A Scalable Approach to Human-AI Collaboration
- A frontend-backend architecture for tool calls in full-duplex speech models — Hu 等人(NVIDIA),arXiv 2609.19334,2026-09-16(
empirical,5 頁):§5.1–5.3 與 Tables 1、2、3、7。Tables 1–3 重新依據pdftotext -f 2 -l 3 -layout閱讀,Table 7 則依據pdftotext -f 4 -l 5 -layout閱讀(其table-shift警告是跨欄標題造成的假象);以上每個數字都來自核對過的儲存格或正文。完整分析見 Interaction / Background Model Split - Full-Duplex Speech Models Take the Floor When Asked, Not When Needed — Peng、Nuchged、Fu 與 Yao,arXiv 2609.19596,2026-09-17(
empirical,5 頁):§3 的刺激設計、條件分類與起始點定義;§4.4 的輪次釋出評分規範。四張表都重新依據pdftotext -layout閱讀,並逐位核對一致。完整分析見 Content-Driven Intervention - Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Tom Ouyang 與 Malini Jaganathan(Gemini Audio Team,Google),
blog.google,2026-09-15(vendor-claim,約 1,764 字):上方五張圖表。解析註記:並非源自 PDF;圖表為.webp圖片,讀取時已轉錄至Figure transcription區塊,且編譯時已檢視全部五張圖片。四張長條圖附有印刷數據標籤,與轉錄內容逐位相符。EVA-Bench 散佈圖沒有數據標籤——數值是依據格線目測估算,誤差約 1–2 分,因此僅用於比較排名與優勢,不用於引用數值。編譯時修正一項轉錄錯誤:讀取註記稱虛線連接「三個 Gemini 3.8 數據點」,但放大 3 倍後可見,它連接的是 Gemini 3.8 Live → Extended Thinking(minimal)→ GPT Realtime 2.1 → Scribe Realtime + GPT 5.4 + Eleven Flash v2,並未連到 Extended Thinking(high)。原始資料不可變,因此修正記錄在此處與 Source Notes。 - Build more natural voice experiences with GPT‑Live‑1 in the API — OpenAI,2026-09-10(
vendor-claim,約 1,670 字,未署名):七張 GPT-Live-1 基準測試卡及各卡的後端註腳。這些卡片是延遲載入的 JS 圖表元件,從算繪後的 DOM 擷取為文字值,而非從圖片轉錄,因此數據是讀取所得,並非估算;每項指標的定義都只有一句話,也沒有公布任何子集、規範或測試次數。基準比較對象只有 OpenAI 模型。 - NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities — Balam、Bartley、Casanova 等人(NVIDIA,48 位貢獻者),arXiv 2609.21967,2026-09-18(
empirical,19 頁):Table 1(FDB 1.0、7 個系統、4 種資料來源)、Table 2(FDB 1.5 行為分布)、Table 3(VoiceBench、6 個系統 × 9 個子集)、Table 4(FDB 3.0 對照 Gemini Live 2.5/3.1)、Table 6(LibriTTS 上的 VoiceChat-TTS)、Table 7(兩種區塊大小的 OpenASR)。**解析註記:**源自 PDF(docling: 2.126.0,MLX 版面/表格階段);讀取驗證結果為warn,原始資料沒有任何修補區塊,因此七張表都視為未修補,並於編譯時逐格與pdftotext -layout核對——七張表全數無誤,沒有欄位合併、位移或列遺漏。Table 5 與 Table 7 也通過算術自我驗證(SFT 抽樣器權重總和為 1.175,正規化後符合正文所述的 46.8/23.8/26.0/3.4%;兩欄 OpenASR 平均值都能從各自八列數據算出 9.02 和 8.28)。唯一外觀上的 docling 問題:Table 2 註腳在 markdown 正文中被插到 VoiceBench 段落中間。**證據:**標記為empirical,且由 NVIDIA 評分 NVIDIA——僅執行一次,論文完全沒有誤差線,Table 1 中所有開放權重基準列都是引用資料,並非重新測試所得。 - OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue — He、Chu、Chen 等人(18 位作者;CUHK + Alibaba Token Hub / Qwen Team + SJTU + Shanghai Innovation Institute + Zhejiang;arXiv 2609.21465,2026-09-18;
empirical,52 頁):§3 的基準測試與分層規準評分函數(Eq. 1–2)、§4.3 + Table 1 的模型比較、Appendix D.2 的 360 段錄音人類探測測試、D.3 + Table 2 的六評審敏感度研究、D.4 + Table 3 的單輪與多輪比較、E.1 + Table 4 的訓練設定,以及 E.5 的檢查點雜訊分析。**解析註記:**源自 PDF(docling: 2.126.0,MLX 版面/表格階段);讀取驗證結果為warn,原始資料中僅有的四個 Appendix-F 規準範例[!note]修補區塊都不在正文,因此所有正文表格皆視為未修補。Tables 1、2、3 已逐格依據pdftotext -layout(第 9–10、24、25 頁)核對——三張表均無誤,沒有欄位合併、位移或列遺漏;Table 1 的 15 列也符合正文所述的「12 個已發布系統、OmniVChat-RL,以及兩項獎勵消融」。Table 4 完全坍縮(所有標籤都擠在一個儲存格、所有數值都擠在另一個儲存格,兩個子系統都是如此),在採用任何數據前已依據pdftotext -layout第 26 頁重建。Figure 3 各子類別的樣本數合計為 2,800,也符合所述的 2,550 個單輪樣本,因此驗證了圖表與數量的對應關係。值得留意的一項 docling 問題:Figure 2 標題下方立即輸出的圖片(image_000002)並非 Figure 2,而是以圖片呈現的 Example 2 軌跡表;Figure 2 實際上是image_000001。**證據:**標記為empirical;一個實驗室掌控任務定義、資料引擎、基準測試、人類探測測試、評審、基礎模型、獎勵和訓練後模型,而且沒有報告外部基準測試結果。完整分析見此處及 LLM-as-a-Judge - Toward Native Multimodal Modeling: A Roadmap — An、Lu、Dong 等人(Tencent Youtu Lab + 5 所大學;arXiv 2605.25343,2026-05-25;
practitioner-opinion,52 頁):§7 + Table 3(39 個基準測試——18 個影像/7 個音訊/14 個影片)、§7.2 全雙工評估、§7.3 串流影片與 ResAdapt 效率結果、§8.5 四個開放評估方向。**解析註記:**docling 將 Table 3 的大部分內容合併後又遺漏;原始資料附有根據pdftotext -layout第 29 頁重建的[!note],本次編譯已逐列重新核對(唯一差異是外觀上的——來源標題寫的是「Task Group」,不是「Category」)。這篇調查沒有報告任何基準測試數字。完整分析見 Native Multimodal Modeling: Fusion Depth and I/O Duality
Cited by 22
- Full-Duplex Interaction×8
gpt live 1 in the api — OpenAI, 2026-09-10 (vendor-claim): the third stay-present assertion, native…
- Artificial Analysis×6
Agentic Performance (τ-Voice) · Interactivity Benchmarks, Gemini 3 8 Live · AA's run of the τ-Voice…
- Gemini 3.8 Live×4
ServiceNow's EVA-Bench is the chart that does not flatter. Google's prose says "our models push the…
- Interaction / Background Model Split×4
And OpenAI's own benchmark footnotes confirm the interface empirically, in its own favour. Four of…
- LLM-as-a-Judge×4
OmniVChat (He, Chu, Chen et al., Alibaba Qwen Team + CUHK + SJTU, arXiv 2609.21465, 2026-09-18,…
- Native Multimodal Modeling: Fusion Depth and I/O Duality×4
The full-duplex rows corroborate the vault's own numbers from a neutral source: Moshi Eval at a 200…
- Content-Driven Intervention×3
Turn-taking research asks when the floor is available. Content-driven intervention asks whether the…
- Interaction Models×3
See Full Duplex Interaction and Interactivity Benchmarks for how these are demonstrated and…
- GPT-Live×2
Interactivity Benchmarks — where its seven vendor-reported benchmark cards are catalogued, and why…
- Harness Activation and Adherence×2
Caveats before importing any number: different domain (spoken audio-visual dialogue, not agentic…
- Live-Path Minimalism×2
Interactivity Benchmarks — the benchmark surface the ablation above is run on; FD-bench v1 as a…
- Thinking Machines Lab×2
Benchmarks their model against GPT-realtime-2.0 / 1.5 (OpenAI) and Gemini-3.1-flash-live (Google)…
- TML-Interaction-Small×2
Interactivity Benchmarks — its full benchmark table and the baselines it beats
- Compute-Controlled Benchmarking
Interactivity Benchmarks — the voice-side instance of this page's problem: a cross-vendor chart…
- Cost-per-Task Over Cost-per-Token
Interactivity Benchmarks — where the voice cost chart sits alongside the quality boards it has to…
- Interaction & Multimodal
Interactivity Benchmarks — FD-bench, Audio MultiChallenge + TimeSpeak/CueSpeak (proactive audio)…
- NVIDIA
Interactivity Benchmarks — runs the tool-calling evaluation cluster (BFCL-audio, FDB3, EVA-Bench)…
- OpenAI
Realtime voice systems engineering. GPT-Live (July 2026) is its third-generation voice system: a…
- Production-Sourced Evaluation
Interactivity Benchmarks — where the generated-stimulus benchmark above is catalogued as an…
- Scale-Dependent Prompt Sensitivity
Interactivity Benchmarks — another case of a paper inventing its own evaluation framing (FD-bench…
- Time-Aligned Micro-Turns
Interactivity Benchmarks — turn-taking latency (0.40s) is the direct, measured payoff of removing…
- Turn-Level Credit Assignment
Interactivity Benchmarks — the same absence on the measurement side, in a multi-turn dialogue…
Related articles
- Interaction / Background Model Split
Dual-model architecture: a time-aware interaction model stays present while an async background model handles deep reas…
- Interaction Models
Thinking Machines Lab (May 2026): models that handle audio/video/text interaction natively in real time instead of via…
- Full-Duplex Interaction
Perceive-and-respond simultaneously across modalities — a property of scheduling, not of emitting in speech; proactive…
- Content-Driven Intervention
Speaking because the content warrants it — correcting a false claim, warning of a hazard, supplying a searched-for word…
- Live-Path Minimalism
GPT-Live's serving principle — "the voice must flow": the realtime media loop is the only thing on the live path; deleg…
