開放的語音代理研究

依照它量測的工作,選擇語音代理基準測試。

「語音 AI」不是單一的評估問題。語音辨識的基準測試可能完全沒有談到任務完成;工具呼叫測試組可能從未真正執行那個動作;而逐字稿基準測試可能是在麥克風端的工作都結束之後才開始。

本指南整理了 13 個公開起點,於 2026 年 9 月 1 日依第一手來源檢視。這是一份全景圖,不是排行榜,列入其中並不代表背書。

從三種產品成果之一開始

先選出與你需要驗證的使用者結果相符的那條路線。接著再用元件層級的指標,解釋那個結果為什麼成功或失敗。

1

會實際執行動作的語音代理

量測完成的任務、狀態變更、失敗後的恢復、確認、可撤銷性,以及如實回報的狀態——而不只是格式有效的工具呼叫 JSON。

2

語音輸入與聽寫

把辨識準確度與實體處理、格式、延遲、修正負擔,以及能否可靠地插入目標應用程式,合併起來一起看。

3

會議理解

把收音、轉寫、語者分離、摘要忠實度、決議與待辦事項品質,分別維持成獨立的層次。

公開的基準測試起點

下方矩陣只回答一個很窄的問題:針對某一種評估需求,哪一個公開專案是合理的第一站?「部分涵蓋」表示該能力只出現在測試組的一部分,或是以間接方式量測。

基準測試最適合作為起點的用途語音輸入/輸出工具任務完成電腦操作
EVA端對端對話代理的準確度與體驗輸入+輸出
tau2-bench / tau-Voice真實領域中使用者、代理與工具的動態互動輸入+輸出
VoiceComputerBench / TalkAct即時語音對話加上瀏覽器操作輸入+輸出
NVIDIA voice-agent evaluation可重現的即時測試框架,涵蓋 EVA 與 tau2 情境輸入+輸出
VoiceAgentBench以語音為基礎的工具選擇、編排與安全性僅輸入部分涵蓋
Audio2Tool跨不同意圖複雜度的口說工具呼叫選擇僅輸入
Voice Agent Latency來電者感受到的、直到代理發出第一段語音的時間輸入+輸出
OpenBench可重現的 ASR、語者分離與串流測試僅輸入
ELITR-Bench針對會議逐字稿的長情境推理逐字稿文字部分涵蓋

全部 13 個受檢視專案的能力涵蓋範圍、佐證說明、授權條款與連結,都收錄在機器可讀的 JSONL 資料集中。

採用分層的評估計畫

單一的綜合分數會掩蓋失敗模式。請讓以下四個層次都保持可見,並分別公布每一層的結果。

使用者成果

使用者有沒有在目標系統中得到他想要的結果?

互動品質

這段交流是否即時、聽得懂、可打斷,而且可以從錯誤中恢復?

元件品質

量測 ASR、語者分離、實體、工具參數或產生的內容,但不要把它們當成最終成果。

安全與信任

測試同意、確認、可撤銷性、隱私,以及代理是否如實回報任務已完成。

重要的缺口:在這次檢視的全景中,沒有任何公開基準測試完整量測在各種應用程式裡進行的連續桌面聽寫。團隊應該把公開的 ASR 基線,與一份取得同意、能反映自己真實麥克風、語言、應用程式與詞彙的私有語料庫結合使用。

不要拿意義不同的分數互相比較

  • 工具呼叫準確度並不能證明下游動作真的成功,或改動到正確的對象。
  • 字錯誤率無法涵蓋標點、格式、實體準確度、編輯所花的力氣,或插入的可靠度。
  • 只看逐字稿的會議測試,無法揭露麥克風、話語重疊、語者分離、重新連線或裝置故障的問題。
  • 延遲量測需要明確的起點與終點;來電者的語音、第一個 token、最終文字與看得見的任務進度,是不同的時鐘。

請記錄基準測試的 commit、模型與供應商版本、提示詞、工具結構描述、音訊前處理、試驗次數、取樣設定、計時邊界、評審評分準則、逾時、拒答,以及每一份資料集的授權條款。失敗的執行應該保留在報告中,而不是從分母裡消失。

開放資料與可重現性

底層的全景資料由 Sophon LLC 以獨立社群資源的形式維護。它不會把 Cue 與所列專案排名比較,也沒有任何基準測試的擁有者贊助其列入。

另一項證據:這份全景資料並未重現 Cue 內部 227 個樣本的正式環境基準測試。那項範圍較窄的 Apple Silicon 量測記錄在Gemma 4 聽寫案例研究指南中,並以 Google DeepMind 原始的 Gemmaverse 頁面作為主要來源。

先評估工作,再選擇工具。

如果你正在設計一套評估,請從開放的全景資料開始。如果你要實際評估桌面語音代理,可以另外瞭解 Cue 的語音輸入、會議與跨應用程式工作流程。