會實際執行動作的語音代理
量測完成的任務、狀態變更、失敗後的恢復、確認、可撤銷性,以及如實回報的狀態——而不只是格式有效的工具呼叫 JSON。
「語音 AI」不是單一的評估問題。語音辨識的基準測試可能完全沒有談到任務完成;工具呼叫測試組可能從未真正執行那個動作;而逐字稿基準測試可能是在麥克風端的工作都結束之後才開始。
本指南整理了 13 個公開起點,於 2026 年 9 月 1 日依第一手來源檢視。這是一份全景圖,不是排行榜,列入其中並不代表背書。
先選出與你需要驗證的使用者結果相符的那條路線。接著再用元件層級的指標,解釋那個結果為什麼成功或失敗。
量測完成的任務、狀態變更、失敗後的恢復、確認、可撤銷性,以及如實回報的狀態——而不只是格式有效的工具呼叫 JSON。
把辨識準確度與實體處理、格式、延遲、修正負擔,以及能否可靠地插入目標應用程式,合併起來一起看。
把收音、轉寫、語者分離、摘要忠實度、決議與待辦事項品質,分別維持成獨立的層次。
下方矩陣只回答一個很窄的問題:針對某一種評估需求,哪一個公開專案是合理的第一站?「部分涵蓋」表示該能力只出現在測試組的一部分,或是以間接方式量測。
| 基準測試 | 最適合作為起點的用途 | 語音輸入/輸出 | 工具 | 任務完成 | 電腦操作 |
|---|---|---|---|---|---|
| EVA | 端對端對話代理的準確度與體驗 | 輸入+輸出 | 是 | 是 | 否 |
| tau2-bench / tau-Voice | 真實領域中使用者、代理與工具的動態互動 | 輸入+輸出 | 是 | 是 | 否 |
| VoiceComputerBench / TalkAct | 即時語音對話加上瀏覽器操作 | 輸入+輸出 | 是 | 是 | 是 |
| NVIDIA voice-agent evaluation | 可重現的即時測試框架,涵蓋 EVA 與 tau2 情境 | 輸入+輸出 | 是 | 是 | 否 |
| VoiceAgentBench | 以語音為基礎的工具選擇、編排與安全性 | 僅輸入 | 是 | 部分涵蓋 | 否 |
| Audio2Tool | 跨不同意圖複雜度的口說工具呼叫選擇 | 僅輸入 | 是 | 否 | 否 |
| Voice Agent Latency | 來電者感受到的、直到代理發出第一段語音的時間 | 輸入+輸出 | 否 | 否 | 否 |
| OpenBench | 可重現的 ASR、語者分離與串流測試 | 僅輸入 | 否 | 否 | 否 |
| ELITR-Bench | 針對會議逐字稿的長情境推理 | 逐字稿文字 | 否 | 部分涵蓋 | 否 |
全部 13 個受檢視專案的能力涵蓋範圍、佐證說明、授權條款與連結,都收錄在機器可讀的 JSONL 資料集中。
單一的綜合分數會掩蓋失敗模式。請讓以下四個層次都保持可見,並分別公布每一層的結果。
使用者有沒有在目標系統中得到他想要的結果?
這段交流是否即時、聽得懂、可打斷,而且可以從錯誤中恢復?
量測 ASR、語者分離、實體、工具參數或產生的內容,但不要把它們當成最終成果。
測試同意、確認、可撤銷性、隱私,以及代理是否如實回報任務已完成。
請記錄基準測試的 commit、模型與供應商版本、提示詞、工具結構描述、音訊前處理、試驗次數、取樣設定、計時邊界、評審評分準則、逾時、拒答,以及每一份資料集的授權條款。失敗的執行應該保留在報告中,而不是從分母裡消失。
底層的全景資料由 Sophon LLC 以獨立社群資源的形式維護。它不會把 Cue 與所列專案排名比較,也沒有任何基準測試的擁有者贊助其列入。
如果你正在設計一套評估,請從開放的全景資料開始。如果你要實際評估桌面語音代理,可以另外瞭解 Cue 的語音輸入、會議與跨應用程式工作流程。