语音代理开放研究

按它所衡量的任务来选择语音代理评测基准。

“语音 AI”并不是单一的评估问题。语音识别的评测基准可能完全无法说明任务是否完成;工具调用测试集可能从不真正执行操作;而转写稿评测基准可能在麦克风相关的工作完成之后才开始。

本指南梳理了 13 个公开的起点项目,均于 2026 年 9 月 1 日依据第一方来源审阅。这是一份全景图,而非排行榜;收录其中并不代表推荐或背书。

从三种产品结果中选择一个作为起点

先选择与你需要验证的用户结果相匹配的方向,再用组件级指标来解释该结果为何成功或失败。

1

执行操作的语音代理

衡量已完成的任务、状态变更、错误恢复、确认、可撤销性以及状态汇报是否属实,而不只是工具调用 JSON 是否合法。

2

语音输入与听写

把识别准确性与实体处理、格式化、延迟、纠错负担以及能否可靠地插入目标应用结合起来考察。

3

会议理解

把采集、转写、说话人分离、摘要忠实度、决策以及行动项质量作为彼此独立的层次分别对待。

公开评测基准的起点项目

下表只回答一个很窄的问题:对某项评估需求而言,哪个公开项目适合作为合理的第一站?“部分覆盖”表示该能力只出现在测试集的一部分中,或者只是被间接衡量。

评测基准最适合作为起点的场景语音输入/输出工具任务完成计算机操作
EVA端到端对话代理的准确性与体验输入 + 输出
tau2-bench / tau-Voice真实领域中用户、代理与工具之间的动态交互输入 + 输出
VoiceComputerBench / TalkAct实时语音对话加上浏览器操作输入 + 输出
NVIDIA voice-agent evaluation在 EVA 与 tau2 场景上可复现的实时测试框架输入 + 输出
VoiceAgentBench基于语音的工具选择、编排与安全性仅输入部分覆盖
Audio2Tool不同意图复杂度下的语音工具调用选择仅输入
Voice Agent Latency来电者感知到的首次代理语音输出时间输入 + 输出
OpenBench可复现的 ASR、说话人分离与流式测试仅输入
ELITR-Bench基于会议转写稿的长上下文推理转写稿文本部分覆盖

全部 13 个已审阅项目的能力覆盖情况、证据说明、许可证与链接,都收录在机器可读的 JSONL 数据集中。

采用分层的评估方案

单一的综合分数会掩盖失败模式。请让以下四个层次保持可见,并分别公布每一层的结果。

用户结果

用户是否在目标系统中得到了预期的结果?

交互质量

整个交流是否及时、可理解、可打断、可恢复?

组件质量

衡量 ASR、说话人分离、实体、工具参数或生成内容,但不要把它们当作最终结果。

安全与信任

测试授权同意、确认、可撤销性、隐私,以及代理是否如实汇报任务已完成。

重要空白:在本次审阅的全景图中,没有任何公开评测基准能够完整衡量在各类应用中进行的桌面连续听写。团队应把公开的 ASR 基线与一份获得同意授权的私有语料结合起来,该语料需反映自身真实的麦克风、语言、应用与词汇。

不要比较含义不同的分数

  • 工具调用准确率并不能证明下游操作已经成功,也不能证明改动的是正确的对象。
  • 词错误率无法体现标点、格式、实体准确性、编辑投入或插入的可靠性。
  • 仅基于转写稿的会议测试无法暴露麦克风、语音重叠、说话人分离、重新连接或设备方面的故障。
  • 延迟测量需要明确的起止边界;来电者音频、首个 token、最终文本以及可见的任务进度分别对应不同的计时口径。

请记录评测基准的提交版本、模型与服务商版本、提示词、工具 schema、音频预处理、试验次数、采样设置、计时边界、评判细则、超时、拒答,以及每一份数据集的许可证。失败的运行应保留在报告中,而不是从分母里消失。

开放数据与可复现性

作为基础的这份全景图由 Sophon LLC 作为独立的社区资源维护。它不会把 Cue 与所列项目放在一起排名,也没有任何评测基准的所有方出资赞助以换取收录。

单独的证据:这份全景图并未复现 Cue 内部 227 个样本的生产环境评测。那项范围更窄的 Apple Silicon 测量记录在 Gemma 4 听写案例研究指南中,其主要来源是 Google DeepMind 的原始 Gemmaverse 页面。

先评估任务,再选择工具。

如果你正在设计评估方案,可以从这份开放全景图开始。如果你要在实际使用中评估桌面语音代理,可以另行了解 Cue 的语音输入、会议与跨应用工作流。