执行操作的语音代理
衡量已完成的任务、状态变更、错误恢复、确认、可撤销性以及状态汇报是否属实,而不只是工具调用 JSON 是否合法。
“语音 AI”并不是单一的评估问题。语音识别的评测基准可能完全无法说明任务是否完成;工具调用测试集可能从不真正执行操作;而转写稿评测基准可能在麦克风相关的工作完成之后才开始。
本指南梳理了 13 个公开的起点项目,均于 2026 年 9 月 1 日依据第一方来源审阅。这是一份全景图,而非排行榜;收录其中并不代表推荐或背书。
先选择与你需要验证的用户结果相匹配的方向,再用组件级指标来解释该结果为何成功或失败。
衡量已完成的任务、状态变更、错误恢复、确认、可撤销性以及状态汇报是否属实,而不只是工具调用 JSON 是否合法。
把识别准确性与实体处理、格式化、延迟、纠错负担以及能否可靠地插入目标应用结合起来考察。
把采集、转写、说话人分离、摘要忠实度、决策以及行动项质量作为彼此独立的层次分别对待。
下表只回答一个很窄的问题:对某项评估需求而言,哪个公开项目适合作为合理的第一站?“部分覆盖”表示该能力只出现在测试集的一部分中,或者只是被间接衡量。
| 评测基准 | 最适合作为起点的场景 | 语音输入/输出 | 工具 | 任务完成 | 计算机操作 |
|---|---|---|---|---|---|
| EVA | 端到端对话代理的准确性与体验 | 输入 + 输出 | 是 | 是 | 否 |
| tau2-bench / tau-Voice | 真实领域中用户、代理与工具之间的动态交互 | 输入 + 输出 | 是 | 是 | 否 |
| VoiceComputerBench / TalkAct | 实时语音对话加上浏览器操作 | 输入 + 输出 | 是 | 是 | 是 |
| NVIDIA voice-agent evaluation | 在 EVA 与 tau2 场景上可复现的实时测试框架 | 输入 + 输出 | 是 | 是 | 否 |
| VoiceAgentBench | 基于语音的工具选择、编排与安全性 | 仅输入 | 是 | 部分覆盖 | 否 |
| Audio2Tool | 不同意图复杂度下的语音工具调用选择 | 仅输入 | 是 | 否 | 否 |
| Voice Agent Latency | 来电者感知到的首次代理语音输出时间 | 输入 + 输出 | 否 | 否 | 否 |
| OpenBench | 可复现的 ASR、说话人分离与流式测试 | 仅输入 | 否 | 否 | 否 |
| ELITR-Bench | 基于会议转写稿的长上下文推理 | 转写稿文本 | 否 | 部分覆盖 | 否 |
全部 13 个已审阅项目的能力覆盖情况、证据说明、许可证与链接,都收录在机器可读的 JSONL 数据集中。
单一的综合分数会掩盖失败模式。请让以下四个层次保持可见,并分别公布每一层的结果。
用户是否在目标系统中得到了预期的结果?
整个交流是否及时、可理解、可打断、可恢复?
衡量 ASR、说话人分离、实体、工具参数或生成内容,但不要把它们当作最终结果。
测试授权同意、确认、可撤销性、隐私,以及代理是否如实汇报任务已完成。
请记录评测基准的提交版本、模型与服务商版本、提示词、工具 schema、音频预处理、试验次数、采样设置、计时边界、评判细则、超时、拒答,以及每一份数据集的许可证。失败的运行应保留在报告中,而不是从分母里消失。
作为基础的这份全景图由 Sophon LLC 作为独立的社区资源维护。它不会把 Cue 与所列项目放在一起排名,也没有任何评测基准的所有方出资赞助以换取收录。
如果你正在设计评估方案,可以从这份开放全景图开始。如果你要在实际使用中评估桌面语音代理,可以另行了解 Cue 的语音输入、会议与跨应用工作流。