행동하는 음성 에이전트
유효한 도구 호출 JSON만이 아니라 완료된 작업, 상태 변경, 복구, 확인, 되돌리기 가능성, 정확한 상태 보고를 측정하세요.
“음성 AI”는 하나의 평가 문제가 아니에요. 음성 인식 벤치마크는 작업 완료에 대해 아무것도 말해 주지 않을 수 있고, 도구 호출 모음은 실제 동작을 한 번도 실행하지 않을 수 있으며, 트랜스크립트 벤치마크는 마이크 관련 작업이 이미 끝난 뒤에 시작될 수 있어요.
이 가이드는 2026년 9월 1일에 1차 출처를 통해 검토한 13개의 공개 출발점을 정리한 것이에요. 순위표가 아니라 지형도이며, 목록에 포함되었다고 해서 추천을 뜻하지는 않아요.
확인해야 할 사용자 결과에 맞는 트랙을 고르세요. 그런 다음 구성 요소 지표로 그 결과가 왜 성공했는지 또는 실패했는지 설명하세요.
유효한 도구 호출 JSON만이 아니라 완료된 작업, 상태 변경, 복구, 확인, 되돌리기 가능성, 정확한 상태 보고를 측정하세요.
인식 정확도를 개체 처리, 서식, 지연 시간, 수정 부담, 대상 앱에 안정적으로 삽입되는지와 함께 살펴보세요.
캡처, 전사, 화자 분리, 요약 충실도, 결정 사항, 실행 항목 품질을 각각 별도의 레이어로 유지하세요.
아래 표는 좁은 질문 하나에 답해요. 특정한 평가 요구에 대해 어떤 공개 프로젝트가 합리적인 첫 출발점인가요? “부분 지원”은 해당 역량이 모음의 일부에만 나타나거나 간접적으로 측정된다는 뜻이에요.
| 벤치마크 | 가장 알맞은 출발점 | 음성 입출력 | 도구 | 작업 완료 | 컴퓨터 조작 |
|---|---|---|---|---|---|
| EVA | 종단 간 대화형 에이전트의 정확도와 경험 | 입력 + 출력 | 예 | 예 | 아니요 |
| tau2-bench / tau-Voice | 현실적인 도메인에서의 동적인 사용자·에이전트·도구 상호작용 | 입력 + 출력 | 예 | 예 | 아니요 |
| VoiceComputerBench / TalkAct | 실시간 음성 대화와 브라우저 동작 | 입력 + 출력 | 예 | 예 | 예 |
| NVIDIA voice-agent evaluation | EVA와 tau2 시나리오를 재현 가능하게 실행하는 라이브 하네스 | 입력 + 출력 | 예 | 예 | 아니요 |
| VoiceAgentBench | 음성 기반 도구 선택, 오케스트레이션, 안전성 | 입력만 | 예 | 부분 지원 | 아니요 |
| Audio2Tool | 의도 복잡도에 따른 음성 도구 호출 선택 | 입력만 | 예 | 아니요 | 아니요 |
| Voice Agent Latency | 발신자가 체감하는 첫 에이전트 음성까지의 시간 | 입력 + 출력 | 아니요 | 아니요 | 아니요 |
| OpenBench | 재현 가능한 ASR, 화자 분리, 스트리밍 테스트 | 입력만 | 아니요 | 아니요 | 아니요 |
| ELITR-Bench | 회의 트랜스크립트에 대한 장문 컨텍스트 추론 | 트랜스크립트 텍스트 | 아니요 | 부분 지원 | 아니요 |
검토한 13개 프로젝트 전체의 역량 커버리지, 근거 메모, 라이선스, 링크는 기계 판독용 JSONL 데이터셋에서 확인할 수 있어요.
하나의 종합 점수는 실패 유형을 가려요. 다음 네 개의 레이어를 각각 드러내고 레이어마다 결과를 공개하세요.
사용자가 대상 시스템에서 의도한 결과를 얻었나요?
주고받는 과정이 제때 이뤄지고, 이해할 수 있고, 중간에 끊을 수 있고, 복구할 수 있었나요?
ASR, 화자 분리, 개체, 도구 인자, 생성된 내용을 최종 결과로 취급하지 말고 측정하세요.
동의, 확인, 되돌리기 가능성, 개인정보 보호, 그리고 에이전트가 완료 여부를 정확하게 보고하는지를 시험하세요.
벤치마크 커밋, 모델과 제공업체 버전, 프롬프트, 도구 스키마, 오디오 전처리, 시행 횟수, 샘플링 설정, 시간 측정 경계, 심사 루브릭, 타임아웃, 거부, 모든 데이터셋 라이선스를 기록하세요. 실패한 실행은 분모에서 사라지는 대신 보고서에 남아 있어야 해요.
기반이 되는 지형도는 Sophon LLC가 독립적인 커뮤니티 자료로 관리하고 있어요. 여기에 나열된 프로젝트와 Cue의 순위를 매기지 않으며, 어떤 벤치마크 소유자도 목록 등재를 후원하지 않았어요.
평가를 설계하는 중이라면 공개 지형도에서 시작하세요. 실제로 데스크톱 음성 에이전트를 평가하는 중이라면 Cue의 음성 입력, 회의, 앱 간 워크플로를 따로 살펴보세요.