공개 음성 에이전트 연구

측정하는 작업을 기준으로 음성 에이전트 벤치마크를 고르세요.

“음성 AI”는 하나의 평가 문제가 아니에요. 음성 인식 벤치마크는 작업 완료에 대해 아무것도 말해 주지 않을 수 있고, 도구 호출 모음은 실제 동작을 한 번도 실행하지 않을 수 있으며, 트랜스크립트 벤치마크는 마이크 관련 작업이 이미 끝난 뒤에 시작될 수 있어요.

이 가이드는 2026년 9월 1일에 1차 출처를 통해 검토한 13개의 공개 출발점을 정리한 것이에요. 순위표가 아니라 지형도이며, 목록에 포함되었다고 해서 추천을 뜻하지는 않아요.

세 가지 제품 결과 중 하나에서 시작하세요

확인해야 할 사용자 결과에 맞는 트랙을 고르세요. 그런 다음 구성 요소 지표로 그 결과가 왜 성공했는지 또는 실패했는지 설명하세요.

1

행동하는 음성 에이전트

유효한 도구 호출 JSON만이 아니라 완료된 작업, 상태 변경, 복구, 확인, 되돌리기 가능성, 정확한 상태 보고를 측정하세요.

2

음성 입력과 받아쓰기

인식 정확도를 개체 처리, 서식, 지연 시간, 수정 부담, 대상 앱에 안정적으로 삽입되는지와 함께 살펴보세요.

3

회의 이해

캡처, 전사, 화자 분리, 요약 충실도, 결정 사항, 실행 항목 품질을 각각 별도의 레이어로 유지하세요.

공개 벤치마크 출발점

아래 표는 좁은 질문 하나에 답해요. 특정한 평가 요구에 대해 어떤 공개 프로젝트가 합리적인 첫 출발점인가요? “부분 지원”은 해당 역량이 모음의 일부에만 나타나거나 간접적으로 측정된다는 뜻이에요.

벤치마크가장 알맞은 출발점음성 입출력도구작업 완료컴퓨터 조작
EVA종단 간 대화형 에이전트의 정확도와 경험입력 + 출력아니요
tau2-bench / tau-Voice현실적인 도메인에서의 동적인 사용자·에이전트·도구 상호작용입력 + 출력아니요
VoiceComputerBench / TalkAct실시간 음성 대화와 브라우저 동작입력 + 출력
NVIDIA voice-agent evaluationEVA와 tau2 시나리오를 재현 가능하게 실행하는 라이브 하네스입력 + 출력아니요
VoiceAgentBench음성 기반 도구 선택, 오케스트레이션, 안전성입력만부분 지원아니요
Audio2Tool의도 복잡도에 따른 음성 도구 호출 선택입력만아니요아니요
Voice Agent Latency발신자가 체감하는 첫 에이전트 음성까지의 시간입력 + 출력아니요아니요아니요
OpenBench재현 가능한 ASR, 화자 분리, 스트리밍 테스트입력만아니요아니요아니요
ELITR-Bench회의 트랜스크립트에 대한 장문 컨텍스트 추론트랜스크립트 텍스트아니요부분 지원아니요

검토한 13개 프로젝트 전체의 역량 커버리지, 근거 메모, 라이선스, 링크는 기계 판독용 JSONL 데이터셋에서 확인할 수 있어요.

계층으로 나눈 평가 계획을 사용하세요

하나의 종합 점수는 실패 유형을 가려요. 다음 네 개의 레이어를 각각 드러내고 레이어마다 결과를 공개하세요.

사용자 결과

사용자가 대상 시스템에서 의도한 결과를 얻었나요?

상호작용 품질

주고받는 과정이 제때 이뤄지고, 이해할 수 있고, 중간에 끊을 수 있고, 복구할 수 있었나요?

구성 요소 품질

ASR, 화자 분리, 개체, 도구 인자, 생성된 내용을 최종 결과로 취급하지 말고 측정하세요.

안전성과 신뢰

동의, 확인, 되돌리기 가능성, 개인정보 보호, 그리고 에이전트가 완료 여부를 정확하게 보고하는지를 시험하세요.

중요한 공백: 이번에 검토한 지형도 안에는 임의의 애플리케이션 안에서 이뤄지는 연속 데스크톱 받아쓰기를 온전히 측정하는 공개 벤치마크가 없어요. 팀은 공개 ASR 기준선에, 실제로 쓰는 마이크·언어·앱·어휘를 반영하고 동의를 받은 비공개 코퍼스를 함께 써야 해요.

뜻이 다른 점수를 서로 비교하지 마세요

  • 도구 호출 정확도는 그 뒤에 이어지는 동작이 성공했는지, 올바른 대상을 바꿨는지를 증명하지 않아요.
  • 단어 오류율은 구두점, 서식, 개체 정확도, 편집 노력, 삽입 안정성을 담아내지 못해요.
  • 트랜스크립트만 쓰는 회의 테스트로는 마이크, 발화 겹침, 화자 분리, 재연결, 기기 관련 실패를 드러낼 수 없어요.
  • 지연 시간 측정에는 명확한 시작과 끝 경계가 필요해요. 발신자 음성, 첫 토큰, 최종 텍스트, 눈에 보이는 작업 진행은 서로 다른 시계예요.

벤치마크 커밋, 모델과 제공업체 버전, 프롬프트, 도구 스키마, 오디오 전처리, 시행 횟수, 샘플링 설정, 시간 측정 경계, 심사 루브릭, 타임아웃, 거부, 모든 데이터셋 라이선스를 기록하세요. 실패한 실행은 분모에서 사라지는 대신 보고서에 남아 있어야 해요.

공개 데이터와 재현성

기반이 되는 지형도는 Sophon LLC가 독립적인 커뮤니티 자료로 관리하고 있어요. 여기에 나열된 프로젝트와 Cue의 순위를 매기지 않으며, 어떤 벤치마크 소유자도 목록 등재를 후원하지 않았어요.

별도의 근거: 이 지형도는 Cue의 비공개 227개 샘플 프로덕션 벤치마크를 재현하지 않아요. 더 좁은 범위의 그 Apple Silicon 측정은 Gemma 4 받아쓰기 사례 연구 가이드에 정리돼 있고, Google DeepMind의 원본 Gemmaverse 페이지를 1차 출처로 삼고 있어요.

작업을 먼저 평가하고, 그다음 도구를 고르세요.

평가를 설계하는 중이라면 공개 지형도에서 시작하세요. 실제로 데스크톱 음성 에이전트를 평가하는 중이라면 Cue의 음성 입력, 회의, 앱 간 워크플로를 따로 살펴보세요.