음성 텍스트 변환은 영어로 speech to text 또는 speech-to-text라고 쓰고 STT로 줄여 부르며, 사람이 말한 음성을 글로 바꾸는 과정을 가리켜요. 음성 인식 모델이 마이크나 녹음 파일에서 음성을 받아 텍스트로 된 결과를 돌려줘요. 이 말은 특정 앱이 아니라 변환 자체를 가리키기 때문에, 두 도구가 똑같이 음성 텍스트 변환을 하더라도 실제로 쓰는 느낌은 아주 다를 수 있어요.
이 세 가지는 서로 겹치는 부분이 있어 혼동하기 쉬워요. 음성 텍스트 변환은 밑바탕에 깔린 변환 그 자체예요. 받아쓰기는 그 변환을 제품으로 쓰는 한 가지 방식으로, 만들어진 텍스트가 지금 입력하고 있는 칸에 그대로 들어가요. 음성 AI는 셋 중 가장 넓은 개념이라, 단순히 텍스트를 내놓는 데서 그치지 않고 요청을 해석하거나 사용자가 허용한 맥락을 활용하거나 다음 단계를 준비하기도 해요.
먼저 음성을 받아들여 다루기 좋은 구간으로 나눈 뒤, 인식 모델이 이를 단어로 옮기면서 대개 문장 부호와 대소문자까지 붙여요. 말하는 도중에 중간 결과를 계속 보여 주는 도구가 있는가 하면, 음성이 끝난 뒤에 전체 텍스트를 한 번에 돌려주는 도구도 있어요. 결과물이 도착하는 곳은 제품마다 정해져 있어서, 지금 포커스가 놓인 입력 칸일 수도 있고 클립보드일 수도 있으며, 저장된 텍스트 기록이나 그 도구의 자체 노트 화면일 수도 있어요. 어떤 업무 흐름에 정착하기 전에 이 도착 지점을 확인해 두세요. 뒤이어 복사하고 다듬는 손이 얼마나 가는지가 여기서 갈리기 때문이에요.
지원 언어, 이름과 전문 용어를 다루는 방식, 화자 구분 표시, 타임스탬프, 녹음 길이 제한, 오프라인 지원, 처리를 기기에서 하는지 서비스를 거쳐서 하는지가 모두 달라요. 비용 구조도 데스크톱 기능에 포함된 형태부터 분당 과금까지 제각각이에요. 일반적인 설명이 모든 환경을 그대로 설명해 주는 경우는 드무니, 본인의 마이크와 억양, 실제로 다루는 주제로 직접 시험해 보세요.
음성 텍스트 변환에는 마이크 접근 권한이 필요하며, 회의나 통화를 담으려면 시스템 오디오와 함께 그 자리에 있는 다른 사람들의 인지까지 걸릴 수 있어요. 도구가 무엇을 기록하는지, 음성과 텍스트가 서비스로 전송되는지, 얼마나 오래 보관되는지, 삭제할 수 있는지를 살펴보세요. 그리고 텍스트를 전달하거나 공개하기 전에 반드시 읽어 보세요. 인식 오류는 이름과 숫자, 전문 용어처럼 가장 알아채기 어려운 자리에 남기 쉬워요.
Cue는 macOS 13 이상과 Windows 10 이상에서 쓰는 데스크톱 음성 AI예요. 받아쓰기를 하려면 지원되는 앱에서 텍스트 입력 칸에 포커스를 두고, 설치된 버전에 표시된 받아쓰기 단축키를 누른 뒤 말하고, 삽입된 텍스트를 검토하면 돼요. 더 긴 작업은 Cue의 데스크톱 녹음 기능을 직접 시작하면 되는데, 회의가 진행되는 동안 텍스트가 차곡차곡 채워지는 것을 보여 주고, 녹음을 멈추면 정리된 노트와 실행 항목을 돌려주며, 참석자 명단에는 아무것도 추가되지 않아요. Cue는 무료로 시작할 수 있습니다. Cue Plus는 월 $19.99입니다.