← AI 용어집

AI 용어집 · 입문 · 음성·오디오

음성 인식 ASR, STT

음성 인식(ASR, Automatic Speech Recognition, STT라고도 함)은 사람이 말한 소리를 듣고 그 내용을 글자로 받아 적는 기술입니다.

쉽게 말하면 강연을 들으며 받아 적는 속기사와 비슷합니다. 속기사처럼 잘 안 들린 부분은 앞뒤 맥락으로 짐작해 채우는데, 이 짐작이 틀리면 엉뚱한 단어가 적히기도 합니다.

어떻게 작동하나

마이크로 들어온 소리는 먼저 시간에 따라 어떤 높이의 소리가 얼마나 센지를 보여 주는 그림 같은 데이터로 바뀝니다. 딥러닝 모델이 이 데이터를 보고 어떤 소리·글자·단어에 해당하는지 추정합니다. 이때 '어떤 단어 다음에 어떤 단어가 오기 쉬운지'라는 언어 지식도 함께 써서, 비슷하게 들리는 말 중 문맥에 맞는 쪽을 고릅니다. 요즘은 소리를 넣으면 글자가 바로 나오는 하나의 큰 모델(엔드투엔드 방식)이 주류이고, 여러 언어를 한 모델로 받아 적기도 합니다.

왜 중요한가

음성 인식은 음성 비서, 회의록 자동 작성, 영상 자막, 콜센터 상담 분석처럼 말을 데이터로 바꿔야 하는 거의 모든 서비스의 입구입니다. 받아 적은 글은 LLM이 요약·번역·답변하는 데 그대로 쓸 수 있어, TTS와 함께 '말로 하는 AI'를 완성하는 핵심 부품이 됩니다. 손을 쓰기 어려운 상황이나 청각장애인을 위한 실시간 자막 같은 접근성 측면에서도 중요합니다.

알아 둘 점

주변 소음, 여러 사람이 겹쳐 말하는 상황, 사투리·억양, 전문 용어와 고유명사에서는 정확도가 떨어지기 쉽습니다. 일부 모델은 소리가 거의 없는 구간에서 실제로 하지 않은 말을 지어내 적는 환각을 보이기도 하므로, 중요한 기록은 사람이 확인하는 것이 좋습니다. 또 목소리는 개인정보이므로 녹음을 서버로 보낼지 기기 안에서 처리할지(온디바이스 AI)도 서비스를 고를 때 따져 볼 점입니다.

예시

회의 녹음 앱이나 화상회의 서비스의 '자동 회의록' 기능은 음성 인식으로 대화를 글로 받아 적은 뒤, LLM이 그 글을 요약하고 할 일 목록을 뽑아 주는 방식으로 작동합니다. 스마트폰의 음성 입력 키보드나 유튜브 같은 영상 플랫폼의 자동 자막도 음성 인식을 쓰는 대표적인 예입니다.

함께 보면 좋은 용어