← AI 용어집

AI 용어집 · 입문 · 음성·오디오

TTS 음성 합성

TTS(Text-to-Speech, 음성 합성)는 글자로 된 문장을 사람 목소리처럼 들리는 음성으로 바꿔 읽어 주는 기술입니다.

쉽게 말하면 대본을 받아 소리 내어 읽어 주는 성우와 비슷합니다. 다만 AI 성우는 문장 뜻을 사람처럼 이해해서 감정을 싣는다기보다, 학습한 수많은 음성의 패턴을 따라 그럴듯한 억양을 만들어 냅니다.

어떻게 작동하나

먼저 텍스트 분석 단계에서 숫자·약어를 읽는 말로 풀고, 발음과 끊어 읽을 위치를 정합니다. 다음으로 음향 모델이 이 정보를 바탕으로 소리의 높낮이·길이·음색을 담은 중간 표현(소리의 설계도 같은 것)을 만듭니다. 마지막으로 보코더라는 부분이 이 설계도를 실제로 들을 수 있는 음성 파형으로 바꿉니다. 최근에는 이 단계들을 하나의 딥러닝 모델로 합치거나, LLM처럼 소리를 토큰으로 나눠 이어 생성하는 방식도 널리 쓰입니다.

TTS의 기본 처리 흐름입력 문장 → 텍스트 분석; 텍스트 분석 → 음향 모델; 음향 모델 → 보코더(설계도); 보코더 → 음성 출력입력 문장텍스트 분석발음·끊어 읽기음향 모델높낮이·길이·음색보코더소리 파형 만들기음성 출력설계도
TTS의 기본 처리 흐름 왼쪽에서 오른쪽으로 글이 소리로 바뀌는 단계입니다. 최근에는 가운데 단계들을 하나의 모델로 합치는 경우도 많습니다.

왜 중요한가

TTS는 음성 비서, 내비게이션, 오디오북, 시각장애인을 위한 화면 읽기 기능처럼 '듣는 화면'이 필요한 곳 어디에나 들어갑니다. 음성 인식(ASR), LLM과 함께 묶이면 사람과 말로 대화하는 AI 비서가 됩니다. 최근 TTS는 사람 목소리와 구별하기 어려울 정도로 자연스러워졌고, 감정이나 말투를 지정하는 것도 가능해졌습니다. 작은 모델로도 쓸 만한 품질이 나오면서 휴대폰 안에서 바로 돌리는 온디바이스 TTS도 늘고 있습니다.

알아 둘 점

짧은 녹음만으로 특정인의 목소리를 흉내 내는 '보이스 클로닝'이 가능해지면서 보이스피싱·딥페이크 악용 우려가 커졌습니다. 그래서 생성 음성에 AI 워터마크를 넣거나, 본인 동의를 확인하는 장치를 두는 서비스가 많습니다. 또 고유명사·외래어·숫자 읽기, 문맥에 따른 억양 같은 부분에서는 아직 어색한 실수가 나올 수 있습니다.

예시

이 사이트에서 다룬 'Paradee: Kokoro-82M을 8M 파라미터 단일 음성 TTS로 Distillation' 소식이 좋은 예입니다. 비교적 작은 공개 TTS 모델인 Kokoro-82M을 Teacher 모델로 삼아, 목소리 하나만 내는 훨씬 작은 Student 모델로 Distill했다는 내용입니다. 목소리 종류를 줄이는 대신 모델을 가볍게 만들어, 휴대폰이나 작은 기기에서도 TTS를 돌리기 쉽게 하려는 흐름을 보여 줍니다.

이 사이트에서 나온 사례

함께 보면 좋은 용어