AI 용어집 · 입문 · 음성·오디오
TTS 음성 합성
TTS(Text-to-Speech, 음성 합성)는 글자로 된 문장을 사람 목소리처럼 들리는 음성으로 바꿔 읽어 주는 기술입니다.
어떻게 작동하나
먼저 텍스트 분석 단계에서 숫자·약어를 읽는 말로 풀고, 발음과 끊어 읽을 위치를 정합니다. 다음으로 음향 모델이 이 정보를 바탕으로 소리의 높낮이·길이·음색을 담은 중간 표현(소리의 설계도 같은 것)을 만듭니다. 마지막으로 보코더라는 부분이 이 설계도를 실제로 들을 수 있는 음성 파형으로 바꿉니다. 최근에는 이 단계들을 하나의 딥러닝 모델로 합치거나, LLM처럼 소리를 토큰으로 나눠 이어 생성하는 방식도 널리 쓰입니다.
왜 중요한가
TTS는 음성 비서, 내비게이션, 오디오북, 시각장애인을 위한 화면 읽기 기능처럼 '듣는 화면'이 필요한 곳 어디에나 들어갑니다. 음성 인식(ASR), LLM과 함께 묶이면 사람과 말로 대화하는 AI 비서가 됩니다. 최근 TTS는 사람 목소리와 구별하기 어려울 정도로 자연스러워졌고, 감정이나 말투를 지정하는 것도 가능해졌습니다. 작은 모델로도 쓸 만한 품질이 나오면서 휴대폰 안에서 바로 돌리는 온디바이스 TTS도 늘고 있습니다.
알아 둘 점
짧은 녹음만으로 특정인의 목소리를 흉내 내는 '보이스 클로닝'이 가능해지면서 보이스피싱·딥페이크 악용 우려가 커졌습니다. 그래서 생성 음성에 AI 워터마크를 넣거나, 본인 동의를 확인하는 장치를 두는 서비스가 많습니다. 또 고유명사·외래어·숫자 읽기, 문맥에 따른 억양 같은 부분에서는 아직 어색한 실수가 나올 수 있습니다.
예시
이 사이트에서 다룬 'Paradee: Kokoro-82M을 8M 파라미터 단일 음성 TTS로 Distillation' 소식이 좋은 예입니다. 비교적 작은 공개 TTS 모델인 Kokoro-82M을 Teacher 모델로 삼아, 목소리 하나만 내는 훨씬 작은 Student 모델로 Distill했다는 내용입니다. 목소리 종류를 줄이는 대신 모델을 가볍게 만들어, 휴대폰이나 작은 기기에서도 TTS를 돌리기 쉽게 하려는 흐름을 보여 줍니다.
이 사이트에서 나온 사례
- 브리핑 Paradee: Kokoro-82M을 8M 파라미터 단일 음성 TTS로 Distillation 2026-10-06