AI 용어집 · 기초 · 생성형 미디어
디퓨전 모델 Diffusion model, 확산 모델
디퓨전 모델(확산 모델)은 무작위 노이즈에서 출발해 노이즈를 조금씩 걷어 내면서 이미지·영상·소리 같은 데이터를 만드는 생성 AI 모델이다. 학습할 때는 노이즈가 섞인 데이터에서 그 노이즈를 알아맞히는 법을 배운다.
어떻게 작동하나
학습할 때는 먼저 진짜 이미지에 노이즈(무작위 잡음)를 단계적으로 섞어서 점점 알아볼 수 없게 만든다. 그다음 모델에게 ‘이 이미지에 어떤 노이즈가 섞였는지’ 알아맞히게 한다. 이 연습을 아주 많이 반복하면 모델은 노이즈를 걷어 내는 법을 익힌다. 무언가를 생성할 때는 순수한 노이즈에서 시작해, 모델이 노이즈를 예측하고 조금씩 걷어 내는 일을 여러 번 되풀이한다. 그러면 마지막에 깨끗한 이미지가 나온다.
왜 중요한가
디퓨전 모델은 오늘날 이미지 생성 AI의 주류 방식이다. 결과물이 세밀하고 다양하며, 학습도 비교적 안정적이라는 장점 덕분이다. ‘노을 지는 바닷가의 고양이’ 같은 글(프롬프트)을 조건으로 함께 넣으면, 모델은 노이즈를 걷어 내면서 그 설명에 맞는 쪽으로 그림을 만든다. 같은 원리가 영상, 음성, 음악, 3D, 로봇 동작 생성 등으로 넓어지고 있다.
알아 둘 점
노이즈를 걷어 내는 과정을 여러 번 반복해야 해서 한 번에 결과를 내는 방식보다 생성이 느리고 계산 비용이 든다. 그래서 반복 횟수를 줄이는 기법이 활발히 연구되며, Distillation으로 단계를 줄이는 방법도 그중 하나다. 비용을 아끼려고 원본 이미지 대신 압축된 작은 공간에서 노이즈를 걷어 내는 방식(잠재 디퓨전)도 널리 쓰인다. 학습 데이터의 저작권, 딥페이크 악용 같은 사회적 문제도 함께 논의되고 있다.
예시
Stable Diffusion 같은 이미지 생성 모델이 대표적인 디퓨전 모델이다. 사용자가 원하는 장면을 글로 적으면, 모델은 무작위 노이즈에서 출발해 그 설명에 맞게 노이즈를 걷어 내며 그림을 완성한다. 요즘에는 글로 영상을 만드는 서비스, 음성·음악 생성 도구, 사진의 일부를 지우고 자연스럽게 채우는 편집 기능에도 같은 원리가 쓰인다.