← AI 용어집

AI 용어집 · 기초 · 언어 모델

트랜스포머 Transformer

트랜스포머는 문장 속 단어(토큰)들이 서로 얼마나 관련 있는지를 한꺼번에 따져 보는 어텐션 방식을 중심으로 만든 인공 신경망 구조다. 오늘날 대부분의 LLM이 이 구조를 바탕으로 한다.

쉽게 말하면 회의에서 모든 참석자가 서로의 발언을 동시에 듣고, 누구 말이 지금 내 생각과 가장 관련 있는지 골라 귀 기울이는 모습과 비슷하다. 실제로는 사람이 아니라 숫자로 된 관련도 계산이 이 역할을 한다.

어떻게 작동하나

먼저 문장을 토큰이라는 작은 조각으로 나누고, 각 토큰을 숫자 묶음(임베딩)으로 바꾼다. 여기에 '몇 번째 자리에 있는지'를 알려 주는 위치 정보를 더한다. 그다음 어텐션 단계에서 각 토큰이 문장 안의 다른 토큰들을 살펴보고 관련 있는 정보를 끌어모으며, 이어지는 피드포워드 단계에서 그 정보를 한 번 더 가공한다. 이 두 단계로 된 층(블록)을 수십 번 쌓아 반복하면 문맥에 대한 이해가 점점 깊어지고, 생성형 모델은 마지막에 다음에 올 토큰을 예측한다.

트랜스포머가 글을 처리하는 흐름입력 문장 → 토큰화; 토큰화 → 임베딩; 임베딩 → 어텐션; 어텐션 → 피드포워드; 피드포워드 → 어텐션(반복); 피드포워드 → 다음 토큰 예측트랜스포머 블록 × N입력 문장토큰화임베딩+ 위치 정보어텐션토큰끼리 관련도 계산피드포워드정보 가공다음 토큰 예측반복
트랜스포머가 글을 처리하는 흐름 토큰으로 나눈 글이 임베딩을 거쳐 '어텐션→피드포워드' 블록을 여러 번 지나고, 마지막에 다음 토큰을 예측한다. 아래 화살표는 블록을 반복해 쌓는다는 뜻이다.

왜 중요한가

트랜스포머 이전에 많이 쓰던 RNN은 글을 앞에서부터 한 단어씩 차례로 처리해서 긴 글을 다루기 어렵고 속도도 느렸다. 트랜스포머는 문장 전체를 한꺼번에 처리할 수 있어 GPU로 대량 계산을 나눠 하기 좋았다. 덕분에 모델과 데이터를 크게 키울수록 성능이 좋아지는 흐름이 가능해졌고, 이것이 오늘날 LLM의 바탕이 됐다. 글뿐 아니라 이미지, 음성, 로봇 제어 같은 분야에서도 트랜스포머 구조가 널리 쓰인다.

알아 둘 점

어텐션은 모든 토큰 쌍을 비교하기 때문에 입력이 길어질수록 계산량과 메모리가 빠르게 늘어난다. 이 부담을 줄이려고 KV 캐시, MoE, 상태 공간 모델과 섞은 구조 같은 다양한 개선이 나오고 있다. 또 트랜스포머는 '구조'를 가리키는 말이라서, 같은 트랜스포머라도 어떤 데이터로 어떻게 학습했는지에 따라 능력이 크게 달라진다.

예시

챗봇, 번역기, 코딩 도우미 같은 LLM 서비스는 대부분 트랜스포머를 바탕으로 만들어졌다. 연구자들은 이 구조를 계속 변형하고 있는데, 이 사이트에서 다룬 'ALoDLM'은 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델로, 모든 토큰이 같은 횟수로 처리되는 대신 필요한 만큼만 반복해 계산하게 하려는 시도다.

이 사이트에서 나온 사례

함께 보면 좋은 용어