AI 용어집 · 기초 · 언어 모델
트랜스포머 Transformer
트랜스포머는 문장 속 단어(토큰)들이 서로 얼마나 관련 있는지를 한꺼번에 따져 보는 어텐션 방식을 중심으로 만든 인공 신경망 구조다. 오늘날 대부분의 LLM이 이 구조를 바탕으로 한다.
어떻게 작동하나
먼저 문장을 토큰이라는 작은 조각으로 나누고, 각 토큰을 숫자 묶음(임베딩)으로 바꾼다. 여기에 '몇 번째 자리에 있는지'를 알려 주는 위치 정보를 더한다. 그다음 어텐션 단계에서 각 토큰이 문장 안의 다른 토큰들을 살펴보고 관련 있는 정보를 끌어모으며, 이어지는 피드포워드 단계에서 그 정보를 한 번 더 가공한다. 이 두 단계로 된 층(블록)을 수십 번 쌓아 반복하면 문맥에 대한 이해가 점점 깊어지고, 생성형 모델은 마지막에 다음에 올 토큰을 예측한다.
왜 중요한가
트랜스포머 이전에 많이 쓰던 RNN은 글을 앞에서부터 한 단어씩 차례로 처리해서 긴 글을 다루기 어렵고 속도도 느렸다. 트랜스포머는 문장 전체를 한꺼번에 처리할 수 있어 GPU로 대량 계산을 나눠 하기 좋았다. 덕분에 모델과 데이터를 크게 키울수록 성능이 좋아지는 흐름이 가능해졌고, 이것이 오늘날 LLM의 바탕이 됐다. 글뿐 아니라 이미지, 음성, 로봇 제어 같은 분야에서도 트랜스포머 구조가 널리 쓰인다.
알아 둘 점
어텐션은 모든 토큰 쌍을 비교하기 때문에 입력이 길어질수록 계산량과 메모리가 빠르게 늘어난다. 이 부담을 줄이려고 KV 캐시, MoE, 상태 공간 모델과 섞은 구조 같은 다양한 개선이 나오고 있다. 또 트랜스포머는 '구조'를 가리키는 말이라서, 같은 트랜스포머라도 어떤 데이터로 어떻게 학습했는지에 따라 능력이 크게 달라진다.
예시
챗봇, 번역기, 코딩 도우미 같은 LLM 서비스는 대부분 트랜스포머를 바탕으로 만들어졌다. 연구자들은 이 구조를 계속 변형하고 있는데, 이 사이트에서 다룬 'ALoDLM'은 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델로, 모든 토큰이 같은 횟수로 처리되는 대신 필요한 만큼만 반복해 계산하게 하려는 시도다.
이 사이트에서 나온 사례
- 논문 ALoDLM: 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델 2026-10-07