AI 용어집 · 심화 · 언어 모델
어텐션 Attention
어텐션(Attention)은 AI 모델이 문장 같은 입력을 처리할 때, 지금 다루는 단어와 관련이 깊은 다른 단어에 더 큰 비중을 두고 정보를 모으는 방법입니다. 트랜스포머 구조의 핵심 부품입니다.
어떻게 작동하나
입력은 먼저 토큰이라는 작은 조각으로 나뉘고, 토큰마다 의미를 담은 숫자 묶음(임베딩)으로 바뀝니다. 각 토큰은 '내가 찾는 정보'(Query)를 들고, 다른 토큰이 가진 '나는 이런 정보야'(Key)와 비교해서 얼마나 관련 있는지 점수를 냅니다. 점수가 높은 토큰의 내용(Value)을 더 많이 섞어서 새 Representation(모델 안에서 쓰는 내부 표현)을 만듭니다. 이 과정을 여러 관점에서 동시에 하는 것을 멀티헤드 어텐션이라고 부릅니다.
왜 중요한가
예전 방식(RNN)은 단어를 하나씩 순서대로 읽어서 멀리 떨어진 단어 사이의 관계를 놓치기 쉬웠습니다. 어텐션은 문장 안의 모든 위치를 한 번에 서로 비교할 수 있어서 긴 문맥을 더 잘 이해합니다. 계산을 병렬로 처리하기 좋아 GPU에서 빠르게 돌릴 수 있고, 이 덕분에 거대한 LLM을 학습시킬 수 있게 되었습니다. 텍스트뿐 아니라 이미지·영상·음성 모델에도 널리 쓰입니다.
알아 둘 점
모든 토큰 쌍을 비교하므로 입력이 길어질수록 계산량과 메모리가 빠르게 늘어납니다. 이 문제 때문에 컨텍스트 윈도를 늘리기가 어렵고, 이미 계산한 Key·Value를 저장해 두는 KV 캐시 같은 최적화 기법이 생겼습니다. 어텐션 점수가 높다고 해서 모델이 '왜' 그렇게 판단했는지 그대로 설명해 주는 것은 아니라는 점도 알아 두세요. 계산을 줄인 변형 어텐션이나 상태 공간 모델 같은 대안도 연구되고 있습니다.
예시
LLM을 서비스로 돌리는 추론 엔진은 어텐션 계산을 얼마나 효율적으로 처리하느냐가 속도를 크게 좌우합니다. 이 사이트에 소개된 'vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중' 같은 소식도, 결국 어텐션과 KV 캐시를 메모리 안에서 더 잘 관리해 응답을 빠르게 만드는 작업과 맞닿아 있습니다.
이 사이트에서 나온 사례
- 브리핑 vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중 2026-10-07
- 논문 Kandinsky 6.0 Video: 영상과 오디오를 동기화해 생성하는 파운데이션 모델 2026-10-07