← AI 용어집

AI 용어집 · 심화 · 언어 모델

어텐션 Attention

어텐션(Attention)은 AI 모델이 문장 같은 입력을 처리할 때, 지금 다루는 단어와 관련이 깊은 다른 단어에 더 큰 비중을 두고 정보를 모으는 방법입니다. 트랜스포머 구조의 핵심 부품입니다.

쉽게 말하면 긴 회의록에서 '그 안건'이라는 말을 보면, 앞부분에서 그 안건이 처음 나온 문장을 다시 찾아보는 것과 비슷합니다. 다만 사람은 몇 군데만 골라 보지만, 어텐션은 모든 단어를 동시에 훑고 관련된 정도를 숫자로 매깁니다.

어떻게 작동하나

입력은 먼저 토큰이라는 작은 조각으로 나뉘고, 토큰마다 의미를 담은 숫자 묶음(임베딩)으로 바뀝니다. 각 토큰은 '내가 찾는 정보'(Query)를 들고, 다른 토큰이 가진 '나는 이런 정보야'(Key)와 비교해서 얼마나 관련 있는지 점수를 냅니다. 점수가 높은 토큰의 내용(Value)을 더 많이 섞어서 새 Representation(모델 안에서 쓰는 내부 표현)을 만듭니다. 이 과정을 여러 관점에서 동시에 하는 것을 멀티헤드 어텐션이라고 부릅니다.

어텐션 한 번의 흐름입력 토큰들 → Query·Key·Value; Query·Key·Value → 관련도 점수; 관련도 점수 → 가중 합산(비중); 가중 합산 → 새 Representation입력 토큰들임베딩으로 변환Query·Key·Value토큰마다 세 가지 생성관련도 점수Query와 Key 비교가중 합산점수만큼 Value 섞기새 Representation비중
어텐션 한 번의 흐름 한 토큰이 다른 토큰들과 관련도를 비교하고, 관련이 큰 정보를 더 많이 섞어 새 표현을 만드는 과정입니다.

왜 중요한가

예전 방식(RNN)은 단어를 하나씩 순서대로 읽어서 멀리 떨어진 단어 사이의 관계를 놓치기 쉬웠습니다. 어텐션은 문장 안의 모든 위치를 한 번에 서로 비교할 수 있어서 긴 문맥을 더 잘 이해합니다. 계산을 병렬로 처리하기 좋아 GPU에서 빠르게 돌릴 수 있고, 이 덕분에 거대한 LLM을 학습시킬 수 있게 되었습니다. 텍스트뿐 아니라 이미지·영상·음성 모델에도 널리 쓰입니다.

알아 둘 점

모든 토큰 쌍을 비교하므로 입력이 길어질수록 계산량과 메모리가 빠르게 늘어납니다. 이 문제 때문에 컨텍스트 윈도를 늘리기가 어렵고, 이미 계산한 Key·Value를 저장해 두는 KV 캐시 같은 최적화 기법이 생겼습니다. 어텐션 점수가 높다고 해서 모델이 '왜' 그렇게 판단했는지 그대로 설명해 주는 것은 아니라는 점도 알아 두세요. 계산을 줄인 변형 어텐션이나 상태 공간 모델 같은 대안도 연구되고 있습니다.

예시

LLM을 서비스로 돌리는 추론 엔진은 어텐션 계산을 얼마나 효율적으로 처리하느냐가 속도를 크게 좌우합니다. 이 사이트에 소개된 'vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중' 같은 소식도, 결국 어텐션과 KV 캐시를 메모리 안에서 더 잘 관리해 응답을 빠르게 만드는 작업과 맞닿아 있습니다.

이 사이트에서 나온 사례

함께 보면 좋은 용어