← AI 용어집

AI 용어집 · 심화 · 언어 모델 · 효율·인프라

상태 공간 모델 State space model, SSM

상태 공간 모델(SSM)은 글이나 소리 같은 긴 순서 데이터를 앞에서부터 하나씩 읽으며, 지금까지 본 내용을 크기가 정해진 '상태'라는 요약에 계속 덮어써 가며 처리하는 AI 모델 구조입니다. 트랜스포머를 대신하거나 보완하는 방식으로 주목받고 있습니다.

쉽게 말하면 긴 회의를 들으며 녹취록 전체를 보관하는 대신, 메모장 한 장에 핵심만 계속 고쳐 적는 것과 비슷합니다. 메모장이 한 장뿐이라 아주 오래전에 나온 세부 내용은 흐려질 수 있다는 점이 이 비유의 한계이자 SSM의 실제 약점이기도 합니다.

어떻게 작동하나

SSM은 입력 토큰(글을 잘게 나눈 조각)을 하나씩 받을 때마다 내부 '상태'를 고칩니다. 상태는 지금까지 읽은 내용을 압축한 요약이고, 크기가 늘 같습니다. 모델은 새 토큰과 이전 상태를 함께 보고 상태를 갱신한 뒤, 그 상태를 바탕으로 출력을 냅니다. 트랜스포머의 어텐션은 새 토큰마다 지난 토큰 전부를 다시 살펴보지만, SSM은 요약본 하나만 보면 되므로 글이 길어져도 계산량이 크게 늘지 않습니다. Mamba 같은 최근 SSM은 입력 내용에 따라 무엇을 남기고 무엇을 잊을지 고르는 방식(선택적 SSM)을 써서 성능을 끌어올렸습니다.

SSM이 토큰을 처리하는 고리현재 토큰 → 상태 갱신; 상태 갱신 → 고정 크기 상태; 고정 크기 상태 → 출력; 고정 크기 상태 → 상태 갱신(다음 토큰에)현재 토큰상태 갱신남길 것·잊을 것 고르기고정 크기 상태지금까지의 요약출력트랜스포머와 차이어텐션은 지난 토큰 전부를다시 살펴봄다음 토큰에
SSM이 토큰을 처리하는 고리 토큰이 들어올 때마다 고정 크기 상태를 고치고, 그 상태로 출력을 냅니다. 갱신된 상태는 다음 토큰을 처리할 때 다시 쓰입니다.

왜 중요한가

트랜스포머는 입력이 길어질수록 계산량과 메모리(KV 캐시 등)가 빠르게 늘어나 아주 긴 문서·음성·유전체 데이터를 다루기가 부담스럽습니다. SSM은 입력 길이에 비례하는 정도로만 비용이 늘어 긴 데이터를 다루는 데 유리합니다. 답을 생성할 때도 고정 크기 상태만 들고 다니면 되므로 추론(인퍼런스)이 빠르고 메모리를 적게 씁니다. 그래서 긴 컨텍스트와 효율이 중요한 서비스, 온디바이스 AI 쪽에서 관심이 큽니다.

알아 둘 점

모든 정보를 작은 상태 하나에 눌러 담기 때문에, 긴 글 속 특정 문장을 정확히 그대로 찾아 베껴 오는 일에는 어텐션보다 약하다는 평가가 많습니다. 그래서 요즘은 SSM 층과 어텐션 층을 섞은 '하이브리드' 구조가 자주 쓰입니다. 이름의 '상태 공간'은 원래 제어공학에서 시스템을 설명하던 수학 틀에서 왔지만, 사용자 입장에서는 '요약을 들고 다니는 순차 모델'로 이해해도 충분합니다. 아이디어 자체는 RNN과 닮았지만 학습을 병렬로 빠르게 할 수 있도록 설계됐다는 점이 다릅니다.

예시

Mamba는 대표적인 SSM 기반 언어 모델 구조로, 이후 여러 연구와 오픈웨이트 모델에서 트랜스포머 대안으로 실험되고 있습니다. 실제 제품 쪽에서는 SSM 층과 어텐션 층을 번갈아 쌓은 하이브리드 LLM이 나와, 긴 문서를 넣어도 메모리를 덜 쓰고 빠르게 답하는 것을 장점으로 내세우고 있습니다.

함께 보면 좋은 용어