← AI 용어집

AI 용어집 · 심화 · 언어 모델 · 효율·인프라

MoE 전문가 혼합

MoE(Mixture of Experts, 전문가 혼합)는 모델 안에 '전문가'라 부르는 작은 신경망을 여러 개 두고, 입력마다 그중 일부만 골라 계산하게 하는 구조입니다. 모델 전체는 크게 만들면서도 한 번에 쓰는 계산량은 줄일 수 있습니다.

쉽게 말하면 큰 종합병원에 진료과가 많아도, 환자 한 명은 접수처 안내를 받아 필요한 과 몇 곳만 들르는 것과 비슷합니다. 다만 실제 MoE의 '전문가'는 사람이 정한 분야(수학, 법률 등)로 깔끔하게 나뉘지 않고 학습 과정에서 저절로 역할이 갈립니다.

어떻게 작동하나

MoE 모델에는 라우터(Router)라는 작은 안내 장치와 여러 개의 전문가 네트워크가 있습니다. 토큰이 들어오면 라우터가 어느 전문가에게 보낼지 점수를 매기고, 점수가 높은 몇 개만 골라 계산합니다. 선택된 전문가들의 결과는 라우터 점수만큼 섞여 다음 단계로 넘어갑니다. 그래서 전체 파라미터 수는 매우 많아도, 토큰 하나를 처리할 때 실제로 쓰이는 파라미터(활성 파라미터)는 일부에 그칩니다.

MoE 층의 구조입력 토큰 → 라우터; 라우터 → 전문가 A(선택); 라우터 → 전문가 B(선택); 라우터 → 전문가 C; 전문가 A → 결과 합치기; 전문가 B → 결과 합치기입력 토큰라우터전문가 점수 매기기전문가 A전문가 B전문가 C이번엔 미선택결과 합치기점수만큼 섞기선택선택
MoE 층의 구조 라우터가 토큰마다 몇 명의 전문가만 골라 계산하게 합니다. 점선은 이번 토큰에서 선택되지 않은 전문가입니다(예시).

왜 중요한가

모델을 키우면 대체로 성능이 좋아지지만, 보통은 계산 비용도 함께 커집니다. MoE는 '아는 것'은 많이 담되 매번 전부 꺼내 쓰지는 않는 방식이라 성능 대비 비용을 낮출 수 있습니다. 이런 이유로 최근 공개되는 대형 LLM과 오픈웨이트 모델 중 MoE 구조를 택한 경우가 많습니다. 모델 소개에서 '전체 파라미터'와 '활성 파라미터'를 따로 적는 것도 이 때문입니다.

알아 둘 점

계산량은 줄어도 모든 전문가를 메모리에 올려 두어야 하므로 필요한 GPU 메모리는 여전히 큽니다. 라우터가 특정 전문가에게만 일을 몰아주면 학습이 불안정해질 수 있어, 일을 고르게 나누도록 하는 장치가 필요합니다. 여러 GPU에 전문가를 나눠 두면 장치 사이 통신이 병목이 되기도 합니다. 또 학습이나 양자화 같은 후처리가 일반 모델보다 까다로워 별도 연구가 이어지고 있습니다.

예시

클라우드 기업들은 MoE 구조의 대형 모델을 API로 제공해, 사용자가 큰 모델을 직접 띄우지 않고도 쓸 수 있게 합니다. 이 사이트에 소개된 'AWS, Amazon Bedrock에서 Z.ai의 753B MoE 모델 GLM 5.3 제공' 소식이 그런 사례로, 제목의 753B는 전체 파라미터 규모를 뜻하며 토큰마다 실제로 계산에 쓰이는 부분은 그보다 작습니다.

이 사이트에서 나온 사례

함께 보면 좋은 용어