MoE 전문가 혼합
MoE(Mixture of Experts, 전문가 혼합)는 모델 안에 '전문가'라 부르는 작은 신경망을 여러 개 두고, 입력마다 그중 일부만 골라 계산하게 하는 구조입니다. 모델 전체는 크게 만들면서도 한 번에 쓰는 계산량은 줄일 수 있습니다.
어떻게 작동하나
MoE 모델에는 라우터(Router)라는 작은 안내 장치와 여러 개의 전문가 네트워크가 있습니다. 토큰이 들어오면 라우터가 어느 전문가에게 보낼지 점수를 매기고, 점수가 높은 몇 개만 골라 계산합니다. 선택된 전문가들의 결과는 라우터 점수만큼 섞여 다음 단계로 넘어갑니다. 그래서 전체 파라미터 수는 매우 많아도, 토큰 하나를 처리할 때 실제로 쓰이는 파라미터(활성 파라미터)는 일부에 그칩니다.
왜 중요한가
모델을 키우면 대체로 성능이 좋아지지만, 보통은 계산 비용도 함께 커집니다. MoE는 '아는 것'은 많이 담되 매번 전부 꺼내 쓰지는 않는 방식이라 성능 대비 비용을 낮출 수 있습니다. 이런 이유로 최근 공개되는 대형 LLM과 오픈웨이트 모델 중 MoE 구조를 택한 경우가 많습니다. 모델 소개에서 '전체 파라미터'와 '활성 파라미터'를 따로 적는 것도 이 때문입니다.
알아 둘 점
계산량은 줄어도 모든 전문가를 메모리에 올려 두어야 하므로 필요한 GPU 메모리는 여전히 큽니다. 라우터가 특정 전문가에게만 일을 몰아주면 학습이 불안정해질 수 있어, 일을 고르게 나누도록 하는 장치가 필요합니다. 여러 GPU에 전문가를 나눠 두면 장치 사이 통신이 병목이 되기도 합니다. 또 학습이나 양자화 같은 후처리가 일반 모델보다 까다로워 별도 연구가 이어지고 있습니다.
예시
클라우드 기업들은 MoE 구조의 대형 모델을 API로 제공해, 사용자가 큰 모델을 직접 띄우지 않고도 쓸 수 있게 합니다. 이 사이트에 소개된 'AWS, Amazon Bedrock에서 Z.ai의 753B MoE 모델 GLM 5.3 제공' 소식이 그런 사례로, 제목의 753B는 전체 파라미터 규모를 뜻하며 토큰마다 실제로 계산에 쓰이는 부분은 그보다 작습니다.
이 사이트에서 나온 사례
- 논문 TRACE: MoE 언어 모델의 FP4 강화학습을 위한 Rollout 기반 QAT(양자화 인식 학습) 2026-10-08
- 브리핑 AWS, Amazon Bedrock에서 Z.ai의 753B MoE 모델 'GLM 5.3' 제공 2026-10-07