AI 용어집 · 심화 · 효율·인프라
양자화 Quantization
양자화(Quantization)는 AI 모델 안의 숫자(파라미터 등)를 더 적은 비트로 표현해, 모델을 작고 빠르게 만드는 기법입니다. 정밀도를 조금 낮추는 대신 메모리와 계산 비용을 크게 줄입니다.
어떻게 작동하나
모델의 파라미터는 원래 소수점 숫자를 정밀하게 담는 16비트나 32비트 형식으로 저장되는 경우가 많습니다. 양자화는 이 숫자들을 8비트, 4비트처럼 더 짧은 형식으로 바꿔, 표현할 수 있는 값의 칸 수를 줄입니다. 원래 값은 가장 가까운 칸으로 반올림되고, 칸 간격을 정하는 기준값(스케일)을 함께 저장해 나중에 원래 크기를 대략 되살립니다. 학습이 끝난 모델을 그대로 바꾸는 방식(PTQ)과, 학습 중에 양자화를 미리 반영해 오차에 익숙해지게 하는 방식(QAT, 양자화 인식 학습)이 있습니다.
왜 중요한가
LLM은 파라미터가 매우 많아 그대로 돌리려면 비싼 GPU와 큰 메모리가 필요합니다. 양자화를 하면 같은 모델을 더 적은 메모리로 올릴 수 있어, 한 장비에서 더 큰 모델을 돌리거나 더 많은 사용자를 동시에 처리할 수 있습니다. 노트북이나 스마트폰에서 AI를 돌리는 온디바이스 AI에서도 거의 필수입니다. 오픈웨이트 모델이 공개되면 양자화 버전이 함께 배포되는 일이 흔합니다.
알아 둘 점
비트를 너무 줄이면 답변 품질이 떨어지거나 특정 작업에서 실수가 늘 수 있습니다. 모델 안의 일부 값이 유난히 크면 반올림 오차가 커지기 때문에, 이런 값을 따로 다루는 다양한 기법이 쓰입니다. 같은 비트 수라도 방법에 따라 품질 차이가 나므로, 양자화된 모델은 원래 모델과 별도로 평가해 보는 것이 좋습니다. 하드웨어가 해당 숫자 형식을 지원해야 실제 속도 이득을 볼 수 있다는 점도 기억해 두세요.
예시
오픈웨이트 LLM을 개인 PC에서 돌리는 사용자들은 흔히 4비트나 8비트로 양자화된 버전을 내려받아 씁니다. 연구 쪽에서는 학습 단계까지 양자화를 넓히려는 시도도 있습니다. 이 사이트에 소개된 논문 'TRACE: MoE 언어 모델의 FP4 강화학습을 위한 Rollout 기반 QAT(양자화 인식 학습)'는 MoE 모델을 강화학습할 때 4비트 숫자 형식(FP4)을 쓰면서도 학습이 잘 되도록 QAT를 적용하는 방법을 다룹니다.
이 사이트에서 나온 사례
- 논문 TRACE: MoE 언어 모델의 FP4 강화학습을 위한 Rollout 기반 QAT(양자화 인식 학습) 2026-10-08