← AI 용어집

AI 용어집 · 기초 · 언어 모델

스케일링 법칙 Scaling law

스케일링 법칙은 AI 모델의 크기(파라미터 수), 학습 데이터 양, 학습에 쓰는 계산량을 늘릴수록 모델 성능이 꽤 예측 가능한 방식으로 좋아진다는 경험적 규칙입니다.

쉽게 말하면 공부 시간과 교재 양, 두뇌 용량을 함께 늘리면 시험 점수가 오르는 것과 비슷합니다. 다만 점수가 오르는 폭은 점점 줄어들고, 셋 중 하나만 늘려서는 효과가 금방 한계에 부딪힙니다. 사람의 공부와 달리 이 규칙은 실제 측정값을 바탕으로 한 관찰이라는 점에서 비유와 다릅니다.

어떻게 작동하나

연구자들은 크기가 다른 모델을 여러 개 학습시키고, 각 모델이 다음 단어를 얼마나 잘 맞히는지(손실 값) 측정합니다. 이 결과를 그래프로 그려 보면 모델 크기·데이터·계산량이 늘어날 때 오류가 꾸준히 줄어드는 매끄러운 곡선이 나타납니다. 이 곡선을 이용하면 아주 큰 모델을 실제로 학습시키기 전에 그 성능을 어느 정도 미리 짐작할 수 있습니다. 또 정해진 계산 예산 안에서 모델 크기와 데이터 양을 어떻게 나눌지 정하는 데에도 쓰입니다.

왜 중요한가

대형 모델 하나를 학습시키는 데는 막대한 비용과 시간이 듭니다. 스케일링 법칙은 이런 투자가 어느 정도의 성능 향상으로 이어질지 예측하는 근거가 되어, AI 기업들이 GPU와 데이터센터에 대규모로 투자하는 이유 중 하나가 되었습니다. 지금의 LLM이 빠르게 커져 온 흐름도 이 법칙에 대한 믿음과 깊이 연결되어 있습니다.

알아 둘 점

스케일링 법칙은 자연법칙이 아니라 관찰로 얻은 경향입니다. 규모를 키울수록 얻는 이득은 점점 줄어들고, 질 좋은 학습 데이터가 부족해지는 문제도 거론됩니다. 손실 값이 줄어드는 것이 곧 사람이 체감하는 능력 향상과 똑같다는 보장도 없습니다. 그래서 최근에는 사전 학습 규모를 키우는 것 외에도 사후 학습이나 테스트 타임 컴퓨트처럼 다른 방향으로 성능을 끌어올리는 방법에 관심이 커지고 있습니다.

예시

AI 기업들이 새 모델을 발표하면서 이전보다 더 많은 GPU와 더 많은 데이터로 학습했다고 강조하는 것은 스케일링 법칙을 전제로 한 전략입니다. 기업들은 본격적인 학습에 들어가기 전에 작은 모델 여러 개로 실험해 곡선을 그리고, 이를 바탕으로 최종 모델의 크기와 학습 데이터 양을 정합니다.

함께 보면 좋은 용어