← AI 용어집

AI 용어집 · 기초 · 언어 모델

경사 하강법 Gradient Descent

경사 하강법(Gradient Descent)은 AI 모델이 틀린 정도(손실)를 줄이는 쪽으로 파라미터를 조금씩 고쳐 가며 학습하는 방법이다. 오늘날 딥러닝 모델 대부분이 이 방식이나 이를 바꾼 방식으로 학습한다.

쉽게 말하면 짙은 안개 속에서 산을 내려갈 때 발밑의 경사만 느끼고 가장 가파르게 내려가는 쪽으로 한 걸음씩 옮기는 것과 비슷하다. 다만 실제 모델의 '지형'은 수백만~수십억 개 방향이 있는 공간이라 사람이 떠올리는 산보다 훨씬 복잡하다.

어떻게 작동하나

먼저 모델이 현재 파라미터로 예측을 하고, 손실 함수로 예측이 정답과 얼마나 다른지 계산한다. 그다음 각 파라미터를 조금 바꾸면 손실이 어느 쪽으로 얼마나 변하는지, 즉 기울기를 구한다. 신경망에서는 이 기울기를 역전파로 효율적으로 계산한다. 기울기의 반대 방향, 곧 손실이 줄어드는 쪽으로 파라미터를 조금 고친다. 이 과정을 손실이 충분히 작아질 때까지 수없이 반복한다.

경사 하강법의 반복 고리파라미터 → 예측하기; 예측하기 → 손실 계산; 손실 계산 → 기울기 구하기; 기울기 구하기 → 파라미터 조금 수정; 파라미터 조금 수정 → 파라미터(반복)파라미터모델의 숫자들예측하기손실 계산정답과의 차이기울기 구하기역전파로 계산파라미터 조금 수정학습률만큼 이동반복
경사 하강법의 반복 고리 왼쪽에서 오른쪽으로 예측→손실 계산→기울기 계산을 거친 뒤, 파라미터를 고쳐 다시 처음으로 돌아가는 과정을 반복한다.

왜 중요한가

경사 하강법은 거대한 신경망을 실제로 학습시킬 수 있게 해 주는 핵심 도구다. 사람이 규칙을 하나하나 정하지 않아도, 데이터와 손실 함수만 있으면 모델이 스스로 파라미터를 맞춰 간다. LLM의 사전 학습과 파인튜닝도 결국 이 원리 위에서 돌아간다. 그래서 딥러닝을 이해하려면 가장 먼저 알아야 할 개념 중 하나로 꼽힌다.

알아 둘 점

한 번에 얼마나 크게 움직일지를 정하는 값을 학습률이라고 한다. 학습률이 너무 크면 최저점을 지나쳐 학습이 불안정해지고, 너무 작으면 학습이 지나치게 느려진다. 실제로는 전체 데이터 대신 작은 묶음(미니배치)으로 기울기를 구하는 확률적 경사 하강법(SGD)과, 이를 개선한 Adam 같은 방식을 주로 쓴다. 또 손실이 가장 낮은 지점을 반드시 찾는다는 보장은 없고, 충분히 좋은 지점에서 멈추는 경우가 많다.

예시

챗봇에 쓰이는 LLM을 학습시킬 때, 모델은 문장의 다음 토큰을 예측하고 실제 다음 토큰과 비교해 손실을 계산한다. 그 손실을 줄이는 방향으로 파라미터를 고치는 일을 엄청난 양의 텍스트에 대해 반복하는데, 이 '고치는 방법'이 바로 경사 하강법 계열의 최적화 알고리즘이다. 회사가 자기 데이터로 모델을 파인튜닝할 때도 같은 원리가 쓰인다.

함께 보면 좋은 용어