← AI 용어집

AI 용어집 · 기초 · 언어 모델

손실 함수 Loss Function

손실 함수는 AI 모델의 예측이 정답과 얼마나 다른지를 하나의 숫자로 계산하는 규칙입니다. 학습은 이 숫자(손실)를 최대한 줄이는 방향으로 모델을 조금씩 고쳐 가는 과정입니다.

쉽게 말하면 다트 게임에서 화살이 과녁 중심에서 얼마나 떨어졌는지 재는 자와 같습니다. 거리가 멀수록 점수가 나쁘고, 선수는 그 거리를 줄이도록 자세를 고칩니다. 다만 무엇을 '멀다'고 볼지는 손실 함수를 어떻게 정하느냐에 달려 있습니다.

어떻게 작동하나

모델이 입력을 받아 예측을 내놓으면, 손실 함수가 그 예측과 정답을 비교해 오차 점수를 매깁니다. 집값처럼 숫자를 맞히는 문제에서는 예측과 정답의 차이를 제곱해 평균 내는 방식(평균제곱오차)을 흔히 씁니다. 고양이·개처럼 종류를 고르는 문제나 LLM이 다음 토큰을 맞히는 문제에서는 정답에 낮은 확률을 줄수록 크게 벌점을 주는 교차 엔트로피를 많이 씁니다. 이렇게 나온 손실 값을 바탕으로 역전파가 각 파라미터를 어느 방향으로 바꿔야 하는지 계산하고, 경사 하강법이 파라미터를 조금씩 수정합니다. 이 과정을 수없이 반복하며 손실이 줄어듭니다.

손실 함수가 이끄는 학습 고리학습 데이터 → 모델; 모델 → 예측; 예측 → 손실 함수; 정답 → 손실 함수; 손실 함수 → 파라미터 수정(손실 값); 파라미터 수정 → 모델(반복)학습 데이터입력모델현재 파라미터예측손실 함수예측 vs 정답정답파라미터 수정역전파·경사 하강법손실 값반복
손실 함수가 이끄는 학습 고리 예측과 정답을 비교해 손실을 구하고, 그 값을 줄이도록 파라미터를 고친 뒤 다시 예측하는 과정을 반복합니다.

왜 중요한가

손실 함수는 모델에게 '무엇을 잘하는 것인지'를 알려 주는 유일한 기준입니다. 모델은 사람의 의도를 직접 이해하지 못하고, 오직 이 숫자를 낮추는 방향으로만 바뀝니다. 그래서 같은 데이터와 모델이라도 손실 함수를 다르게 정하면 전혀 다른 성격의 모델이 만들어질 수 있습니다. 파인튜닝, RLHF, DPO 같은 기법도 결국 어떤 목표를 손실(또는 보상)로 표현할지에 대한 설계라고 볼 수 있습니다.

알아 둘 점

손실이 낮다고 항상 좋은 모델은 아닙니다. 학습 데이터에서만 손실이 아주 낮고 새 데이터에서는 높다면 과적합을 의심해야 합니다. 또 손실 함수가 실제로 원하는 목표를 정확히 담지 못하면, 모델이 숫자만 낮추는 엉뚱한 요령을 배우기도 합니다. 그래서 학습 중에는 따로 떼어 둔 검증 데이터의 손실과 실제 평가 결과를 함께 살펴봅니다.

예시

LLM의 사전 학습에서는 문장의 앞부분을 보여 주고 다음 토큰을 예측하게 한 뒤, 실제 다음 토큰에 얼마나 높은 확률을 줬는지를 교차 엔트로피 손실로 계산합니다. 모델 개발 팀은 학습 내내 이 손실 값이 내려가는 곡선을 지켜보며 학습이 제대로 되고 있는지 확인합니다.

함께 보면 좋은 용어