사후 학습 Post-training
사후 학습은 사전 학습을 마친 모델을 사람이 쓰기 좋게 다듬는 단계예요. 지시를 따르고, 대화하고, 안전하게 답하고, 추론하는 법 등을 추가로 가르쳐요.
어떻게 작동하나
보통 여러 단계를 거쳐요. 먼저 SFT(지도 파인튜닝)로 질문과 모범 답안을 짝지은 데이터를 보여 주고 따라 하게 해요. 이어서 RLHF나 DPO처럼 사람이 더 좋다고 고른 답을 기준으로 모델의 답변 경향을 조정해요. 최근에는 수학 문제나 코드처럼 정답을 자동으로 확인할 수 있는 과제에서 보상을 주는 RLVR 같은 강화학습도 많이 써요.
왜 중요한가
사전 학습만 마친 모델은 지식은 많아도 질문에 엉뚱하게 이어 쓰거나 위험한 요청에도 그대로 답할 수 있어요. 사후 학습을 거치면 대화형 어시스턴트, 코딩 에이전트, 추론 모델처럼 실제로 쓸 수 있는 제품이 돼요. 사전 학습보다 비용이 적게 들어서 같은 기반 모델로도 사후 학습만 달리해 성격이 다른 모델을 만들 수 있어요. 그래서 요즘 모델 경쟁에서 사후 학습의 비중이 점점 커지고 있어요.
알아 둘 점
사후 학습은 새로운 지식을 많이 넣기보다 이미 가진 능력을 끌어내고 행동 방식을 바꾸는 쪽에 가까워요. 보상을 잘못 설계하면 모델이 보상만 챙기는 꼼수를 배우는 보상 해킹이나, 사용자 비위를 맞추는 아첨 같은 문제가 생길 수 있어요. 안전 규칙을 지키게 하는 정렬 작업도 주로 이 단계에서 이루어져요.
예시
같은 기반 모델이라도 사후 학습을 어떻게 했느냐에 따라 일반 채팅용 모델, 길게 생각하고 답하는 추론 모델, 코드를 고치는 코딩 에이전트용 모델로 나뉘어요. AI 회사들이 '사후 학습을 개선해 지시를 더 잘 따르게 했다'고 발표하는 경우가 많은 것도 이 때문이에요.