← AI 용어집

AI 용어집 · 기초 · 언어 모델

SFT 지도 미세조정

SFT(Supervised Fine-Tuning, 지도 미세조정)는 사전학습을 마친 언어 모델에 '지시문과 모범 답변' 짝으로 된 예시를 보여 주며, 원하는 방식으로 답하도록 추가로 학습시키는 것이다. 챗봇이 질문에 대화 형식으로 답하게 만드는 가장 기본적인 사후 학습 단계다.

쉽게 말하면 책을 많이 읽어 아는 것은 많지만 답하는 요령이 서툰 신입에게 선배가 쓴 모범 답안집을 보여 주며 "이렇게 답하라"고 가르치는 것과 비슷하다. 다만 모델은 답안의 뜻을 깊이 이해하기보다 형식과 패턴을 따라 배운다는 점에서 사람과 다르다.

어떻게 작동하나

먼저 사람이 직접 쓰거나 검수한 '지시문-정답' 예시를 모은다. 모델은 지시문을 입력받아 정답 문장을 토큰 하나씩 예측하고, 실제 정답과 다를수록 큰 오차(손실)를 받아 파라미터를 조금씩 고친다. 원리는 사전학습과 같지만, 학습 재료가 아무 글이 아니라 '정답이 정해진 예시'라는 점이 다르다. 이 과정을 반복하면 모델은 질문에 답하는 형식과 말투, 지시를 따르는 습관을 익힌다.

왜 중요한가

사전학습만 한 모델은 글을 이어 쓰는 데는 능하지만, 질문을 받으면 답 대신 비슷한 질문을 줄줄이 늘어놓기도 한다. SFT는 이런 모델을 사용자의 지시를 따르는 어시스턴트로 바꾸는 첫 단계다. 보통 SFT 뒤에 RLHF나 DPO 같은 선호 학습, 또는 강화학습을 더해 답변의 질을 다듬는다. 법률·의료·고객 상담처럼 특정 분야의 말투와 지식을 입힐 때도 가장 먼저 쓰는 방법이다.

SFT가 들어가는 학습 순서사전학습된 모델 → SFT; 지시문-정답 예시 → SFT(학습 재료); SFT → 지시를 따르는 모델; 지시를 따르는 모델 → 선호 학습·강화학습(선택)사전학습된 모델글 이어 쓰기에 능함지시문-정답 예시사람이 쓰거나 검수SFT정답을 따라 쓰도록 학습지시를 따르는 모델선호 학습·강화학습RLHF, DPO 등학습 재료선택
SFT가 들어가는 학습 순서 왼쪽에서 오른쪽으로 읽는다. 사전학습된 모델에 예시 데이터로 SFT를 하고, 필요하면 선호 학습·강화학습으로 더 다듬는다(점선은 선택 단계).

알아 둘 점

결과는 데이터 품질에 크게 좌우된다. 예시가 틀렸거나 편향되어 있으면 모델도 그대로 배운다. 모범 답안을 흉내 내는 방식이라 예시에 없던 상황에서는 그럴듯하지만 틀린 답, 곧 환각을 낼 수 있다. 좁은 데이터로 지나치게 학습하면 원래 갖고 있던 일반 능력이 떨어지기도 하며, 비용을 줄이려고 LoRA처럼 파라미터 일부만 고치는 방식과 함께 쓰는 경우가 많다.

예시

기업이 상담 기록을 '고객 질문-상담원 모범 답변' 형태로 정리한 뒤 공개된 오픈웨이트 모델에 SFT를 하면, 회사 말투와 응대 규칙을 따르는 상담 챗봇을 만들 수 있다. 이 사이트에 소개된 'T-Search: Qwen3.6-35B-A3B 기반 오픈웨이트 다단계 검색 에이전트 리트리버' 같은 연구에서도, 공개 모델을 바탕으로 특정 작업용 모델을 만드는 과정에서 SFT가 언급된다.

이 사이트에서 나온 사례

함께 보면 좋은 용어