AI 용어집 · 기초 · 언어 모델
SFT 지도 미세조정
SFT(Supervised Fine-Tuning, 지도 미세조정)는 사전학습을 마친 언어 모델에 '지시문과 모범 답변' 짝으로 된 예시를 보여 주며, 원하는 방식으로 답하도록 추가로 학습시키는 것이다. 챗봇이 질문에 대화 형식으로 답하게 만드는 가장 기본적인 사후 학습 단계다.
어떻게 작동하나
먼저 사람이 직접 쓰거나 검수한 '지시문-정답' 예시를 모은다. 모델은 지시문을 입력받아 정답 문장을 토큰 하나씩 예측하고, 실제 정답과 다를수록 큰 오차(손실)를 받아 파라미터를 조금씩 고친다. 원리는 사전학습과 같지만, 학습 재료가 아무 글이 아니라 '정답이 정해진 예시'라는 점이 다르다. 이 과정을 반복하면 모델은 질문에 답하는 형식과 말투, 지시를 따르는 습관을 익힌다.
왜 중요한가
사전학습만 한 모델은 글을 이어 쓰는 데는 능하지만, 질문을 받으면 답 대신 비슷한 질문을 줄줄이 늘어놓기도 한다. SFT는 이런 모델을 사용자의 지시를 따르는 어시스턴트로 바꾸는 첫 단계다. 보통 SFT 뒤에 RLHF나 DPO 같은 선호 학습, 또는 강화학습을 더해 답변의 질을 다듬는다. 법률·의료·고객 상담처럼 특정 분야의 말투와 지식을 입힐 때도 가장 먼저 쓰는 방법이다.
알아 둘 점
결과는 데이터 품질에 크게 좌우된다. 예시가 틀렸거나 편향되어 있으면 모델도 그대로 배운다. 모범 답안을 흉내 내는 방식이라 예시에 없던 상황에서는 그럴듯하지만 틀린 답, 곧 환각을 낼 수 있다. 좁은 데이터로 지나치게 학습하면 원래 갖고 있던 일반 능력이 떨어지기도 하며, 비용을 줄이려고 LoRA처럼 파라미터 일부만 고치는 방식과 함께 쓰는 경우가 많다.
예시
기업이 상담 기록을 '고객 질문-상담원 모범 답변' 형태로 정리한 뒤 공개된 오픈웨이트 모델에 SFT를 하면, 회사 말투와 응대 규칙을 따르는 상담 챗봇을 만들 수 있다. 이 사이트에 소개된 'T-Search: Qwen3.6-35B-A3B 기반 오픈웨이트 다단계 검색 에이전트 리트리버' 같은 연구에서도, 공개 모델을 바탕으로 특정 작업용 모델을 만드는 과정에서 SFT가 언급된다.
이 사이트에서 나온 사례
- 논문 Kandinsky 6.0 Video: 영상과 오디오를 동기화해 생성하는 파운데이션 모델 2026-10-07
- 논문 ALoDLM: 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델 2026-10-07
- 브리핑 T-Search: Qwen3.6-35B-A3B 기반 오픈웨이트 다단계 검색 에이전트 리트리버 2026-10-06