← AI 용어집

AI 용어집 · 심화 · 강화학습 · 안전·정렬

RLHF 인간 피드백 강화학습

RLHF(인간 피드백 강화학습)는 사람이 AI의 여러 답변 중 어느 쪽이 더 나은지 고른 판단을 모아, 모델이 사람이 선호하는 방향으로 답하도록 강화학습으로 다듬는 방법이다.

쉽게 말하면 요리사가 손님 평가표를 보고 레시피를 고치는 것과 비슷하다. 손님이 모든 접시를 직접 맛볼 수는 없으니, 손님 입맛을 흉내 내는 ‘평가 담당’을 따로 두고 그 점수에 맞춰 연습하는 셈이다. 다만 평가 담당이 손님 입맛을 완벽히 따라 하지는 못한다는 한계가 있다.

어떻게 작동하나

먼저 사전학습을 마친 모델에게 사람이 쓴 모범 답안을 보여 주며 SFT(지도 파인튜닝)로 기본적인 대화 방식을 익힌다. 다음으로 모델이 같은 질문에 여러 답변을 내면, 사람이 어느 답이 더 나은지 순위를 매긴다. 이 비교 데이터로 ‘사람이라면 어떤 답을 좋아할지’ 점수를 매기는 보상 모델을 따로 학습한다. 마지막으로 모델이 답변을 생성하고, 보상 모델이 점수를 주고, 점수가 높아지는 쪽으로 모델을 고치는 강화학습을 반복한다.

RLHF의 세 단계사전학습 모델 → SFT; SFT → 사람이 답변 비교(답변들); 사람이 답변 비교 → 보상 모델(학습); SFT → 답변 생성(출발점); 답변 생성 → 보상 점수; 보상 모델 → 보상 점수(채점); 보상 점수 → 모델 업데이트; 모델 업데이트 → 답변 생성(반복)① 준비 · 보상 모델 만들기② 강화학습사전학습 모델SFT모범 답안으로 학습사람이 답변 비교어느 답이 더 나은지 순위보상 모델답변 생성보상 점수모델 업데이트점수가 높아지는 쪽으로답변들학습출발점채점반복
RLHF의 세 단계 윗줄은 준비 단계로, SFT 모델의 답변을 사람이 비교해 보상 모델을 만든다. 아래는 강화학습 단계로, 답변 생성·보상 채점·모델 업데이트를 반복한다.

왜 중요한가

사전학습만 한 언어 모델은 문장을 그럴듯하게 이어 쓸 뿐, 질문에 도움이 되게 답하거나 위험한 요청을 거절하는 법은 잘 모른다. RLHF는 ‘좋은 답’이 무엇인지 사람의 판단을 모델에 반영하는 방법이라, 대화형 AI를 쓸 만하게 만든 핵심 기법으로 꼽힌다. ChatGPT 같은 대화형 서비스가 이 방식을 활용한 것으로 널리 알려져 있다. AI를 사람의 의도와 가치에 맞추는 정렬 연구에서도 중요한 출발점이다.

알아 둘 점

사람의 평가를 많이 모아야 해서 비용과 시간이 많이 든다. 보상 모델은 사람 판단을 흉내 낸 것일 뿐이라, 모델이 보상 모델의 허점을 파고들어 점수만 높이는 보상 해킹이 생길 수 있다. 평가자가 자신 있고 듣기 좋은 답을 선호하면 모델이 사용자 말에 무조건 맞장구치는 아첨 경향이 생긴다는 지적도 있다. 그래서 보상 모델 없이 선호 데이터로 바로 학습하는 DPO, 정답을 자동으로 확인할 수 있는 문제로 보상을 주는 RLVR 같은 대안도 함께 쓰인다.

예시

대화형 AI 서비스에서 답변 옆에 있는 ‘좋아요/싫어요’ 버튼이나 두 답변 중 더 나은 쪽을 고르게 하는 화면은 이런 사람 선호 데이터를 모으는 방식과 닮았다. 모델 개발사는 전문 평가자가 매긴 답변 비교 데이터로 보상 모델을 만들고, 이를 이용해 모델이 더 도움이 되고 덜 해로운 답을 하도록 사후 학습 단계에서 다듬는다.

함께 보면 좋은 용어