RLHF 인간 피드백 강화학습
RLHF(인간 피드백 강화학습)는 사람이 AI의 여러 답변 중 어느 쪽이 더 나은지 고른 판단을 모아, 모델이 사람이 선호하는 방향으로 답하도록 강화학습으로 다듬는 방법이다.
어떻게 작동하나
먼저 사전학습을 마친 모델에게 사람이 쓴 모범 답안을 보여 주며 SFT(지도 파인튜닝)로 기본적인 대화 방식을 익힌다. 다음으로 모델이 같은 질문에 여러 답변을 내면, 사람이 어느 답이 더 나은지 순위를 매긴다. 이 비교 데이터로 ‘사람이라면 어떤 답을 좋아할지’ 점수를 매기는 보상 모델을 따로 학습한다. 마지막으로 모델이 답변을 생성하고, 보상 모델이 점수를 주고, 점수가 높아지는 쪽으로 모델을 고치는 강화학습을 반복한다.
왜 중요한가
사전학습만 한 언어 모델은 문장을 그럴듯하게 이어 쓸 뿐, 질문에 도움이 되게 답하거나 위험한 요청을 거절하는 법은 잘 모른다. RLHF는 ‘좋은 답’이 무엇인지 사람의 판단을 모델에 반영하는 방법이라, 대화형 AI를 쓸 만하게 만든 핵심 기법으로 꼽힌다. ChatGPT 같은 대화형 서비스가 이 방식을 활용한 것으로 널리 알려져 있다. AI를 사람의 의도와 가치에 맞추는 정렬 연구에서도 중요한 출발점이다.
알아 둘 점
사람의 평가를 많이 모아야 해서 비용과 시간이 많이 든다. 보상 모델은 사람 판단을 흉내 낸 것일 뿐이라, 모델이 보상 모델의 허점을 파고들어 점수만 높이는 보상 해킹이 생길 수 있다. 평가자가 자신 있고 듣기 좋은 답을 선호하면 모델이 사용자 말에 무조건 맞장구치는 아첨 경향이 생긴다는 지적도 있다. 그래서 보상 모델 없이 선호 데이터로 바로 학습하는 DPO, 정답을 자동으로 확인할 수 있는 문제로 보상을 주는 RLVR 같은 대안도 함께 쓰인다.
예시
대화형 AI 서비스에서 답변 옆에 있는 ‘좋아요/싫어요’ 버튼이나 두 답변 중 더 나은 쪽을 고르게 하는 화면은 이런 사람 선호 데이터를 모으는 방식과 닮았다. 모델 개발사는 전문 평가자가 매긴 답변 비교 데이터로 보상 모델을 만들고, 이를 이용해 모델이 더 도움이 되고 덜 해로운 답을 하도록 사후 학습 단계에서 다듬는다.