← AI 용어집

AI 용어집 · 심화 · 강화학습 · 언어 모델

RLVR 검증 가능한 보상 강화학습

RLVR(Reinforcement Learning with Verifiable Rewards, 검증 가능한 보상 강화학습)은 정답 대조나 테스트 실행처럼 맞고 틀림을 자동으로 확인할 수 있는 기준을 보상으로 삼아 AI 모델을 강화학습하는 방법이다.

쉽게 말하면 채점 기준이 분명한 수학 문제집으로 공부하는 것과 비슷합니다. 답안지와 맞춰 보기만 하면 되니 선생님의 주관적 평가 없이도 바로 점수를 받을 수 있습니다. 다만 답만 맞히면 풀이 과정이 엉성해도 점수를 받을 수 있다는 한계도 그대로 닮았습니다.

어떻게 작동하나

모델에게 수학 문제나 코딩 과제처럼 정답을 확인할 수 있는 문제를 주고, 여러 개의 답을 직접 생성하게 합니다(Rollout). 그다음 검증기가 최종 답을 정답과 비교하거나 코드를 테스트로 실행해 맞으면 높은 보상, 틀리면 낮은 보상을 줍니다. 모델은 높은 보상을 받은 답을 만들어 낸 방식이 더 자주 나오도록 갱신됩니다. 이 과정을 반복하면 모델이 스스로 더 나은 풀이 방법을 찾아가게 됩니다.

RLVR 학습 고리문제 → LLM; LLM → 여러 답 생성; 여러 답 생성 → 자동 검증; 자동 검증 → 보상; 보상 → 모델 갱신; 모델 갱신 → LLM(반복)문제수학·코딩 과제LLM여러 답 생성Rollout자동 검증정답 대조·테스트 실행보상맞음/틀림모델 갱신반복
RLVR 학습 고리 모델이 여러 답을 만들면 검증기가 자동으로 채점하고, 그 보상으로 모델을 갱신한 뒤 다시 답을 만드는 과정을 반복합니다.

왜 중요한가

사람의 선호를 학습한 보상 모델(RLHF 방식)은 만들기 비싸고, 모델이 그 보상 모델의 약점을 파고들기도 쉽습니다. RLVR은 규칙으로 정확히 채점하므로 이런 문제가 줄고, 대량의 문제로 자동 학습을 돌리기 쉽습니다. 수학·코딩처럼 여러 단계를 거쳐 생각해야 하는 문제에서 효과가 커서, 긴 CoT로 생각한 뒤 답하는 추론 모델을 만드는 핵심 기법으로 꼽힙니다.

알아 둘 점

정답을 자동으로 확인할 수 있는 분야에서만 바로 쓸 수 있습니다. 글쓰기나 상담처럼 좋은 답의 기준이 모호한 작업에는 적용하기 어렵습니다. 또 검증기에 허점이 있으면, 예를 들어 테스트가 부실하면 모델이 문제를 제대로 풀지 않고 테스트만 통과하는 보상 해킹이 생길 수 있습니다. 최종 답만 채점하는 경우 중간 추론이 올바른지는 따로 보장되지 않습니다.

예시

이 사이트에 소개된 논문 'TRACE: MoE 언어 모델의 FP4 강화학습을 위한 Rollout 기반 QAT(양자화 인식 학습)'처럼, 언어 모델을 강화학습할 때는 Rollout(모델이 답을 직접 생성하는 단계)에 드는 계산 비용이 큰 부담이라 이를 줄이려는 연구가 활발합니다. RLVR은 이런 Rollout을 대량으로 만들고 자동 채점하는 구조라 비용 문제가 특히 중요합니다. 실제 서비스에서는 수학 문제를 단계별로 풀어 주는 추론 모델이나, 테스트를 통과하는 코드를 작성하는 코딩 에이전트를 학습시키는 데 쓰입니다.

이 사이트에서 나온 사례

함께 보면 좋은 용어