AI 용어집 · 입문 · 강화학습
강화학습 Reinforcement learning
강화학습은 AI가 정답을 미리 배우는 대신, 스스로 행동해 보고 그 결과로 받은 보상(점수)을 바탕으로 더 좋은 행동을 찾아가도록 학습하는 방식이다.
어떻게 작동하나
학습하는 쪽을 에이전트, 에이전트가 상대하는 세계를 환경이라고 부릅니다. 에이전트는 지금 상태를 보고 행동을 고르고, 환경은 그 결과로 바뀐 상태와 보상을 돌려줍니다. 에이전트는 보상이 높았던 행동은 더 자주, 낮았던 행동은 덜 하도록 자신의 행동 규칙(정책)을 갱신합니다. 이 고리를 수없이 반복하면서 점점 더 높은 보상을 얻는 방법을 익힙니다. 한 번의 시도에서 나온 상태·행동·보상의 기록을 Trajectory라고 하고, 모델이 직접 이런 시도를 만들어 보는 과정을 Rollout이라고 부릅니다.
왜 중요한가
정답 데이터를 일일이 만들기 어려운 문제에서도 '무엇이 좋은 결과인지'만 정할 수 있으면 학습이 가능합니다. 게임, 로봇 제어처럼 여러 단계를 거쳐야 하는 문제에서 오래 쓰여 왔습니다. 최근에는 LLM의 사후 학습에 널리 쓰여, 사람이 선호하는 답을 하게 만들거나(RLHF) 수학·코딩 문제를 더 잘 풀게 만드는 데(RLVR) 핵심 역할을 합니다. 추론 모델이나 AI 에이전트의 능력을 끌어올리는 주요 수단이기도 합니다.
알아 둘 점
보상을 어떻게 설계하느냐에 따라 결과가 크게 달라집니다. 보상 기준에 허점이 있으면 AI가 진짜 목표 대신 점수만 올리는 꼼수를 찾는 보상 해킹이 일어날 수 있습니다. 또 수많은 시도를 직접 생성해야 해서 계산 비용이 크고, 학습이 불안정해지기 쉽습니다. 그래서 실제로는 먼저 지도 학습(SFT)으로 기본기를 갖춘 뒤 강화학습을 더하는 경우가 많습니다.
예시
이 사이트에 소개된 Microsoft Research의 'Agent Lightning v1.0'은 이미 만들어 둔 AI 에이전트를 크게 고치지 않고 그대로 강화학습할 수 있게 해 주는 경량 프레임워크로 소개됐습니다. 에이전트가 실제 작업을 수행한 기록을 학습 신호로 삼아, 작업을 더 잘 해내도록 다듬는 데 강화학습을 쓰는 사례입니다. 이 밖에도 챗봇이 더 도움이 되는 답을 하도록 다듬거나, 코딩 에이전트가 테스트를 통과하는 코드를 쓰도록 훈련할 때 강화학습이 쓰입니다.