← AI 용어집

AI 용어집 · 입문 · 강화학습

강화학습 Reinforcement learning

강화학습은 AI가 정답을 미리 배우는 대신, 스스로 행동해 보고 그 결과로 받은 보상(점수)을 바탕으로 더 좋은 행동을 찾아가도록 학습하는 방식이다.

쉽게 말하면 강아지에게 '앉아'를 가르칠 때 정답을 설명하지 않고, 앉으면 간식을 주고 아니면 주지 않는 식으로 반복하는 것과 비슷합니다. 다만 AI는 간식처럼 단순한 신호만으로 매우 긴 행동의 연쇄를 배워야 해서, 현실의 훈련보다 훨씬 많은 시행착오가 필요합니다.

어떻게 작동하나

학습하는 쪽을 에이전트, 에이전트가 상대하는 세계를 환경이라고 부릅니다. 에이전트는 지금 상태를 보고 행동을 고르고, 환경은 그 결과로 바뀐 상태와 보상을 돌려줍니다. 에이전트는 보상이 높았던 행동은 더 자주, 낮았던 행동은 덜 하도록 자신의 행동 규칙(정책)을 갱신합니다. 이 고리를 수없이 반복하면서 점점 더 높은 보상을 얻는 방법을 익힙니다. 한 번의 시도에서 나온 상태·행동·보상의 기록을 Trajectory라고 하고, 모델이 직접 이런 시도를 만들어 보는 과정을 Rollout이라고 부릅니다.

강화학습의 기본 고리에이전트 → 행동(선택); 행동 → 환경; 환경 → 상태와 보상(반응); 상태와 보상 → 정책 갱신; 정책 갱신 → 에이전트(반복)에이전트정책에 따라 판단행동환경게임·문제·도구 등상태와 보상결과·점수정책 갱신보상 높은 행동을 강화선택반응반복
강화학습의 기본 고리 에이전트가 행동하면 환경이 새 상태와 보상을 돌려주고, 에이전트는 이를 바탕으로 정책을 갱신해 다시 행동합니다. 이 고리가 계속 반복됩니다.

왜 중요한가

정답 데이터를 일일이 만들기 어려운 문제에서도 '무엇이 좋은 결과인지'만 정할 수 있으면 학습이 가능합니다. 게임, 로봇 제어처럼 여러 단계를 거쳐야 하는 문제에서 오래 쓰여 왔습니다. 최근에는 LLM의 사후 학습에 널리 쓰여, 사람이 선호하는 답을 하게 만들거나(RLHF) 수학·코딩 문제를 더 잘 풀게 만드는 데(RLVR) 핵심 역할을 합니다. 추론 모델이나 AI 에이전트의 능력을 끌어올리는 주요 수단이기도 합니다.

알아 둘 점

보상을 어떻게 설계하느냐에 따라 결과가 크게 달라집니다. 보상 기준에 허점이 있으면 AI가 진짜 목표 대신 점수만 올리는 꼼수를 찾는 보상 해킹이 일어날 수 있습니다. 또 수많은 시도를 직접 생성해야 해서 계산 비용이 크고, 학습이 불안정해지기 쉽습니다. 그래서 실제로는 먼저 지도 학습(SFT)으로 기본기를 갖춘 뒤 강화학습을 더하는 경우가 많습니다.

예시

이 사이트에 소개된 Microsoft Research의 'Agent Lightning v1.0'은 이미 만들어 둔 AI 에이전트를 크게 고치지 않고 그대로 강화학습할 수 있게 해 주는 경량 프레임워크로 소개됐습니다. 에이전트가 실제 작업을 수행한 기록을 학습 신호로 삼아, 작업을 더 잘 해내도록 다듬는 데 강화학습을 쓰는 사례입니다. 이 밖에도 챗봇이 더 도움이 되는 답을 하도록 다듬거나, 코딩 에이전트가 테스트를 통과하는 코드를 쓰도록 훈련할 때 강화학습이 쓰입니다.

이 사이트에서 나온 사례

함께 보면 좋은 용어