← 2026년 10월 6일 브리핑

P1 연구 논문 arXiv

연구: 응답 시작 토큰 고정만으로 베이스 모델 추론 성능이 RL 모델 수준에 근접

발표 2026년 10월 5일

무슨 일인가

이 논문은 학습 데이터가 베이스 모델 응답의 시작 토큰과 그 뒤에 이어지는 추론 행동을 어떻게 연관 짓는지 분석한다. 특정 시작 토큰 큐를 고정하면 베이스 모델의 수학·코딩 성능이 RL 학습 모델과 견줄 만해졌다. 예를 들어 '.\n\nOkay' 큐는 Olmo-3-7B의 MATH-500 pass@1을 42%에서 78%로, 'Alright,' 큐는 Qwen3-14B를 72%에서 87%로 끌어올렸다. 또한 RL이 이런 큐의 출현 확률을 높이며, 큐를 고정하면 RL 성능 향상분의 상당 부분이 회복된다고 보고했다.

의미

RL의 추론 향상 효과 상당 부분이 베이스 모델에 이미 있는 행동을 끌어내는 데서 온다는 해석을 뒷받침한다. 사후 학습 효과를 평가하는 방식에 시사점이 있다.

출처

arXiv 관련 다른 소식