← 연구

논문 리뷰 · 2026년 10월 9일

어떤 Rollout이 그 행동을 가르쳤나? 온라인 강화학습에서 학습 데이터 귀속의 한계를 검증하는 BehaviorTrace

Which Rollout Taught It That? BehaviorTrace and the Limits of Training-Data Attribution in Online RL

강화학습안전·정렬언어 모델 고급 cs.LG

정답이 알려진 행동을 심어 GRPO 학습을 통제 실험한 결과, 기울기 기반 학습 데이터 귀속의 신호 상당 부분이 교란 요인에서 나온다는 것을 보였다.

문제

강화학습 파인튜닝은 의도하지 않은 행동을 가르칠 수 있다. 그 행동을 만든 학습 Rollout을 찾는 데는 Influence function, TracIn, TRAK 같은 기울기 기반 귀속 기법이 쓰인다. 하지만 이 기법들은 주로 정적·지도학습 환경에서 검증됐고, 온라인 강화학습에서도 실제로 행동의 원인을 짚어내는지는 거의 검증되지 않았다.

방법

Qwen2.5-1.5B-Instruct를 짧은 SFT 워밍업 후 GRPO로 1,000스텝 학습한다. 이때 'frobnitz' 프롬프트에 'QZXBT'를 출력하면 학습 초기에만 보너스 보상을 주는 방식으로 원인이 알려진 행동을 심는다. 전체 기울기를 CountSketch로 65,536차원에 압축해 행동 관련 파라미터가 빠지지 않게 하고, GAS(재정규화된 TracInCP), TRAK 방식 추정기, TracInCP 같은 기존 추정기를 평가한다. 대조군으로는 행동 타깃 없이 기울기 크기만 보는 norm-only, 유창성(평균 토큰 로그확률) 기준선, 시드 3개와 여러 생성 Draw 간 변동을 함께 둔다. 새 추정기는 제안하지 않고 평가 하네스와 체크리스트를 공개한다.

결과

한계

모델은 Qwen2.5-1.5B 하나, 시드는 3개이며, 심은 행동도 단일 토큰 트리거 하나에 한정된다. 행동은 강화학습만으로 생긴 것이 아니라 SFT 워밍업으로 먼저 심은 연결을 강화학습이 키운 것이다. 정답 Rollout을 빼고 다시 학습하는 인과 검증은 본 실험이 아니라 오염이 학습 내내 적용된 유사 설정에서 수행됐다. Rollout 단위 분석은 원본 학습 Rollout이 아니라 저장된 체크포인트에서 새로 생성한 샘플로 했다. 유창성 매칭 쌍이 100쌍 이상인 경우는 시드 2뿐이었다.

의미

강화학습 중 생긴 원치 않는 행동의 원인 데이터를 추적하려는 실무자에게, 기존 귀속 기법이 내놓는 '그럴듯한' 결과가 기울기 크기나 유창성 같은 교란 요인일 수 있음을 경고한다. 기울기 크기 대조군, 유창성 통제, 여러 시드·Draw 반복 같은 검증 체크리스트와 공개 하네스를 제공한다. 토큰 단위 귀속이 더 유망하다는 방향도 제시한다.

핵심 용어

학습 데이터 귀속(Training-Data Attribution)
모델의 특정 출력이나 행동이 어떤 학습 샘플 때문에 생겼는지 추정하는 기법이다. 학습 샘플과 목표 행동의 기울기 유사도를 비교하는 TracIn, TRAK 등이 대표적이다.
GRPO
같은 프롬프트로 여러 응답(그룹)을 생성하고, 그룹 안의 보상 평균·표준편차로 정규화한 Advantage로 정책을 업데이트하는 강화학습 기법이다. 그룹 안 보상에 편차가 없으면 업데이트에 기여하지 않는다.
Norm-only 대조군
행동 타깃 없이 기울기 크기만으로 샘플 순위를 매기는 기준선이다. 이 대조군이 타깃 기반 추정기와 비슷한 성능을 내면, 추정기의 성능이 행동 방향이 아니라 기울기 크기에서 나왔을 가능성이 크다.
CountSketch
고차원 벡터의 각 좌표를 해시로 버킷과 부호에 배정해 더하는 방식으로 압축하는 기법이다. 내적이 근사적으로 보존되고 모든 파라미터를 반영하므로, 일부 파라미터에만 있는 신호도 놓치지 않는다.

원문

저자: Amit Nautiyal · 게시 2026-10-07 · 라이선스 CC BY 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.