논문 리뷰 · 2026년 10월 9일
어떤 Rollout이 그 행동을 가르쳤나? 온라인 강화학습에서 학습 데이터 귀속의 한계를 검증하는 BehaviorTrace
Which Rollout Taught It That? BehaviorTrace and the Limits of Training-Data Attribution in Online RL
정답이 알려진 행동을 심어 GRPO 학습을 통제 실험한 결과, 기울기 기반 학습 데이터 귀속의 신호 상당 부분이 교란 요인에서 나온다는 것을 보였다.
문제
강화학습 파인튜닝은 의도하지 않은 행동을 가르칠 수 있다. 그 행동을 만든 학습 Rollout을 찾는 데는 Influence function, TracIn, TRAK 같은 기울기 기반 귀속 기법이 쓰인다. 하지만 이 기법들은 주로 정적·지도학습 환경에서 검증됐고, 온라인 강화학습에서도 실제로 행동의 원인을 짚어내는지는 거의 검증되지 않았다.
방법
Qwen2.5-1.5B-Instruct를 짧은 SFT 워밍업 후 GRPO로 1,000스텝 학습한다. 이때 'frobnitz' 프롬프트에 'QZXBT'를 출력하면 학습 초기에만 보너스 보상을 주는 방식으로 원인이 알려진 행동을 심는다. 전체 기울기를 CountSketch로 65,536차원에 압축해 행동 관련 파라미터가 빠지지 않게 하고, GAS(재정규화된 TracInCP), TRAK 방식 추정기, TracInCP 같은 기존 추정기를 평가한다. 대조군으로는 행동 타깃 없이 기울기 크기만 보는 norm-only, 유창성(평균 토큰 로그확률) 기준선, 시드 3개와 여러 생성 Draw 간 변동을 함께 둔다. 새 추정기는 제안하지 않고 평가 하네스와 체크리스트를 공개한다.
결과
- 스텝 단위 정밀도에서 행동 타깃이 없는 norm-only 대조군이 0.422/0.396/0.385(시드 0/1/2)로, 가장 좋은 타깃 추정기(GAS 0.404/0.383/0.421)와 비슷하거나 시드 2개에서 더 높았다. 저자들은 이 결과가 우연 수준의 4.2~4.5배에 해당한다고 보고했다.
- 학습이 일어난 구간 안으로 좁히면 random을 포함한 모든 방법이 각 시드의 우연 수준에서 약 0.03 이내였다. 스텝 단위로 달성할 수 있는 여유 폭도 약 0.11에 그쳤다. 저자들은 스텝 단위 귀속이 '어느 스텝이 학습됐는지'만 찾을 뿐 '어느 Rollout인지'는 찾지 못한다고 해석했다.
- 시드 2의 사전 등록 Draw(882쌍)에서 그룹 내 AUC는 유창성 기준선 0.724, norm-only 0.721, GAS 0.669 순이었다. 포화된 체크포인트에서는 유창성이 모든 기울기 방법과 같거나 더 나은 예측력을 보였다.
- 유창성을 통제한 뒤 GAS의 방향 AUC는 0.486/0.624/0.629(시드 0/1/2)로 시드마다 달랐다. 시드 1 체크포인트에서 새로 생성한 Draw는 0.526으로 판정이 뒤집혀, 실행 한 번으로는 결론을 내릴 수 없었다.
- 토큰 단위에서는 실제 응답 맥락에서 만든 타깃과 트리거 토큰 기울기의 코사인이 세 시드 모두 양수였다(+0.114~+0.295). 반면 인위적으로 만든 연속 타깃은 0 근처이거나 음수였다(시드 2에서 −0.111).
한계
모델은 Qwen2.5-1.5B 하나, 시드는 3개이며, 심은 행동도 단일 토큰 트리거 하나에 한정된다. 행동은 강화학습만으로 생긴 것이 아니라 SFT 워밍업으로 먼저 심은 연결을 강화학습이 키운 것이다. 정답 Rollout을 빼고 다시 학습하는 인과 검증은 본 실험이 아니라 오염이 학습 내내 적용된 유사 설정에서 수행됐다. Rollout 단위 분석은 원본 학습 Rollout이 아니라 저장된 체크포인트에서 새로 생성한 샘플로 했다. 유창성 매칭 쌍이 100쌍 이상인 경우는 시드 2뿐이었다.
의미
강화학습 중 생긴 원치 않는 행동의 원인 데이터를 추적하려는 실무자에게, 기존 귀속 기법이 내놓는 '그럴듯한' 결과가 기울기 크기나 유창성 같은 교란 요인일 수 있음을 경고한다. 기울기 크기 대조군, 유창성 통제, 여러 시드·Draw 반복 같은 검증 체크리스트와 공개 하네스를 제공한다. 토큰 단위 귀속이 더 유망하다는 방향도 제시한다.
핵심 용어
- 학습 데이터 귀속(Training-Data Attribution)
- 모델의 특정 출력이나 행동이 어떤 학습 샘플 때문에 생겼는지 추정하는 기법이다. 학습 샘플과 목표 행동의 기울기 유사도를 비교하는 TracIn, TRAK 등이 대표적이다.
- GRPO
- 같은 프롬프트로 여러 응답(그룹)을 생성하고, 그룹 안의 보상 평균·표준편차로 정규화한 Advantage로 정책을 업데이트하는 강화학습 기법이다. 그룹 안 보상에 편차가 없으면 업데이트에 기여하지 않는다.
- Norm-only 대조군
- 행동 타깃 없이 기울기 크기만으로 샘플 순위를 매기는 기준선이다. 이 대조군이 타깃 기반 추정기와 비슷한 성능을 내면, 추정기의 성능이 행동 방향이 아니라 기울기 크기에서 나왔을 가능성이 크다.
- CountSketch
- 고차원 벡터의 각 좌표를 해시로 버킷과 부호에 배정해 더하는 방식으로 압축하는 기법이다. 내적이 근사적으로 보존되고 모든 파라미터를 반영하므로, 일부 파라미터에만 있는 신호도 놓치지 않는다.
원문
저자: Amit Nautiyal · 게시 2026-10-07 · 라이선스 CC BY 4.0 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.