← 연구

논문 리뷰 · 2026년 10월 8일

토크나이저가 다른 모델 간 온폴리시 증류 다시 보기: 정렬 범위보다 감독 신호의 신뢰성

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

언어 모델 고급 추천 153 cs.CL

토크나이저가 다른 교사·학생 모델 간 온폴리시 증류를 분석해, 정렬 범위를 넓히는 것보다 1:1로 정렬된 위치만 간결하게 감독하는 편이 더 효과적임을 보였다.

문제

온폴리시 증류(OPD)는 학생 모델이 직접 생성한 응답에 교사의 피드백을 주어 학습시킨다. 그런데 교사와 학생의 토크나이저가 다르면 토큰 경계와 어휘가 달라 예측을 비교하기 어렵다. 최근 연구들은 정렬되지 않는 구간까지 감독하도록 정렬 범위를 넓혀 왔다. 하지만 범위를 넓힌 만큼 학습이 실제로 좋아지는지는 검증되지 않았다.

방법

학생 응답을 두 토크나이저로 각각 나눈 뒤, 학생 토큰 하나와 교사 토큰 하나가 같은 구간을 덮는 '엄격 1:1 위치'에서만 비교한다. 이 위치에서 두 분포를 공유 어휘로 제한·재정규화하고 reverse KL을 적용한다(Strict 목적함수). 이 기준에 두 가지를 더해 실험했다. (1) 1:1로 맞지 않는 구간의 로그확률에 MSE 손실(span 감독)을 가중치 λ로 추가한다. (2) KL 계산 범위를 학생이 고른 공유 어휘 상위 k개로 줄인다. 실험은 수학·코드 과제에서 교사→학생 3쌍(Qwen→Llama, Granite→Phi, Granite→Qwen)으로 했다. 확률 질량 측정과 그래디언트 진단으로 결과를 해석했다.

결과

한계

교사→학생 3쌍과 수학·코드 두 영역(DAPO-Math, CodeForces 프롬프트 2만 개)에서만 실험했다. 정렬 안 된 구간의 감독 방식은 로그확률 MSE 하나만 시험했으므로, 다른 목적함수를 쓰면 결론이 달라질 수 있다. 그래디언트 진단에 대해서도 저자들은 정확도 하락을 '설명할 수 있다'는 정도로만 해석했고, 인과관계를 입증하지는 않았다.

의미

서로 다른 모델 계열 간 증류에서 '더 많은 위치를 감독할수록 좋다'는 가정에 반례를 제시한다. 실무에서는 1:1 정렬 위치와 학생 기준 top-k 어휘만 써도 계산을 줄이면서 성능을 유지할 수 있다는 근거가 된다.

핵심 용어

온폴리시 증류(On-Policy Distillation)
학생 모델이 직접 생성한 응답의 각 위치에서 교사 분포와 맞추도록 학습하는 증류 방식이다. 학생이 실제로 방문하는 상태에서 감독을 받는다.
Cross-Tokenizer 정렬
토크나이저가 다른 두 모델의 토큰 경계와 어휘를 대응시키는 과정이다. 시퀀스 수준(어느 토큰끼리 같은 구간인지)과 어휘 수준(어떤 어휘 항목이 공유되는지)을 모두 다룬다.
Reverse KL
학생 분포를 기준으로 교사 분포와의 차이를 재는 KL 발산이다. 학생이 교사가 낮게 평가하는 토큰에 확률을 두지 않도록 유도한다.
공유 어휘(Shared Vocabulary)
교사와 학생 어휘에 공통으로 존재하는 토큰 집합이다. 이 집합으로 두 분포를 제한·재정규화하면 직접 비교할 수 있다.

원문

저자: Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang · 게시 2026-10-06 · 라이선스 CC BY 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.