← 연구

논문 리뷰 · 2026년 10월 8일

TRACE: MoE 언어 모델의 FP4 강화학습을 위한 롤아웃 유도 양자화 인식 학습

TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

효율·인프라강화학습언어 모델 고급 추천 65 cs.LG

롤아웃 쪽 FP4 반올림 결과로 학습 쪽 반올림을 유도해 학습-롤아웃 불일치를 줄였고, MoE 모델 RL에서 BF16 수준 성능으로 최대 5.4배 롤아웃 가속을 얻었다.

문제

LLM 강화학습에서는 롤아웃 생성 비용이 크다. FP4 저정밀 롤아웃은 매력적이지만, 학습 경로와 롤아웃 경로 사이에 수치 불일치가 커져 정책 불일치와 학습 붕괴를 일으킨다. MoE에서는 이 차이가 전문가 라우팅까지 바꿀 수 있다. 기존 방법은 경로별 양자화 오차를 각각 줄일 뿐, 두 양자화 경로 사이의 차이를 직접 줄이지는 않는다.

방법

(1) 롤아웃 유도 QAT: 롤아웃 중 라우팅 전문가의 활성값과 KV 캐시의 FP4 양자화 결과를 기록한다. 학습 단계에서는 인접한 두 FP4 코드워드 가운데 롤아웃 코드워드에 더 가까운 쪽으로 반올림한다. 일반 RTN 반올림 대비, 각 지점에서 국소 불일치가 늘지 않음이 보장된다. (2) 효율적 캐싱: 불일치는 대부분 인접 코드워드 한 칸 차이이고 보정은 깊은 층에 집중된다. 그래서 후반부 층의 가수(mantissa)와 스케일 정보만 저장·전송한다. 실험은 VeRL·Megatron·SGLang 환경에서 GRPO와 R3 라우팅 재생을 써서 했다.

결과

한계

보장은 지점별 국소 불일치에 한정되며, 네트워크 전체나 정책 수준의 차이가 단조롭게 준다는 뜻은 아니라고 저자들이 밝혔다. 비동기 학습의 정책 staleness로 생기는 활성값 차이 자체는 없애지 못한다. 양자화 대상은 라우팅 전문가와 KV 캐시뿐이고 나머지 모듈은 BF16으로 유지했다. 평가 모델이 모두 Qwen 계열 MoE이고, 대형 두 모델은 50스텝만 학습했다.

의미

대규모 MoE의 RL 후학습에서 가장 비싼 롤아웃 단계를 FP4로 돌리면서도 학습 안정성을 지키는 방법을 제시한다. 핵심은 '양자화 오차 최소화'가 아니라 '두 경로의 일치'를 목표로 삼아야 한다는 관점이다.

핵심 용어

학습-롤아웃 불일치(Train-Rollout Mismatch)
RL에서 응답을 생성하는 추론 엔진과 그래디언트를 계산하는 학습 엔진이 같은 입력에 서로 다른 확률을 내는 현상이다. 정책 불일치와 학습 불안정을 일으킨다.
양자화 인식 학습(QAT)
순전파에서 저정밀 양자화를 흉내 내며 학습해, 모델이 양자화 오차에 적응하도록 하는 기법이다.
NVFP4 / FP4 E2M1
지수 2비트, 가수 1비트로 이루어진 4비트 부동소수점 형식이다. 블록 스케일과 함께 쓰며 표현 가능한 값이 매우 적다.
Round-to-Nearest(RTN)
값을 가장 가까운 양자화 코드워드로 반올림하는 표준 방식이다. 경계 근처의 작은 차이가 큰 차이로 증폭될 수 있다.

원문

저자: Xin Wang, Hao Yu, Zhengyang Zhuge, Bochao Mao, Zheng Li, Junda Feng, Yuyan Luo, Yi Zhang, 외 · 게시 2026-10-06 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.