논문 리뷰 · 2026년 10월 9일
STEPQuant: Delta-rule 순환 상태 양자화에서 오차가 언제·어디서 중요한가
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
선형 어텐션 모델의 순환 상태를 오차 수명과 위치를 고려해 양자화하여, 6비트로 FP32 수준 정확도를 유지하면서 서빙 메모리를 최대 68.7% 줄였다.
문제
선형 어텐션은 KV 캐시 대신 고정 크기의 순환 상태(recurrent state)를 쓴다. 하지만 동시 요청마다 상태를 따로 유지해야 해서, 동시 요청이 많아지면 상태 메모리가 커진다. 저자들은 Qwen을 SGLang으로 서빙할 때 동시 요청이 70개가 되면 FP32 상태 풀이 BF16 가중치 메모리를 넘는다고 보고했다. 이 상태를 단순하게 균일 양자화하면 매 디코딩 단계마다 오차가 다음 상태로 전파된다. 그 결과 4·6비트에서 정확도가 크게 떨어지고, 8비트에서도 격차가 남는다.
방법
STEPQuant는 오차를 시간 축과 공간 축으로 나눠 다룬다. (1) Lifetime-aware Bit Allocation: 게이트 retention으로 각 상태 단위(Qwen은 헤드, KDA는 key row)의 메모리 수명을 추정한다. 그다음 '양자화 오차 × 수명 가중치'를 최소화하도록 비트를 혼합 배분한다. 가장 위험한 단위 일부는 FP16 pivot으로 남긴다. 이 배분은 오프라인 캘리브레이션에서 한 번 정하고 모든 요청에 고정해 쓴다. (2) Key-Row-Aware Dual-axis Fitting: 상태 행렬에서는 key row와 value column 양쪽에 이상치가 나타난다. 그래서 행 스케일과 열 스케일을 따로 둔다. 행 스케일에는 해당 행의 크기와, 그 행이 출력 오차에 미치는 영향 점수를 함께 반영한다. 열 스케일은 영향이 큰 행에 가중치를 더 준 재구성 오차를 최소화하도록 맞춘다. 마지막으로 상태 복원·Delta 업데이트·readout을 하나로 합친 GPU 커널을 SGLang에 통합했다.
결과
- Qwen3.8-27B의 7개 장문 생성 추론 벤치마크(BF16 가중치) 평균 정확도: FP32 상태 80.60, STEPQuant 6비트 80.59, 4비트 80.51. 균일 INT8은 71.86, INT6은 45.04, INT4는 12.73에 그쳤다.
- 저자들은 4비트 STEPQuant가 두 모델 모두에서 균일 INT8보다 높다고 보고했다. Qwen에서는 FP32에 거의 근접했고, Kimi-Linear-48B-A3B에서는 작은 격차가 남았다.
- 6비트 STEPQuant는 순환 상태 메모리를 Qwen에서 5.03배, Kimi에서 5.08배 압축했다. 모델 가중치를 포함한 전체 서빙 메모리는 각각 68.7%, 53.7% 줄었다.
- 최적화 커널로 상태 업데이트 속도가 최대 2.91배 빨라졌다.
- Qwen의 순환 헤드 2,304개에서 게이트 half-life와 누적 상태 오차 사이의 Spearman 상관은 약 0.80이었다. 수명이 긴 상태일수록 오차가 크다는 가정을 뒷받침하는 결과다.
한계
평가는 gated Delta-rule 계열 하이브리드 모델 2개(Qwen3.8-27B, Kimi-Linear)와 A800 GPU 환경으로 한정된다. Kimi의 4비트 설정에서는 FP32 대비 격차가 남는다. 비트 배분·FP16 pivot·행 영향 점수는 WikiText-2 32개 구간(각 2,048 토큰)으로 오프라인에서 정한 뒤 모든 요청에 고정한다. 따라서 입력 분포가 크게 다를 때도 성능이 유지되는지는 이 실험만으로 알 수 없다. 또 '6비트'는 FP16 pivot을 포함한 명목 예산이다.
의미
선형 어텐션·하이브리드 모델은 긴 컨텍스트에서 메모리 효율이 좋다. 하지만 동시 서빙에서는 순환 상태가 새로운 메모리 병목이 된다. 이 연구는 상태 양자화가 왜 실패하는지를 분석하고, SGLang에 통합된 실용적 해법을 함께 제시했다. 하이브리드 모델 서빙 비용을 줄이려는 팀에 직접 참고가 된다.
핵심 용어
- 순환 상태(Recurrent State)
- 선형 어텐션이 지난 토큰 정보를 요약해 담는 고정 크기 행렬이다. 시퀀스가 길어져도 크기는 그대로지만, 요청마다 하나씩 유지해야 한다.
- Gated Delta Rule
- retention 게이트로 이전 상태를 감쇠시키고, 현재 key 방향으로 오차를 보정해 새 값을 쓰는 상태 업데이트 규칙이다. Gated DeltaNet과 KDA가 이 방식을 쓴다.
- 혼합 정밀도 양자화(Mixed-precision Quantization)
- 민감한 부분에는 비트를 더 주고 덜 민감한 부분에는 적게 주는 양자화 방식이다. 같은 평균 비트 예산에서 정확도를 더 지키려는 목적이다.
- 사후 학습 양자화(PTQ)
- 재학습 없이 소량의 캘리브레이션 데이터만으로 양자화 설정을 정하는 방법이다.
원문
저자: Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Zhenan Sun, 외 · 게시 2026-09-29 · 라이선스 arXiv 비독점 배포 라이선스 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.