논문 리뷰 · 2026년 10월 10일
TokenRouter: 토큰 단위 LLM 라우팅을 위한 효율적 서빙 시스템
TokenRouter: Efficient Serving System for Token-Level LLM Routing
요청 중심 프로그래밍과 모델별 비동기 실행, 지연 배칭을 결합한 서빙 시스템을 만들어 토큰 단위 라우팅의 디코딩 처리량을 기존 구현보다 2.01~64.15배 높였다.
문제
토큰마다 처리할 모델을 바꾸는 토큰 단위 라우팅은 알고리즘 수준에서 비용·품질 이점이 보고됐다. 하지만 SGLang·vLLM 같은 기존 서빙 시스템은 단일 LLM을 전제로 해서 모델 간 스텝 비동기화, 배치 진입 지연, 높은 구현 복잡도라는 문제가 생긴다.
방법
개발자는 요청 하나가 모델 사이를 오가는 흐름만 route·send·receive 세 함수로 기술하고, 런타임은 모델마다 서브서버를 띄워 비동기로 실행한다. 기존 두 루프에 모델 간 루프를 더한 tri-loop 구조와 pending 상태를 쓴 handoff-resume으로 모델 전환 비용을 줄였다. 각 서브서버는 같은 모델 요청이 임계값 B만큼 쌓이면 배치를 시작하는 지연 배칭 스케줄러를 쓰며, B는 이산시간 마르코프 체인 기반 처리량 모델로 최적값을 구한다. SGLang 위에 구현했다.
결과
- CITER, R2R, R-Stitch, Co-LLM, ME 다섯 가지 라우팅 알고리즘과 여러 워크로드·모델 조합에서 기존 시스템 대비 디코딩 처리량이 2.01~64.15배 높았다고 보고했다.
- 동시 요청 8에서 공식 R2R 구현 대비 엔지니어링 최적화만으로 1.71배, TokenRouter 전체로 2.76배 처리량 향상을 보였다.
- 더 엄격한 SLO 조건에서는 R2R보다 18.58배 높은 처리량을 기록했다.
- 주요 실험은 Qwen3-0.6B와 Qwen3-32B(ME는 Qwen3-8B 추가) 조합으로 진행됐다.
한계
제공된 본문이 잘려 있어 세부 실험 결과와 품질 영향은 확인하지 못했다. 평가 모델은 Qwen3 계열 조합에 한정된다. 지연 배칭은 먼저 도착한 요청의 대기 시간을 늘릴 수 있어, 처리량과 개별 요청 지연 사이의 균형은 워크로드에 따라 달라질 수 있다.
의미
토큰 단위 라우팅은 작은 모델로 대부분을 처리하고 어려운 토큰만 큰 모델에 넘겨 비용을 줄일 수 있다. 실제 서빙 속도가 받쳐주지 않으면 쓸 수 없는데, 이 연구는 그 시스템 쪽 병목을 다룬다. 단일 LLM 서버를 그대로 대체할 수 있는 인터페이스도 제공한다.
핵심 용어
- 토큰 단위 라우팅
- 응답을 생성하는 도중 토큰마다 어떤 모델이 다음 토큰을 만들지 결정하는 방식. 쿼리 단위 라우팅보다 세밀하게 비용과 품질을 조절할 수 있다.
- 스텝 비동기화(Step Desynchronization)
- 모델마다 디코딩 한 스텝의 지연이 달라, 한 배치로 묶으면 가장 느린 모델을 기다리느라 빠른 모델이 쉬는 문제.
- 지연 배칭(Delayed Batching)
- 같은 모델로 가는 요청이 일정 수만큼 모일 때까지 잠깐 기다렸다가 함께 실행해 평균 배치 진입 지연을 줄이는 스케줄링 방식.
원문
저자: Tianyu Fu, Tengxuan Liu, Ruoxi Wang, Yixin Dong, Yi Ge, Yichen You, Yu Wang · 게시 2026-10-08 · 라이선스 CC BY 4.0 · 본문 기준 분석
이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.