← 연구

논문 리뷰 · 2026년 10월 10일

TokenRouter: 토큰 단위 LLM 라우팅을 위한 효율적 서빙 시스템

TokenRouter: Efficient Serving System for Token-Level LLM Routing

효율·인프라언어 모델 고급 추천 102 cs.CL

요청 중심 프로그래밍과 모델별 비동기 실행, 지연 배칭을 결합한 서빙 시스템을 만들어 토큰 단위 라우팅의 디코딩 처리량을 기존 구현보다 2.01~64.15배 높였다.

문제

토큰마다 처리할 모델을 바꾸는 토큰 단위 라우팅은 알고리즘 수준에서 비용·품질 이점이 보고됐다. 하지만 SGLang·vLLM 같은 기존 서빙 시스템은 단일 LLM을 전제로 해서 모델 간 스텝 비동기화, 배치 진입 지연, 높은 구현 복잡도라는 문제가 생긴다.

방법

개발자는 요청 하나가 모델 사이를 오가는 흐름만 route·send·receive 세 함수로 기술하고, 런타임은 모델마다 서브서버를 띄워 비동기로 실행한다. 기존 두 루프에 모델 간 루프를 더한 tri-loop 구조와 pending 상태를 쓴 handoff-resume으로 모델 전환 비용을 줄였다. 각 서브서버는 같은 모델 요청이 임계값 B만큼 쌓이면 배치를 시작하는 지연 배칭 스케줄러를 쓰며, B는 이산시간 마르코프 체인 기반 처리량 모델로 최적값을 구한다. SGLang 위에 구현했다.

결과

한계

제공된 본문이 잘려 있어 세부 실험 결과와 품질 영향은 확인하지 못했다. 평가 모델은 Qwen3 계열 조합에 한정된다. 지연 배칭은 먼저 도착한 요청의 대기 시간을 늘릴 수 있어, 처리량과 개별 요청 지연 사이의 균형은 워크로드에 따라 달라질 수 있다.

의미

토큰 단위 라우팅은 작은 모델로 대부분을 처리하고 어려운 토큰만 큰 모델에 넘겨 비용을 줄일 수 있다. 실제 서빙 속도가 받쳐주지 않으면 쓸 수 없는데, 이 연구는 그 시스템 쪽 병목을 다룬다. 단일 LLM 서버를 그대로 대체할 수 있는 인터페이스도 제공한다.

핵심 용어

토큰 단위 라우팅
응답을 생성하는 도중 토큰마다 어떤 모델이 다음 토큰을 만들지 결정하는 방식. 쿼리 단위 라우팅보다 세밀하게 비용과 품질을 조절할 수 있다.
스텝 비동기화(Step Desynchronization)
모델마다 디코딩 한 스텝의 지연이 달라, 한 배치로 묶으면 가장 느린 모델을 기다리느라 빠른 모델이 쉬는 문제.
지연 배칭(Delayed Batching)
같은 모델로 가는 요청이 일정 수만큼 모일 때까지 잠깐 기다렸다가 함께 실행해 평균 배치 진입 지연을 줄이는 스케줄링 방식.

원문

저자: Tianyu Fu, Tengxuan Liu, Ruoxi Wang, Yixin Dong, Yi Ge, Yichen You, Yu Wang · 게시 2026-10-08 · 라이선스 CC BY 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.