← AI 용어집

AI 용어집 · 기초 · MLOps·LLMOps · 효율·인프라

모델 서빙 Model Serving

모델 서빙은 학습을 마친 AI 모델을 서버에 올려, 앱이나 사용자가 보낸 요청을 받아 모델을 실행하고 결과를 돌려주도록 운영하는 일이다.

쉽게 말하면 레시피(학습된 모델)를 완성한 뒤 식당을 열어 손님 주문을 받고 음식을 내는 일과 같다. 맛있는 레시피만큼이나 주문이 몰릴 때 빨리, 끊김 없이 내놓는 주방 운영이 중요하다.

어떻게 작동하나

서빙 시스템은 모델 레지스트리 등에서 모델을 불러와 GPU 같은 하드웨어 메모리에 올려 둔다. 사용자 요청이 API로 들어오면 서버가 이를 받아 여러 요청을 묶거나 순서를 정한 뒤(배칭·스케줄링) 모델을 실행해 추론 결과를 돌려준다. LLM은 답을 토큰 단위로 하나씩 만들기 때문에, 완성된 부분부터 바로 보내는 스트리밍 방식을 자주 쓴다. 실시간으로 바로 응답하는 방식 외에, 쌓아 둔 데이터를 한꺼번에 처리하는 배치 방식도 있다.

요청이 응답이 되기까지사용자 요청 → API 서버; API 서버 → 배칭·스케줄링; 배칭·스케줄링 → 모델 실행; 모델 실행 → 응답; 모델 레지스트리 → 모델 실행(모델 로드)사용자 요청앱·API 호출API 서버요청 받기배칭·스케줄링요청 묶기·순서 정하기모델 실행GPU 위 추론응답스트리밍 가능모델 레지스트리운영 버전 보관모델 로드
요청이 응답이 되기까지 왼쪽에서 오른쪽으로 요청이 처리된다. 점선은 미리 해 두는 일로, 레지스트리에서 모델을 불러와 GPU에 올려 두는 단계다.

왜 중요한가

아무리 좋은 모델도 서빙되지 않으면 실제 서비스에서 쓸 수 없다. 서빙은 응답 속도, 동시에 처리할 수 있는 요청 수, 그리고 비용을 좌우한다. 특히 LLM은 GPU가 비싸서, 같은 GPU로 더 많은 요청을 처리하는 기술이 곧 서비스 비용과 직결된다. 그래서 KV 캐시 관리, 양자화, 추측 디코딩 같은 최적화 기법이 서빙 단계에서 많이 쓰인다.

알아 둘 점

서빙은 한 번 띄우고 끝나는 일이 아니다. 요청량에 맞춰 서버 수를 늘리고 줄이는 확장, 새 모델로 바꿀 때 서비스가 끊기지 않게 하는 배포 방식, 장애 감시가 함께 필요하다. 쿠버네티스 위에서 운영하는 경우가 많고, 운영 중에는 데이터 드리프트로 성능이 떨어지지 않는지도 지켜봐야 한다. 속도와 비용, 품질은 서로 줄다리기 관계라 서비스 목적에 맞는 균형점을 찾아야 한다.

예시

vLLM은 LLM 서빙에 널리 쓰이는 오픈소스 엔진으로, 이 사이트에서도 'vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중' 소식으로 다뤄졌다. 기업은 이런 엔진으로 오픈웨이트 모델을 자체 GPU 서버에 올려 사내 챗봇이나 API로 제공하고, 앞단에 LLM 게이트웨이를 두어 여러 모델로 가는 요청을 관리하기도 한다.

이 사이트에서 나온 사례

함께 보면 좋은 용어