AI 용어집 · 기초 · MLOps·LLMOps · 효율·인프라
모델 서빙 Model Serving
모델 서빙은 학습을 마친 AI 모델을 서버에 올려, 앱이나 사용자가 보낸 요청을 받아 모델을 실행하고 결과를 돌려주도록 운영하는 일이다.
어떻게 작동하나
서빙 시스템은 모델 레지스트리 등에서 모델을 불러와 GPU 같은 하드웨어 메모리에 올려 둔다. 사용자 요청이 API로 들어오면 서버가 이를 받아 여러 요청을 묶거나 순서를 정한 뒤(배칭·스케줄링) 모델을 실행해 추론 결과를 돌려준다. LLM은 답을 토큰 단위로 하나씩 만들기 때문에, 완성된 부분부터 바로 보내는 스트리밍 방식을 자주 쓴다. 실시간으로 바로 응답하는 방식 외에, 쌓아 둔 데이터를 한꺼번에 처리하는 배치 방식도 있다.
왜 중요한가
아무리 좋은 모델도 서빙되지 않으면 실제 서비스에서 쓸 수 없다. 서빙은 응답 속도, 동시에 처리할 수 있는 요청 수, 그리고 비용을 좌우한다. 특히 LLM은 GPU가 비싸서, 같은 GPU로 더 많은 요청을 처리하는 기술이 곧 서비스 비용과 직결된다. 그래서 KV 캐시 관리, 양자화, 추측 디코딩 같은 최적화 기법이 서빙 단계에서 많이 쓰인다.
알아 둘 점
서빙은 한 번 띄우고 끝나는 일이 아니다. 요청량에 맞춰 서버 수를 늘리고 줄이는 확장, 새 모델로 바꿀 때 서비스가 끊기지 않게 하는 배포 방식, 장애 감시가 함께 필요하다. 쿠버네티스 위에서 운영하는 경우가 많고, 운영 중에는 데이터 드리프트로 성능이 떨어지지 않는지도 지켜봐야 한다. 속도와 비용, 품질은 서로 줄다리기 관계라 서비스 목적에 맞는 균형점을 찾아야 한다.
예시
vLLM은 LLM 서빙에 널리 쓰이는 오픈소스 엔진으로, 이 사이트에서도 'vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중' 소식으로 다뤄졌다. 기업은 이런 엔진으로 오픈웨이트 모델을 자체 GPU 서버에 올려 사내 챗봇이나 API로 제공하고, 앞단에 LLM 게이트웨이를 두어 여러 모델로 가는 요청을 관리하기도 한다.
이 사이트에서 나온 사례
- 브리핑 vLLM v0.31.0 출시…DeepSeek-V4.1-Flash 추론 성능 최적화 집중 2026-10-07