AI 용어집 · 기초 · MLOps·LLMOps · 언어 모델
LLMOps LLM Operations
LLMOps는 LLM(대규모 언어 모델)을 쓰는 서비스를 만들고 운영할 때 필요한 관리 방법과 도구를 말합니다. MLOps를 바탕으로 하되, 프롬프트 관리·답변 품질 평가·비용 관리처럼 LLM에서 새로 생긴 일을 더한 것입니다.
어떻게 작동하나
LLM 서비스는 모델 자체보다 그 주변을 바꾸는 일이 많습니다. 프롬프트와 시스템 프롬프트를 버전별로 관리하고, RAG를 쓴다면 검색할 문서와 임베딩 파이프라인도 함께 관리합니다. 바꿀 때마다 Evals(평가 세트)로 답변 품질을 확인하고, 실제 서비스에서는 요청과 응답, 토큰 사용량, 응답 속도를 기록해 지켜봅니다(LLM 관측 가능성). 여러 모델을 쓴다면 LLM 게이트웨이로 호출을 한곳에 모아 관리하기도 합니다.
왜 중요한가
LLM은 같은 질문에도 매번 조금씩 다르게 답하고, 정답이 하나로 정해지지 않는 경우가 많아 품질 확인이 까다롭습니다. 프롬프트 한 줄만 바꿔도 다른 답변이 무너질 수 있어서, 바꾸기 전후를 비교하는 절차가 필요합니다. 또 사용량에 따라 비용이 바로 늘어나고, 환각이나 프롬프트 인젝션 같은 위험도 운영 중에 계속 살펴야 합니다. 시제품은 쉽게 만들어도 안정적인 서비스로 키우려면 이런 관리가 필수입니다.
MLOps와 LLMOps
MLOps직접 학습한 모델 운영
- 데이터와 학습 과정 관리
- 정답과 비교하는 성능 지표
- 데이터 드리프트 감시
LLMOpsLLM 기반 서비스 운영
- 프롬프트·검색 문서 버전 관리
- 정답이 여럿인 답변 품질 평가
- 토큰 비용·환각·인젝션 관리
공통 둘 다 배포 후에도 지켜보고 고쳐 가는 반복 운영이 핵심
알아 둘 점
LLMOps는 MLOps를 대체하는 것이 아니라 확장한 개념이라, 데이터 관리·배포·모니터링 같은 기본기는 그대로 필요합니다. 답변 품질 평가에는 사람의 검토와 LLM-as-a-Judge(다른 LLM이 채점하는 방식)를 섞어 쓰는 일이 많은데, 채점하는 LLM도 틀릴 수 있다는 점을 염두에 둬야 합니다. 외부 API 모델을 쓰면 제공 회사가 모델을 업데이트할 때 동작이 달라질 수 있으니, 평가 세트로 주기적으로 다시 확인하는 것이 좋습니다. 용어의 범위는 회사마다 조금씩 다르게 쓰입니다.
예시
고객센터 상담 챗봇을 운영하는 팀을 떠올려 봅시다. 팀은 프롬프트를 고칠 때마다 자주 들어오는 질문을 모은 평가 세트로 답변을 먼저 채점해 보고, 점수가 떨어지지 않을 때만 반영합니다. 운영 중에는 대화 기록과 토큰 사용량을 대시보드로 보며, 엉뚱한 답이 나온 사례를 모아 다음 평가 세트에 추가합니다. 이렇게 '바꾸기 → 평가 → 배포 → 관찰'을 반복하는 체계가 LLMOps입니다.