AI 용어집 · 기초 · 데이터·평가
Evals 평가 세트, Evaluations
Evals(평가, Evaluations)는 AI 모델이나 AI 기능이 원하는 대로 잘 작동하는지 미리 정해 둔 문제와 채점 기준으로 반복해서 확인하는 시험 세트이자 그 과정이다. 공개 벤치마크와 달리 보통 내 서비스와 내 업무에 맞춰 직접 만든다.
어떻게 작동하나
먼저 실제 사용 상황을 닮은 입력(질문, 문서, 작업 지시 등)을 모아 시험 문제 목록을 만든다. 각 문제에는 정답이나 '좋은 답'의 기준을 함께 적어 둔다. 그다음 모델이나 AI 에이전트가 이 문제를 풀게 하고, 결과를 채점한다. 채점은 정답과 그대로 비교하거나 코드로 자동 검사하기도 하고, 다른 LLM에게 채점을 맡기는 LLM-as-a-Judge나 사람이 직접 보는 방식을 섞기도 한다. 이렇게 나온 점수를 프롬프트나 모델을 바꿀 때마다 다시 재서 나아졌는지 나빠졌는지 비교한다.
왜 중요한가
LLM은 같은 입력에도 답이 달라질 수 있고, 프롬프트 한 줄만 바꿔도 다른 곳에서 엉뚱하게 성능이 떨어질 수 있다. Evals가 없으면 '몇 번 써 보니 괜찮았다'는 느낌에 기대 판단하게 된다. 반대로 Evals를 갖춰 두면 모델 교체, 프롬프트 수정, RAG 설정 변경 같은 결정을 숫자와 사례로 따질 수 있다. 그래서 AI 제품을 만드는 팀에서는 일반 소프트웨어의 테스트 코드처럼 Evals를 개발 과정의 기본 도구로 여기는 경우가 많다.
알아 둘 점
점수가 높다고 해서 실제 사용자 경험이 꼭 좋은 것은 아니다. 시험 문제가 실제 상황을 잘 대표하지 못하면 엉뚱한 것을 재게 된다. 또 시험 문제가 모델의 학습 데이터에 섞여 들어가면 실력보다 점수가 부풀려지는 데이터 오염 문제가 생길 수 있다. LLM에게 채점을 맡길 때도 채점하는 모델 자체가 틀리거나 한쪽으로 치우칠 수 있으니, 사람이 일부를 직접 검토해 채점 기준이 맞는지 확인하는 편이 안전하다. 서비스가 바뀌면 Evals도 함께 고쳐 나가야 한다.
예시
고객 상담 챗봇을 만드는 회사라면 실제 문의를 바탕으로 '환불 규정 질문', '배송 지연 항의', '답할 수 없는 질문' 같은 시험 문제 수백 개를 모아 둘 수 있다. 각 문제에는 '규정 문서에 근거해 답했는가', '모르는 내용을 지어내지 않았는가(환각)', '정중한 말투인가' 같은 채점 기준을 붙인다. 시스템 프롬프트를 고치거나 더 저렴한 모델로 바꾸려 할 때마다 이 Evals를 돌려 점수를 비교하고, 떨어진 항목이 있으면 배포 전에 원인을 찾는다. AI 모델을 만드는 회사들도 새 모델을 내놓기 전에 공개 벤치마크와 함께 자체 Evals로 성능과 안전성을 확인한다.