AI 용어집 · 심화 · 데이터·평가
LLM-as-a-Judge LLM 평가자
LLM-as-a-Judge는 사람 대신 LLM(대규모 언어 모델)에게 다른 AI의 답변을 채점하거나 두 답변 중 더 나은 쪽을 고르게 하는 평가 방법이다.
어떻게 작동하나
먼저 평가할 AI 모델에게 질문을 주고 답변을 받는다. 그다음 '심판' 역할을 맡은 LLM에게 질문, 답변, 평가 기준을 함께 프롬프트로 넣는다. 심판 LLM은 정확성, 유용성, 안전성 같은 기준에 따라 점수를 매기거나, 두 답변을 비교해 더 나은 쪽을 고른다. 판정 이유를 함께 쓰게 하면 왜 그런 점수가 나왔는지 사람이 확인하기 쉬워진다. 결과를 믿을 수 있는지 보기 위해 일부 판정은 사람 평가와 대조해 본다.
왜 중요한가
요약, 글쓰기, 대화처럼 정답이 하나로 정해지지 않은 과제는 객관식 벤치마크로 채점하기 어렵다. 사람이 일일이 평가하면 정확하지만 시간과 비용이 많이 든다. LLM 심판을 쓰면 수많은 답변을 빠르고 싸게, 같은 기준으로 평가할 수 있다. 그래서 모델 개발 중간 점검, 서비스 품질 모니터링, 학습용 선호 데이터 만들기 등에 널리 쓰인다.
알아 둘 점
심판 LLM에도 편향이 있다. 먼저 나온 답변이나 더 긴 답변을 좋게 보거나, 자기와 비슷한 모델이 쓴 답을 더 높게 치는 경향이 알려져 있다. 심판 자신이 모르는 전문 지식이 필요한 문제는 틀린 답을 맞다고 할 수도 있다. 이런 문제를 줄이려고 답변 순서를 바꿔 두 번 평가하거나, 기준을 아주 구체적으로 쓰거나, 여러 심판의 판정을 합친다. 결국 사람의 확인을 완전히 대신하지는 못하고, 보조 도구로 쓰는 것이 안전하다.
예시
챗봇 서비스를 운영하는 회사는 프롬프트를 고칠 때마다 수백 개의 예시 질문에 대한 새 답변을 받아 둔다. 그다음 심판 LLM에게 '질문에 정확히 답했는가, 근거 없는 내용을 지어내지 않았는가' 같은 기준으로 예전 답변과 비교하게 한다. 점수가 떨어진 항목만 사람이 직접 살펴보면, 전부를 사람이 읽을 때보다 훨씬 빠르게 품질 변화를 잡아낼 수 있다.