AI 용어집 · 기초 · 데이터·평가
벤치마크 Benchmark
벤치마크는 AI 모델의 능력을 같은 조건에서 비교하려고 만든 표준 시험 문제 모음과 채점 방식이다. 모델마다 같은 문제를 풀게 해서 점수로 실력을 견준다.
어떻게 작동하나
벤치마크는 보통 문제 묶음, 정답이나 채점 기준, 점수 계산법으로 이루어진다. 수학 문제, 코딩 과제, 상식 질문처럼 정답이 분명한 시험도 있고, 사람이나 다른 AI가 답의 질을 평가하는 방식도 있다. 최근에는 AI 에이전트가 여러 단계를 거쳐 실제 과제를 끝까지 해내는지 보는 벤치마크도 많아졌다. 같은 문제와 같은 채점 기준을 쓰기 때문에, 서로 다른 회사의 모델도 한 줄로 비교할 수 있다.
왜 중요한가
AI 모델이 '더 똑똑해졌다'는 말을 확인하려면 공통 잣대가 필요하다. 연구자는 벤치마크로 새 방법이 실제로 나아졌는지 확인하고, 기업은 어떤 모델을 쓸지 고를 때 참고한다. 새 벤치마크가 나오면 지금 AI가 무엇을 못하는지가 드러나서 연구 방향을 정하는 데도 영향을 준다. 그래서 모델 발표 때는 여러 벤치마크 점수가 함께 공개되는 경우가 많다.
알아 둘 점
벤치마크 문제가 학습 데이터에 섞여 들어가면 모델이 문제를 '외워서' 점수가 부풀 수 있는데, 이를 데이터 오염이라고 한다. 모델들이 거의 만점에 가까워지면 그 벤치마크로는 더 이상 차이를 가리기 어려워 '포화'됐다고 말한다. 또 점수를 올리는 데만 맞춰 모델을 다듬으면 실제 쓰임새에서는 기대만큼 좋지 않을 수 있다. 그래서 점수는 여러 벤치마크와 실제 사용 경험을 함께 놓고 보는 것이 좋다.
예시
이 사이트에서 다룬 'TasteVal'은 AI의 실험 연구 감각을 인간 전문가와 비교하는 벤치마크이고, 'LMBuild'는 LLM 에이전트가 실제로 조립할 수 있고 작동하는 구조물을 만드는지 평가한다. 이처럼 요즘 벤치마크는 정답 맞히기를 넘어, 연구 판단력이나 실제로 동작하는 결과물을 만드는 능력까지 재려는 쪽으로 넓어지고 있다.
이 사이트에서 나온 사례
- 논문 증거에서 행동으로: 도구 사용 에이전트는 어디서 실패하는가 2026-10-08
- 논문 LMBuild: 실제로 조립할 수 있고 작동하는 구조물을 만드는 LLM 에이전트 평가 2026-10-07
- 브리핑 AWS, 코딩 에이전트용 SageMaker 추론 최적화 스킬 'aws-ai-ml' 공개 2026-10-06
- 브리핑 TasteVal: AI의 실험 연구 감각을 인간 전문가와 비교하는 벤치마크 2026-10-06