AI 용어집 · 심화 · 데이터·평가
데이터 오염 Data contamination
데이터 오염은 AI 모델을 평가하는 시험 문제(벤치마크)가 모델의 학습 데이터에 섞여 들어가, 실력보다 점수가 부풀려지는 현상이다.
어떻게 작동하나
LLM은 인터넷에서 모은 아주 많은 글로 사전학습을 한다. 그런데 벤치마크 문제와 정답도 논문, 깃허브, 블로그 등을 통해 인터넷에 공개되어 있는 경우가 많다. 학습 데이터를 모을 때 이것이 함께 들어가면 모델은 시험 문제를 미리 본 셈이 된다. 그러면 모델이 문제를 풀어서가 아니라 기억해서 맞힐 수 있다. 개발자가 일부러 넣지 않아도 데이터가 워낙 많아 모르는 사이에 섞이는 경우가 대부분이다.
왜 중요한가
벤치마크 점수는 어떤 모델이 더 뛰어난지 비교하는 주요 근거다. 데이터 오염이 있으면 이 점수를 믿을 수 없게 되고, 실제 서비스에서 기대만큼 성능이 나오지 않을 수 있다. 연구자들이 새 기법의 효과를 잘못 판단할 위험도 있다. 그래서 모델 발표 때 오염 여부를 점검했는지가 점점 중요한 신뢰 기준이 되고 있다.
알아 둘 점
오염을 완전히 막기는 어렵다. 학습 데이터에서 벤치마크 문장과 겹치는 부분을 찾아 지우는 방법이 흔히 쓰이지만, 문장을 조금 바꾸거나 번역한 형태는 놓치기 쉽다. 그래서 문제를 비공개로 두는 벤치마크, 모델 학습 이후에 새로 만든 문제로 평가하는 방법, 문제의 숫자나 표현을 바꿔 다시 풀게 하는 방법 등이 함께 쓰인다. 원래 문제와 살짝 바꾼 문제 사이에 점수 차이가 크면 오염을 의심할 수 있다.
예시
새 LLM이 유명한 수학 벤치마크에서 높은 점수를 받았다고 발표되면, 연구자들은 같은 유형의 문제를 숫자와 문장만 바꿔 다시 풀게 해 보곤 한다. 바꾼 문제에서 점수가 크게 떨어지면 원래 문제를 외웠을 가능성, 즉 데이터 오염을 의심한다. 그래서 여러 AI 회사와 연구팀은 모델을 발표할 때 오염 점검 결과를 함께 공개하거나, 공개되지 않은 문제로 따로 평가한 점수를 내놓는다.