← AI 용어집

AI 용어집 · 심화 · MLOps·LLMOps · 데이터·평가

데이터 드리프트 Data Drift, 모델 드리프트

데이터 드리프트는 모델이 실제로 받는 데이터의 성질이 학습할 때의 데이터와 점점 달라지는 현상입니다. 이 때문에 처음엔 잘 맞던 모델의 예측이 시간이 지나며 조용히 틀려 갑니다.

쉽게 말하면 작년 지도로 길을 찾는 것과 비슷합니다. 지도를 만들 땐 정확했지만, 새 도로가 생기고 길이 바뀌면 같은 지도로는 점점 헤매게 됩니다. 지도는 그대로인데 세상이 바뀐 것입니다.

어떻게 작동하나

모델은 학습 데이터에 담긴 패턴을 익힙니다. 그런데 서비스를 시작한 뒤 사용자층이 바뀌거나, 계절이 바뀌거나, 센서가 교체되는 등 들어오는 데이터의 분포가 달라질 수 있습니다. 입력 데이터의 모습이 바뀌는 것을 좁은 의미의 데이터 드리프트라고 하고, 입력과 정답 사이의 관계 자체가 바뀌는 것을 컨셉 드리프트라고 구분하기도 합니다. 둘을 묶어 '모델 드리프트'라고 부르는 경우도 많습니다.

데이터 드리프트와 컨셉 드리프트

데이터 드리프트입력이 바뀜

  • 들어오는 데이터의 모습이 달라짐
  • 예: 사용자층·계절 변화
  • 입력 통계로 비교적 빨리 감지

컨셉 드리프트관계가 바뀜

  • 입력과 정답 사이의 관계가 달라짐
  • 같은 입력에도 정답이 달라짐
  • 실제 성능 지표로 확인

공통 둘 다 학습 때와 실제 사용 때가 달라져 예측이 조용히 틀려 가는 현상

무엇이 바뀌었는지에 따라 두 가지로 나눠 부르기도 합니다.

왜 중요한가

드리프트는 오류 메시지 없이 진행되기 때문에 알아채기 어렵습니다. 시스템은 멀쩡히 돌아가는데 추천이 엉뚱해지거나 사기 탐지가 놓치는 일이 늘어납니다. 그래서 운영 중인 모델은 입력 데이터의 통계와 예측 결과를 꾸준히 지켜보고, 학습 때와 차이가 커지면 경고를 띄우는 모니터링을 둡니다. 경고가 오면 새 데이터로 다시 학습시키거나 모델을 고칩니다.

알아 둘 점

모든 변화가 문제는 아닙니다. 분포가 조금 바뀌어도 성능이 유지되면 굳이 다시 학습할 필요가 없으므로, 실제 성능 지표와 함께 판단하는 것이 좋습니다. 정답이 늦게 확인되는 업무(대출 상환 여부 등)에서는 성능 저하를 바로 측정하기 어려워 입력 분포 변화를 먼저 살핍니다. LLM 서비스에서도 사용자 질문 유형이 바뀌면 같은 문제가 생길 수 있어, LLM 관측 가능성 도구로 질문 흐름을 지켜보기도 합니다.

예시

쇼핑몰의 수요 예측 모델은 명절이나 유행 변화로 구매 패턴이 갑자기 달라지면 예측이 크게 빗나갈 수 있습니다. 그래서 운영팀은 대시보드에서 주요 입력값의 분포를 학습 시점과 비교하고, 차이가 기준을 넘으면 재학습을 진행합니다. 학습 때와 실제 사용 때의 분포 차이라는 같은 고민은 생성 모델 연구에도 나타납니다. 이 사이트에 소개된 'In-Distribution Forcing' 논문은 긴 영상을 만들 때 모델이 다루는 값을 학습 때 보던 분포 안에 머물게 하는 방법을 다룹니다.

이 사이트에서 나온 사례

함께 보면 좋은 용어