AI 용어집 · 기초 · 데이터 엔지니어링 · 데이터·평가
데이터 품질 Data Quality
데이터 품질은 데이터가 목적에 맞게 쓸 만큼 정확하고, 빠짐없고, 일관되고, 최신인지를 나타내는 정도다. 품질이 낮은 데이터로 만든 분석이나 AI 모델은 결과도 믿기 어렵다.
어떻게 작동하나
데이터 품질은 보통 몇 가지 기준으로 나눠 본다. 값이 실제 사실과 맞는지(정확성), 비어 있는 칸이 없는지(완전성), 시스템마다 같은 값을 갖는지(일관성), 충분히 최신인지(적시성), 같은 기록이 중복되지 않았는지(유일성), 정해진 형식을 지키는지(유효성)가 대표적이다. 데이터 파이프라인 중간에 이런 규칙을 자동 검사하도록 넣어 두고, 기준을 벗어나면 알림을 보내거나 다음 단계로 넘기지 않는다.
품질 기준과 흔한 문제
| 확인 내용 | 흔한 문제 예 | |
|---|---|---|
| 정확성 | 사실과 맞는가 | 잘못 입력된 값 |
| 완전성 | 빈칸이 없는가 | 누락된 필드 |
| 일관성 | 시스템마다 같은가 | 부서별로 다른 정의 |
| 적시성 | 충분히 최신인가 | 폐기된 옛 문서 |
| 유일성 | 중복이 없는가 | 같은 기록 여러 개 |
| 유효성 | 형식을 지키는가 | 날짜 형식 뒤섞임 |
왜 중요한가
'쓰레기를 넣으면 쓰레기가 나온다'는 말처럼, 모델은 데이터의 오류와 편향을 그대로 배운다. 특히 LLM 학습에서는 데이터의 양보다 질이 성능을 크게 좌우한다는 인식이 퍼지면서 중복 제거와 저품질 문서 걸러내기가 중요한 단계가 되었다. 업무용 AI에서도 잘못된 문서가 검색되면 그럴듯하지만 틀린 답이 나온다. 품질 문제는 늦게 발견할수록 고치는 비용이 커지므로 데이터가 들어오는 초기에 잡는 것이 좋다.
알아 둘 점
완벽한 데이터는 거의 없으므로, 용도에 맞는 '충분한 품질' 기준을 정하는 것이 현실적이다. 처음에는 품질이 좋았던 데이터도 시간이 지나면 현실과 달라질 수 있는데, 이를 데이터 드리프트라고 부른다. 그래서 품질 점검은 한 번으로 끝나지 않고 계속 반복해야 한다. 품질 기준과 책임자를 정하는 일은 데이터 거버넌스와 함께 움직인다.
예시
사내 지식 검색 챗봇을 운영하는 팀은 같은 규정의 옛 버전과 새 버전이 함께 검색되어 챗봇이 폐기된 규정을 안내하는 문제를 자주 겪는다. 이를 막기 위해 문서에 작성일·유효 기간을 붙이고, 중복 문서를 걸러내고, 오래된 문서는 색인에서 빼는 품질 관리 단계를 파이프라인에 넣는다.