데이터 필터링 Data Filtering, 품질 필터링
데이터 필터링은 AI 모델을 학습시키기 전에 모아 둔 데이터에서 품질이 낮거나, 해롭거나, 쓸모없는 것을 골라내 버리는 작업이다. 무엇을 넣느냐만큼 무엇을 빼느냐가 모델 성능을 크게 좌우한다.
어떻게 작동하나
보통 여러 단계의 거름망을 차례로 통과시킨다. 먼저 어떤 언어로 쓴 글인지 가려내고, 너무 짧거나 깨진 글, 광고·스팸 같은 것을 간단한 규칙으로 걸러 낸다. 그다음 같은 글이 여러 번 들어간 것을 지우는 중복 제거를 한다. 마지막으로 '좋은 글'을 알아보도록 학습한 작은 분류 모델이나 LLM이 점수를 매겨, 일정 점수 이상만 남긴다. 개인정보나 유해한 내용을 찾아 지우는 단계도 함께 들어간다.
단계마다 줄어드는 데이터
왜 중요한가
인터넷에서 긁어모은 원본 데이터에는 의미 없는 글, 반복되는 문구, 잘못된 정보가 많이 섞여 있다. 이런 데이터를 그대로 학습하면 모델이 엉뚱한 말투를 배우고 학습 비용만 늘어난다. 같은 계산 자원을 쓰더라도 잘 걸러진 데이터로 학습하면 더 똑똑한 모델을 만들 수 있다는 점이 업계에 널리 퍼지면서, 필터링은 사전학습의 핵심 경쟁력이 됐다.
알아 둘 점
'좋은 데이터'의 기준을 누가 정하느냐에 따라 결과가 달라진다. 교과서 같은 글만 남기면 구어체나 특정 지역·집단의 말투가 사라져 모델이 한쪽으로 치우칠 수 있다. 평가용 문제가 학습 데이터에 섞여 들어가는 데이터 오염을 막는 것도 필터링이 맡는 일이다. 그래서 필터를 얼마나 강하게 걸지는 실험으로 확인하면서 조정한다.
예시
대형 언어 모델을 만드는 회사들은 공개 웹 데이터를 모은 뒤, 품질 분류기로 점수를 매겨 높은 점수를 받은 데이터만 사전학습에 쓰는 방식을 흔히 쓴다. 공개 학습 데이터셋 중에는 '교육적 가치가 높은 글'만 LLM으로 골라낸 버전을 따로 내놓는 경우도 있다. 기업이 사내 문서로 챗봇을 만들 때도 오래된 문서, 초안, 중복 문서를 먼저 걸러 내야 답변 품질이 올라간다.