← 스터디

스터디 · 2026-10-08 · 기초

데이터 중심 AI: 정제·중복 제거·합성 데이터로 모델을 키우는 법

모델 구조를 그대로 두고 학습 데이터를 거르고, 중복을 없애고, 필요하면 새로 만들기만 해도 모델 성능과 학습 효율이 크게 달라진다. 이 노트는 중복 제거·품질 필터링·합성 데이터·데이터 선별 연구가 각각 무엇을 보여 줬고 요즘 어디로 가는지 정리한다.

핵심 정리

왜 필요했나: 많이 모으기만 해서는 부족했다

LLM(대규모 언어 모델)은 인터넷에서 긁어모은 엄청난 양의 글로 사전 학습한다. 데이터가 수 기가바이트에서 테라바이트 단위로 커지자 사람이 하나하나 검토하기는 불가능해졌고, 그만큼 품질도 떨어졌다. 같은 광고 문구가 수만 번 반복되고, 메뉴·버튼 글씨 같은 군더더기(boilerplate)나 뜻 없는 문자열도 함께 섞여 들어갔다.

중복 제거 연구논문는 이 문제를 숫자로 보여 줬다. 흔히 쓰는 데이터셋 C4에서는 61단어짜리 영어 문장 하나가 6만 번 이상 반복됐고, 이런 데이터로 학습한 모델이 아무 지시 없이 내놓는 글의 1% 넘게가 학습 데이터를 그대로 베낀 것이었다. 연구진이 살펴본 네 가지 데이터셋 모두에 중복이 있었고, 표준 데이터셋 검증 세트의 4% 넘게가 학습 세트와 겹쳤다.

학습과 평가 데이터가 겹치면 모델이 실제보다 똑똑해 보인다. 같은 연구논문는 이런 겹침이 연구자로 하여금 모델 정확도를 과대평가하게 만들고, 학습 데이터에 과적합(외워서 맞히기)하는 모델과 설정을 고르게 만든다고 지적했다. 이것이 '데이터 오염' 문제다. 모델 구조를 아무리 다듬어도 데이터가 이러면 결과를 믿기 어렵다.

중복이 남긴 흔적(C4 등)

6만 번 이상C4에서 반복된 61단어 문장
1% 넘게학습 데이터를 그대로 베낀 출력
4% 넘게학습 세트와 겹친 검증 세트
중복 제거 연구가 보고한 수치다. 중복과 학습·평가 겹침이 얼마나 흔한지 보여 준다.

핵심 아이디어: 요리보다 재료 손질이 먼저다

데이터 중심 AI는 모델 구조나 학습 알고리즘은 그대로 두고 '무엇을 먹일지'를 바꿔서 성능을 끌어올리는 접근이다. 요리에 빗대면 조리법을 바꾸기 전에 재료를 씻고, 상한 것을 골라내고, 똑같은 재료가 너무 많으면 덜어내고, 모자란 재료는 따로 사 오는 일이다.

이 손질은 크게 세 갈래다. 첫째는 정제·필터링으로, 언어가 다르거나 품질이 낮은 글을 걸러낸다. 둘째는 중복 제거로, 똑같거나 거의 같은 글을 없앤다. 셋째는 합성 데이터로, 모자란 종류의 데이터를 다른 모델로 새로 만든다. 여기에 '이 중 어떤 데이터를 얼마나 쓸지' 고르는 데이터 선별이 덧붙는다.

이 생각을 실험으로 굳힌 대표 사례가 DataComp논문다. 이 벤치마크는 모델 학습 코드를 표준으로 묶어 두고 참가자가 데이터를 거르는 방법만 바꾸게 했다. 데이터만 바꿔도 결과가 달라진다는 것을 공정하게 비교하려는 설계다.

데이터 손질의 세 갈래

정제·필터링나쁜 재료 골라내기

  • 언어·규칙으로 거르기
  • 품질 점수로 상위만 남기기
  • 너무 거르면 양이 모자람

중복 제거같은 재료 덜어내기

  • 정확 일치·근사 일치
  • 외운 글 출력이 줄어듦
  • 학습·평가 겹침을 줄임

합성 데이터모자란 재료 새로 만들기

  • 다른 모델로 교과서·문제 생성
  • 작은 모델도 성능을 끌어올림
  • 만든 모델의 수준에 좌우

공통 모두 모델 구조 대신 '무엇을 먹일지'를 바꾼다

모델은 그대로 두고 데이터만 바꾸는 세 가지 방법을 나란히 놓았다.

어떻게 작동하나: 데이터 정제 파이프라인

웹 데이터를 학습용으로 만드는 과정은 보통 다음 순서를 따른다. 먼저 Common Crawl처럼 공개된 웹 스냅숏에서 글을 모은다. FineWeb논문에 따르면 Common Crawl은 2007년부터 웹을 모아 왔고, 많은 LLM 사전 학습 데이터셋이 여기서 출발한다.

다음은 규칙 기반 필터다. 언어 판별기로 원하는 언어만 남기고, 마침표로 끝나지 않는 줄이나 너무 짧은 줄, 금지어가 들어간 페이지를 버리는 식이다. FineWeb논문은 이전 연구에서 쓰던 50개가 넘는 후보 필터 가운데 실제로 효과가 있는 몇 개만 골라 썼다.

세 번째는 중복 제거다. 중복 제거 연구논문는 두 가지 도구를 내놓았다. 하나는 똑같은 문자열이 반복되는 부분을 찾아내는 정확 일치 방식이고, 다른 하나는 해시(긴 글을 짧은 지문으로 바꾸는 기법) 기반 MinHash로 단어 묶음이 많이 겹치는 '거의 같은' 문서 쌍을 찾는 근사 방식이다. 줄 단위로 지울지, 문단이나 문서 단위로 지울지, 정확히 같은 것만 지울지 비슷한 것까지 지울지는 모두 설계 선택이다.

네 번째는 품질 점수다. 남은 글마다 점수를 매겨 높은 것만 남긴다. 점수로는 퍼플렉서티(작은 모델이 그 글을 얼마나 예상 밖으로 느끼는지)나 '교육적인 글인가'를 판단하는 분류기를 쓴다. 필요하면 여기에 합성 데이터를 보탠다. 마지막으로 이 데이터로 작은 모델을 학습해 벤치마크로 평가하고, 결과를 보고 필터 기준을 다시 조정한다. FineWeb논문이 필터와 중복 제거 방식을 고를 때 쓴 방법이 바로 이렇게 모델을 실제로 학습해 비교하는 실험(ablation)이다.

웹 데이터 정제 파이프라인웹 수집 → 규칙 필터; 규칙 필터 → 중복 제거; 중복 제거 → 품질 점수; 품질 점수 → 학습 데이터; 합성 데이터 → 학습 데이터(보강); 학습 데이터 → 모델 학습; 모델 학습 → 벤치마크 평가; 벤치마크 평가 → 규칙 필터(기준 조정)웹 수집Common Crawl 등규칙 필터언어·짧은 줄·금지어중복 제거정확 일치·MinHash품질 점수퍼플렉서티·분류기합성 데이터다른 모델로 생성학습 데이터모델 학습벤치마크 평가보강기준 조정
웹 데이터 정제 파이프라인 윗줄 왼쪽에서 오른쪽으로 거른 뒤 아래로 내려가 학습·평가한다. 점선은 선택 사항(합성 데이터 보강)과 평가 결과로 필터를 다시 조정하는 고리다.

발전 흐름: 출발점 연구들이 새로 보여 준 것

중복 제거 연구2021 논문는 중복을 꼼꼼히 없애면 모델이 외운 글을 내뱉는 빈도가 10분의 1로 줄고, 같은 정확도에 이르는 데 필요한 학습 단계도 줄어든다는 것을 보였다. 데이터셋은 최대 19% 작아졌고, 퍼플렉서티는 나빠지지 않았으며 경우에 따라 최대 10% 좋아졌다. 연구진은 중복 제거에서 단점을 관찰하지 못했다고 정리했다.

2023년에는 여러 방향이 한꺼번에 나왔다. DataComp논문는 128억 개의 이미지-텍스트 쌍 후보 풀과 38개 평가 세트로 멀티모달 데이터 필터링을 겨루는 벤치마크를 만들었다. 가장 좋은 기준선인 DataComp-1B로 학습한 CLIP ViT-L/14는 ImageNet 제로샷 정확도 79.2%로, 같은 학습 절차와 연산량을 쓴 OpenAI CLIP보다 3.7%p 높았다. 데이터 가지치기 연구논문는 퍼플렉서티라는 단순한 점수가 더 비싼 품질 지표들보다 나았고, 원래 데이터의 30%만으로도 가지치기하지 않은 기준선보다 좋아질 수 있다고 보고했다.

같은 해 phi-1을 낸 'Textbooks Are All You Need'논문는 합성 데이터의 가능성을 보였다. 웹에서 고른 '교과서 수준' 데이터 60억 토큰과 GPT-3.5로 만든 합성 교과서·연습 문제 10억 토큰을 써서, 파라미터 13억 개짜리 코드 모델을 A100 8장으로 4일 학습했다. 이 모델은 HumanEval에서 pass@1 50.6%, MBPP에서 55.5%를 기록했다. 데이터 제약 스케일링 연구논문는 반대편 질문을 다뤘다. 쓸 데이터가 모자라 같은 데이터를 반복할 때, 4에포크(데이터를 네 번 훑기)까지는 새 데이터를 쓸 때와 손실 차이가 거의 없지만, 그보다 더 반복하면 연산을 늘려도 얻는 이득이 결국 0으로 줄어든다는 것을 보였다.

2024년의 FineWeb논문은 이런 지식을 대규모 공개 데이터셋으로 묶었다. 96개 Common Crawl 스냅숏에서 15조 토큰을 정제했고, 필터링과 중복 제거의 설계 선택을 하나하나 실험해 문서로 남겼다. 교육적 가치를 매기는 분류기로 1.3조 토큰을 골라낸 FineWeb-Edu는 MMLU, ARC처럼 지식과 추론이 필요한 벤치마크에서 훨씬 나은 성능을 냈다. 그동안 기업이 영업 비밀로 숨겨 온 데이터 정제 방법을 공개 자료로 끌어냈다는 데 의미가 있다.

데이터 중심 연구 지도 위쪽 묶음은 출발점 연구, 가운데는 이를 대규모 공개 데이터셋으로 묶은 FineWeb, 아래는 2026년 흐름이다. 화살표는 Edu-QuRating이 FineWeb-Edu를 기준선으로 삼았다는 뜻이다.

요즘 어디로 가고 있나: 더 세밀한 채점, 더 싼 선별

첫째 흐름은 품질을 한 가지 점수가 아니라 여러 기준으로 매기는 것이다. Edu-QuRating논문은 '교육적 가치'를 하나의 숫자로 보는 기존 필터가 너무 거칠다고 보고, 정확성·구성 같은 교육용 기준을 따로 정했다. LLM-as-a-Judge(LLM 평가자)가 문서 두 개를 비교해 고른 결과를 가볍고 다시 쓸 수 있는 채점 모델로 Distill했다. 가장 좋은 채점기는 GPT-4.1-mini의 비교 판단을 평균 0.917의 정확도로 재현했다. 문서 3억 2,225만 개에 점수를 매겨 만든 데이터로 작은 모델을 사전 학습했더니, 아홉 개 벤치마크 종합 정확도가 FineWeb-Edu 기준선보다 높게 나왔다. 다만 한 번씩만 돌려 비교한 결과다.

둘째 흐름은 선별 비용을 줄이는 것이다. 사후 학습 데이터를 고를 때 많이 쓰는 방법은 각 샘플의 그래디언트(모델을 어느 방향으로 고칠지 알려 주는 신호)가 작은 검증 세트의 그래디언트와 얼마나 같은 방향인지 보는 것이다. 문제는 모든 샘플마다 역전파를 해야 해서 비싸다는 점이다. LESSER논문는 출력층의 그래디언트만으로도 충분하다는 것을 보였고, 특징 추출 연산량을 SFT에서 9.7배, 강화학습 벤치마크에서 3.0배 줄이면서 전체 그래디언트를 쓸 때와 비슷한 성능을 유지했다.

정리하면 데이터 정제는 '규칙으로 버리기'에서 '모델로 채점하기'로, 다시 '어떤 데이터가 모델을 어떻게 바꿀지 따져 고르기'로 옮겨 가고 있다. 사전 학습뿐 아니라 파인튜닝·정렬 같은 사후 학습 단계에서도 데이터 선별이 따로 연구되고 있다.

한계와 쟁점

가장 먼저 부딪히는 문제는 균형이다. FineWeb논문은 너무 많이 걸러내면 범용 모델을 사전 학습하기에 데이터가 모자라게 된다고 지적한다. 데이터 제약 스케일링 연구논문도 웹 텍스트가 곧 바닥날 수 있다는 걱정에서 출발했고, 대안으로 코드 데이터 섞기나 흔히 쓰는 필터 일부를 빼는 방법을 실험했다. 품질과 양은 서로 맞바꾸는 관계다.

둘째는 안전 문제다. 품질 기반 선별 이후의 오염 공격 연구논문는 품질 필터가 대놓고 해로운 샘플은 많이 걸러내지만, 걸러지지 않고 남은 '품질 좋은' 샘플이 오히려 모델의 안전 정렬을 무너뜨릴 수 있음을 보였다. 연구진이 만든 Bi-QSTO는 품질 기준을 통과하도록 오염 샘플을 다듬는 방법으로, 데이터의 90%를 걸러내는 강한 필터에서도 오염 샘플의 90% 넘게가 살아남았다. 품질이 높다는 것이 안전하다는 뜻은 아니다.

셋째는 평가의 함정이다. 중복 제거 연구논문가 보였듯 학습·평가 데이터가 겹치면 점수가 부풀려진다. 필터 성능을 벤치마크 점수로 고르다 보면 그 벤치마크에 유리한 데이터만 남길 위험도 있다. FineWeb-Edu논문가 MMLU·ARC처럼 지식 중심 벤치마크에서 특히 좋았다는 결과도, 어떤 벤치마크로 재느냐에 따라 '좋은 데이터'의 뜻이 달라질 수 있음을 보여 준다.

넷째로 합성 데이터에는 만든 모델의 수준과 성향이 그대로 묻어난다. phi-1논문은 GPT-3.5로 만든 데이터에 기대었으므로, 합성 데이터의 품질은 그것을 만든 모델과 프롬프트 설계에 달려 있다.

더 공부하려면

처음이라면 중복 제거 연구논문부터 읽기를 권한다. 문제 제기, 두 가지 중복 제거 방법, 효과가 짧고 분명하게 정리돼 있어 데이터 정제가 왜 중요한지 감을 잡기 좋다. 이어서 FineWeb논문을 읽으면 실제 대규모 정제 파이프라인이 어떤 선택의 연속인지, 각 선택을 실험으로 어떻게 검증하는지 볼 수 있다.

품질 점수에 관심이 있다면 데이터 가지치기 연구논문와 Edu-QuRating논문을 이어 읽으면 단순 점수에서 여러 기준 채점으로 넘어가는 흐름이 보인다. 합성 데이터는 phi-1 논문논문, 데이터가 모자랄 때의 전략은 데이터 제약 스케일링 연구논문가 출발점이다.

이미지·텍스트 같은 멀티모달 데이터는 DataComp논문가 데이터 실험을 어떻게 공정하게 설계하는지 보여 준다. 실무에서 사후 학습 데이터를 고르는 비용이 고민이면 LESSER논문를, 데이터 파이프라인의 보안이 걱정이면 품질 선별 이후의 오염 공격 연구논문를 함께 보면 좋다.

관련 용어

합성 데이터 데이터 오염 사전 학습 스케일링 법칙 파인튜닝 LLM-as-a-Judge 과적합 벤치마크

참고 문헌

핵심 논문

최근 연구

참고 영상·강의

영상은 본문의 근거로 쓰지 않았고, 더 알아보려는 분을 위한 링크입니다.

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.