데이터 믹스 Data Mixture
데이터 믹스는 AI 모델을 학습시킬 때 웹 문서, 코드, 책, 수학, 여러 언어 같은 서로 다른 데이터를 어떤 비율로 섞을지 정한 조합입니다. 같은 양의 데이터라도 섞는 비율에 따라 모델의 능력이 달라집니다.
어떻게 작동하나
먼저 학습 데이터를 출처나 종류별로 묶습니다. 예를 들어 일반 웹 글, 코드, 학술 논문, 수학 문제, 대화, 다른 언어 문서 같은 묶음입니다. 그리고 각 묶음을 학습 중에 얼마나 자주 보여 줄지 비율을 정합니다. 품질이 높지만 양이 적은 데이터는 여러 번 반복해 보여 주기도 하고, 양이 많지만 품질이 낮은 웹 데이터는 줄이기도 합니다. 학습 단계별로 비율을 바꿔, 후반에 고품질 데이터 비중을 높이는 방식도 쓰입니다.
왜 중요한가
사전학습에는 막대한 계산 비용이 들기 때문에 한 번 정한 데이터 믹스를 되돌리기 어렵습니다. 코드 비중을 높이면 코딩과 논리적 추론이 좋아질 수 있지만 다른 능력이 상대적으로 약해질 수 있어, 비율은 늘 맞바꿈입니다. 그래서 많은 연구팀이 작은 모델로 여러 비율을 먼저 실험해 보고 결과가 좋은 조합을 큰 모델에 적용합니다. 모델 구조가 비슷해진 지금은 데이터 믹스가 모델 간 성능 차이를 만드는 핵심 요소로 꼽힙니다.
데이터 믹스를 찾는 반복
좋은 비율 찾기
- 1비율 정하기
- 2작은 모델 학습
- 3능력 평가
- 4비율 조정
- 1. 비율 정하기 웹·코드·수학 등
- 3. 능력 평가 벤치마크 등
- 4. 비율 조정 부족한 능력 보강
알아 둘 점
작은 모델에서 좋았던 비율이 큰 모델에서도 똑같이 좋으리라는 보장은 없습니다. 또 벤치마크 점수만 보고 비율을 조정하면 특정 시험에만 강한 모델이 될 수 있습니다. 대부분의 기업은 자사 모델의 정확한 데이터 믹스를 공개하지 않아, 외부에서 비교하기 어렵습니다. 데이터 필터링, 중복 제거 같은 정제 작업과 함께 봐야 효과를 제대로 판단할 수 있습니다.
예시
오픈웨이트 LLM을 만드는 연구팀은 기술 보고서에서 웹 문서, 코드, 수학, 다국어 데이터를 어떤 원칙으로 섞었는지 설명하곤 합니다. 예를 들어 코딩 능력을 강조하는 모델은 코드 데이터 비중을 높이고, 한국어 같은 특정 언어를 잘하는 모델을 만들 때는 그 언어 문서 비중을 의도적으로 늘립니다. 소버린 AI를 내세우는 국가별 모델도 자국어 데이터를 얼마나 섞느냐가 핵심 설계 결정이 됩니다.