← AI 용어집

AI 용어집 · 심화 · 데이터·평가 · 언어 모델

데이터 믹스 Data Mixture

데이터 믹스는 AI 모델을 학습시킬 때 웹 문서, 코드, 책, 수학, 여러 언어 같은 서로 다른 데이터를 어떤 비율로 섞을지 정한 조합입니다. 같은 양의 데이터라도 섞는 비율에 따라 모델의 능력이 달라집니다.

쉽게 말하면 식단을 짜는 일과 비슷합니다. 같은 칼로리라도 탄수화물·단백질·채소 비율에 따라 몸이 달라지듯, 모델도 무엇을 얼마나 먹었느냐에 따라 잘하는 일이 달라집니다.

어떻게 작동하나

먼저 학습 데이터를 출처나 종류별로 묶습니다. 예를 들어 일반 웹 글, 코드, 학술 논문, 수학 문제, 대화, 다른 언어 문서 같은 묶음입니다. 그리고 각 묶음을 학습 중에 얼마나 자주 보여 줄지 비율을 정합니다. 품질이 높지만 양이 적은 데이터는 여러 번 반복해 보여 주기도 하고, 양이 많지만 품질이 낮은 웹 데이터는 줄이기도 합니다. 학습 단계별로 비율을 바꿔, 후반에 고품질 데이터 비중을 높이는 방식도 쓰입니다.

왜 중요한가

사전학습에는 막대한 계산 비용이 들기 때문에 한 번 정한 데이터 믹스를 되돌리기 어렵습니다. 코드 비중을 높이면 코딩과 논리적 추론이 좋아질 수 있지만 다른 능력이 상대적으로 약해질 수 있어, 비율은 늘 맞바꿈입니다. 그래서 많은 연구팀이 작은 모델로 여러 비율을 먼저 실험해 보고 결과가 좋은 조합을 큰 모델에 적용합니다. 모델 구조가 비슷해진 지금은 데이터 믹스가 모델 간 성능 차이를 만드는 핵심 요소로 꼽힙니다.

데이터 믹스를 찾는 반복

  1. 1. 비율 정하기 웹·코드·수학 등
  2. 3. 능력 평가 벤치마크 등
  3. 4. 비율 조정 부족한 능력 보강
작은 모델로 여러 비율을 시험하고, 결과를 보고 다시 조정하는 과정을 반복합니다.

알아 둘 점

작은 모델에서 좋았던 비율이 큰 모델에서도 똑같이 좋으리라는 보장은 없습니다. 또 벤치마크 점수만 보고 비율을 조정하면 특정 시험에만 강한 모델이 될 수 있습니다. 대부분의 기업은 자사 모델의 정확한 데이터 믹스를 공개하지 않아, 외부에서 비교하기 어렵습니다. 데이터 필터링, 중복 제거 같은 정제 작업과 함께 봐야 효과를 제대로 판단할 수 있습니다.

예시

오픈웨이트 LLM을 만드는 연구팀은 기술 보고서에서 웹 문서, 코드, 수학, 다국어 데이터를 어떤 원칙으로 섞었는지 설명하곤 합니다. 예를 들어 코딩 능력을 강조하는 모델은 코드 데이터 비중을 높이고, 한국어 같은 특정 언어를 잘하는 모델을 만들 때는 그 언어 문서 비중을 의도적으로 늘립니다. 소버린 AI를 내세우는 국가별 모델도 자국어 데이터를 얼마나 섞느냐가 핵심 설계 결정이 됩니다.

함께 보면 좋은 용어