← AI 용어집

AI 용어집 · 기초 · 데이터 엔지니어링 · 컴퓨터 비전

데이터 증강 Data Augmentation

데이터 증강은 이미 가진 학습 데이터를 조금씩 바꾸거나 변형해서 새로운 학습 예시를 늘리는 것이다. 데이터를 새로 모으지 않고도 모델이 더 다양한 경우를 보고 배우게 해 준다.

쉽게 말하면 수학 문제집 한 권을 풀고 나서, 같은 문제의 숫자만 바꾸거나 문장을 다르게 써서 연습 문제를 더 만들어 푸는 것과 같다. 다만 원래 문제집에 없던 유형까지 새로 생기지는 않는다는 한계가 있다.

어떻게 작동하나

원래 데이터의 '정답'은 그대로 두고 겉모습만 바꾼다. 고양이 사진을 좌우로 뒤집거나 조금 자르거나 밝기를 바꿔도 여전히 고양이이므로, 사진 한 장에서 여러 장의 학습 예시를 얻는다. 글이라면 같은 뜻을 다른 표현으로 바꿔 쓰거나, 다른 언어로 번역했다가 다시 되돌리는 역번역을 쓴다. 음성은 배경 잡음을 섞거나 말 속도를 바꾼다. 최근에는 LLM에게 비슷한 예시를 새로 써 달라고 해서 데이터를 늘리는 방법도 많이 쓰이는데, 이는 합성 데이터와 경계가 겹친다.

데이터 종류별 증강 방법

  • 데이터 증강
    • 이미지
      • 좌우 뒤집기
      • 자르기
      • 밝기 바꾸기
    • 텍스트
      • 바꿔 쓰기
      • 역번역
      • LLM으로 예시 생성
    • 음성
      • 잡음 섞기
      • 속도 바꾸기
데이터 형태마다 '정답을 바꾸지 않는 변형'이 다르다. 본문에 나온 대표 방법을 묶었다.

왜 중요한가

모델은 학습 때 본 데이터와 비슷한 상황에서만 잘 작동하는 경향이 있다. 데이터가 적으면 모델이 학습 데이터를 통째로 외워 버려 새 데이터에서 성적이 떨어지는 과적합이 생기기 쉽다. 증강은 같은 대상의 다양한 모습을 보여 줘서 모델이 '본질적인 특징'에 집중하도록 돕는다. 의료 영상이나 불량품 사진처럼 데이터를 모으기 어렵고 라벨링 비용이 비싼 분야에서 특히 효과가 크다.

알아 둘 점

변형이 정답을 바꾸면 오히려 해가 된다. 숫자 '6'을 뒤집으면 '9'가 되고, 문장을 바꿔 쓰다 부정어가 빠지면 뜻이 반대가 된다. 그래서 어떤 변형이 안전한지는 데이터와 과제마다 따로 판단해야 한다. 또 증강은 원래 데이터의 범위 안에서 다양성을 늘릴 뿐이라, 처음부터 빠져 있던 상황(예: 야간 사진이 전혀 없음)을 채워 주지는 못한다. 평가용 데이터에는 증강을 섞지 않아야 실력을 정직하게 잴 수 있다.

예시

공장의 불량품 검사 AI를 만들 때 불량 사진은 정상 사진보다 훨씬 적다. 이때 몇 안 되는 불량 사진을 회전·확대·밝기 조절해 여러 장으로 늘려 학습시키면 조명이나 각도가 조금 달라도 불량을 잘 찾는 모델이 된다. 챗봇 의도 분류 모델에서는 '환불하고 싶어요'라는 예시를 LLM으로 '돈 돌려받을 수 있나요?' 같은 여러 표현으로 늘려 학습시키기도 한다.

함께 보면 좋은 용어