AI 용어집 · 입문 · 데이터 엔지니어링 · 데이터·평가
데이터 라벨링 Data Labeling, 어노테이션
데이터 라벨링은 사진·글·음성·영상 같은 원본 데이터에 '이것은 고양이다', '이 문장은 부정적이다'처럼 정답 표시(라벨)를 붙이는 작업이다. 어노테이션이라고도 부르며, AI가 무엇을 배워야 하는지 알려 주는 교재를 만드는 일이다.
어떻게 작동하나
먼저 무엇을 어떻게 표시할지 기준(가이드라인)을 정한다. 작업자가 그 기준에 따라 이미지에 상자를 그리거나, 문장에 감정을 고르거나, 음성을 글로 받아 적는 식으로 라벨을 붙인다. 같은 데이터를 여러 사람이 라벨링해 의견이 맞는지 비교하고, 엇갈리는 부분은 검수자가 확인한다. 이렇게 만든 데이터로 모델을 학습시키고, 모델이 자주 틀리는 사례를 모아 다시 라벨링하는 과정을 반복한다.
라벨링 반복 고리
더 나은 학습 데이터
- 1기준 정하기
- 2라벨 붙이기
- 3검수
- 4모델 학습
- 5틀린 사례 모으기
- 1. 기준 정하기 가이드라인 작성
- 2. 라벨 붙이기 작업자가 표시
- 3. 검수 엇갈린 라벨 확인
- 5. 틀린 사례 모으기 다시 라벨링 대상으로
왜 중요한가
정답을 보며 배우는 지도 학습은 라벨이 붙은 데이터 없이는 시작할 수 없다. LLM 시대에도 라벨링은 여전히 중요한데, 좋은 답변 예시를 사람이 써 주는 SFT나, 두 답변 중 어느 쪽이 나은지 사람이 고르는 RLHF용 선호 데이터도 넓게 보면 라벨링이다. 라벨의 정확도와 일관성이 모델 품질을 직접 좌우하기 때문에 데이터 품질 관리의 핵심 영역이기도 하다.
알아 둘 점
라벨링은 사람 손이 많이 들어 비용과 시간이 크다. 그래서 요즘은 AI 모델이 먼저 라벨을 달고 사람이 검수만 하는 방식, 또는 모델이 직접 학습용 데이터를 만드는 합성 데이터가 함께 쓰인다. 하지만 자동 라벨도 틀릴 수 있어 사람의 검수가 완전히 사라지지는 않는다. 또 작업자마다 판단이 다를 수 있으므로 기준을 명확히 쓰는 것이 결과의 일관성을 좌우한다.
예시
로봇 학습에서는 사람이 물건을 집거나 옮기는 장면을 담은 영상에 '어떤 동작을 했는지'를 표시한 데이터가 필요하다. 이 사이트에 소개된 트웰브랩스의 '페가수스 1.6' 소식처럼, 영상을 이해하는 VLM을 이용해 1인칭 영상을 로봇 학습 데이터로 바꾸려는 시도가 나오고 있다. 사람이 일일이 하던 라벨링의 일부를 AI가 대신 맡는 흐름을 보여 주는 사례다.
이 사이트에서 나온 사례
- 브리핑 트웰브랩스, 1인칭 영상을 로봇 학습 데이터로 바꾸는 VLM '페가수스 1.6' 출시(보도) 2026-10-07