← AI 용어집

AI 용어집 · 입문 · 데이터 엔지니어링

배치 처리 Batch Processing

배치 처리(Batch Processing)는 데이터를 일정 기간 모아 두었다가 정해진 시점에 한꺼번에 처리하는 방식이다. 매일 밤 하루치 매출을 집계하는 일이 대표적이다.

쉽게 말하면 빨래를 나올 때마다 하나씩 빨지 않고 바구니에 모았다가 저녁에 세탁기로 한 번에 돌리는 것과 같다. 효율은 좋지만, 급하게 입을 옷이 있으면 기다려야 한다는 한계도 같다.

어떻게 작동하나

하루 동안 쌓인 주문 기록이나 로그 파일처럼 정해진 범위의 데이터를 모아 둔다. 스케줄러가 정해진 시각(예: 매일 새벽)이 되면 작업을 시작한다. 처리 엔진은 모인 데이터를 한꺼번에 읽어 정리·변환·집계하고, 결과를 데이터 웨어하우스나 파일로 저장한다. 데이터가 크면 여러 대의 컴퓨터에 나눠 동시에 처리해 시간을 줄인다.

배치 작업의 순서

  1. 1
    데이터 모으기주문 기록·로그 파일
  2. 2
    정해진 시각에 시작스케줄러가 실행
  3. 3
    한꺼번에 처리정리·변환·집계
  4. 4
    결과 저장데이터 웨어하우스·파일
모으고, 정해진 시각에 시작해, 한꺼번에 처리하고 저장하는 흐름이다.

왜 중요한가

많은 양의 데이터를 한 번에 처리하므로 같은 일을 작은 단위로 계속하는 것보다 효율적이고 비용이 적게 드는 경우가 많다. 구조가 단순해 만들고 운영하기 쉽고, 실패하면 같은 작업을 다시 돌리면 되므로 복구도 수월하다. 월간 리포트, 정산, ETL로 데이터 웨어하우스 채우기 같은 일은 대부분 배치로 처리한다. AI 분야에서도 학습 데이터 정제, 대량 문서 임베딩, 모델 평가처럼 즉시 응답이 필요 없는 큰 작업에 널리 쓰인다.

알아 둘 점

결과는 마지막 실행 시점 기준이라 그 사이에 생긴 데이터는 반영되지 않는다. 그래서 몇 초 안에 반응해야 하는 사기 탐지나 실시간 추천에는 맞지 않고, 이런 일에는 스트림 처리를 쓴다. 작업끼리 순서가 얽혀 있으면 앞 작업이 실패했을 때 뒤 작업이 잘못된 데이터를 쓰지 않도록 의존 관계를 관리해야 한다. 실행 주기를 짧게 줄인 '짧은 주기 배치'로 실시간성과 효율 사이의 균형을 맞추기도 한다.

배치 처리 vs 스트림 처리

배치 처리모아서 한꺼번에

  • 대량 처리에 효율적
  • 구조가 단순하고 다시 돌리기 쉬움
  • 마지막 실행 이후 데이터는 반영 안 됨

스트림 처리생기는 즉시

  • 몇 초 안에 반응
  • 늦게 온 데이터 처리가 까다로움
  • 항상 켜 두어야 해 운영 부담

공통 둘 다 데이터 파이프라인의 처리 방식

두 방식은 경쟁보다는 역할 분담 관계로 함께 쓰인다.

예시

온라인 쇼핑몰은 매일 새벽 전날 하루치 주문·반품·방문 로그를 배치 작업으로 모아 매출과 재고를 집계하고, 아침 출근 시간에 맞춰 대시보드를 갱신한다. 같은 배치 작업에서 고객별 구매 이력을 정리해 추천 시스템이 쓸 피처도 만들어 둔다. LLM 서비스 회사도 즉시 답이 필요 없는 대량 문서 요약이나 분류를 모아서 한꺼번에 처리하는 배치 방식을 쓰곤 한다.

함께 보면 좋은 용어