← AI 용어집

AI 용어집 · 기초 · 데이터 엔지니어링

데이터 파이프라인 Data Pipeline, ETL·ELT

데이터 파이프라인은 여러 곳에 흩어진 데이터를 모으고, 쓰기 좋게 다듬고, 필요한 저장소로 옮기는 일을 자동으로 이어 붙인 처리 흐름입니다. 단계 순서에 따라 ETL(추출→변환→적재)과 ELT(추출→적재→변환) 방식으로 나눕니다.

쉽게 말하면 정수장에 비유할 수 있습니다. 강물(원본 데이터)을 끌어와 거르고 소독(변환)한 뒤 수도관으로 각 가정(분석·AI 서비스)에 보내는 과정이 날마다 자동으로 돌아갑니다. 다만 데이터는 물과 달리 같은 원본을 여러 용도에 맞게 다르게 가공할 수 있습니다.

어떻게 작동하나

먼저 앱의 데이터베이스, 웹 로그, 외부 서비스 API, 엑셀 파일처럼 여러 원천에서 데이터를 꺼냅니다(추출, Extract). 이어서 형식을 맞추고, 중복이나 빠진 값을 정리하고, 필요한 계산을 붙입니다(변환, Transform). 마지막으로 정리된 데이터를 데이터 웨어하우스 같은 저장소에 넣습니다(적재, Load). 이 과정은 정해진 시간마다 한꺼번에 처리하는 배치 방식이나, 데이터가 생기는 즉시 흘려보내는 스트리밍 방식으로 돌립니다.

ETL 파이프라인의 흐름앱 데이터베이스 → 추출; 웹 로그 → 추출; 외부 API·파일 → 추출; 추출 → 변환; 변환 → 데이터 웨어하우스(적재); 데이터 웨어하우스 → 대시보드·보고서; 데이터 웨어하우스 → 머신러닝·RAG앱 데이터베이스웹 로그외부 API·파일추출Extract변환형식 맞춤·정리데이터 웨어하우스Load(적재)대시보드·보고서머신러닝·RAG적재
ETL 파이프라인의 흐름 왼쪽의 여러 원천에서 데이터를 꺼내 다듬은 뒤 저장소에 넣고, 저장소의 데이터를 분석과 AI가 씁니다. 원천의 종류는 예시입니다.

ETL과 ELT는 무엇이 다른가

ETL은 저장소에 넣기 전에 변환을 마칩니다. 저장 공간과 계산 자원이 비쌌던 시절에 흔했던 방식으로, 정리된 데이터만 저장한다는 장점이 있습니다. ELT는 원본을 일단 저장소에 그대로 넣은 뒤 저장소 안에서 변환합니다. 클라우드 데이터 웨어하우스의 계산 능력이 커지면서 많이 쓰이게 됐고, 원본이 남아 있어 나중에 다른 방식으로 다시 가공하기 쉽습니다.

ETL 대 ELT

ETL추출 → 변환 → 적재

  • 정리된 데이터만 저장
  • 저장 자원이 비쌀 때 유리
  • 다시 가공하려면 원천에서 다시 꺼내야 함

ELT추출 → 적재 → 변환

  • 원본을 그대로 저장
  • 저장소 안의 계산 능력으로 변환
  • 나중에 다른 방식으로 다시 가공하기 쉬움

공통 둘 다 흩어진 데이터를 분석할 수 있는 한곳으로 모으는 방법

변환을 저장소에 넣기 전에 하느냐, 넣은 뒤에 하느냐의 차이입니다.

왜 중요한가

대시보드, 보고서, 머신러닝 모델, RAG 챗봇 모두 결국 파이프라인이 실어 나른 데이터를 씁니다. 파이프라인이 멈추거나 잘못된 값을 흘려보내면 그 뒤의 모든 결과가 틀려집니다. 그래서 AI 프로젝트에서 모델보다 데이터 파이프라인을 만드는 데 더 많은 시간이 드는 경우가 흔합니다.

알아 둘 점

원천 시스템의 형식이 예고 없이 바뀌면 파이프라인이 깨지기 쉬우므로 실패를 알려 주는 모니터링이 필요합니다. 단계 사이의 순서와 재실행을 관리하기 위해 Apache Airflow 같은 워크플로 관리 도구를 함께 쓰는 경우가 많습니다. 데이터 품질 검사와 개인정보 처리도 파이프라인 안에 넣어 두는 것이 좋습니다.

예시

쇼핑몰이라면 매일 새벽 주문 DB, 회원 DB, 광고 플랫폼의 성과 데이터를 꺼내 하나의 데이터 웨어하우스로 모읍니다. 아침에 출근한 마케터는 이 데이터를 바탕으로 갱신된 매출 대시보드를 보고, 데이터 과학자는 같은 데이터로 추천 모델을 다시 학습합니다. 사내 문서 검색 챗봇을 만들 때도 문서를 모아 청킹하고 임베딩해 벡터 DB에 넣는 임베딩 파이프라인이 같은 원리로 돌아갑니다.

함께 보면 좋은 용어