AI 용어집 · 기초 · 데이터 엔지니어링
ETL·ELT 추출·변환·적재
ETL·ELT는 여러 곳에 흩어진 데이터를 꺼내(Extract) 쓰기 좋은 형태로 바꾸고(Transform) 한곳에 옮겨 담는(Load) 작업 방식이다. 바꾸는 일을 담기 전에 하면 ETL, 담은 뒤에 하면 ELT라고 부른다.
어떻게 작동하나
먼저 회원 DB, 주문 시스템, 웹 로그, 외부 서비스처럼 데이터가 있는 곳에서 필요한 데이터를 꺼낸다(추출). 다음으로 날짜 형식을 통일하고, 빠진 값이나 중복을 정리하고, 여러 표를 합치는 등 분석에 맞게 다듬는다(변환). 마지막으로 데이터 웨어하우스나 데이터 레이크 같은 저장소에 담는다(적재). ETL은 변환을 별도 처리 서버에서 마친 뒤 깨끗한 결과만 담고, ELT는 원본을 먼저 저장소에 담은 뒤 저장소 자체의 계산 능력으로 변환한다.
ETL과 ELT의 차이
ETL추출 → 변환 → 적재
- 별도 서버에서 미리 다듬음
- 깨끗한 결과만 저장
- 저장 공간이 비쌀 때 유리
ELT추출 → 적재 → 변환
- 원본을 먼저 저장소에 담음
- 저장소의 계산 능력으로 다듬음
- 나중에 다시 변환하기 쉬움
공통 둘 다 흩어진 데이터를 분석 가능한 형태로 한곳에 모으는 방법
왜 중요한가
AI 모델이든 사내 대시보드든, 결국 '정리된 데이터'가 있어야 제대로 돌아간다. 원본 데이터는 시스템마다 형식과 이름이 제각각이라 그대로 합치면 숫자가 틀리거나 분석이 불가능해진다. ETL·ELT는 이 정리 과정을 매번 손으로 하지 않고 정해진 순서대로 자동 반복하게 해 준다. 그래서 데이터 파이프라인의 가장 기본적인 뼈대로 꼽힌다.
알아 둘 점
예전에는 저장 공간과 계산 비용이 비싸서 미리 다듬어 꼭 필요한 것만 담는 ETL이 일반적이었다. 클라우드 데이터 웨어하우스처럼 저장소 안에서 대량 계산을 싸고 빠르게 할 수 있게 되면서 원본을 먼저 담는 ELT가 널리 쓰이게 되었다. ELT는 원본이 남아 있어 나중에 다른 방식으로 다시 변환하기 쉽지만, 정리되지 않은 데이터가 쌓여 관리가 어려워질 수 있다. 개인정보처럼 저장소에 그대로 넣으면 안 되는 데이터는 ELT에서도 담기 전에 걸러 내는 처리가 필요하다.
예시
온라인 쇼핑몰이 매일 밤 주문 시스템과 회원 DB, 광고 클릭 로그를 꺼내 데이터 웨어하우스에 모은 뒤, '고객별 구매 요약 표'로 다듬어 다음 날 아침 매출 대시보드와 추천 모델 학습에 쓰는 것이 전형적인 ETL·ELT 작업이다. 사내 문서를 모아 RAG용 검색 색인을 만드는 과정도 문서를 꺼내고, 조각내 다듬고, 벡터 DB에 담는다는 점에서 같은 사고방식을 따른다.