← AI 용어집

AI 용어집 · 기초 · 데이터 엔지니어링

데이터 레이크 Data Lake

데이터 레이크는 표 형태의 데이터부터 로그, 이미지, 문서까지 온갖 데이터를 원래 모습 그대로 값싸게 한곳에 모아 두는 대용량 저장소다. 미리 형식을 정하지 않고 일단 저장한 뒤, 쓸 때 필요한 방식으로 읽는다.

쉽게 말하면 모든 물건을 일단 분류 없이 넣어 두는 큰 창고와 같다. 무엇이든 넣을 수 있어 편하지만, 목록과 정리 규칙이 없으면 필요한 물건을 찾을 수 없는 '잡동사니 창고'가 되기 쉽다.

어떻게 작동하나

데이터 레이크는 보통 클라우드의 객체 저장소처럼 싸고 거의 무한히 늘릴 수 있는 공간 위에 만든다. 데이터베이스 표, 서버 로그, 센서 기록, PDF, 이미지, 음성 파일을 원래 형식 그대로 파일로 저장한다. 저장할 때 구조를 강제하지 않고, 분석할 때 필요한 구조를 붙여 읽는 방식을 쓴다. 실무에서는 원본을 담는 구역, 정리한 데이터를 담는 구역, 바로 분석에 쓰는 데이터를 담는 구역처럼 단계별로 나눠 관리하는 경우가 많다.

왜 중요한가

AI 학습에는 표 데이터뿐 아니라 글·이미지·음성 같은 비정형 데이터가 대량으로 필요하다. 데이터 웨어하우스는 정리된 표 데이터에 강하지만, 이런 다양한 원본을 그대로 담기에는 비싸고 불편하다. 데이터 레이크는 '나중에 어떻게 쓸지 몰라도 일단 보관'할 수 있게 해 주어, 새 분석이나 모델 학습이 필요해졌을 때 원본에서 다시 시작할 수 있게 한다. 그래서 ELT 방식의 데이터 파이프라인과 함께 자주 쓰인다.

데이터 레이크와 웨어하우스

데이터 레이크원본 그대로 보관

  • 글·이미지·로그 등 무엇이든
  • 저장할 때 구조를 강제하지 않음
  • 값싸게 대용량 보관
  • 관리 없으면 '데이터 늪'

데이터 웨어하우스정리된 표 데이터

  • 정형 데이터 분석에 강함
  • 미리 정한 구조로 저장
  • 비정형 원본 보관엔 불편

공통 둘의 장점을 합친 구조가 데이터 레이크하우스

무엇이든 원본 그대로 담는 창고와, 정리된 표만 담는 분석용 저장소의 차이다.

알아 둘 점

아무 규칙 없이 데이터를 쌓기만 하면 무엇이 어디 있는지, 믿을 만한지 아무도 모르는 '데이터 늪(data swamp)'이 된다. 이를 막으려면 데이터 카탈로그로 목록을 관리하고, 데이터 거버넌스로 접근 권한과 품질 규칙을 정해야 한다. 또 파일 단위로 저장하다 보니 기존 데이터베이스처럼 수정·삭제를 안전하게 처리하기 어려운 약점이 있었다. 이 약점을 보완해 웨어하우스의 장점을 합친 구조가 데이터 레이크하우스다.

예시

동영상 서비스가 시청 로그, 자막 파일, 썸네일 이미지, 고객 문의 기록을 모두 데이터 레이크에 원본 그대로 쌓아 두는 경우를 생각할 수 있다. 분석팀은 여기서 시청 로그를 꺼내 이용 통계를 만들고, AI팀은 같은 저장소의 자막과 문의 기록을 꺼내 추천 모델이나 상담 챗봇 학습 데이터로 쓴다.

함께 보면 좋은 용어