← AI 용어집

AI 용어집 · 기초 · 데이터 엔지니어링

데이터 카탈로그 Data Catalog

데이터 카탈로그는 회사 안에 어떤 데이터가 어디에 있고, 무슨 뜻이며, 누가 관리하고, 믿고 써도 되는지를 한곳에서 찾아볼 수 있게 정리한 목록이자 검색 서비스다.

쉽게 말하면 도서관의 도서 검색 시스템과 같다. 책 자체가 아니라 제목·저자·위치·대출 가능 여부 같은 '책에 대한 정보'를 모아 두어, 서가를 다 뒤지지 않아도 원하는 책을 찾게 해 준다.

어떻게 작동하나

데이터 카탈로그는 데이터 자체가 아니라 데이터에 대한 정보, 즉 메타데이터를 모은다. 데이터베이스, 데이터 레이크, 웨어하우스 등을 자동으로 훑어 표 이름, 열 구조, 갱신 시각 같은 기술 정보를 수집한다. 여기에 사람이 '이 표의 매출은 부가세 포함' 같은 업무 설명, 담당자, 민감 정보 여부 같은 태그를 덧붙인다. 사용자는 검색창에 '월별 매출'처럼 입력해 관련 데이터를 찾고, 설명과 품질 정보를 확인한 뒤 사용한다.

카탈로그가 만들어지고 쓰이는 순서

  1. 1
    자동 수집표 이름·열 구조·갱신 시각
  2. 2
    설명 덧붙이기업무 의미·담당자·민감 정보 태그
  3. 3
    검색'월별 매출'처럼 찾기
  4. 4
    확인 후 사용설명·품질 보고 판단
자동 수집한 기술 정보에 사람이 업무 설명을 더해, 사용자가 검색해서 쓰는 흐름이다.

왜 중요한가

회사 데이터가 많아질수록 '이 데이터가 있긴 한가', '비슷한 표가 여러 개인데 어떤 게 맞나'를 묻는 데 시간이 많이 든다. 카탈로그가 있으면 분석가나 AI 개발자가 담당자에게 일일이 묻지 않고 스스로 데이터를 찾을 수 있다. 개인정보가 담긴 데이터를 표시해 두면 함부로 쓰는 일을 막을 수 있어 데이터 거버넌스의 기반이 된다. 데이터 레이크가 '데이터 늪'이 되지 않게 막는 핵심 도구이기도 하다.

알아 둘 점

카탈로그는 만드는 것보다 최신 상태로 유지하는 것이 더 어렵다. 기술 정보는 자동으로 모을 수 있지만, 업무 의미나 담당자 같은 정보는 사람이 꾸준히 채워야 해서 방치되기 쉽다. 그래서 데이터가 어디서 와서 어디로 흘러가는지 보여 주는 데이터 리니지, 품질 점검 결과 등을 함께 연결해 '살아 있는' 목록으로 만드는 경우가 많다. 최근에는 LLM이 표와 열 설명 초안을 자동으로 써 주거나, Text-to-SQL 같은 기능이 카탈로그의 설명을 참고해 정확도를 높이는 방식으로도 활용된다.

예시

한 금융사의 데이터 분석가가 '고객 이탈 예측 모델'을 만들려고 사내 데이터 카탈로그에서 '해지'를 검색하는 장면을 떠올려 보자. 검색 결과에서 해지 이력 표를 찾고, 설명란에서 각 열의 뜻과 담당 부서, 개인정보 포함 표시를 확인한 뒤, 접근 권한을 신청해 바로 분석을 시작할 수 있다.

함께 보면 좋은 용어