AI 용어집 · 기초 · 데이터 엔지니어링 · 안전·정렬
데이터 거버넌스 Data Governance
데이터 거버넌스는 조직이 가진 데이터를 누가, 어떤 규칙으로, 어떻게 관리하고 쓸지 정하고 지키게 하는 체계다. 데이터의 책임자, 접근 권한, 품질 기준, 보관·삭제 규칙 등을 모두 포함한다.
어떻게 작동하나
먼저 데이터마다 책임자(데이터 오너)를 정하고, 그 데이터가 무엇을 뜻하는지 정의를 문서로 남긴다. 다음으로 누가 어떤 데이터를 볼 수 있는지 접근 권한을 나누고, 개인정보처럼 민감한 데이터는 따로 표시해 더 엄격하게 다룬다. 데이터가 어디서 와서 어디로 흘러가는지(데이터 계보)를 추적하고, 품질 기준을 정해 정기적으로 점검한다. 이런 규칙은 위원회나 담당 조직이 정하고, 데이터 카탈로그 같은 도구로 실제 시스템에 적용한다.
거버넌스 기본 점검 항목
책임과 정의
- 데이터마다 책임자가 정해져 있는가
- 데이터의 뜻이 문서로 정의되어 있는가
보호와 권한
- 누가 어떤 데이터를 볼 수 있는지 나뉘어 있는가
- 민감한 데이터가 따로 표시되어 있는가
추적과 품질
- 데이터가 어디서 와서 어디로 가는지 추적되는가
- 품질 기준을 정기적으로 점검하는가
왜 중요한가
AI 모델은 학습하고 참고하는 데이터만큼만 좋아진다. 출처가 불분명하거나 권한 없이 쓴 데이터로 모델을 만들면 결과를 믿기 어렵고, 개인정보 유출이나 저작권 문제로 이어질 수 있다. 또 부서마다 같은 지표를 다르게 정의하면 같은 질문에 서로 다른 답이 나온다. 각국의 AI·개인정보 규제가 강해지면서, 어떤 데이터를 어떻게 썼는지 설명할 수 있는 체계가 사업의 필수 조건이 되고 있다.
알아 둘 점
거버넌스는 도구를 하나 도입한다고 끝나는 일이 아니라 사람·절차·기술이 함께 맞물려야 한다. 규칙을 너무 엄격하게 만들면 데이터를 쓰려는 사람이 절차에 지쳐 우회로를 찾게 된다. 그래서 위험이 큰 데이터부터 단계적으로 적용하는 경우가 많다. 데이터 품질 관리, 개인정보 비식별화 같은 활동은 거버넌스라는 큰 틀 안에 들어가는 세부 활동이라고 보면 된다.
예시
기업이 사내 문서를 바탕으로 질문에 답하는 RAG 챗봇을 만들 때, 데이터 거버넌스가 없으면 인사 기록이나 임원 보고서처럼 일부 직원만 봐야 할 문서까지 모든 사용자에게 답변 근거로 노출될 수 있다. 그래서 많은 기업은 문서마다 보안 등급과 접근 권한을 붙여 두고, 검색 단계에서 질문한 사람의 권한에 맞는 문서만 꺼내도록 설계한다.