← AI 용어집

AI 용어집 · 기초 · 데이터 엔지니어링 · 안전·정렬

개인정보 비식별화 PII Masking, De-identification

개인정보 비식별화는 이름·전화번호·주민등록번호처럼 특정 사람을 알아볼 수 있는 정보(PII, 개인 식별 정보)를 지우거나 다른 값으로 바꿔서 누구의 데이터인지 알 수 없게 만드는 것이다. AI 학습·분석에 데이터를 쓰기 전에 거치는 기본 보호 절차다.

쉽게 말하면 공개하는 서류에서 이름과 주소에 검은 펜을 칠해 가리는 것과 비슷하다. 다만 가린 부분 말고 다른 정보(나이·동네·직업)를 조합해도 누군지 알아낼 수 있어서, 펜으로 몇 군데 칠한다고 끝나는 일은 아니다.

어떻게 작동하나

먼저 데이터에서 개인정보가 어디 있는지 찾는다. 표의 열처럼 위치가 정해진 정보는 쉽게 찾지만, 상담 기록·이메일 같은 자유로운 글에서는 규칙(정규표현식)이나 AI 모델로 이름·주소·계좌번호 같은 항목을 자동으로 찾아낸다. 찾은 정보는 목적에 맞게 처리한다. '홍길동'을 '***'로 가리는 마스킹, '고객A'처럼 다른 이름으로 바꾸는 가명처리, '34세'를 '30대'로 넓히는 범주화, 아예 지우는 삭제 등이 있다. 마지막으로 남은 정보를 조합해 다시 사람을 알아낼 수 있는지(재식별 위험) 점검한다.

왜 중요한가

LLM은 학습 데이터 속 문장을 그대로 기억했다가 답변에 내보낼 수 있다. 학습 데이터에 고객 전화번호가 섞여 있으면 모델이 엉뚱한 사람에게 그 번호를 알려 줄 위험이 생긴다. 또 사내 문서를 RAG로 연결하거나 외부 AI API에 프롬프트를 보낼 때도 개인정보가 함께 빠져나갈 수 있다. 그래서 많은 나라의 개인정보 법규가 데이터를 분석·활용하기 전에 적절한 비식별 조치를 하도록 요구하며, 기업이 AI를 도입할 때 가장 먼저 부딪히는 관문이 된다.

알아 둘 점

가명처리와 익명처리는 다르다. 가명처리는 따로 보관한 '연결표'가 있으면 원래 사람을 되찾을 수 있어 여전히 개인정보로 다뤄지는 경우가 많고, 익명처리는 어떤 방법으로도 되돌릴 수 없게 만든 상태를 말한다. 너무 많이 가리면 데이터가 쓸모없어지고, 너무 적게 가리면 보호가 안 되므로 활용도와 안전 사이에서 균형을 잡아야 한다. 자동 탐지 도구도 놓치는 경우가 있어서, 중요한 데이터는 사람이 표본을 검토하는 절차를 함께 두는 것이 좋다.

원본에서 익명까지

← 원본 그대로(누군지 바로 앎)완전 익명(되돌릴 수 없음) →
1234
  1. 마스킹(일부 가리기)
  2. 가명처리(연결표 따로 보관)
  3. 범주화·삭제
  4. 익명처리
오른쪽으로 갈수록 사람을 알아보기 어렵지만 데이터의 쓸모도 줄어든다. 목적에 맞는 지점을 고른다.

예시

고객센터 상담 기록으로 상담 요약 AI를 만드는 회사라면, 학습에 쓰기 전에 기록 속 고객 이름을 '고객A'로, 전화번호와 카드번호를 '[전화번호]'·'[카드번호]' 같은 표시로 자동 치환한다. 사내 직원이 외부 챗봇에 질문할 때 중간의 LLM 게이트웨이가 프롬프트 속 주민등록번호를 찾아 가린 뒤 내보내는 방식도 널리 쓰인다.

함께 보면 좋은 용어