AI 용어집 · 심화 · 안전·정렬 · 데이터 엔지니어링
차분 프라이버시 Differential Privacy
차분 프라이버시는 데이터에 계산된 양만큼 '잡음'을 섞어서, 분석 결과만 보고는 특정 개인이 데이터에 들어 있었는지 알아낼 수 없게 만드는 수학적 개인정보 보호 방법이다.
어떻게 작동하나
핵심 아이디어는 '어떤 한 사람의 데이터가 있든 없든 결과가 거의 같아야 한다'는 것이다. 이를 위해 통계값이나 모델 학습 과정에 무작위 잡음을 더해, 한 사람이 결과에 미치는 영향을 숨긴다. 잡음을 얼마나 넣을지는 '프라이버시 예산'이라는 값으로 조절한다. 예산을 작게 잡으면 잡음이 커져 보호는 강해지지만 결과의 정확도가 떨어지고, 크게 잡으면 그 반대가 된다.
프라이버시 예산의 줄다리기
- 예산을 아주 작게
- 용도에 맞춘 균형점
- 예산을 아주 크게
왜 중요한가
이름이나 주민번호를 지우는 단순한 비식별화는 다른 데이터와 맞춰 보면 사람을 다시 찾아낼 수 있는 경우가 있다. 차분 프라이버시는 공격자가 어떤 배경 지식을 가졌든 보호 수준을 수학적으로 보장한다는 점에서 다르다. AI 모델은 학습 데이터 일부를 외워서 그대로 내뱉을 수 있는데, 학습에 차분 프라이버시를 적용하면 이런 개인정보 유출 위험을 줄일 수 있다. 그래서 의료·금융처럼 민감한 데이터를 다루는 분야에서 주목받는다.
알아 둘 점
공짜 보호는 없다. 잡음 때문에 결과나 모델 성능이 떨어지며, 특히 데이터가 적거나 소수 집단에 대한 분석일수록 손해가 크다. 또 같은 데이터를 여러 번 조회하면 예산이 계속 소모되므로 전체 사용량을 관리해야 한다. '차분 프라이버시를 적용했다'는 말만으로는 부족하고, 예산을 얼마로 잡았는지까지 봐야 실제 보호 수준을 알 수 있다.
예시
스마트폰 제조사나 브라우저 회사는 사용자가 자주 쓰는 이모지나 새로 유행하는 단어 같은 통계를 모을 때, 기기에서 미리 잡음을 섞어 보내는 방식으로 차분 프라이버시를 쓴다. 회사는 전체 경향은 파악하지만 개별 사용자의 입력은 알 수 없다. 인구 통계를 공개하는 정부 기관이나, 민감한 데이터로 AI 모델을 학습하는 기업도 같은 원리를 활용한다.