멤버십 추론 공격 Membership Inference Attack
멤버십 추론 공격은 어떤 데이터가 AI 모델의 학습에 쓰였는지를 모델의 반응만 보고 알아내려는 공격이다. 학습 데이터가 민감하면 '포함되었다'는 사실만으로도 개인정보가 드러날 수 있다.
어떻게 작동하나
모델은 학습 때 본 데이터에 더 높은 확신을 보이는 경향이 있다. 공격자는 의심 가는 데이터를 모델에 넣고, 출력 확률이나 신뢰도가 유난히 높은지 살펴 '학습에 쓰였다' 또는 '쓰이지 않았다'를 판단한다. 흔히 쓰는 방법은 비슷한 데이터로 연습용 모델(섀도 모델)을 직접 만들어, 본 데이터와 처음 보는 데이터에 대한 반응 차이를 구분하는 판별기를 학습시키는 것이다. LLM에서는 문장의 토큰 확률이 얼마나 높은지를 비교하는 방식이 자주 쓰인다.
학습에 쓰인 데이터 vs 처음 보는 데이터
학습에 쓰인 데이터모델이 본 적 있음
- 확신이 높음
- 토큰 확률이 높음
처음 보는 데이터모델이 본 적 없음
- 확신이 상대적으로 낮음
- 토큰 확률이 낮음
공통 이 차이가 클수록 공격이 잘 통한다
왜 중요한가
예를 들어 특정 질병 환자 데이터로 만든 모델이라면, 어떤 사람의 기록이 학습에 들어갔다는 사실만으로 그 사람이 환자임이 드러난다. 그래서 개인정보 보호 관점에서 모델이 얼마나 안전한지를 재는 대표적 기준으로 쓰인다. 반대로 작가나 기업이 '내 글이 학습에 쓰였는가'를 확인하려는 도구로도 쓰인다. 벤치마크 문제가 학습 데이터에 섞였는지 확인하는 데이터 오염 점검에도 같은 아이디어가 쓰인다.
알아 둘 점
모델이 학습 데이터를 지나치게 외울수록, 즉 과적합이 심할수록 공격이 잘 통한다. 대규모 LLM에서는 판별이 생각보다 어렵다는 지적도 있어 결과를 단정적으로 해석하면 안 된다. 방어로는 차분 프라이버시 적용, 과적합 줄이기, 출력 확률 값을 외부에 그대로 보여 주지 않기 등이 쓰인다. 이 공격은 '있다·없다'만 알아내고, 내용 자체를 꺼내는 것은 학습 데이터 추출이다.
예시
의료·금융처럼 민감한 데이터를 다루는 조직은 모델을 배포하기 전 감사 단계에서 일부러 멤버십 추론 공격을 시도해 본다. 공격이 잘 통하면 개인정보 노출 위험이 크다는 뜻이므로, 차분 프라이버시를 적용하거나 출력 정보를 줄인 뒤 다시 시험해 효과를 확인한다.