← 스터디

스터디 · 2026-10-09 · 심화

AI 프라이버시: 학습 데이터는 새는가 — 멤버십 추론·추출과 차분 프라이버시

AI 모델은 학습 데이터를 요약할 뿐만 아니라 일부를 외워서 내보낼 수 있다. 이 글은 '학습에 썼는가'를 알아내는 멤버십 추론, 외운 문장을 그대로 끌어내는 데이터 추출, 수학적으로 유출을 묶는 차분 프라이버시를 주요 연구 순서대로 정리한다.

핵심 정리

왜 필요했나: '모델은 데이터를 요약할 뿐'이라는 믿음

머신러닝 모델은 보통 수많은 데이터에서 일반적인 규칙만 뽑아낸 결과물로 여겨졌다. 그런데 학습 데이터에는 사람들의 구매 기록, 위치, 병원 기록 같은 민감한 정보가 들어간다. 멤버십 추론 공격 연구논문는 이런 서비스들이 학습 데이터를 쓴다는 점을 짚고 질문을 던졌다. 결과로 나온 모델만 보고 원래 데이터에 대해 무엇을 알아낼 수 있느냐는 것이다.

언어 모델에서는 이 믿음이 더 강했다. GPT-2 학습 데이터 추출 연구논문에 따르면 거대 언어 모델은 중복 제거된 방대한 데이터로 한 번만(1 epoch) 학습하는 경우가 많다. 그래서 과적합(학습 데이터에서만 잘 맞고 새 데이터에서는 성능이 떨어지는 현상)이 거의 보이지 않았다. 이 때문에 '특정 문서를 외우지는 않는다'는 생각이 널리 퍼져 있었다.

이 글이 다루는 연구들은 그 생각이 틀렸음을 단계적으로 보여 준다. 모델은 평균적으로는 외우지 않아도 일부 '최악의 경우' 데이터는 외운다. 그 정보는 API로 질문만 던져도 밖으로 나올 수 있다.

핵심 아이디어: 시험 문제를 외운 학생

기출문제를 외운 학생을 떠올려 보자. 본 적 있는 문제에는 유난히 자신 있고 빠르게 답하고, 처음 보는 문제에는 머뭇거린다. 이 차이만 지켜봐도 '이 문제를 본 적 있구나'를 알아챌 수 있다. 이것이 멤버십 추론이다. 한 걸음 더 나가 문제 앞부분만 불러 주고 외운 답안을 끝까지 읊게 하면, 그게 학습 데이터 추출이다.

두 공격은 목표가 다르다. 멤버십 추론은 '이 기록이 학습 데이터에 있었나?'에 예·아니오로 답한다. 데이터 추출은 학습 데이터의 원문 자체를 꺼내 온다. 의료 데이터처럼 어떤 데이터셋에 들어 있다는 사실만으로 민감한 경우(예: 특정 질환 환자 명단)에는 멤버십 추론만으로도 피해가 생긴다.

방어 쪽 아이디어인 차분 프라이버시(Differential Privacy)는 이렇게 말한다. 학생이 어떤 한 문제를 봤든 안 봤든 겉으로 드러나는 행동이 거의 같다면, 관찰자는 그 문제를 봤는지 알 수 없다. 데이터 하나의 영향력을 수학적으로 작게 묶어 두는 방식이다.

두 공격과 한 방어

멤버십 추론본 적 있지?

  • 학습에 쓰였는지 예·아니오로 판정
  • 학습 때 본 입력에 다르게 반응하는 점을 이용
  • 명단에 있다는 사실만으로도 피해

학습 데이터 추출외운 답 읊게 하기

  • 원문을 그대로 꺼냄
  • 개인정보·코드·UUID까지
  • 한 번만 나온 문장도 가능

차분 프라이버시있든 없든 비슷하게

  • 데이터 하나의 영향을 수학적으로 묶음
  • 클리핑과 노이즈
  • 학습 시간·성능 비용
두 공격은 노리는 것이 다르고, 차분 프라이버시는 두 공격 모두의 바탕인 '데이터 하나의 영향'을 줄인다.

어떻게 작동하나: 그림자 모델, 이상하게 높은 확률, 노이즈

멤버십 추론 공격 연구논문는 '그림자 학습(shadow training)'을 제안했다. 공격자는 대상 모델의 내부를 모르고 질문과 답만 볼 수 있다(블랙박스). 그래서 먼저 대상 모델과 비슷하게 동작하는 그림자 모델 여러 개를 직접 학습시킨다. 그림자 모델의 학습 데이터는 공격자가 알기 때문에, 각 입력이 '학습에 쓰였는지'라는 정답을 붙일 수 있다. 그다음 이 정답이 붙은 출력으로 공격 모델을 학습시킨다. 공격 모델은 '학습 때 본 입력에 대한 반응'과 '처음 보는 입력에 대한 반응'을 구별하는 분류기가 된다. 즉 멤버십 추론을 하나의 분류 문제로 바꾼 것이다.

LLM 대상 데이터 추출논문은 두 단계로 진행된다. 먼저 모델에서 다양한 문장을 대량으로 생성한다(샘플링 전략 3가지). 다음으로 각 문장이 이 모델에서 얼마나 그럴듯한지를 다른 기준 모델과 비교하는 지표 6가지로 순위를 매긴다. 대상 모델만 유난히 높은 확률을 주는 문장은 외운 문장일 가능성이 높다는 논리다.

차분 프라이버시 학습의 기본 동작은 RLVR 차분 프라이버시 연구논문의 설명에 잘 드러난다. 보호할 단위(그 연구에서는 문제 하나)의 그래디언트(가중치를 고칠 방향)를 모아 크기를 한 번 잘라 내고(clipping), 가우시안 노이즈를 더한다. 그리고 학습이 거듭되는 동안 쌓이는 프라이버시 손실을 합산해 전체 예산(ε)을 계산한다. ε이 작을수록 보호는 강하고 성능 비용은 커진다.

그림자 학습으로 하는 멤버십 추론그림자 학습 데이터 → 그림자 모델들(학습); 그림자 모델들 → 안/밖 표시된 출력; 안/밖 표시된 출력 → 공격 모델(학습); 확인할 기록 → 대상 모델(질문); 대상 모델 → 예측 결과; 예측 결과 → 공격 모델; 공격 모델 → 학습에 쓰였나?그림자 학습 데이터정답(안/밖)을 아는데이터그림자 모델들대상 모델 흉내안/밖 표시된 출력공격 모델안/밖 분류기확인할 기록대상 모델블랙박스 API예측 결과학습에 쓰였나?예 / 아니오학습학습질문
그림자 학습으로 하는 멤버십 추론 위 줄은 공격자가 미리 하는 준비(그림자 모델로 공격 모델 학습), 아래 줄은 실제 공격(대상 모델의 반응을 공격 모델이 판정)이다.

발전 흐름: 분류 모델에서 상용 챗봇까지

멤버십 추론 공격 연구2016 논문는 Google과 Amazon의 '머신러닝 서비스'로 만든 분류 모델을 공격했다. 1만 건 규모의 소매 거래 데이터로 학습한 모델에서 추론 정확도 중앙값이 각각 94%와 74%였다. 학습 데이터 분포를 전혀 모른 채 완전히 합성된 데이터로 그림자 모델을 만들어도 Google 모델 대상 정확도는 90%였다. 텍사스 병원 퇴원 데이터에서도 70%를 넘었다. 연구진은 유출이 과적합과 관련된다는 점을 수치로 보였다. 방어책으로는 상위 k개 클래스만 보여 주기, 예측 값의 정밀도 낮추기, 정규화 같은 방법을 비교했다.

같은 해 차분 프라이버시 딥러닝 연구2016 논문는 방어 쪽의 출발점이 됐다. 이 연구는 새로운 학습 알고리즘 기법과 정교한 프라이버시 비용 분석을 내놓았다. 그리고 크지 않은 프라이버시 예산 안에서도 소프트웨어 복잡도·학습 효율·모델 품질을 감당할 만한 수준으로 유지하며 심층 신경망을 학습할 수 있음을 보였다.

GPT-2 학습 데이터 추출 연구2020 논문는 무대를 LLM으로 옮겼다. 후보 샘플 1,800개 중 600개 이상이 GPT-2 학습 데이터의 원문과 똑같았다. 가장 좋은 설정에서는 후보의 67%가 원문이었다. 추출된 내용에는 이름·전화번호·이메일 같은 개인정보, IRC 대화, 코드, 128비트 UUID가 있었다. 학습 데이터에 단 한 문서에만 나온 문장도 추출됐고, 큰 모델이 작은 모델보다 더 취약했다.

대규모 추출 연구2023 논문는 이를 실제 서비스로 넓혔다. Pythia·GPT-Neo 같은 오픈소스 모델, LLaMA·Falcon, 그리고 닫힌 모델인 ChatGPT에서 기가바이트 단위의 학습 데이터를 추출했다. 정렬된 ChatGPT에는 '발산 공격'을 새로 만들었다. 챗봇다운 응답에서 벗어나게 유도하자 학습 데이터를 정상 동작 때보다 150배 높은 비율로 쏟아냈다. 결론은 현재의 정렬 기법이 외운 내용을 없애지는 못한다는 것이다.

공격 연구가 보여 준 숫자

94%멤버십 추론 정확도(Google 모델)
600개 이상GPT-2에서 확인된 원문 샘플
67%최고 설정의 원문 비율
150배발산 공격 시 학습 데이터 방출률
본문에 나온 대표 수치다. 94%는 Google 서비스로 만든 모델 대상 멤버십 추론 정확도(중앙값), 나머지는 LLM 추출 결과다.

요즘 어디로 가고 있나: 문맥 속 기억, 측정의 한계, 새 학습 방식의 보호

첫째, 실제 배포 환경에서 유출을 다시 보고 있다. 문맥 속 기억 추출 연구논문는 학습 문장의 앞부분(프리픽스)을 그냥 넣었을 때와, RAG처럼 검색된 문서를 앞에 붙였을 때 추출이 얼마나 달라지는지 지시 학습된 오픈웨이트 모델 3종에서 짝지어 측정했다. 문맥이 외운 내용을 지우지는 않았다. 문맥에 상관없이 추출되는 '단단한 핵심'과 문맥에 따라 바뀌는 '경계'가 있었다. 프리픽스가 길수록 문맥이 붙어도 추출이 잘 됐다. 문맥은 경계 근처의 일부 노출을 막았지만, 프리픽스만으로 평가할 때는 보이지 않던 새 노출을 만들기도 했다. 'RAG를 쓰면 기억 유출 위험이 줄어든다'는 견해에 단서를 단 셈이다.

둘째, 멤버십 추론을 얼마나 믿을 수 있는지 다시 재고 있다. OLMo-Detect논문는 학습 데이터가 모두 공개된 OLMo 2를 바탕으로 사전 학습·중간 학습·사후 학습 단계를 모두 다루는 벤치마크다. 학습에 쓴 글(멤버)과 쓰지 않은 글(비멤버)의 분포를 맞춰 공정하게 비교한다. 비지도 공격 15종과 지도 공격 3종을 평가했는데, 가장 좋은 공격도 AUC 0.68에 그쳤다. AUC는 0.5가 동전 던지기, 1.0이 완벽한 구별이다. 탐지는 중간 학습 단계에서 가장 잘 됐는데, 이는 학습 단계 때문이 아니라 데이터 종류 때문이었다(정제된 수학 데이터가 훨씬 잘 드러남). 모델이 1B에서 13B로 커질수록 점수가 올랐지만 32B에서는 더 오르지 않았다.

셋째, 차분 프라이버시를 새 학습 방식으로 넓히고 있다. RLVR 차분 프라이버시 연구논문는 RLVR(정답을 자동 채점할 수 있는 문제로 하는 강화학습)에 문제 단위 차분 프라이버시를 적용했다. 연구진은 이것이 자신들이 아는 한 RLVR 학습에 대한 첫 보장이라고 밝혔다. Qwen2.5-1.5B-Instruct를 LoRA로 ε=8 예산에서 학습했다. 보상 신호는 MATH에서 2.65점, GSM8K에서 3.24점을 더 올렸다. 같은 예산의 프라이버시 SFT 방식보다는 2.3~3.8점 높았고, 프라이버시를 적용하지 않은 GRPO가 얻는 향상의 85~90%를 유지했다. MATH에서는 예산을 8배 빡빡하게 해도 손실이 최대 1.2점이었다.

학습 데이터 프라이버시 연구 지도 위는 공격 연구, 가운데는 방어의 출발점, 아래는 최근 방향이다. 상자를 누르면 원문으로 이동한다.

한계와 쟁점

방어에는 비용이 든다. GPT-2 학습 데이터 추출 연구논문는 차분 프라이버시 학습이 이론적으로 탄탄하지만 학습 시간이 길어지고 보통 성능이 떨어진다고 지적했다. 데이터의 중복 제거는 실제로 외우기를 줄이는 데 도움이 되지만 모든 공격을 막지는 못한다고 했다. 또 보호 단위를 제대로 정해야 한다. 같은 사람의 정보가 여러 문서에 흩어져 있다면 문서 하나 단위의 보호로는 모자랄 수 있다. 이 연구는 '적절한 기록 단위'로 적용해야 한다고 단서를 달았다.

흔히 쓰는 우회책도 완전하지 않다. 정렬은 외운 내용을 없애지 못했고논문, RAG 같은 문맥은 일부 노출을 줄이는 대신 다른 노출을 새로 만들 수 있다논문. 출력을 다듬는 방어(상위 k개만 보여 주기, 정밀도 낮추기)는 분류 모델을 대상으로 비교된 방법이다논문. 그래서 생성형 모델에 그대로 효과가 있다고 볼 근거는 이 글의 자료에 없다.

측정 도구 자체도 쟁점이다. 멤버십 추론은 '이 데이터가 학습에 쓰였나'를 따지는 감사나 저작권 분쟁의 근거로도 거론된다. 그러나 OLMo-Detect논문 결과처럼 LLM에서는 가장 좋은 공격의 AUC도 0.68에 그친다. 그러니 '탐지되지 않았다'를 '학습에 쓰지 않았다'의 증거로 받아들이면 안 된다. 거꾸로 공격이 약하다고 해서 유출이 없다는 뜻도 아니다. 추출 공격은 평균이 아니라 '최악의 경우' 외운 문장을 노리기 때문이다.

더 공부하려면

처음이라면 GPT-2 학습 데이터 추출 연구논문부터 읽기를 권한다. LLM의 외우기 문제가 무엇이고 왜 과적합이 없어도 생기는지가 가장 직관적으로 설명돼 있다. 마지막의 방어 논의도 실무에 바로 연결된다. 이어서 멤버십 추론 공격 연구논문로 그림자 모델 기법과 과적합의 관계를 익히면 이후의 멤버십 추론 연구를 읽을 기반이 생긴다.

서비스 운영자라면 대상 범위를 상용 모델까지 넓힌 대규모 추출 연구논문와, RAG 환경의 노출을 다룬 문맥 속 기억 추출 연구논문를 함께 읽으면 좋다. 방어 설계를 고민한다면 차분 프라이버시 딥러닝 연구논문로 개념을 잡은 뒤, RLVR 차분 프라이버시 연구논문에서 예산과 성능을 어떻게 맞바꾸는지 구체적인 수치로 확인하자.

멤버십 추론으로 데이터 사용 여부를 감사하려 한다면 OLMo-Detect논문를 꼭 읽기를 권한다. 공격의 실제 성능과, 멤버·비멤버 분포를 맞추지 않으면 결과가 어떻게 부풀려지는지를 보여 준다.

관련 용어

멤버십 추론 공격 학습 데이터 추출 차분 프라이버시 과적합 중복 제거 머신 언러닝 개인정보 비식별화 연합학습

참고 문헌

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.