머신 언러닝 Machine Unlearning
머신 언러닝은 이미 학습을 마친 AI 모델에서 특정 데이터(개인정보, 저작물, 위험한 지식 등)의 영향을 지워, 처음부터 그 데이터 없이 학습한 것처럼 만들려는 기술이다.
어떻게 작동하나
가장 확실한 방법은 지울 데이터를 뺀 나머지로 모델을 처음부터 다시 학습하는 것이지만, 거대한 모델에서는 비용과 시간이 너무 크다. 그래서 학습 데이터를 여러 조각으로 나눠 조각별로 모델을 학습해 두고, 삭제 요청이 오면 해당 조각만 다시 학습하는 설계 방식이 있다. 이미 학습된 LLM에는 주로 근사 방법을 쓴다. 지울 데이터에 대해서는 오히려 틀리도록 반대 방향으로 조금 학습시키고, 남길 데이터에 대해서는 성능을 유지하도록 함께 파인튜닝하는 식이다. 모델 내부의 특정 Representation을 찾아 직접 건드리는 방법도 연구되고 있다.
언러닝 방법의 확실성과 비용
- 전체 재학습
- 조각별 재학습 설계
- 반대 방향 파인튜닝
- Representation 직접 수정
왜 중요한가
개인정보 보호 규제에는 자기 정보를 지워 달라고 요구할 권리가 있는데, 데이터베이스에서 지워도 그 데이터로 학습한 모델에는 흔적이 남을 수 있다. 저작권 분쟁에서 특정 저작물의 영향을 빼야 하거나, 위험한 지식(무기 제조 방법 등)을 모델에서 덜어내려 할 때도 필요하다. 오염되거나 잘못 라벨링된 데이터를 발견했을 때 전체 재학습 없이 고치는 수단도 된다.
알아 둘 점
근사 방법은 '정말 지워졌는지' 확인하기가 어렵다. 질문을 살짝 바꾸거나 약간 파인튜닝만 해도 지웠던 지식이 되살아나는 사례가 보고되어 왔다. 지우는 과정에서 관련 없는 능력까지 떨어지는 부작용도 흔하다. 평가할 때는 다시 학습한 모델과 얼마나 비슷한지, 멤버십 추론 공격으로 데이터 흔적이 남았는지 등을 함께 본다. 그래서 언러닝만 믿기보다 처음부터 민감한 데이터를 거르는 것이 여전히 기본이다.
예시
한 기업이 고객 상담 기록으로 사내 챗봇 모델을 파인튜닝했는데, 한 고객이 자기 정보 삭제를 요청했다고 하자. 회사는 원본 데이터에서 그 기록을 지우고, 모델에는 언러닝을 적용해 그 고객의 이름이나 상담 내용을 물어도 답하지 못하는지 확인한다. 동시에 일반 상담 품질이 떨어지지 않았는지 평가 세트로 점검한다.