AI 용어집 · 심화 · AI 보안
모델 탈취 Model Extraction
모델 탈취(Model Extraction)는 공격자가 AI 모델에 질문을 대량으로 던지고 받은 답을 모아, 원래 모델과 비슷하게 동작하는 복제 모델을 만들어 내는 공격이다.
어떻게 작동하나
공격자는 API나 웹 서비스처럼 누구나 질문할 수 있는 창구를 이용한다. 다양한 질문을 자동으로 만들어 대량으로 보내고, 모델의 답변(때로는 확률 점수까지)을 모아 데이터셋을 만든다. 이 데이터로 자기 모델을 학습시키면 원래 모델의 행동을 꽤 비슷하게 흉내 내는 복제본이 생긴다. 원리는 큰 모델의 답을 보고 작은 모델을 가르치는 Distillation과 같지만, 허락 없이 한다는 점이 다르다.
왜 중요한가
좋은 모델을 만들려면 많은 데이터와 컴퓨팅 비용이 들기 때문에, 모델 자체가 회사의 핵심 자산이다. 복제당하면 그 투자를 남이 싸게 가져가는 셈이 된다. 또 복제 모델을 손에 넣은 공격자는 그 위에서 마음껏 실험해 탈옥이나 적대적 예제 같은 다음 공격을 미리 찾아낼 수 있다. 그래서 모델 탈취는 지식재산 문제이면서 보안 문제로도 다뤄진다.
알아 둘 점
막는 방법으로는 사용량 제한, 비정상적으로 많거나 패턴이 이상한 질문 감지, 확률 점수 같은 세부 정보 숨기기, 이용 약관으로 복제 목적 사용 금지 등이 쓰인다. 출력에 워터마크를 넣어 복제 여부를 나중에 확인하려는 시도도 있다. 하지만 정상 사용자와 공격자를 완벽히 구분하기는 어려워서, 너무 강하게 막으면 서비스 품질이 떨어지는 균형 문제가 있다. 모델 가중치 파일을 직접 훔치는 해킹과는 구분되며, 이 용어는 보통 질문·답변만으로 흉내 내는 경우를 가리킨다.
모델 탈취 방어 점검
접근 통제
- 사용량 제한이 있는가
- 이상한 질문 패턴을 감지하는가
- 확률 점수 같은 세부 정보를 숨기는가
사후 대응
- 약관에 복제 금지 조항이 있는가
- 출력 워터마크로 복제를 확인할 수 있는가
예시
상용 LLM API를 제공하는 회사들은 이용 약관에 '출력을 이용해 경쟁 모델을 학습시키지 말 것'이라는 조항을 넣는 경우가 많다. 또 짧은 시간에 비슷한 형식의 질문이 대량으로 들어오는 계정을 감지해 속도를 늦추거나 차단한다. 이는 누군가 API 답변을 모아 Distillation으로 자기 모델을 만드는 모델 탈취를 막으려는 조치다.