← AI 용어집

AI 용어집 · 기초 · AI 보안 · 컴퓨터 비전

적대적 예제 Adversarial Example

적대적 예제는 사람 눈에는 거의 차이가 없지만 AI 모델은 완전히 다르게 판단하도록 일부러 살짝 바꿔 놓은 입력이다. 모델을 속이려고 만든 '착시 문제'라고 보면 된다.

쉽게 말하면 사람에게는 그냥 얼룩처럼 보이는 스티커 몇 장 때문에 운전 보조 장치가 '정지' 표지판을 다른 표지판으로 읽는 상황과 비슷하다. 다만 사람의 착시와 달리, 모델의 약점을 계산해서 정확히 노리고 만든다는 점이 다르다.

어떻게 작동하나

AI 모델은 입력의 미세한 패턴에 기대어 답을 정한다. 공격자는 모델이 어떤 방향으로 입력을 바꾸면 판단이 가장 크게 흔들리는지 찾아내고, 그 방향으로 아주 작은 변화(노이즈)를 더한다. 사진이라면 픽셀 값을 조금씩 바꾸고, 글이라면 단어 하나나 눈에 띄지 않는 문자를 바꾸는 식이다. 사람에게는 같은 사진·같은 문장이지만 모델은 전혀 다른 답을 내놓는다. 모델 내부를 들여다볼 수 있으면 화이트박스 공격, 질문과 답만 주고받으며 찾아내면 블랙박스 공격이라고 부른다.

화이트박스 공격 대 블랙박스 공격

화이트박스모델 내부를 안다

  • 판단이 흔들리는 방향을 직접 계산
  • 적은 시도로 정확히 노림

블랙박스질문과 답만 본다

  • 입력을 바꿔 가며 반응을 관찰
  • 실제 서비스 공격에 가까움

공통 둘 다 사람 눈에 안 띄는 작은 변화로 모델 판단을 뒤집는다

공격자가 모델 내부를 얼마나 볼 수 있느냐에 따라 두 갈래로 나뉜다.

왜 중요한가

자율주행, 얼굴 인식, 스팸·악성코드 탐지처럼 AI 판단이 안전과 보안에 직결되는 곳이 많다. 이런 곳에서 작은 조작으로 판단을 뒤집을 수 있다면 큰 피해로 이어질 수 있다. 또 적대적 예제는 모델이 사람처럼 '의미'를 이해하기보다 통계적 패턴에 기대고 있다는 사실을 잘 보여 준다. 그래서 모델의 견고성(robustness)을 시험하는 대표적인 도구로도 쓰인다.

알아 둘 점

대표적인 방어법은 적대적 예제를 일부러 만들어 학습 데이터에 섞는 '적대적 학습'이다. 하지만 한 가지 공격에 강해진 모델이 다른 방식의 공격에는 여전히 약한 경우가 많아, 완전한 방어법은 아직 없다고 보는 것이 일반적이다. LLM에서는 이상한 문자열을 덧붙여 안전 장치를 우회하는 탈옥 공격이 같은 원리로 설명되기도 한다. 견고성을 높이면 평소 정확도가 조금 떨어지는 등 대가가 따를 수 있다.

예시

이미지 인식 서비스를 운영하는 회사는 배포 전에 레드팀이 적대적 예제를 만들어 모델이 얼마나 쉽게 속는지 점검한다. 예를 들어 상품 사진 검수 모델에 사람 눈에는 보이지 않는 노이즈를 더한 이미지를 넣어, 금지 상품을 정상 상품으로 통과시키는지 확인하고 그 결과를 학습 데이터에 다시 반영한다.

함께 보면 좋은 용어