AI 용어집 · 기초 · 안전·정렬
레드팀 Red teaming
레드팀은 AI 모델의 약점을 찾기 위해 일부러 공격자 입장에서 모델을 속이고 오용해 보는 시험 활동이다.
어떻게 작동하나
레드팀이라는 이름은 군사 훈련에서 적군 역할을 맡는 팀에서 왔다. AI 레드팀은 탈옥을 시도하거나, 위험한 정보를 끌어내려 하거나, 편향된 답을 유도하는 등 다양한 방식으로 모델을 공격해 본다. 사람 전문가가 직접 할 수도 있고, 다른 AI 모델이 공격 질문을 대량으로 만들어 시험하기도 한다. 찾아낸 약점은 모델 재학습이나 가드레일 보강에 쓰인다.
왜 중요한가
AI 모델은 만든 회사도 모든 행동을 미리 알기 어렵다. 레드팀은 실제 사용자나 악의적인 사람이 만나게 될 문제를 출시 전에 드러내는 거의 유일한 방법이다. 그래서 주요 AI 회사들은 새 모델을 내놓기 전에 레드팀 결과를 정리해 발표하는 경우가 많다. 사이버 보안, 생물·화학 위험처럼 전문 지식이 필요한 분야는 외부 전문가를 따로 불러 시험하기도 한다.
알아 둘 점
레드팀은 약점을 찾는 활동이지, 모델이 안전하다는 보증은 아니다. 시험하지 않은 방식의 공격은 여전히 남아 있을 수 있다. 또 레드팀에 쓰이는 공격 기법 자체가 악용될 수 있어서, 누구에게 어느 수준까지 접근을 허용할지 관리하는 일도 중요하다. 모델이 바뀔 때마다 다시 해야 하는 지속적인 작업이다.
예시
이 사이트에 소개된 보도에서는 Anthropic이 사이버 보안 관련 접근 체계를 방어·레드팀·특수의 세 단계로 나눠 개편했다고 전했다. 보안 전문가가 공격자처럼 시스템을 시험하는 레드팀 용도를 따로 구분해, 그런 활동에 필요한 모델 접근을 관리하겠다는 흐름으로 볼 수 있다.