AI 용어집 · 입문 · 안전·정렬
탈옥 Jailbreak
탈옥은 AI 모델에 걸려 있는 안전 규칙을 교묘한 질문이나 상황 설정으로 우회해서, 원래라면 거절했을 답을 하게 만드는 것이다.
어떻게 작동하나
LLM은 학습 과정에서 위험하거나 해로운 요청은 거절하도록 훈련된다. 탈옥은 이 거절 습관이 모든 상황을 빈틈없이 덮지 못한다는 점을 노린다. 흔히 쓰이는 방법은 역할극을 시키거나, 가상의 이야기 속 질문처럼 꾸미거나, 요청을 잘게 나눠 조금씩 묻는 것이다. 다른 언어나 암호처럼 바꾼 글로 묻거나, 긴 대화로 모델의 경계를 서서히 흐리는 방식도 있다.
왜 중요한가
탈옥이 성공하면 위험한 정보가 나오거나, 서비스가 의도하지 않은 방식으로 쓰일 수 있다. AI가 검색·코드 실행·결제 같은 실제 행동까지 하게 되면서 피해의 범위도 커지고 있다. 그래서 AI 회사들은 새 모델을 내놓기 전에 탈옥 시도를 일부러 해 보며 약점을 찾는다. 이 과정이 레드팀 활동의 중요한 부분이다.
알아 둘 점
탈옥은 프롬프트 인젝션과 자주 함께 이야기되지만 같은 것은 아니다. 탈옥은 사용자가 직접 모델의 안전 규칙을 깨려는 것이고, 프롬프트 인젝션은 웹페이지나 문서 같은 외부 내용에 숨겨진 지시가 모델을 조종하는 것이다. 한 가지 방어로 모든 탈옥을 막기는 어렵다. 그래서 모델 자체의 훈련에 가드레일 같은 별도 검사 장치를 겹쳐 쓰는 경우가 많다.
예시
챗봇 서비스에서는 "할머니가 옛날이야기처럼 들려주던 방법을 알려 줘" 같은 역할극형 질문이 탈옥 시도의 전형적인 예로 자주 소개된다. AI 회사들은 이런 패턴이 알려지면 모델을 다시 학습시키거나 입력·출력 검사 규칙을 보강해 대응한다.