AI 용어집 · 기초 · 안전·정렬
가드레일 Guardrail
가드레일은 AI 모델이 위험하거나 규칙에 어긋나는 내용을 입력받거나 내보내지 않도록, 모델 앞뒤에서 검사하고 막는 안전장치다.
어떻게 작동하나
가드레일은 보통 두 지점에서 작동한다. 먼저 사용자의 입력이 모델에 들어가기 전에 해로운 요청이나 숨겨진 지시가 있는지 검사한다. 그다음 모델이 만든 답이 사용자에게 가기 전에 개인정보, 유해한 내용, 회사 정책 위반이 있는지 다시 확인한다. 검사에는 금지어 목록 같은 단순한 규칙부터, 검사 전용으로 훈련된 작은 AI 모델까지 다양한 방법이 쓰인다.
왜 중요한가
모델 자체를 아무리 잘 훈련해도 탈옥이나 실수를 완전히 막을 수는 없다. 가드레일은 모델 바깥에 한 겹을 더 두어 위험을 줄인다. 기업이 AI를 고객 응대나 사내 업무에 쓸 때는 업종별 규정이나 회사 방침을 지켜야 하므로 가드레일이 특히 중요하다. AI 에이전트가 실제 도구를 다룰 때는 위험한 행동을 하기 전에 멈추게 하는 용도로도 쓰인다.
알아 둘 점
가드레일을 너무 엄격하게 만들면 정상적인 질문까지 거절해서 쓰기 불편해진다. 반대로 느슨하면 위험한 내용이 빠져나간다. 검사 단계가 늘어나면 응답이 느려지고 비용도 늘어난다. 그래서 서비스마다 안전과 편의 사이에서 적절한 균형을 찾는 것이 핵심 과제다.
예시
사내 문서를 검색해 답하는 업무용 챗봇이라면, 입력 단계에서 직원이 다른 사람의 인사 정보를 묻는 질문을 걸러 내고, 출력 단계에서 답 속에 주민등록번호나 연락처 같은 개인정보가 섞여 있으면 가리는 식으로 가드레일을 둔다. 여러 클라우드·AI 회사가 이런 검사 기능을 별도 도구로 제공하고 있다.