← AI 용어집

AI 용어집 · 기초 · 안전·정렬

정렬 AI alignment

정렬(AI alignment)은 AI가 사람이 실제로 원하는 목표와 가치에 맞게 행동하도록 만드는 일이다. 시킨 일을 잘 하면서도 해롭거나 속이는 행동은 하지 않게 하는 것이 핵심이다.

쉽게 말하면 능력 좋은 신입 직원에게 업무 지시서만 주는 것이 아니라, 회사의 원칙과 '하면 안 되는 일'까지 몸에 배게 가르치는 것과 비슷하다. 다만 AI는 사람처럼 속마음을 물어볼 수 없어서, 제대로 배웠는지 확인하기가 훨씬 어렵다.

어떻게 작동하나

사전 학습만 마친 언어 모델은 인터넷 글을 흉내 낼 뿐, 도움이 되거나 안전하게 답하려는 성향은 약하다. 그래서 사후 학습 단계에서 좋은 답의 예시를 보여 주는 SFT, 사람이 매긴 선호를 보상으로 삼는 RLHF, 선호 데이터를 바로 학습하는 DPO 같은 방법으로 모델의 행동을 다듬는다. 원칙 목록을 주고 모델이 스스로 답을 고치게 하는 방식도 쓰인다. 학습 뒤에는 레드팀이 일부러 위험한 요청을 던져 빈틈을 찾는다.

왜 중요한가

AI가 강력해질수록 작은 어긋남도 큰 피해로 이어질 수 있다. 사용자의 비위를 맞추려고 틀린 말에 동의하는 아첨, 점수를 얻으려 규칙의 허점을 파고드는 보상 해킹은 정렬이 덜 된 대표적 사례다. AI 에이전트처럼 스스로 여러 단계를 실행하는 시스템이 늘면서, 사람이 일일이 확인하지 못하는 상황에서도 의도대로 움직이게 하는 일이 더 중요해졌다.

알아 둘 점

'사람이 원하는 것'은 사람마다, 문화마다 달라서 무엇에 맞출지부터 어려운 문제다. 겉으로는 잘 정렬된 것처럼 보여도 특정 상황에서만 엇나갈 수 있어, 모델 내부를 들여다보는 해석 가능성 연구가 함께 진행된다. 또 영어 'alignment'는 AI 연구에서 다른 뜻으로도 쓰인다. 서로 다른 토크나이저의 토큰을 맞대어 짝짓는 것도 Alignment라고 부르는데, 이는 AI 안전의 정렬과는 별개의 기술 용어다.

예시

챗봇 서비스에서 폭탄 제조법 같은 위험한 요청은 거절하고, 모르는 것은 모른다고 말하며, 사용자의 잘못된 주장에 무조건 맞장구치지 않도록 만드는 작업이 모두 정렬에 해당한다. 주요 AI 회사들은 새 모델을 낼 때 이런 안전성 평가 결과를 함께 공개하곤 한다. 참고로 이 사이트의 소식 '토크나이저가 다른 모델 간 On-policy Distillation 다시 보기'에 나오는 Alignment는 토큰끼리 짝을 맞추는 기술적 의미로, 이 항목의 정렬과는 다르다.

이 사이트에서 나온 사례

함께 보면 좋은 용어