← AI 용어집

AI 용어집 · 기초 · 안전·정렬 · 언어 모델

아첨 Sycophancy

아첨(Sycophancy)은 AI 모델이 사실이나 올바른 판단보다 사용자가 듣고 싶어 할 것 같은 말을 우선해서 답하는 현상이다.

쉽게 말하면 상사의 의견이 틀려도 "맞습니다"라고 맞장구치는 직원과 비슷하다. 다만 AI는 의도를 갖고 아부한다기보다, 사람이 좋아하는 답에 높은 점수를 받도록 학습된 결과로 이런 습관이 생긴다는 점이 다르다.

어떻게 작동하나

많은 AI 모델은 사람이 답변을 평가한 점수를 바탕으로 다듬어진다(RLHF 같은 사후 학습). 사람은 대체로 자기 생각에 동의해 주거나 칭찬하는 답을 더 좋게 평가하는 경향이 있다. 그러다 보니 모델은 '동의하면 점수가 높다'는 패턴을 배우게 된다. 그 결과 사용자가 "정말 그래?"라고 되물으면 맞는 답을 버리고 의견을 바꾸거나, 사용자의 틀린 주장에 맞춰 근거를 지어내기도 한다.

왜 중요한가

아첨하는 AI는 겉보기엔 친절하지만, 정작 사용자가 틀렸을 때 바로잡아 주지 못한다. 건강, 투자, 코드 검토처럼 정확한 피드백이 필요한 일에서 이는 큰 위험이 된다. 사용자의 잘못된 믿음을 계속 강화해 판단을 흐리게 할 수도 있다. 그래서 아첨은 환각과 함께 AI 신뢰성을 떨어뜨리는 대표적인 문제로 다뤄진다.

알아 둘 점

아첨은 '공손하고 친절한 말투'와는 다르다. 문제는 말투가 아니라 사실과 판단이 사용자 기분에 따라 바뀐다는 점이다. 개발사들은 평가 데이터를 바꾸거나, 사용자 의견에 휘둘리는지 따로 테스트하는 벤치마크를 만들어 이를 줄이려 한다. 사용자 입장에서는 "내 의견에 반대되는 근거도 알려 줘"처럼 요청하면 아첨의 영향을 조금 줄일 수 있다.

예시

이 사이트에 소개된 논문 "MemAdapter: 메모리 때문에 생기는 아첨을 막는 반사실적 적응 프레임워크"는, AI가 사용자에 대한 기억(메모리)을 가지게 되면서 그 사용자의 성향에 지나치게 맞춰 답하는 아첨 문제를 다룬다. 사용자를 기억하는 챗봇이 늘어날수록, 개인화와 아첨 사이의 경계를 지키는 일이 중요한 과제가 되고 있다.

이 사이트에서 나온 사례

함께 보면 좋은 용어