AI 용어집 · 입문 · MLOps·LLMOps · 데이터·평가
A/B 테스트 A/B Testing
A/B 테스트는 사용자를 무작위로 두 무리로 나눠 한쪽에는 기존 버전(A), 다른 쪽에는 새 버전(B)을 보여 준 뒤, 어느 쪽이 더 좋은 결과를 내는지 실제 데이터로 비교하는 실험 방법이다.
어떻게 작동하나
먼저 "새 추천 방식을 쓰면 클릭이 늘 것이다"처럼 확인할 가설과 성공을 판단할 지표를 정한다. 그다음 사용자를 무작위로 A군과 B군에 나누어, 두 무리가 버전 말고는 최대한 비슷하도록 만든다. 충분한 기간 동안 각 무리의 지표(클릭률, 구매율, 만족도 등)를 모은다. 마지막으로 두 무리의 차이가 우연히 생길 만한 수준인지 통계적으로 검토해 '의미 있는 차이'인지 판단한다.
A/B 테스트 진행 순서
- 1가설·지표 정하기무엇이 좋아질지, 무엇으로 잴지
- 2무작위로 나누기A군과 B군을 비슷하게
- 3데이터 모으기충분한 기간 동안
- 4통계로 판단우연한 차이인지 확인
왜 중요한가
회의실의 직감이나 목소리 큰 사람의 의견 대신 실제 사용자 반응으로 결정을 내릴 수 있게 해 준다. AI 서비스에서는 새 모델 버전, 바뀐 프롬프트, 다른 추천 알고리즘이 정말 더 나은지 확인할 때 많이 쓴다. 미리 준비한 시험 문제(오프라인 평가)에서 점수가 높아도 실제 사용자에게는 덜 좋을 수 있기 때문에, 배포 전후의 마지막 확인 단계로 중요하다.
알아 둘 점
사용자 수가 너무 적거나 기간이 짧으면 우연한 차이를 진짜 효과로 착각하기 쉽다. 지표를 여러 개 동시에 보다 보면 그중 하나는 우연히 좋아 보일 수 있으므로, 핵심 지표를 미리 정해 두는 것이 좋다. 새 기능이 처음에는 신기해서 반응이 좋다가 곧 식는 경우도 있어 기간을 넉넉히 잡는다. 또 한쪽 사용자에게 불편을 줄 수 있으므로 위험한 변경은 작은 비율부터 시험한다.
예시
검색·쇼핑·동영상 서비스는 추천 목록 순서나 화면 배치를 바꿀 때 일부 사용자에게만 새 버전을 보여 주고 클릭과 체류 시간을 비교한다. 생성형 AI 챗봇을 운영하는 팀도 새 모델이나 수정한 시스템 프롬프트를 일부 대화에만 적용해 답변 만족도(좋아요·싫어요)와 재질문 비율이 좋아지는지 확인한 뒤 전체에 적용하는 식으로 A/B 테스트를 활용한다.