AI 용어집 · 심화 · 안전·정렬
해석 가능성 Interpretability
해석 가능성(Interpretability)은 AI 모델이 왜 그런 답을 냈는지, 모델 내부에서 실제로 어떤 계산이 일어나는지를 사람이 이해할 수 있게 밝혀내는 연구 분야다.
어떻게 작동하나
딥러닝 모델은 입력을 받아 수많은 파라미터(모델 안의 숫자)를 거쳐 답을 만든다. 해석 가능성 연구는 이 중간 과정에서 어떤 뉴런이나 내부 신호(Representation)가 특정 개념, 예를 들어 '도시 이름'이나 '거짓말' 같은 것과 연결되는지 찾는다. 어떤 입력이 답에 가장 큰 영향을 줬는지 표시하는 방법도 있고, 내부 신호를 일부러 바꿔 보면서 결과가 어떻게 달라지는지 실험하는 방법도 있다. 최근에는 모델 안에서 정보가 흘러가는 '회로'를 찾아내려는 기계적 해석 가능성(mechanistic interpretability) 연구가 활발하다.
왜 중요한가
AI가 의료, 금융, 법률처럼 중요한 결정에 쓰일수록 '왜 그렇게 판단했는가'를 설명할 수 있어야 한다. 모델이 겉으로는 맞는 답을 내도 속으로는 엉뚱한 단서에 기대고 있을 수 있는데, 이를 잡아내려면 내부를 봐야 한다. 환각, 아첨, 보상 해킹 같은 문제의 원인을 찾고 고치는 데도 도움이 된다. 그래서 해석 가능성은 AI를 안전하게 만드는 정렬 연구의 핵심 도구로 꼽힌다.
알아 둘 점
오늘날의 대형 모델은 너무 크고 복잡해서, 내부 전체를 완전히 이해하는 수준에는 아직 이르지 못했다. 모델이 스스로 내놓는 설명(예: CoT로 쓴 생각 과정)이 실제 내부 계산과 일치한다는 보장도 없다. 또 '이 뉴런은 이 개념'처럼 깔끔하게 나뉘지 않고 한 부분이 여러 개념을 동시에 담당하는 경우가 많아 해석이 까다롭다. 따라서 해석 결과는 '부분적인 단서'로 받아들이는 편이 안전하다.
예시
AI 연구 기업들은 해석 가능성 연구로 대형 언어 모델 안에서 특정 개념에 반응하는 내부 신호를 찾아내고, 이를 일부러 키우거나 줄여 모델의 행동이 어떻게 바뀌는지 공개해 왔다. 기업에서는 대출 심사나 이상 거래 탐지처럼 설명 책임이 필요한 서비스에서, 모델이 어떤 입력 항목을 근거로 판단했는지 보여 주는 기능으로 해석 가능성 기법을 활용한다.