← AI 용어집

AI 용어집 · 심화 · 데이터 엔지니어링

Entity Resolution 같은 대상 찾아 합치기

Entity Resolution(같은 대상 찾아 합치기)은 서로 다른 데이터 속에 이름·표기가 조금씩 다르게 적힌 기록들이 실제로는 같은 사람·회사·상품을 가리키는지 찾아내고 하나로 묶는 작업이다.

쉽게 말하면 휴대폰 연락처에 '김민수', '민수 (회사)', '김민수 팀장'이 따로 저장돼 있을 때 전화번호와 이메일을 보고 같은 사람이라 판단해 연락처 하나로 합치는 것과 같다. 다만 실제 데이터에서는 동명이인처럼 비슷하지만 다른 대상을 잘못 합치는 위험도 함께 따진다.

어떻게 작동하나

먼저 이름의 띄어쓰기·대소문자·약칭('(주)', '주식회사')처럼 표기 차이를 정리하는 전처리를 한다. 모든 기록을 서로 다 비교하면 너무 오래 걸리므로, 같은 지역이나 이름 첫 글자처럼 묶음을 나눠 비교할 후보를 줄이는 '블로킹'을 한다. 후보 쌍마다 이름·주소·전화번호가 얼마나 비슷한지 점수를 내고, 규칙이나 머신러닝 모델로 같은 대상인지 판정한다. 같다고 판정된 기록들은 하나로 묶어 대표 기록을 만든다.

후보를 좁혀 가는 과정

모든 기록 쌍
블로킹 후 후보 쌍
유사도 점수가 높은 쌍
같은 대상으로 판정·병합
모든 기록 쌍에서 시작해 블로킹과 비교·판정을 거치며 실제로 합칠 기록만 남는다.

왜 중요한가

같은 고객이 여러 번 집계되면 고객 수·매출 분석이 틀어지고, 같은 회사가 여러 이름으로 흩어져 있으면 거래 위험을 제대로 볼 수 없다. 여러 부서·시스템의 데이터를 합쳐 데이터 웨어하우스나 지식 그래프를 만들 때 반드시 거치는 단계다. AI 학습 데이터에서도 같은 내용이 여러 번 들어가지 않게 하는 중복 제거와 맞닿아 있다. 요즘은 임베딩으로 의미가 비슷한 기록을 찾거나 LLM에게 애매한 쌍을 판정하게 하는 방식도 쓰인다.

알아 둘 점

잘못 합치는 실수와 합쳐야 할 것을 놓치는 실수 사이에 늘 균형을 잡아야 한다. 의료·금융처럼 잘못 합치면 피해가 큰 분야에서는 애매한 경우를 사람이 확인하는 절차를 둔다. 개인정보가 담긴 기록을 다루므로 개인정보 비식별화와 접근 권한 관리도 함께 고려해야 한다. 데이터는 계속 들어오므로 한 번 하고 끝나는 작업이 아니라 꾸준히 갱신해야 한다.

예시

쇼핑몰이 온라인 회원 정보, 오프라인 매장 멤버십, 고객센터 상담 기록을 합쳐 '고객 한 명의 전체 모습'을 만들려고 한다. 같은 고객이 매장에서는 영문 이름으로, 온라인에서는 한글 이름으로 가입했더라도 전화번호와 주소가 비슷하면 Entity Resolution으로 한 사람으로 묶는다. 그 결과 중복 쿠폰 발송을 줄이고 추천 시스템이 고객의 구매 이력 전체를 보고 추천할 수 있게 된다.

함께 보면 좋은 용어