지식 그래프 Knowledge graph
지식 그래프는 사람·장소·사건·개념 같은 '대상'을 점으로, 대상 사이의 관계를 선으로 이어 지식을 그물망처럼 저장하는 방식이다. 이렇게 하면 컴퓨터가 '무엇이 무엇과 어떻게 연결되는지' 읽고 따져 볼 수 있다.
어떻게 작동하나
지식 그래프의 기본 단위는 '주어–관계–목적어' 세 덩어리로 된 문장이다. 예를 들어 '서울 – 수도이다 – 대한민국'처럼 쓴다. 웹 표준 단체 W3C가 정한 RDF라는 데이터 형식이 바로 이 방식으로, 이런 세 덩어리를 '트리플'이라고 부른다. 트리플이 쌓이면 점(대상)과 이름 붙은 화살표(관계)로 이루어진 큰 그물이 된다. 여기에 '도시는 장소의 한 종류다' 같은 개념 체계(온톨로지)를 더하면 직접 적혀 있지 않은 사실도 논리적으로 끌어낼 수 있다.
어떻게 발전해 왔나
지식을 그래프로 나타내려는 생각은 오래전부터 있었고, '지식 그래프'라는 말도 1972년 오스트리아 언어학자 에드거 W. 슈나이더가 처음 썼다고 알려져 있다. 이후 기계가 읽을 수 있는 웹을 만들자는 '시맨틱 웹' 흐름 속에서 RDF·OWL 같은 표준이 나왔고, 2007년에는 위키백과 내용을 정리한 DBpedia 같은 범용 지식 저장소가 생겼다. 2020년 Hogan 등의 논문 「Knowledge Graphs」는 데이터 모델, 질의 언어, 만들고 다듬고 품질을 점검하는 방법까지 지식 그래프 전반을 한데 모아 소개한 입문서 역할을 했다. 2023년 Pan 등의 논문 「Unifying Large Language Models and Knowledge Graphs: A Roadmap」은 LLM과 지식 그래프를 합치는 길을 세 가지로 나눴다. 지식 그래프로 LLM을 보강하는 방식, LLM으로 지식 그래프 구축을 돕는 방식, 그리고 둘이 서로 보완하며 함께 추론하는 방식이다.
왜 중요한가
LLM은 아는 것이 많지만 그 지식이 모델 안에 흐릿하게 섞여 있어서, 사실을 틀리게 말하는 환각을 일으키기 쉽다. 지식 그래프는 사실을 명확한 연결로 적어 두기 때문에 답의 근거를 확인하고 설명하기가 쉽다. 그래서 검색 엔진, 음성 비서, 추천 시스템에서 오래 쓰였고, 요즘에는 LLM에 정확한 사실을 공급하는 GraphRAG 같은 방식의 바탕이 된다. 유전체·단백질 연구처럼 복잡한 관계를 다루는 과학 분야에서도 쓰임이 늘고 있다.
알아 둘 점
지식 그래프는 만들고 최신 상태로 유지하는 데 손이 많이 든다. 세상의 사실은 계속 바뀌는데, 그래프에 없는 새 지식은 스스로 채우지 못한다. 또 무엇을 대상으로 보고 어떤 관계 이름을 쓸지 미리 약속해야 해서, 출처가 다른 데이터를 합칠 때 표기와 기준을 맞추는 일이 까다롭다. 최근에는 이런 구축 작업을 LLM이 돕는 연구가 활발하다.
예시
검색 엔진에서 유명 인물이나 도시를 검색하면 출생지, 관련 인물, 소속 같은 정보가 정리된 상자가 따로 뜨는 경우가 많다. 이런 기능은 대상과 관계를 연결해 둔 지식 그래프를 바탕으로 한다. 음성 비서에게 '이 영화 감독이 만든 다른 작품은?'처럼 여러 단계를 거쳐야 하는 질문을 할 때도 '영화 → 감독 → 다른 작품'으로 연결을 따라가는 방식이 쓰인다. 기업에서는 사내 문서, 제품, 고객 정보를 지식 그래프로 엮은 뒤 LLM 챗봇이 이를 참고해 근거 있는 답을 하도록 만들기도 한다.