← 스터디

스터디 · 2026-10-07 · 심화

GraphRAG와 지식 그래프·온톨로지: 문서 더미를 관계도로 바꿔 묻기

GraphRAG는 문서를 개체와 관계로 이루어진 지식 그래프로 다시 정리하고, 관계가 촘촘한 묶음마다 요약을 미리 써 두어 '전체를 보는 질문'에 답하는 RAG 방식이다. 이 글은 벡터 RAG의 한계에서 출발해 작동 원리, 지식 그래프·온톨로지와의 관계, 최근 연구와 보안·평가 쟁점까지 다룬다.

핵심 정리

왜 필요했나: 조각 검색의 한계

RAG(검색 증강 생성)는 LLM이 한 번에 읽을 수 있는 분량, 즉 컨텍스트 윈도보다 큰 문서 묶음을 다루기 위한 방법이다. 문서를 잘게 나누고(청킹), 각 조각을 임베딩(문장의 뜻을 숫자 벡터로 바꾼 것)으로 저장해 두었다가, 질문과 뜻이 가까운 조각 몇 개를 찾아 LLM에게 함께 건넨다. GraphRAG 논문(2404.16130)은 이런 일반적인 방식을 '벡터 RAG'라고 부르고, 답이 소수의 기록 안에 모여 있는 질문에는 잘 맞는다고 정리한다.

문제는 '이 자료 전체의 주요 주제는 무엇인가' 같은 질문이다. 이런 질문은 특정 조각을 찾는 검색 문제가 아니라 말뭉치 전체를 질문에 맞춰 요약하는 일(질의 중심 요약, QFS)이다. 질문과 비슷한 조각 몇 개만 가져와서는 전체 그림을 그릴 수 없다. 반대로 기존 요약 기법들은 RAG 시스템이 색인하는 규모의 텍스트까지 확장되지 못했다. GraphRAG는 이 둘 사이의 빈자리를 겨냥했다.

또 하나는 여러 문서에 흩어진 사실을 이어야 하는 다단계(multi-hop) 질문이다. GRAG(2405.16506)는 인용 관계망, 소셜 미디어, 지식 그래프처럼 서로 연결된 문서에서 기존 RAG가 개별 문서만 보기 때문에 약하다고 지적한다. Pan 등의 로드맵(2306.08302)은 더 근본적인 이유를 짚는다. LLM은 지식을 파라미터 속에 암묵적으로 담고 있어서 사실과 다른 말을 지어내는 환각이 생기고, 그 근거를 사람이 확인하기도 어렵다는 것이다.

핵심 아이디어: 문서를 관계도로 다시 그리기

비유하면 두꺼운 사건 기록을 받은 탐정이 하는 일과 비슷하다. 탐정은 기록을 처음부터 다시 읽는 대신 벽에 인물·장소·사건을 붙이고 실로 관계를 잇는다. 그리고 실이 촘촘하게 얽힌 무리마다 '이 무리는 무슨 이야기인가'를 메모로 적어 둔다. 누가 '이 사건의 큰 흐름은?'이라고 물으면 그 메모들을 훑어 답한다. GraphRAG에서 관계도는 지식 그래프, 무리는 커뮤니티, 메모는 커뮤니티 요약이다.

지식 그래프는 사실을 점(노드)과 선(엣지)으로 표현한 데이터 구조다. 로드맵 논문(2306.08302)은 지식 그래프가 사실을 (머리 개체, 관계, 꼬리 개체) 형태의 트리플로 저장한다고 설명한다. 예를 들어 (뉴턴, 정립했다, 중력 이론)처럼 쓴다. 지식이 명시적으로 드러나 있으니 정확성과 해석 가능성이 높은 대신, 만들기 어렵고 늘 불완전하다는 약점이 있다.

온톨로지는 그 그래프의 설계도다. 어떤 종류의 개체(사람, 조직, 약물)가 있고 그 사이에 어떤 관계(소속, 부작용)가 허용되는지를 정한다. Hogan 등의 개론(2003.02320)은 지식 그래프에서 스키마, 개체의 동일성, 맥락이 하는 역할을 별도 주제로 다룰 만큼 중요하게 본다. GraphRAG의 초기 방식은 LLM이 원문에서 개체와 관계를 자유롭게 뽑는 쪽에 가깝고, 온톨로지로 추출을 묶어 두는 접근은 최근 연구에서 다시 등장한다.

어떻게 작동하나: 색인과 질문 두 단계

GraphRAG(2404.16130)는 일을 질문이 오기 전의 '색인'과 질문이 온 뒤의 '답변'으로 나눈다. 색인 첫 단계에서는 LLM이 원문 문서에서 핵심 개체와 그 사이의 관계를 뽑아 개체 지식 그래프를 만든다. 다음으로 그래프 커뮤니티 탐지(서로 촘촘히 연결된 노드 무리를 찾는 알고리즘)로 그래프를 계층적인 커뮤니티로 나눈다. 큰 주제 아래 작은 주제가 들어가는 구조다.

그다음 LLM이 커뮤니티마다 요약을 쓴다. 요약은 아래에서 위로 올라가며 만들어지고, 상위 커뮤니티의 요약은 하위 요약들을 다시 묶어 쓴다. 이렇게 쌓인 요약들이 말뭉치 전체에 대한 '목차 겸 해설집'이 된다. 질문이 오면 map-reduce 방식으로 답한다. map 단계에서 각 커뮤니티 요약을 근거로 부분 답을 서로 독립적·병렬로 만들고, reduce 단계에서 부분 답들을 합쳐 최종 답을 만든다.

모든 그래프 기반 RAG가 이렇게 작동하는 것은 아니다. GRAG(2405.16506)는 다단계 질문을 위해 질문에 맞는 '텍스트가 달린 부분 그래프'를 찾아낸다. 분할 정복 전략으로 최적의 부분 그래프를 선형 시간에 찾고, 이를 텍스트로 풀어 쓴 관점과 그래프 구조 자체의 관점, 두 가지로 LLM에 넣는다. 정리하면 GraphRAG는 '전체를 요약하는 질문', GRAG는 '연결을 따라가는 질문'에 초점을 둔 설계다.

GraphRAG의 색인과 답변 흐름원문 문서 → 개체·관계 추출; 개체·관계 추출 → 지식 그래프; 지식 그래프 → 커뮤니티 탐지; 커뮤니티 탐지 → 커뮤니티 요약(요약); 커뮤니티 요약 → 부분 답변(map)(근거); 사용자 질문 → 부분 답변(map); 부분 답변(map) → 최종 답변(reduce)(종합)오프라인 색인질문 시점원문 문서개체·관계 추출LLM지식 그래프노드=개체, 엣지=관계커뮤니티 탐지계층적 묶음커뮤니티 요약아래→위로 작성사용자 질문부분 답변(map)요약별 병렬 생성최종 답변(reduce)부분 답 종합요약근거종합
GraphRAG의 색인과 답변 흐름 윗줄은 질문이 오기 전에 미리 해 두는 색인, 아랫줄은 질문이 왔을 때의 답변이다. 커뮤니티 요약이 두 단계를 잇는다.

발전 흐름: 지식 그래프에서 그래프 RAG까지

출발점은 지식 그래프 자체에 대한 정리다. Hogan 등(2003.02320, 2020)은 지식 그래프에 쓰이는 데이터 모델과 질의 언어, 스키마·동일성·맥락의 역할, 연역적·귀납적 기법으로 지식을 표현하고 추출하는 방법, 그리고 그래프의 생성·보강·품질 평가·정제·공개 방법을 폭넓게 개관했다. 이후 LLM과 결합하는 연구의 공통 어휘가 여기서 나온다.

LLM이 등장하자 Pan 등(2306.08302, 2023)은 둘을 합치는 로드맵을 세 갈래로 정리했다. 지식 그래프로 LLM을 보강하는 방향(KG-enhanced LLM), LLM으로 지식 그래프 구축·완성·질의응답을 돕는 방향(LLM-augmented KG), 둘이 대등하게 서로를 키우는 방향(Synergized LLM + KG)이다. 같은 해 LLMs4OL(2307.16648)은 '온톨로지 학습', 즉 텍스트에서 개념 체계를 자동으로 뽑아내는 일을 LLM이 할 수 있는지 시험했다. 9개 LLM 계열을 제로샷 프롬프트(예시 없이 지시만 주는 방식)로 용어 유형 분류, 상하위 분류 체계 발견, 비계층 관계 추출 세 과제에 대해 평가했고, WordNet(어휘), GeoNames(지리), UMLS(의료) 지식을 다뤘다.

2024년에는 검색 쪽에서 구조를 만드는 시도가 이어졌다. RAPTOR(2401.18059)는 텍스트 조각을 임베딩하고 비슷한 것끼리 묶어 요약하는 과정을 반복해 아래에서 위로 요약 트리를 만들고, 서로 다른 추상화 수준에서 검색한다. GPT-4와 결합해 QuALITY 벤치마크 최고 성능을 절대 정확도 20% 높였다고 보고했다. GraphRAG 논문(2404.16130)은 스스로를 RAPTOR 같은 계층적 요약 색인과 비슷하다고 소개하면서, 원문에서 그래프 색인을 만들고 커뮤니티 탐지로 주제별로 나눈다는 점을 차이로 든다. 이어 GRAG(2405.16506)가 연결된 문서에서 부분 그래프를 검색하는 방향을 제시했다.

평가 방식도 새로웠다. 전체 주제를 묻는 질문에는 정해진 정답이 없기 때문에, GraphRAG 연구진은 한 LLM으로 말뭉치 맞춤형 질문을 만들고 다른 LLM이 두 RAG 시스템의 답을 미리 정한 기준으로 비교하는 LLM-as-a-judge 방식을 썼다. 100만 토큰 규모 데이터셋에서 GraphRAG가 벡터 RAG보다 답의 포괄성과 다양성에서 크게 앞섰다고 보고한다.

요즘 어디로 가고 있나

첫째, '모든 질문에 같은 탐색법'에서 벗어나는 흐름이다. MOSAIC(2609.11065)는 대부분의 GraphRAG가 질문과 상관없이 비슷한 탐색 절차를 쓴다는 점을 문제로 본다. 단순 사실 질문은 가까운 이웃만, 비교 질문은 여러 대상을 고르게, 간접 질문은 더 깊은 경로를 봐야 한다는 것이다. 그래서 추가 학습 없이 LLM 분석기가 질문마다 출발점 선택, 그래프 탐색, 멈춤, 근거 선택 정책을 정한다. 같은 그래프와 생성기에서 비교했을 때 좁게·중간·넓게 중 어느 고정 정책도 늘 최선이 아니었고, MOSAIC는 가장 강한 고정 정책보다 9.96점 높았으며 '넓게' 정책보다 경로를 81.9% 적게 평가했다고 보고한다.

둘째, 온톨로지와 제약을 다시 그래프 안으로 들여오는 흐름이다. NS-ST-GraphRAG(2609.05139)는 장편 문학 작품처럼 근거가 여러 장에 흩어지고 관계가 이야기 시간에 따라 바뀌는 텍스트를 다룬다. 온톨로지에 맞춘 추출, 규칙 기반 제약 검사, 시간 좌표, 장면의 공간 속성을 넣고, 하나의 고정된 그래프 대신 질문의 시간·공간 범위에 맞는 그래프 상태를 골라 검색한다. 앞서 본 LLMs4OL이 'LLM으로 온톨로지를 만들 수 있나'를 물었다면, 이 연구는 '온톨로지로 LLM의 추출을 묶어 둘 수 있나'를 묻는 셈이다.

셋째, GraphRAG가 실제 시스템이 되면서 보안 문제가 연구 대상이 됐다. 색인 단계에서 미리 만들어 두는 요약·점수 같은 보조 구조가 공격 대상이 될 수 있다는 연구(2610.02373)가 나왔고, 이는 '한계와 쟁점'에서 자세히 다룬다.

지식 그래프·GraphRAG 연구 지도GraphRAG → MOSAIC(탐색 개선); GraphRAG → HDI(공격 대상); LLMs4OL → NS-ST-GraphRAG(온톨로지)기초 · 지식 그래프·온톨로지2024 · 구조를 만들어 검색요즘 방향Knowledge Graphs2003.02320지식 그래프 개론LLM+KG 로드맵2306.08302세 갈래로 정리LLMs4OL2307.16648LLM으로 온톨로지 학습RAPTOR2401.18059요약 트리 검색GraphRAG2404.16130커뮤니티 요약GRAG2405.16506부분 그래프 검색MOSAIC2609.11065질문별 탐색 정책HDI2610.02373보조 구조 공격NS-ST-GraphRAG2609.05139온톨로지·시공간 제약탐색 개선공격 대상온톨로지
지식 그래프·GraphRAG 연구 지도 왼쪽은 개념의 기초, 가운데는 2024년 '구조를 만들어 검색하는' 방법들, 오른쪽은 요즘 방향이다. 화살표는 본문에서 직접 이어지는 관계만 표시했다.

한계와 쟁점

가장 먼저 드는 쟁점은 비용과 품질의 맞교환이다. GraphRAG는 그래프와 커뮤니티 요약을 LLM으로 만들기 때문에 질문이 오기 전에 상당한 LLM 처리를 해 두어야 하고, 그래프 품질은 추출 품질에 그대로 좌우된다. 로드맵 논문(2306.08302)이 정리하듯 지식 그래프는 원래 만들기 어렵고 불완전하며 계속 바뀌는 성질이 있다. 자동 추출로 만든 그래프도 이 약점에서 자유롭지 않다.

둘째는 보안이다. HDI 연구(2610.02373)는 지금까지의 공격이 노드·엣지·트리플 같은 개별 요소만 노렸던 것과 달리, 의미 요약·계층 엣지·사전 계산 점수 같은 보조 구조를 새 공격 표면으로 정의했다. Microsoft GraphRAG와 HippoRAG2를 HotpotQA·2WikiMultiHopQA에서 시험했을 때, 보조 구조의 0.016%만 바꿔도 88~94%의 공격 성공률을 보였고, 수정 하나가 최대 6.00개 질문에 영향을 줬다. 조작된 요약은 시스템이 만든 것처럼 자연스러운 문장이어서 문장 이상도(perplexity)·바꿔쓰기 기반 방어를 99% 넘게 피했다. 미리 만든 구조를 실행 시점에 검증 없이 믿는 설계 자체가 사각지대라는 지적이다.

셋째는 평가다. 전체 주제를 묻는 질문에는 정답이 없어서 GraphRAG 원 논문도 LLM이 답을 비교 채점하는 방식을 썼다. 이 방식은 실용적이지만 채점 LLM의 기준에 결과가 기댄다. 최근 연구 중에는 결과를 신중하게 보고하는 사례도 있다. NS-ST-GraphRAG(2609.05139)는 120문항 평가에서 답 재현 0.733 대 기준선 0.675로 방향은 유리하지만 통계적으로 유의하지 않다(p = 0.092)고 밝히고, 미리 세운 가설 하나는 지지되지 않았다고 적었다. 그래프를 넣으면 무조건 좋아진다고 단정하기는 아직 이르다.

더 공부하려면

개념 바탕이 필요하면 Hogan 등의 「Knowledge Graphs」(2003.02320)로 데이터 모델, 스키마, 품질 평가 같은 기초 어휘를 먼저 잡는 것이 좋다. 이어 Pan 등의 로드맵(2306.08302)을 읽으면 LLM과 지식 그래프를 잇는 연구가 세 갈래 중 어디에 속하는지 분류하는 눈이 생긴다.

그다음은 GraphRAG 원 논문(2404.16130)이다. 색인→커뮤니티 요약→map-reduce 답변의 흐름과 LLM-as-a-judge 평가 설계를 함께 보면 좋다. 비교 대상으로 RAPTOR(2401.18059)의 요약 트리와 GRAG(2405.16506)의 부분 그래프 검색을 나란히 읽으면 '구조를 만들어 검색한다'는 같은 발상이 질문 유형에 따라 어떻게 갈라지는지 보인다.

온톨로지에 관심이 있다면 LLMs4OL(2307.16648)과 NS-ST-GraphRAG(2609.05139)를 이어 읽는다. 실제 시스템을 만드는 입장이라면 MOSAIC(2609.11065)의 질문별 탐색 정책과 HDI(2610.02373)의 보조 구조 공격 분석을 함께 보길 권한다. 성능을 높이는 설계와 그 설계가 여는 위험을 한 번에 볼 수 있다.

관련 용어

지식 그래프 온톨로지 RAG 에이전틱 RAG 하이브리드 검색 임베딩 청킹 환각

참고 문헌

핵심 논문

최근 연구

AI가 참고 문헌을 바탕으로 작성하고 검수를 거친 해설입니다. 정확한 내용은 원문을 확인해 주세요.