[Paper Review] RAG vs. GraphRAG: A Systematic Evaluation and Key Insights (KDD 2026)

2026. 8. 11. 15:38·Paper Review

 

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

 

TL;DR: 본 논문은 RAG system 평가를 위한 새로운 벤치마크를 제시하거나 평가방법론을 설계하기보다는, VectorRAG vs. GraphRAG 관점에서 Emperical Study 를 진행하고, 다각도에서 효과적인 RAG 가 어떤것인지를 규명하기 위한 연구임. 따라서 벤치마크는 기존에 이미 알려진, ground truth 가 존재하는 HotpotQA 등을 사용함. 

Abstract

  • 연구 배경 및 필요성
    • RAG (Retrieval-Augmented Generation): 외부 텍스트 데이터에서 정보를 검색해 LLM의 답변 정확도를 높이는 방식입니다. 주로 구조화되지 않은 일반 텍스트 데이터에 강점이 있습니다.
    • GraphRAG: Knowledge Graph와 같은 구조화된 데이터를 활용하여 데이터 간의 관계(Relation)를 따라 정보를 검색합니다. 최근에는 비구조화된 텍스트를 그래프로 변환해 추론 능력을 강화하려는 시도가 많아지고 있습니다.
    • 문제점: 기존의 GraphRAG 연구들은 각자 다른 환경, 다른 데이터셋, 다른 평가 방식을 사용하여 RAG와의 직접적인 성능 비교가 어려웠습니다. 즉, '어떤 상황에서 왜 그래프 구조가 유리한지'에 대한 체계적인 분석이 부족함.
  • Main Contributions
    • 통합 평가 프로토콜 도입: 데이터 전처리부터 검색, 생성 설정까지 모든 단계를 표준화하여 RAG와 GraphRAG를 공정하고 재현 가능하게 비교했습니다.
    • 상호 보완적 관계 증명: 두 방식은 어느 한쪽이 항상 우월한 것이 아니라, 작업 유형에 따라 강점이 다르다는 점을 밝혀냈습니다.
    • 하이브리드 전략 제안: 두 방식의 강점을 결합하는 '선택(Selection)'과 '통합(Integration)' 전략을 통해 성능을 극대화할 수 있는 방법을 연구했습니다.
    • 실무적 인사이트: 단순히 성능뿐만 아니라, 그래프 구축 비용, 검색 지연 시간(latency), 저장 공간 문제, 평가 과정에서의 편향(Bias) 등 실제 배포 시 고려해야 할 현실적인 trade-off를 분석했습니다.
  • 요약: 이 논문은 단순히 새로운 모델을 제안하는 것이 아니라, 기존 기술을 체계적으로 벤치마킹하여 실무자들이 시스템 설계 시 합리적인 선택을 할 수 있도록 돕는 "가이드라인"을 제공한다는 점에서 큰 의의가 있음

Introduction

  • RAG의 기본 개념과 역할
    • RAG는 외부 데이터 소스에서 관련 정보를 검색하여 LLM의 출력을 향상시키는 실용적인 패러다임입니다.
    • 의료, 법률, 금융, 교육 등 다양한 분야에서 활용되며, LLM의 고질적인 문제인 환각(Hallucination) 현상을 완화하고, 생성된 정보의 신뢰성(Faithfulness)과 견고함(Robustness)을 높이는 데 기여
    • 기존 RAG 시스템은 주로 텍스트 말뭉치(Text corpora)에서 정보를 검색하는 방식에 의존
  • GraphRAG의 등장 배경 및 확장
    • 그래프(Graph)는 데이터 간의 관계를 명시적으로 표현할 수 있어 지식 표현, 사회 연결망 분석 등에서 널리 사용
    • GraphRAG는 Knowledge Graphs(KGs)나 분자 그래프와 같은 구조화된 데이터에서 정보를 검색하고 집계하는 방식으로 주목받고 있습니다.
    • 최근에는 비정형 텍스트 문서에서 그래프를 생성하여, 전역적 요약(Global summarization), 계획 수립(Planning), 복잡한 추론(Reasoning) 작업에 활용하려는 시도가 활발합니다.
  • 본 연구의 목적
    • 기존 GraphRAG 연구들은 특정 작업이나 데이터셋에 한정되어 평가 방식이 파편화되어 있습니다.
    • 이로 인해 명시적인 그래프 구조가 RAG 성능에 언제, 왜 도움이 되는지 혹은 방해가 되는지에 대한 원칙적인 결론을 내리기 어렵습니다.
    • 본 논문은 그래프 생성 비용, 검색 지연 시간(Latency), 저장 공간(Storage footprint) 등 실무적인 트레이드오프를 체계적으로 비교 분석하고자 합니다.
  • GraphRAG의 4가지 유형 분류: 논문에서는 그래프 활용 방식에 따라 다음 4가지로 시스템을 분류하여 평가
    • KG-based GraphRAG: 텍스트에서 지식 그래프(Knowledge Graph)를 추출하여 이를 기반으로 검색.
    • Community-based GraphRAG: 그래프를 군집화하고 계층적 요약본을 생성하여 검색.
    • Text-centric graph-guided RAG: 지식 그래프를 검색 가이드로 활용하여 원본 텍스트 청크(Chunk)를 검색.
    • Hierarchical summary-based GraphRAG: 그래프 구조 없이 계층적 요약 구조를 만들어 다중 입도(multi-granular) 검색 지원.
  • 핵심 연구 결과
    • 상호 보완적 관계: RAG는 단일 단계(single-hop)의 사실 중심 질문에 강점이 있고, GraphRAG는 여러 단계를 거치는(multi-hop) 추론 중심 질문에 더 효과적입니다.
    • 설계의 중요성: 특히 Community-based GraphRAG의 경우, 전체를 요약하는 'Global Search'는 전체적인 맥락 파악에는 좋지만, 세부 정보를 놓칠 수 있는 trade-off가 존재합니다.
    • 평가 방식의 한계: LLM을 판사로 활용하는 'LLM-as-a-Judge' 방식은 답변의 제시 순서에 따라 결과가 달라지는 position bias(위치 편향) 문제가 있음을 지적합니다.
    • 비용 문제: GraphRAG는 그래프 구축 비용, 검색 지연 시간(latency), 저장 공간 면에서 RAG보다 더 많은 자원을 소모합니다.
  • 하이브리드 전략 제안
    • Selection: 질문의 유형(사실 vs. 추론)에 따라 RAG나 GraphRAG 중 적합한 모델을 선택하는 방식.
    • Integration: 두 시스템의 검색 결과를 모두 활용하여 최종 답변을 생성함으로써 성능을 극대화하는 방식.
  • Main Contributions
    • 통합 평가 프레임워크 구축 (Evaluation Framework): 데이터 전처리, 검색(Retrieval) 설정, 생성(Generation) 설정을 표준화하여 RAG와 다양한 GraphRAG 변형 간의 공정하고 재현 가능한 비교 환경을 마련했습니다.
    • 작업별 성능 보완성 설명
      1. RAG: 단일 홉(Single-hop) 질문이나 세부 정보가 필요한 사실 기반(Factual) QA에서 강점을 보입니다.
      2. GraphRAG: 다중 홉(Multi-hop) 질문처럼 복잡한 추론이 필요한 작업이나, 전체 코퍼스 수준의 포괄적이고 다양한 요약(Global Summarization)에서 우수한 성능을 나타냅니다.
    • 하이브리드 전략 제안: 두 방식의 강점을 결합한 'Selection(질문 유형에 따른 선택)' 및 'Integration(두 방식의 증거를 병합)' 전략을 통해 시스템 성능을 일관되게 향상할 수 있음을 입증
    • 실무적 고려사항 도출
      1. 비용 및 효율: GraphRAG는 구축 및 검색 과정에서 더 높은 계산 비용과 저장 공간을 요구하며, 검색 성능이 그래프 구축 품질에 민감하게 반응합니다.
      2. 평가 편향: 요약 작업에서 LLM-as-a-Judge 방식을 사용할 경우, 결과물의 제시 순서에 따라 판단이 달라지는 '위치 효과(Position Effect)'가 존재함을 확인했습니다.

Evaluation Framework

Graph RAG Implementations.

  • KG-based GraphRAG: 텍스트로부터 지식 그래프(Knowledge Graph, KG)를 직접 구축하는 방식입니다. 쿼리에 포함된 엔티티를 KG의 노드와 정렬한 뒤, 다중 홉(multi-hop) 이웃 노드를 탐색하여 (head, relation, tail) 형태의 관계형 삼중항(triplets)을 증거로 수집합니다. 단순히 삼중항만 검색하거나, 그와 관련된 원본 텍스트를 함께 검색하는 두 가지 하위 변형이 존재합니다.
  • Community-based GraphRAG: 구축된 KG를 그래프 클러스터링 알고리즘으로 계층적 커뮤니티로 나눕니다. 하위 커뮤니티는 세부 정보를, 상위 커뮤니티는 추상적인 요약 정보를 담고 있습니다.
    • Local Search: 엔티티 이웃과 하위 커뮤니티 보고서를 직접 검색합니다.
    • Global Search: 상위 커뮤니티 요약을 시맨틱 유사도 기반으로 검색하여 전체적인 맥락을 파악합니다.
  • Text-centric graph-guided RAG: 그래프를 검색의 주 대상이 아닌, 텍스트 청크를 검색하기 위한 보조적인 길잡이(auxiliary structure)로 활용합니다. HippoRAG2가 대표적인 예로, 엔티티 연결 그래프를 이용해 쿼리와 관련성 높은 엔티티를 먼저 찾고, 그에 연결된 텍스트 청크를 가져옵니다.
  • Hierarchical summary-based GraphRAG: 명시적인 KG 구성 없이, 텍스트 청크를 재귀적으로 클러스터링하여 다단계 요약 구조를 생성합니다. RAPTOR가 이에 해당하며, 거친 요약부터 세밀한 정보까지 단계적으로 검색할 수 있는 다중 입도(multi-granular) 검색을 지원합니다.

Tasks.

  • 주요 평가 과제 (Tasks):
    • Question Answering (QA): 질문에 대한 정확한 답변을 찾아내는 능력입니다. 단일 사실을 확인하는 single-hop QA와 여러 정보를 종합해 추론해야 하는 multi-hop QA로 구분하여 평가합니다.
    • Query-based Summarization: 특정 질문이나 주제와 관련된 핵심 내용을 요약하는 작업입니다. 단일 문서에서 요약하는 방식과 여러 문서의 정보를 통합하여 요약하는 방식으로 나뉩니다.
  • 문서 범위에 따른 검색 제한:
    • Single-document tasks: 검색 범위가 해당 문서 하나로 제한됩니다. 즉, 외부 데이터를 탐색하지 않고 주어진 텍스트 내에서만 근거를 찾습니다.
    • Multi-document tasks: 모든 문서로 구축된 전체 인덱스(index)를 대상으로 검색을 수행합니다. 따라서 더 방대한 정보 속에서 관련 내용을 찾아내고 통합하는 능력이 요구됩니다.
  • 요약: 단순히 하나의 모델을 테스트하는 것이 아니라, RAG와 GraphRAG가 각기 다른 데이터 구조(단일 문서 vs 다중 문서)와 질문 유형(단순 사실 vs 복합 추론)에서 어떤 강점을 보이는지 체계적으로 분석하려는 목적을 가지고 있습니다.

Question Answering

  • RAG의 강점 (단일 홉 쿼리)
    • RAG는 단순한 정보 검색 및 사실 관계 확인이 필요한 단일 홉(Single-hop) 질문이나 세부 사항(Detail-oriented)을 묻는 쿼리에서 매우 뛰어난 성능을 보입니다.
    • Natural Questions (NQ)와 같은 벤치마크에서 RAG가 우위를 점하는 이유입니다.
  • GraphRAG의 강점 (다중 홉 쿼리)
    • HippoRAG나 Community-GraphRAG와 같이 그래프 구조를 활용하는 방식은 여러 문서에 걸쳐 있는 정보를 연결해야 하는 다중 홉(Multi-hop) 질문에서 RAG보다 우수한 성능을 나타냅니다.
    • 데이터 간의 관계를 명시적으로 모델링하기 때문에 추론이 필요한 복잡한 질문에 적합합니다.
  • GraphRAG의 설계에 따른 한계
    • Global Search의 한계: Community-GraphRAG의 'Global search' 방식은 요약된 정보를 위주로 검색하므로 세부적인 정보가 유실될 가능성이 크며, 이는 답변이 불가능한 'Null' 쿼리에서 환각(Hallucination)을 유발할 위험을 높입니다.
    • KG-based GraphRAG의 데이터 누락: 지식 그래프(Knowledge Graph)를 기반으로 하는 방식은 추출된 엔티티(Entity)나 관계(Relation)에 정보가 포함되지 않았을 경우, 답변에 필요한 핵심 내용을 아예 찾아내지 못하는 문제가 발생합니다. 실제 NQ나 HotPotQA 데이터셋에서 정답 엔티티의 약 35% 정도가 그래프에 포함되지 않는다는 점이 이를 입증합니다.
  • 요약: 두 방식은 상호 보완적인 관계에 있습니다. 즉, 어떤 방식이 항상 우월한 것이 아니라, 질문의 유형(단순 사실 검색 vs. 복잡한 추론)에 따라 선택적으로 활용하거나 결합하는 전략이 필요합니다.

Improving QA Performance.

  • 전략 1: RAG vs. GraphRAG Selection (선택 전략)
    • 핵심 아이디어: 질문의 유형에 따라 가장 적합한 검색 방식을 분류하여 할당하는 방식입니다.
    • 분류 기준: 질문이 단일 사실 확인(Fact-based) 중심인지, 아니면 여러 정보를 연결해 추론(Reasoning-based)해야 하는지를 기준으로 나눕니다.
    • 운영 방식: LLM의 In-context Learning 능력을 사용하여 입력된 쿼리를 분류합니다. 사실 중심이면 RAG를, 추론이 필요하면 GraphRAG(특히 Community-GraphRAG (Local))를 선택하여 답변을 생성합니다.
    • 장점: 하나의 시스템만 가동하므로 Integration 전략에 비해 연산 비용(computational cost) 측면에서 효율적입니다.
  • 전략 2: RAG와 GraphRAG Integration (통합 전략)
    • 핵심 아이디어: 두 시스템을 병렬로 가동하여 얻은 정보를 모두 합쳐서 최종 답변을 생성하는 방식입니다.
    • 운영 방식: 동일한 쿼리에 대해 RAG와 GraphRAG가 각각 관련 정보를 검색하게 합니다. 그 후, 두 시스템이 가져온 컨텍스트를 하나로 결합(concatenation)하여 LLM에 입력합니다.
    • 장점: 두 가지 다른 시각의 정보를 모두 활용하기 때문에, 일반적으로 Selection 전략보다 더 높은 답변 정확도를 기록합니다.
    • 단점: 매 쿼리마다 두 검색 엔진을 모두 실행해야 하므로 시스템 리소스와 검색 시간이 더 많이 소요됩니다.
  • 요약
    • 두 전략 모두 기존 베이스라인 모델보다 QA 성능을 일관되게 향상
    • 모델의 크기가 충분히 클수록(예: Llama 3.1-70B) 복잡한 정보를 더 잘 처리하여 통합 전략의 성능 이득이 큽니다.
    • 결론적으로, 고정된 시스템을 사용하는 대신 쿼리의 성격과 시스템 효율성을 고려해 검색 패러다임을 유연하게 조정하는 것이 성능과 비용 사이의 균형을 맞추는 최선의 방법임을 시사합니다.

Appendix C (Retrieval Performance)

  • 검색 성능 측정 방법 (Appendix C)
    • 논문에서는 검색 단계에서의 성능을 측정하기 위해 '검색 정확도(Retrieval Accuracy)'라는 지표를 사용했습니다.
    • 구체적으로는 "정답(Ground-truth)에 해당하는 문자열이 검색되어 모델에 전달된 컨텍스트 내에 포함되어 있는가?" 를 비율로 계산하였습니다.
  • 주요 실험 결과
    • KG-based GraphRAG의 한계: 논문에서는 HotPotQA와 Natural Questions (NQ) 데이터셋을 사용하여 검색 성능을 분석했습니다.
    • 결과적으로 KG-based GraphRAG는 그래프 구성 과정에서의 정보 유실 (전체 정답 엔티티 중 약 34~35%가 그래프에 누락됨) 로 인해 검색 정확도가 낮다는 점을 지적함.
    • 반면, Community-GraphRAG와 같은 방식은 커뮤니티 요약 정보를 활용함으로써 훨씬 높은 검색 정확도를 보여준다는 점을 비교표(Table 16 등)를 통해 제시함.
  • 검색과 생성의 분리: 논문은 검색과 생성을 분리하여 평가했습니다. 먼저 각 방법론으로 검색된 증거(Evidence)를 저장한 후, 통일된 생성 스크립트를 통해 답변을 생성했습니다. 이는 검색 알고리즘 자체가 모델의 답변 능력에 미치는 순수한 영향을 공정하게 비교하기 위한 조치입니다.

*Comment: 본 논문에서는 일반적인 VectorRAG 와 GraphRAG 간의 공정한 평가를 잘 정의된 (well-defined) 광범위한 벤치마크 데이터셋 (Single-hop / Multi-hop) 에서 진행하고, 데이터의 특성의 따라 다양한 RAG system 의 유불리를 분석합니다. 실험결과, 통합된 Framework 의 강한 일관된 성능을 볼 수 있고, 이후에는 어떻게 두 system 을 통합하는것이 가장 효과적일지에 대해 고민해봐야할 것 같습니다.

'Paper Review' 카테고리의 다른 글

[Paper Review] When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation (ICLR 2026)  (0) 2026.08.10
[Paper Review] GraphMAE2: A Decoding-Enhanced Masked Self-Supervised Graph Learner (WWW 2023)  (0) 2026.03.20
[Paper Review] Text Embeddings Reveal (Almost) As Much As Text (EMNLP 2023)  (0) 2026.02.16
[Paper Review] SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs (ACL 2024)  (0) 2026.01.28
[Paper Review] A Variational Approach for Mitigating Entity Bias in Relation Extraction (ACL 2025)  (0) 2026.01.14
'Paper Review' 카테고리의 다른 글
  • [Paper Review] When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation (ICLR 2026)
  • [Paper Review] GraphMAE2: A Decoding-Enhanced Masked Self-Supervised Graph Learner (WWW 2023)
  • [Paper Review] Text Embeddings Reveal (Almost) As Much As Text (EMNLP 2023)
  • [Paper Review] SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs (ACL 2024)
Seung-won Seo
Seung-won Seo
ML , NLP , DL 에 관심이 많습니다. 반갑습니다 :P
  • Seung-won Seo
    Butterfly_Effect
    Seung-won Seo
    • 분류 전체보기 (84)
      • 일기장 (2)
      • 메모장 (1)
      • Plan (0)
      • To do List (0)
      • Paper Review (39)
      • Progress Meeting (0)
      • Research in NLP (14)
      • Progress for XTM (0)
      • Writing for XTM (0)
      • 논문작성 Tips (12)
      • Study (16)
        • Algorithm (0)
        • ML & DL (7)
        • NLP (2)
        • Statistics (1)
        • Topic Modeling (6)
  • 링크

  • hELLO· Designed By정상우.v4.10.3
Seung-won Seo
[Paper Review] RAG vs. GraphRAG: A Systematic Evaluation and Key Insights (KDD 2026)
상단으로

티스토리툴바