
GraphRAG 가이드: 지식 그래프가 벡터 RAG를 이기는 경우 (그리고 지지 않는 경우)
GraphRAG가 죽은 것은 아니지만 기본값도 아닙니다. microsoft/graphrag는 2026년 7월 18일에 v3.1.1을 출시했고(GitHub 스타 35,088개), 2026년의 세 개 벤치마크 논문이 일관되게 보고하는 바에 따르면 순수 벡터 검색에 자주 패배합니다. 따라서 이 GraphRAG 가이드는 남은 유일한 질문에 답합니다. 지식 그래프가 인덱싱 비용을 정당화할 가치가 있을까요?
GraphRAG를 사용해야 할까요? 짧은 답변
다중 엔티티에 걸쳐 있거나 전체 말뭉치에 걸친 질문이 있을 때 GraphRAG를 사용하세요. 예를 들어 "우리의 최대 고객은 누구이고, 그 고객과 협력하는 공급업체는 누구인가?"라는 질문 같은 경우입니다. 단일 단계 팩트 검색, 자주 변경되는 문서, 그리고 엄격한 지연 시간 예산이 있을 때는 기본 RAG나 하이브리드 RAG를 선택하세요. 그래프는 다중 홉 질문에서는 투자 가치를 뽑지만 다른 곳에서는 비용일 뿐입니다.
GraphRAG는 죽지 않았고 기본값도 아닙니다. 다중 홉 또는 전체 말뭉치 질문이 있을 때 인덱싱 비용을 정당화하고, 그렇지 않을 때는 단순히 비용입니다.
짧은 버전:
- GraphRAG는 다중 홉과 말뭉치 전체 질문에서 승리하고, 기본 RAG는 단일 홉 검색에서 승리합니다.
- 2026년 벤치마크는 엇갈렸습니다. 그래프는 집계에 도움이 되지만 세밀한 요약에는 손상을 줄 수 있습니다.
- 비용은 쿼리 시간이 아니라 인덱스 시간의 LLM 추출 호출에서 발생합니다.
- 아무것을 구축하기 전에 자신의 말뭉치에서 기본 검색을 제어 기준으로 실행하세요.
이미 벡터 RAG 파이프라인을 운영 중이라면 유일한 결정은 그래프 위의 것이 투자 가치를 뽑느냐입니다. 아래 표는 전체 주장을 여섯 행으로 요약한 것이고, 기본 RAG로 유지하라고 쓰인 곳이 정직한 답변입니다. 벤더들이 인정하는 것보다 더 자주 그렇습니다. 하이브리드 BM25와 벡터 검색의 조합은 그래프 없이도 대부분의 경우를 커버합니다.
GraphRAG가 실제로 무엇인가: 청크에서 커뮤니티로
GraphRAG는 분리된 청크 대신 지식 그래프를 통한 검색 증강 생성입니다. 인덱싱 시간에 LLM이 문서에서 엔티티와 관계를 추출하고, Leiden 알고리즘이 그 엔티티들을 커뮤니티로 그룹화하며, 각 커뮤니티가 요약을 얻습니다. 쿼리 시간에 그래프와 그 요약이 청크 위의 top_k 창이 구조적으로 할 수 없는 질문에 답합니다.
엔드투엔드 파이프라인:
두 가지 단계가 일을 합니다. 인덱싱 단계가 비싼 단계입니다. 모든 청크는 엔티티와 관계를 추출하기 위한 LLM 호출이 필요하고, 커뮤니티 요약은 그 위에 더 많은 호출이 들어갑니다. 쿼리 단계는 성과가 드러나는 곳입니다. 그래프가 관계를 명시적으로 저장하기 때문에 "우리의 최대 고객이 협력하는 공급업체는 누구인가?"라는 질문은 올바른 두 청크가 같은 top_k 창에 들어갈 희망 대신 트래버설이 됩니다.
요약이 중요한 이유는 그것이 글로벌 검색이 실제로 읽는 것이기 때문입니다. 전체 말뭉치 질문은 원시 청크가 아니라 미리 작성된 커뮤니티 요약으로부터 응답을 받습니다. 그리고 모든 엣지는 LLM의 판단 호출이고, 실제 그래프 데이터베이스에서 Cypher로 쿼리할 수 있는 트리플로 저장됩니다. 그 설계가 또한 인덱싱이 비용을 지배하는 이유이기도 하며, 아래의 숫자들이 구체적으로 보여줍니다.
자리를 잡은 프레이밍: 기본 RAG는 구절을 검색하고, GraphRAG는 구조를 검색합니다. 임베딩 모델 선택은 여전히 벡터 계층에 중요하고, 벡터 데이터베이스는 여전히 설명을 저장하지만, 그래프가 새로운 하중을 견디는 부분입니다. 공식 Index Overview 문서는 각 단계를 전체적으로 설명합니다.
GraphRAG의 네 가지 쿼리 방법은 무엇인가?
GraphRAG 쿼리 엔진은 네 가지 방법을 제공합니다. Local Search, Global Search, DRIFT Search, 그리고 Basic Search입니다. Local Search는 특정 엔티티에서 외향으로 추론하고, Global Search는 전체 말뭉치의 커뮤니티 요약을 집계하며, DRIFT Search는 두 가지를 재귀적으로 혼합하고, Basic Search는 순수 벡터 기준선입니다. 다섯 번째 기능인 Question Generation은 엔진 옆이 아니라 위에 앉아 있습니다.
우리는 2026년 7월 30일 microsoft.github.io/graphrag/query/overview/의 라이브 문서를 확인했고, 개수는 네 개입니다. 대부분의 순위 가이드는 두 세 개를 이름 지어 봅니다. 같은 확인으로 Index와 Query overview 페이지 모두에서 "lazy"라는 단어는 0번 나타났으며, 이는 아래 비용 섹션에 중요합니다.
주목할 가치가 있는 행은 마지막 것입니다. Basic Search는 내장된 순수 벡터 기준선이고, 자신의 말뭉치에서 그래프를 순수 검색과 비교하고 그래프가 투자 가치를 뽑는지 알아내기 위해 존재합니다. 이것은 사소한 것이 아닙니다. 이 가이드의 전체 결정 절차가 한 기능에 있습니다. 기본 검색을 먼저 실행하세요. Local, Global, 또는 DRIFT 검색이 실제로 받는 질문에서 이를 이기지 못하면, 그래프는 업그레이드가 아니라 비용입니다.
2026년 벤치마크가 실제로 찾은 것은 무엇인가?
2026년의 세 벤치마크 논문은 GraphRAG가 다중 홉과 다중 팩트 집계 작업에서 도움이 되지만 다른 곳에서는 기본 RAG보다 성능이 자주 떨어진다는 것을 발견합니다. 그 중 하나는 그래프가 지는 곳을 찾기 위해 특별히 벤치마크를 구축합니다. 모두 세 개가 승리가 말뭉치 크기가 아니라 질문 유형에 따라 달라진다는 것에 동의합니다. 증거는 GraphRAG가 기본값이 아니라 상황 의존적이라고 말합니다.
네 번째 노력인 GraphRAG-Bench(저장소)는 16개 분야와 20권의 교과서에 걸쳐 9개의 GraphRAG 방법을 평가하고, 더 넓은 각도에서 같은 결론에 도달합니다.
세 개의 논문 모두 한 점에 수렴합니다. 그래프는 다중 홉 집계 비용을 정당화하고 세밀한 회수에서는 그 비용을 잃습니다.
우리의 해석: 과대 광고 사이클이 손상을 입혔고, 이 논문들이 수정입니다. 그들 중 누구도 그래프가 쓸모없다고 말하지 않습니다. 그들이 일관되게 말하는 것은 GraphRAG를 말뭉치 전체 주제에 좋게 만드는 집계 단계가 세밀한 세부 정보를 흐리게 하는 같은 단계라는 것입니다. WildGraphBench가 가장 명확한 예입니다. 그래프는 중간 정도의 수의 소스에서 다중 팩트 집계에 도움이 되었고, 같은 평가에서 요약 정확성을 손상시켰습니다. 그것은 모순이 아닙니다. 같은 메커니즘이 두 번 나타나는 것입니다.
실제 결과는 문헌만으로 이것을 결정할 수 없다는 것입니다. 논문은 어떤 질문 유형을 테스트할지를 말하고, 당신의 말뭉치가 그 중 하나인지 여부는 말하지 않습니다. 정확히 위의 방법 섹션의 기본 검색 제어가 하는 일입니다.
GraphRAG의 비용이 얼마나 될까요? (그리고 모두가 반복적으로 틀리게 설명하는 LazyGraphRAG 주의)
GraphRAG의 비용은 쿼리 시간이 아니라 인덱싱 시간 청구이며, 정확히 이것이 사람들을 놀라게 하는 이유입니다. 모든 청크에서 엔티티와 관계를 추출하고 커뮤니티 요약 전달을 하는 LLM 호출이 비싸게 만드는 것입니다. 단일 쿼리가 실행되기 전에 앞서 비용을 지불합니다. 쿼리 시간은 더 저렴하지만 무료는 아닙니다. Global Search는 커뮤니티당 LLM 호출로 커뮤니티 요약 위에 확산하는데, 이것이 위의 방법 표가 그것을 높게 표시하는 이유입니다.
유일한 어려운 공개 숫자는 Microsoft Research에서 옵니다. 2024년 11월 25일 그 팀은 LazyGraphRAG의 인덱싱 비용이 벡터 RAG와 동일하고 전체 GraphRAG 비용의 0.1%였으며, GraphRAG 글로벌 검색의 쿼리 비용의 4%에서 테스트된 경쟁 방법들을 능가했다고 보고했습니다. 로컬 및 글로벌 쿼리 유형 모두에서 말입니다(Microsoft Research). 이것들은 Microsoft의 도형이고, Microsoft의 블로그에서 나왔으며, 우리는 그것들을 그렇게 보고합니다. 우리는 우리 자신의 가격이 책정된 인덱스를 운영하지 않았습니다.
대부분의 글이 놓치는 수정입니다. LazyGraphRAG는 pip install 옵션이 아닙니다. Microsoft 자신의 2025년 6월 6일 편집자 메모에 따르면, 그것은 오픈 소스 패키지가 아니라 Microsoft Discovery와 Azure Local로 출시되었습니다. 우리는 2026년 7월 30일의 공식 Index Overview와 Query Overview 페이지를 확인했습니다. "lazy"라는 단어는 둘 다에서 0번 나타납니다. 따라서 가이드가 LazyGraphRAG를 오늘 오후에 스핀업할 수 있는 변형으로 나열하면, 오픈 소스 세계에서 더 이상 사실이 아닌 주장을 반복하고 있습니다.
오늘 할 수 있는 것: 추출 모델을 로컬에서 실행하세요. Ollama를 통해 인덱싱 단계를 로컬 모델로 지정하면 가장 비싼 단계에서 토큰당 API 수수료가 제거되고, 자체 호스팅 벡터 저장소와 쌍을 이루면 나머지 청구를 거의 0에 가깝게 유지합니다.
실제로 유지되는 GraphRAG 라이브러리는 어느 것인가?
...