AI 인사이트 목록
RAG2026년 7월 11일

GraphRAG가 전체를 조망하는 질문에 답하는 방법

GraphRAG는 문서 전체에서 엔티티 지식 그래프를 만들고 커뮤니티 단위 요약을 미리 생성해, 코퍼스 전반을 조망하는 질문에 답하는 마이크로소프트의 방법입니다. 개별 문서 조각 검색으로는 답할 수 없는 전역 질문까지 커버 범위를 넓힌다는 점에서 사내 지식 시스템의 다음 단계를 보여줍니다.

원문 논문 보기GraphRAG · 지식 그래프 · 요약 · 커뮤니티 탐지

기존 RAG는 질문과 비슷한 문서 조각을 찾아 답합니다. 그래서 "이 데이터셋의 주요 주제는 무엇인가"처럼 코퍼스 전체를 종합해야 하는 질문에는 구조적으로 실패합니다. 어떤 조각도 전체를 담고 있지 않기 때문입니다.

문제 배경

벡터 검색 RAG는 질문과 국소적으로 유사한 조각을 찾는 데 최적화되어 있습니다. 전체를 종합하는 질문은 본질적으로 요약 문제에 가깝지만, 코퍼스가 컨텍스트 윈도우를 훨씬 넘는 규모라면 전체를 한 번에 넣어 요약할 수도 없습니다. 검색으로는 전역 구조를 못 보고, 요약으로는 규모를 감당하지 못하는 간극이 있었습니다.

방법

Edge 등(2024)의 GraphRAG는 색인 단계에서 미리 일을 해 둡니다. LLM으로 문서 전체에서 엔티티와 관계를 추출해 지식 그래프를 만들고, 라이덴 알고리즘으로 그래프의 커뮤니티 구조를 계층적으로 탐지한 뒤, 커뮤니티마다 요약을 미리 생성합니다. 질문이 들어오면 관련 커뮤니티 요약들로 부분 답변을 병렬 생성하고 이를 다시 종합해 최종 답을 냅니다. 전역 요약 문제를 커뮤니티 단위의 맵리듀스로 바꾼 것입니다.

라이덴 알고리즘으로 탐지한 엔티티 그래프의 커뮤니티 구조

결과

팟캐스트 전사록(약 100만 토큰)과 뉴스 기사(약 170만 토큰) 두 데이터셋에서 전역 조망형 질문으로 평가했습니다. LLM 심판이 답변 쌍을 비교하는 방식으로 데이터셋과 지표마다 125개 질문을 사용했는데, 커뮤니티 계층의 어느 수준을 쓰든 GraphRAG의 모든 조건이 답변의 포괄성과 다양성에서 기존 벡터 RAG를 이겼습니다. 원문 전체를 맵리듀스로 요약하는 방식과 비교하면 하위 커뮤니티 요약을 쓰는 구성이 훨씬 적은 토큰으로 경쟁력 있는 성능을 냈습니다.

한계와 주의점

평가가 두 데이터셋 약 100만 토큰 규모에 머물렀고, LLM 심판의 상대 비교라는 평가 방식 자체의 한계도 저자들이 인정합니다. 색인 단계에서 코퍼스 전체에 LLM을 돌리므로 초기 구축 비용이 상당하며, 문서가 자주 갱신되는 환경에서는 그래프와 요약의 최신성 유지가 추가 과제가 됩니다. 조각 검색으로 충분한 국소 질문에까지 쓸 이유는 없습니다.

기업 적용 관점

경영진이 원하는 질문은 "이 조항이 어디 있나"보다 "올해 고객 불만의 공통 원인은 무엇인가"에 가깝습니다. 후자는 벡터 검색만으로는 답할 수 없습니다. 코텍시스는 질문 유형을 먼저 분류해 국소 질문은 조각 검색형 RAG로, 전역 질문은 그래프 기반 질의로 처리하도록 나눠 설계합니다. 색인 비용이 있는 만큼, 전역 질문의 빈도와 가치가 비용을 넘는지 도입 전에 함께 검토합니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의