AI 인사이트 목록
RAG2026년 7월 2일

하이브리드 검색이 단일 인덱스를 이기는 이유

하이브리드 검색은 키워드 검색과 의미 검색의 실패 지점이 서로 다르다는 사실을 이용해 단일 인덱스보다 높은 정확도를 얻는 방법입니다. 밀집 벡터 인덱스와 희소 인코더 인덱스를 하이브리드 질의로 결합한 Blended RAG는 NQ와 TREC-COVID 검색에서 새로운 기준을 세웠고, SQuAD 질의응답에서는 미세조정 접근을 능가했습니다.

원문 논문 보기하이브리드 검색 · BM25 · 밀집 벡터 · 검색 정확도

임베딩 기반 의미 검색은 표현이 달라도 뜻이 같은 문서를 찾아내지만, 모델이 본 적 없는 제품명이나 오류 코드 앞에서는 약해집니다. 반대로 BM25 같은 키워드 검색은 정확한 용어 일치에 강하지만 동의어와 문맥을 놓칩니다. 두 방식의 실패 지점이 서로 다르다는 것이 하이브리드 검색의 출발점입니다.

문제 배경

RAG 개선 노력의 대부분은 프롬프트 조정이나 모델 튜닝 등 생성 쪽에 쏠려 있었습니다. 그러나 검색이 엉뚱한 문맥을 가져오면 생성 단계에서 만회할 방법이 없습니다. 검색기 연구는 정보검색 분야에서, RAG는 LLM 분야에서 따로 다뤄지다 보니 검색 구성 자체를 체계적으로 최적화한 연구가 부족했습니다.

방법

Sawarkar 등(2024)의 Blended RAG는 세 종류의 인덱스를 준비합니다. BM25 인덱스, 코사인 유사도 기반 밀집 벡터(KNN) 인덱스, 그리고 의미 이해와 유사도 검색을 결합한 희소 인코더 인덱스입니다. 그 위에 매치 질의, 필드 조합 질의 등 여러 질의 유형을 얹어 인덱스와 질의 유형의 조합을 체계적으로 탐색하고, 가장 좋은 조합을 하이브리드 질의 전략으로 채택했습니다. 생성 단계는 모델 영향을 통제하기 위해 FLAN-T5-XXL 하나로 고정했습니다.

하이브리드 질의로 블렌디드 검색기를 구성하는 과정

결과

희소 인코더 인덱스에 필드 조합 질의를 결합한 구성이 NQ 데이터셋 상위 10건 검색 정확도 88.77%를 기록했습니다. 랭킹 지표에서도 TREC-COVID nDCG@10 0.87로 기존 기준 0.804를 넘었고, NQ에서는 0.67로 monoT5-3B의 0.633을 앞섰습니다. 질의응답 단계의 개선도 확인됩니다.

SQuAD 구성EMF1
RAG-original28.1239.42
RAG-end2end (미세조정)40.0252.63
Blended RAG (제로샷)57.6368.40

데이터셋에 미세조정하지 않은 제로샷 구성이 미세조정 접근을 넘어섰습니다. 검색 단계를 잘 설계하는 것만으로 확보한 성능입니다.

한계와 주의점

벤치마크가 NQ, TREC-COVID, SQuAD 등 공개 데이터셋 중심이라 기업 내부 문서에서 같은 폭의 개선이 보장되지는 않습니다. 저자들도 검색기와 RAG 벤치마크가 함께 갖춰진 표준 데이터셋이 없다는 점을 연구의 어려움으로 밝혔습니다. 인덱스를 세 벌 유지하는 운영 비용과 질의 유형별 가중치 조정도 실무에서는 추가 부담입니다.

기업 적용 관점

사내 검색 질의의 상당수는 계약 번호, 제품 코드, 담당자 이름처럼 정확한 문자열 일치가 핵심입니다. 임베딩 검색만 쓰는 시스템은 바로 이 지점에서 신뢰를 잃습니다. 미세조정 없이 검색 구성만으로 성능을 확보했다는 이 논문의 결과는, 학습 데이터를 만들기 어려운 기업 환경에서 특히 실용적입니다. 코텍시스는 RAG 구축 시 하이브리드 검색을 기본 구성으로 두고 가중치 조정을 고객 데이터로 검증합니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의