리랭커가 검색 정확도를 끌어올리는 방식
리랭커는 1차 검색이 추린 후보를 질의와 함께 다시 읽어 순위를 재조정하는 단계로, 검색 정확도를 좌우하는 저비용 개선점입니다. LLaMA를 밀집 검색기(RepLLaMA)와 리랭커(RankLLaMA)로 미세조정해 다단계 검색 파이프라인 전체를 대형 모델로 구성한 이 논문은 대형 모델 기반 검색이 소형 모델 기반 검색을 능가함을 보였습니다.
검색은 보통 두 단계로 구성됩니다. 1차 검색기가 후보 문서를 빠르게 추린 뒤 리랭커가 질의와 문서를 함께 읽어 순위를 다시 매깁니다. 이 리랭커 자리는 오랫동안 BERT 계열 소형 모델의 몫이었습니다. Ma 등(2023)은 이 구도를 바꿨습니다.
문제 배경
BERT 계열 리랭커의 최대 입력은 512 토큰입니다. 저자들의 분석에 따르면 MS MARCO 문서 코퍼스의 평균 문서 길이는 약 1,500 토큰이고 512 토큰 이하 문서는 24%에 불과합니다. 그래서 기존 파이프라인은 문서를 문단으로 쪼개 각각 점수를 매기고 합치는 우회로를 써 왔습니다. 한편 LLM에 프롬프트만으로 재순위를 시키는 접근은 여러 번의 생성 호출이 필요해 느리고, MS MARCO 같은 사람의 관련성 판정 데이터를 학습에 활용하기 어렵습니다.
방법
저자들은 LLaMA를 두 역할로 각각 미세조정했습니다. RepLLaMA는 질의와 문서를 각각 벡터로 변환하는 밀집 검색기이고, RankLLaMA는 질의와 문서를 함께 입력받아 관련성 점수를 내는 포인트와이즈 리랭커입니다. 문서 끝에 특수 토큰을 붙여 그 위치의 표현을 점수 계산에 쓰는 단순한 구조로, 대형 모델의 긴 문맥 처리 능력 덕분에 문서를 쪼개지 않고 통째로 표현할 수 있습니다.
결과
MS MARCO 패시지 검색에서 단계별 기여가 뚜렷합니다.
| 구성 | MRR@10 (dev) |
|---|---|
| BM25 | 18.4 |
| RepLLaMA (7B) | 41.2 |
| RepLLaMA + RankLLaMA (7B) | 44.9 |
| RepLLaMA + RankLLaMA (13B) | 45.2 |
학습에 쓰이지 않은 도메인 18종으로 구성된 BEIR 제로샷 평가에서도 RepLLaMA는 평균 nDCG@10 55.1로 기존 밀집 검색기들을 앞섰고, RankLLaMA 7B를 더하면 평균 1.5점이 추가로 올라 56.6에 이릅니다. 문서 단위 검색에서도 RepLLaMA 45.6, RankLLaMA 50.3으로 같은 경향이 확인됩니다.
한계와 주의점
13B 리랭커는 7B 대비 BEIR 평균에서 개선이 없었습니다(56.5). 모델을 키우는 것이 항상 답은 아니라는 뜻입니다. 또한 7B 모델로 후보 문서마다 점수를 계산하는 비용은 BERT 계열보다 크므로, 재순위 대상 후보 수와 지연 시간 요구사항을 함께 따져야 합니다. 실무에서는 후보 수십 건에만 리랭커를 적용하는 절충이 일반적입니다.
도입 검토 가이드
1차 검색기가 이미 돌아가고 있고 상위 결과의 순서가 품질 불만의 원인으로 지목되는 조직이 검토 대상입니다. 기존 인덱스를 그대로 두고 뒤에 한 단계를 얹는 구성이므로, 검색 시스템 전면 교체가 부담스러운 환경일수록 적합합니다. 문서가 512 토큰을 넘는 비중이 크다면 문서를 쪼개지 않고 통째로 읽는 이 논문의 접근이 특히 해당됩니다.
| 구분 | 내용 |
|---|---|
| 검토 주체 | 검색 플랫폼팀과 추론 인프라를 관리하는 MLOps 담당자 |
| 전제 조건 | 후보를 추려 주는 1차 검색기, 7B급 모델을 서빙할 GPU 추론 환경, 재순위 단계가 추가할 지연을 수용할 수 있는 응답 시간 예산 |
| 첫 적용 지점 | 상위 후보 수십 건에만 리랭커를 적용하는 오프라인 배치 평가. 실시간 적용은 지연 측정 후에 결정합니다 |
| 판단 기준 | 재순위 전후의 MRR@10과 nDCG@10 개선 폭. 논문 기준 리랭커 추가로 MRR@10이 41.2에서 44.9로, BEIR 평균이 55.1에서 56.6으로 올랐으므로 이 규모의 개선이 지연과 GPU 비용 증가를 상회하는지 봅니다. 13B는 7B 대비 BEIR 개선이 없었으므로 7B급에서 시작하는 것이 안전합니다 |
코텍시스가 기존 검색 시스템을 고도화할 때 리랭커 도입을 가장 먼저 검토하는 이유가 여기에 있습니다. 인덱스 재구축 없이 개선 폭이 검증된 지점부터 손대는 것입니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
멀티홉 질의 앞에서 무너지는 RAG를 측정하다
여러 문서의 증거를 모아 추론해야 답할 수 있는 멀티홉 질의에서 기존 RAG는 GPT-4를 써도 정답률이 절반 수준에 그칩니다. 이를 체계적으로 측정한 벤치마크 MultiHop-RAG를 구축한 논문으로, 단일 검색 한 번으로 설계된 시스템의 한계를 미리 알고 보완해야 함을 보여줍니다.
정답지 없이 RAG를 평가하는 RAGAS
RAGAS는 사람이 만든 정답 데이터 없이 검색 관련성, 생성 충실도, 답변 관련성을 각각 자동 측정하는 참조 없는 RAG 평가 프레임워크입니다. 평가 체계가 없으면 RAG 개선은 감에 의존하게 되므로, 사내 시스템 도입 시 정량 평가 루프를 처음부터 갖추는 일의 근거가 됩니다.
검색 전에 질문부터 고쳐 쓰는 RAG
사용자 질문을 검색에 맞게 고쳐 쓰는 재작성 단계를 검색 앞에 추가하면 RAG 성능이 일관되게 개선됩니다. Rewrite-Retrieve-Read 프레임워크를 제안한 이 논문은 소형 재작성 모델을 LLM 리더의 피드백으로 강화학습해, 검색기와 생성기를 그대로 둔 채 QA 성능을 끌어올렸습니다.