시맨틱 청킹은 비용만큼 효과가 있는가
시맨틱 청킹이 고정 길이 청킹보다 항상 나은 것은 아닙니다. 임베딩 유사도로 문서를 자르는 시맨틱 청킹을 세 가지 검색 과제로 체계 검증한 이 논문의 결론은 계산 비용을 정당화할 만큼 일관된 이득이 없다는 것으로, 청킹 전략은 유행이 아니라 자기 데이터에서의 측정으로 골라야 함을 보여줍니다.
RAG 파이프라인의 첫 결정은 문서를 어떻게 자를 것인가입니다. 최근에는 문장 임베딩의 유사도가 급락하는 지점에서 자르는 시맨틱 청킹이 사실상의 권장 사항처럼 퍼졌지만, 정작 그 효과를 체계적으로 검증한 연구는 드물었습니다. Vectara의 Qu 등(2024)은 이 통념을 정면으로 시험했습니다.
문제 배경
고정 길이 청킹은 토큰 수를 기준으로 기계적으로 자르기 때문에 하나의 주제가 청크 경계에서 끊길 수 있습니다. 시맨틱 청킹은 문장 임베딩을 계산해 의미가 바뀌는 지점에서 자르므로 이 문제를 피할 수 있다고 알려져 왔습니다. 그러나 모든 문장의 임베딩을 계산하는 비용이 추가되는데도, 그 비용이 검색 품질 향상으로 회수되는지는 검증되지 않은 채 도구 문서와 블로그를 통해 관행으로 굳어졌습니다.
방법
저자들은 세 가지 청킹 전략을 비교했습니다. 고정 길이 청킹, 인접 문장 간 임베딩 거리가 임계값을 넘는 지점에서 자르는 경계 기반 시맨틱 청킹, 의미가 비슷한 문장들을 묶어 비연속 문장까지 하나의 청크로 합칠 수 있는 군집 기반 시맨틱 청킹입니다. 평가 과제도 셋으로 나눴습니다. 검색된 청크가 정답 문서에 속하는지 보는 문서 검색, 정답 근거 문장을 직접 찾는지 보는 근거 검색, 그리고 검색 결과로 생성한 답변의 품질입니다. 짧은 문서를 이어 붙여 주제 다양성이 높은 합성 문서를 만들고 데이터셋마다 100개 질의를 표본으로 실험했습니다.

결과
시맨틱 청킹은 주제 다양성이 높은 합성 문서의 일부 조건에서만 우위를 보였고, 그 우위조차 과제와 데이터셋에 따라 뒤집혔습니다. 답변 생성 단계에서는 차이가 사실상 사라졌습니다.
| 데이터셋 | 고정 길이 | 경계 기반 | 군집 기반 |
|---|---|---|---|
| ExpertQA | 0.65 | 0.65 | 0.65 |
| TechQA | 0.68 | 0.68 | 0.68 |
| ConditionalQA | 0.42 | 0.43 | 0.43 |
| Qasper | 0.49 | 0.49 | 0.50 |
답변 생성 BERTScore가 세 방식에서 거의 같았습니다. 임베딩 연산이라는 추가 비용을 정당화할 일관된 이득은 확인되지 않았습니다.
한계와 주의점
저자들 스스로 밝힌 한계가 있습니다. 실험이 문장 단위 분할에 한정되어 문맥을 반영한 임베딩은 다루지 않았고, 청크 자체의 품질을 직접 재는 지표 없이 문서와 근거 매핑에 의존했으며, 긴 실제 문서로 된 평가 데이터가 부족해 합성 문서를 썼습니다. 따라서 이 결과는 시맨틱 청킹이 무용하다는 증명이 아니라, 기본값으로 삼을 근거가 없다는 증거로 읽어야 합니다.
기업 적용 관점
사내 규정집, 기술 문서, 상담 기록은 저마다 구조가 다릅니다. 규정집처럼 조 단위 구조가 명확한 문서는 구조 기반 분할이, 회의록처럼 주제가 섞이는 문서는 다른 전략이 맞을 수 있습니다. 코텍시스는 RAG 구축 초기에 고객 문서 표본과 실제 질의로 청킹 전략별 검색 성능을 비교하는 실험을 표준 절차로 둡니다. 이 논문은 그 실험을 생략하고 유행을 따르는 것이 왜 위험한지 보여주는 근거입니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의같은 주제의 다른 인사이트
멀티홉 질의 앞에서 무너지는 RAG를 측정하다
여러 문서의 증거를 모아 추론해야 답할 수 있는 멀티홉 질의에서 기존 RAG는 GPT-4를 써도 정답률이 절반 수준에 그칩니다. 이를 체계적으로 측정한 벤치마크 MultiHop-RAG를 구축한 논문으로, 단일 검색 한 번으로 설계된 시스템의 한계를 미리 알고 보완해야 함을 보여줍니다.
정답지 없이 RAG를 평가하는 RAGAS
RAGAS는 사람이 만든 정답 데이터 없이 검색 관련성, 생성 충실도, 답변 관련성을 각각 자동 측정하는 참조 없는 RAG 평가 프레임워크입니다. 평가 체계가 없으면 RAG 개선은 감에 의존하게 되므로, 사내 시스템 도입 시 정량 평가 루프를 처음부터 갖추는 일의 근거가 됩니다.
검색 전에 질문부터 고쳐 쓰는 RAG
사용자 질문을 검색에 맞게 고쳐 쓰는 재작성 단계를 검색 앞에 추가하면 RAG 성능이 일관되게 개선됩니다. Rewrite-Retrieve-Read 프레임워크를 제안한 이 논문은 소형 재작성 모델을 LLM 리더의 피드백으로 강화학습해, 검색기와 생성기를 그대로 둔 채 QA 성능을 끌어올렸습니다.