RAG 시스템의 Hallucination 감소 기법
검색을 항상 수행하는 대신 필요할 때만 검색하고, 생성 결과를 모델 스스로 평가하게 만드는 것이 효과적인 환각 감소 방법입니다. 대표 기법인 Self-RAG 논문을 중심으로 reflection token 구조와 실무 적용 시 고려사항을 정리합니다.
RAG를 도입해도 환각은 사라지지 않습니다. 검색된 문서가 질문과 무관하거나, 모델이 문서를 무시하고 파라미터 지식으로 답하는 경우가 남기 때문입니다. 워싱턴대와 IBM 연구진이 2023년 10월 발표한 Self-RAG 논문은 이 문제를 검색과 생성 과정 자체에 자기 평가를 심는 방식으로 풀었고, 2024년 환각 감소 연구의 출발점이 됐습니다.
문제 배경
표준 RAG는 질문이 들어오면 무조건 고정 개수의 문서를 검색해 프롬프트에 붙입니다. 검색이 필요 없는 질문에는 오히려 무관한 문서가 잡음이 되고, 검색된 문서가 부실해도 모델은 이를 걸러낼 수단이 없습니다. 생성된 답이 문서에 근거했는지 확인하는 장치도 없어서, 인용은 달렸는데 내용은 문서와 다른 답변이 나오곤 합니다.
방법/내용
Self-RAG는 reflection token이라는 특수 토큰 네 종류를 생성 어휘에 추가해 모델을 학습시킵니다.
| 토큰 | 판단 내용 |
|---|---|
| Retrieve | 이 시점에 검색이 필요한지 여부 |
| ISREL | 검색된 문서가 질문과 관련 있는지 |
| ISSUP | 생성된 문장이 문서 증거로 뒷받침되는지 |
| ISUSE | 답변이 전체적으로 유용한지 |
모델은 생성 도중 스스로 검색 시점을 결정하고, 검색된 각 문서의 관련성을 평가한 뒤, 생성 결과가 증거에 근거하는지 문장 단위로 검증합니다. 추론 시에는 이 토큰들의 확률을 조합해 여러 후보 중 근거가 튼튼한 출력을 선택할 수 있어, 정확성과 창의성의 균형을 과제별로 조절할 수 있습니다.
결과·수치
논문 기준으로 Self-RAG 7B와 13B 모델은 개방형 QA, 추론, 사실 검증 과제에서 ChatGPT와 검색 증강 Llama2-chat을 능가했습니다. 장문 생성에서는 사실성과 인용 정확도가 개선됐다고 보고합니다. 7B급 소형 모델이 학습 방법 변경만으로 상용 대형 모델을 특정 과제에서 넘어선 점이 주목할 결과입니다.
한계와 주의점
reflection token을 넣으려면 별도 학습이 필요해서, API로만 쓰는 상용 모델에는 그대로 적용할 수 없습니다. 비평 모델로 만든 학습 데이터의 품질이 결과를 좌우하며, 벤치마크가 영어 중심이라 한국어 환경에서는 재검증이 필요합니다. 검색 시점 판단과 문서 평가가 추가되는 만큼 추론 지연도 늘어납니다.
도입 검토 가이드
| 구분 | 내용 |
|---|---|
| 검토 주체 | 자체 모델을 파인튜닝할 수 있는 팀, RAG 품질 담당 조직 |
| 전제 조건 | 학습 인프라, 도메인 문서로 만든 환각 평가 세트 |
| 첫 적용 지점 | 사내 지식베이스 QA처럼 근거 제시가 필수인 서비스 |
| 판단 기준 | 근거 없는 답변 비율의 감소폭과 추론 지연 증가의 교환 비율 |
파인튜닝이 어렵다면 문서 관련성 평가와 근거 검증 단계만 별도 모듈로 떼어 적용하는 절충안부터 시도해 볼 수 있습니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
멀티홉 질의 앞에서 무너지는 RAG를 측정하다
여러 문서의 증거를 모아 추론해야 답할 수 있는 멀티홉 질의에서 기존 RAG는 GPT-4를 써도 정답률이 절반 수준에 그칩니다. 이를 체계적으로 측정한 벤치마크 MultiHop-RAG를 구축한 논문으로, 단일 검색 한 번으로 설계된 시스템의 한계를 미리 알고 보완해야 함을 보여줍니다.
정답지 없이 RAG를 평가하는 RAGAS
RAGAS는 사람이 만든 정답 데이터 없이 검색 관련성, 생성 충실도, 답변 관련성을 각각 자동 측정하는 참조 없는 RAG 평가 프레임워크입니다. 평가 체계가 없으면 RAG 개선은 감에 의존하게 되므로, 사내 시스템 도입 시 정량 평가 루프를 처음부터 갖추는 일의 근거가 됩니다.
검색 전에 질문부터 고쳐 쓰는 RAG
사용자 질문을 검색에 맞게 고쳐 쓰는 재작성 단계를 검색 앞에 추가하면 RAG 성능이 일관되게 개선됩니다. Rewrite-Retrieve-Read 프레임워크를 제안한 이 논문은 소형 재작성 모델을 LLM 리더의 피드백으로 강화학습해, 검색기와 생성기를 그대로 둔 채 QA 성능을 끌어올렸습니다.