AI 인사이트 목록
RAG2024년 12월 10일

RAG 시스템의 Hallucination 감소 기법

검색을 항상 수행하는 대신 필요할 때만 검색하고, 생성 결과를 모델 스스로 평가하게 만드는 것이 효과적인 환각 감소 방법입니다. 대표 기법인 Self-RAG 논문을 중심으로 reflection token 구조와 실무 적용 시 고려사항을 정리합니다.

원문 논문 보기RAG · Hallucination · NLP · Retrieval

RAG를 도입해도 환각은 사라지지 않습니다. 검색된 문서가 질문과 무관하거나, 모델이 문서를 무시하고 파라미터 지식으로 답하는 경우가 남기 때문입니다. 워싱턴대와 IBM 연구진이 2023년 10월 발표한 Self-RAG 논문은 이 문제를 검색과 생성 과정 자체에 자기 평가를 심는 방식으로 풀었고, 2024년 환각 감소 연구의 출발점이 됐습니다.

문제 배경

표준 RAG는 질문이 들어오면 무조건 고정 개수의 문서를 검색해 프롬프트에 붙입니다. 검색이 필요 없는 질문에는 오히려 무관한 문서가 잡음이 되고, 검색된 문서가 부실해도 모델은 이를 걸러낼 수단이 없습니다. 생성된 답이 문서에 근거했는지 확인하는 장치도 없어서, 인용은 달렸는데 내용은 문서와 다른 답변이 나오곤 합니다.

방법/내용

Self-RAG는 reflection token이라는 특수 토큰 네 종류를 생성 어휘에 추가해 모델을 학습시킵니다.

토큰판단 내용
Retrieve이 시점에 검색이 필요한지 여부
ISREL검색된 문서가 질문과 관련 있는지
ISSUP생성된 문장이 문서 증거로 뒷받침되는지
ISUSE답변이 전체적으로 유용한지

모델은 생성 도중 스스로 검색 시점을 결정하고, 검색된 각 문서의 관련성을 평가한 뒤, 생성 결과가 증거에 근거하는지 문장 단위로 검증합니다. 추론 시에는 이 토큰들의 확률을 조합해 여러 후보 중 근거가 튼튼한 출력을 선택할 수 있어, 정확성과 창의성의 균형을 과제별로 조절할 수 있습니다.

결과·수치

논문 기준으로 Self-RAG 7B와 13B 모델은 개방형 QA, 추론, 사실 검증 과제에서 ChatGPT와 검색 증강 Llama2-chat을 능가했습니다. 장문 생성에서는 사실성과 인용 정확도가 개선됐다고 보고합니다. 7B급 소형 모델이 학습 방법 변경만으로 상용 대형 모델을 특정 과제에서 넘어선 점이 주목할 결과입니다.

한계와 주의점

reflection token을 넣으려면 별도 학습이 필요해서, API로만 쓰는 상용 모델에는 그대로 적용할 수 없습니다. 비평 모델로 만든 학습 데이터의 품질이 결과를 좌우하며, 벤치마크가 영어 중심이라 한국어 환경에서는 재검증이 필요합니다. 검색 시점 판단과 문서 평가가 추가되는 만큼 추론 지연도 늘어납니다.

도입 검토 가이드

구분내용
검토 주체자체 모델을 파인튜닝할 수 있는 팀, RAG 품질 담당 조직
전제 조건학습 인프라, 도메인 문서로 만든 환각 평가 세트
첫 적용 지점사내 지식베이스 QA처럼 근거 제시가 필수인 서비스
판단 기준근거 없는 답변 비율의 감소폭과 추론 지연 증가의 교환 비율

파인튜닝이 어렵다면 문서 관련성 평가와 근거 검증 단계만 별도 모듈로 떼어 적용하는 절충안부터 시도해 볼 수 있습니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의