OCR 없이 PDF를 읽는 Nougat
Nougat은 비전 트랜스포머로 문서 이미지를 곧바로 마크업 텍스트로 변환해, PDF에서 수식 등 의미 정보가 손실되는 문제를 푸는 메타의 모델입니다. RAG 품질은 파싱 품질의 상한을 넘지 못하므로, 표와 수식이 많은 문서를 다루는 시스템에서 문서 이해 계층이 검색 못지않게 중요함을 보여줍니다.
RAG 구축에서 가장 과소평가되는 단계는 문서를 텍스트로 바꾸는 일입니다. PDF는 사람이 보기 위한 형식이라 기계가 읽으면 수식이 깨지고 표 구조가 사라집니다. 전통적 OCR은 글자를 읽을 뿐 문서의 의미 구조를 복원하지 못합니다.
문제 배경
PDF에 내장된 텍스트를 추출하거나 OCR을 돌리는 기존 방식은 글자 단위로는 정확해도 구조를 잃습니다. 위 첨자와 아래 첨자가 본문에 섞이고, 2단 레이아웃의 읽기 순서가 뒤엉키고, 수식은 기호의 나열로 부서집니다. 글자 인식, 레이아웃 분석, 수식 복원을 별도 모듈로 잇는 파이프라인은 각 단계의 오류가 누적된다는 문제가 있었습니다.
방법
메타의 Blecher 등(2023)이 만든 Nougat은 이 파이프라인을 하나의 모델로 대체합니다. 문서 페이지 이미지를 Swin 트랜스포머 인코더에 넣고, 디코더가 수식까지 포함된 마크업 텍스트를 자기회귀로 생성합니다. 중간 단계 없이 이미지에서 구조화된 텍스트로 가는 변환을 통째로 학습한 것입니다. 학습 데이터는 arXiv 논문의 LaTeX 원본과 PDF를 페이지 단위로 정렬해 만들었으며, arXiv 751만 페이지를 포함해 총 820만 페이지 규모입니다.

결과
arXiv 테스트 세트에서 기반 모델(350M)의 성능은 다음과 같습니다.
| 대상 | 편집 거리(낮을수록 좋음) | BLEU |
|---|---|---|
| 전체 | 0.071 | 89.1 |
| 일반 텍스트 | 0.058 | 91.2 |
| 수식 | 0.128 | 56.9 |
| 표 | 0.211 | 69.7 |
일반 텍스트는 매우 정확하게 복원되고, 기존 OCR이 포기하던 수식도 텍스트 표현으로 되살아납니다. 250M의 소형 모델도 거의 같은 성능을 내며, 코드와 모델이 공개되어 후속 문서 이해 연구의 기반이 됐습니다.
한계와 주의점
저자들이 밝힌 최대 약점은 생성 모델 특유의 반복 루프입니다. 추론 중 같은 문장을 되풀이하며 무너지는 경우가 있어 반복 감지 장치를 따로 두었습니다. 페이지 단위 처리라 페이지를 넘나드는 문맥이 끊길 수 있고, 학습 데이터가 디지털로 생성된 학술 문서 중심이라 스캔 문서에서는 성능이 눈에 띄게 떨어집니다. 표는 편집 거리 0.211로 여전히 가장 어려운 대상입니다.
기업 적용 관점
기업 문서의 핵심 정보는 표와 서식 안에 있는 경우가 많습니다. 파싱이 표를 뭉개면 그 뒤의 검색과 생성이 아무리 좋아도 답은 틀립니다. 이 논문의 수치는 같은 모델도 문서 요소별로 품질이 크게 다르다는 것을 보여주므로, 파싱 도구 선정은 전체 평균이 아니라 자사 문서에 많은 요소 기준으로 해야 합니다. 코텍시스는 RAG 구축 전에 고객 문서 표본으로 파싱 품질부터 진단하고 문서 유형별 변환 파이프라인을 설계합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의같은 주제의 다른 인사이트
멀티홉 질의 앞에서 무너지는 RAG를 측정하다
여러 문서의 증거를 모아 추론해야 답할 수 있는 멀티홉 질의에서 기존 RAG는 GPT-4를 써도 정답률이 절반 수준에 그칩니다. 이를 체계적으로 측정한 벤치마크 MultiHop-RAG를 구축한 논문으로, 단일 검색 한 번으로 설계된 시스템의 한계를 미리 알고 보완해야 함을 보여줍니다.
정답지 없이 RAG를 평가하는 RAGAS
RAGAS는 사람이 만든 정답 데이터 없이 검색 관련성, 생성 충실도, 답변 관련성을 각각 자동 측정하는 참조 없는 RAG 평가 프레임워크입니다. 평가 체계가 없으면 RAG 개선은 감에 의존하게 되므로, 사내 시스템 도입 시 정량 평가 루프를 처음부터 갖추는 일의 근거가 됩니다.
검색 전에 질문부터 고쳐 쓰는 RAG
사용자 질문을 검색에 맞게 고쳐 쓰는 재작성 단계를 검색 앞에 추가하면 RAG 성능이 일관되게 개선됩니다. Rewrite-Retrieve-Read 프레임워크를 제안한 이 논문은 소형 재작성 모델을 LLM 리더의 피드백으로 강화학습해, 검색기와 생성기를 그대로 둔 채 QA 성능을 끌어올렸습니다.