YaRN이 보여준 컨텍스트 확장 효율: 10분의 1 토큰으로 늘리는 긴 문맥
RoPE 위치 임베딩을 쓰는 모델의 컨텍스트 윈도우는 기존 방법 대비 10분의 1의 학습 토큰과 2.5분의 1의 학습 스텝으로 확장할 수 있으며, 이것이 YaRN 논문의 핵심 기여입니다. 학습 데이터보다 긴 문맥으로 외삽하는 능력까지 확인되어, 계약서나 기술 문서처럼 긴 입력을 다루는 기업 과제에서 저비용 컨텍스트 확장 튜닝의 표준 경로가 된 논문입니다.
공개 sLLM의 사전학습 컨텍스트는 대부분 4k에서 8k 토큰 수준이었습니다. 계약서 전체나 긴 기술 문서를 다루려면 컨텍스트 확장이 필요한데, 긴 시퀀스로 추가 학습하는 비용이 만만치 않았습니다. YaRN은 이 확장 비용을 한 자릿수 아래로 끌어내린 기법입니다.
문제 배경
RoPE 위치 임베딩은 학습 길이를 넘는 위치에서 성능이 급격히 무너집니다. 위치 인덱스를 균일하게 압축하는 위치 보간이 대안으로 나왔지만, 모든 주파수 성분을 같은 비율로 늘이면 인접 토큰을 구분하는 고주파 정보가 뭉개져 짧은 거리의 위치 분해능이 손상됩니다. 이를 보상하려면 상당한 양의 장문 파인튜닝이 필요했습니다.
방법
YaRN은 RoPE의 주파수 대역별로 보간 강도를 다르게 적용합니다. 파장이 컨텍스트 길이보다 훨씬 짧은 고주파 성분은 보간하지 않고 보존해 인접 토큰의 분해능을 지키고, 파장이 긴 저주파 성분만 늘여서 먼 거리를 표현하게 합니다. 그 사이 대역은 두 방식을 부드럽게 섞습니다. 여기에 어텐션 로짓에 온도 계수를 곱하는 보정을 더해 확장 후 퍼플렉서티 저하를 줄입니다. 기존 모델 구조를 바꾸지 않아 추론 최적화 기법과 그대로 호환됩니다.

결과
YaRN은 기존 확장 방법 대비 10분의 1의 학습 토큰과 2.5분의 1의 학습 스텝으로 더 나은 성능을 얻었습니다. 원래 사전학습 데이터의 0.1%에도 못 미치는 양의 파인튜닝으로 LLaMA 2 모델을 64k와 128k 컨텍스트로 확장했고, 파인튜닝 데이터의 길이를 넘는 컨텍스트로 외삽하는 능력도 확인했습니다.
| 항목 | YaRN |
|---|---|
| 학습 토큰 | 기존 방법의 10분의 1 |
| 학습 스텝 | 기존 방법의 2.5분의 1 |
| 확장 길이 | 64k, 128k 토큰 |
| 추가 학습량 | 사전학습 데이터의 0.1% 미만 |
한계와 주의점
무학습 확장이 아니라 소량이라도 장문 파인튜닝이 필요하며, 확장 후 표준 벤치마크에서 원 모델 대비 소폭의 성능 변화가 보고됩니다. 평가가 퍼플렉서티와 패스키 검색 중심이므로 긴 문서에 대한 추론 품질은 대상 과제로 별도 검증해야 합니다. 컨텍스트가 길어지면 어텐션과 KV 캐시로 인한 추론 메모리와 지연시간 증가는 그대로 남는다는 점도 운영 설계에서 감안해야 합니다.
도입 검토 가이드
계약서 전문이나 기술 규격처럼 문서를 쪼개면 판단이 흐려지는 장문 정독 과제를 RoPE 기반 공개 sLLM으로 처리하려는 조직이 검토 대상입니다. RAG 검색만으로 해결되지 않는 문서 전체 대조 요구가 있고, 소규모 추가 파인튜닝을 수행할 GPU 자원이 있다면 적용 조건이 성립합니다.
| 구분 | 내용 |
|---|---|
| 검토 주체 | 문서 처리 파이프라인을 설계하는 ML팀과 장문 입력 요구사항을 정의하는 현업 부서 |
| 전제 조건 | RoPE 위치 임베딩을 쓰는 베이스 모델, 소량의 장문 파인튜닝 데이터(논문 기준 사전학습 데이터의 0.1% 미만), 확장 후 늘어나는 어텐션과 KV 캐시를 감당할 추론 메모리 |
| 첫 적용 지점 | 계약서 전문 검토나 기술 규격 대조처럼 논문이 확장을 검증한 64k에서 128k 토큰 범위 안에 들어오는 단일 문서 정독 과제 |
| 판단 기준 | 확장 길이에서의 대상 과제 정확도와 표준 벤치마크의 회귀 폭. 논문 평가가 퍼플렉서티와 패스키 검색 중심이므로 실제 문서 추론 품질은 자체 평가 세트로 별도 확인해야 합니다 |
코텍시스는 장문 정독 과제에 sLLM을 맞출 때 YaRN 계열 확장 튜닝을 비용 대비 효과가 가장 검증된 선택지로 적용하며, RAG와의 역할 구분을 설계 단계에서 함께 정의합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
토크나이저가 만드는 언어 간 비용 격차: 같은 문장이 최대 15배로 늘어난다
같은 내용의 텍스트도 언어에 따라 토큰화 길이가 최대 15배까지 벌어지며, 이 격차는 API 비용, 처리 시간, 활용 가능한 컨텍스트 길이에 그대로 전가됩니다. Petrov 외의 NeurIPS 2023 논문이 이를 체계적으로 실증했으며, 한국어 서비스의 추론 비용을 다루는 코텍시스에 토크나이저 효율 진단이 최적화 견적의 첫 단계여야 하는 이유를 제시합니다.