AI 인사이트 목록
Optimization2026년 7월 18일

토큰이 아니라 피처를 예측하는 EAGLE 추측 디코딩

EAGLE은 추측 디코딩의 초안 생성을 토큰 수준이 아닌 모델 내부 피처 수준에서 수행해 LLaMA2-Chat 70B 기준 2.7배에서 3.5배의 지연 시간 단축과 2배의 처리량 향상을 생성 분포 변화 없이 달성했습니다. 별도의 소형 초안 모델을 구하기 어려운 사내 특화 sLLM에도 가벼운 예측 헤드 하나로 적용할 수 있다는 점이 실무적 강점입니다.

원문 논문 보기Speculative Decoding · EAGLE · 추론 가속 · 디코딩

자기회귀 디코딩은 토큰을 하나씩 생성하므로 LLM 응답 지연의 근본 원인입니다. ICML에 발표된 EAGLE은 추측 디코딩의 초안 생성 위치를 바꾸는 것만으로 품질 손실 없이 지연을 절반 이하로 줄인 연구입니다.

문제 배경

추측 디코딩(speculative decoding)은 작은 초안 모델이 여러 토큰을 미리 제안하고 본 모델이 한 번에 검증하는 가속 기법입니다. 그러나 본 모델과 어휘를 공유하는 적절한 초안 모델을 구하기 어렵고, 초안이 자주 기각되면 검증 비용만 남아 이득이 사라집니다. 특히 파인튜닝된 특화 모델은 짝이 맞는 소형 모델이 아예 없는 경우가 많습니다.

방법

EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency)은 두 가지 관찰에서 출발합니다. 첫째, 최상위 직전 레이어의 피처 시퀀스는 토큰 시퀀스보다 규칙적이어서 자기회귀 예측이 더 쉽습니다. 둘째, 피처 수준 예측에는 샘플링 결과를 모르는 데서 오는 불확실성이 남는데, 한 스텝 앞선 토큰을 입력에 함께 넣으면 이 불확실성이 해소됩니다. 초안 모듈은 임베딩 층과 LM 헤드를 본 모델에서 그대로 가져와 추가 학습이 필요 없고, 새로 학습하는 부분은 FC 층과 디코더 레이어 하나로 구성된 자기회귀 헤드뿐입니다. 검증 단계가 원 모델의 분포를 보존하므로 생성 결과의 분포는 이론적으로 동일합니다.

토큰 수준과 피처 수준 자기회귀의 차이를 보인 EAGLE 개념도

결과

Vicuna와 LLaMA2-Chat 전 계열, MoE 모델 Mixtral 8x7B Instruct에 대해 대화, 코드 생성, 수학 추론, 명령 수행 과제로 평가했습니다. LLaMA2-Chat 70B 기준 지연 시간을 2.7배에서 3.5배 단축했고 처리량은 2배로 늘었습니다.

한계와 주의점

예측 헤드는 공짜가 아니라 별도 학습이 필요합니다. 논문 기준 70B 모델용 헤드도 A100 40G 서버에서 1일에서 2일이면 학습되지만 파이프라인은 갖춰야 합니다. 또한 가속 폭은 초안 수락률에 좌우되므로 과제 특성과 샘플링 온도에 따라 실측 이득이 달라지며, 배치가 커서 GPU 연산이 이미 포화된 서빙 환경에서는 이득이 줄어듭니다.

도입 검토 가이드

응답 지연이 서비스 품질 지표나 계약 조건에 들어가는 대화형 LLM 서비스를 운영하면서, 파인튜닝된 특화 모델이라 어휘가 맞는 소형 초안 모델을 구할 수 없는 조직에 해당합니다. 검증 단계가 생성 분포를 보존하므로 출력 품질 검수를 처음부터 다시 받을 부담이 없다는 점이 도입 판단을 단순하게 만듭니다.

구분내용
검토 주체추론 지연 지표를 책임지는 ML 플랫폼팀, 서빙 인프라 담당자
전제 조건예측 헤드를 학습할 GPU 자원과 학습 파이프라인(논문 기준 70B 모델용 헤드가 A100 40G 서버에서 1일에서 2일), GPU 연산이 포화되지 않은 배치 규모의 서빙 환경
첫 적용 지점지연 민감도가 높은 챗봇이나 상담 보조 서비스의 단일 모델 서빙 경로
판단 기준실 트래픽에서 측정한 초안 수락률과 지연 단축 폭(논문 기준 LLaMA2-Chat 70B에서 2.7배에서 3.5배), 처리량 변화(논문 기준 2배)

코텍시스는 GPU 증설 없이 지연 조건을 맞추는 수단으로 EAGLE 방식을 검토하며, 고객 도메인에 파인튜닝된 온프레미스 특화 모델에 예측 헤드 학습까지 포함해 이식합니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의