토큰이 아니라 피처를 예측하는 EAGLE 추측 디코딩
EAGLE은 추측 디코딩의 초안 생성을 토큰 수준이 아닌 모델 내부 피처 수준에서 수행해 LLaMA2-Chat 70B 기준 2.7배에서 3.5배의 지연 시간 단축과 2배의 처리량 향상을 생성 분포 변화 없이 달성했습니다. 별도의 소형 초안 모델을 구하기 어려운 사내 특화 sLLM에도 가벼운 예측 헤드 하나로 적용할 수 있다는 점이 실무적 강점입니다.
자기회귀 디코딩은 토큰을 하나씩 생성하므로 LLM 응답 지연의 근본 원인입니다. ICML에 발표된 EAGLE은 추측 디코딩의 초안 생성 위치를 바꾸는 것만으로 품질 손실 없이 지연을 절반 이하로 줄인 연구입니다.
문제 배경
추측 디코딩(speculative decoding)은 작은 초안 모델이 여러 토큰을 미리 제안하고 본 모델이 한 번에 검증하는 가속 기법입니다. 그러나 본 모델과 어휘를 공유하는 적절한 초안 모델을 구하기 어렵고, 초안이 자주 기각되면 검증 비용만 남아 이득이 사라집니다. 특히 파인튜닝된 특화 모델은 짝이 맞는 소형 모델이 아예 없는 경우가 많습니다.
방법
EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency)은 두 가지 관찰에서 출발합니다. 첫째, 최상위 직전 레이어의 피처 시퀀스는 토큰 시퀀스보다 규칙적이어서 자기회귀 예측이 더 쉽습니다. 둘째, 피처 수준 예측에는 샘플링 결과를 모르는 데서 오는 불확실성이 남는데, 한 스텝 앞선 토큰을 입력에 함께 넣으면 이 불확실성이 해소됩니다. 초안 모듈은 임베딩 층과 LM 헤드를 본 모델에서 그대로 가져와 추가 학습이 필요 없고, 새로 학습하는 부분은 FC 층과 디코더 레이어 하나로 구성된 자기회귀 헤드뿐입니다. 검증 단계가 원 모델의 분포를 보존하므로 생성 결과의 분포는 이론적으로 동일합니다.

결과
Vicuna와 LLaMA2-Chat 전 계열, MoE 모델 Mixtral 8x7B Instruct에 대해 대화, 코드 생성, 수학 추론, 명령 수행 과제로 평가했습니다. LLaMA2-Chat 70B 기준 지연 시간을 2.7배에서 3.5배 단축했고 처리량은 2배로 늘었습니다.
한계와 주의점
예측 헤드는 공짜가 아니라 별도 학습이 필요합니다. 논문 기준 70B 모델용 헤드도 A100 40G 서버에서 1일에서 2일이면 학습되지만 파이프라인은 갖춰야 합니다. 또한 가속 폭은 초안 수락률에 좌우되므로 과제 특성과 샘플링 온도에 따라 실측 이득이 달라지며, 배치가 커서 GPU 연산이 이미 포화된 서빙 환경에서는 이득이 줄어듭니다.
도입 검토 가이드
응답 지연이 서비스 품질 지표나 계약 조건에 들어가는 대화형 LLM 서비스를 운영하면서, 파인튜닝된 특화 모델이라 어휘가 맞는 소형 초안 모델을 구할 수 없는 조직에 해당합니다. 검증 단계가 생성 분포를 보존하므로 출력 품질 검수를 처음부터 다시 받을 부담이 없다는 점이 도입 판단을 단순하게 만듭니다.
| 구분 | 내용 |
|---|---|
| 검토 주체 | 추론 지연 지표를 책임지는 ML 플랫폼팀, 서빙 인프라 담당자 |
| 전제 조건 | 예측 헤드를 학습할 GPU 자원과 학습 파이프라인(논문 기준 70B 모델용 헤드가 A100 40G 서버에서 1일에서 2일), GPU 연산이 포화되지 않은 배치 규모의 서빙 환경 |
| 첫 적용 지점 | 지연 민감도가 높은 챗봇이나 상담 보조 서비스의 단일 모델 서빙 경로 |
| 판단 기준 | 실 트래픽에서 측정한 초안 수락률과 지연 단축 폭(논문 기준 LLaMA2-Chat 70B에서 2.7배에서 3.5배), 처리량 변화(논문 기준 2배) |
코텍시스는 GPU 증설 없이 지연 조건을 맞추는 수단으로 EAGLE 방식을 검토하며, 고객 도메인에 파인튜닝된 온프레미스 특화 모델에 예측 헤드 학습까지 포함해 이식합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
구조화된 LLM 프로그램을 위한 서빙 시스템 SGLang
SGLang은 다중 호출과 제어 흐름이 얽힌 LLM 프로그램을 위한 언어와 런타임을 함께 설계해 RadixAttention 기반 KV 캐시 재사용으로 기존 시스템 대비 최대 6.4배의 처리량을 달성했습니다. 에이전트 워크플로와 JSON 구조화 출력이 많은 기업 자동화 파이프라인일수록 이 캐시 재사용 효과가 비용 절감으로 직결됩니다.
프리필을 쪼개 처리량과 지연을 함께 잡는 Sarathi-Serve
Sarathi-Serve는 프리필을 청크로 쪼개 디코드 배치의 빈 연산 슬롯에 끼워 넣는 무정지 스케줄링으로 처리량과 지연의 트레이드오프를 해소했고 vLLM 대비 Mistral-7B에서 2.6배, Falcon-180B에서 최대 5.6배의 서빙 용량을 달성했습니다. 같은 GPU로 SLA를 지키며 더 많은 동시 사용자를 받는다는 뜻이므로 온프레미스 서빙의 장비 산정 기준을 바꾸는 결과입니다.
재학습 없는 LLM 프루닝 기법 Wanda
ICLR 2024에 채택된 Wanda는 가중치 크기에 입력 활성값 크기를 곱한 값을 기준으로 프루닝해 재학습이나 가중치 업데이트 없이 즉시 사용 가능한 희소 LLM을 만듭니다. 별도 학습 인프라 없이 배포 직전 단계에서 모델을 가볍게 만들 수 있어 GPU 예산이 빠듯한 온프레미스 도입 프로젝트에 실용적입니다.