AI 인사이트 목록
VLM2024년 12월 15일

LLaMA 3.2 Vision 모델 분석

LLaMA 3.2 Vision은 언어 모델 파라미터를 고정한 채 크로스 어텐션 어댑터로 이미지 인코더를 결합해, 기존 텍스트 성능을 지키면서 시각 이해를 추가한 개방형 멀티모달 모델입니다. Meta 공식 발표를 기준으로 11B와 90B의 구조, 경량 1B·3B 라인업, 도입 시 고려사항을 정리합니다.

원문 논문 보기LLaMA · Vision · Multimodal · Meta

Meta가 2024년 9월 Connect 행사에서 공개한 LLaMA 3.2는 개방형 모델 진영 최초로 본격적인 비전 능력을 갖춘 11B·90B 모델과 온디바이스용 1B·3B 경량 모델을 함께 내놓았습니다. 폐쇄형 API에 의존하지 않고 이미지 이해 기능을 자체 인프라에 올리려는 조직에게 중요한 선택지가 생겼습니다.

문제 배경

2024년 시점에 이미지 이해가 필요한 서비스는 대부분 GPT-4o나 Claude 계열의 상용 API를 써야 했습니다. 민감한 문서나 사내 이미지 데이터를 외부로 보낼 수 없는 조직은 선택지가 마땅치 않았고, 기존 오픈소스 멀티모달 모델은 텍스트 능력이 약해 실무 투입이 어려웠습니다.

방법/내용

LLaMA 3.2 Vision은 사전학습된 이미지 인코더의 표현을 크로스 어텐션 레이어를 통해 언어 모델에 주입하는 어댑터 구조를 씁니다. 핵심 설계는 언어 모델 파라미터를 고정하고 어댑터와 인코더만 학습한 점입니다. 이 덕분에 기존 LLaMA 3.1의 텍스트 성능이 그대로 보존됩니다. 학습은 대규모 이미지·텍스트 쌍 사전학습, 고품질 데이터 파인튜닝, 감독학습·거부 샘플링·직접 선호 최적화(DPO)로 이어지는 후처리 순서로 진행됐습니다. 경량 1B·3B 모델은 LLaMA 3.1 8B에서 구조적 프루닝을 하고 8B·70B의 로짓을 증류해 만들었습니다.

결과·수치

모델용도발표 자료 기준 평가
Vision 90B서버급 이미지 추론문서 이해·차트 해석에서 경쟁 모델과 동급 이상 주장
Vision 11B단일 GPU 이미지 이해Claude 3 Haiku, GPT-4o mini와 경쟁력 있다고 발표
3B / 1B온디바이스, 에이전트3B가 Gemma 2 2.6B와 Phi 3.5-mini보다 우수하다고 발표

전 모델이 128K 토큰 컨텍스트를 지원하고, 150개 이상 벤치마크로 평가했다고 밝혔으나 세부 수치 상당수는 공개 이미지 표에만 담겨 있습니다. 배포는 Hugging Face 직접 다운로드와 25개 이상 파트너 플랫폼, iOS용 ExecuTorch, Ollama를 지원합니다.

한계와 주의점

발표문 본문에 정량 수치가 제한적으로만 실려 있어 자체 벤치마크 검증이 필요합니다. 시각적 접지와 차트 해석은 지원하지만 한국어 문서 OCR 성능은 별도로 검증된 바 없습니다. EU 지역에서는 멀티모달 모델 이용에 제약 가능성이 언급됐고, 90B는 단일 GPU에 올리기 어려워 양자화나 다중 GPU 구성이 필요합니다.

도입 검토 가이드

구분내용
검토 주체자체 GPU 인프라를 보유한 팀, 데이터 반출이 불가한 조직
전제 조건24GB 이상 GPU(11B 기준), 자체 이미지 평가 데이터셋
첫 적용 지점사내 문서·전표의 차트와 표 판독, 이미지 캡셔닝
판단 기준상용 API 대비 정확도 격차와 월 API 비용 절감폭의 교환 비율

이미지 데이터를 외부로 보낼 수 없는 환경이라면 11B부터 검증을 시작해 볼 만합니다.

코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.

AI 개발 문의

같은 주제의 다른 인사이트