LLaMA 3.2 Vision 모델 분석
LLaMA 3.2 Vision은 언어 모델 파라미터를 고정한 채 크로스 어텐션 어댑터로 이미지 인코더를 결합해, 기존 텍스트 성능을 지키면서 시각 이해를 추가한 개방형 멀티모달 모델입니다. Meta 공식 발표를 기준으로 11B와 90B의 구조, 경량 1B·3B 라인업, 도입 시 고려사항을 정리합니다.
Meta가 2024년 9월 Connect 행사에서 공개한 LLaMA 3.2는 개방형 모델 진영 최초로 본격적인 비전 능력을 갖춘 11B·90B 모델과 온디바이스용 1B·3B 경량 모델을 함께 내놓았습니다. 폐쇄형 API에 의존하지 않고 이미지 이해 기능을 자체 인프라에 올리려는 조직에게 중요한 선택지가 생겼습니다.
문제 배경
2024년 시점에 이미지 이해가 필요한 서비스는 대부분 GPT-4o나 Claude 계열의 상용 API를 써야 했습니다. 민감한 문서나 사내 이미지 데이터를 외부로 보낼 수 없는 조직은 선택지가 마땅치 않았고, 기존 오픈소스 멀티모달 모델은 텍스트 능력이 약해 실무 투입이 어려웠습니다.
방법/내용
LLaMA 3.2 Vision은 사전학습된 이미지 인코더의 표현을 크로스 어텐션 레이어를 통해 언어 모델에 주입하는 어댑터 구조를 씁니다. 핵심 설계는 언어 모델 파라미터를 고정하고 어댑터와 인코더만 학습한 점입니다. 이 덕분에 기존 LLaMA 3.1의 텍스트 성능이 그대로 보존됩니다. 학습은 대규모 이미지·텍스트 쌍 사전학습, 고품질 데이터 파인튜닝, 감독학습·거부 샘플링·직접 선호 최적화(DPO)로 이어지는 후처리 순서로 진행됐습니다. 경량 1B·3B 모델은 LLaMA 3.1 8B에서 구조적 프루닝을 하고 8B·70B의 로짓을 증류해 만들었습니다.
결과·수치
| 모델 | 용도 | 발표 자료 기준 평가 |
|---|---|---|
| Vision 90B | 서버급 이미지 추론 | 문서 이해·차트 해석에서 경쟁 모델과 동급 이상 주장 |
| Vision 11B | 단일 GPU 이미지 이해 | Claude 3 Haiku, GPT-4o mini와 경쟁력 있다고 발표 |
| 3B / 1B | 온디바이스, 에이전트 | 3B가 Gemma 2 2.6B와 Phi 3.5-mini보다 우수하다고 발표 |
전 모델이 128K 토큰 컨텍스트를 지원하고, 150개 이상 벤치마크로 평가했다고 밝혔으나 세부 수치 상당수는 공개 이미지 표에만 담겨 있습니다. 배포는 Hugging Face 직접 다운로드와 25개 이상 파트너 플랫폼, iOS용 ExecuTorch, Ollama를 지원합니다.
한계와 주의점
발표문 본문에 정량 수치가 제한적으로만 실려 있어 자체 벤치마크 검증이 필요합니다. 시각적 접지와 차트 해석은 지원하지만 한국어 문서 OCR 성능은 별도로 검증된 바 없습니다. EU 지역에서는 멀티모달 모델 이용에 제약 가능성이 언급됐고, 90B는 단일 GPU에 올리기 어려워 양자화나 다중 GPU 구성이 필요합니다.
도입 검토 가이드
| 구분 | 내용 |
|---|---|
| 검토 주체 | 자체 GPU 인프라를 보유한 팀, 데이터 반출이 불가한 조직 |
| 전제 조건 | 24GB 이상 GPU(11B 기준), 자체 이미지 평가 데이터셋 |
| 첫 적용 지점 | 사내 문서·전표의 차트와 표 판독, 이미지 캡셔닝 |
| 판단 기준 | 상용 API 대비 정확도 격차와 월 API 비용 절감폭의 교환 비율 |
이미지 데이터를 외부로 보낼 수 없는 환경이라면 11B부터 검증을 시작해 볼 만합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
정렬 후 투영으로 이미지와 영상을 함께 배우는 Video-LLaVA
Video-LLaVA는 이미지와 영상을 투영 전에 하나의 언어 정렬 표현 공간으로 묶는 설계로 두 모달리티를 함께 학습해 Video-ChatGPT 대비 MSRVTT 5.8%, MSVD 9.9%, TGIF 18.6%, ActivityNet 10.1%의 성능 향상을 기록했습니다. 이미지 문서와 현장 영상을 한 모델로 다룰 수 있어 CCTV 분석이나 작업 영상 검수 같은 수주 과제의 모델 운영 수를 줄여 줍니다.
1GB 메모리로 동작하는 초소형 VLM SmolVLM
Hugging Face의 SmolVLM은 소형 모델에 맞춘 아키텍처와 토큰화 전략을 재설계해 256M 모델이 추론 시 1GB 미만의 GPU 메모리로 300배 큰 Idefics-80B를 능가하고 2.2B 모델은 2배의 메모리를 쓰는 최신 VLM들과 경쟁하는 성능을 냈습니다. 문서 이해 기능을 일반 사무용 장비나 모바일 기기에서 돌릴 수 있게 되므로 GPU 서버 없는 소규모 온프레미스 도입의 문턱을 크게 낮춥니다.
하루 학습으로 최고 성능을 낸 LLaVA-1.5의 시각 명령 튜닝
LLaVA-1.5는 MLP 커넥터와 학술 VQA 데이터 등 간단한 개선만으로 공개 데이터 120만 건과 8장 A100 약 하루 학습이라는 비용으로 11개 벤치마크 최고 성능을 달성했습니다. 거대 사전학습 없이도 데이터 구성만으로 상용급 VLM을 만들 수 있음을 보인 결과라 자체 도메인 문서로 VLM을 파인튜닝하려는 기업에 직접적인 참조 설계가 됩니다.