LLaMA 3.2 Vision 모델 분석
Meta의 최신 멀티모달 모델 LLaMA 3.2 Vision의 아키텍처와 성능을 분석합니다. 11B와 90B 파라미터 버전의 차이점과 실제 활용 사례를 다룹니다.
본문이 준비 중입니다. 요약과 원문 논문 링크를 참고해 주세요.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의같은 주제의 다른 인사이트
정렬 후 투영으로 이미지와 영상을 함께 배우는 Video-LLaVA
Video-LLaVA는 이미지와 영상을 투영 전에 하나의 언어 정렬 표현 공간으로 묶는 설계로 두 모달리티를 함께 학습해 Video-ChatGPT 대비 MSRVTT 5.8%, MSVD 9.9%, TGIF 18.6%, ActivityNet 10.1%의 성능 향상을 기록했습니다. 이미지 문서와 현장 영상을 한 모델로 다룰 수 있어 CCTV 분석이나 작업 영상 검수 같은 수주 과제의 모델 운영 수를 줄여 줍니다.
1GB 메모리로 동작하는 초소형 VLM SmolVLM
Hugging Face의 SmolVLM은 소형 모델에 맞춘 아키텍처와 토큰화 전략을 재설계해 256M 모델이 추론 시 1GB 미만의 GPU 메모리로 300배 큰 Idefics-80B를 능가하고 2.2B 모델은 2배의 메모리를 쓰는 최신 VLM들과 경쟁하는 성능을 냈습니다. 문서 이해 기능을 일반 사무용 장비나 모바일 기기에서 돌릴 수 있게 되므로 GPU 서버 없는 소규모 온프레미스 도입의 문턱을 크게 낮춥니다.
하루 학습으로 최고 성능을 낸 LLaVA-1.5의 시각 명령 튜닝
LLaVA-1.5는 MLP 커넥터와 학술 VQA 데이터 등 간단한 개선만으로 공개 데이터 120만 건과 8장 A100 약 하루 학습이라는 비용으로 11개 벤치마크 최고 성능을 달성했습니다. 거대 사전학습 없이도 데이터 구성만으로 상용급 VLM을 만들 수 있음을 보인 결과라 자체 도메인 문서로 VLM을 파인튜닝하려는 기업에 직접적인 참조 설계가 됩니다.