하루 학습으로 최고 성능을 낸 LLaVA-1.5의 시각 명령 튜닝
LLaVA-1.5는 MLP 커넥터와 학술 VQA 데이터 등 간단한 개선만으로 공개 데이터 120만 건과 8장 A100 약 하루 학습이라는 비용으로 11개 벤치마크 최고 성능을 달성했습니다. 거대 사전학습 없이도 데이터 구성만으로 상용급 VLM을 만들 수 있음을 보인 결과라 자체 도메인 문서로 VLM을 파인튜닝하려는 기업에 직접적인 참조 설계가 됩니다.
멀티모달 모델을 만들려면 수억 장 규모의 사전학습이 필요하다는 통념을 뒤집은 연구입니다. LLaVA-1.5는 통제된 조건에서 멀티모달 모델의 설계 선택을 처음으로 체계적으로 비교했고, 그 결론이 지금까지 오픈소스 VLM 설계의 기본형이 됐습니다.
문제 배경
시각 명령 튜닝(visual instruction tuning)을 제안한 초기 LLaVA는 자연스러운 대화 능력을 보였지만 학술 벤치마크에서는 수억 장 규모 사전학습을 쓰는 모델들에 밀렸습니다. 어떤 설계 요소가 성능을 좌우하는지에 대한 통제된 비교도 없었고, 짧은 답을 요구하는 학술 VQA 데이터와 자유 대화 데이터를 그대로 섞으면 응답 형식이 충돌하는 문제도 있었습니다.
방법
논문은 LLaVA의 완전연결 비전-언어 커넥터가 놀랍도록 강력하고 데이터 효율적임을 보이고, 그 위에 단순한 개선을 더합니다. 커넥터를 선형 투영에서 2층 MLP로 바꾸고, 비전 인코더를 CLIP-ViT-L-336px로 올려 입력 해상도를 높였으며, 짧은 답이 필요한 과제에 응답 형식 프롬프트를 명시한 학술 VQA 데이터를 학습에 포함했습니다. 각 변경의 기여를 통제된 실험으로 하나씩 검증한 뒤 조합한 것이 LLaVA-1.5이며, 이 레시피는 13B뿐 아니라 더 작은 규모의 모델 구성에도 같은 방식으로 적용됩니다.

결과
13B 체크포인트는 공개 데이터 120만 건만 사용해 8장 A100 노드에서 약 하루 만에 전체 학습을 마치고 11개 벤치마크에서 최고 성능을 기록했습니다. 수십억 장 규모 사전학습을 쓰는 접근과 대비되는 데이터 효율성이며, 고해상도 입력 확장과 조합적 능력, 환각 같은 열린 문제에 대한 초기 탐색도 함께 제시했습니다.
한계와 주의점
논문 스스로 밝힌 한계가 뚜렷합니다. 이미지 패치 전체를 토큰으로 쓰므로 학습 반복이 길어지고, 여러 이미지를 함께 다루는 능력이 없으며, 특정 분야의 문제 해결 능력은 제한적이고, 환각이 완전히 사라지지 않아 중요 용도에서는 주의가 필요합니다. 고해상도 확장은 초기 탐색 수준으로만 다뤘습니다.
기업 적용 관점
VLM 수주 프로젝트의 관건은 고객 도메인 데이터로 얼마나 저렴하게 모델을 특화하느냐입니다. 잘 설계된 명령 데이터 100만 건 수준과 단일 노드 하루 학습으로 실전급 VLM이 나온다는 결과는 제조 도면이나 사내 양식 문서에 특화한 온프레미스 VLM 구축의 비용 상한을 현실적으로 낮추고, 데이터 형식 설계가 성능을 좌우한다는 교훈은 데이터 구축 단가 산정에 직접 반영됩니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의같은 주제의 다른 인사이트
정렬 후 투영으로 이미지와 영상을 함께 배우는 Video-LLaVA
Video-LLaVA는 이미지와 영상을 투영 전에 하나의 언어 정렬 표현 공간으로 묶는 설계로 두 모달리티를 함께 학습해 Video-ChatGPT 대비 MSRVTT 5.8%, MSVD 9.9%, TGIF 18.6%, ActivityNet 10.1%의 성능 향상을 기록했습니다. 이미지 문서와 현장 영상을 한 모델로 다룰 수 있어 CCTV 분석이나 작업 영상 검수 같은 수주 과제의 모델 운영 수를 줄여 줍니다.
1GB 메모리로 동작하는 초소형 VLM SmolVLM
Hugging Face의 SmolVLM은 소형 모델에 맞춘 아키텍처와 토큰화 전략을 재설계해 256M 모델이 추론 시 1GB 미만의 GPU 메모리로 300배 큰 Idefics-80B를 능가하고 2.2B 모델은 2배의 메모리를 쓰는 최신 VLM들과 경쟁하는 성능을 냈습니다. 문서 이해 기능을 일반 사무용 장비나 모바일 기기에서 돌릴 수 있게 되므로 GPU 서버 없는 소규모 온프레미스 도입의 문턱을 크게 낮춥니다.
OCR 없이 문서 구조를 읽는 mPLUG-DocOwl 1.5
mPLUG-DocOwl 1.5는 문서, 표, 차트 등 5개 영역의 구조 인식 파싱을 학습하는 통합 구조 학습과 고해상도 처리 모듈 H-Reducer로 OCR 엔진 없이 문서를 이해하며 10개 벤치마크 중 5개에서 기존 7B급 최고 성능을 10점 이상 앞섰습니다. OCR 파이프라인의 오류 누적과 라이선스 비용을 걷어낸다는 점에서 문서 자동화 수주 프로젝트의 아키텍처를 단순하게 만드는 접근입니다.