返回AI开发
cortexys.ai

AI洞察

了解最新AI技术动态和洞察。

FeaturedRAG

검색 전에 질문부터 고쳐 쓰는 RAG

사용자 질문을 검색에 맞게 고쳐 쓰는 재작성 단계를 검색 앞에 추가하면 RAG 성능이 일관되게 개선됩니다. Rewrite-Retrieve-Read 프레임워크를 제안한 이 논문은 소형 재작성 모델을 LLM 리더의 피드백으로 강화학습해, 검색기와 생성기를 그대로 둔 채 QA 성능을 끌어올렸습니다.

2026년 8월 19일查看详情
FeaturedLLM

도메인 적응 사전학습의 함정과 해법: 원문 대신 독해형 데이터로 학습하기

도메인 원문으로 계속 학습하면 지식은 쌓이지만 질의응답 프롬프팅 능력이 떨어진다는 것이 AdaptLLM 논문의 발견입니다. 원문을 독해형 과제 데이터로 변환해 학습하는 해법으로 7B 모델이 바이오의료, 금융, 법률에서 BloombergGPT-50B 수준의 성능을 냈으며, 도메인 특화 모델을 처음부터 만들 예산이 없는 기업에 현실적인 경로를 제시하는 결과입니다.

2026년 8월 12일查看详情
FeaturedAgent

깃허브 이슈로 코드 에이전트를 시험하는 SWE-bench

SWE-bench는 12개 파이썬 오픈소스 저장소의 실제 깃허브 이슈 2,294건을 언어 모델이 해결할 수 있는지 테스트로 검증하는 벤치마크로, 발표 당시 최고 모델의 해결률은 1.96%에 그쳤습니다. 이후 코드 에이전트 경쟁의 표준 척도가 된 이 벤치마크는 개발 업무 자동화의 성숙도를 기업이 수치로 추적할 수 있게 해줍니다.

2026년 8월 10일查看详情
LLM논문

활성값을 보고 가중치를 지키는 AWQ 양자화

MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.

양자화, AWQ, 4bit
2026년 8월 29일읽기
LLM논문

Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기

총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.

MoE, Mixtral, Sparse Models
2026년 8월 28일읽기
LLM논문

DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법

DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.

DPO, Alignment, Preference Optimization
2026년 8월 26일읽기
RAG논문

멀티홉 질의 앞에서 무너지는 RAG를 측정하다

여러 문서의 증거를 모아 추론해야 답할 수 있는 멀티홉 질의에서 기존 RAG는 GPT-4를 써도 정답률이 절반 수준에 그칩니다. 이를 체계적으로 측정한 벤치마크 MultiHop-RAG를 구축한 논문으로, 단일 검색 한 번으로 설계된 시스템의 한계를 미리 알고 보완해야 함을 보여줍니다.

멀티홉, 벤치마크, 복합 질의
2026년 8월 24일읽기
RAG논문

정답지 없이 RAG를 평가하는 RAGAS

RAGAS는 사람이 만든 정답 데이터 없이 검색 관련성, 생성 충실도, 답변 관련성을 각각 자동 측정하는 참조 없는 RAG 평가 프레임워크입니다. 평가 체계가 없으면 RAG 개선은 감에 의존하게 되므로, 사내 시스템 도입 시 정량 평가 루프를 처음부터 갖추는 일의 근거가 됩니다.

RAG 평가, RAGAS, 충실도
2026년 8월 21일읽기
LLM논문

YaRN이 보여준 컨텍스트 확장 효율: 10분의 1 토큰으로 늘리는 긴 문맥

RoPE 위치 임베딩을 쓰는 모델의 컨텍스트 윈도우는 기존 방법 대비 10분의 1의 학습 토큰과 2.5분의 1의 학습 스텝으로 확장할 수 있으며, 이것이 YaRN 논문의 핵심 기여입니다. 학습 데이터보다 긴 문맥으로 외삽하는 능력까지 확인되어, 계약서나 기술 문서처럼 긴 입력을 다루는 기업 과제에서 저비용 컨텍스트 확장 튜닝의 표준 경로가 된 논문입니다.

Long Context, YaRN, RoPE
2026년 8월 17일읽기
LLM논문

토크나이저가 만드는 언어 간 비용 격차: 같은 문장이 최대 15배로 늘어난다

같은 내용의 텍스트도 언어에 따라 토큰화 길이가 최대 15배까지 벌어지며, 이 격차는 API 비용, 처리 시간, 활용 가능한 컨텍스트 길이에 그대로 전가됩니다. Petrov 외의 NeurIPS 2023 논문이 이를 체계적으로 실증했으며, 한국어 서비스의 추론 비용을 다루는 코텍시스에 토크나이저 효율 진단이 최적화 견적의 첫 단계여야 하는 이유를 제시합니다.

Tokenizer, Multilingual, Korean NLP
2026년 8월 14일읽기
VLM논문

정렬 후 투영으로 이미지와 영상을 함께 배우는 Video-LLaVA

Video-LLaVA는 이미지와 영상을 투영 전에 하나의 언어 정렬 표현 공간으로 묶는 설계로 두 모달리티를 함께 학습해 Video-ChatGPT 대비 MSRVTT 5.8%, MSVD 9.9%, TGIF 18.6%, ActivityNet 10.1%의 성능 향상을 기록했습니다. 이미지 문서와 현장 영상을 한 모델로 다룰 수 있어 CCTV 분석이나 작업 영상 검수 같은 수주 과제의 모델 운영 수를 줄여 줍니다.

영상 이해, Video-LLaVA, 멀티모달
2026년 8월 8일읽기
LLM논문

QLoRA로 보는 파라미터 효율 파인튜닝: 48GB GPU에서 65B 모델을 튜닝하는 방법

QLoRA는 4비트로 양자화한 베이스 모델 위에 LoRA 어댑터만 학습해 65B 모델을 단일 48GB GPU에서 파인튜닝하는 기법입니다. 이 방식으로 만든 Guanaco는 Vicuna 벤치마크에서 ChatGPT 성능의 99.3%에 도달했으며, 고객사 GPU 예산 안에서 sLLM 커스터마이징을 제안해야 하는 코텍시스 입장에서는 튜닝 비용 산정의 기준선이 되는 논문입니다.

QLoRA, LoRA, PEFT
2026년 8월 5일읽기
LLM논문

RLAIF 실증 연구: AI 피드백이 인간 피드백 라벨링을 대체할 수 있는가

AI 피드백 기반 강화학습(RLAIF)은 요약과 대화 생성 과제에서 인간 피드백 기반 RLHF와 동등한 성능을 낸다는 것이 Google의 실증 연구로 확인되었습니다. 보상 모델 학습을 생략하는 d-RLAIF 기법도 함께 제안되어, 선호 라벨링 예산이 정렬 프로젝트의 최대 비용 항목인 기업 환경에서 어노테이션 비용 구조를 바꿀 수 있는 결과입니다.

RLAIF, RLHF, AI Feedback
2026년 8월 3일읽기
Optimization논문

구조화된 LLM 프로그램을 위한 서빙 시스템 SGLang

SGLang은 다중 호출과 제어 흐름이 얽힌 LLM 프로그램을 위한 언어와 런타임을 함께 설계해 RadixAttention 기반 KV 캐시 재사용으로 기존 시스템 대비 최대 6.4배의 처리량을 달성했습니다. 에이전트 워크플로와 JSON 구조화 출력이 많은 기업 자동화 파이프라인일수록 이 캐시 재사용 효과가 비용 절감으로 직결됩니다.

SGLang, 서빙 시스템, RadixAttention
2026년 8월 1일읽기
VLM논문

1GB 메모리로 동작하는 초소형 VLM SmolVLM

Hugging Face의 SmolVLM은 소형 모델에 맞춘 아키텍처와 토큰화 전략을 재설계해 256M 모델이 추론 시 1GB 미만의 GPU 메모리로 300배 큰 Idefics-80B를 능가하고 2.2B 모델은 2배의 메모리를 쓰는 최신 VLM들과 경쟁하는 성능을 냈습니다. 문서 이해 기능을 일반 사무용 장비나 모바일 기기에서 돌릴 수 있게 되므로 GPU 서버 없는 소규모 온프레미스 도입의 문턱을 크게 낮춥니다.

경량 VLM, SmolVLM, 온디바이스
2026년 7월 30일읽기
RAG논문

필요할 때만 검색하고 스스로 검증하는 Self-RAG

Self-RAG는 모델이 검색 필요 여부를 스스로 판단하고 반성 토큰으로 자기 생성물의 근거성을 비평하도록 학습시킨 프레임워크입니다. 7B와 13B 규모로 개방형 QA와 사실 검증 등에서 ChatGPT와 검색 증강 Llama2-chat을 능가했으며, 오답 비용이 큰 사내 질의응답에 시사점이 큽니다.

할루시네이션, Self-RAG, 자기 검증
2026년 7월 27일읽기
RAG논문

에이전트가 검색을 지휘하는 Agentic RAG

Agentic RAG는 자율 AI 에이전트를 RAG 파이프라인에 내장해 정적 워크플로를 동적 검색 전략과 다단계 추론으로 바꾸는 접근입니다. 아키텍처 분류체계와 산업별 응용, 미해결 과제를 정리한 이 서베이는 검색 한 번으로 끝나는 시스템과 계획하고 재검색하는 시스템의 차이가 기업 RAG의 다음 세대를 가른다는 것을 보여줍니다.

Agentic RAG, AI 에이전트, 동적 검색
2026년 7월 25일읽기
Agent논문

MCP 생태계의 구조와 보안 위협을 정리한 첫 체계적 분석

이 논문은 AI 모델과 외부 도구를 잇는 표준인 Model Context Protocol의 아키텍처와 생태계를 정리하고, 서버 생명주기 4단계에 걸친 16개 위협 시나리오의 보안 분류체계를 제시한 첫 체계적 연구입니다. MCP로 사내 시스템을 에이전트에 연결하려는 기업에게 표준 도입의 이점과 함께 서버 검증 절차가 왜 필수인지를 알려줍니다.

MCP, 도구 프로토콜, 표준화
2026년 7월 23일읽기
VLM논문

하루 학습으로 최고 성능을 낸 LLaVA-1.5의 시각 명령 튜닝

LLaVA-1.5는 MLP 커넥터와 학술 VQA 데이터 등 간단한 개선만으로 공개 데이터 120만 건과 8장 A100 약 하루 학습이라는 비용으로 11개 벤치마크 최고 성능을 달성했습니다. 거대 사전학습 없이도 데이터 구성만으로 상용급 VLM을 만들 수 있음을 보인 결과라 자체 도메인 문서로 VLM을 파인튜닝하려는 기업에 직접적인 참조 설계가 됩니다.

VLM 파인튜닝, LLaVA, Visual Instruction Tuning
2026년 7월 20일읽기
Optimization논문

토큰이 아니라 피처를 예측하는 EAGLE 추측 디코딩

EAGLE은 추측 디코딩의 초안 생성을 토큰 수준이 아닌 모델 내부 피처 수준에서 수행해 LLaMA2-Chat 70B 기준 2.7배에서 3.5배의 지연 시간 단축과 2배의 처리량 향상을 생성 분포 변화 없이 달성했습니다. 별도의 소형 초안 모델을 구하기 어려운 사내 특화 sLLM에도 가벼운 예측 헤드 하나로 적용할 수 있다는 점이 실무적 강점입니다.

Speculative Decoding, EAGLE, 추론 가속
2026년 7월 18일읽기
Agent논문

언어 모델이 스스로 도구 사용을 배우는 방법, Toolformer

Meta AI의 Toolformer는 언어 모델이 사람의 개입 없이 스스로 API 호출 시점과 인자를 학습하는 자기지도 방식을 제시한 논문입니다. 업무 자동화 에이전트를 도입하려는 기업에게는 도구 호출 능력이 별도의 대규모 수작업 라벨링 없이도 학습될 수 있다는 근거가 되어 사내 시스템 연동 에이전트 설계의 출발점이 됩니다.

Tool Use, Function Calling, 자기지도학습
2026년 7월 16일읽기
Agent논문

운영체제에서 배운 에이전트 장기 메모리, MemGPT

MemGPT는 운영체제의 계층적 메모리 관리에서 착안해 언어 모델이 제한된 컨텍스트 창 안팎으로 정보를 스스로 옮기는 가상 컨텍스트 관리를 제안했습니다. 고객 이력이나 프로젝트 맥락을 오래 기억해야 하는 업무 에이전트를 설계할 때 컨텍스트 창 확장 경쟁 대신 메모리 계층 설계로 접근할 수 있음을 보여줍니다.

메모리, 컨텍스트 관리, LLM OS
2026년 7월 14일읽기
RAG논문

GraphRAG가 전체를 조망하는 질문에 답하는 방법

GraphRAG는 문서 전체에서 엔티티 지식 그래프를 만들고 커뮤니티 단위 요약을 미리 생성해, 코퍼스 전반을 조망하는 질문에 답하는 마이크로소프트의 방법입니다. 개별 문서 조각 검색으로는 답할 수 없는 전역 질문까지 커버 범위를 넓힌다는 점에서 사내 지식 시스템의 다음 단계를 보여줍니다.

GraphRAG, 지식 그래프, 요약
2026년 7월 11일읽기
Agent논문

에이전트의 사고를 미리 겪어보는 안전 평가, ToolEmu

ToolEmu는 언어 모델로 도구 실행을 에뮬레이션해 에이전트의 위험 행동을 실제 피해 없이 발견하는 프레임워크로, 가장 안전하다는 에이전트조차 23.9%의 비율로 심각한 실패를 보임을 확인했습니다. 업무 자동화 에이전트를 운영 시스템에 연결하기 전에 저비용으로 위험 시나리오를 선별하는 방법론이 필요하다는 것을 보여줍니다.

안전성, 가드레일, 리스크 평가
2026년 7월 9일읽기
Optimization논문

프리필을 쪼개 처리량과 지연을 함께 잡는 Sarathi-Serve

Sarathi-Serve는 프리필을 청크로 쪼개 디코드 배치의 빈 연산 슬롯에 끼워 넣는 무정지 스케줄링으로 처리량과 지연의 트레이드오프를 해소했고 vLLM 대비 Mistral-7B에서 2.6배, Falcon-180B에서 최대 5.6배의 서빙 용량을 달성했습니다. 같은 GPU로 SLA를 지키며 더 많은 동시 사용자를 받는다는 뜻이므로 온프레미스 서빙의 장비 산정 기준을 바꾸는 결과입니다.

Continuous Batching, Chunked Prefill, 서빙 스케줄링
2026년 7월 7일읽기
Optimization논문

재학습 없는 LLM 프루닝 기법 Wanda

ICLR 2024에 채택된 Wanda는 가중치 크기에 입력 활성값 크기를 곱한 값을 기준으로 프루닝해 재학습이나 가중치 업데이트 없이 즉시 사용 가능한 희소 LLM을 만듭니다. 별도 학습 인프라 없이 배포 직전 단계에서 모델을 가볍게 만들 수 있어 GPU 예산이 빠듯한 온프레미스 도입 프로젝트에 실용적입니다.

Pruning, Sparsity, Wanda
2026년 7월 5일읽기
RAG논문

하이브리드 검색이 단일 인덱스를 이기는 이유

하이브리드 검색은 키워드 검색과 의미 검색의 실패 지점이 서로 다르다는 사실을 이용해 단일 인덱스보다 높은 정확도를 얻는 방법입니다. 밀집 벡터 인덱스와 희소 인코더 인덱스를 하이브리드 질의로 결합한 Blended RAG는 NQ와 TREC-COVID 검색에서 새로운 기준을 세웠고, SQuAD 질의응답에서는 미세조정 접근을 능가했습니다.

하이브리드 검색, BM25, 밀집 벡터
2026년 7월 2일읽기
RAG논문

OCR 없이 PDF를 읽는 Nougat

Nougat은 비전 트랜스포머로 문서 이미지를 곧바로 마크업 텍스트로 변환해, PDF에서 수식 등 의미 정보가 손실되는 문제를 푸는 메타의 모델입니다. RAG 품질은 파싱 품질의 상한을 넘지 못하므로, 표와 수식이 많은 문서를 다루는 시스템에서 문서 이해 계층이 검색 못지않게 중요함을 보여줍니다.

문서 파싱, OCR-free, PDF
2026년 6월 30일읽기
Agent논문

대화하는 에이전트들로 애플리케이션을 만드는 AutoGen

Microsoft의 AutoGen은 LLM과 사람과 도구를 조합한 여러 에이전트가 서로 대화하며 과업을 수행하는 오픈소스 프레임워크로, 수학과 코딩과 질의응답 등 다양한 영역에서 효과를 입증했습니다. 하나의 만능 에이전트 대신 역할을 나눈 에이전트 팀으로 업무를 자동화하는 구성이 실무에서 왜 관리하기 쉬운지 보여주는 기준점입니다.

Multi-Agent, 협업, 프레임워크
2026년 6월 28일읽기
Agent논문

에이전트 워크플로를 사람 대신 탐색으로 설계하는 AFlow

AFlow는 에이전트 워크플로 설계를 코드로 표현된 탐색 공간의 최적화 문제로 정의하고 몬테카를로 트리 탐색으로 자동 생성해, 6개 벤치마크에서 수작업 설계 대비 평균 5.7% 개선을 달성했습니다. 소형 모델 기반 워크플로가 GPT-4o 비용의 4.55%로 더 나은 성능을 낸 결과는 업무 자동화의 운영 비용 구조를 바꿀 수 있음을 시사합니다.

워크플로 오케스트레이션, 자동 설계, MCTS
2026년 6월 25일읽기
Agent논문

여러 경로를 탐색하며 추론하는 Tree of Thoughts

Tree of Thoughts는 언어 모델이 하나의 답을 향해 직진하는 대신 여러 중간 사고 경로를 생성하고 자체 평가하며 탐색하도록 만든 프레임워크로, Game of 24 문제에서 성공률을 4%에서 74%로 끌어올렸습니다. 계획이 필요한 업무 자동화 에이전트에서 단일 응답 생성보다 탐색과 평가를 결합한 설계가 왜 유리한지 보여주는 대표 근거입니다.

Planning, 추론, 탐색
2026년 6월 23일읽기
Optimization논문

KV 캐시를 가상 메모리처럼 다루는 PagedAttention

SOSP 2023에 발표된 vLLM의 PagedAttention은 운영체제의 페이징 기법을 KV 캐시에 적용해 메모리 낭비를 거의 0으로 줄이고 동일한 지연 수준에서 처리량을 2배에서 4배 끌어올렸습니다. 같은 GPU로 몇 배의 동시 사용자를 감당하게 하므로 온프레미스 추론 서버의 하드웨어 투자 규모를 직접 좌우하는 기술입니다.

KV Cache, PagedAttention, vLLM
2026년 6월 21일읽기
LLM논문

MiniLLM의 역방향 KL 증류: 대형 모델의 능력을 소형 모델로 옮기는 기술

생성형 LLM 증류에서 표준 증류의 정방향 KL 대신 역방향 KL 발산을 최소화하면 학생 모델이 교사 분포의 저확률 영역을 과대평가하는 문제를 막을 수 있다는 것이 MiniLLM 논문의 핵심입니다. 120M부터 13B까지의 규모에서 응답 정확도와 장문 생성 품질 개선이 확인되었으며, 대형 모델 품질을 소형 모델 운영 비용으로 제공해야 하는 sLLM 사업의 핵심 기법 중 하나입니다.

Knowledge Distillation, MiniLLM, sLLM
2026년 6월 19일읽기
RAG논문

리랭커가 검색 정확도를 끌어올리는 방식

리랭커는 1차 검색이 추린 후보를 질의와 함께 다시 읽어 순위를 재조정하는 단계로, 검색 정확도를 좌우하는 저비용 개선점입니다. LLaMA를 밀집 검색기(RepLLaMA)와 리랭커(RankLLaMA)로 미세조정해 다단계 검색 파이프라인 전체를 대형 모델로 구성한 이 논문은 대형 모델 기반 검색이 소형 모델 기반 검색을 능가함을 보였습니다.

리랭커, 재순위화, 다단계 검색
2026년 6월 16일읽기
Agent논문

에이전트에게 진짜 컴퓨터를 쥐여준 벤치마크, OSWorld

OSWorld는 Ubuntu와 Windows 등 실제 운영체제 위에서 369개 과업으로 멀티모달 에이전트를 평가하는 최초의 확장 가능한 실컴퓨터 벤치마크로, 사람은 72.36%를 해내는 과업을 최고 모델이 12.24%밖에 완수하지 못함을 보였습니다. 화면을 보고 업무 프로그램을 조작하는 자동화를 검토하는 기업에게 현재 기술의 위치와 도입 시 안전장치의 필요성을 알려주는 기준선입니다.

Computer Use, GUI 에이전트, 벤치마크
2026년 6월 12일읽기
Agent논문

LLM을 에이전트로서 평가하는 첫 다차원 벤치마크, AgentBench

AgentBench는 운영체제와 데이터베이스와 웹 쇼핑 등 8개 환경에서 LLM의 에이전트 역량을 측정하는 다차원 벤치마크로, 상용 모델과 오픈소스 모델 사이의 큰 격차를 실증했습니다. 에이전트 도입 시 일반 챗봇 성능표가 아니라 다단계 의사결정 능력 기준으로 모델을 골라야 한다는 점을 알려주는 논문입니다.

벤치마크, 평가, 에이전트 역량
2026년 6월 10일읽기
VLM논문

OCR 없이 문서 구조를 읽는 mPLUG-DocOwl 1.5

mPLUG-DocOwl 1.5는 문서, 표, 차트 등 5개 영역의 구조 인식 파싱을 학습하는 통합 구조 학습과 고해상도 처리 모듈 H-Reducer로 OCR 엔진 없이 문서를 이해하며 10개 벤치마크 중 5개에서 기존 7B급 최고 성능을 10점 이상 앞섰습니다. OCR 파이프라인의 오류 누적과 라이선스 비용을 걷어낸다는 점에서 문서 자동화 수주 프로젝트의 아키텍처를 단순하게 만드는 접근입니다.

문서 이해, OCR-free, DocOwl
2026년 6월 7일읽기
RAG논문

시맨틱 청킹은 비용만큼 효과가 있는가

시맨틱 청킹이 고정 길이 청킹보다 항상 나은 것은 아닙니다. 임베딩 유사도로 문서를 자르는 시맨틱 청킹을 세 가지 검색 과제로 체계 검증한 이 논문의 결론은 계산 비용을 정당화할 만큼 일관된 이득이 없다는 것으로, 청킹 전략은 유행이 아니라 자기 데이터에서의 측정으로 골라야 함을 보여줍니다.

청킹, 문서 분할, 검색 품질
2026년 6월 5일읽기
LLM논문

LIMA가 던진 질문: 인스트럭션 튜닝 데이터는 얼마나 필요한가

인스트럭션 튜닝에 필요한 데이터는 수십만 건이 아니라 신중히 선별한 1,000건으로 충분할 수 있다는 것이 LIMA 논문의 결론입니다. 1,000개의 프롬프트 응답 쌍만으로 튜닝한 65B LLaMA가 인간 평가에서 GPT-4 대비 43%, Bard 대비 58%의 선호율을 얻었으며, 기업 파인튜닝에서 데이터 구축 예산을 양이 아니라 선별 품질에 배정해야 한다는 실증 근거입니다.

Instruction Tuning, Data Quality, LIMA
2026년 6월 3일읽기
LLM논문

TIES-Merging으로 보는 모델 머징: 재학습 없이 여러 튜닝 모델을 하나로 합치기

여러 파인튜닝 모델을 합칠 때 성능이 떨어지는 원인은 중복 파라미터와 부호 불일치라는 두 가지 간섭이며, TIES-Merging은 작은 변화량 제거, 부호 합의, 합의 부호 파라미터만 병합하는 3단계로 이를 해결합니다. 과제별 튜닝 모델을 여럿 운영하는 대신 단일 모델로 통합해 서빙 비용을 줄이려는 기업에 실용적인 도구입니다.

Model Merging, TIES, Multi-task
2026년 6월 1일읽기
VLM논문

LLaMA 3.2 Vision 모델 분석

LLaMA 3.2 Vision은 언어 모델 파라미터를 고정한 채 크로스 어텐션 어댑터로 이미지 인코더를 결합해, 기존 텍스트 성능을 지키면서 시각 이해를 추가한 개방형 멀티모달 모델입니다. Meta 공식 발표를 기준으로 11B와 90B의 구조, 경량 1B·3B 라인업, 도입 시 고려사항을 정리합니다.

LLaMA, Vision, Multimodal
2024년 12월 15일읽기
RAG논문

RAG 시스템의 Hallucination 감소 기법

검색을 항상 수행하는 대신 필요할 때만 검색하고, 생성 결과를 모델 스스로 평가하게 만드는 것이 효과적인 환각 감소 방법입니다. 대표 기법인 Self-RAG 논문을 중심으로 reflection token 구조와 실무 적용 시 고려사항을 정리합니다.

RAG, Hallucination, NLP
2024년 12월 10일읽기
Optimization논문

sLLM 양자화 기법 비교: GGUF vs AWQ vs GPTQ

GPU 서빙에는 AWQ, CPU 혼합 환경에는 GGUF, 기존 GPTQ 자산이 있다면 GPTQ 유지가 기본 선택입니다. MLSys 2024 최우수 논문상을 받은 AWQ 논문을 중심으로 세 방식의 원리와 선택 기준을 정리합니다.

Quantization, GGUF, AWQ
2024년 12월 5일읽기
LLM논문

Claude 3.5 Sonnet과 GPT-4 Turbo 비교 분석

코딩과 대학원 수준 추론에서는 Claude 3.5 Sonnet이 앞서고, 가격 대비 성능에서도 우위를 보입니다. Anthropic 공식 발표 자료를 기준으로 두 진영 플래그십 모델의 벤치마크와 운영 비용을 비교합니다.

Claude, GPT-4, Benchmark
2024년 12월 1일읽기
Agent논문

LangGraph를 활용한 Multi-Agent 시스템 구축

여러 에이전트가 협업하는 시스템에는 순환과 상태 공유를 지원하는 그래프 구조가 필요하며, LangGraph가 이를 위한 대표 프레임워크입니다. 공식 문서를 기준으로 핵심 개념과 supervisor 패턴, 도입 시 판단 기준을 정리합니다.

LangGraph, Multi-Agent, Workflow
2024년 11월 28일읽기