TIES-Merging으로 보는 모델 머징: 재학습 없이 여러 튜닝 모델을 하나로 합치기
여러 파인튜닝 모델을 합칠 때 성능이 떨어지는 원인은 중복 파라미터와 부호 불일치라는 두 가지 간섭이며, TIES-Merging은 작은 변화량 제거, 부호 합의, 합의 부호 파라미터만 병합하는 3단계로 이를 해결합니다. 과제별 튜닝 모델을 여럿 운영하는 대신 단일 모델로 통합해 서빙 비용을 줄이려는 기업에 실용적인 도구입니다.
과제마다 파인튜닝 모델을 따로 만들면 성능은 좋지만 모델 수만큼 서빙 비용이 늘어납니다. 모델 머징은 추가 학습 없이 여러 튜닝 모델의 가중치를 산술적으로 결합해 하나의 멀티태스크 모델을 얻으려는 접근이며, TIES-Merging은 왜 단순한 결합이 실패하는지를 규명하고 고친 논문입니다.
문제 배경
같은 베이스에서 파인튜닝된 모델들의 가중치를 단순 평균하면 개별 모델보다 성능이 떨어지는 경우가 많았습니다. 이 논문은 실패 원인을 파라미터 간 간섭으로 규명합니다. 첫째, 파인튜닝 중 거의 변하지 않은 중복 파라미터가 평균에 노이즈로 섞여 소수의 영향력 있는 파라미터를 희석합니다. 둘째, 같은 파라미터를 두고 모델마다 변화 방향의 부호가 충돌해 상쇄가 일어납니다.
방법
TIES는 각 모델의 태스크 벡터, 즉 베이스 대비 가중치 변화량을 3단계로 처리합니다. 먼저 변화량 크기 기준 상위 20%만 남기고 나머지를 0으로 되돌려 중복 파라미터를 제거합니다. 다음으로 파라미터마다 여러 모델의 변화량을 모아 다수가 향하는 부호를 정합니다. 마지막으로 합의된 부호와 일치하는 값들만 평균해 병합합니다. 전 과정이 산술 연산이라 GPU 학습이 필요 없습니다.

결과
논문의 분석에서 태스크 벡터 상위 20% 파라미터만 남겨도 과제 성능이 유지된다는 것, 그리고 병합 모델 수가 늘수록 부호 충돌 비율이 증가한다는 것이 확인되었습니다. TIES는 T5 계열 언어모델과 ViT 비전 모델, 전체 파인튜닝과 파라미터 효율 파인튜닝을 아우르는 설정에서 기존 머징 기법들을 일관되게 능가했고, 분포 밖 일반화에서도 더 나은 결과를 보였습니다.
한계와 주의점
머징은 같은 베이스 모델에서 파인튜닝된 모델들 사이에서만 성립합니다. 서로 다른 사전학습 출신의 모델은 합칠 수 없습니다. 논문의 부호 충돌 분석이 보여주듯 병합하는 과제 수가 늘수록 간섭이 커져 성능 유지가 어려워지고, 병합 비중을 정하는 하이퍼파라미터의 검증 절차도 필요합니다. 개별 전문 모델 대비 일부 과제의 성능 손실은 남을 수 있으므로 과제별 회귀 평가를 전제로 도입해야 합니다.
도입 검토 가이드
같은 베이스 모델에서 파인튜닝한 과제별 모델이나 어댑터를 여럿 서빙하고 있어 GPU 비용이 모델 수에 비례해 늘고 있는 조직이 검토 대상입니다. 서로 다른 사전학습 출신의 모델은 합칠 수 없으므로, 운영 중인 모델들의 베이스가 통일되어 있는지가 첫 번째 확인 사항입니다.
| 구분 | 내용 |
|---|---|
| 검토 주체 | 모델 서빙 비용을 관리하는 ML 플랫폼팀과 과제별 모델 품질을 책임지는 서비스 운영 조직 |
| 전제 조건 | 동일 베이스에서 파인튜닝된 모델들의 가중치, 병합 비중 하이퍼파라미터를 검증할 과제별 평가 세트. 전 과정이 산술 연산이라 GPU 학습 자원은 필요 없습니다 |
| 첫 적용 지점 | 요약, 분류, 질의응답처럼 이미 운영 중인 2개에서 3개 과제 모델의 통합 실험. 논문 분석상 병합 과제 수가 늘수록 부호 충돌이 커지므로 소수 과제부터 시작합니다 |
| 판단 기준 | 병합 모델의 과제별 회귀 평가에서 개별 전문 모델 대비 성능 손실 폭과 절감되는 서빙 비용의 비교. 손실이 서비스 허용 범위를 넘는 과제는 병합 대상에서 제외합니다 |
코텍시스는 다과제 sLLM 구축 제안에서 머징으로 서빙 인프라를 단일화하는 구성을 제시하며, 이미 과제별 모델을 여럿 운영 중인 고객에게는 재학습 없이 운영 비용을 줄이는 개선 프로젝트로 제안합니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의기술 블로그 최신 글
AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
Anthropic이 AI 교육을 설계한 다섯 원칙과 한국 기업교육의 거리
Anthropic이 Claude Academy를 공개하며 밝힌 AI 교육 설계 원칙 다섯 가지를 정리하고, 국내 기업교육 발주에 옮길 때 제안서에서 확인할 질문과 실패 유형을 덧붙였습니다.
Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 국내 조직 도입 시 확인할 항목을 덧붙였습니다.
같은 주제의 다른 인사이트
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
YaRN이 보여준 컨텍스트 확장 효율: 10분의 1 토큰으로 늘리는 긴 문맥
RoPE 위치 임베딩을 쓰는 모델의 컨텍스트 윈도우는 기존 방법 대비 10분의 1의 학습 토큰과 2.5분의 1의 학습 스텝으로 확장할 수 있으며, 이것이 YaRN 논문의 핵심 기여입니다. 학습 데이터보다 긴 문맥으로 외삽하는 능력까지 확인되어, 계약서나 기술 문서처럼 긴 입력을 다루는 기업 과제에서 저비용 컨텍스트 확장 튜닝의 표준 경로가 된 논문입니다.