DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
사람의 선호를 모델에 반영하는 정렬 학습은 오랫동안 강화학습 전문 조직의 영역이었습니다. DPO는 그 파이프라인을 지도학습 한 단계로 접어 넣었고, 발표 이후 공개 모델 진영에서 RLHF의 사실상 대체재로 자리 잡았습니다.
문제 배경
표준 RLHF는 두 단계를 요구합니다. 먼저 사람이 매긴 응답 쌍 선호로 보상 모델을 학습하고, 그 보상을 최대화하도록 PPO 강화학습으로 언어모델을 다시 학습합니다. 이 과정은 하이퍼파라미터에 민감하고 학습이 불안정하며, 정책 모델과 보상 모델을 동시에 띄워야 해서 구현과 운영 부담이 큽니다. 소규모 팀이 재현하기 어려운 구조였습니다.
방법
DPO의 출발점은 KL 제약이 걸린 보상 최대화 문제의 최적 정책이 보상 함수의 닫힌 형태로 표현된다는 관찰입니다. 이 관계를 뒤집으면 보상 함수를 정책 자체로 재매개변수화할 수 있고, 선호 확률 모델에 대입하면 보상 모델이 식에서 사라집니다. 남는 것은 선호 쌍 데이터에서 선택된 응답의 상대 확률은 높이고 탈락한 응답의 상대 확률은 낮추는 분류 손실 하나입니다. 별도의 보상 모델 학습도, 샘플링 기반 강화학습 루프도 없이 지도학습과 같은 절차로 정렬이 끝납니다.

결과
감정 제어 과제에서 DPO는 보상과 KL 발산의 균형 면에서 PPO 기반 RLHF를 능가했습니다. TL;DR 요약 과제에서는 GPT-4 평가 기준으로 온도 0.0에서 약 61%의 승률을 기록해 PPO의 최적 조건 승률 57%를 넘었고, 단일 턴 대화에서도 동등하거나 더 나은 응답 품질을 보였습니다. 구현이 단순하고 학습이 안정적이며 샘플링이 없어 계산 비용도 낮았습니다.
| 과제 | DPO | PPO |
|---|---|---|
| TL;DR 요약 승률 (GPT-4 평가, 온도 0.0) | 약 61% | 57% |
한계와 주의점
논문은 학습 분포 밖에서의 일반화가 명시적 보상 모델 방식과 어떻게 다른지, 보상 과최적화가 DPO에서 어떻게 나타나는지를 열린 질문으로 남깁니다. 검증 규모도 6B 수준까지였고 더 큰 모델로의 확장은 향후 과제로 두었습니다. 실무에서는 강화학습이 사라졌을 뿐 고품질 선호 쌍 데이터가 여전히 필요하다는 점이 자주 간과됩니다.
기업 적용 관점
선호 정렬이 강화학습 전문 인력 없이 가능한 작업이 되었다는 점이 수주 관점의 핵심입니다. 고객사가 답변 톤, 형식 준수, 금지 표현 회피 같은 요구사항을 제시할 때, 코텍시스는 어노테이션된 선호 쌍 구축과 DPO 학습 한 단계로 작업 범위를 정의할 수 있습니다. 파이프라인이 단순한 만큼 일정과 비용 산정이 명확해지고, sLLM 파인튜닝 프로젝트에 정렬 단계를 옵션이 아닌 기본 구성으로 포함하는 제안이 가능해집니다.
코텍시스 AI사업부는 sLLM 최적화, Advanced RAG, AI Agent 개발을 수행합니다. 이런 기법의 도입을 검토 중이라면 문의를 남겨주세요.
AI 개발 문의같은 주제의 다른 인사이트
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
YaRN이 보여준 컨텍스트 확장 효율: 10분의 1 토큰으로 늘리는 긴 문맥
RoPE 위치 임베딩을 쓰는 모델의 컨텍스트 윈도우는 기존 방법 대비 10분의 1의 학습 토큰과 2.5분의 1의 학습 스텝으로 확장할 수 있으며, 이것이 YaRN 논문의 핵심 기여입니다. 학습 데이터보다 긴 문맥으로 외삽하는 능력까지 확인되어, 계약서나 기술 문서처럼 긴 입력을 다루는 기업 과제에서 저비용 컨텍스트 확장 튜닝의 표준 경로가 된 논문입니다.
토크나이저가 만드는 언어 간 비용 격차: 같은 문장이 최대 15배로 늘어난다
같은 내용의 텍스트도 언어에 따라 토큰화 길이가 최대 15배까지 벌어지며, 이 격차는 API 비용, 처리 시간, 활용 가능한 컨텍스트 길이에 그대로 전가됩니다. Petrov 외의 NeurIPS 2023 논문이 이를 체계적으로 실증했으며, 한국어 서비스의 추론 비용을 다루는 코텍시스에 토크나이저 효율 진단이 최적화 견적의 첫 단계여야 하는 이유를 제시합니다.