ToolNavs AI 도구 탐색
도구 제출 로그인
돌아가기 AI 백과사전
DPO란 무엇인가요? 모델이 "어떤 답변을 선호하나요?"로부터 직접 학습하는 방식입니다

DPO란 무엇인가요? 모델이 "어떤 답변을 선호하나요?"로부터 직접 학습하는 방식입니다

AI 백과사전 Admin 4 회 조회

DPO(직접 선호 최적화)는 모델 정렬 방법이다. 학습 데이터는 단일 표준 답변이 아니라 동일한 프롬프트 아래의 두 응답으로, 선호도와 더 잘 맞고 상대적으로 나쁜 반응으로 이루어진다. DPO는 보상 모델을 별도로 훈련시키고 PPO를 강화 학습 최적화에 사용하지 않고도 모델 선호 응답의 상대적 확률을 직접 높여준다.

선호 데이터는 어떤 모습인가요?

가장 기본적인 예시에는 프롬프트, 승리 답변, 누락된 답변이 포함됩니다. 주석 작성자는 도움성, 사실성, 스타일 또는 안전 경계를 비교합니다. 훈련 중에 모델은 동일한 맥락 내에서 두 가지 사이에 확률 격차를 만드는 법을 배우며, 선호도에 맞추기 위해 원래 모델에서 너무 벗어나지 않도록 모델 제약 조건을 참조합니다.

이 때문에 DPO가 고전적인 RLHF 프로세스보다 더 단순하다고 여겨지는 이유도 설명됩니다: 보상 모델링과 전략 최적화를 이진 목표로 전환하여 온라인 샘플링, 보상 모델 서비스, 복잡한 강화 학습 루프를 제거합니다. DPO는 여전히 훈련 후 단계에 머물러 있으며, 사전 학습에서 얻은 기초 지식을 대체할 수 없습니다.

DPO, SFT, RLHF는 각각 무엇을 배우나요?

방법주요 데이터핵심 역할일반적인 제한 사항
SFT힌트와 이상적인 답변모방 표적 시범두 가지 답변 중에서 미묘한 선호를 표현하기는 어렵습니다
DPO선호와 비선호는 옳습니다직접 학습이 상대적으로 선호됩니다데이터 품질과 보장 범위 비교에 크게 의존합니다
클래식 RLHF표본 선호 데이터, 보상 모델 및 전략보상 신호로 전략을 지속적으로 최적화하세요이 과정은 복잡하며, 훈련 안정성과 비용 관리가 더 어렵습니다

이 세 가지는 단순한 치환 관계가 아닙니다. 일반적인 접근법은 먼저 SFT로 사용 가능한 동작을 확립한 후, DPO 또는 기타 선호도 최적화 방법을 사용해 톤, 거부 경계, 응답 품질을 보정하는 것입니다.

"훈련이 쉬워진다"고 해서 반드시 더 나은 결과가 나온다는 뜻은 아닙니다

승리한 답변이 단지 더 길고 주석자에게 더 잘 맞춘다면, 모델은 진정한 품질보다는 표면적 스타일을 학습할 수 있습니다. 선호도가 너무 비슷하면 훈련 신호가 약해집니다; 커버리지가 부족하면 모델은 몇몇 작업에서만 개선될 수 있습니다.

DPO는 목표를 쌍별 비교로 표현할 수 있으면서도 RLHF 공학적 복잡성을 줄이려는 시나리오에 가장 적합합니다. 팀은 여전히 독립적인 평가 세트를 유지하여 사실, 안전성, 길이 편향, 다양한 그룹의 선호도를 확인해야 합니다; "어느 쪽을 선호하는가"가 보편적으로 옳다고 볼 수는 없습니다.

추천 도구

더보기