ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 백과사전
SFT(지도 미세조정)란? 챗봇 모델이 '데뷔 전 교육'을 받는 이유

SFT(지도 미세조정)란? 챗봇 모델이 '데뷔 전 교육'을 받는 이유

AI 백과사전 • Admin • • 6 회 조회

SFT(Supervised Fine-Tuning, 지도 미세조정)는 챗봇 모델이 '데뷔'하기 전 받는 직무 교육과 같습니다. 수천 건의 '지시-응답' 예시 데이터를 사용해, 사전학습된 대형 모델에게 인간이 기대하는 방식으로 말하고 행동하도록 가르칩니다. 여기서 중요한 점은 모델에 새로운 지식을 주입하는 것이 아니라, '이미 배운 것을 올바른 형식으로 말하는 법'을 가르친다는 것입니다.

사전학습·SFT·RLHF의 역할 분담

챗봇 모델의 학습 파이프라인은 보통 사전학습 → SFT → RLHF(또는 DPO 같은 정렬 기법)의 3단계로 진행되며, 각 단계의 역할은 완전히 다릅니다.

단계배우는 것한마디로
사전학습방대한 텍스트에서 언어 규칙과 세계 지식을 배움'말하고 이해하는 법'을 배움
SFT지시 예시에서 '지시를 따르고 기대되는 형식으로 답하기'를 배움'요구대로 일하는 법'을 배움
RLHF / DPO인간의 선호에서 '더 안전하고 유용해지기'를 배움'만족시키는 법'을 배움

SFT는 어떻게 하는가

첫째, 지시 데이터셋을 준비합니다. '사용자 지시-이상적인 응답' 쌍을 수천 건 모아 질의응답·글쓰기·코드·추론 등의 작업을 포괄합니다. 둘째, 손실(loss)은 응답 부분에만 계산합니다. 모델은 데이터 전체를 보지만, '응답이 예시와 얼마나 닮았는지'만 평가받고 지시 부분은 채점되지 않습니다. 셋째, 품질이 양을 압도합니다. 수백~수천 건의 고품질 예시가 수십만 건의 조잡한 데이터보다 좋은 결과를 낸다는 연구 결과가 있습니다.

참고로 SFT가 반드시 전체 미세조정을 필요로 하지는 않습니다. LoRA 미세조정 같은 파라미터 효율적 방법으로 저비용으로 SFT를 수행할 수 있어, 개인과 소규모 팀의 상용 선택지입니다.

SFT의 한계

첫째, 학습 컷오프 이후의 새로운 지식은 배울 수 없습니다. 지식의 상한은 사전학습에서 정해지고, SFT가 가르치는 것은 '표현 방식'뿐입니다. 둘째, 행동 복제(behavioral cloning)의 한계가 있습니다. 모델은 예시 데이터의 수준까지만 배울 수 있고, 예시를 제공한 사람을 넘어설 수 없습니다. 셋째, 데이터의 편향은 증폭됩니다. 예시 데이터에 담긴 편견과 오류는 모델이 그대로 배워 굳어집니다.

흔한 세 가지 오해

오해 1: 'SFT 데이터는 많을수록 좋다.' 틀렸습니다. 조잡한 데이터는 나쁜 습관을 가르칩니다. 중요한 것은 고품질 예시입니다.

오해 2: 'SFT를 하면 모델이 똑똑해진다.' 틀렸습니다. 모델의 지식량은 변하지 않고, 답을 더 잘하게 될 뿐입니다. 능력의 상한은 사전학습 단계에서 이미 정해져 있습니다.

오해 3: 'SFT를 하면 프롬프트 엔지니어링이나 RAG가 필요 없어진다.' 틀렸습니다. SFT가 정하는 것은 모델의 '기본 행동', RAG가 담당하는 것은 '실시간 지식', 프롬프트 엔지니어링이 담당하는 것은 '당장의 작업'으로, 세 층은 각자 다른 영역이며 서로 대체할 수 없습니다.

SFT의 본질은 모델을 위한 '직업 습관 교육'입니다. 모델이 '무엇을 아는지'는 바꾸지 않고, '어떻게 답하는지'를 바꾸는 것입니다.

추천 도구

더보기