지식 증류(Knowledge Distillation)는 이미 학습된 거대 모델(교사 모델)로부터 작은 모델(학생 모델)이 배우는 기술이다. Geoffrey Hinton 등이 2015년 논문 「Distilling the Knowledge in a Neural Network」에서 체계화했다. 목표는 파라미터가 적고 빠른 소형 모델이 거대 모델의 능력을 최대한 이어받게 하는 것이다.
핵심 메커니즘: 학생이 배우는 건 정답이 아니라 교사의 '망설임'
일반 학습은 '하드 레이블'만 쓴다. 이 이미지가 고양이면 100% 고양이라고 기록한다. 하지만 교사 모델이 내놓는 건 '소프트 레이블'이다. 70% 고양이, 20% 호랑이, 10% 기타 식이다. Hinton은 이런 정보를 '다크 지식(dark knowledge)'이라 불렀다. 클래스 간의 유사 관계야말로 교사가 진짜로 배운 것이기 때문이다.
이 미약한 확률 신호를 드러내기 위해 증류에서는 온도 파라미터 T를 도입한다. 교사 출력의 logits를 T로 나눈 뒤 softmax를 적용한다. T가 클수록 확률 분포는 '부드러워'지고, 0.1%로 눌려 있던 차순위 클래스들이 올라와 학생이 교사의 판단 구조를 읽을 수 있게 된다. 학습 시 학생의 손실은 교사의 소프트 레이블을 따르는 KL 발산과 일반적인 교차 엔트로피(하드 레이블) 손실의 가중합이다.
지식 증류의 핵심 구성 요소
증류를 한 번 완성하려면 네 가지가 필요하다. 학습된 교사 모델(보통 거대 모델), 학습시킬 학생 모델(소형 아키텍처), 온도 파라미터 T, 그리고 소프트·하드 두 손실의 가중 비율이다. 교사는 '문제를 내고 모범 답안을 제시'하는 역할, 학생은 교사의 출력 분포를 모방하는 것과 정답 레이블에 맞추는 것 사이의 균형을 찾는다.
증류의 한계: 직접 학습보다 못할 때는 언제인가
증류가 만능은 아니다. 첫째, 학생의 상한은 대체로 교사가 정한다. 교사가 어떤 과제에서 약하면 학생이 배우는 것도 '교사를 닮은 오답'뿐이다. 둘째, 용량이 너무 작은 학생은 '배우지 못한다'——교사의 지식은 지나치게 작은 네트워크에 담기지 않는다. 셋째, 증류에는 선행 비용이 있다. 소프트 레이블을 만들려면 거대한 교사 모델을 먼저 한 번 돌려야 한다. 마지막으로, 목표 과제가 교사가 잘하는 분포 밖에 있다면 차라리 목표 데이터로 소형 모델을 직접 학습시키는 편이 낫다.
흔한 3가지 오해
오해 1: 증류는 압축, 즉 양자화나 가지치기와 같다. 셋 다 '작고 빠르게'와 관련 있지만, 증류는 학습 단계에서 능력을 전이하고, 양자화는 배포 단계에서 수치 정밀도를 낮추며, 가지치기는 불필요한 파라미터를 삭제한다. 함께 쓸 수는 있지만(먼저 증류하고 양자화하는 조합이 흔하다) 서로 대체할 수는 없다.
오해 2: 학생은 교사를 절대 넘지 못한다. 대부분 교사기 상한인 건 맞지만, 손실에는 진짜 하드 레이블도 섞여 있어 과제 데이터로 조정한 학생이 단일 지표에서 교사를 앞지를 때도 있다.
오해 3: 증류하면 능력 손실이 없다. 거의 모든 증류에서 성능은 조금 떨어진다. 문제는 얼마나, 어디서 떨어지느냐다. '성능 97% 유지'라는 홍보 뒤에는, 사라진 3%가 롱테일과 어려운 샘플에 몰리는 경향이 있다는 사실이 있다.
증류·양자화·가지치기의 경계는 어디인가
한 문장으로 구분하면, 증류가 바꾸는 건 '모델이 배우는 방식'으로 완전히 새로운 소형 모델을 만들어낸다. 양자화가 바꾸는 건 '숫자를 저장하는 방식'으로 모델 구조는 거의 그대로다. 가지치기가 바꾸는 건 '구조를 얼마나 남길지'로 파라미터를 직접 삭제한다. 셋은 모델 수명 주기의 서로 다른 단계에서 작용하고 자주 함께 쓰이지만 푸는 문제는 다르다. 쉬운 해설 버전은 모델 증류: 왜 '소형 모델'이 거대 모델을 따라잡고 있는가를 참고하면 된다.
실제 적용 사례
대표 사례는 HuggingFace의 DistilBERT다. BERT를 교사로 삼아 학생 모델은 파라미터 40% 감소, 속도 60% 향상을 이루면서 언어 이해력의 약 97%를 유지했다. LLM 시대의 대표작도 있다. DeepSeek-R1 팀은 R1이 생성한 80만 개 추론 샘플로 DeepSeek-R1-Distill-Qwen-7B를 증류해 수학 테스트 AIME 2024에서 55.5%의 정답률을 기록했다. 같은 규모로 직접 학습한 모델을 크게 웃돈다. 오늘날 스마트폰 음성 기능, 온디바이스 고객 응대, 차량 시스템에서 도는 소형 모델 뒤에는 대부분 증류가 있다.