모델 압축과 양자화
증류가 대규모 모델의 능력을 작은 모델로 어떻게 옮기는지, 저정밀 양자화가 무엇과 바꿔 속도와 메모리를 얻는지, 소형 언어 모델의 한계가 어디인지 정리합니다.
모델을 스마트폰이나 보급형 GPU에 올리는 방법은 보통 세 가지입니다. 대규모 모델의 출력 분포를 흉내 내는 증류, 가중치를 4비트나 8비트로 낮추는 양자화, 기여가 작은 연결을 잘라내는 가지치기입니다. 메모리·지연·전력을 얻는 대신 정확도와 견고함을 잃으며, 손실은 고르지 않아 장문 생성과 수학 추론이 먼저 흔들립니다. 이 태그는 각 방법이 언제 값어치를 하는지와 압축 후 검증 절차를 다룹니다.