ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
transformers, GGUF 네이티브 지원: llama.cpp 없이 양자화 모델을 로컬에서 실행

transformers, GGUF 네이티브 지원: llama.cpp 없이 양자화 모델을 로컬에서 실행

AI 정보 Admin 2 회 조회

2026년 9월 22일, Hugging Face는 공식 블로그를 통해 transformers가 GGUF 양자화 모델을 직접 불러올 수 있게 됐다고 발표했다. 노트북에서 모델을 돌리는 사람에게는 익숙한 from_pretrained 호출 하나로 충분하다는 뜻이다. transformers와 llama.cpp 두 도구 체인을 오갈 필요가 없어졌다.

지금까지 뭐가 번거로웠나

GGUF는 llama.cpp 생태계의 양자화 모델 형식으로, 커뮤니티에서 내려받을 수 있는 양자화 가중치의 대다수는 GGUF 파일이다. transformers 사용자가 이를 쓰려면 직접 형식을 변환하거나 llama.cpp 추론 흐름을 따로 띄워야 했다. 어느 쪽도 우아하지 않다. 변환에는 정밀도와 호환성 리스크가 따르고, 별도 흐름은 의존성과 API가 두 배가 된다.

이번에 어떻게 해결했나

핵심은 Hugging Face가 바퀴를 다시 발명하지 않았다는 점이다. 목표는 'llama.cpp에 근접한 성능'이라고 명시했고, llama.cpp의 ggml 커널 자체를(kernels 라이브러리를 통해) 재사용하고 generate 단계의 오버헤드를 줄여 이를 달성했다. 블로그는 또 transformers serve가 이제 GGUF 모델을 OpenAI 호환 API로 제공할 수 있어 Jan이나 Pi 같은 데스크톱 추론 클라이언트가 바로 연결할 수 있다고 밝혔다. 공식 예시는 Qwen3.5-4B다. BF16 정밀도에서 8.42GB인 파일이 Q4_K_M에서는 2.74GB로 줄어든다. 이것이 바로 GGUF가 존재하는 이유다. 노트북 메모리에 들어가지 않던 모델을 돌아가는 크기로 바꾸는 것.

지금 바로 쓸 수 있는 사람, 조금 더 기다려야 할 사람

초기 최적화는 Apple Silicon에 집중됐고, ggml의 Metal 커널로 처리량을 측정했다. 테스트 머신은 32GB 통합 메모리의 MacBook Pro M2 Max다. Mac 사용자가 첫 수혜자가 된다. CUDA나 CPU에 대해서는 같은 수준의 상세 수치가 아직 공개되지 않아, 속도를 극한까지 뽑고 싶은 사람은 관망이 낫다. 한 가지 더. 양자화 자체에도 대가가 있다. Q4_K_M 같은 4비트 양자화는 정밀도가 떨어진다. 2.74GB 파일과 8.42GB 원본은 다른 물건이니, 파일 크기만 보고 모델을 고르지 말자.

추천 도구

더보기