Am 22. September 2026 hat Hugging Face in seinem offiziellen Blog bekannt gegeben, dass transformers GGUF-quantisierte Modelle jetzt direkt laden kann. Für alle, die Modelle auf dem Laptop betreiben, heißt das: Ein vertrauter from_pretrained-Aufruf genügt – das Hin- und Herpendeln zwischen den transformers- und llama.cpp-Toolchains entfällt.
Warum das bisher mühsam war
GGUF ist das quantisierte Modellformat des llama.cpp-Ökosystems, und die überwältigende Mehrheit der herunterladbaren quantisierten Gewichte in der Community sind GGUF-Dateien. Wer sie mit transformers nutzen wollte, musste entweder selbst konvertieren oder einen separaten llama.cpp-Inferenzablauf aufsetzen. Beides war wenig elegant: Konvertierung birgt Präzisions- und Kompatibilitätsrisiken, ein zweiter Ablauf bedeutet doppelte Abhängigkeiten und doppelte APIs.
Wie diese Version das löst
Der entscheidende Punkt: Hugging Face hat das Rad nicht neu erfunden. Das erklärte Ziel ist eine Leistung "nahe an llama.cpp", erreicht durch die Wiederverwendung der ggml-Kernel von llama.cpp selbst (über die kernels-Bibliothek) und weniger Overhead im generate-Schritt. Außerdem kann transformers serve ein GGUF-Modell jetzt über eine OpenAI-kompatible API bereitstellen, sodass Desktop-Inferenzclients wie Jan oder Pi direkt andocken können. Das offizielle Beispiel ist Qwen3.5-4B: Eine 8,42-GB-Datei in BF16-Präzision schrumpft auf 2,74 GB bei Q4_K_M – genau dafür existiert GGUF: ein Modell, das nicht in den Laptop-Speicher passt, lauffähig zu machen.
Wer es jetzt nutzen kann – und wer noch warten sollte
Die erste Optimierungswelle konzentriert sich auf Apple Silicon, mit Durchsatztests auf ggmls Metal-Kerneln; die Testmaschine war ein MacBook Pro M2 Max mit 32 GB gemeinsamem Speicher. Mac-Nutzer profitieren zuerst. Für CUDA und CPU liegen noch keine gleich detaillierten Zahlen vor – wer maximale Geschwindigkeit will, wartet besser ab. Noch ein Hinweis: Quantisierung hat ihren Preis. 4-Bit-Quantisierung wie Q4_K_M kostet Präzision – eine 2,74-GB-Datei ist nicht dasselbe wie das 8,42-GB-Original. Ein Modell nur nach der Dateigröße zu wählen, wäre ein Fehler.