ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
transformers unterstützt GGUF jetzt nativ: quantisierte Modelle lokal ausführen – ganz ohne llama.cpp

transformers unterstützt GGUF jetzt nativ: quantisierte Modelle lokal ausführen – ganz ohne llama.cpp

KI-Informationen Admin 2 Aufrufe

Am 22. September 2026 hat Hugging Face in seinem offiziellen Blog bekannt gegeben, dass transformers GGUF-quantisierte Modelle jetzt direkt laden kann. Für alle, die Modelle auf dem Laptop betreiben, heißt das: Ein vertrauter from_pretrained-Aufruf genügt – das Hin- und Herpendeln zwischen den transformers- und llama.cpp-Toolchains entfällt.

Warum das bisher mühsam war

GGUF ist das quantisierte Modellformat des llama.cpp-Ökosystems, und die überwältigende Mehrheit der herunterladbaren quantisierten Gewichte in der Community sind GGUF-Dateien. Wer sie mit transformers nutzen wollte, musste entweder selbst konvertieren oder einen separaten llama.cpp-Inferenzablauf aufsetzen. Beides war wenig elegant: Konvertierung birgt Präzisions- und Kompatibilitätsrisiken, ein zweiter Ablauf bedeutet doppelte Abhängigkeiten und doppelte APIs.

Wie diese Version das löst

Der entscheidende Punkt: Hugging Face hat das Rad nicht neu erfunden. Das erklärte Ziel ist eine Leistung "nahe an llama.cpp", erreicht durch die Wiederverwendung der ggml-Kernel von llama.cpp selbst (über die kernels-Bibliothek) und weniger Overhead im generate-Schritt. Außerdem kann transformers serve ein GGUF-Modell jetzt über eine OpenAI-kompatible API bereitstellen, sodass Desktop-Inferenzclients wie Jan oder Pi direkt andocken können. Das offizielle Beispiel ist Qwen3.5-4B: Eine 8,42-GB-Datei in BF16-Präzision schrumpft auf 2,74 GB bei Q4_K_M – genau dafür existiert GGUF: ein Modell, das nicht in den Laptop-Speicher passt, lauffähig zu machen.

Wer es jetzt nutzen kann – und wer noch warten sollte

Die erste Optimierungswelle konzentriert sich auf Apple Silicon, mit Durchsatztests auf ggmls Metal-Kerneln; die Testmaschine war ein MacBook Pro M2 Max mit 32 GB gemeinsamem Speicher. Mac-Nutzer profitieren zuerst. Für CUDA und CPU liegen noch keine gleich detaillierten Zahlen vor – wer maximale Geschwindigkeit will, wartet besser ab. Noch ein Hinweis: Quantisierung hat ihren Preis. 4-Bit-Quantisierung wie Q4_K_M kostet Präzision – eine 2,74-GB-Datei ist nicht dasselbe wie das 8,42-GB-Original. Ein Modell nur nach der Dateigröße zu wählen, wäre ein Fehler.

Empfohlene Tools

Mehr