ToolNavs KI-Tools entdecken
Tool einreichen Anmelden

llama.cpp

Erklärt, wo llama.cpp als Basis der lokalen Inferenz steht, wie GGUF und Quantisierung plattformübergreifende Läufe tragen, und trennt seinen Einsatzbereich von dem fertiger lokaler Werkzeuge.

llama.cpp ist die quelloffene Inferenz-Engine an der Basis des lokalen LLM-Ökosystems und führt quantisierte Modelle auf Mac, Linux, Windows, Servern und Edge-Geräten aus. Sie unterstützt lokale Formate wie GGUF und setzt auf ressourcenschonende Inferenz und plattformübergreifenden Betrieb, weshalb viele Ein-Klick-Werkzeuge auf vergleichbarer Fähigkeit aufbauen. Sie ist eher Motor als fertiges Auto: Kommandozeile, Modellformat und Hardware-Beschleunigung bleiben Handarbeit.