Ein großes Sprachmodell lokal mit Ollama zu betreiben, lässt sich in einem Satz zusammenfassen: Es verwandelt das Modell von einem „Cloud-API-Aufruf" in einen einzigen Befehl auf dem eigenen Rechner. Ollama installieren, mit ollama pull llama3.1 das Modell laden und mit ollama run offline chatten, programmieren und Dokumente lesen – nichts davon läuft je über einen fremden Server. Gelöst wird nicht die Frage „ist das Modell klug genug", sondern „kann das Modell privat, offline und ohne Grenzkosten auf meiner eigenen Hardware laufen".
Offizielles Repository
Das Projekt liegt auf GitHub, Organisation Ollama, Projektname ollama (Repository-Pfad ollama/ollama), veröffentlicht unter der MIT-Lizenz. Mitte 2026 hat es die Marke von 170.000 Sternen überschritten und ist damit das meistbeachtete Open-Source-Projekt im Bereich lokaler LLM-Laufzeitumgebungen. Offizielle Installer gibt es für Windows, macOS und Linux, dazu eine Desktop-GUI-Version; eingebaut ist ein OpenAI-kompatibler lokaler API-Endpunkt, an den sich zahlreiche Desktop-Clients und Agent-Frameworks direkt als lokales Modell-Backend andocken.
Die drei Probleme, die es tatsächlich löst
Erstens Privatsphäre: Vertrauliche Dokumente und Code müssen nicht mehr zu Dritten hochgeladen werden. Zweitens Offline-Nutzung: KI funktioniert weiter im Flugzeug oder bei wackeliger Verbindung. Drittens Kosten: Das Modell wird einmal heruntergeladen, danach kostet kein Token mehr etwas. Der Preis ist ebenso klar – ein lokales Modell der 7B/8B-Klasse spielt leistungsmäßig nicht in derselben Liga wie ein Cloud-Flaggschiff, und das muss man vor der Entscheidung akzeptieren.
Einsatzkosten: Hardware und Festplatte sind die zwei Hürden
Ollama selbst installiert sich kostenlos; die echten Kosten stecken in der Hardware. Faustregel: 8 GB RAM reichen für kleine Modelle der 3B-Klasse, 16 GB passen zur 7B/8B-Klasse, die 30B-Klasse braucht rund 24 GB VRAM. Mit dedizierter NVIDIA-GPU läuft die Beschleunigung automatisch, ohne sie rechnet nur die CPU – es läuft, aber um ein Vielfaches langsamer. Die zweite Hürde ist die Festplatte und wird gern unterschätzt: Ein quantisiertes 8B-Modell wiegt etwa 4–5 GB, die 70B-Klasse erreicht locker zweistellige Gigabyte-Werte. Für das Modellverzeichnis sollten einige Dutzend Gigabyte reserviert sein.
Echte Fallstricke: Quantisierung, VRAM und Modellnamen
Erstens: Die falsche Quantisierungsstufe macht den Download zunichte. Dasselbe Modell gibt es in Q4, Q5, Q8 und weiteren quantisierten Varianten – je größer die Zahl, desto größer die Datei und desto geringer der Qualitätsverlust. Bei knappem VRAM greift man direkt zu 4-Bit-Varianten wie Q4_K_M; Q8_0 erst dann, wenn VRAM reichlich vorhanden ist. Zweitens: Zu wenig VRAM erzeugt keinen Fehler, sondern nur Langsamkeit. Reicht der VRAM nicht, wechselt Ollama stillschweigend zur CPU-Inferenz, und die Geschwindigkeit bricht ein. Erst im Task-Manager prüfen, ob die GPU wirklich arbeitet, bevor man „es läuft" verkündet. Drittens: Den Doppelpunkt im Modellnamen nicht übersehen – llama3.1 und llama3.1:70b sind zwei völlig verschiedene Downloads in Größe und Fähigkeit, und die Verwechslung ist der klassische Anfängerfehler.
Mit einem Rechner über 16 GB RAM und einer ordentlichen GPU ist Ollama derzeit der reibungsloseste Weg, Open-Source-Modelle nach Hause zu holen. Erst VRAM und Festplatte durchrechnen, dann entscheiden, welches Modell man zieht – das erspart die meisten Umwege.
F: Brauche ich nach dem Herunterladen eines Modells mit Ollama noch eine Internetverbindung?
A: Nein. Sobald die Modelldateien geladen sind, läuft die Inferenz vollständig offline; eine Verbindung ist nur für den ersten Download und Update-Prüfungen nötig.