Wer große Modelle lokal laufen lässt, stößt oft schon vor dem Download an eine Grenze: ob der Grafikspeicher reicht, entscheidet über das Nutzungserlebnis. Viele schauen zuerst auf die Rechenleistung und merken erst später, dass das Modell nicht hineinpasst oder nur mit sehr kurzem Kontext läuft. VRAM ist eine harte Grenze: Wer zu wenig kauft, kann später nichts nachrüsten, sondern muss die ganze Karte tauschen.
Zuerst die Klassen: Welches Modell läuft mit wie viel VRAM
| VRAM | Modelle, die bequem laufen | Für wen geeignet |
|---|---|---|
| 8GB | Q4-quantisierte 7B/8B-Modelle, kurzer Kontext | Für Neugierige und gelegentliche Offline-Nutzung |
| 16GB | 14B bequem, 32B nur mit sparsamem Kontext | Für die meisten, die lokal ernsthaft deployen wollen |
| 24GB | 32B plus Reserve für den Kontext | Für alle, die langen Kontext und stabile Leistung brauchen |
| 32GB | Viel Reserve für 32B, für 70B weiter zu wenig | Für alle mit großzügigem Budget, die Spielraum wollen |
| 48GB und mehr | Modelle der 70B-Klasse | Für Bastler großer Modelle, auch mit Dual-GPU oder Plattformwechsel |
Diese Tabelle meint „bequem laufen“, nicht „gerade so hineinpassen“. Als Q4-Richtwert brauchen 7B/8B-Gewichte etwa 4,5 bis 5,5GB, 14B etwa 9GB, 32B etwa 19 bis 20GB und 70B mehr als 40GB. Hinzu kommen Kontext, KV-Cache und Systembedarf: Zu wenig Reserve bedeutet Out-of-Memory-Fehler oder häufige Drosselung.
Warum der VRAM vor der Rechenleistung zum Engpass wird
Im Betrieb belegt nicht nur das Modellgewicht den VRAM. Je länger das Gespräch und je größer der Kontext, desto mehr wächst der KV-Cache. Typisch ist: Die Modelldatei passt eindeutig, doch nach wenigen Runden kommt ein Fehler, oder der Kontext muss so klein gestellt werden, dass das Modell Früheres vergisst. Das ist kein Mangel an Rechenleistung, sondern VRAM, der von Gewichten und Cache gemeinsam gefüllt wird.
Eine Karte sollte daher nicht nach „Gewichtsgröße gleich VRAM“ gewählt werden. Für 14B wirken 9GB Gewichte mit 16GB VRAM erst entspannt; für 32B sind 19 bis 20GB Gewichte mit 24GB VRAM sinnvoll, 16GB sind nur ein knapper Versuch. Dass Karten wie die RTX 5080 trotz starker Leistung wegen nur 16GB VRAM oft kritisiert werden, hat genau diesen Grund: Nicht die Geschwindigkeit, die Kapazität erreicht zuerst ihre Grenze.
Bei gängigen Modellen gibt es die RTX 5060 Ti in einer 16GB-Version, die RTX 5070 hat 12GB, RTX 5070 Ti und RTX 5080 haben 16GB, die RTX 5090 hat 32GB, und RTX 4090 wie RTX 3090 haben 24GB. Eine gebrauchte RTX 3090 gilt wegen ihrer 24GB oft als Preis-Leistungs-Lücke, doch die Preise schwanken mit dem Markt, also Zustand und Stromverbrauch prüfen.
So kaufen drei Gruppen richtig
Nur ausprobieren
Hat die vorhandene Karte 8GB oder 12GB, besteht kein Grund zum schnellen Wechsel. Ein Q4-quantisiertes 7B/8B-Modell reicht für lokale Chats und kurze Texte völlig aus. Für einen einfachen Einstieg hilft LM Studio: ein großes Modell in einer Desktop-App, einfach herunterladen und loschatten, mit drei Kosten bei Speicher, Quantisierung und Auswahl: erst den Ablauf zum Laufen bringen, dann entscheiden, ob ein größeres Modell Geld wert ist.
Ernsthaft lokal deployen
Das Ziel 14B bis 32B macht 16GB zum aktuellen Sweet Spot, 24GB ist stabiler. Für alltägliches Programmieren, Dokumentenarbeit und Daten, die auf dem eigenen Gerät bleiben sollen, deckt 14B das Meiste ab, ein Sprung zum größten Modell ist nicht nötig. Wer oft lange Dokumente und langen Kontext lädt, sollte direkt 24GB wählen und sich wiederholtes Parametertuning sparen.
An großen Modellen basteln
Für 70B müssen deutlich höhere Kosten akzeptiert werden: Eine Consumer-Karte hat zu wenig VRAM, also Dual-GPU oder eine Plattform mit mehr Unified Memory in Betracht ziehen. Consumer-Karten der 40er- und 50er-Serie haben kein NVLink, Multi-GPU-Skalierung und Software-Support sind begrenzt. Zwei Karten verdoppeln die Kapazität nicht einfach; zuerst die Multi-GPU-Unterstützung des eigenen Inference-Frameworks prüfen.
Wo es sich nicht lohnt, und die Alternativen
Eine RTX 5090 nur zum Chatten zu kaufen, ist klassische Verschwendung. Ihre 32GB VRAM und ihre Leistung werden nicht ausgenutzt, während Kühlung und Netzteil trotzdem Geld kosten. Umgekehrt lohnt auch eine neue 8GB-Karte in der Hoffnung auf spätere große Modelle nicht, denn VRAM-Mangel lässt sich per Einstellung nicht beheben.
Zwei Alternativen gibt es. Erstens Apple Macs mit Unified Memory: Geräte mit 64GB oder 128GB fassen größere Modelle und passen zu Menschen im Mac-Ökosystem, doch Geschwindigkeit, Quantisierungsformate und Tooling unterscheiden sich von N-Karten, Grafikkarten-Erfahrung überträgt sich nicht direkt. Zweitens reine Cloud-APIs, die bei gelegentlicher Nutzung mit Qualitätsanspruch oft günstiger sind als eine Karte mit viel VRAM. Der Wert lokaler Bereitstellung liegt in Privatsphäre, Offline-Nutzung und kontrollierbaren Kosten bei hohem Volumen; trifft nichts davon zu, sollte der Kartenkauf nicht übereilt werden.