Am 23. September 2026 hat Google im offiziellen Entwicklerblog angekündigt, dass das Antigravity SDK jetzt lokale Modell-Workflows unterstützt – zum Start mit Gemma 4 26B A4B über LiteRT von Google AI Edge. Entwickler können damit Assistenten mit Agentenfähigkeiten in vollständig offline Umgebungen betreiben: Code und Anfragen verlassen die Maschine nicht mehr.
Die Voraussetzungen sind konkret benannt. Google empfiehlt eine Maschine mit mehr als 24 GB VRAM oder Unified Memory; die Einrichtung braucht zwei Schritte – per pip google-antigravity und litert-lm installieren, dann die LiteRT-Variante von Gemma 4 26B A4B von der Organisation litert-community auf Hugging Face laden – und wenige Codezeilen starten einen lokalen Agenten. Im offiziellen Beispiel beantwortet dieser lokale Agent die Frage „Welche Dateien liegen im aktuellen Verzeichnis?" – die schlichteste und zugleich sprechendste Aufgabe.
Warum das Beachtung verdient: Cloud-Gehirn plus lokale Arbeitskraft
Google verkauft hier nicht „lokal ersetzt Cloud", sondern hybride Orchestrierung. Die offizielle Demo zeigt ein Architect-Builder-Muster: Gemini 3.8 Flash in der Cloud übernimmt Planung und Steuerung als Architekt; ein Schwarm von Gemma-4-26B-Instanzen auf der lokalen Maschine erledigt die eigentliche Arbeit als Bautrupp. In der Demo werden Audit und Patching dreier anfälliger Module – auth.py, billing.py und database.py – komplett lokal durchgeführt, die Daten verlassen das interne Netz nicht.
Die Arbeitsteilung ist bewusst kalkuliert. Planung und Steuerung brauchen das Urteilsvermögen des stärksten Modells und bleiben in der Cloud; die tokenhungrige Ausführungsphase wandert aufs Gerät, spart API-Kosten und Rate Limits und erfüllt strenge Daten-Compliance. Die vier Gründe, die Google nennt – Kosten, Privatsphäre, Offline-Resilienz, hybride Orchestrierung – beantworten im Kern dieselbe Frage: Für welche Stufen lohnt es sich, ein Cloud-Modell zu bezahlen, und welche lassen sich lokal lösen? Das ist derselbe Trend wie die native GGUF-Unterstützung in transformers (die Hürde für quantisierte Modelle auf dem eigenen Rechner sinkt weiter (/article/2045-transformers-yuan-sheng-zhi-chi-gguf-ben-di-pao-liang-hua-mo-xing-bu-yong-zai-zh)): On-Device-Rechenleistung entwickelt sich von „kann ein Modell ausführen" zu „kann einen Agenten ausführen".
Die Grenzen
Die 24-GB-VRAM-Anforderung schließt die meisten dünnen Notebooks aus – die unvermeidliche Hardware-Mathematik für ein 26B-Modell auf dem eigenen Rechner. LiteRT ist vorerst das bevorzugte Ausführungs-Backend; zu weiteren lokalen Modellen und Ausführungsoptionen sagt Google nur, die Abdeckung werde ausgeweitet, ohne Zeitplan. Und offline heißt nicht wartungsfrei: Modelldateien, SDK-Versionen und die lokale Umgebung wollen weiterhin gepflegt werden.