Am 1. September 2026 kündigte Google DeepMind Geminis intelligente emulative Videoverständnisfähigkeiten auf seinem offiziellen Blog an, wobei die erste Charge Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite abdeckt. Die Änderung besteht nicht nur darin, dass "Modelle Videos ansehen können", sondern dass es nicht mehr eine große Anzahl irrelevanter Bilder mit fester Bildrate in den Kontext einfügen muss.
Es geht nicht darum, "ein paar weitere Bilder zu betrachten", sondern darum, zu entscheiden, wo man zuerst hinschaut
Traditionelle Videoanalyse extrahiert in der Regel Bilder mit einer festen Rate, während die statische Verarbeitung der Gemini-API standardmäßig 1 Bild pro Sekunde beträgt. Bei langen Tutorien, Vorlesungen oder Stunden Aufnahme verbraucht dieser Ansatz entweder eine große Anzahl von Tokens oder verpasst kurze Aktionen aufgrund der geringeren Abtastdichte.
Neue Funktionen kombinieren Schlussfolgerung mit nativen Videowerkzeugen. Das Modell sucht, scannt und spielt dynamisch Clips rund um das Problem ab und wählt die gewünschten Signale zwischen Bildern, Audio und transkribiertem Text aus. Wenn Änderungen innerhalb einer Sekunde gefunden werden, kann es die lokalen Abtastraten verbessern; beim Suchen nach einem Schlüsselsatz muss man den gesamten Clip Absatz für Absatz nicht lesen. Dies ist auch der Unterschied zwischen KI-Agenten und festen Workflows: Das Modell beginnt zu entscheiden, welches Tool als nächstes aufgerufen wird.
"Bis zu 88 % Token sparen" kann nicht als fester Rabatt betrachtet werden
Googles Standard-Videoanalyse-Benchmark zeigt, dass nach der Aktivierung der Token-Verbrauch um bis zu 88 % sinkt, die Analysekosten um bis zu 66 % sinken und die Genauigkeit um bis zu 7 % steigt. All diese Zahlen haben die "meisten" Bedingungen und stammen aus spezifischen Modellen, Videolängen und Problemtypen und können nicht direkt auf jedes Unternehmen angewendet werden. Ein zuverlässigerer Ansatz ist es, eigene Video- und Abfragesammlungen für A/B-Tests zu verwenden, während Tokens, Latenz, Abruf und Fehllokalisierung aufgezeichnet werden.
Offiziell bietet Gemini 3.7 Flash eine bessere Kombination aus Genauigkeit und Kosten im Testmodell; Kurze Videos oder Aufgaben, die nur grobe Zusammenfassungen erfordern, bieten möglicherweise nicht die gleichen Vorteile. Vorteile liegen eher in schneller Aktion, Anomalieerkennung, präziser Zählung und Suche über Stunden hinweg. Für verwandte Fähigkeitsgrenzen siehe bitte die "Multimodal Model Practical Use Summary" der Seite.
Entwickler müssen vor der Anmeldung vier Prüfungen durchführen
Diese Funktion unterstützt das Hochladen von Videos und YouTube-Videos, mit Einstiegspunkten wie der Gemini API von Google AI Studio und der Gemini Enterprise Agent Platform. Das Setzen des Videoverarbeitungsmodus auf agentisch aktiviert sie; es wird keine zusätzliche Feature-Gebühr erhoben, aber sie wird weiterhin als reguläres API-Token berechnet.
Bestätigen Sie vor dem Start, ob das Unternehmen sich auf Details und nicht nur auf Zusammenfassungen konzentrieren muss; Ob die Antworten Zeitpunkte für manuelle Überprüfung enthalten sollten; Welche Regeln verwendet werden sollten, wenn Audio, Untertitel und Bilder kollidieren; Ob Batch-Aufgaben Kosten- und Dauerobergrenzen haben. Google plant, Funktionen in Gemini-Apps und YouTubes Ask YouTube einzuführen; derzeit kann die API-Verfügbarkeit nicht mit allen bereits aktiven Terminals gleichgesetzt werden.