Le 1er septembre 2026, Google DeepMind a annoncé sur son blog officiel les capacités intelligentes d’apprentissage des vidéos émulatives de Gemini, le premier lot couvrant Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. Le changement n’est pas seulement que « les modèles peuvent regarder des vidéos », mais aussi qu’il n’est plus nécessaire d’introduire un grand nombre d’images non pertinentes dans leur contexte à un taux d’images fixe.
Il ne s’agit pas de « regarder quelques images de plus », mais de décider où regarder en premier
L’analyse vidéo traditionnelle extrait généralement des images à un taux fixe, tandis que le traitement statique par défaut de l’API Gemini est 1 image par seconde. Lorsqu’il s’agit de tutoriels longs, de cours ou d’heures d’enregistrement, cette approche consomme soit un grand nombre de jetons, soit manque de brèves actions en raison de la densité d’échantillonnage réduite.
De nouvelles capacités combinent le raisonnement avec des outils vidéo natifs. Le modèle recherche, scanne et rejoue dynamiquement des extraits autour du problème, sélectionnant les signaux désirés parmi les visuels, l’audio et le texte transcrit. Lorsqu’on localise des changements en une seconde, il peut améliorer les taux d’échantillonnage locaux ; lors de la recherche d’une phrase clé, il ne nécessite pas de lire l’intégralité du clip paragraphe par paragraphe. C’est aussi la différence entre les agents IA et les flux de travail fixes : le modèle commence à décider quel outil appeler ensuite.
« Économiser jusqu’à 88 % de jetons » ne peut pas être considéré comme une remise fixe
Le benchmark standard d’analyse vidéo de Google montre qu’après l’activation, la consommation de tokens chute jusqu’à 88 %, les coûts d’analyse jusqu’à 66 %, et la précision s’améliore jusqu’à 7 %. Tous ces chiffres ont la « plupart » des conditions et proviennent de modèles spécifiques, de durées vidéo et de types de problèmes, et ne peuvent pas être appliqués directement à toutes les entreprises. Une approche plus fiable consiste à utiliser vos propres collections vidéo et requêtes pour les tests A/B, tout en enregistrant les jetons, la latence, le rappel et la mauvaise localisation.
Officiellement, Gemini 3.7 Flash offre une meilleure combinaison de précision et de coût dans le modèle de test ; Les courtes vidéos ou tâches nécessitant seulement un résumé approximatif peuvent ne pas apporter les mêmes avantages. Les avantages sont plus susceptibles de résider dans l’action rapide, la détection d’anomalies, le comptage précis et la recherche sur plusieurs heures. Pour les limites de capacités associées, veuillez consulter le « Résumé d’utilisation pratique du modèle multimodal » du site.
Les développeurs doivent effectuer quatre vérifications avant la connexion
Cette fonctionnalité permet de télécharger des vidéos et des vidéos YouTube, avec des points d’entrée incluant l’API Gemini de Google AI Studio et la plateforme Gemini Enterprise Agent. En réglant le mode de traitement vidéo en agent, cela permet ; aucun frais de fonctionnalité supplémentaire n’est facturé, mais il est toujours facturé comme un jeton API classique.
Avant le lancement, vérifiez si l’entreprise doit se concentrer sur les détails plutôt que sur un simple résumé ; Si les réponses doivent inclure des points temporels pour une révision manuelle ; Quelles règles doivent être utilisées lorsque l’audio, les sous-titres et les visuels entrent en conflit ; Si les tâches en lots ont des plafonds de coût et de durée. Google prévoit d’apporter des fonctionnalités aux applications Gemini et à Ask YouTube de YouTube ; actuellement, la disponibilité des API ne peut pas être assimilée à tous les terminaux déjà actifs.