ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
DeepSeek V4 Flash Vision ouvre des poids : les agents multimodaux passent à un déploiement sur site

DeepSeek V4 Flash Vision ouvre des poids : les agents multimodaux passent à un déploiement sur site

Informations sur l’IA Admin 0 vues

Le 31 août 2026, DeepSeek a lancé des poids ouverts DeepSeek-V4-Flash-Vision-Exp sur l’organisation officielle de Hugging Face, deepseek-ai. Le dépôt de modèles a été créé à 06:16 (UTC) le même jour, utilisant la licence MIT, fournissant des fichiers modèles, des tokenizeurs, des références d’encodage d’invites et des implémentations d’inférence PyTorch minimisées. Ce n’est pas une répétition de l’annonce de lancement de l’API du 21 août : auparavant, la capacité d’appel basée sur le cloud était traitée, mais cette fois les poids et le code de référence clé sont remis aux développeurs.

D’une « interface de diagramme » à un asset de modèle inspectable

La carte officielle montre que le modèle possède environ 305 milliards de paramètres, maintenant un niveau proche de DeepSeek-V4-Flash-0731 pour les tâches purement d’agent textuel, tout en intégrant une compréhension visuelle. Il peut placer des images, des graphiques, des interfaces logicielles et des commandes textuelles dans la même chaîne de tâches, adaptés aux opérations web, à l’analyse de graphiques, au dépannage de captures d’écran et à la vérification qualité visuelle. Pour comprendre l’étape précédente des capacités de l’API, vous pouvez vous référer à l’interprétation de lancement DeepSeek-V4-Flash-Vision-Exp.

Dans les autotests de DeepSeek, ApexBench Pass@1 progressé de 26,2 dans la version texte à 36,5, a obtenu 64,3 en Chartography, et 35,0 en ZeroBench Pass@5. Il a également obtenu 83,9 dans Terminal Bench 2.1 et 59,3 dans DeepSWE. Cependant, ces chiffres proviennent de cartes modèles officielles et ne peuvent pas être directement assimilés à la stabilité de toutes les opérations commerciales réelles.

Les poids ouverts ne sont pas la même chose qu’utiliser un ordinateur classique dès la sortie de la boîte

Pour l’équipe, la valeur réside dans la vérification des points, l’ajustement fin, et la construction d’agents contrôlés autour de captures d’écran privées et d’interfaces internes ; La limitation est que le seuil de déploiement reste élevé. 305 milliards de paramètres signifient que le stockage en poids, la VRAM, les cadres d’inférence et la communication multi-cartes ne sont pas facilement gérés par des ordinateurs grand public, et le code d’inférence minimal dans l’entrepôt n’est pas un produit prêt à l’emploi.

Ainsi, cette ouverture ressemble davantage à la transmission de la base de recherche pour les agents multimodaux aux fournisseurs cloud, aux équipes de cadres d’inférence et aux entreprises de puissance de calcul. À court terme, les développeurs de petites et moyennes dimensions restent encore aptes à utiliser d’abord des tâches de vérification API avant de décider s’ils veulent utiliser la quantification, l’inférence managée ou des clusters privés. Ce qui mérite vraiment de l’attention n’est pas la « téléchargeabilité du modèle », mais la transition des agents visuels d’interfaces fermées vers des actifs d’ingénierie inspectables et transitoires.

Outils Recommandés

Plus