Le 24 avril 2026, DeepSeek V4 a officiellement fait surface. Contrairement à il y a quelques heures, où il ne pouvait être jugé que sur la base de rumeurs médiatiques, l’organisation officielle Hugging Face de DeepSeek a désormais lancé DeepSeek-V4-Pro, DeepSeek-V4-Flash et le modèle de base correspondant, et la page officielle de prix de l’API apparaît également en même temps. Cela signifie que DeepSeek V4 n’est plus seulement une « rumeur à publier », mais est entré dans la phase de vérification publique.
L’objectif de cette version est clair : DeepSeek V4 met l’accent sur des contextes d’un million de tokens, la pondération open source, l’architecture MoE et des coûts d’inférence à long contexte plus faibles. Ce que cela signifie pour les développeurs n’est pas seulement « un autre modèle solide », mais aussi de nouvelles options pour une documentation longue, des bases de code, des flux de travail d’agents et des déploiements sur site/privatisés.
Deux gammes de produits : Pro et Flash
Selon la carte modèle officielle, la série DeepSeek V4 contient deux versions principales : DeepSeek-V4-Pro avec un paramètre total de 1,6T et un paramètre d’activation de 49B ; DeepSeek-V4-Flash avec un paramètre total de 284B et un paramètre d’activation de 13B. Les deux supportent une longueur de contexte de 1M et fournissent des poids de base et du modèle d’instructions.
Du point de vue du positionnement, Pro est la version phare, destinée aux tâches complexes d’inférence, de code, d’agents et de contextes longs ; Flash est plus orienté vers la vitesse et le coût, adapté aux questions et réponses classiques, au traitement par lots et aux applications sensibles à la latence. Les responsables ont également mentionné que V4-Pro-Max est le mode d’effort d’inférence le plus élevé de Pro, avec pour objectif d’élever la limite supérieure des tâches de connaissance, de code et d’agents dans les modèles open source.
Les prix et interfaces des API sont également synchronisés
La page officielle de tarification de l’API de DeepSeek liste déjà le modèle V4 : deepseek-v4-flash et deepseek-v4-pro utilisent tous deux https://api.deepseek.com comme URL de base du format OpenAI, et fournissent également une URL de base au format Anthropic. Les deux prennent en charge les modes de pensée et non, la sortie JSON, les appels d’outils, la complétion du préfixe de chat et la complétion FIM n’est disponible qu’en mode non-pensant.
En termes de prix, deepseek-v4-flash atteint 0,028 $ par million de mises cache de jetons d’entrée, 0,14 $ de manque cache et 0,28 $ de sortie ; deepseek-v4-pro correspond à 0,145 $, 1,74 $ et 3,48 $. Les anciens noms deepseek-chat et deepseek-reasoner seront dépréciés à l’avenir, mais pour des raisons de compatibilité, ils correspondent respectivement au mode non-pensant et au mode pensant de deepseek-v4-flash.
Points forts techniques : Les coûts à long contexte diminuent
La carte modèle DeepSeek V4 met l’accent sur l’efficacité en contexte long avec des mises à jour de base. Officiellement, la V4 utilise une architecture d’attention mixte, combinant une attention clairsemée compressée et une attention fortement compressée. Dans le contexte des jetons 1M, DeepSeek-V4-Pro ne nécessite que 27 % de FLOPs d’inférence à un seul jeton et 10 % de cache KV comparé à DeepSeek-V3.2.
C’est crucial pour les applications réelles. Par le passé, des millions de contextes semblaient souvent forts, mais le coût, la mémoire et la latence rendent son utilisation normale difficile. Si l’efficacité à long contexte de V4 est cohérente dans les déploiements communautaires et les API cloud, cela impactera directement la compréhension des dépôts de code, la revue des contrats juridiques, la compilation de recherches scientifiques, la base de connaissances d’entreprise et les tâches multi-tours d’agents.
Que regarder maintenant
La chose la plus remarquable de la sortie de DeepSeek V4 cette fois-ci n’est pas le numéro unique de liste, mais la combinaison de « poids ouvert + disponibilité API + 1M de contexte + cache à faible prix ». Pour les développeurs nationaux, cela continuera à piloter l’adaptation des puces IA nationales et des frameworks d’inférence ; pour la communauté open source mondiale, V4-Pro et V4-Flash deviendront de nouveaux benchmarks pour l’évaluation, la quantification, le déploiement et l’accès au cadre d’agent.
Cependant, il reste nécessaire de rester prudent lors de l’atterrissage : lors de la sortie du grand modèle, les scores de fonctionnement tiers, le débit réel, la stabilité des appels d’outils et l’adaptation de différents cadres d’inférence doivent encore être vérifiés. En production, vous pouvez d’abord effectuer des tests A/B, sans remplacer directement les modèles existants uniquement sur la base de l’échelle des paramètres.
Source de l’information : carte officielle modèle DeepSeek-V4-Pro, page officielle d’organisation Hugging Face de DeepSeek, page modèle API DeepSeek et prix : lien officiel de publication du compte public DeepSeek.