ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Nouvelle critique de DeepSeek V4.1 Flash : Le coût des tâches de code est d’environ un quinzième de celui d’Astra

Nouvelle critique de DeepSeek V4.1 Flash : Le coût des tâches de code est d’environ un quinzième de celui d’Astra

Informations sur l’IA Admin 3 vues

Le 14 septembre 2026, la plateforme d’inférence IA Fireworks AI a publié une critique de DeepSeek V4.1 Flash. Dans ses tâches de code DeepSWE, le modèle a obtenu un score maximal de 74,34 %, avec un coût moyen de 0,430 $ par tâche ; GPT-6 Astra a obtenu 74,12 % dans la fourchette d’inférence xhigh, soit un coût de 6,524 $. Sur la base de ces résultats, le coût d’une tâche pour la première est d’environ un quinzième de celui de la seconde, mais il ne s’agit que d’une comparaison basée sur des plateformes et benchmarks spécifiques, même si tous les scénarios de développement ne conservent pas le même écart.

À quel point les résultats des quatre modèles sont-ils proches ?

ModèlePartitions DeepSWECoût par tâche
DeepSeek V4.1 Flash74.34%0,430 $
GPT-6 Astra xhigh74.12%6,524 $
Gemini 3.8 Flash73.83%2 362 $
Claude Opus 573.65%11 838 $

Fireworks souligne également que DeepSWE fluctue d’environ 1,4 à 3,2 points de pourcentage par exécution, tandis que les scores les plus élevés des quatre modèles ne diffèrent que de 0,69 point de pourcentage. Par conséquent, ce tableau ne suffit pas à déclarer qui est absolument supérieur en termes de capacités de code ; Il illustre mieux que lorsque la qualité est dans une fourchette similaire, le coût d’inférence devient une variable clé dans les décisions de routage et d’approvisionnement.

D’où vient le bas coût ?

DeepSeek V4.1 Flash utilise une architecture hybride expert avec 552 milliards de paramètres, activant environ 8 milliards de paramètres par jeton lors de l’entrée et environ 16 milliards de paramètres en sortie. DeepSWE est une autre tâche typique à forte intensité en entrée : chaque tâche gère environ 36,9 millions de jetons d’entrée et 211 000 jetons de sortie en moyenne, soit un ratio d’environ 174:1, avec 99,6 % des correspondances d’entrée dans le cache. La répartition de la facturation de Fireworks montre que l’entrée du cache représente environ 59,9 % du coût total et la sortie environ 32,5 %. Cela signifie que l’architecture du modèle, la tarification du cache et la forme de la charge de travail ensemble produisent des résultats, qui ne peuvent pas être expliqués uniquement par les paramètres totaux.

En regardant les benchmarks croisés, les conclusions ne sont pas les mêmes

Dans Terminal Bench 2.1, DeepSeek V4.1 Flash a obtenu 86,5 %, Astra 87,5 %, et Fireworks a rapporté une différence de coût totale d’environ 12 fois ; Mais dans Humanity’s Last Exam, les deux scores étaient respectivement de 34,52 % et 50,40 %, montrant un écart clair de capacité. Le rapport propose également une limite supérieure théorique de 54,80 % pour le « Routage Oracle », en supposant le résultat idéal de toujours choisir le bon modèle, ce qui peut ne pas être possible sur de vrais routeurs.

Comment les entreprises doivent-elles utiliser ces données ?

Une approche plus sûre consiste à effectuer des retests à petite échelle en utilisant votre base de code, la longueur du contexte, le taux de réussite du cache et les règles de réévaluation des échecs, tout en enregistrant les taux d’achèvement, le temps de retravail manuel, les délais et la facturation finale. Saisir des tâches très répétitives de revue de code ou de compréhension en entrepôt peut faciliter l’obtention de bonus de cache ; Les tâches nécessitant une inférence difficile ou de faibles résultats au cache peuvent avoir des courbes de coût complètement différentes. L’intérêt de cette évaluation n’est pas de sélectionner un modèle unique pour l’entreprise, mais de montrer que le routage multi-modèles doit prendre en compte à la fois les intervalles de qualité et les coûts totaux réels.

Outils Recommandés

Plus