Le Jev 1,13 de TypeSafe AI facture par jeton d’entrée, avec un prix officiel actuel de 0,042 $ par million de jetons d’entrée, soit 42 $ par milliard de jetons ; Les jetons de sortie sont gratuits. La facturation réelle dépend de l’état, de la description du problème et des critères candidats pour l’utilisation des entrées, et non simplement du nombre de questions ou des options de retour.
Ces informations sur les prix peuvent encore être ajustées, surtout que le produit est actuellement en disponibilité anticipée. Lors du budgétisation, vous devriez lire l’utilisation des consoles et la dernière page officielle du modèle, plutôt que de simplement inscrire les prix de lancement dans la configuration professionnelle.
Quel contenu est inclus dans l’entrée
L’état, les questions, les instructions et les critères d’une seule requête sont tous des entrées que le modèle doit traiter. JEV évalue plusieurs questions en parallèle pour le même état, donc fusionner les questions liées en une seule requête est généralement plus économique que d’envoyer le même état à répétition. Aucun frais de sortie supplémentaire n’est facturé pour la sélection, la probabilité et la confiance en sortie.
Un algorithme de coût simple
Pour estimer les coûts mensuels, vous pouvez dire : « Total des jetons mensuels d’entrée × 0,042 ÷ 1 000 000 ». Par exemple, si le système traite un grand nombre de commandes courtes chaque jour, l’impact réel sur le coût est la longueur totale de chaque ordre de travail ainsi que la norme du problème. Ne supprimez pas les conditions limites nécessaires juste pour économiser de l’argent ; Priorisez la suppression des champs doublés, du bruit des logs et du contenu historique sans rapport avec le jugement.
Quelles limites restent disponibles pour le modèle actuel ?
- Dans JEV 1.13, la limite totale de contexte par requête est de 64k tokens.
- L’État plus la question unique maximale est limitée à 32k jetons.
- La page officielle du modèle indique actuellement un plafond de 250 000 jetons par seconde et 1 200 requêtes par minute.
- Dépasser la limite de taux donne 429 ; le SDK officiel évite par défaut les réessais et suit la réévaluation après la réutilisation.
La déclaration officielle précise également que les limites de taux lors de l’accès anticipé seront ajustées dynamiquement, et que les entreprises et les plans personnalisés pourront demander des plafonds plus élevés. Les systèmes de production ne doivent pas supposer que les limites restent permanentes ; la concurrence, les files d’attente et les paramètres de réévaluation doivent être configurés en conséquence.
Comment contrôler simultanément le coût et la latence
- Premièrement, filtrez les documents non pertinents du code pour éviter d’entasser tout le fichier historique dans l’État.
- Les problèmes atomiques partageant le même état sont fusionnés et envoyés pour réduire les entrées en double.
- Mettez en cache les résultats de prétraitement des données stables, mais ne mettez pas en cache les jugements commerciaux obsolètes.
- Enregistre les jetons, les délais et les taux de vérification manuelle pour chaque type de requête, en calculant la valeur par flux de travail.
- Retour aux tests avec une version fixe avant de mettre à niveau le
jev-latestpour éviter une défaillance silencieuse au seuil.
Un faible prix unitaire ne signifie pas que chaque tâche doit appeler le modèle. Les étapes pouvant être réalisées précisément avec regex, requêtes de base de données ou code classique doivent se poursuivre avec le code ; Seules les étapes nécessitant un jugement sémantique doivent être confiées à JEV, ce qui améliore le coût et la fiabilité.