L’IA « zéro hallucination » de TypeSafe fait référence au fait que Jev ne retourne pas de contenu en dehors du type prédéfini, ce qui ne signifie pas que tous les jugements commerciaux sont 100 % corrects. Choice ne crée pas l’option 256 à partir de rien, et Score ne donne pas de note invalide, mais il peut tout de même sélectionner la mauvaise option parmi les options légitimes. Lors du lancement, le risque doit être contrôlé à l’aide de probabilités, de confiance, de jeux de tests et de revue manuelle.
Qu’est-ce qui peut être garanti ?
L’espace de réponse de Jev est prédéfini par les requêtes, donc les programmes n’ont pas à s’inquiéter de recevoir soudainement un chat non résolu, un nom fictif d’outil ou un type de champ d’erreur. La description officielle des « erreurs sans saisie » est une garantie structurelle, résolvant les erreurs d’analyse syntaxique courantes et les problèmes de sortie hors limites dans les systèmes automatisés.
Et qu’est-ce qui ne peut pas être garanti ?
Le modèle peut encore mal comprendre des instructions ambiguës, ignorer des relations indirectes ou être distrait par de longues informations sans importance. Les faiblesses officielles listées par Jev 1.13 incluent le comptage précis, les mathématiques, la comparaison des dates, le raisonnement indirect complexe, le contenu adversarial et les normes de conflit. La structure correcte, les faits corrects et le jugement correct sont trois choses différentes.
| Le résultat | Si le type est légal | Déterminer la fiabilité |
|---|---|---|
| Facturation de retour à partir de facturation et technique | Juridique | Cela dépend toujours du contenu de l’actualité et de la probabilité |
| Retourne legal_team indéfini | Illégal | La contrainte de type de JEV la bloquera |
| Les remboursements automatiques sont toujours disponibles lorsque la confiance est faible | Les exportations peuvent être légales | Les stratégies commerciales sont peu sûres |
Comment la confiance devrait-elle être utilisée ?
Choix et Score rendent des distributions de probabilité et offrent une confiance de 0 à 1 ; Noul retourne directement la probabilité de « oui » sans confiance supplémentaire. Il n’existe pas de réponse universelle au seuil ; il doit être fixé en fonction du coût d’une erreur de jugement : les recommandations de contenu peuvent être relativement indulgentes, tandis que les remboursements, interdictions et détournements médicaux devraient être plus prudents.
Le système peut être conçu en trois étapes : exécution automatique à haute confiance, zones intermédiaires envoyées pour vérification manuelle, et rejet à faible confiance d’une action automatique ou du passage à un chemin sûr. Les seuils doivent être débogés à l’aide d’échantillons réels et ne peuvent pas être copiés directement à partir des numéros de démonstration.
Quatre façons de réduire les erreurs de jugement
- Chaque question n’exprime qu’un seul jugement, et les conditions aux limites sont inscrites dans les critères.
- D’abord, filtrez le contexte non pertinent, en n’envoyant que l’état nécessaire pour prendre la décision.
- Les mathématiques, le comptage, la date et les règles d’autorisation sont gérées avec du code déterministe.
- Une version fixe du modèle est établie comme un ensemble de régression, et les distributions d’erreurs ainsi que les seuils sont comparés avant la mise à jour.
Ainsi, « aucune illusion » peut être comprise comme des sorties qui ne franchissent pas les frontières de type, plutôt que comme le modèle qui gagne la capacité de ne jamais faire d’erreurs. Ce n’est qu’en écrivant cette frontière dans l’architecture que TypeSafe peut réellement améliorer la fiabilité de l’automatisation.