ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
ThinkingBox est là : l'agent a dit terminé, la base de données a dit non

ThinkingBox est là : l'agent a dit terminé, la base de données a dit non

Informations sur l’IA • Admin • • 9 vues

ThinkingBox est un banc d'essai pour agents publié conjointement par Microsoft et Hugging Face le 3 octobre 2026, qui ne note pas ce que l'agent dit à la fin, mais uniquement ce qu'il laisse dans la base de données. Ses 507 flux métier avec état — environ une centaine chacun pour la vente au détail, l'assurance auto, le voyage, la néobanque et le support conseil — sont exécutés 20 fois chacun depuis un système propre. Un seul champ de ticket écrit avec une mauvaise valeur, et la tentative entière échoue.

L'état final fait office de bulletin

L'article s'ouvre sur un cas de support : l'agent a vérifié la commande, le suivi, le profil client et la politique de remboursement — neuf appels d'outils bien formés — puis a fermé le ticket comme résolu et annoncé à la cliente que tout était réglé. Pourtant, l'incident chez le transporteur était toujours ouvert, l'état final exigé était « en attente », et la vraie question de la cliente n'avait reçu aucune réponse. Noté sur les appels d'outils, il frôle la perfection ; noté sur l'état de la base, il échoue.

Cet écart n'est pas une anecdote. Sur 121 680 essais valides couvrant 12 modèles, 79 853 ont échoué aux contrôles exécutables. Parmi ces échecs, 67,24 % se terminaient proprement, avaient appelé un outil modifiant l'état et ne signalaient aucune erreur finale — les contrôles ont pourtant trouvé des valeurs de champs erronées dans 77,61 % des cas, des effets supplémentaires involontaires dans 43,30 % et des effets requis manquants dans 25,36 %. Le mode d'échec le plus fréquent n'est pas l'incohérence, mais l'écriture confiante d'un mauvais enregistrement, sans s'en apercevoir.

Réussir une fois et réussir à chaque fois sont deux choses différentes

Le classement en tentative unique a des airs familiers : Claude Opus 5.5 mène avec 67,16 %, Claude Opus 5 suit à 66,50 % et GPT-5.4 à 65,36 %. La vraie question de ThinkingBox est la seconde : répéter la même tâche 20 fois, et combien du score survit ?

Kimi-K3 affiche la couverture la plus large, résolvant 476 des 507 tâches au moins une fois, soit 93,89 % ; mais seules 68 tâches, 13,41 %, réussissent les 20 passages. Claude Opus 5 inverse le profil : moins de tâches résolues au moins une fois, mais 241 tâches réussies à chaque fois, soit 47,53 %. Le plus récent Opus 5.5 obtient un meilleur score en tentative unique et réussit exactement les mêmes 241 tâches sur les 20 passages — pas une de plus. GPT-6 Astra conserve 78 % de son taux initial, la meilleure rétention du lot. Un modèle plus récent qui relève la moyenne ne relève pas automatiquement la fiabilité.

La fiabilité a son propre prix

L'article chiffre aussi la fiabilité : le coût de la campagne complète de 20 passages divisé par le nombre de tâches réussies à tous les passages. GPT-5.4 est le moins cher à 6,80 dollars par tâche fiable, mais seulement 128 tâches franchissent la barre ; GPT-6 Astra coûte 7,45 dollars pour 231 tâches, Claude Opus 5.5 7,80 dollars pour 241. Le moyen le moins cher d'obtenir une bonne réponse n'est pas le moyen le moins cher d'en obtenir une fiable.

La répartition des échecs est tout aussi concrète : environ 79,9 % relèvent de la manipulation d'outils, les mauvaises mises à jour d'état 10,3 %, les réponses incomplètes 7,0 %, et l'absence totale d'action modifiant l'état seulement 2,9 %. La plupart des agents comprennent la tâche, puis trébuchent sur des erreurs d'outils, des préconditions non remplies ou des recherches vides. Trois leçons pour qui déploie des agents : vérifier l'état final avant de valider plutôt que de croire le résumé du modèle, classer les erreurs d'outils pour ne réessayer que les cas récupérables, et garder une approbation humaine pour les changements difficilement réversibles. ThinkingBox est désormais disponible via OpenEnv de Hugging Face : chaque équipe peut repasser ses propres flux à ce crible avant de parler de mise en production.

Outils Recommandés

Plus