La consommation de jetons Hermes Agent est soudainement élevée, donc ne blâmez pas le modèle pour son coût. Récemment, ce problème s’est beaucoup concentré dans la communauté, et les déclencheurs courants sont : trop d’appels d’outils, des contextes trop longs, une mémoire hybride qui extrait des informations, et pas de routage bon marché des modèles. Lors de l’enquête, il est nécessaire de localiser d’abord quel type brûle.
Séquence d’enquête la plus rapide
- Utilisez
/usagepour observer d’abord la tendance approximative de la consommation. - Exécutez
/compresspour de longues conversations d’abord, ne gardez pas le contexte indéfiniment. - Si vous activez la mémoire hybride Honcho, coupez temporairement la mémoire locale pour comparaison.
- Lorsqu’il y a de nombreuses questions et réponses simples, pensez à activer
smart_model_routing. - Réparez l’outil s’il lâche à plusieurs reprises, et ne laissez pas l’agent réessayer.
La question du coût doit être démontée : le prix modèle en fait partie, et les tentatives ratées ainsi que les contextes longs sont les factures invisibles les plus faciles à ignorer.
En un mot : regardez d’abord /usage et context, puis consultez Honcho et l’outil pour réessayer, et enfin changez le modèle.
Adresse officielle open source : https://github.com/NousResearch/hermes-agent ; Entrée officielle du document : https://hermes-agent.nousresearch.com/.