Le cache d’invite Claude d’Hermes Agent n’est pas « toutes les conversations sont automatiquement à moitié prix ». Il met principalement en cache du contenu stable avec préfixes tels que les prompts système, les compétences, les souvenirs et les contextes répétitifs ; Si vous changez fréquemment de modèle, de fournisseur, de profil, ou que vous chargez de nouveaux fichiers volumineux à chaque tour, les avantages du cache diminueront.
La description officielle de la v0.14 mentionne qu’Hermes Agent ajoute un cache de préfixe inter-session d’une heure à Claude sur les chemins Anthropic, OpenRouter et Nous Portal. L’accent est mis sur le « préfixe » : plus le contenu stable du paragraphe précédent est cohérent, plus il est facile à atteindre ; Les nouvelles entrées et résultats d’outils ultérieurs seront toujours facturés normalement.
Pourquoi vous sentez-vous inconscient
- Il n’y a pas de cache chaud au premier moment, et la première manche n’est généralement pas donnée immédiatement.
- J’ai changé le profil, les compétences et le contenu de la mémoire, et le préfixe a changé.
- En passant d’Anthropic à OpenRouter ou Nous Portal, les liens de cache ne sont pas nécessairement partagés.
- Téléchargez de nouveaux fichiers et collez de nouveaux journaux à chaque fois, et le principal coût vient du nouveau contenu.
- Le modèle ou le fournisseur lui-même n’est pas exposé aux réductions cache, comme on pourrait s’y attendre.
Ne considérez donc pas le cache d’invitation comme un switch universel pour économiser de l’argent, c’est plutôt comme un « accélérateur lorsqu’on utilise le même ensemble de contextes de travail pendant longtemps ».
Comment améliorer le taux de réussite
L’approche la plus efficace consiste à réduire le jitter contextuel dénué de sens : utiliser régulièrement le même fournisseur Claude ; Ne modifiez pas les invites système ni de grandes parties de mémoire à chaque tour ; Mettre les règles du projet dans des fichiers fixes ou des compétences ; Les gros fichiers ne sont relus que lorsque cela est nécessaire ; Les tâches courtes utilisent des conversations ordinaires, tandis que les tâches longues rendent le cache plus précieux.
Si vous faites principalement des Q&A ponctuelles, les revenus de caches sont limités ; Si vous travaillez avec la même base de code, le même ensemble de compétences et le même profil chaque jour, une heure de cache inter-sessions est plus facile à refléter. Si vous souhaitez vérifier les limites des fonctionnalités, vous pouvez consulter la version officielle du dépôt Hermes Agent :https://github.com/NousResearch/hermes-agent.