Hermes Agent token 消耗突然很高,先别只怪模型贵。最近社区里这个问题非常集中,常见触发点是:工具调用太多、上下文太长、hybrid memory 额外拉取信息、没有开便宜模型路由。排查时要先定位是哪一类在烧。
最快排查顺序
- 先用
/usage看大概消耗趋势。 - 长对话先执行
/compress,别无限堆上下文。 - 如果你开了 Honcho hybrid memory,临时切成本地记忆做一次对比。
- 简单问答多时,考虑开启
smart_model_routing。 - 工具反复失败时先修工具,不要让 agent 一直重试。
成本问题要拆开看:模型贵是一部分,失败重试和长上下文才是最容易被忽略的隐形账单。
一句话:先看 /usage 和上下文,再看 Honcho 与工具重试,最后才是换模型。
官方开源地址:https://github.com/NousResearch/hermes-agent;官方文档入口:https://hermes-agent.nousresearch.com/。