Hermes Agent 的 Claude prompt cache 不是“所有对话都自动半价”。它主要缓存稳定的前缀内容,比如系统提示、技能、记忆和重复上下文;如果你频繁换模型、换 provider、换 profile,或者每轮都塞全新的大文件,缓存收益就会变小。
v0.14 官方说明里提到,Hermes Agent 对 Claude 在 Anthropic、OpenRouter、Nous Portal 路径上加入跨会话 1 小时 prompt prefix cache。重点是“prefix”:前面那段稳定内容越一致,越容易命中;后面用户新输入和工具结果变化大,仍然会正常计费。
为什么你感觉没省
- 刚开始用时还没有热缓存,第一轮通常不会立刻便宜。
- 换了 profile、skills、memory 内容,前缀发生变化。
- 从 Anthropic 切到 OpenRouter 或 Nous Portal,缓存链路不一定共享。
- 每次都上传新文件、贴新日志,主要成本来自新内容。
- 模型或 provider 本身没有按你预期暴露缓存折扣。
所以不要把 prompt cache 当成万能省钱开关,它更像“长期用同一套工作上下文时的加速器”。
怎么提高命中率
最有效的做法是减少无意义的上下文抖动:稳定使用同一个 Claude provider;不要每轮修改 system prompt 或大段记忆;把项目规则放进固定文件或 skill;大文件只在必要时重新读取;短任务用普通会话,长任务再让缓存发挥价值。
如果你主要是一次性问答,缓存收益有限;如果你每天围绕同一个代码库、同一套 skills、同一个 profile 工作,1 小时跨会话缓存才更容易体现出来。想确认功能边界,可以查看 Hermes Agent 官方仓库 release:https://github.com/NousResearch/hermes-agent。