ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
OpenAI 升级 GPT-6 提示词缓存:缓存输入 token 最高直降 90%

OpenAI 升级 GPT-6 提示词缓存:缓存输入 token 最高直降 90%

AI资讯 Admin 3 次浏览

2026 年 9 月 22 日,OpenAI 在官方博客发布《Better prompt caching for GPT-6》,为 GPT-6 系列推出改进的提示词缓存系统,以及一套帮开发者监控和诊断缓存表现的新工具。

先说这次到底变了什么。GPT-6 系列默认获得更高的缓存命中率:开发者在 30 分钟窗口内复用的合格共享前缀,可享受最高 90% 的缓存输入 token 折扣。OpenAI 同时上线了 Prompt Caching Dashboard,可以按时间追踪命中率,并用输入构成图对比缓存与未缓存 token 的比例,帮团队发现命中率下跌的原因。遇到意外的缓存未命中时,新的诊断工具能把某次请求和最近一次成功响应做对比,指出是模型、工具、设置还是输入变化导致无法复用,并估算受影响的 token 数量。

对 Agent 开发者最友好的两处改动

一是开发者可以显式设置缓存前缀断点,自己决定提示词中哪些部分参与缓存、缓存从哪里开始和结束;二是调整推理力度(reasoning effort)或增减可用工具,不再自动让之前的缓存上下文失效。官方解释是,GPT-6 的目标是支撑长时间运行的智能体——从重构代码库到产出调研文档,这类应用会连续发起多轮 API 请求,每轮都携带相同的指令、工具定义和上下文。缓存的本质,就是让这些重复发送的内容只算一次钱。

这笔账对谁最划算

OpenAI 引用了 GitHub 的数据:过去几个月里,缓存方面的改进让 GitHub Copilot 需要重新处理的 prompt token 占比下降超过 50%,响应也更快。对于跑多轮对话、文档处理流水线和 Agent 系统的团队,输入 token 本来就是成本大头,90% 的缓存折扣会直接压低账单。但也要注意边界:折扣只适用于 30 分钟窗口内的合格共享前缀,输出 token 不参与;如果你的应用是短提示词、单轮问答,能吃到的缓存红利很有限。想要真正省钱,还得配合 Dashboard 和诊断工具去优化提示词结构,而不是默认开启就万事大吉。

推荐工具

更多