2026년 9월 22일, OpenAI는 공식 블로그 글 'Better prompt caching for GPT-6'을 통해 GPT-6 시리즈를 위한 개선된 프롬프트 캐싱 시스템과 캐시 성능을 모니터링·진단하는 새 도구를 발표했다.
먼저 실제로 무엇이 바뀌었는지 정리하자. GPT-6 시리즈는 기본 캐시 적중률이 높아졌고, 30분 윈도우 안에서 재사용된 적격 공유 프리픽스에 대해 캐시된 입력 토큰을 최대 90% 할인받을 수 있다. OpenAI는 함께 'Prompt Caching Dashboard'도 공개했다. 적중률 추이를 추적하고, 입력 구성 차트로 캐시된 토큰과 캐시되지 않은 토큰을 비교해 적중률 하락 원인을 찾는 데 도움을 준다. 예상치 못한 캐시 미스가 발생하면 새 진단 도구가 해당 요청과 최근 성공 응답을 비교해 모델·도구·설정·입력 중 무엇이 재사용을 막았는지 짚어주고, 영향을 받은 토큰 수 추정치도 보여준다.
에이전트 개발자에게 가장 반가운 두 가지 변화
첫째, 캐시 프리픽스 중단점(breakpoint)을 명시적으로 지정할 수 있게 됐다. 프롬프트의 어느 부분을 캐시하고, 캐시 구간을 어디서 시작해 어디서 끝낼지를 개발자가 직접 정할 수 있다. 둘째, 추론 강도(reasoning effort)를 바꾸거나 사용 도구를 늘리고 줄여도 이전에 캐시된 컨텍스트가 자동으로 무효화되지 않는다. OpenAI의 설명에 따르면 GPT-6는 장시간 동작하는 에이전트를 염두에 두고 설계됐다. 코드베이스 리팩터링부터 조사 문서 작성까지, 이런 애플리케이션은 동일한 지시·도구 정의·컨텍스트를 실은 API 요청을 연속으로 보낸다. 캐싱이란 결국 반복 전송되는 내용에 대한 비용을 한 번만 지불하게 만드는 장치다.
계산이 가장 유리해지는 쪽은
OpenAI는 GitHub의 데이터를 인용했다. 지난 몇 달간 캐싱 개선으로 수십억 건의 요청 중 새로 처리해야 하는 프롬프트 토큰 비중이 50% 이상 줄었고, Copilot의 응답 속도도 빨라졌다는 것이다. 멀티턴 대화, 문서 처리 파이프라인, 에이전트 시스템을 운영하는 팀에게 입력 토큰은 원래 비용의 대부분을 차지한다. 캐시 읽기에 대한 90% 할인은 청구서에 직접 반영된다. 다만 경계도 분명하다. 할인은 30분 윈도우 안의 적격 공유 프리픽스에만 적용되고, 출력 토큰은 제외된다. 짧은 프롬프트의 단발성 Q&A 앱이라면 캐시로 얻을 수 있는 이득은 제한적이다. 진짜로 아끼려면 대시보드와 진단 도구로 프롬프트 구조를 최적화해야 한다. 켜기만 한다고 다 해결되지는 않는다.