Ultrafast API 是 OpenAI 今年 8 月随 GPT-5.6 Sol 推出的极速推理档位,官方宣称输出速度最高可达每秒 750 个 token,是标准档的 14 倍。9 月 26 日,多位开发者在 OpenAI Platform 与 API 文档中发现了 Ultrafast 相关文档;爆料者 @imjustnewatai 在 X 上贴出的截图显示,“Ultrafast”已出现在云端智能体(cloud agent)API 文档中。与此同时,TestingCatalog 发现 Responses API Playground 正在准备一个隐藏的速度选择器,开发者可在 Standard、Fast、Ultrafast 三档之间切换——该功能目前仍处于隐藏状态。
这不是新模型,而是一个“速度档位”
Ultrafast 并不是一个新模型,而是一个服务档位。OpenAI 的 API 此前已经有 Standard 和 Fast 两档(Fast 档有公开文档,开发者可在请求中设置 service_tier: "fast"),Ultrafast 是第三档,也是最快的一档。它跑在 Cerebras 的基础设施上——OpenAI 今年早些时候宣布了与 Cerebras 的 750MW 算力合作,容量将分阶段在 2028 年前上线。目前 Ultrafast 只向部分客户开放,GPT-5.6 Sol 是唯一确认支持的模型。
对开发者意味着什么
对开发者来说,最直接的变化是延迟可以按档购买。客服对话、实时语音、代码补全、交易风控这类对响应时间敏感的场景,过去往往被迫在“用小模型换速度”和“用大模型忍延迟”之间二选一;三档并存之后,团队可以按每个工作负载的价值来选择延迟,把高成本推理留给真正影响收入或体验的链路。速度档位化也等于把“延迟”变成了 API 经济学里的一等公民——应用架构开始需要为延迟做预算。
三个待确认的悬念
第一,9 月 29 日就是 OpenAI DevDay,从时间点看,在会上宣布扩围并非不可能,但官方尚未确认。第二,GPT-6 系列(Sol、Astra)是否支持 Ultrafast,目前也没有人能确认。第三,定价——极速档的溢价会是多少,OpenAI 至今没有透露。
文档和 Playground 开关同时出现,说明这不是一次偶然的“误上线”,而是有节奏的预热。对开发者而言,真正要准备的不是等一个开关打开,而是开始给自己的应用做延迟预算:哪些链路值得为毫秒付费,哪些不值得。答案要在 9 月 29 日的 DevDay 揭晓,在此之前,这仍是一次未经官方确认的爆料。