ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
OpenRouter 推出 Batch API:批量推理半价,实测中位数 7 分钟完工

OpenRouter 推出 Batch API:批量推理半价,实测中位数 7 分钟完工

AI资讯 Admin 5 次浏览

2026年9月22日,AI 模型 API 聚合平台 OpenRouter 在官方博客宣布推出 Batch API:把一批请求打包提交,供应商在 24 小时窗口内自行安排执行时间,作为交换,价格通常降到标准按 token 计费的 50%,部分模型甚至更低。上线首日已支持 70 多个模型。

半价换的是什么:确定性

Batch API 的核心交易很直白:你放弃"立刻出结果",供应商获得"错峰调度"的自由。调用方式是向 api/v1/batches POST 请求列表,并指定 endpoint 形状——聊天补全、responses、messages、embedding 四种都支持。提交后轮询批次状态,直到 completed、failed、expired 或 cancelled,结果内联返回。

和 OpenAI 的 Batch API 思路一致,但 OpenRouter 的版本有两个差异点:第一,路由默认选择"在用户允许列表、数据政策和 BYOK 设置之下最便宜的批量端点",单个批次固定走一个供应商;第二,每个请求的结果独立返回,几条坏数据不会拖垮整批任务。输入和结果保留 30 天,也可随时 DELETE 删除。

两周 beta 数据:比想象中快,但要看时段

OpenRouter 公布了超过 23 万个批次的两周 beta 数据:中位数 7 分钟完工,90% 在 1 小时内完成。也就是说,绝大多数情况下你根本等不到 24 小时。

但时段影响明显:太平洋时间凌晨 5 点到中午提交的批次显著更慢,最慢的十分之一要 2 到 4.5 小时;其他时段 90 分位线压到 1.1 小时以内,太平洋时间下午 6 点之后则不到 50 分钟。批量大小的影响反而较小:1000 条以上的请求,中位数 12 到 21 分钟完工。

哪些任务适合,哪些不适合

适合:语料打标、embedding 回填、评测集打分、工单积压摘要、同一 prompt 跑几千行数据——一切"可以等一晚"的工作负载。

不适合:实时对话、需要音频或视频输入的任务(批量暂不支持)、依赖 OpenRouter 网页搜索插件的请求(搜索调用按标准费率计费,且插件本身不支持批量);图片和文件输入必须是公开 URL。

对 API 成本结构的意义

Batch API 把"延迟"正式变成了可交易的商品。对独立开发者和小团队,这意味着评测、数据处理这类过去因为贵而不敢大规模跑的任务,现在有了官方的固定五折通道。代价是工作流要改成异步:提交—轮询—收结果,不再是请求—响应的一次往返。能接受这个改写的团队,推理账单会直接少一半。

推荐工具

更多