TypeSafe AI 的 Jev 1.13 按输入 Token 收费,官方当前标价为每百万输入 Token 0.042 美元,也就是每十亿 Token 42 美元;输出 Token 免费。实际账单取决于 state、问题说明和候选标准占用的输入量,不是按问题数量或返回选项数量简单计次。
这项价格信息仍可能调整,尤其产品目前处在早期开放阶段。做预算时应读取控制台用量和最新官方模型页,而不是把首发价格写死进业务配置。
哪些内容会计入输入
一次请求中的 state、questions、instructions 和 criteria 都属于模型要处理的输入。Jev 会对同一 state 并行评估多个问题,因此把相关问题合并到一次请求,通常比重复发送相同 state 更省。输出的选择、概率和 confidence 不另收输出费。
一个简单的成本算法
估算月成本可用“每月输入 Token 总量 × 0.042 ÷ 1,000,000”。例如系统每天处理大量短工单,真正影响费用的是每条工单连同问题标准的总输入长度。不要为了省钱删除必要边界条件;应优先去掉重复字段、日志噪声和与判断无关的历史内容。
当前模型还有哪些限额
- Jev 1.13 每个请求总上下文上限为 64k Token。
- state 加最长单个问题还有 32k Token 限制。
- 官方模型页当前列出的速率上限为每秒 250,000 Token、每分钟 1,200 次请求。
- 超过速率限制会返回 429;官方 SDK 默认退避重试并遵循 retry-after。
官方同时说明,早期访问阶段的速率限制会动态调整,企业和定制计划可申请更高上限。生产系统不要假设限额永久不变,应把并发、队列和重试参数做成配置。
怎样同时控制成本和延迟
- 先在代码中筛掉不相关记录,避免把整份历史档案塞入 state。
- 把共享同一状态的原子问题合并发送,减少重复输入。
- 缓存稳定资料的预处理结果,但不要缓存已经过时的业务判断。
- 记录每类请求的 Token、延迟和人工复核率,按工作流核算价值。
- 用固定版本回归测试后再升级
jev-latest,避免阈值悄然失效。
低单价不等于每个任务都应该调用模型。能用正则、数据库查询或普通代码精确完成的步骤,继续用代码;只有需要语义判断的环节才交给 Jev,成本与可靠性都会更好。