ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Prime Inference 上线:给前沿开源模型做推理服务,拼的是稳定性

Prime Inference 上线:给前沿开源模型做推理服务,拼的是稳定性

AI资讯 • Admin • • 9 次浏览

Prime Inference 于2026年10月2日由 Prime Intellect 正式发布,是一项面向前沿开源模型的推理服务。它在多个数据中心以自有 GPU 基础设施提供无服务器端点和预留容量两种形态,带有生产级 SLA、安全与隐私设计、统一计费和团队级用量追踪,支持跨数据中心自动故障转移,调用方式兼容 OpenAI 接口形式。

先在自己家里跑通,再拿出来卖

Prime Inference 最早是 Prime Intellect 的自用平台,支撑大规模强化学习 rollout、合成数据生成、评测和长时间运行的编程智能体,内部每天处理近一万亿 token,2026年1月起已为客户承担大规模生产部署。首个公开部署是 GLM-5.3,9月22日在 OpenRouter 上线,是上面最快的 GLM-5.3 端点之一,工具调用错误率接近零,上线以来保持100%可用。

底座是 Blackwell,软件栈全是熟面孔

当前它跑在 NVIDIA Blackwell 上,Vera Rubin 即将跟进。软件层面组合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer,与 Inferact 和 NVIDIA 密切合作,改进回馈上游。关于这类底座,可参考 vLLM 适合什么团队?它是高性能推理底座,不是装上就能用的聊天产品。

工程数据更能说明问题:预填充与解码分离到不同 GPU 组后,p90 token 间延迟降低近40%;每步预填充 token 预算从8K减半到4K,中位排队等待从550毫秒降到110毫秒,中位首 token 时间减少约20%;用 NVFP4 压缩 KV 缓存,每行从576字节降到352字节,同样显存下缓存容量提升约50%,每个解码器约从109万 token 升到163万 token。在每用户每秒100 token 的目标下,1:4的预填充与解码配比下,每个预填充组可服务66个并发会话。

智能体负载拼的早已不只是算力

智能体负载的特点是长上下文、多轮反复复用历史,推理瓶颈越来越多落在缓存与调度上,而不只是算力。模型权重开源,不等于能直接进生产,企业还缺用量追踪、故障转移和有人负责的可用性承诺。Prime Inference 把这些做成带 SLA 的托管层,正是开源模型走向生产时最缺的一环。

推荐工具

更多