2026 年 10 月 1 日,OpenRouter 在官方博客发布了一套为 Agent 任务挑选模型的三步框架。它的起点是一个反常识的判断:按排行榜名次选模型,会让你为用不上的名次付前沿价格。正确的问题不是「哪个模型分最高」,而是「哪个模型是刚好够用的最便宜一款」。
榜单排名为什么会误导 Agent 选型
排行榜是把模型在互不相干的任务上取平均。你自己的 Agent 任务往往很窄:分个工单、抽一个字段、拿不准就升级人工。便宜模型在窄任务上能不能达到前沿模型的准确率,是个测量问题,榜单替你做不了这个测量。
Agent 的账也不能按一次对话算。一次聊天只收一次费,一个 Agent 的每一次工具调用、每一个中间步骤、每一次重试都要付费,一个三步循环至少把 token 单价付三遍。按榜单第一名选型,等于把前沿价格付三遍,去完成一个便宜模型本来也能达标的任务。
三步法具体怎么做
第一步,给任务定一条质量线。答案错了会惹麻烦的任务(合规、医疗、法律复核)把线定高;高频客服这类看总体结果的任务,90% 自动解决、10% 干净升级人工可能就够。对延迟敏感的工作(欺诈检测、实时客服),速度是第三个硬约束,便宜又准但太慢的模型先出局。
第二步,用自己的样本实测。每档挑一个代表——便宜、中档、前沿各一,用业务里真实的 20 到 50 个例子跑一遍,同一套评分标准打分,成本除以分数得到「每质量点成本」。成本不要按价目表估算,直接读每次响应里的 usage.cost 字段,那是平台实际扣的钱。
第三步,选「超线且有余量」里最便宜的。余量很重要,因为分数会漂:模型权重更新、你自己的流量变化都会让分数挪动。做法是多跑几轮,观察分数在轮次之间摆动多大,要求胜出者超线的幅度大于这个摆动。
OpenRouter 给了一个示例:质量线 85% 时,GPT-5.6 Luna 拿到 82 分直接出局——再便宜也没用;Gemini 3.7 Flash 89 分过线,成为每千次请求 1.09 美元的最优选;Claude Opus 5 拿到 97 分,但每千次 7.25 美元,是任务不需要的奢侈。价格和分数均为示例数据,实测时以你自己的跑分为准。
这套方法的边界在哪
三步法把选型从玄学变成测量,但它有三个前提。第一,质量线是你定的,主观判断错了,后面全错。第二,测量只在测量的那天成立,模型上新版本、价格一变,结论就可能过期,得重跑。第三,它管的是「成本和质量的权衡」,管不了「该不该用 Agent」——任务本身拆得不好,再便宜的模型也是浪费。