ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Strands Decider 2B 开源发布:2B 小模型专做选择题,百毫秒给出把握分

Strands Decider 2B 开源发布:2B 小模型专做选择题,百毫秒给出把握分

AI资讯 • Admin • • 5 次浏览

Strands Decider 2B 在 2026 年 10 月 7 日由 Strands Agents 团队开源发布,它不写文章、不聊天,只做一件事:在给定的选项里挑一个,并给出自己有多大把握。2B 参数、本地百毫秒级延迟、权重与训练数据全部公开,这类被称为决策模型的小模型,正在智能体工作流里抢下一块原本属于大模型的地盘。

它和普通大模型差在哪

普通大模型回答问题靠逐字生成,答案空间没有边界;决策模型反过来,先把候选选项摆好,再用一次并行计算同时给每个选项打分,最后只输出选项和分数。代价很明确:它不会生成文本,复杂推理也明显弱于推理模型,写代码、做摘要、陪聊这类活儿都干不了。换来的好处同样明确:答案永远落在给定选项内,速度快,而且每个判断都附带一个可信度分数——这个分数经过校准,能大致反映判断对的概率,这是前沿大模型的接口通常不直接给的东西。

架构上做了一次减法

Strands Decider 2B 以 Qwen3.5-2B 为躯干,去掉负责生成文本的语言模型头,换上一个只有一百多万参数的指针头:它拿每个选项位置的内部状态,去和答案标记位置的状态比对打分。躯干本身只用秩为 16 的 LoRA 适配器微调。团队说这次放出的是第 19 个迭代版本,仓库里完整记录了每一版改了什么,包括早期一个效果明显更差的槽位头方案为什么被放弃。

成绩和速度

在 JevBench 公开集上,它在 2B 级别 33 个模型里排第 3,若排除参数略超 2B 的模型则排第 1;校准质量用 Brier 分数衡量,与准确率一起公布。延迟方面,本地 RTX 3090 上中位约 115 毫秒,M3 MacBook 上小任务中位约 153 毫秒,且随任务长度近似线性增长。对需要在每次工具调用前都做判断的场景来说,这个量级的延迟才有可能塞进调用链路,而不必为每个小判断都付一次大模型推理的钱。

它在智能体里具体干什么

团队列出的典型用途包括模型路由、工具选择、自动评测、安全护栏、记忆管理、上下文管理和策略分类。随仓库给出的示例很能说明问题:一个智能体在用户没说城市时就急着调用天气工具,Decider 在工具真正执行前先回答两个是非题——参数里的值是不是用户真的说过、现在调用是不是太早——几行代码据此决定放行、拦截、转人工确认,还是把回合退回给模型并附上反馈。更宏观的玩法是混合分工:最难的判断留给大模型,大量重复、规则明确的小判断交给决策模型,成本和延迟一起降下来。

对正在搭智能体的团队,这次发布的信号在于分工开始细化:不是所有判断都值得动用前沿模型。它的边界也要看清——选项必须由人或上层系统先定义好,它只负责选;选项本身错了,它选得再准也没用。 pip 安装 strands-decider 即可本地试用,权重在 Hugging Face 上以开源形式提供,训练数据和脚本一并公开,想自己训一个同类小模型的团队有了完整的起点。

推荐工具

更多