ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Microsoft-Decision-1 发布:不写长文,专给选项打分

Microsoft-Decision-1 发布:不写长文,专给选项打分

AI资讯 • Admin • • 31 次浏览

Microsoft-Decision-1 于 2026 年 10 月 9 日由微软在官方博客发布,现已上架 Microsoft Foundry,接下来还会登陆 OpenRouter。它不生成长文,也不做开放式推理,唯一的工作是在一组固定选项里给每个选项打出校准过的概率分,让软件拿到分数就能直接执行下一步。

它和通用大模型分工不同

Microsoft-Decision-1 由 Qwen3.5-9B 后训练而来,专为单次快速决策打分设计,微软计划后续把基座迁移到自家 MAI 模型和 OpenAI 模型上。它支持是或否、多项选择和量表评分,也能按评分标准给 AI 回复和智能体动作打分,全部走简单的结构化接口。为什么要为"判断"单独做一个模型?微软的理由很实际:工作流里每多一步决策就多一份延迟,20 步串行决策、每步多出 100 毫秒,总时长就多出 2 秒;把判断交给通用大模型逐个慢慢想,成本和速度都撑不住规模。

先看两个数字:延迟和稳定性

在微软自测的 36 项基准、近 15 万道题里,Microsoft-Decision-1 准确率最高,这批题目对训练保持不可见,覆盖路由、排序、长上下文、多语言、安全等类型。延迟方面,它的 P50 延迟比 GPT-6 Sol 快约 35 倍,比第二名 Quyet-1.0-Large 快 4.5 倍。稳定性单独测了一项:对同一请求做改写、换序、改键名、加格式噪声等八种扰动,决策平均只有 1.3% 发生翻转,其中选项描述改写和选项倒序时翻转为零。概率分本身就是接口输出的一部分——模型说九成把握,就应在代表性样本上大致对九成,应用才能据此决定自动执行、先放一放还是送人工复核。安全方面,它在 5250 条请求、11 项基准上做了有害内容、越狱和提示注入测试,官方称能在拒绝有害行为的同时保留较高的可用性。

微软内部已经用上的地方

Xbox 研究团队用它处理一万多条玩家反馈和评论并归入固定主题,质量与 GPT-6 Sol 相当,速度快 14 倍以上,成本约为后者的二百分之一。Copilot 团队拿它评估聊天和智能体回复质量,称与 GPT-5.6 Luna 相当但快 100 倍;值班工程师用它在日志、工单和通话记录里做知识检索路由;Microsoft Discovery 则用它给实验方案打分、驱动自适应重规划,一致性比大模型打分高 46 倍,整体流程提速近 4 倍。这条路线并不孤单,OpenAI 此前已经把同类判断做成了接口,见站内 Decisions API 开启公测:OpenAI 把判断做成一道快 10 倍的选择题;区别在于微软这次把判断做成了一个独立模型,而不是大模型的一个模式。

定价上,输入为每百万 token 0.042 美元,输出免费。它适合选项已经定好的判断:模型路由、内容分类、优先级排序、数据校验、工作流控制、给智能体的下一步动作把关。不适合开放性问题——那里没有固定选项可打分。对每天要跑大量结构化判断的团队,上手前值得先拿自己的真实样本测两件事:改写措辞后决策翻不翻转,以及它给出的概率和真实正确率对不对得上;榜单名次只能排在后面。

推荐工具

更多