DeepSeek V4.1 Flash 的最新一组成绩在 2026 年 10 月 6 日由 ARC Prize 公布:这家独立评测机构在 ARC-AGI(Verified)评测中给它打出 ARC-AGI-1 得分 94.5%、ARC-AGI-2 得分 72.9%。抽象推理这条线又往前迈了一截,但每道题的花费也明显变贵了。
涨幅拆开看
和上一代 V4 Flash 在同一评测上的最佳成绩相比,ARC-AGI-1 提高了 5.5 个百分点,ARC-AGI-2 提高了 11.5 个百分点。ARC-AGI 考的不是背题:每道题只给几个输入输出示例,要求模型自己悟出变换规则,再套到没见过的新图形上;ARC-AGI-2 还要同时处理多个相互纠缠的规则,所以第二代的涨幅更能说明问题。成本端是另一面:ARC-AGI-1 每题约 0.07 美元,ARC-AGI-2 每题约 0.13 美元,达到上一代最佳成绩对应成本的数倍。换句话说,这次进步是靠更舍得花推理算力换来的,不是免费的午餐。
为什么成本数字和分数一样重要
ARC Prize 把成本和分数放在一起公布,本身就是一种态度:只报分数、不报账单的评测,对真正要部署的人参考价值有限。对开发者来说,72.9% 的 ARC-AGI-2 成绩意味着,处理陌生规则类任务时多了一个可选项,而且它的单题成本仍在十几美分级别,和头部闭源模型动辄数美元的推理账单不在一个量级。但任务量一旦巨大,成本翻几倍就必须算进总账,尤其是那些靠反复试错堆正确率的智能体工作流,账单会被放大得更快。
读这组数字的两个提醒
第一,这是评测机构在自家验证集和固定设置下跑出的结果,换一套提示方式或推理档位,分数和成本都会变,不能直接当成业务场景的承诺。第二,抽象推理强不等于代码、长文档这些日常任务全面领先,选型时仍要用自己的任务集复测。这组结果真正的信号是:中国开源阵营在最难的通用推理评测上继续逼近第一梯队,而竞争的焦点正从单纯拼分数,转向拼每一分钱能买到多少推理能力。