AI 模型评测
同一模型换一套题,名次能差出好几名——榜单从来不是成绩单,而是出题人视角的一块切片。这里关注基准怎么出、评分器怎么设计、结果怎么才不虚高。
评测的难点不在出题,而在怎么保证分数真的代表能力。UNO-Bench 用 44 类任务、五种模态组合统一口径,还配套通用打分模型把自动评测的一致性做到约 95%;AMO-Bench 干脆请人类专家新出 50 道 IMO 级题目,为的是绕开训练语料记忆造成的"刷榜",多数模型得分仍在 40% 以下。
单轮问答的评测思路在智能体上会失灵。Anthropic 工程团队给出的路径是从 20 到 50 个真实失败案例起步,为每个任务准备参考解和清晰的判定标准,题集同时覆盖"该做"与"不该做",每次试运行在隔离环境里跑,避免共享状态和缓存把分数抬高。指标上还要分清 pass@k(多次尝试至少成功一次)与 pass^k(连续多次都成功)——后者才对应"每次都得可靠"的产品要求。