ToolNavs 发现实用AI工具
提交工具 登录

AI 模型评测

同一模型换一套题,名次能差出好几名——榜单从来不是成绩单,而是出题人视角的一块切片。这里关注基准怎么出、评分器怎么设计、结果怎么才不虚高。

评测的难点不在出题,而在怎么保证分数真的代表能力。UNO-Bench 用 44 类任务、五种模态组合统一口径,还配套通用打分模型把自动评测的一致性做到约 95%;AMO-Bench 干脆请人类专家新出 50 道 IMO 级题目,为的是绕开训练语料记忆造成的"刷榜",多数模型得分仍在 40% 以下。 单轮问答的评测思路在智能体上会失灵。Anthropic 工程团队给出的路径是从 20 到 50 个真实失败案例起步,为每个任务准备参考解和清晰的判定标准,题集同时覆盖"该做"与"不该做",每次试运行在隔离环境里跑,避免共享状态和缓存把分数抬高。指标上还要分清 pass@k(多次尝试至少成功一次)与 pass^k(连续多次都成功)——后者才对应"每次都得可靠"的产品要求。
UNO-Bench 全面解读:统一评测全模态理解与推理的开放基准

UNO-Bench 全面解读:统一评测全模态理解与推理的开放基准

一、摘要 UNO-Bench 是面向“单模/全模”统一评测的开源基准,覆盖感知与推理两大维度,提供中文真实场景题目与多步开放问答(MO)。数据与工具强调高质量、人为主导构建,并配套通用打分模型以便自动化评测。 二、核心特性 1、统一能力框架:44 类任务、5 种模态组合,单模与全模同一指标口径。 2...

Admin
125