InnovationEval 结果出炉:前沿模型自己搞研发,最好成绩只有人类增益的 15%
InnovationEval 是 Epoch AI 于 2026 年 10 月 9 日公布的新评测,要回答的问题很直接:把一篇人类论文藏起来,让前沿模型在没见过答案的情况下独立发现一项可比肩的机器学习新技术,它能做到吗?首轮结果不乐观——最好的成绩按同等耗时折算,只有对照论文增益的 15%。 考法:...
InnovationEval 是 Epoch AI 于 2026 年 10 月 9 日公布的新评测,要回答的问题很直接:把一篇人类论文藏起来,让前沿模型在没见过答案的情况下独立发现一项可比肩的机器学习新技术,它能做到吗?首轮结果不乐观——最好的成绩按同等耗时折算,只有对照论文增益的 15%。 考法:...
Microsoft-Decision-1 于 2026 年 10 月 9 日由微软在官方博客发布,现已上架 Microsoft Foundry,接下来还会登陆 OpenRouter。它不生成长文,也不做开放式推理,唯一的工作是在一组固定选项里给每个选项打出校准过的概率分,让软件拿到分数就能直接执行下...
Project Beacon 于 2026 年 10 月 9 日由 Baseten 在其官方博客宣布,合作方是 Goodfire AI,目标是把主动安全控制直接做进开放模型的推理环节。做法不是在输出之后再加一道文本过滤,而是在模型生成过程中读取其内部激活状态,用探针提前识别正在发生的风险事件,赶在内...
ARC-AGI-2 高分榜在 2026 年 10 月 9 日被刷新:ARC Prize 官方公布,Tufa Labs 以 88.06% 登上 ARC Prize 2026 赛季 ARC-AGI-2 高分榜第一名。这个分数越过了 85% 这条线——赛事为此另设的 15 万美元奖金池,将由所有得分超过 ...
Claude Managed Agents 的动态工作流于 2026 年 10 月 9 日进入公开测试,Anthropic 通过其开发者账号 ClaudeDevs 宣布了这一更新。这是一种新的多智能体编排方式:主智能体先写出一份跨多个阶段执行的计划,再把各阶段分给一组智能体并行处理,最后合并结果,而...
Sabi 在 2026 年 10 月 9 日宣布完成 5,000 万美元融资,投资方包括 Khosla Ventures、Accel、Initialized、DST Global 和前 OpenAI 产品负责人 Kevin Weil。这家位于帕洛阿尔托的初创公司今年 4 月才走出隐身模式,它要做的东...
Qwen-Image-2.1-Turbo 在 2026 年 10 月 9 日由通义千问团队正式发布,权重同步开放。它是 Qwen-Image-2.1 的官方加速检查点:同一套 7B 视觉生成架构不变,生成和编辑一张图只需要 8 个去噪步骤。基础版 9 月下旬开放权重时,官方流程要走约 40 步,Tu...
Perplexity 在 2026 年 10 月 9 日上线了 Alexandria:一座由其智能体系统 Computer 建成、并将持续维护的免费百科。首席执行官 Aravind Srinivas 在当天的发布中给出了一组具体数字——66,574 个条目、综合了 348,980 个来源,整个项目花...