ToolNavs 发现实用AI工具
提交工具 登录
返回AI新闻简报
24小时AI简报:MiMo-V2.6开源夺冠,OpenAI遭BC省起诉

24小时AI简报:MiMo-V2.6开源夺冠,OpenAI遭BC省起诉

AI新闻简报 Admin 2 次浏览

今天(9 月 22 日)的 AI 速览:小米 MiMo-V2.6 开源发布,Pro 版在 Artificial Analysis Intelligence Index 拿下 46 分,成为开源权重模型第一;xAI 的 Grok 4.7 评测同步出炉,同获 46 分,编码智能体指标冲到 56;加拿大不列颠哥伦比亚省就校园枪击案起诉 OpenAI,指其安全团队标记了风险对话却未报警;Linear 则公开了它们应对 AI 编码时代 CI 瓶颈的改造复盘。

小米开源 MiMo-V2.6:Pro 版 Intelligence Index 46 分,登顶开源榜

9 月 21 日,小米通过官方博客发布 MiMo-V2.6 系列:Pro 与 Flash 两个原生全模态模型,加上 Distill-Qwen-9B、7000 多个 RL 任务环境与训练代码,一并开源。

MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 拿到 46 分(精确 46.32),超过 Kimi K3 和 Qwen3.8 Max,成为开源权重模型第一;不过与 Claude Fable 5.1、GPT-6 Astra 等闭源前沿相比仍有差距。最特别的是“6 天公开直播 RL 训练”:Pro、Flash 各完成 30 步、约 75 万条轨迹,成本约 262 万和 85 万美元,DeepSWE v1.1 样本外评分分别提升约 17 和 14 分。API 价格与 V2.5 持平,还新增了输出速度最高 20 倍的 Pro-UltraSpeed 托管档位。

延伸阅读:小米发布 MiMo-V2.6:全模态双版本,把 Agent 执行层做进模型里 (/article/2026-xiaomi-released-mimo-v26-dual-versions-of-full-modality-integrating-the-agent-ex)

Grok 4.7 评测:总分 46 分跻身前四实验室,编码智能体拿到 56 分

xAI 在 9 月 21 日发布 Grok 4.7,Artificial Analysis 随即给出 Intelligence Index 46 分,比 Grok 4.6 高 2 分,xAI 由此跻身该指数前四实验室;但距离 Claude Fable 5.1 与 GPT-6 的 53 分还有 7 分差距。

亮点在编码:搭配自家编码智能体 Grok Build,Coding Agent Index 拿到 56 分,较 4.6 提升 9 分,超过 GPT-5.6 Sol,在原生 harness 配置中排名第四。马斯克在 X 上宣称 xAI 的智能体编码排名第三,仅次于 Anthropic 和 OpenAI。长程真实职业任务(AA-Briefcase)1657 Elo,比上代高 111,接近 Claude Opus 5 水平;GDPval-AA 1695 Elo(+90)。定价不变:每百万 token 输入 2 美元、输出 6 美元。

不列颠哥伦比亚省起诉 OpenAI:安全团队标记了风险对话,却没有报警

9 月 21 日,加拿大不列颠哥伦比亚省政府向美国加州北区联邦法院起诉 OpenAI 及其 CEO Sam Altman(路透社首发报道)。起因是今年 2 月发生在 Tumbler Ridge 的校园枪击案,造成 9 人死亡,多为儿童。

诉状指控:凶手 Jesse Van Rootselaar 在 ChatGPT 对话中讨论枪支暴力后,被 OpenAI 安全团队标记为高风险,但公司没有把预警转交执法部门;省政府认为悲剧本可预防,索赔包括学校重建、心理健康等灾后支出,并要求法院命令 OpenAI 改革对涉暴力对话的处理流程。此前已有 30 多名受害者家属在加州联邦法院提起诉讼;OpenAI 发言人称这是“难以言喻的悲剧”,表示会配合执法。

延伸阅读:不列颠哥伦比亚省起诉 OpenAI:内部标记风险账号却未报警 (/article/2031-british-columbia-sues-openai-risk-account-flagged-internally-police-never-alerte)

Linear 公开 CI 改造:AI 编码越快,验证越贵

9 月 21 日,Linear 在官方工程博客复盘了它们的 CI 改造,标题“CI costs are high”直接取自 CTO Tuomas Artman 指派的 issue 原话。

核心论点很扎心:AI 编码让写代码指数级加速,但每个 PR 仍然要过 CI,验证环节成了新瓶颈——既推高基建成本,又让开发者和 Agent 干等反馈。改造后,测试套件规模较年初翻近 4 倍,PR 等待时间反而从 6 分钟以上降到 5 分钟出头,单测 runner 时间减半。做法包括升级基建与工具链、优化阻塞性任务、减少重复装配、提升测试执行效率;文章强调这些优化对 TypeScript 之外的语言和工具链同样适用。

本轮简报共收录 4 条,每条都核实到 24 小时内的官方来源(官方博客、官方公告、Artificial Analysis 评测、路透社首发报道)。另有 4 条线索未收录:Kimi 浏览器扩展(“WebBridge 更名”实际发生在 9 月 17 日)、transformers 的 GGUF 支持(长期既有功能,并非新发布)、NVIDIA Nemotron 3.5 Lightning(8 月 11 日旧发布)、Step 5 Preview(9 月 18 日发布,已超出 24 小时窗口)。

推荐工具

更多