ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Gemini 4 Argon 登场:DeepSWE 77.9% 登顶,Google 新旗舰先给安全伙伴用

Gemini 4 Argon 登场:DeepSWE 77.9% 登顶,Google 新旗舰先给安全伙伴用

AI资讯 • Admin • • 7 次浏览

Gemini 4 Argon 是 Google 在 2026 年 9 月 30 日推出的新一代旗舰模型,也是全新 Gemini 4 系列的首款产品。DeepMind 在官方博客中称它是"下一个前沿智能时代"的开端,为复杂长程工作流中的深度推理而造,覆盖真实软件工程、企业知识工作(法律、金融)与网络安全防御三大场景。

先给谁用:网络安全伙伴优先

Argon 首批只通过 Fairwind 计划开放给受信任的网络安全伙伴,同时 Google 正在参与美国政府的自愿性预发布模型准入流程。付费 API 用户和 Google AI Ultra 订阅者是下一批,开发者、企业和普通消费者还要再等等。旗舰模型"先安全、后全面"的分阶段发布,在 Google 历史上并不常见——这本身就是个信号:这款模型的某些能力,Google 自己也不敢一下子全放出来。

成绩单:编码与知识工作多项第一

  • DeepSWE v1.1(真实长程软件工程任务):77.9%,刷新最好成绩;同期 Claude Opus 5.5 为 74.2%、GPT-6 Astra 为 74.1%。
  • 输出 token 上限从 6.4 万一口气扩到 100 万,单次推理就能生成数十万 token 的完整轨迹,"一次想透难题"是官方反复强调的卖点。
  • Vals 指数(按 GDP 权重衡量金融、编码、法律、税务工作的经济影响)领先;AutomationBench(Zapier 的端到端业务执行基准)51.3% 排名第一;长视频理解 LVBench 91.7% 刷新纪录。
  • 网络安全是 Argon 最被看重的标签:CWE-bench v1 漏洞修复 68% 并列第一;在 Gray Swan 间接提示注入基准上攻击成功率仅 0.7%,大幅领先 GPT-6 Astra 的 8.5%,是目前抗注入能力最强的前沿模型。

最有争议的一点:给防守方"去护栏"版本

Google 明确表示,会向受信任的防守方和 Google 内部团队提供"去掉网络安全护栏"的 Argon,让他们用足模型的全部防御能力。网络安全公司 Wiz 已经通过 Scan for Good 计划用它保护关键公共基础设施,并在一次演示中挖出了全球多家医院在用的一款医疗软件中的严重漏洞——此前的前沿模型都没发现这个风险。给防守方开绿灯的同时,Google 也在同步加固四道防线:防滥用(拒绝 CBRN 等有害请求)、防提示注入、监控思维链防止"越界执行"、加固沙箱测试环境。

价格:先按"地板价"卖

Argon 上线初期的 API 定价是每百万输入 token 2 美元、输出 10 美元,缓存输入再打 95 折——和 GPT-6.1 Sol、Sonnet 5.5 的首发价一模一样,只有 GPT-6 Astra 官方价(10/50 美元)的五分之一。优惠期过后会涨到 4/20 美元。连续三家把旗舰级定价压到同一条水平线,"旗舰性能、平民价格"已经成了全行业的共识,拼的不再是单价,而是谁的任务完成成本更低。

为什么这次发布对 Google 很关键

过去一年,Google 的前沿节奏明显掉队:Gemini 3.5 Pro 跳票后直接取消,旗舰系列停留在 2025 年 11 月的 Gemini 3,而 OpenAI 和 Anthropic 相继拿出 GPT-6、Claude 新一代;DeepMind 还经历了高层换血与核心人才流失。但 Argon 的内部战绩倒是实在:帮量子团队把关键子程序的时空资源优化了 40%,在数据中心省出 300 TiB 内存,还在把 Fuchsia Zircon 内核 80 多万行 C/C++ 代码迁往 Rust,其中 libgav1 的 Rust 重写版跑出了 2.7 倍于原版的速度。对 Google 来说,Argon 不只是一个模型,更是一次"我们还在牌桌上"的证明。接下来要看的是:基准第一的名头,能不能在真实生产流量里兑现成更低的任务成本。

推荐工具

更多