ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
OpenAI推出GPT-6 Astra,满分网络安全测试背后更值得关注

OpenAI推出GPT-6 Astra,满分网络安全测试背后更值得关注

AI资讯 Admin 3 次浏览

GPT-6 Astra 正式登场。OpenAI 将其定位为目前能力最强的模型,主攻计算机操作、专业工作、科学、编程和网络安全。FrontierMath Tier 4 v2 达97.6%,ARC-AGI-3最高99.9%,ExploitBench更拿到100%。真正值得关注的,是模型能力正在从“解题”快速转向“完成工作”。

从回答问题到执行完整任务

Astra支持超过100万Token上下文,并强化网页搜索、Computer Use、代码执行和多工具协作。OpenAI给出的方向很明确:模型不只生成答案,而是跨浏览器、终端和专业软件连续完成多步骤任务。

这对AI Agent尤其关键。复杂工作流过去常因上下文丢失、工具调用失败而中断,Astra试图把模型变成真正的“执行者”,让软件开发、研究和企业自动化进一步减少人工接管。

99.9%并不等于AGI

最吸睛的是ARC-AGI-3。ARC Prize独立测试显示,Astra在OpenAI Provider Adapter环境下最高达到99.9%,但在统一Standard harness下最高为62.7%。运行框架和上下文管理方式,对最终成绩影响巨大。

即便如此,这仍是一次明显跃升。Astra能够在陌生环境中探索规则、建立内部模型并规划行动,说明前沿模型正在增强持续学习与任务执行能力,但ARC Prize也明确表示,高分本身不能作为AGI已经实现的证明。

网络安全首次进入Critical级别

Astra在ExploitBench取得100%,OpenAI也首次将旗下模型的网络安全能力评为Preparedness Framework中的Critical级别。模型已经具备寻找未知漏洞、开发利用链并执行复杂安全任务的能力。

不过OpenAI承认,历史漏洞可能造成ExploitBench数据污染,因此又使用2026年6月至8月披露的新漏洞进行内部测试。测试期间,Astra还发现并利用了两个此前未知的零日漏洞,相关问题正在进行负责任披露。

GPT-6 Astra真正改变的不是某一张排行榜,而是AI能力边界:当模型可以持续操作软件、开展科研并处理复杂工程任务,下一轮AI创业竞争将从“接入大模型”转向“谁能让模型真正接管完整工作流”。

推荐工具

更多