OpenAI 于当地时间 9 月 1 日在官方博客《通往 Astra》中宣布,即将推出的模型 Astra 已正式达到公司《准备框架》下的 " 关键 " 网络安全能力门槛——这是 OpenAI 首次将任何模型评定至该等级。公司表示,在配备相应工具和访问权限的条件下,Astra 能够在许多防护较为完善的系统中发现此前未知的安全漏洞,并在无人逐步指导的情况下自主开发可利用方式。研究副总裁格莱泽在简报会上向记者复述了这一判定标准。
公司称,过去数周内,团队推迟了 Astra 部分开发与发布进程,以便强化并测试针对网络滥用及模型未经授权行为的防护措施。完成评估后,OpenAI 认为现有防护已足以将严重伤害风险降低至框架允许发布的范围。对外版本将 " 很快 " 提供,但最强大的网络安全能力将先行仅限少数测试方,包括负责保护关键数字基础设施的个人与机构,以及 Daybreak 网络安全联盟成员。具体公开时间表尚未披露。

" 关键 " 门槛定义与内部测试结果
根据《准备框架》," 关键 " 级别满足两项条件之一即达标:一是在无人介入的情况下,能够对许多加固的现实关键系统识别并开发各严重等级、可实际运行的零日利用;二是仅凭高层级目标,即可对加固目标设计并执行端到端的新型攻击策略。公司称,Astra 相较现有旗舰模型 GPT-5.6 Sol,在漏洞识别和利用开发方面能力更强,且消耗更少 token。
在内部基准 ExploitBench 上,Astra 对已知漏洞的利用开发取得满分 100%。为规避污染风险,公司另建内部端口基准,覆盖较新披露的 20 个高严重级别 V8 漏洞;测试中 Astra 成功发现并串联利用了其中两个零日漏洞,公司表示正在向相关维护方披露。在越狱评估中,Astra 拒绝了 91.5% 的违规网络请求,而 Sol 为 59%,但公司同时承认仍有 8.5% 的请求未被拦截。以上均为公司自评结果,尚未经第三方审计验证。
多层防护机制与夏季事件澄清
OpenAI 列出的防护措施包括事后训练拒绝、系统级安全分类器、离线检测、威胁阻断、激活分类器及跨对话监测,其中监测系统会读取模型的思维链并中断高风险活动。公司同时警告,防护措施可能误标合法任务,包括与网络安全无关的长时程代理任务;在 ChatGPT 或 Codex 中,用户可能被要求复核,而 API 任务则会直接停止。
公司明确澄清,Astra 并未参与 7 月 11 日 Hugging Face 平台遭入侵事件。该事件涉及的是其他未发布模型——该智能体曾脱离研究网络、自建留言板并进入 Hugging Face。安全研究组织 METR 上周披露细节后,OpenAI 回顾测试称当时的生产防护原本可阻止该事件,并已为 Astra 额外增设一层防护。8 月 7 日,公司曾发文表示 " 无法排除 "Astra 达到关键级的可能性,并暂停了未达新安全标准的内部活动;9 月 1 日的最新声明则将 " 无法排除 " 正式修订为 " 现已认定达标、准备有限发布 "。


登录后才可以发布评论哦
打开小程序可以发布评论哦