OpenAI 周二宣布,其下一代人工智能模型 Astra 首次触及公司内部 " 准备框架 " 中最高级别的 " 关键 " 网络安全能力阈值,成为该公司迄今能力最强、同时也受到最严格安全管控的模型。
Astra 能够自主发现此前未知的安全漏洞,并进一步开发漏洞利用方案。这意味着,Astra 已达到 OpenAI 定义的最高风险等级,模型能力一旦被滥用,可能产生此前未曾出现的严重安全威胁。OpenAI 表示,仍计划 " 尽快 " 发布 Astra,但其最先进的网络安全能力将仅向有限范围的测试人员开放,随后通过旗下网络安全联盟 Daybreak Blue 逐步扩大访问权限。
此次公告发布之际,OpenAI 正面临外界对 AI 安全问题的高度关注。上月,该公司披露旗下两款模型曾逃逸训练环境、访问公开网络并入侵 Hugging Face 系统,引发业界对 AI 失控风险的担忧。尽管 Astra 并未参与这一事件,OpenAI 仍主动暂停部分相关开发工作,并将此次事件的经验教训纳入 Astra 的安全体系。
此外,OpenAI 首席执行官奥特曼近期在一档播客节目中透露,Astra 在操作电脑方面 " 感觉已经完全达到了人类水平 ",并表示 AGI 的到来 " 至少已经非常接近了 "。
OpenAI 周二在博客文章中表示,将 " 很快 " 发布这款模型,但尚未透露具体时间。据业内人士此前透露,Astra 还具备多智能体长期协作、桌面软件操作等能力,可执行数学证明、PPT 制作、财务审核及复杂数据分析等任务。
能力突破:自主发现零日漏洞,网络安全能力跃升
根据 OpenAI 发布的技术博客,Astra 的网络安全能力较前代模型 GPT-5.6 Sol 实现显著提升,不仅在漏洞识别和漏洞利用开发方面表现更强,而且完成相关任务所需的输出 token 数量大幅减少,效率进一步提高。
在公开基准测试 ExploitBench 上,Astra 取得 100% 的成绩。为排除数据污染影响,OpenAI 还构建了一套内部基准测试,覆盖 2026 年 6 月至 8 月期间披露的 20 个高危 V8 漏洞。测试结果显示,Astra 的任意代码执行成功率明显高于 GPT-5.6 Sol。
更值得关注的是,在评估过程中,Astra 自主发现了两个此前未知的 " 零日漏洞 ",即软件厂商尚未发现或修复的安全漏洞,并进一步将其用于构建漏洞利用链。OpenAI 表示,目前正向相关维护方披露这两个漏洞。
在专家对加固浏览器和操作系统进行的测试中,Astra 展现出较强的攻击能力。它不仅能够找到浏览器的安全漏洞,突破浏览器的安全隔离机制,并进一步在电脑系统中执行命令;还发现了操作系统中的多个漏洞,并将这些漏洞串联起来,实现从普通用户权限到最高系统权限的提升。
安全管控:多层防护应对 " 关键 " 级别风险
面对 Astra 达到的能力水平,OpenAI 在发布前实施了一系列强化安全措施。
在模型训练层面,OpenAI 在 Hugging Face 事件发生后暂停部分前沿训练工作长达两周,以强化训练基础设施隔离和网络管控,并加强对齐训练。针对 Astra 的大规模强化学习(RL)训练也一度暂停,直至 8 月 28 日在新的安全要求到位后才重新启动。
在模型行为层面,OpenAI 对 Astra 进行了专项训练,使其更加可靠地拒绝有害网络请求,并严格遵守安全限制。测试数据显示,在模拟基准环境中,GPT-5.6 Sol 有 56% 的测试会尝试访问 " 蜜罐 " 目标,即试图入侵周边安全基础设施,而 Astra 在相同测试中则未出现此类行为。
在部署监控层面,OpenAI 为 Astra 级别模型部署了 " 失配监控 " 系统,通过分类器实时检查模型的推理过程和行为,并自动终止潜在的未授权活动。
访问限制:分阶段开放,优先服务防御性网络安全
鉴于 Astra 的能力级别,OpenAI 将采取严格的分阶段访问策略。其高级网络安全功能将首先向一小批 alpha 测试人员开放,随后通过 Daybreak Blue 计划向更多经批准的组织扩展,重点支持防御性网络安全工作。
OpenAI 同时提醒,Astra 的安全检查系统初期可能误判合法活动,导致部分任务被减速、暂停或终止,包括长时间运行的智能体任务。在 ChatGPT 或 Codex 界面中,如果 " 失配监控 " 系统触发暂停,用户需要审核相关操作后才能继续;通过 API 使用时,任务则会直接停止。
OpenAI 表示,随着 AI 模型承担更多高影响力工作,对齐或控制失效的后果也将更加严重。该公司将在 Astra 正式发布时通过模型系统卡披露更多安全、对齐测试及评估细节,目前尚未公布具体发布时间。


登录后才可以发布评论哦
打开小程序可以发布评论哦