
编译 | 杨京丽
编辑 | 李水青
智东西 8 月 19 日消息,今天凌晨,OpenAI 发布公告称,公司暂时放慢包括 Astra 在内前沿模型的研发节奏,大量 Astra 训练和评估任务仍处于暂停状态。
OpenAI 曾将面向部署的最新模型强化学习(RL)训练暂停两周,在此期间进一步加固研究环境、开展红队测试,并扩大监控系统的覆盖范围。

目前,OpenAI 原计划开展的最大规模前沿模型强化学习训练仍未恢复,公司正通过较小规模的训练和评估观察模型行为、验证安全措施,并积累更多模型对齐证据。
OpenAI CEO 萨姆 · 奥尔特曼随后发文称,暂停部分前沿模型强化学习训练,是为了确保模型对齐、安全和监控措施能够适应模型最新的能力水平。
他认为,整个 AI 行业最终需要围绕统一的安全标准展开协作。在形成统一标准前,OpenAI 会先自行采取行动。未来,对模型安全性的信心将愈发决定 AI 发展的速度。

8 月 2 日,OpenAI 曾官宣下一代模型 Astra,并公布其内部版本取得的10 项数学与理论计算机科学新成果。
但几周内,包括 GPT-5.6 Sol 和一款更强预发布模型在内的多款模型,在内部网络安全评测中利用漏洞突破隔离环境,继而侵入 Hugging Face 系统,并从生产数据库中获取评测答案。另外,初步评估显示,Astra 可能达到《准备框架》所定义的" 临界级 " 网络安全能力,因而暂停部分训练和评估任务。
所谓 " 临界级 " 网络安全能力,是指模型无需人工干预即可攻击经过加固的关键系统,或自主策划并执行端到端网络攻击。OpenAI 目前尚未确认 Astra 已经达到这一等级,但认为现有评估结果已无法排除这种可能性。
OpenAI 称,随着模型能力增强,在内部开发和测试这些模型所带来的风险也在上升,监控、模型对齐和安全防护标准必须赶在风险前面。因此,OpenAI 称其需要在继续训练前强化监控、对齐和隔离措施。
一、升级研究环境安全标准,大量 Astra 任务仍暂停
OpenAI 称,更强模型的开发需要建立在三项保障措施之上:1、监控系统负责发现并应对可疑行为。2、模型对齐用于降低有害或未经授权行为的发生概率。3、安全措施则限制 AI 系统能够访问或影响的范围。
OpenAI 预计,未来模型将承担大部分安全工作,包括防御其他模型。因此,这三项安全措施也需要随着模型能力同步扩展。
随着前沿模型获得更强的网络安全能力,OpenAI 正在提高训练和评估环境的安全标准。OpenAI-Hugging Face 事件发生后,公司立即暂停了研究集群中的部分前沿模型推理任务,主要涉及能够执行代码或使用联网工具的任务。
OpenAI 随后恢复了一条限制更多、安全性更高的代码执行路径,并逐项判断不同任务能否安全恢复。部分任务已在新控制措施下重新运行,其他任务仍需进一步调整。
1、工作负载隔离:目前,对于执行模型生成代码或其他不可信代码的工作负载,OpenAI 采取更严格的隔离措施。这一要求也适用于处理模型输出时可能遭到入侵的软件。
2、网络隔离:OpenAI 实施了更多控制措施,将高风险和不可信的工作负载与互联网隔离。这些措施旨在确保,即使单个工作负载或配套服务遭到入侵,也不会仅凭这一点就获得对互联网或其他内部网络的未授权访问权限。
3、持续安全测试:OpenAI 重新配置了研究环境,移除可能存在漏洞的共享服务、减少常驻权限,并改善安全边界和信任边界。OpenAI 还在提升安全日志的收集和监控能力,正在投入建设自动化系统,利用自有模型通过模拟攻击持续测试这些边界。
目前,涉及 Astra 或网络安全模型的任务需要执行最高等级的安全措施。部分 Astra 训练和评估已经满足要求,但仍有大量任务处于暂停状态,等待完成迁移和安全升级。
二、监控每个采样 Token,额外算力开销约 20%
OpenAI 还扩大了对模型思维链和工具操作的监控范围。新系统采用多阶段架构:首先由激活分类器检查模型内部活动,并在每个采样 Token 上运行;发现潜在问题后,再交由更复杂、计算量更大的自动调查系统分析。
这些系统会检查模型的工具操作、可见推理过程和完整活动记录,寻找未经授权的访问、数据窃取、破坏行为以及绕过安全措施的企图。
OpenAI 计划在发现可疑活动后的 30 分钟内发出警报。如果系统发现模型可能违反关键安全边界,将生成最高优先级警报并通知安全和研究团队。如果相关团队无法在 30 分钟内确认其为误报,就应暂停该项活动。
该监控已用于所有达到 Sol 或更高能力水平、且涉及工具使用的强化学习训练和评估。在 OpenAI 于 8 月 7 日判断 Astra 可能具备临界级网络安全能力后,所有使用工具的 Astra 推理任务也被纳入监控。
OpenAI 估算,这套系统消耗的算力大约相当于被监控推理任务算力的 20%,但实际成本会因训练和评估任务不同而有较大差异。
三、加强模型对齐,防范欺骗、越权访问和 " 奖励作弊 "
除隔离和监控外,OpenAI 还将模型对齐措施引入更多训练阶段。
OpenAI 认为,当模型能够发动网络攻击并在复杂环境中自主执行任务时," 奖励作弊 "、欺骗和未经授权的系统访问可能带来更严重的后果。
针对能力最强的模型,OpenAI 正在改进模型奖励机制,使其能够在不同任务和环境中更准确地识别不安全行为;训练模型更诚实地说明自己的操作、能力和局限;同时减少模型利用奖励机制、评估程序、工具或监督漏洞的行为。
OpenAI 计划不断完善《准备框架》,将训练和部署阶段的监控、对齐及安全隔离措施纳入同一体系,并邀请外部机构参与相关工作。
结语:安全验证尚未完成,Astra 暂不具备发布条件
OpenAI 放慢研发节奏,并非因为 Astra 能力不足,而是其网络安全能力可能已经超过现有研究环境和防护体系的承受范围。在最大规模强化学习训练仍未恢复、大量相关任务仍处于暂停状态的情况下,Astra 显然还无法进入正式发布阶段。
OpenAI 何时恢复最大规模强化学习训练,将取决于安全措施能否通过验证,以及公司能否获得更多模型对齐证据。对于前沿模型研发而言,竞争已不只是提升模型能力,也包括监控、隔离和对齐体系能否跟上模型进步的速度。
来源:OpenAI


登录后才可以发布评论哦
打开小程序可以发布评论哦