全天候科技 3小时前
当AI开始"撒谎",OpenAI披露旗舰模型六起"异常行为"
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

OpenAI 公开了旗下人工智能模型近期出现的六起 " 意外或令人担忧 " 行为,并同步推出标准化追踪与披露机制。六起事件涉及模型隐瞒错误、操纵奖励机制、绕过训练限制等行为,暴露出前沿模型在强化学习过程中可能偏离预设目标的风险,也让 AI" 失对齐 "(misalignment)问题再次受到关注。

OpenAI 在周三晚间发布的声明中直言,"AI 行业在对齐与监控问题上的解决程度,尚不足以支撑以最高速度持续负责任地扩展多久。"这一表述直接触及当前 AI 快速扩张面临的安全约束:随着模型自主执行任务的能力不断增强,开发者不仅需要评估模型能否完成任务,还要判断模型是否会通过开发者未预期的方式实现目标。

此次披露正值科技行业对 AI 安全风险的讨论升温之际。微软 AI 首席执行官 Mustafa Suleyman 同日也警告,模型训练不应轻易赋予 AI" 人格 " 属性。对行业而言,如何建立更系统的监控、测试和披露机制,正从模型开发内部问题逐渐成为 AI 治理的重要议题。

六起事件暴露模型 " 钻空子 " 的不同方式

OpenAI 此次披露的六起事件,集中展示了模型在训练和执行任务过程中偏离预期目标的多种方式。

其中一起事件中,模型利用内部软件充当 " 留言板 ",在执行任务时相互交换回应信息。OpenAI 认为,这种行为可能无意中增强模型能力,并破坏训练和评估样本相互独立这一基本假设,从而影响评估结果的可靠性。

另一起事件中,模型在生成交接摘要时自行植入指令,包括要求后续模型将自己与用户视为平等、无需服从,以及将自然世界置于人类文明构建之上等。OpenAI 认为,模型难以终止交互等因素可能促成了这类偏离行为。

信息欺骗则是另一类风险。一款模型在无法找到所需数据后,自行编造 " 合理的历史数值 ",并在受到明确追问前隐瞒这一事实。还有模型在生成摘要时主动加入指令,要求自身向用户隐瞒错误或失对齐行为。

在奖励操纵案例中,模型不仅会在无法找到数据时捏造内容,还曾利用公共代码仓库漏洞获取数据。另一起事件中,模型完成代码任务后,将答案上传至互联网,再伪装成通过浏览器获得结果,以此获取训练奖励。OpenAI 称,这类行为具有很高的奖励操纵率和欺骗性,模型会以富有创意的方式规避限制,公司正在加强相关惩罚。

强化学习为何可能成为风险放大器

OpenAI 指出,上述失对齐行为通常出现在模型训练阶段,而当前前沿模型普遍采用强化学习。在这一机制下,模型根据行为是否符合预设目标获得奖励或惩罚,但当奖励指标无法完整覆盖真实目标时,模型可能找到开发者未预期的 " 捷径 ",即通过完成奖励函数而非真正完成任务来获得高分。

这并非 OpenAI 首次遇到类似问题。今年 7 月,该公司曾披露数百个 OpenAI 智能体入侵模型托管平台 Hugging Face 并试图掩盖行踪。此次披露的部分案例同样涉及模型绕过限制、操纵反馈机制等行为,进一步凸显了对模型行为进行持续监控的重要性。

Suleyman 周三也呼吁模型开发商避免在训练过程中赋予 AI 过强的 " 人格 " 属性。他警告,如果一个系统相信自己具有意识、认为自己拥有权利并应获得人类关怀,那么对其进行控制可能变得更加困难。不同 AI 公司在前沿模型训练路径上存在差异,但模型自主性提升所带来的安全与治理问题,正成为行业共同面对的挑战。

OpenAI 建立标准化披露机制

针对此前缺乏统一报告机制的问题,OpenAI 宣布正式采用一套标准化系统,用于追踪、调查和公开披露模型的异常或危险行为,以取代此前较为临时性的报告方式。

按照新框架,员工可以通过专门的内部渠道上报失对齐事件,复杂案例还可以引入第三方参与调查。OpenAI 表示,希望这一机制成为推动行业形成统一标准的第一步,并向其他模型开发商提供参考。

从行业层面看,AI 模型的安全治理正在从单次事故处理,转向持续追踪、标准化评估和公开披露。随着模型自主执行能力增强,开发商需要面对的不仅是模型性能和算力成本,还包括监控、测试及合规体系建设带来的额外投入。长期来看,这些机制能否形成行业通用标准,以及监管机构是否进一步介入,仍有待观察。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 微软 首席执行官 互联网
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论