第一财经 昨天
OpenAI新模型陷入失控争议,首席科学家回应
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

当地时间 9 月 2 日,OpenAI 首席科学家雅库布・帕乔基(Jakub Pachocki)在社交平台发文,就近日围绕新模型 Astra" 不可监控 " 的争议作出回应。

这场争议源于此前一天,有消息称 OpenAI 即将发布的 Astra 模型采用了一种名为循环深度(Recurrent Depth)的推理技术。该模式下,同一组 Transformer 层被反复计算,部分推理过程发生在模型内部,不必全部以思维链形式呈现,因此也被称为 " 不透明循环 "。

帕乔基表示,希望避免因信息失实引发一场冲向不可监控状态的军备竞赛——即各大实验室竞相开发能力过强、人类难以监控、无法审查的模型,导致安全管控彻底失效。

他强调,包括 Astra 在内的前沿模型,计算图深度与 GPT-4 相差不超过两倍,说明模型架构并未如外界担忧的那样出现跳跃式的复杂度增长。

此处的计算图深度是指模型完成一次推理任务必须依次执行、无法并行加速的最长计算步骤链条。过去普通 Transformer 架构下的层内计算可以大规模并行,串行的深度约等于模型层数。

而市场传言的循环深度可以把同一套模块反复循环迭代多轮做思考,在输出下一个 token(词元)前增加内部推理深度,而非仅依赖更长的可见文本思维链,可以提升数学、编码等性能并降低成本。

该架构隐含的安全风险在于,当计算图深度拉得极高,模型可以在内部隐式完成海量推理步骤,不必在输出里吐出完整思维链,人类就看不到它中间思考、谋划、找漏洞的过程,进而进入不可监控状态,安全审计与思维链监控全部失效。

相关消息披露后,AI 安全界反应强烈。非营利 AI 安全组织 Redwood Research 首席执行官巴克・施莱格里斯(Buck Shlegeris)发文称 " 极度担忧 "。他结合此前 OpenAI 模型攻击 Hugging Face 社区事件表示,不确定 Astra 思维链可监测性是否比之前的模型差很多,但如果进一步推进这项技术,大幅增加循环次数,将彻底破坏思维链的可监测性。这一点尤其令人担忧,因为如果调查人员无法查看思维链,相关安全事件调查将会更加困难,这着实令人恐惧。

曾参与调查 Hugging Face 安全事件的 Redwood Research 首席科学家瑞安・格林布拉特(Ryan Greenblatt)也表示,这可能是迄今为止 AI 安全最严重的一次倒退。长期关注 AI 安全的作家兹维・莫肖维茨(Zvi Mowshowitz)则批评这一技术是 " 玩火 ",甚至表示需要法律来阻止 AI 实验室之间竞相降低标准的竞赛。

帕乔基在回应中承认,思维链监控确实脆弱,且正朝着更困难的方向发展,但并非由架构变更导致。OpenAI 自首批推理模型一直致力于维护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化。加强思维链监控仍是当前研究项目的核心目标。

OpenAI 方面表示,将为 Astra 部署额外的思维链监控,以快速监测并遏制潜在的不当行为。另据市场消息,Astra 对循环深度技术的使用有限度,模型思维链仍有望保持可读性。行业内 Anthropic 和 Google DeepMind 等平台已在讨论类似技术。

( 本文来自第一财经 )

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra ai 社交平台 首席执行官 数学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论