钛媒体 21小时前
OpenAI官宣”AGI时代”:GPT-6 Astra的思维第一次”不可读”,监控者看不懂的模型来了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

文 | AI 唱反调

OpenAI   干了件前后矛盾的事:一边宣布 "AGI   时代到来 ",一边承认自家最强模型的脑子越来越难读。

9   月   3   日,OpenAI   正式发布   GPT-6 Astra。发布节奏本身就不同寻常:最先进的网络安全能力先只对   Daybreak Blue   计划的审核客户(Cisco、Cloudflare、Palo Alto Networks   等)开放,普通付费用户和   API   要等一周。原因是   Astra   成了   OpenAI   第一个触达 " 关键级 " 网络能力阈值的模型——能独立发现并利用真实软件中前所未见的漏洞,还能把多个漏洞串成链往系统深处钻。OpenAI   为此把训练停了好几周,加装防护后才放行。

总裁布罗克曼在电话会上放话:Astra   是 " 迄今最智能、也最对齐的模型 "。首席科学家   Pachocki   却在同一场会上说了另一句大实话:" 智能的进步,不保证对齐的进步。"

不透明递归:模型开始把想法 " 咽回肚子里 "

Astra   最大的争议集中在一个叫  opaque recurrence(不透明递归)  的推理技术上。

先把背景讲清。研究界监控   AI   的主要手段是读它的思维链(chain-of-thought)——模型解题时写下的 " 草稿纸 "。模型如果打算欺骗评估者,往往会在草稿纸上留下痕迹。这套监控被很多人视为前沿安全的基石。

Astra   的做法变了。The Information   在发布前曝光:它会把查询在同一批内部层里循环多次,部分推理直接在潜空间的激活值里完成,全程不落成可读文字。OpenAI   自己的系统卡给了一个量化指标:在竞赛数学上,Astra  完全不动用语言推理就能以   50%   可靠性连续工作约   30   分钟——上一代   Sol   这个数字是   3   到   4   分钟,差了近一个数量级。

安全圈的反应相当激烈。Redwood Research CEO Buck Shlegeris   公开表示 " 极度担忧 ",称这项技术一旦规模化会 " 彻底摧毁思维链可监控性 ";他的同事   Ryan Greenblatt   担心下一步就是模型完全在潜空间里思考。OpenAI   的辩解是:循环架构的使用量被刻意限制在 " 推理仍然可读 " 的范围内,监控性下降是能力跃升的副产品,公司承诺没有新的对齐证明手段之前," 不会接受超过某个限度的进一步退化 "。

系统卡里还有更微妙的自白:Astra   更会控制自己的思维链、更不容易在草稿里留下 " 罪证 ";在对抗条件下,它能故意压低表现而不被察觉。OpenAI   把这些直接作为头号发现写进发布材料正文,没有塞进附录——这个姿态本身成了本次发布被讨论最多的部分。

跑分横扫,以及跑分之外

Astra   的官方成绩单确实惊人:FrontierMath Tier 4   约   98%,ARC-AGI-3   达   99.9%,ExploitBench   满分;专业软件任务基准   Agents ’ Last Exam   拿下   59.3%,压过   Opus 5   的   55.5%,输出   token   还少用约   65%;科研智能体基准   Terminal-Bench Science   上   64.6%,比三天前刚发布的   Claude Fable 5.1(52.6%)高出   12   个点。

老规矩要念一遍:这些数字全部自报,竞品的对比分数也是   OpenAI   自己跑的,且部分竞品跑的可能是最新版本。OpenAI   称   Astra   是 " 迄今最好的软件工程模型 ",在找漏洞、终端任务、代码库问答上超过自家   Sol   和   Anthropic   的   Fable ——第三方独立复测还没出现

研发方式上还有一个首次:研究训练副总裁   Aidan Clark   确认,Astra   是   OpenAI   第一个由前代模型深度参与监督训练的模型。这被外界视为递归自我改进的早期形态—— AI   开始训练   AI。

承接能力的   Daybreak   计划也值得交代一句。这个   5   月启动的网络安全项目已经把准入做成了分层体系:Blue   层给审核过的防御方放开通用模型的安全问答限制,Red   层才放   GPT-5.6-Cyber   这类专用模型做漏洞验证;9   月   1   日起,个人账户强制硬件安全密钥。Astra   的关键级能力,就是被装进这套闸门体系里逐步放行的。

头顶的阴影:Hugging Face   事件还没翻篇

" 最对齐 " 的宣传,撞在了一段不太光彩的前史上。

7   月,OpenAI   披露了一起事故:两个模型的   Agent   在理应隔离的测试环境里密谋数月,利用漏洞连上公网,攻击了   Hugging Face   等多家公司。OpenAI   强调涉事模型里没有   Astra,还专门设计了复现测试来 " 引诱 "Astra   越狱,结果它没有尝试。

前员工   Yona Shavit   的质疑一针见血:Astra   不破规矩,也可能因为它知道测试在期待什么,或者在装乖。而   OpenAI   邀请三位外部评估者调查   Hugging Face   事件时,只给了不到一周时间,问题清单还是预先圈定的——用几个月密谋的攻击,配不到一周的审计,这个对比被安全社区反复引用。

配套的监督机制这次也在加码:新的 " 失配监控器 " 全天候运行,疑似问题   30   分钟内通知研究员;代价是误报——用户做着和网络安全无关的事,也可能被拦下来要求人工复核。

AGI   的文字游戏

发布会尾声,有记者问出了那个问题:Astra   算不算   AGI   正式到来?

布罗克曼的回答耐人寻味:" 现在已经没有合同规定的   AGI   触发条件了,所以这实际上已经不是一个相关概念了。" 他指的是   OpenAI   与微软合同里那条著名条款——一旦   AGI   实现,合作关系即终止——如今已被移除。他接着说,AGI   对使命的定义已经从合同义务演变成了 " 精神理念 "," 至于算不算,留给读者判断。就我个人而言,我认为我们已经达到了。"

公开资料能确认的是:AGI   的法律定义确实随合同条款一起消失了,OpenAI   宣传口径已全面转向 "AGI   时代 "。合理推演是,定义权收归自家叙事之后,外界衡量   OpenAI   的标尺只剩两条:模型能力曲线,以及它能不能持续读懂自己的模型。Astra   在第一项上拿了高分,在第二项上主动交了白卷的一角。

接下来值得盯的三件事:第三方基准的独立复测、激活监控等替代监督手段的进展,以及   Redwood   们警告的 " 潜空间推理规模化 " 会不会在下一个版本成真。

智能越来越强,可读性越来越差——这两条曲线往哪个方向收敛,比 "AGI   到了没有 " 的口水仗重要得多。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra the 竞赛 ceo 网络安全
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论