量子位 23小时前
“GPT-6”Astra能力首次公开!浙大同济校友参与研发
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

就在刚刚,OpenAI 多线齐发,为下一代模型 Astra(传说中的 GPT-6)拉满预热:

官方突然放出技术长文,首次公开 Astra 的能力底牌;

紧接着,奥特曼亲自下场写 " 小作文 ",讲述 Astra 为何迟迟未能上线;

随后,两位华人研究员接连发声,带着一手细节晒出了此前从未公开的内部测试成绩。

短短几个小时,所有信号都指向同一个方向:

OpenAI 的下一代旗舰模型,已经箭在弦上

奥特曼在小作文中透露,Astra 其实早已完成训练,迟迟未发不是因为模型还不够强。

恰恰相反,这是因为 Astra 已经强到了公司不得不主动踩下刹车。

奥特曼将这段经历形容为一种持续的拉扯:

既兴奋于 Astra 带来的能力跃升,又焦虑于没人能够完全预判这些能力的后果

于是刚过去的整个夏天,OpenAI 几乎都在给 Astra 补安全、做对齐、加护栏。

他甚至表示,Astra 之后的模型,必要时还要主动降速,以便给安全和对齐研究留出时间。

??Astra 究竟强到了什么程度?OpenAI 又凭什么认为现在就能发了?

这次公开的技术博客,或许为我们提供了一个观察窗口。

漏洞识别能力超越 GPT-5.6 Sol、内部测试收获满分答卷

按照官方说法,Astra 这次之所以能被放出来,核心原因是它已经达到 " 网络安全关键级 "(Cyber-Critical)能力门槛

这是 OpenAI 首个被正式划入这一等级的模型。

所谓 " 关键级 ",意味着 Astra 在获得相应工具和环境权限后,已经能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统,不再需要人类一步步指导。

最直观的一项成绩,是Astra 在公开漏洞利用基准 ExploitBench 上拿到了 100% 的成功率

公开题难不倒它,OpenAI 只好临时给它出了一套新卷。

团队收集了 2026 年 6 月至 8 月刚刚披露的 20 个高危 V8 漏洞。

这些漏洞均出现在 Astra 的知识截止日期之后,基本排除了模型靠训练数据 " 背答案 " 的可能。

结果面对这套内部新题,Astra 依然显著领先 GPT-5.6 Sol,而且使用的 Token 更少

参与 Astra 研发的 Jiawei Liu 把差距概括得更加直白:

在这项内部测试中,Astra 的网络安全能力约为 GPT-5.6 Sol 的 4 倍。

更让人意外的是,在一次测试中,Astra 自主发现并利用了两个零日漏洞,还将它们串成了一条完整的攻击链:

面对经过加固的浏览器,Astra 从一份 HTML 文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令。

面对加固操作系统,它又完成了本地提权,从一个普通低权限账户一路拿到 root 权限。

也就是说,Astra 已经不只是帮程序员审查代码、寻找 Bug。

它开始能够独立完成一场高难度的红队攻击

这也是 OpenAI 此前迟迟不敢放行 Astra 的原因。

一旦这样的能力被用于防守,它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞,但如果落入攻击者手中,同样可能大幅降低发动复杂网络攻击的门槛。

不过,这份成绩也需要加上一个限定。

测试中的 Astra 获得了 Daybreak Blue 级别的高级工具和环境权限,并不代表未来普通用户拿到的默认版本也具备同等攻击条件。

相关结果目前也主要来自 OpenAI 内部评估,仍有待第三方验证。

但至少有一点已经确定:

到了 Astra 这个阶段,摆在 OpenAI 面前的已经不再是能力问题。

安全问题,已经成为那把达摩克利斯之剑

两道安全闸门:既防恶意滥用,也防模型自行失控

如何让这把剑不要乱伤人?

OpenAI 给出的方案,是同时守住两条风险路径:一条防人,一条防模型。

第一条,防止用户恶意滥用 Astra

除了专门的安全训练,OpenAI 还会利用系统分类器、持续监控和威胁检测,识别多轮对话与长时间任务中的可疑操作。

在网络安全越狱测试中,Astra 对危险请求的拒绝率达到 91.5%,GPT-5.6 Sol 则为 59%

同时,Astra 的高级网络安全能力不会直接向所有用户开放,它会先交给少量 Alpha 测试者,再通过 Daybreak Blue 等受控项目逐步释放。

第二条,防止模型自己跑偏

这里的风险更加隐蔽:

即使用户没有恶意,模型会不会擅自扩大任务范围?会不会调用未经授权的工具,甚至绕开安全审查?

OpenAI 为此搭建了一套 " 蜜罐(honeypot)" 测试。

面对极难甚至无解的任务,测试环境会故意留下一条越权 " 作弊 " 的捷径,模型可以老老实实攻击指定目标,也可以越过授权边界,转而入侵周边测试设施来完成任务。

结果,GPT-5.6 Sol 在 56% 的测试中尝试走捷径,Astra 则一次也没有。

在另一项测试中,Astra 的操作被自动审查系统拒绝后,同样没有重试危险命令或尝试绕过限制。

此外,OpenAI 还会监控模型的推理过程。

一旦发现异常倾向,系统可以减速、暂停,甚至直接终止任务。

虽然确实存在代价(部分正常任务可能因此变慢,甚至被误判中断),但在 OpenAI 看来,这是放行 Astra 必须付出的安全成本。

不过 OpenAI 也承认,这些措施终究只是外部 " 刹车 ",无法替代模型自身的对齐:

真正的安全,是让模型从一开始就不会驶出边界

浙大同济校友站上 Astra 研发一线

要把这句话变成现实,最终还得回到造模型的人。

虽然 OpenAI 尚未公布 Astra 团队名单,但顺着这轮公开发声,至少两位深度参与其中的华人研究员已经浮出水面。

一位是前面提到的 Jiawei Liu

他目前是 OpenAI 研究员,2021 年本科毕业于同济大学计算机专业。

本科期间,他就参与开发了高性能人体姿态估计框架 HyperPose,主要负责模型推理引擎,相关成果还入选 ACM Multimedia 2021,项目当时已在 GitHub 收获超过 1000 颗星。

此后,他前往伊利诺伊大学厄巴纳 - 香槟分校攻读计算机博士,师从软件工程学者张令明(Lingming Zhang),研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。

博士期间,他参与开发的工具在 PyTorch、TensorFlow 等机器学习系统中发现了 300 多个严重 Bug;

代码模型 Magicoder 还被 Meta Llama 3.1、Google CodeGemma 和 IBM Granite 采用。

2025 年博士毕业加入 OpenAI 后,他研究的问题依然一脉相承:

如何让 AI 更会写代码,也更会发现代码中的漏洞。

另一位则是 Xiangyu Qi (漆翔宇)

漆翔宇本科毕业于浙江大学计算机科学与技术专业,2021 年前往普林斯顿大学攻读电气与计算机工程博士,研究方向集中于大模型鲁棒性、越狱攻击与安全对齐。

他最受关注的一项工作,是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。

这篇论文指出,大模型的安全对齐不能只依赖回答开头的几个 Token,否则随着生成继续,原本的安全防线仍可能被攻击者撕开。

该论文最终从 11672 篇投稿中脱颖而出,成为 ICLR 2025 仅有的 3 篇杰出论文之一。

2025 年博士毕业后,漆翔宇加入 OpenAI 担任技术团队成员,继续研究大模型鲁棒性,并参与网络安全模型相关工作。

从浙大到普林斯顿,再到 OpenAI,他一路追问的,也正是 Astra 如今必须直面的问题:

能力可以越来越强,边界不能越来越模糊

By the way,不知道等 Astra 正式发布后 OpenAI 是否会公布完整名单。

GPT-4 之前,OpenAI 还曾专门列出数百位贡献者,而到了 GPT-5 和 GPT-5.5,System Card 越写越厚,研究员名单却越藏越深。

背后的原因众所周知,防的就是 Meta 小扎这样爱四处挖角的人。

也算是一种 ptsd 了。。。

One More Thing

就在 OpenAI 大谈如何监控 Astra、避免模型失控时,The Information 爆料称:

Astra 使用了一项名为 " 循环深度 "(Recurrent Depth)的技术

传统模型在生成下一个 Token 前,会让信息依次经过固定数量的网络层,而循环深度则会让信息在同一组网络层中反复处理,相当于让模型在内部 " 多想几遍 "。

这项技术有望提升能力、降低成本,同时也可能让更多推理发生在模型内部,不再完整呈现为人类能够读懂的文字。

换言之,模型可能想得更深,但人类却越来越看不懂了

长期关注 AI 安全政策的 Nathan Calvin 因此警告,这项技术可能破坏思维链的可监控性。

这就很微妙了:

OpenAI 一边说要盯紧 Astra 在想什么,另一边的新技术却可能让它越来越不爱把心里话说出来。

啊这。。。

好在 The Information 透露,OpenAI 目前已经限制了这项技术在 Astra 中的使用。

翻译翻译,现在能看懂,以后就不好说了。

另外,之前一直传闻 Astra 很可能在这周四(9 月 3 日)发。

随着 A 社发布最新一代 5.1 模型,感觉这个说法的合理性越来越高了。

螳螂捕蝉,黄雀在后。

是谁又悟了!

参考链接:

[ 1 ] https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20

[ 2 ] https://xiangyuqi.com

[ 3 ] https://x.com/JiaweiLiu_/status/2094901279239921816?s=20

[ 4 ] https://jw-liu.xyz/

[ 5 ] https://x.com/sama/status/2094934592062959832?s=20

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 奥特曼 作文 箭在弦上
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论