就在刚刚,OpenAI 多线齐发,为下一代模型 Astra(传说中的 GPT-6)拉满预热:
官方突然放出技术长文,首次公开 Astra 的能力底牌;
紧接着,奥特曼亲自下场写 " 小作文 ",讲述 Astra 为何迟迟未能上线;
随后,两位华人研究员接连发声,带着一手细节晒出了此前从未公开的内部测试成绩。
短短几个小时,所有信号都指向同一个方向:
OpenAI 的下一代旗舰模型,已经箭在弦上。
奥特曼在小作文中透露,Astra 其实早已完成训练,迟迟未发不是因为模型还不够强。
恰恰相反,这是因为 Astra 已经强到了公司不得不主动踩下刹车。
奥特曼将这段经历形容为一种持续的拉扯:
既兴奋于 Astra 带来的能力跃升,又焦虑于没人能够完全预判这些能力的后果。
于是刚过去的整个夏天,OpenAI 几乎都在给 Astra 补安全、做对齐、加护栏。
他甚至表示,Astra 之后的模型,必要时还要主动降速,以便给安全和对齐研究留出时间。
??Astra 究竟强到了什么程度?OpenAI 又凭什么认为现在就能发了?
这次公开的技术博客,或许为我们提供了一个观察窗口。
漏洞识别能力超越 GPT-5.6 Sol、内部测试收获满分答卷
按照官方说法,Astra 这次之所以能被放出来,核心原因是它已经达到 " 网络安全关键级 "(Cyber-Critical)能力门槛。
这是 OpenAI 首个被正式划入这一等级的模型。
所谓 " 关键级 ",意味着 Astra 在获得相应工具和环境权限后,已经能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统,不再需要人类一步步指导。
最直观的一项成绩,是Astra 在公开漏洞利用基准 ExploitBench 上拿到了 100% 的成功率。
公开题难不倒它,OpenAI 只好临时给它出了一套新卷。
团队收集了 2026 年 6 月至 8 月刚刚披露的 20 个高危 V8 漏洞。
这些漏洞均出现在 Astra 的知识截止日期之后,基本排除了模型靠训练数据 " 背答案 " 的可能。
结果面对这套内部新题,Astra 依然显著领先 GPT-5.6 Sol,而且使用的 Token 更少。
参与 Astra 研发的 Jiawei Liu 把差距概括得更加直白:
在这项内部测试中,Astra 的网络安全能力约为 GPT-5.6 Sol 的 4 倍。
更让人意外的是,在一次测试中,Astra 自主发现并利用了两个零日漏洞,还将它们串成了一条完整的攻击链:
面对经过加固的浏览器,Astra 从一份 HTML 文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令。
面对加固操作系统,它又完成了本地提权,从一个普通低权限账户一路拿到 root 权限。
也就是说,Astra 已经不只是帮程序员审查代码、寻找 Bug。
它开始能够独立完成一场高难度的红队攻击。
这也是 OpenAI 此前迟迟不敢放行 Astra 的原因。
一旦这样的能力被用于防守,它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞,但如果落入攻击者手中,同样可能大幅降低发动复杂网络攻击的门槛。
不过,这份成绩也需要加上一个限定。
测试中的 Astra 获得了 Daybreak Blue 级别的高级工具和环境权限,并不代表未来普通用户拿到的默认版本也具备同等攻击条件。
相关结果目前也主要来自 OpenAI 内部评估,仍有待第三方验证。
但至少有一点已经确定:
到了 Astra 这个阶段,摆在 OpenAI 面前的已经不再是能力问题。
安全问题,已经成为那把达摩克利斯之剑。
两道安全闸门:既防恶意滥用,也防模型自行失控
如何让这把剑不要乱伤人?
OpenAI 给出的方案,是同时守住两条风险路径:一条防人,一条防模型。
第一条,防止用户恶意滥用 Astra。
除了专门的安全训练,OpenAI 还会利用系统分类器、持续监控和威胁检测,识别多轮对话与长时间任务中的可疑操作。
在网络安全越狱测试中,Astra 对危险请求的拒绝率达到 91.5%,GPT-5.6 Sol 则为 59%。
同时,Astra 的高级网络安全能力不会直接向所有用户开放,它会先交给少量 Alpha 测试者,再通过 Daybreak Blue 等受控项目逐步释放。
第二条,防止模型自己跑偏。
这里的风险更加隐蔽:
即使用户没有恶意,模型会不会擅自扩大任务范围?会不会调用未经授权的工具,甚至绕开安全审查?
OpenAI 为此搭建了一套 " 蜜罐(honeypot)" 测试。
面对极难甚至无解的任务,测试环境会故意留下一条越权 " 作弊 " 的捷径,模型可以老老实实攻击指定目标,也可以越过授权边界,转而入侵周边测试设施来完成任务。
结果,GPT-5.6 Sol 在 56% 的测试中尝试走捷径,Astra 则一次也没有。
在另一项测试中,Astra 的操作被自动审查系统拒绝后,同样没有重试危险命令或尝试绕过限制。
此外,OpenAI 还会监控模型的推理过程。
一旦发现异常倾向,系统可以减速、暂停,甚至直接终止任务。
虽然确实存在代价(部分正常任务可能因此变慢,甚至被误判中断),但在 OpenAI 看来,这是放行 Astra 必须付出的安全成本。
不过 OpenAI 也承认,这些措施终究只是外部 " 刹车 ",无法替代模型自身的对齐:
真正的安全,是让模型从一开始就不会驶出边界。
浙大同济校友站上 Astra 研发一线
要把这句话变成现实,最终还得回到造模型的人。
虽然 OpenAI 尚未公布 Astra 团队名单,但顺着这轮公开发声,至少两位深度参与其中的华人研究员已经浮出水面。
一位是前面提到的 Jiawei Liu。
他目前是 OpenAI 研究员,2021 年本科毕业于同济大学计算机专业。
本科期间,他就参与开发了高性能人体姿态估计框架 HyperPose,主要负责模型推理引擎,相关成果还入选 ACM Multimedia 2021,项目当时已在 GitHub 收获超过 1000 颗星。
此后,他前往伊利诺伊大学厄巴纳 - 香槟分校攻读计算机博士,师从软件工程学者张令明(Lingming Zhang),研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。
博士期间,他参与开发的工具在 PyTorch、TensorFlow 等机器学习系统中发现了 300 多个严重 Bug;
代码模型 Magicoder 还被 Meta Llama 3.1、Google CodeGemma 和 IBM Granite 采用。
2025 年博士毕业加入 OpenAI 后,他研究的问题依然一脉相承:
如何让 AI 更会写代码,也更会发现代码中的漏洞。
另一位则是 Xiangyu Qi (漆翔宇)。
漆翔宇本科毕业于浙江大学计算机科学与技术专业,2021 年前往普林斯顿大学攻读电气与计算机工程博士,研究方向集中于大模型鲁棒性、越狱攻击与安全对齐。
他最受关注的一项工作,是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。
这篇论文指出,大模型的安全对齐不能只依赖回答开头的几个 Token,否则随着生成继续,原本的安全防线仍可能被攻击者撕开。
该论文最终从 11672 篇投稿中脱颖而出,成为 ICLR 2025 仅有的 3 篇杰出论文之一。
2025 年博士毕业后,漆翔宇加入 OpenAI 担任技术团队成员,继续研究大模型鲁棒性,并参与网络安全模型相关工作。
从浙大到普林斯顿,再到 OpenAI,他一路追问的,也正是 Astra 如今必须直面的问题:
能力可以越来越强,边界不能越来越模糊。
By the way,不知道等 Astra 正式发布后 OpenAI 是否会公布完整名单。
GPT-4 之前,OpenAI 还曾专门列出数百位贡献者,而到了 GPT-5 和 GPT-5.5,System Card 越写越厚,研究员名单却越藏越深。
背后的原因众所周知,防的就是 Meta 小扎这样爱四处挖角的人。
也算是一种 ptsd 了。。。
One More Thing
就在 OpenAI 大谈如何监控 Astra、避免模型失控时,The Information 爆料称:
Astra 使用了一项名为 " 循环深度 "(Recurrent Depth)的技术。
传统模型在生成下一个 Token 前,会让信息依次经过固定数量的网络层,而循环深度则会让信息在同一组网络层中反复处理,相当于让模型在内部 " 多想几遍 "。
这项技术有望提升能力、降低成本,同时也可能让更多推理发生在模型内部,不再完整呈现为人类能够读懂的文字。
换言之,模型可能想得更深,但人类却越来越看不懂了。
长期关注 AI 安全政策的 Nathan Calvin 因此警告,这项技术可能破坏思维链的可监控性。
这就很微妙了:
OpenAI 一边说要盯紧 Astra 在想什么,另一边的新技术却可能让它越来越不爱把心里话说出来。
啊这。。。
好在 The Information 透露,OpenAI 目前已经限制了这项技术在 Astra 中的使用。
翻译翻译,现在能看懂,以后就不好说了。
另外,之前一直传闻 Astra 很可能在这周四(9 月 3 日)发。
随着 A 社发布最新一代 5.1 模型,感觉这个说法的合理性越来越高了。
螳螂捕蝉,黄雀在后。
是谁又悟了!
参考链接:
[ 1 ] https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
[ 2 ] https://xiangyuqi.com
[ 3 ] https://x.com/JiaweiLiu_/status/2094901279239921816?s=20
[ 4 ] https://jw-liu.xyz/
[ 5 ] https://x.com/sama/status/2094934592062959832?s=20
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦