量子位 11小时前
都学坏了!奥特曼亲手封锁最强模型Astra,重蹈Mythos覆辙
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

不 er,闹呢?

刚刚,奥特曼发文,宣布推迟最强模型Astra的发布。

Astra 是一个强大的模型,我们正努力让它向所有用户开放。

我们认为,把强大的模型只提供给少数特定人群使用,并不是一个好的策略。

不过,考虑到 Astra 具备网络安全方面的能力,我们还需要多花一点时间,以确保能够安全地开放它。

是的,被「囚禁」了,哈哈哈哈(无力)……又要走一遍 Mythos 的流程

Astra 的披露之旅

所以 Astra,究竟是个啥?

这是 OpenAI 的最新模型类别,踩在 Sol、Terra 和 Luna 之上

你可以理解为,这是 OpenAI 的 Fable 系。

上周,是这只大怪兽的初次亮相。奥特曼在华盛顿向政府介绍了 Astra,重点展示了多个 Agent 长时间协同工作的能力,旨在展示该模型在处理复杂项目方面的潜力,比如——

数学。

果然,几乎是消息出来第二天,OpenAI 便官宣了 Astra 相关的数学突破——

一次性拿下了10 项长期悬而未决的数学与理论计算机科学公开难题,横跨高维几何、编码理论、群论、算子代数、量子复杂度和极值组合学等领域。

数学圈直接炸了,一度引起不少数学家惊呼,甚至有人将这一突破定义为「菲尔茨奖」级。

还有一个大家怀疑比较多的,就是之前Hugging Face 事件

也是很神了,OpenAI 自己公开认领了一项「安全事故」,说自家模型在接受网络安全测试,不小心(并非)逃出了内部隔离环境,一路闯进了 Hugging Face 的家门,直接原地开黑。

给 Hugging Face 也是整无语了,只能拿起GLM 5.2自卫。

具体是哪个模型,OpenAI 当时没说,但后来不少人将这个锅丢在了 Astra 上

这次倒是表态了,说是 Astra 确实很危险,但跟 Hugging Face 这茬没关系嗷。

但无论如何吧,也是吊足了大家胃口,虽然没 Mythos 那次整那么神,但也算 OpenAI 这几个月来最受瞩目的一款模型了吧。

谁能想到,又来 Mythos 那一套啊!!!

OpenAI 表示,考虑到 Astra 网络安全方面的风险,将暂缓这个模型的发布。

「恐怖如斯」的 Astra

所以 Astra,到底触发了什么?

OpenAI 专门写了篇博客,故事是这样的。

过去几天,OpenAI 对 Astra 进行了最新一轮内部评估。

结果显示,该模型在智能体编码和网络安全方面取得了「显著进展」。

结合专家评估意见,公司于昨晚得出结论,无法排除 Astra 在Preparedness Framework下达到「关键(Critical)」级网络能力的可能性。

什么,你问这串英文是个啥玩意儿。

hmm,简单来说就是 OpenAI 于 2023 年末修的一个「安全警报器」,初衷是为能力进展提供识别指南,并据此规划应对措施。

此前发布的模型,包括 GPT-5.6 Sol,均在前沿网络能力评估中被评定为「高(High)」级别,从未触及 Critical 线。

那 Critical 线在哪?

根据 OpenAI 的定义,一个模型达到 Critical 的标准是:

能在无人干预的情况下,自主识别并开发针对众多经过加固的现实世界关键系统的全等级功能性零日漏洞利用,或仅凭一个高层目标描述,就能自主设计并执行针对加固目标的端到端新型网络攻击策略。

Astra 基本就是这个级别。

不过,OpenAI 也打了补丁,目前 Astra 的基准测试和评估仍在继续,初步结果虽然已经差不多实锤,但并不等于已经确认。

同时官方澄清,Astra 并未参与此前 Hugging Face 被攻击事件

基于上述评估,OpenAI 已在内部采取以下措施:

1、对高能力模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络和工具访问、增强模型权重保护和加密、部署额外监测与检测能力、推行沙盒化执行。

2、暂停所有尚未达到上述强化安全标准的 Astra 内部活动。

3、在 Astra 所有智能体应用(含训练和评估环节)中部署通用风险行为监控,审查模型思维链,在高风险活动发生时触发安全响应并中断操作。

4、相关政府机构和选定的 AI 安全组织合作,对 Astra 进行外部能力测试。

5、向第三方测试伙伴提供推荐的安全控制指南,用于安全运行更高风险的评估和工作负载。

其实吧,归根结底就一句话——

寄了。

哈哈!

真那么吓人?

唉,此情此景,我咋总感觉这么眼熟呢。

奥特曼,你这宣发流程,简直和 Mythos 5 一模一样啊。。。

今年 4 月,Anthropic 以网络安全风险为由推迟了其旗舰模型 Mythos 的公开上线,仅通过「Project Glasswing」计划向约 40 家合作伙伴提供访问权限。

当时奥特曼曾在播客节目中公开批评此举为「恐惧营销」,称这显然是一种令人难以置信的营销手段,告诉别人我们造了一颗炸弹,马上就要扔到头上了,但公司有一套价值 1 亿美元的地堡可以卖给你。

如今同样的炸弹落到了 OpenAI 自己头上。

所以为啥又打脸了?

业界有观点认为,「安全威胁叙事」正成为前沿 AI 公司针对DeepSeek、Kimi 等开源模型的竞争策略,当市场普遍接受当前模型确有风险的说法后,公司便能以安全管制为由将开源对手排除出竞争赛道。

好消息是,从评论区来看,用户对这一套说辞并不太买账,每次涉及安全威胁话题,讨论区的质疑声都占了多数。

黄仁勋此前在开源倡议书中也指出,对开源模型的攻击大部分是无稽之谈,如果真为安全着想,最好的方式是公开发布、集众人之力解决问题。

谁能想到,OpenAI 还是如此执着于打安全牌。。。

那还说啥了,等着呗。

关于发布时间,奥特曼在文中表示正在努力让 Astra 向所有用户开放,但未给出新的时间表

求求了,安全管制可以,但至少保证下使用体验,别阉割着玩。

Fable 5 大家也看到了,安全边界做的不好,基本上就只能写写代码,问个生物学问题都能被路由成 Opus 4.8。。。

唉,赶紧整完快点发布吧。

参考链接:

[ 1 ] https://x.com/sama/status/2085862292311396515

[ 2 ] https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

评论
大家都在看