今日凌晨,科技圈再次被一声巨响吵醒。
" 世界上最智能、对齐程度最高 " 的模型,GPT-6 Astra 来了。
前者,无可否认;后者,明显就不是事实。
具体的后面再说。
更吵的是,OpenAI 总裁格雷格 · 布罗克曼高调宣布:AGI 时代来了。
大部分人的第一反应大概都是,吹牛。
IPO 压力大,吹一吹,可以理解。
但是,目前对 AGI 本身就没有统一定义," 进入 AGI 时代 " 与 " 已经完成 AGI" 也不是一个意思。
从 OpenAI 的角度出发,这次可能确实没吹牛。
01
目前,对 AGI 的定义主要有三个方向。
第一,实用层面。
比如,OpenAI 自己的定义是:高度自主、能够在大多数具有经济价值的工作中超越人类的系统。
关键词并非 " 超越人类 ",而是:高度自主、经济价值工作。
第二,最靠谱的,学术层面。
DeepMind 提出了一个 "Levels of AGI" 框架,把 AGI 拆成性能深度、能力广度和自主性三个维度。
简单来说,AGI 的形成是一个渐进式能力谱系,而不是达到什么指标后突然就成了 AGI。
也可以理解为进化与基因突变的区别,AI 会一点一点获得越来越强的通用能力。
所以,AGI 是一个过程,而非一个节点。
这也能解释,为什么同一个模型,有人认为已经接近 AGI,有人却认为还差得远。
因为他们拿的不是同一把尺子。
第三,科幻层面。
这个就不必介绍了,就是科幻电影里那种,有意识、能交流、自我迭代的机器人。

科幻层面上,GPT-6 Astra 肯定远远不是 AGI。
那另外两个层面呢?
先看技术指标,OpenAI 这次给出的成绩单确实非常夸张:
上下文与生成极限:支持 105 万 Token 超长上下文输入窗口,单次最大可生成 12.8 万 Token 输出。
ARC-AGI-3(抽象推理):成绩达到 99.9%,彻底击碎了 " 大模型只是概率填空 " 的质疑。
FrontierMath Tier 4(前沿数学):98%,甚至在测试期间协助人类数学家推演并解决了个别长期悬而未决的开放问题。
ExploitBench(网络安全攻防):100% 满分,Astra 在没有任何人类干预的情况下,自主发现了 2 个此前未知的零日漏洞,并成功构建出链式利用代码突破了高防护系统。
OSWorld 2.0(计算机自主使用 /Agent 能力):72.6%(上一代 GPT-5.6 Sol 为 65.7%),在完成同等复杂的桌面与浏览器跨软件综合操作任务时,将耗时从 75 分钟压缩到了 40 分钟,效率提升了约 47%。
……
在性能方面,GPT-6 Astra 几乎全方位碾压 Anthropic 刚刚上线的 Fable 5.1。
更关键的是,OpenAI 在公告中多次出现 " 饱和 " 一词,意思就是现有的榜单测不出新模型的上限
这还真不是吹牛。

ARC Prize 指出,Astra 出现了一个很有意思的行为:它会把陌生环境压缩成符号化的世界模型,再根据规则进行规划。
这一行为的出现,比 99.9% 这个分数的意义更大。
因为 ARC-AGI-3 本身就是在测试 " 陌生环境智能 " 的能力。
模型面对的是一个此前不熟悉的环境,它需要自己理解规则、构建内部世界模型、规划行动,然后不断试错。
大家过去的质疑没错,大模型的本质确实就是 " 概率填空 ",把试错后的结果呈现出来。
但现在,Astra 是先理解新环境的规则,再去行动。
AI 正在从 " 模式匹配器 " 向 " 环境建模器 " 转变。
这才是 GPT-6 Astra 真正有价值的体现,也是 OpenAI 为什么有底气喊出 "Welcome to the AGI era" 的最大底气。
从实用层面看来,不能完全否定这句话。
02
GPT-6 Astra 在特定的复杂工作流中,确实展现出了极强的实用性。
OpenAI 公布的数据非常直观:
在 Agents ’ Last Exam 上,GPT-6 Astra 达到 59.3%,GPT-5.6 Sol 为 53.6%。
在 OSWorld 2.0 上,Astra 达到 72.6%,GPT-5.6 Sol 为 65.7%。
在 ScreenSpot-Pro 上,Astra 达到 92.7%,GPT-5.6 Sol 为 76.9%。
在法律科技公司 Legora 的真实财务审计测试中,Astra 将财务报表处理工作流的效率提升了 40%,并且在跨越 41 份冗长法律文档的交叉比对中,准确找出了所有隐蔽错误。
在量化交易机构 Jane Street 的内部测试中,Astra 不仅大幅减少了代码迭代次数,还能在发现指令模糊时主动向人类发送异步提问,并继续处理其他不依赖答复的子任务。
简单来说,GPT-6 Astra 在特定赛道,真的展现出了超人的生产力。
它不再是一种 " 软件功能 ",而是实实在在的数字劳动力。

从 OpenAI 自己定义的实用层面触发,GPT-6 Astra 确实实现了自主、能够在具有经济价值的工作中超越人类。
称之为 AGI 不能说完全说错。
当然,也不完全对。
距离真正的 " 实用 ",GPT-6 Astra 依然存在很明显的缺陷。
第一,长期自主性。
它确实已经可以自主完成复杂任务,但 " 完成一个复杂任务 " 和 " 连续数天、数周、数月稳定地承担一个复杂岗位 ",完全是两码事。
让 Astra 做一次性工作,它可能表现得非常优秀。
但是让它长时间面对突发情况、制度调整、数据异常、人际沟通、权限变化、目标变化,并且始终保持正确决策,就很难做到。
尽管 OSWorld 2.0 达到了 72.6%,但在面对超过数天的开放式、无明确边界的现实业务时,Astra 依然会在多步长尾调用中累积微小误差,最终导致决策偏离目标。
第二,成本。
虽然 OpenAI 宣称 Astra 在同等任务下的 API 成本比 GPT-5.6 Sol 和 Claude Fable 5.1 降低了 27%~31%,但在进行上百万 Token 上下文与上千步多工具连续调用的复杂作业时,单次任务的计算成本依然高达数十美元。
对于绝大多数工作而言,这一成本远远差过了人类的薪水,并不划算。
第三,安全。
OpenAI 研究副总裁艾丹 · 克拉克透露,GPT-6 Astra 的训练消耗了超过 10 万张 GPU,引入了 " 隐式递归 / 循环深度 " 计算机制。
过去的语言模型依赖显式链式思考显式输出 Token,而 Astra 允许模型在其内部潜在状态中进行深度递归演算,不需要把思考过程全写在屏幕上。
这不仅大幅节省了输出 Token(最高减少 20%),还极大地提升了多步推理的连贯性。
但是,对 AI 思维链的监控也因此变得极其困难。
Astra 可以在许多防护严密的系统里发现此前未知的安全漏洞,并在无需人工逐步指导的情况下设计漏洞利用方式。
OpenAI 自己也承认,Astra 的安全监管成本极高,甚至达到了威胁级别的 " 临界危急 " 阈值。

以上,结论是什么?
从技术上、产业应用上,Astra 确实表现出了 OpenAI 对 AGI 定义的特点。
只是因为无法胜任长期任务、太贵、不安全等等问题,它并不能大规模落地。
既然如此,那它其实就没有那么 " 实用 ",当然还不能称之为 AGI。
但这并不妨碍 AGI 时代的到来。
03
按照上面提到的 DeepMind 框架,AGI 是一个过程,而非节点。
这其实很符合当下的情况。
真正转变不是某个人宣布 "AGI 已实现 ",而很多原本需要人类完成的数字工作,逐渐被交给 AI,而且 AI 真的能长期稳定地完成。
过去五年的 AI 革命,主要是在改造信息生产。
GPT-6 Astra 确实带来了历史性的变化:AI 可以直接作为劳动力使用。
只是这个 " 可以 ",目前并非 " 普遍 " 而已。
比如 Astra 的公开部署,就是逐步进行中的。首先向一部分组织开放,之后才逐步扩大到 Plus、Pro、Business 和 Enterprise 用户,以及 API 和 AWS。
包括后续的模型,当然也是如此。
所以以上讨论的一切,本身仍然是技术证明阶段,到完整的社会证明仍需要一段时间。
这一段时间,或许就是从可以到普遍的过程。
这可能才是 "AGI 时代 " 的真正含义。
不是 AI 突然拥有了灵魂,而是它终于开始上班了。(全文完)
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


登录后才可以发布评论哦
打开小程序可以发布评论哦