虎嗅APP 昨天
AGI 怎样才算真的来了?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

9 月 3 日,OpenAI 总裁格雷格 · 布罗克曼在发布新模型 GPT-6 Astra 后,抛出了一句话:" 欢迎来到 AGI 时代。"

三天后,黄仁勋在社交平台上把话说得更直接:" 从 ChatGPT 到 o1,再到 GPT-6 Astra,只用了四年。AGI 已经到来。"

众所期待的 AGI,就这么突然被宣布实现了?

显然,事情没这么简单。

GPT-6 Astra 发布前不久,OpenAI CEO 山姆 · 奥尔特曼还在说,AGI 是一个 " 定义极其模糊的词 ",甚至差点称它为 " 无关紧要的营销术语 "。

负责 GPT-6 Astra 关键评测的 ARC Prize 团队也专门提醒:GPT-6 Astra 确实代表了通用化能力的重要进步,但 " 我们并不声称它就是 AGI"。

一边是 " 欢迎来到 AGI 时代 ",一边是 " 我们没有说这是 AGI"。

今天,谁都在谈 AGI,却没有谁能说清楚:AI 究竟要做到什么,才算真正越过了 AGI 这条线。

■榜单上的高评分,能和 AGI 划等号?

先来看看 GPT-6 Astra 最令人咋舌的成绩,是在 ARC-AGI-3 上拿到 99.9%。

ARC-AGI 与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。

这项评测试图衡量的,正是当前 AI 最受质疑的一种能力:面对没见过的问题,能不能现场学会。

99.9% 的得分当然惊人。但这个数字有一个常被省略的前提。

在 ARC Prize 统一提供的标准测试框架中,GPT-6 Astra 得分为 62.7%;接入 OpenAI 提供的专用适配框架后,得分才上升到 99.9%。

后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。

我们无法把 OpenAI 这项操作简单归类为 " 作弊 "。毕竟,现实中的 AI 本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。

问题在于,62.7% 测量的更接近单个模型的能力;99.9% 测量的则是一套经过专门优化的完整系统。

两项成绩都是真的,却不能混为一谈。更不能把 99.9% 的测试得分,顺手换算成 "99.9% 的 AGI"。

此外,GPT-6 Astra 在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。

它在高难数学测试 FrontierMath Tier 4 上达到 97.6%,在计算机操作测试 OSWorld 2.0 上得到 72.6%;但到了更接近真实办公流程的 AutomationBench,成绩降至 41.4%,在复杂专业任务测试 Agents ’ Last Exam 上也只有 59.3%。

这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra 已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。

AI 在封闭考试中表现出色,并不新鲜。

深蓝击败国际象棋世界冠军,Watson 赢下《危险边缘》,AlphaGo 走出 " 神之一手 " 时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。

规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。

■人人都在说的 AGI,是同一个东西吗?

AGI 至今缺少统一共识。

OpenAI 采用了最具经济导向的定义。其在 2018 年发布的公司章程将 AGI 描述为 " 在大多数具有经济价值的工作上超越人类的高度自主系统 "。

这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。

现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。

这一标准与 OpenAI 近年的产品路线高度契合。

推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex 等产品进一步进入软件开发流程。

各项能力最终汇向同一个目标:让 AI 承担更完整的工作,并将模型能力转化为可规模化部署的生产力。

Anthropic 对 AGI 的处理方式更加谨慎。CEO 达里奥 · 阿莫迪认为,这个词承载了过多模糊含义,因此更常使用 " 强大的 AI"。

在 2024 年 10 月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统:

它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。

这幅图景包含能力、自主性和复制规模三个变量。三者共同决定 AI 的现实影响,也会同步放大滥用、失控和系统性风险。

基于这一判断,Anthropic 将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。

Google DeepMind 关注的,则是 AGI 的测量标准。

其 2023 年发布的《Levels of AGI》文章,以 " 性能 " 和 " 通用性 " 为两条主轴,将通用智能划分为 " 新兴 "" 胜任 "" 专家 "" 大师 " 和 " 超人类 " 五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。

2026 年 3 月,DeepMind 进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。

评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。

DeepMind 还与 Kaggle 设立 20 万美元奖金,为其中五个评测较薄弱的维度征集测试方案。

这套思路把 AGI 从单一标签转化为可比较的认知能力图谱,也体现了 DeepMind 的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。

关于 AGI 的定义,不只是一个概念问题。

采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。

定义看似在描述未来,其实也在塑造未来。

■为什么说 "AGI 是否到来 ",成了一场叙事之争?

人们总是习惯把技术革命想象成一个明确的瞬间。

莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗 11 号登上月球。

历史需要日期,也偏爱标志性画面。

回到当下的 AGI 到来之争,"GPT-6 Astra 就是 AGI" 与 " 我们进入了 AGI 时代 ",其实是两种不同性质的表达。

前者是可以被质疑和检验的技术结论:既然它是 AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。

后者则更像一种时代判断。布罗克曼说的正是 " 欢迎来到 AGI 时代 "。这种表述既制造了历史时刻,又保留了足够大的解释空间。

对模型公司和 AI 产业链而言,"AGI" 首先是一种强大的产品叙事。

模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。

"AGI 时代来了 " 却可以把一切压缩成一句话。

它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。

对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。

黄仁勋的表态,也不能脱离这个叙事框架来理解。

2025 年 9 月,英伟达与 OpenAI 宣布达成战略合作意向。按照当时公布的计划,OpenAI 将部署至少 10 吉瓦的英伟达系统,规模相当于数百万颗 GPU;英伟达则准备随着基础设施逐步落地,向 OpenAI 投资最高 1000 亿美元。

这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。

但在最初的合作设想中,英伟达被定位为 OpenAI 扩建 AI 基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于 OpenAI" 迈向部署超级智能 " 的路径。

近期,黄仁勋在宣布 "AGI 已经到来 " 的同时,专门提到训练 Astra 所使用的英伟达计算系统,以及下一批即将上线的 GPU。

整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。

作为全球 AI 算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。

事实上,这也不是黄仁勋第一次宣布 AGI 到来。

2024 年,他曾表示,如果把 AGI 定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。

到 2026 年 3 月,他又在 Lex Fridman 的播客中表示:" 我认为我们已经实现了 AGI。"

这么看来,AGI 不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。

至于 AGI 怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告?

也可能,这就是一个所有人都身处其中、潜移默化的过程。

正如知名 AI 研究者、OpenAI 创始成员 Andrej Karpathy 提出的一个判断,AGI 不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 黄仁勋 社交平台 作弊 数学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论