
人工智能通用智能(AGI)是否已然降临?OpenAI 给出了肯定答案。随着最新模型 GPT-6 Astra 的发布,OpenAI 总裁格雷格 · 布罗克曼(Greg Brockman)直言行业已步入 AGI 时代。英伟达首席执行官黄仁勋亦持相同观点,在 Astra 问世后高调宣称 "AGI 已经到来 "。
这些表态折射出业界对前沿 AI 模型能力的信心激增。然而,此类观点仍属孤立发声,关于 AGI 是否真正实现的争论远未平息。核心分歧在于,目前业界缺乏公认的 AGI 定义或客观测试标准。
黄仁勋的背书尤为引人注目。作为支撑当前 AI 热潮算力基础设施的核心提供商,他今年早些时候曾在播客中表达过类似看法,认为 AGI 已然存在。
Astra 的性能突破与局限
OpenAI 将 Astra 定位为其最智能且对齐度最高的模型,声称其在计算机操作、浏览、软件工程、网络安全、科学及专业工作领域具备最先进的性能。
数据显示,Astra 在高难度评估中表现抢眼:在研究级数学问题基准 FrontierMath Tier 4 上得分 98%,在推理基准 ARC-AGI-3 上得分 99.9%,在网络安全基准 ExploitBench 上更是斩获 100% 满分。OpenAI 还指出,该模型协助解决了长期存在的数学开放性问题。
然而,致力于推动开源 AGI 发展的 ARC Prize 基金会明确泼了冷水。该基金会总裁 Greg Kamradt 撰文指出,饱和通过 ARC-AGI-3 不应被解读为 AGI 实现的证明。" 我们推出 ARC-AGI-3 时已明确表示,饱和该基准并不代表‘实现 AGI 的证明’。尽管 Astra 代表了向泛化能力迈进的重大进展,但我们并未声称它就是 AGI。"
该基准旨在考察代理在不熟悉环境中的表现,但这些环境本质上仍是有界、确定性和封闭式的,与现实世界显著的非封闭式特征存在差异。
因此,支持 AGI 已来的论点不仅基于单点任务的优异表现,更在于其能在日益广泛的智力和专业任务中运作的能力。这种广义的通用性是 AGI 论点的核心。
Gartner 高级副总裁分析师阿伦 · 钱德拉塞卡兰(Arun Chandrasekaran)指出,Astra 在 ARC-AGI-3 上的表现为其在不熟悉但有界环境中代理泛化能力的阶梯式提升提供了证据。该测试要求 AI 代理在无明确指令下,于陌生的抽象回合制环境中探索、推断目标并规划行动。
值得注意的是,Astra 在使用 OpenAI 提供商适配器工具时得分高达 99.9%,而在标准的、与提供商无关的工具下,得分仅为 62.7%。钱德拉塞卡兰强调:" 基准饱和并不确立 AGI。现有证据并未证明其在根本不同的语境中具有通用性。" 他认为,AGI 宣言虽可能影响投资者对 OpenAI 长期市场机会的预期,但估值最终取决于能力能否转化为持久的收入增长及可防御的竞争地位。
Forrester 高级副总裁兼首席分析师查理 · 戴(Charlie Dai)同样认可 Astra 在推理、代码工程及多步骤任务执行上的显著改进,远超早期前沿模型。但他补充道:" 这代表的是更广泛的能力而非已证实的通用智能,因此 AGI 仍是一种解释而非既定事实。"
定义模糊与共识缺失
OpenAI 曾将 AGI 定义为 " 在大多数经济价值工作中超越人类的高度自主系统 "。但这一定义留下了巨大的解释空间,未明确规定所需展示的具体能力、可靠性要求及衡量标准。
CleverTap 数据科学副总裁雅各布 · 约瑟夫(Jacob Joseph)表示,尽管 AGI 通常被归结为能在不同领域推理、具备真正自主性、在未训练场景中学习并达到人类水平的系统,但目前尚无定论。他指出,OpenAI 的定义更多是一个经济阈值而非认知阈值,这意味着 "AGI" 标签更多充当市场信号,而非客观描述。" 测试的关键不在于模型能否自称 AGI,而在于它在长期的野外无监督、负责任的使用中是否经得起考验。"
这种模糊性至关重要。当前 AI 模型可能在复杂数学或编码问题上超越人类,但这并不等同于拥有灵活、可靠且能处理非结构化问题的类人智能。戴指出:" 尚未得到证实的是,基准测试和专业工作流程中的成功是否能转化为人类水平、领域独立的智能——而对于这一阈值,目前不存在普遍接受的定义或测试。"
AI 研究员加里 · 马库斯(Gary Marcus)则强烈反驳黄仁勋的说法。他在文章中写道:" 不幸的是,黄仁勋既没有提供证据也没有给出定义,这感觉像是试图用企业意志接管一个科学问题。" 马库斯认为,人类水平的通用智能涉及从经验中可靠地推广至截然不同的情境、展现足智多谋,并以当前大模型尚未达到的可靠性水平进行操作。
约瑟夫进一步指出,由于缺乏共享标准,AGI 主张难以独立验证。"AGI 没有相当于‘系统卡片’的东西。业界没有达成一致的、可测试的标准,因此这样的声明更像是一种事后提出的标准提案,要求大家事后接受。" 他强调,基准测试本质上是人预先设想的任务,难以证明知识迁移到了真正新颖的情境中。"AGI 的主张最好通过一段较长的时间来评估,观察系统在越来越非封闭的真实环境中的表现。更有趣的问题是,当没有可以操纵的测试且后果真实存在时,它会做什么。"
未来展望
OpenAI 和黄仁勋的论点实质是:AI 系统现已能够执行足够广泛的经济价值智力工作,从而跨越了 AGI 的实践门槛。
戴分析称:" 黄仁勋的背书增加了可信度,因为英伟达在前沿 AI 进展方面拥有独特视角。他的支持应被视为对加速能力趋势的知情验证,而非 AGI 已实现的决定性证明。"
就目前而言,最稳妥的结论是:GPT-6 Astra 代表了前沿 AI 能力的重大扩展。但它是否标志着 AGI 时代的正式开启,仍有待时间与更严苛场景的检验。
【星途科讯 图文丨小林 首发于 ZAKER 科技,转载请注明出处】


