雷锋网 22小时前
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

每题狂烧 360 美元,GPT-6 真的通关 AGI 了?

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

OpenAI 的最强模型 GPT-6 Astra 终于亮相,它在电脑操作、科研探究和安全防御上都有惊人的突破。而在众多亮眼成绩中,最引起大众热议的是它在 ARC-AGI-3 测试中,成绩逼近 100%。

ARC-AGI-3 是什么?这是目前全球科技圈公认 AI " 智商 " 评测榜,你可以把它理解为 AI 界的门萨俱乐部入会考试。

这个测试里全是不断变化的图形规律题,根本没法刷题,AI 必须像人类一样去探索环境、推测目标,靠临场反应和推理能力找出规律。这在各类评测中较为高阶,更能测试出 AI 到底只是一个工具,还是真智能。

而 GPT-6 Astra 竟然把这个测试打穿了,要知道,上一个模型 GPT-5.6 Sol 的分数还是 38.3%,这实在是一个巨大的飞跃。这种智力甚至碾压人类,在 96% 的关卡中,它都比人类的操作效率更高,平均动作步数比人类少 51.7%。

如果一个 AI 在完全陌生的环境下,真正具备了建立逻辑规律并解决问题的能力。我们可以畅想一下,未来,或许它可能在未知的自动驾驶路况中,做出正确的选择,或者在全新的未知病毒爆发时,迅速推演出特效药的分子结构。

为了探究 GPT-6 Astra 为什么这么聪明,ARC Prize 官方亲自复盘了它的后台记录,发现它在玩游戏时,会生成高效的 " 符号世界模型 "。

符号世界模型是 " 世界模型 " 的高级衍生品。当世界模型像艺术家一样,用画面来预测未来时;即时符号世界模型更像一个数学家,将现实世界抽象为逻辑符号和因果代码。

这个技术被公认为 AI 迈向高级推理的必经之路。

01

符号世界模型是什么?

过去,很多大模型在 ARC-AGI 系列基准测试中拿不到高分一个重要原因,就是它们习惯了 " 暴力试错 "。AI 会把游戏画面切成像素块,先随便点一下,不对就换个方向,靠运气通关。

这种模式下,就算有一些分数的突破,AI 也不是真正理解和掌握游戏规则。

符号世界模型之所以能掌控全局,正在于它是对周围环境物理规律、因果关系充分理解后,通过精密计算后做出选择。

在实际测试中,当 GPT-6 Astra 进入陌生的图形游戏后,它会开始用自创的 DSL ,一种专属的代数符号系统,对观察到的环境做大量笔记。比如,它会精准记录下游戏潜在的隐性规则、一连串即将执行的指令,甚至将每一个像素的运动轨迹都精确映射到坐标系上。

这种代数的记录方式带来的是唯一确定的世界状态,相较于之前模型用自然语言交互产生的歧义性,这种符号化表述会让准确率带来史诗级飞跃。

然后,它会先在脑海里写出一套 Python 代码逻辑:" 如果我按 A,图形就会左转 90 度 "。

接着,它会在自己大脑里建一个 " 虚拟沙盒 ",在脑中模拟接下来的计划。确认逻辑闭环、准确无误后,它才会在现实游戏中点下第一步。这就是为什么,它的操作效率远高于人类的原因。

为了摸透 GPT-6 Astra 能力边界,红队测试平台 PRO ‑ LONG 把它放进代码沙盒,允许 AI 自主编写、运行自定义代码。

结果,GPT-6 Astra   居然开始为每一款游戏 " 量身定制 " 工具。比如在一个有守卫巡逻的复杂迷宫游戏里,GPT-6 Astra 自己写了个导航系统,接着又添加了战斗规则,还模拟了守卫的巡逻路线,最后通过这套自制工具链完美预测并校验了成果。

早些年,这套符号推演、自主造工具的能力,完全依赖外部 Harness 外挂框架实现。外挂帮模型做画面转译、状态记录、结果校验,但是缺点十分突出:模型和外挂来回传输数据带来高额延迟;外挂的工程能力与大模型本身的权重训练完全脱节;由于对云端计算环境和外部脚本的重度依赖,这类高阶能力很难被部署到端侧边缘硬件上。

而   GPT-6 Astra 现在把大量属于 Harness 的能力,内化进模型自身权重。一直推崇符号世界模型的顶尖学者 Gary Marcus 忍不住盛赞 GPT-6 Astra 是这一路线的重大胜利。

近一两年来,学术与产业界在这个方向涌现了大量核心成果,从哈佛、MIT 到 Google DeepMind,所有人都在押注 " 符号世界模型 "。在通往 AGI 的无数条分叉路口前,业界正在达成某种底层的技术共识。

02

  分数这么高,AGI 稳了?

出题人亲自泼冷水

很有意思的是,在全网为这一刷榜分数沸腾时,不少人转发 OpenAI 总裁 Greg Brockman 那句 " AGI 已来 " 时,ARC Prize 基金会总裁 Greg Kamradt 亲自下场泼了冷水。

他是出题人中的核心人物,基准怎么设计、分数怎么解读,他最有发言权。从评测角度,他认为分数虽然是真的,但这玩意离 AGI 还差着十万八千里。

到目前为止,他已经看到了不少团队靠 Agent Harness 在 ARC-AGI-3 上拿到 90% 以上,比如有超强记忆外挂的 PRO-LONG、擅长深度推演的 Tycho、能自我进化编程环境的 Prime Agent。

这些拿高分的产品都有共同的技术配方,即拥有无损内存、程序化分析、显式假设检验、持久状态、低成本内部计算五大部分。

其中无损内存负责记忆,程序化分析负责逻辑,显式假设检验负责推演,持久状态负责多轮交互的上下文,低成本内部计算负责廉价内部算力,让 AI 能在虚拟环境里疯狂试错后再输出正确答案。这些共同组成了一个无敌的 Harness,会补足模型自身的不足。

GPT-6 Astra 逼近 100% 的成绩,同样用了一套豪华的 Harness 加持,它借助了专门定制的 " 供应商适配器基座 ",利用连续对话和上下文压缩来帮它撑起逻辑链,每跑完一局游戏,就需要消耗 360 美元的昂贵算力。如果完整跑完一整场测试,总算力账单会高达惊人的 1.8 万美元(约合 13.5 万人民币)! 

人类解一个图形谜题可能只需要几分钟,按人脑 20W 代谢功率折算电费,不到半美分;即使算上支付给受试者的真实时薪补贴,折合每局也就 12.78 美元,而 AI 要花掉 360 美元。这种靠 " 钞能力 " 拼出来的成绩,真的能成为普通人触手可及的 AGI 吗?

当然,GPT-6 Astra 已经开始把 Harness 的能力逐步内化,如果继续发展,模型内部的潜在计算能力会越来越厉害。不过,因为其推理过程开始不透明,开发者们也不知道,AI 是真的懂了,还是找到了更高效的作弊途径。

回到上面的问题,GPT-6 Astra 到底算不算 AGI ?

对于这个问题,Greg Kamradt 在他的长文最后,给出了一个充满哲思的回应。人类为什么能被视为 " 通用智能 ",因为人类可以适应任何未知的世界,哪怕是把古代的婴儿扔到现代,他同样能学会坐地铁、用手机。这种智能延续千年,不断推进科技进步。但现在科技界要氪金通过的测评,只是给 AI 办的一场 " 图形消消乐考试 "。

这只是证明 AI 正在变聪明,但绝不是 AGI 到来的证据。

参考链接:

https://arcprize.org/blog/astra https://x.com/gregkamradt/status/2095600045873828013?s=46

上车,雷峰网 ( 公众号:雷峰网 ) 带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 规律 智商 自动驾驶 考试
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论