驱动之家 9小时前
OpenAI史上最强!GPT-6一天攻破5道至今未解数学难题
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 5 日消息,近日,OpenAI 正式推出品牌史上能力最强大模型 GPT-6 Astra,官方将其定义为全球智能水平最高、对齐效果最优的生成式 AI 模型。

其训练工作在美国德州 Stargate 超算基地完成,动用超过 10 万张 GPU 完成预训练,也是 OpenAI 首次大规模使用前代模型参与监督训练的旗舰产品。

那么它的能力有多强?

Epoch AI 联合曼彻斯特大学发布 FrontierMath Erd ő s(FME)基准测试论文,GPT-6 Astra 成为全场唯一交出有效答卷的大模型。

在包含 68 道人类悬而未决的 Erd ő s 数学难题的严苛测试中,它一举攻克 5 道长期未解猜想,其余 GPT-5.6、Claude Fable 5.1 等四款主流 AI 全部得 0 分。

测试选用全部没有标准答案的开放难题,杜绝训练集 " 背答案 ",要求 AI 输出 Lean 形式化证明,由内核自动核验对错;所有模型统一预算 300 美元、限时 72 小时,条件完全公平。

标准测试环节,GPT-6 Astra 成功解决 2 道题目,放宽算力预算的追加实验中又攻克 3 道,其中就包括 Erd ő s18 岁提出、自称 " 人生第一个正经问题 " 的 1931 年解离集猜想,以及极值图论赫赫有名的 Erd ő s-S ó s 猜想,这些题目数十年来困住无数顶尖数学家。

五道成果里,既有构造反例推翻旧猜想,也有完整证明新命题,难度非同一般。

GPT-6 Astra 完成五道题全部尝试合计消耗超 22 万美元算力,而标准基准测试本身只花了约 2 万美元,按 300 美元一次、3% 成功率计算,解出一道重要开放问题的期望成本约为 1 万美元。

不过也有论文指出,模型有可能想出正确思路,却无法转换成 Lean 形式证明;基准只考察解题,而数学研究同样看重提出新问题,68 道难题依旧有 63 道没被解开,即便 OpenAI 宣布 "AGI 时代到来了 ",但距离全面攻克高阶数学还有很长距离。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 数学 美国 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论