OpenAI 的 GPT-6 Astra 在 Epoch Capabilities Index(ECI)上以 166 分排在首位,领先 Anthropic 的 Claude Fable 5.1(164 分)和 OpenAI 自家的 GPT-5.6 Sol(162 分)。但这一综合排名掩盖了一些复杂性:其 Math-ECI 达到 170,创下新纪录,而在软件工程基准上,Astra 的 SWE-ECI 为 164,仍落后于 Fable 5.1 的 167。
综合、数学与软件工程 ECI 分数(含 90% 置信区间)
ECI 是 Epoch 做的一个综合能力衡量指标。这次比较了四个模型:GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol,还有 Moonshot 的 Kimi K3。
综合分上,GPT-6 Astra 为 166.31,Claude Fable 5.1 为 164.47,GPT-5.6 Sol 为 161.81,Kimi K3 为 157.63。
拆开看,ECI 还做了两个领域版本:Math-ECI 和 SWE-ECI。它们是领域特定的 ECI,仅基于某一个领域的基准重新拟合,衡量模型相对于综合表现的实力。
Math-ECI:GPT-6 Astra 169.83,Claude Fable 5.1 165.73,GPT-5.6 Sol 162.76,Kimi K3 158.39
SWE-ECI:Claude Fable 5.1 167.44,GPT-6 Astra 163.58,Kimi K3 161.54,GPT-5.6 Sol 160.47
数学赛道,Astra 领先第二名 4 分多。软件工程赛道,它落后 Fable 5.1 将近 4 分。
169 到 166,分数是怎么掉下来的
Epoch 提到一个细节:基于发布前的评估,他们当时给 Astra 的 ECI 是 169。但发布之后,随着更多软件工程基准结果出来,这个数字回落到了 166.31。
对比表里能看到这个过程。2026 年 9 月 3 日的快照上,GPT-6 Astra 的 ECI 是 169.23,当时只用了 1 个 SWE 基准(MirrorCode)。到了 9 月 15 日,ECI 变成 166.31,SWE 基准增加到了 4 个:MirrorCode、WeirdML、DeepSWE、FrontierCode。
Claude Fable 5.1 走的是反方向。9 月 3 日它的 ECI 是 162.88,只用了 1 个 SWE 基准(FrontierCode);9 月 15 日升到 164.47,SWE 基准增加到 3 个:MirrorCode、WeirdML、FrontierCode。
一个往下修,一个往上修。基准覆盖越全,软件工程这一项对综合分的影响就越藏不住。
数学的样本,和代码的样本
两个领域的基准数量也不一样。Math-ECI 这边,四个模型都只用了 4 个基准。SWE-ECI 这边,GPT-6 Astra 用了 4 个,Claude Fable 5.1 用了 3 个,GPT-5.6 Sol 用了 6 个,Kimi K3 用了 5 个。
换句话说,Astra 在数学上的领先,是在一套相对集中的题目上打出来的;而它在软件工程上的位置,是在基准不断补齐之后被重新校准的。
置信区间里的余地
看数字不能只看点估计。SWE-ECI 这一项,GPT-6 Astra 的 90% 置信区间是 160.42 到 169.82,Claude Fable 5.1 是 161.95 到 178.53。Math-ECI 那边,GPT-6 Astra 是 165.98 到 175.37,Claude Fable 5.1 是 162.84 到 175.91。


登录后才可以发布评论哦
打开小程序可以发布评论哦