IT之家 前天
OpenAI多次修改GPT-6 Astra基准测试数据,部分成绩一度大幅变化
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 9 月 6 日消息,据 Fortune 报道,OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来,已经多次修改其中的评测基准数据。一些更新后的数据显示,Astra 的表现有所提升,而 OpenAI 最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。

这些变化发生在一次颇为反常的公告发布过程中。

据 IT 之家了解,OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章,但又过了近两个小时,文章才终于能够在网上被大多数用户正常访问。

当地时间下午 3 点 32 分,OpenAI 官方 X 账号发布博客链接,但页面无法正常打开,访问者会看到错误提示。下午 3 点 50 分,OpenAI CEO 萨姆・奥尔特曼(Sam Altman)也发布了链接,并写道:" 我们在部署博客文章时遇到了一点小问题,但它真的非常棒。"

不过,当时仍有多名用户表示无法打开页面。大约一小时后,页面才终于能够正常访问。

事实证明,OpenAI 实际上在下午 2 点过后不久就发布了这篇博客,但随后又将其撤下。OpenAI 表示无法披露撤稿的具体原因,但强调此事与基准测试成绩无关。

OpenAI 最初解释称,问题源于内容管理系统的故障,随后又表示是互联网中断所致。

然而,当博客重新上线后,其中的多项评测数据已经发生变化,而且部分数据此后仍在继续调整。一些更新后的指标似乎让 Astra 的表现更加突出。

这一事件发生之际,人工智能行业正处于激烈竞争之中。各家公司以极快的速度更新大语言模型,都希望在能力上领先竞争对手。围绕这些指标的争议,也再次凸显出一个长期存在的问题:如何利用标准化基准测试准确衡量大语言模型的能力,以及这些测试成绩是否容易被人为优化甚至 " 刷分 "。

OpenAI 发言人表示:" 我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同,大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据,我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计,让用户能够进行有意义的比较。"

首版与最终版数据存在差异,而且部分数字仍在变化

最引人关注的变化之一,是 Astra 的幻觉率。

根据互联网档案中保存的一份页面快照,在美国东部时间 9 月 3 日下午 2 点 23 分发布的最初版本中,Astra 的幻觉率为 4.2%。之后的多份页面快照中,这一数字都没有变化,直到下午 3 点 11 分的第五份快照仍然如此。

大约 10 分钟后,OpenAI 才在 X 上发布了最终版本的博客链接。

但在下午 5 点 20 分保存的第六份网页快照中,也就是页面基本已经能够被公众正常访问之后,Astra 的幻觉率以及另外四项指标发生了变化。Astra 的幻觉率从 4.2% 直接降至 2%,几乎减半。

与此同时,Astra 的前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。

不过,OpenAI 此后仍在继续修改这一指标。截至本文撰写时,Astra 和 GPT-5.6 Sol 的幻觉率又分别回到了最初的 4.2% 和 12.2%。

OpenAI 似乎还大幅提高了 GPT-5.6 Sol 在其内部 ExploitBench 网络安全评测中的成绩,从最初版本的 5.5% 提高到后续版本中的 11.5%。

OpenAI 表示,公司目前正在研究是否将这一数字恢复至 5.5%,因为 11.5% 的成绩对应的是 GPT-5.6 Sol 当前并未向商业用户提供的推理能力等级。

OpenAI 在公告开头重点强调,Astra 在数学能力方面表现尤其出色。

从网页快照来看,Astra 在 FrontierMath Tier 4(v2)评测中的成绩始终保持在 97.6%,并没有发生变化。但 OpenAI 曾短暂修改 GPT-5.6 Sol 和 Anthropic 最新模型 Fable 5.1 的成绩。

这些调整一度让 Astra 看起来明显领先于另外两款模型。

在 9 月 3 日下午 2 点 23 分保存的首份网页快照中,Anthropic Fable 5.1 在该数学评测中的成绩为 87.8%。到下午 5 点 17 分,这一成绩下降近 10 个百分点至 78%。截至目前,该成绩又回升至 83%。

GPT-5.6 Sol 的成绩也经历了类似变化,从 83% 下降至 80.5%,随后又恢复至目前的 83%。

这些数据调整甚至早于 OpenAI 下午 2 点首次发布博客之前。

OpenAI 此前向媒体提供的一份受发布禁令限制的预发布草稿显示,Astra 在 ARC-AGI-3 评测中的成绩为 98.6%。而在目前公开的博客中,这一数字已经变成 99.99%。

OpenAI 当时回应称:" 我们始终会在正式发布前验证评测结果,因此草稿与最终版本之间出现调整是正常的。"

OpenAI 还指出,该基准测试的创建方 Arc Prize Foundation 在独立评估中发现,如果为 Astra 配备一套特别强大的测试工具框架,也就是让模型能够调用更多工具完成任务,Astra 的成绩可以达到 99.9%。

而在使用该基准测试的标准工具框架时,Astra 的成绩为 63%。尽管如此,这一成绩仍明显领先于目前所有公开发布的其他 AI 模型。

OpenAI 表示,测试工具框架、推理等级以及其他因素都会影响最终的评测结果。

是在提高准确性,还是在 " 刷榜 "?

OpenAI 内部由不同的研究团队负责不同的评测指标。这些团队负责计算和上报成绩,再由一个中央团队统一发布。

OpenAI 也公开承认,这些数字是在最佳条件下获得的,因此可能与普通用户通过正式版 ChatGPT 实际能够使用的模型表现存在一定差异。

博客中的免责声明写道:" 评测分数是在任何计算资源投入下能够达到的最高成绩。"

此外,OpenAI 还在每项评测指标的脚注中加入了更多说明和限制条件。

问题在于,评测结果的 " 准确性 " 并不总是唯一的。由于测试条件不同,多个不同的成绩都可能是合理的。

但一些 AI 专家认为,其中可能还存在所谓的 "Benchmaxxing" 现象,也就是通过反复调整测试条件、重新运行评测,以尽可能提高基准测试成绩。

斯坦福智能系统实验室和斯坦福可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 表示,这类操作可以在很短的时间内完成,而且 " 对公司的营销更有利 "。

两人还指出,GPT-6 Astra 的系统卡本应提供更多有关评测方法的技术信息,但其中部分内容并没有得到充分说明。

例如,对于 OpenAI 的内部幻觉率评测,系统卡 " 几乎没有提供任何有关评测方法的细节 ",甚至 " 连测试项目的数量都没有列出 "。

他们认为,反复重新运行测试,可能也是 Astra 在后续版本中编码能力成绩略有提高的原因之一。

Astra 的代码能力评分从 57.7% 提高至 57.9%。虽然只有 0.2 个百分点的变化,但 OpenAI 仍然选择将原来的数字替换成新的、更高成绩。

当然,并非 OpenAI 的所有调整都让 Astra 看起来更有优势。

例如,在面向医疗领域的 HealthBench Professional 评测中,Anthropic 两款模型的成绩在不同版本之间反而有所提高。

Claude Fable 5.1 的成绩从 56.6% 提高至 58.1%,Opus 5 则从 54.5% 提高至 56.4%。

其他 AI 公司模型的成绩通常来自公开排行榜,因此 OpenAI 一般不会亲自对竞争对手的模型进行重新测试。

基准测试成绩争议长期困扰 AI 行业

围绕基准测试准确性的争议此前已经多次出现。

2025 年,Meta 曾否认有关其人为提高 Llama 4 模型测试成绩的报道。当时有报道称,Meta 公布的成绩来自内部版本,而不是最终向公众开放的版本。

Meta 前首席 AI 科学家 Yann LeCun 后来承认,公司确实曾对基准测试结果进行了 " 修饰 "。

与此同时,AI 行业中的评测标准本身也在不断变化,新的测试项目持续出现。

例如,网络安全基准测试 ExploitGym 于 2026 年才刚刚推出。该评测此前曾因一起事件受到关注,当时 OpenAI 的模型在测试过程中出现失控行为,并对 Hugging Face 发起攻击。

Snorkel AI 负责基准测试和评估研究的 AI 工程师 Vincent Sunn Chen 表示,在模型发布前的最后几个小时内调整基准测试成绩并不罕见。

他在电子邮件中表示:" 这通常只是最终发布流程的一部分。一个基准测试成绩对应的是一套具体的测量设置,包括模型检查点、配置参数,例如模型被允许使用多少时间和计算资源、测试工具框架,以及评测和评分配置,例如评分过程中的非确定性。所有这些因素通常都会在模型发布前的最后几天持续调整,因此我并不惊讶看到一些数据更新。"

Chen 表示,他希望行业能够形成新的规范:当公司修改模型基准测试成绩时,应明确说明评测条件发生了哪些变化,从而让研究人员能够更准确地理解这些结果。

基准测试成绩之所以如此重要,有多个原因。

对于 AI 公司而言,它们既是衡量技术进步的工具,也是与竞争对手比拼实力的 " 记分牌 "。在各类评测排行榜上取得领先,可以帮助 AI 公司吸引客户,在某些情况下还能够帮助企业招聘工程师和研究人员。

但正如这次事件所显示的那样,正确解读基准测试成绩本身具有很高的技术复杂性。

对于希望以简单、直观方式向公众展示模型能力的公司来说,这也是一个不小的挑战。

与此同时,评测数据不断变化,以及外界对于企业是否诚实、透明地展示测试结果的质疑,也可能让客户和投资者越来越难判断:究竟哪一款模型最适合哪些任务。

这种混乱也可能削弱 OpenAI 希望向市场传递的一个核心叙事 —— 即其拥有市场上最强大的 AI 模型。对于一家可能计划在 2027 年进行 IPO 的公司来说,这一问题无疑显得更加敏感。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra it之家 美国 互联网 准确
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论