在生成式人工智能时代,Benchmark 基准测试正在被越来越广泛的群体拆解、讨论。围绕 Benchamrk 分数的公开与对比,和伴随的争论,在技术历史中不是偶然,无论是数据库、Web 技术,还是芯片硬件。
在这篇文章,我想讨论这个长期以来的现象,以及争议将走向何方?
01
Benchmark 测量了什么,分数被怎么用?
公布 Benchmark 分数、与竞品进行分数对比,已经成为每一次模型新版发布时的「标准动作」。回归本源,Benchmark 基准测试本身并不是为了发版而存在,它首先是技术产品研发中必要的工程手段。
以 AI 领域为例,Benchmark 旨在评估模型在特定任务的泛化能力,承载了复杂评估范式要求,在预训练阶段、后训练阶段、生产发布前的验证阶段都是重要的评估来源之一。
而到了模型发布的技术传播环节,对外公开的 Benchmark 测评和分数,某种程度上起到了能力的 " 翻译 " 和 " 背书 ",也为新闻报道、公开讨论提供了 " 事实 "。特别是在激烈的竞争环境中,成为了进入讨论场的 " 入场券 "、模型公司留在牌桌的证明。
但是当模型实力在拉近,分数以月为单位被刷新,围绕 Benchmark 和分数的质疑也随之而来。
02
每一次分数讨论背后,必然会指向的问题
AI 竞赛的加速,使 Benchmark 逐渐成为一种 " 消耗品 "。斯坦福 2026 年《AI Index 报告》卷首语称,当模型之间能力趋同,用于评估他们的工具却难以保证有效,基准测试正趋于饱和,前沿模型披露的信息越来越少,独立测试结果也并不总能印证开发者所报告的情况。
因此催生出一个常被议论问题——新版分数提升、甚至超过竞品,为什么体验不到预期中的大幅度变化?
此外,围绕公开的 Benchmark 所做的针对性优化等诸多问题,也让分数的信任效力下降。OpenAI 在其建立的软件工程能力基准测试 SWE-bench Verified 上观察到,模型性能提升放缓,过去 6 个月内准确率仅从 74.9% 提升到 80.9%,宣布将停止报告该基准测试的分数。
这一幕在技术历史中并不陌生,让人不免联想到 JavaScript 引擎的测试历史—— 2017 年,Chrome 浏览器宣布了其一手打造的基准测试套件 Octane 的退休。相对于 Octane 出道 5 年即退休的历史,Open AI 对于 SWE-bench Verified 的使用甚至只有 2 年。
市场对于 Benchmark 分数的另一重质疑,则来自于现实场景的复杂性。
尽管 Bencharmk 数量在激增,从语言理解、数学推理、代码生成,到多模态识别、安全对齐,乃至垂直行业的专项能力。但是每项 Benchmark 都有自己的局限,无论是数据、测试方式、还是评估与反馈方式层面等,测试结果不等同于现实环境中的能力表现,不一定完美匹配用例。于是引来了使用者群体另一个叠加问题——分数好、排名高,与自己有什么关联?
在我看来,这些讨论本质来自对技术能力的预期,对于应用场景适配的探索,对于分数公信力的思考。在多项技术的历史中,重复上演,也是技术走向成熟、竞争进入白热化的必然。
03
围绕 Benchmark 分数的自我解构与重塑
Benchmark 的分数、特别是排名高低,天生就是 " 记忆符号 "、适合引用的 " 新闻事实 "。分数提供事实、吸引注意力,但「注意力」能留存多久、沉淀成什么样的认知,往往来自于现实。
Anthropic 对于今年 Sonnet 5 发布,在新闻宣传材料中,不再将 Sonnet 与其它模型进行对比,只是与自家模型和历史版本进行对比,我将其理解为一种有意识的叙事管理——合理,但是讨论并不会因此终止。
Open AI 的科学家则从 " 技术正在如何被应用 " 的角度,提出倡议。
今年 6 月,Open AI 专注于推理研究的 Noam Brown 公开表示,现在的 Benchmark 缺乏对于预算维度的考虑," 当比较 GPT-5.5 和 GPT-5.4 在最大算力下的表现时,你得到的是近乎持平的结果。但当把两者对 Token 消耗量作图时,GPT-5.5 在每一个固定预算下都明显更强 "。他提出的主张是—— Benchmark(基准测试)应当增加一条明确的 X 轴 -Token、金钱、延迟,把模型性能绘制为算力预算的函数。
与之呼应的一个现象,来自 Benchmark 方法研究一端。在今年机器学习顶会 ICML 的 Position- 立场类型论文中,围绕评估和基准的论文达到了 20 篇,超过 1/4 占比,成为仅次于安全与对齐的第三大主题。论文主题主要聚焦于基准的可信度、评估的实用价值、验证困境。
在围绕分数竞赛的争议之外,Benchmark 还有另一条价值轨道——在模型厂商的研发、企业客户的部署验证环节,它有不可替代的价值。当一系列 Benchamark 分数从内部指标变成一场公开竞赛,呈现的仅仅是看似 " 受控 " 的能力对比,而非真实实力和技术探索的完整表达。
无论是软件、芯片硬件,每一次技术历史上围绕 Benchmark 讨论和争议,都不会因为开发者和使用群体对表达的放弃而终结,往往需要评测标准迭代、行业规则重建,甚至底层技术范式的迁移。争议的消散,也不是因为市场完整看懂了每一个 Benchmark 分数,是因为开发者、普通用户、手握重金的技术买家,最终认可了那些原本依赖分数才能 " 代理表达 " 的产品能力。
■
经历过多项技术周期,在构思这篇文章的时候,我回忆起了那些关于 " 指标与分数 " 的激烈讨论。我关注那些自我解构的主张、被沉淀下来的声音、被技术衔接住应用事实。
在公众号「显影笔记」,分享现象和叙事之下,那些尚待「显影」的逻辑。
引用观点与事实信源:
Artificial Intelligence Index Report,Message from the Co-chairs
Open AI,Why SWE-bench Verified no longer measures frontier coding capabilities
Noam Brown,Benchmarks are lying to your procurement team
Claude Sonnet 5,www.anthropic.com/news/claude-sonnet-5
Retiring Octane,v8.dev/blog/retiring-octane
封面图:The Horse in Motion,Eadweard Muybridge


登录后才可以发布评论哦
打开小程序可以发布评论哦