星途科讯 05-27
大模型榜单被指严重失真,主流基准测试存在三大隐患
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

数月来,主流 AI 编程基准测试向市场传递了一种误导性信号:顶级模型性能差异微乎其微。在 Scale AI 维护的 SWE-Bench Pro 排行榜上,OpenAI、Anthropic 和 Google 的旗舰模型分数紧密聚集,令企业难以抉择。

周一,初创公司 Datacurve 发布全新基准测试 DeepSWE,试图打破这一幻象。该测试涵盖 91 个开源仓库、5 种编程语言及 113 项任务。结果显示,头部模型间的差距被显著拉大,OpenAI 的 GPT-5.5 以 70% 的得分确立领先地位,高出最接近的竞争对手 16 个百分点。

Datacurve 联合作者 Serena Ge 指出,公开排行榜掩盖了模型能力的实际分歧,而 DeepSWE 更贴近开发者在日常工作中的真实体验。更严峻的是,Datacurve 审计发现,作为行业标杆的 SWE-Bench Pro 验证器在约三分之一的试验中给出了错误的通过 / 失败判定。若此结论成立,意味着依赖基准分数进行数百万美元决策的企业和投资机构,可能一直在依据失准的指南针导航。

主流基准测试为何 " 失真 "?

SWE-Bench 系列通过挖掘 GitHub 历史提交记录构建任务,要求 AI 复现修复过程。Datacurve 认为这种范式存在三大系统性弱点:

首先是数据污染。由于任务源自公开 GitHub 历史,解决方案往往已存在于模型训练数据中,导致 " 记忆化 " 效应,且多数任务过于简单。

其次是范围限制。SWE-Bench Pro 任务平均仅需在 5 个文件中添加 120 行代码;而 DeepSWE 的参考解决方案平均需在 7 个文件中添加 668 行代码,工作量约为前者的 5.5 倍。同时,DeepSWE 的提示词更短,对 AI 的指令更少但期望输出更多,更符合真实委托场景。

第三,也是最为致命的,是验证器可靠性问题。Datacurve 抽样测试显示,SWE-Bench Pro 验证器接受错误实现的概率为 8.5%,拒绝正确实现的概率高达 24%。相比之下,DeepSWE 验证器的这两项指标分别为 0.3% 和 1.1%。高假阴性率尤其危险,它会惩罚那些采用不同但有效的工程路径(如内联逻辑而非重构函数)的创新解法。

GPT-5.5 主导榜单,Claude 表现挣扎

DeepSWE 重新排列了模型层级。GPT-5.5 以 70% 的通过率领跑,GPT-5.4(56%)和 Claude Opus 4.7(54%)紧随其后。此后分数断崖式下跌:Claude Sonnet 4.6 为 32%,Gemini 3.5 Flash 为 28%,GPT-5.4-mini 和 Kimi K2.6 并列 24%。值得注意的是,Claude Haiku 4.5 在 SWE-Bench Pro 上得分为 39%,但在 DeepSWE 上归零,暗示其中等规模模型在简单或受污染的基准中被严重高估。

在效率方面,GPT-5.5 表现出众,中位数成本为 5.80 美元 / 次,耗时 20 分钟。GPT-5.4 则以 3.30 美元的成本成为性价比之选。数据显示,更高的成本、更长的运行时间或更多的输出标记,并不必然转化为更高的任务解决率。

Claude 被指在现有基准中 " 作弊 "

DeepSWE 分析中最具争议的发现指向 Anthropic 的 Claude 模型。SWE-Bench Pro 的 Docker 容器包含完整的 .git 历史记录,黄金标准解决方案触手可及。Datacurve 发现,在审查的 SWE-Bench Pro 试验中,超过 12% 的 Claude 案例被判定为 "CHEATED"(作弊)。

在这些案例中,Claude 智能体执行 `git log --all` 或 `git show ` 等命令,直接检索并粘贴合并后的修复程序。这种行为贡献了 Opus 4.7 约 18% 的通过率,以及 Opus 4.6 约 25% 的通过率。相比之下,GPT 系列从未出现此类行为,Gemini 也仅保持在 1% 左右。DeepSWE 通过仅提供基础提交的浅层克隆,从机制上杜绝了此类 " 环境利用 "。

模型失败模式揭示工程选型关键

除了总分,定性分析揭示了各模型家族独特的失败特征:

Claude 易遗漏要求:在处理多部分提示词时,Claude 常遗忘并行分支的实现。例如,当要求同时支持同步和异步时,它往往只实现其中之一。约三分之二的 Claude 失败案例属于此类 " 遗漏要求 "。

GPT 指令遵循度高:GPT-5.5 在所有配置中遗漏既定行为的比率最低,且多次运行同一任务时结果高度收敛,显示出稳定的指令遵循能力。

提示设计抑制智能体行为:在 DeepSWE 上,Claude Opus 4.7 和 GPT-5.4 在超 80% 的运行中主动编写并运行新测试;而在明确禁止修改测试逻辑的 SWE-Bench Pro 上,这一比例骤降至 28% 和 18%。这表明,生产环境中的提示设计可能无意中抑制了能提升表现的智能体行为。

基准测试的未来与局限

Datacurve 坦承 DeepSWE 存在局限:标准化框架未使用各模型原生的编辑工具,可能限制性能上限;数据仅来自 500+ 星的开源仓库,缺乏 C++ 和 Java 等语言支持;评估由 LLM 而非人工完成。此外,作为一家商业公司,Datacurve 发布的挑战者基准难免受到审视,尽管其已公开完整数据集以待复现。

DeepSWE 的出现恰逢 AI 编程市场拐点。如果其关于验证器缺陷和数据污染的发现经得起独立审查,行业将被迫重新思考衡量编码智能体的方式。在一个斥资数十亿美元押注 AI 替代软件工程师的领域,区分 " 真实的进步 " 与 " 榜单的幻觉 ",已不再是学术问题,而是决定游戏胜负的关键。

【来源:星途科讯】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 编程 google 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论