驱动之家 19小时前
谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 8 日消息,谷歌、Meta 这两年在 AI 大模型竞争中一度落伍,跟 Anthropic 及 OpenAI 差距拉大,但最新的 Gemini 3.8 Flash 及 Muse Spark 1.3 杀回来了,在 AA 榜单上一度超越 OA 两家旗舰大模型。

Flash 模型的性能也不是说完全不可能超越别人家 5 万亿甚至 10 万亿参数量的旗舰大模型,但 Gemini 及 Spark 的表现还是让人意外,知名分析机构 SemiAnalysis 日前发文分析了这两家的大模型性能,认为他们存在过拟合,直白点来说就是针对榜单评测做了刷分。

了解过 AI 圈的网友应该很清楚,AI 榜单刷分其实都不算是啥新闻了,只不过以前国产大模型被指责的多,现在矛头指向了谷歌和 Meta 罢了。

对于跑分作弊的指责,没看到谷歌 Gemini 那边的回应,但 Meta 这边的 AI 业务主管 Alexandr Wang 先坐不住了,他是 Scale AI 数据标注业务的创始人,被 Meta 重金收购之后成为 Meta AI 业务的实际当家人,Spark 等大模型就是他领导下做出来的,当然不会接受被人说是刷分作弊才能拿到高分的。

他的回应也很有意思,说 SemiAnalysis 指控他们刷分作弊的论点是愚蠢的,因为 OpenAI 也是这样,GPT-5.6 Sol 大模型在难度较低的 TerminalBench 2.1 跑分是 88.8%,但在难度更高的 TerminalBench 4.0 中也也只有 37.3%。

他的这个反击还是很巧妙的,因为 SemiAnalysis 指控谷歌及 Meta 靠作弊刷高分的证据就是 TB 2.1 这样的评测中得了高分,新出的 TB 4.0 评测基准中跑分就不行,而 Wang 的反击就是 OpenAI 的旗舰大模型也是一样的结果,TB 4.0 中跑分也同样会大幅降低。

Wang 表示这是因为 TB 4.0 是一个难度更高的评测,而且没有饱和,TB 2.1 的评测已经是饱和了。

简单来说,Wang 很巧妙地反击了 SemiAnalysis 对刷分的质疑,强调不同难度下的基准测试分数都不一样,不光是他们这样,OpenAI 也一样,这是测试项目的问题,因为之前的测试难度低了,就像是考试一样,学霸、学渣都可以从简单的考试获得高分数,不能因此就认为学渣是靠作弊实现的高分。

最后 Wang 还不忘给自家的大模型做广告,强调 Spark 1.3 当然不可能像 Astra 或者 Fable5.1 那么强大,但性价比高得多,而且他们未来的大模型会更直接地与 Astra 或者 Fabel5.1 竞争。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:宪瑞

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

作弊 谷歌 考试 spark ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论