全天候科技 58分钟前
追求“跑分”但“实测”平平,谷歌“新旗舰”Gemini 4被内部员工质疑
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Gemini 4 发布遭内部质疑,基准测分亮眼,实际编码表现参差不齐。

华尔街见闻提及,周三谷歌正式向外部发布 Gemini 4 Argon,将其定位为公司长期研发的旗舰人工智能模型。

然而据彭博报道,尽管该模型在多项基准测试中斩获领先分数,部分有权限直接使用该模型的谷歌内部人员却对其实际表现持保留态度,尤其是在编码能力方面。

谷歌方面明确否认上述质疑,表示有关 Gemini 4 在编码等领域表现不佳的说法 " 不准确 ",并援引 Google DeepMind 负责人 Koray Kavukcuoglu 的表态为佐证。Kavukcuoglu 上周在 The Information 主办的一场会议上表示:

我对团队有充分的信心,在我看来,我们始终处于前沿是板上钉钉的事。

面对 OpenAI 和 Anthropic 在模型与产品双线推进的竞争压力,Gemini 4 能否在真实场景中兑现承诺,对谷歌的搜索、广告及云业务均具有直接影响。消息传出后,Alphabet 盘后涨幅明显收窄。

内部分歧:基准佳绩难掩实际短板

据彭博援引知情人士,Gemini 4 在业界通用基准测试中表现良好,但在员工实际使用中效果明显打折,尤其在编码任务上暴露出明显短板。

报道援引其中一名知情人士指出,该模型在前端设计领域能力欠缺,而前端设计直接决定应用程序和网站的视觉呈现与交互体验。

部分员工认为,Anthropic 的 Fable 和 OpenAI 的 Astra 在能力迭代速度上已超过 Gemini,Gemini 4 即便发挥最佳也将在若干领域落后。

另一部分员工则认为,新模型已经追平业内顶尖水准。一名熟悉模型开发的谷歌员工对彭博表示,公司内部存在 " 广泛共识 ",认为 Gemini 4 属于前沿级别,并否认其在真实编码任务中存在困难。

此外,据报道援引知情人士透露,Gemini 4 体量庞大。大体量模型通常意味着较高的推理成本,这将在谷歌持续加码资本支出的背景下,对公司利润率形成额外压力。

" 过度优化 "还是真实能力?

业内人士将上述现象归结为一种被称为 " 过度优化 "(Benchmaxxing)的行业痼疾——即工程师更专注于在标准化测试中取得高分,而非打造真正好用的产品。

据彭博,两名熟悉 Gemini 4 的知情人士表示,该模型似乎受到这一问题的影响。AI 初创公司 Surge AI 创始人 Edwin Chen 对此直言不讳:

打个比方,就好比说 ' 我孩子 SAT 考了很高分 ' ——但 SAT 成绩并不能转化为真实世界的表现。这是一个极其有害的问题。

AI 实验室普遍面临这一困境,因为客户往往以基准分数作为评估模型优劣的主要依据,这在客观上推动了实验室将精力向 " 刷榜 " 倾斜。

值得注意的是,Gemini 4 并非没有优势。据一名知情人士介绍,该模型在多模态任务上表现突出,例如从视频中提取元数据,在安全性和网络安全领域也具备竞争力。

谷歌称其在一项衡量安全技能的基准测试中超越了 OpenAI 的 Astra 模型。此外,该模型单次可生成最多 100 万个 token,约合 75 万英文单词。

代价高昂的弯路:3.5 Pro 折戟与人才流失

Gemini 4 的发布背后,是一段代价不菲的研发弯路。

谷歌原计划于今年 5 月 I/O 大会后的 6 月推出 Gemini 3.5 Pro,但该版本最终因未能达到内部目标而被放弃。

彭博资讯分析师 Mandeep Singh 估计,训练一个前沿模型的单次运算成本最高可达 4 亿美元,若叠加高薪 AI 研究人员的人力成本,实际支出将更为可观。

与此同时,谷歌在人才端也承受持续失血之痛。多名明星 AI 研究员相继离职,包括传奇工程师 Jeff Dean、诺贝尔奖得主 John Jumper,以及对当下 AI 浪潮奠基技术有重要贡献的 Noam Shazeer。

今年 8 月,长期执掌谷歌 AI 研究的 Demis Hassabis 转任董事长,将 DeepMind 日常运营交棒给 Kavukcuoglu。

去年 11 月,谷歌发布 Gemini 3,广受好评,被普遍视为公司 AI 竞争力的一次重要转折。此后一系列进展的停滞与反复,令外界对其执行力产生质疑。

竞争窗口收窄:对手步步紧逼

Gemini 4 面临的外部压力同样不容小觑。

谷歌最直接的风险在于:Gemini 系列模型是搜索、地图、Gmail、Chrome 等核心产品的技术底座,每款产品的用户规模均超过 10 亿。

一旦模型竞争力落后,竞争对手将获得更多时间,说服开发者、企业和消费者选择其平台作为未来搜索与软件的运行基础。

与此同时,OpenAI 和 Anthropic 正加速从模型提供商向产品公司转型,包括推进 AI 编码代理等应用。据报道,Meta 本月早些时候发布了其 AI 代理平台 Muse,发布后迅速登顶应用下载榜。

谷歌方面表示,尽管其上一个 Pro 版本于今年 2 月发布,公司旗下 AI 产品仍实现增长,企业版 Gemini、消费者聊天机器人应用及谷歌搜索 AI 模式的用户均在扩张,后两者用户总数已突破 10 亿。

谷歌强调,庞大的用户分发体系是公司相较部分竞争对手的显著优势。

然而,优势能否转化为 AI 时代的持续领先,仍取决于 Gemini 系列能否在真实应用场景中令用户信服。

评论
大家都在看