腾讯科技 5小时前
谷歌连发三款“Lite、Flash”模型,但最强Pro再次缺席
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文丨晓静

编辑丨徐青阳

美国当地时间 7 月 21 日,谷歌 DeepMind 团队一口气放出三款新的 Gemini 模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及 Gemini 3.5 Flash Cyber。

其中,主力模型 Gemini 3.6 Flash 在编码和多模态任务上表现更强,但更关键的是,它处理相同工作所消耗的输出 token 比前代减少了 17% 到 65%。

Gemini 3.5 Flash-Lite 主打极致的速度与性价比,每秒可生成 350 个输出 token。

而 Gemini 3.5 Flash Cyber 则是一款针对网络安全漏洞检测与修复进行微调的专用模型,目前仅向政府和特定合作伙伴开放。

与此同时,外界期待已久的旗舰模型 Gemini 3.5 Pro 依然没有露面,谷歌表示它正在与合作伙伴进行测试,并首次透露,更庞大的 Gemini 4 预训练工作已经启动。

01 告别 " 啰嗦 " 的 AI

在大语言模型的应用成本中,输出 token 的数量直接关联到费用与延迟。Gemini 3.6 Flash 的设计目标之一,就是降低这种不必要的消耗,同时保持或增强任务完成的质量。

第三方基准测试机构 Artificial Analysis Index 的实测显示,该模型输出 token 使用量较前代降低了 17%。在需要多步骤推理和工具调用的复杂工程任务中,节省效果更为明显。

例如在 Datacurve 的 DeepSWE 基准测试中,token 消耗减少了 65%,这意味着 Gemini 3.6 Flash 在完成任务时执行了更少的冗余代码编辑和循环操作。

这种效率提升还带来了直接的价格下降。

Gemini 3.6 Flash 定价为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。相较于 3.5 Flash 每百万输出 token 9 美元的价格,单次智能体任务的总成本有所降低。

性能方面,Gemini 3.6 Flash 在多个基准测试中取得了可量化的提升。

DeepSWE 测试中得分为 49%,高于 3.5 Flash 的 37%。MLE-Bench 机器学习工程基准测试中,得分从 49.7% 提升至 63.9%。

计算机使用能力在 OSWorld-Verified 测试中得分为 83%,此前为 78.4%,该功能现已成为 Gemini API 和 Gemini Enterprise 的内置客户端工具。

知识工作方面,GDPval-AA v2 基准上的得分从 1349 提升至 1421。

多家客户已经给出反馈。

Figma、Harvey、Hebbia 和 JetBrains 均表示,Gemini 3.6 Flash 在处理复杂工作流和知识型任务时,在 token 效率、准确性和速度之间取得了平衡。

谷歌展示了 Gemini 3.6 Flash 在几个实际场景中的表现。

在金融领域,该模型使用 AI Studio 上的 Managed Agents,能够比 Gemini 3.5 Flash 更高效、更准确地解析和分析财务数据及记录。

在代码迁移任务中,Gemini 3.6 Flash 在 Antigravity 平台上借助多智能体编排执行操作,比前代具有更低的延迟和更高的质量。

在创意工具方面,Gemini 3.6 Flash 利用视觉理解能力,通过 Antigravity 和 tldraw 开源绘图工具构建了一个交互式主题工作室。

此外,该模型还使用 Gemini App 中的画布功能,帮助开发者制作了一个用于 3D 工作流的摄影纹理提取器。

02 在速度上卷出新高度

Gemini 3.6 Flash 追求的是效率平衡,Gemini 3.5 Flash-Lite 追求的则是速度极限。

谷歌将其定义为 3.5 系列中 " 最快、最具成本效益 " 的模型。根据 Artificial Analysis 的实测,它的生成速度达到每秒 350 个输出 token,这大约是上一代 3.1 Flash-Lite 速度的两倍。

定价也极具竞争力,每百万输入 token 0.30 美元,输出 token 2.50 美元。这种低成本和高速度,瞄准的是高吞吐量的业务场景,例如智能体搜索、大规模文档处理等。

虽然名字中带有 Lite,但 Gemini 3.5 Flash-Lite 在 SWE-Bench Pro 测试中,得分 54.2%,超过了标准版 Gemini 3 Flash 的 49.6%。在 OSWorld-Verified 测试中,它以 74% 的成绩优于 Gemini 3 Flash 的 65.1%。

开发者还能根据工作负载调整模型的 " 思考层级 ":处理简单的高容量任务时,可设为最低思考以换取低延迟和低成本;面对复杂子智能体任务时,再提高思考层级保证质量。

谷歌公布了 Gemini 3.5 Flash-Lite 在四个场景中的演示案例。

第一个是从海量电子商务数据集中提取产品特征并进行整合。

第二个是作为主智能体与 Gemini 3.5 Flash-Lite 协同工作,即时生成 25 个独特的、可随时探索的网页设计概念。

第三个是利用多模态理解能力,大规模进行收据翻译和摘要。

第四个是通过即时生成并迭代多个选项来构建游戏。

早期客户 Ashler、Paloalto 和 Ramp 均强调了该模型在速度、智能和成本效益方面的独特组合,认为其适用于扩展智能体工作流和数据处理任务。

03 " 白帽黑客 " 专用模型

谷歌发布的第三款模型 Gemini 3.5 Flash Cyber,是专门用来发现和修补网络安全漏洞的。

这款模型基于 Gemini 3.5 Flash 进行微调,谷歌希望它能以更低的 token 成本,去完成那些通常交给大模型的代码安全任务。在名为 CyberGym 的基准测试中,它的表现已经达到了前沿水平。

不过,鉴于网络攻防的双刃剑性质,谷歌对这款模型采取了审慎的交付策略。它不会面向所有开发者开放,而是直接集成到谷歌的代码安全智能体 CodeMender 中,作为一个有限访问试点项目,仅独家提供给政府和受信任的合作伙伴。

谷歌 Gemini 团队产品管理高级总监图尔西 · 多希表示,这是为了让一线的防御者能在关键漏洞被广泛利用前,抢先一步发现并修复它们,降低被滥用的风险。

谷歌透露,在内部测试中,这个模型在开源代码库 V8 JavaScript Engine 中找出了 55 个问题,其中 10 个漏洞是其他模型未能发现的。

从三款新模型的布局能看出,谷歌当前的策略是在效率上建立优势。

当下,越来越多的企业开始审视 AI 投入产出比,意识到大量消耗 token 并不总能换来好结果。谷歌 CEO 桑达尔 · 皮查伊在今年早些时候就提过,有的公司 5 月份就花完了全年的 token 预算,如果能混合使用 Flash 模型和其他前沿模型,能节省大量资金。

这种思路反映在产品上,就是不断压低成本、提高速度,同时增强模型处理具体任务的能力。

伴随这些高性能指标,安全也是必须要做的功课。Gemini 3.6 Flash 在化学、生物、放射性、核(CBRN)以及网络攻击滥用方面,都加强了前沿安全防护,提升了抵御越狱攻击的能力,同时尽量减少对正常有益用途的拒绝。

对于普通用户和开发者,这些模型自发布当天就可以在 Google AI Studio、Android Studio 和 Gemini 应用里用到,同时可在 Google Antigravity 及 Gemini Enterprise 应用中使用。

Gemini 3.5 Flash-Lite 还会逐步在谷歌搜索引擎中推开。Gemini 3.5 Flash Cyber,将通过 CodeMender 以邀请制落地。

04 3.5 Pro 仍在测试,Gemini 4 已在路上

尽管 Flash 模型陆续到位,但开发者社区更关心的问题始终是:Gemini 3.5 Pro 何时发布?

谷歌上一次更新 Pro 系列模型是在今年 2 月发布的 Gemini 3.1 Pro。此后,竞争对手的旗舰产品持续迭代。

OpenAI 先后发布了 GPT-5.5 并开始推出 GPT-5.6,Anthropic 推出了 Claude Opus 4.8 和 Claude Sonnet 5,并扩大了前沿模型 Fable 5 的访问权限。

今年 5 月,谷歌在发布 Gemini 3.5 Flash 时曾预告 Pro 版本已在内部使用,预期一个月内推出。如今已至 7 月末,该模型仍处于未公开状态。彭博社此前报道称,谷歌因难以达到内部性能目标,在推出 3.5 Pro 方面面临内部延迟。

对此,谷歌 DeepMind 技术负责人洛根 · 基尔帕特里克在社交媒体上回应说,Gemini 3.5 Pro 正在与合作伙伴进行测试,计划在准备就绪后立即广泛提供。但他没有给出具体的时间节点。

谷歌方面并未详细解释延期原因,但在公布 Flash 系列的同时,首次正式提及了下一代旗舰模型 Gemini 4 的进展。团队表示,已经启动了 Gemini 4 的预训练工作,并称其为 " 迄今为止最雄心勃勃的预训练工作 "。

这在一定程度上表明,谷歌的模型研发管线仍在持续推进,而 3.5 Pro 的交付节奏可能受内部测试和性能目标的影响。

美国网络科技媒体 BI 表示,截至 Flash 系列新模型发布当天,在 Artificial Analysis 的数学和推理等综合基准测试中,谷歌还没有一款模型进入该排行榜前十名。

新模型开放访问后,开发者社区很快传出了相当数量的负面声音。这些反馈主要集中在 3.6 Flash 的实际表现上。

有开发者在构建 3D 金门大桥场景时,反复提示了三次,模型仍持续忽略指令。最终输出质量甚至还不如 5 个月前发布的 Gemini 3.1 Pro。

另一位开发者在 Antigravity 平台上测试后反馈,木头纹理质量更差,大理石缺乏功能性,在 AI 游戏测试中同样失利。

有用户给模型布置中等规模任务,两分钟就完成了,但结果被评价为 " 一个本地 4B 模型都能比它做得更好 "。

还有人将矛头指向了性价比。

有评论指出,3.6 Flash 虽然便宜,但在每个编码基准上都表现不佳。相比之下,Kimi K3 和 GLM 5.2 等模型由资本规模远小于谷歌的实验室打造,却交出了更好的成绩。

月之暗面作为 Kimi 的创建者,估值约 300 亿美元,与谷歌约 4.5 万亿美元的市值相差约 150 倍。开发者对此表达了困惑。

更具体的数据来自 Artificial Analysis 的评分。

有用户注意到,3.6 Flash 在该平台上的得分与 3.5 Flash 完全相同,但排在 Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Claude Sonnet 5、Grok 4.5 和 GPT-5.6 Terra 之后。

特约编译金鹿对本文亦有贡献

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash 谷歌 美国 机器学习 安全漏洞
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论