差评 2小时前
4个月4个Flash,Gemini到底在下什么怪棋?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

  四连超凡 Quadra kill,不是游戏,而是 Gemini 又双叒叕发新的 Flash 模型了。

出于刻板印象和谷歌低调的宣发,这次的 Gemini 3.8 Flash 世超本来没太上心。

但意外的是,网上风评很不错,尤其是编辑部的谷歌老粉,纷纷感慨:

难道说,Flash 才是对的?

看官方的跑分表,确实会被唬住,因为它拉来对标的,已经是 Claude 和 GPT 的旗舰模型了。

最有冲击力的提升都集中在「干活」两字上。

DeepSWE 这项,主打长线的编程开发能力,已经摸到了 Claude Opus 5 的屁股,只差 0.3%。

  而像传统测 Agent 能力的 Terminal-bech,它在 2.1 版的测试里也是力压全场,豪取 89.45%;

不过在上个月更新的 4.0 版中,它又拉了个 19.1%,能力泛化差点意思。

除此之外,多模态成绩还算强势,科研,金融分析等专业领域,也小有进步。

而且翻开更具体的模型卡片能看到,3.8 Flash 的世界知识来到了 26 年的 3 月份,脑子里终于更新了点新东西。

但难崩的是谷歌很快打了个补丁,说只有部分领域是新的,很多老领域仍然是雷打不动的 25 年 1 月。。。

当然,重头戏还是性价比,3.8 Flash 这次性能跑分库库涨,但吐 token 的速度仍旧一泻千里。

看 Artificial Analysis 的榜单,大伙儿多半是两位数,就它干到了三百多。

  不过话说回来,比起之前,它执行起任务的速度反而要慢一些。

因为谷歌说 3.8 Flash 在工作中会更努力的调用工具,推理更多步骤,这样活儿会干得更漂亮,代价就是拉长交付时间。

价格这块儿也挺有活儿,虽然 Flash 的便宜大碗众所周知,但直接贴到跑分表里头两行,大写特写的,咱还是头一回见。

我们也简单实测了一下,省流就是除了快还是快,干活儿不懒,智商一般,但写东西意外的挺有人味儿。。。

比如同样生成一篇文章,讲述最近 DLSS 5 有争议的内容。

GPT 5.6 这儿东拼西凑两分半开始下笔,但你一下就能品到 AI 味儿,直冲天灵盖儿。

  像「不是而是」这种已经是老版本了,现在是三五个字儿一句话,配合莫名其妙的设问,再点缀上无穷无尽的排比,读起来断断续续的,非常割裂。。。

Gemini 3.8 Flash 则是另一种画风,3000 字的稿子,17 秒足矣,多一秒都是对 Flash 的亵渎。

遣词造句的习惯也完全不同,风格更犀利,乐意用一些网络热梗去类比。

  虽然偶尔显得用力过猛,但场景的渲染和情绪的递进都丝滑很多,读起来也流畅一些,起码没那么乏味。

不过你仔细看完,就会发现,这俩纯偏科生来的,Gemini 虽然说人话了,但它论证的准确度远不如 GPT 严谨。

接下来的 Coding 测试,表现就没有跑分看起来那么猛了。

先来个常规的 3D 场景建模,用网页还原二游那种渲染的质感,造个日式便利店。

就结果来看,确实达不到原作者 Demo 中 Claude Opus 5 的那种质感。

  模型整体的规格和样式基本没错,但内部的细节就少了太多,而且光影效果也没按提示词来,整体的滤镜色调都差了个档次。

作为对比,下面又拿 GPT 5.6 Terra 和 Kimi K3 跑了一轮,虽然跑分表上他们旗鼓相当,但这俩的质感明显好很多。

超市的门能打开了,模型边缘也加了非常灵魂的黑色描边,多了很多二次元风格化的处理细节。

向左滑动,依次为 GPT 5.6 Terra 和 Kimi K3

接下来加大难度,让它复刻经典的 Minecraft 游戏。

  如果是网页版,配上一句话的提示词,那你将体验到窜稀一样的速度,它不到一分钟就能搓出来。

虽然跟预想的一样拉完了,但好在没啥 BUG,方块能挖也能放,主打一个简约。

而如果升级一下,用谷歌 AI Studio 的那套工具打辅助,那质感挠一下就上来了。

细节更接近 Minecraft 原版,方块的类型更多,玻璃草地的材质也很还原,尤其是游戏本体的功能性更丰富了,菜单有更多设置选项,游戏中也多了背包之类的复杂系统。

能看出来,有工具跟没工具的 Gemini 3.8 Flash 是两个玩意儿。

所以我干脆安装了 Antigravity,谷歌官方的本地 Agent 工具,看看更专业的 Harness 加持下,会不会有更好的效果。

  不过还是得吐槽一下,比起 Codex,WorkBuddy 之类的应用,Antigravity 的使用体验就是一坨,没有中文适配,没有技能商店,第三方插件寥寥无几,一切都透露着原始美。。。

言归正传,这一版的 Minecraft 我让它结合一下漫威蜘蛛侠的玩法,能在城市间荡蛛丝。

这回没那么快了,花了大概 8 分钟,它才把成品掏出来。

地点设置在纽约的曼哈顿,Minecraft 的玩法都还在,方块都转化成了更适配主题的现代化材质。

可能是因为在执行前写了计划书的原因,完成度明显高了很多。

比如很多地标建筑,像帝国大厦,跨海悬索桥,拿方块还原的都不错,过河小桥,路灯这些小细节也不少,连史蒂夫本人都换成了 Spiderman 的皮肤。

不过这个荡蛛丝的玩法物理判定太复杂,它修了好几轮都还有 Bug,Spiderman 的速度诡异,一会儿飞起,一会儿卡住,在大楼之间来回抽搐抖动。

最后我又测了一下代码理解能力,让它去 GitHub 上把 DeepSeek Harness 拉下来,做个方便理解代码仓库的 wiki。

  花了十分钟,它把项目从头到尾读了一遍,然后搓出了 wiki。

内容倒是没偷懒,架构设计,接入的协议,以及后续二次开发的标准都扒了出来。

但审美这块儿还是祖传的 AI 味儿,后续我让它自己装个 skill,然后重构一下前端。

结果它老毛病又犯了,2 分钟安装执行糊弄完毕,风格切换就是换个色儿,翻开思维链能看到,skill 装是装了,但只调用了一半儿就自作主张交差了。。。

这通测试下来,也能感觉到 Gemini 3.8 Flash 的尴尬之处,它执行速度奇高,但又有一堆莫名其妙的小毛病。

  有前面 4 个月 4 个 Flash 模型的积累,没人比谷歌更懂 Flash 的性价比,所以执行效率没啥毛病。

但小毛病这块儿又确实影响体验,像 Minecraft 这个任务,网页版,AI Studio 和 Antigravity 的产物存在明显差距。

工具越少,约束越松散,它就越随心所欲。反之如果有靠谱的 Harness 去约束,有清晰的规划和边界,那它又会听话很多。

所以只能期待一手谷歌给 Harness 的升级,给模型补上能动的手脚,到时候就知道 Flash 这条路到底是夯还是拉了。。。

撰文:风华

编辑:江江 & 面线

美编:素描

图片、资料来源

Google DeepMind,Artificial Analysis,DeepSWE,Google AI Studio,Gemini,Antigravity,部分图源网络

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash 谷歌 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论