驱动之家 17小时前
DeepSeek V4正式版性能封神:Flash直追Opus 静待Pro斩杀四方
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

快科技 7 月 31 日消息,早上刚有传闻 DeepSeek V4 正式版会在 8 月 3 日发布,没想到中午 DeepSeek 就拿出了正式版,首先登场的是 DeepSeek V4 Flash,Pro 版还要等到 8 月初。

根据官方消息,DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练,Agent 能力大幅增强,基准测试远超 V4-Pro-Preview。

根据官方发布的对比,V4 Flash 在多个 AI 编程能力测试中大幅提升,最夸张的一个是 DeepSwe,从 7.3 分提升到了 54.4 分,性能暴涨 6 倍多,只能说明之前 Flash 在这个编程测试中表现确实不行。

官方性能对比的是国产编程代表 GLM-5.2 及美国的 Opus 4.8,Flash 整体性能超过了 GLM-5.2,比 Opus 4.8 差一些。

还有网友让 GPT 整理了 V4 Flash 对比其他大模型的性能测试,可以看到跟国产的 K3 及 GPT 的旗舰 Sol 还有点差距。

著名大模型测试员的结果显示性价比上 Flash 依然无敌,比降价后的 GPT-5.6 Luna 还要少一半的费用。

以上需要注意的是,V4 Flash 只是个小参数模型,2840 亿参数量,激活 130 亿而已,而 GLM-5.2 是 7400 多亿参数,K3 是 2.8 万亿参数,5.6 Sol 及 Fable 5 这样的美国顶级大模型虽然每公布参数量,但公认在 4-5 万亿级别,保守估计也是 K3 这种 3 万亿级别的。

可以说 V4 Flash 只用 1/10 到 1/3 的参数量就做到了前沿级性能,DeepSeek 这一波真的是后训练仙人了,而 V4 Pro 是 1.6 万亿参数量,规模大了 4 倍以上,意味着性能还有更大的提升空间。

按照这个幅度来算 ,V4 Pro 正式版的性能达到甚至超过 K3、Opus 5、GPT-5.6 Sol 或者 Fable 5 都是有可能的,此前网上流传的那些 V4 正式版测试果然不是骗人,DeepSeek 无愧于 AI 斩杀线的美誉,比他强的大模型没奖励,但是比他弱的就麻烦了。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash ai 编程 美国
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论