DeepSeek-V4 系列模型迎来重大升级。抢在 7 月最后一天(31 日),DeepSeek-V4-Flash 正式版上线。

根据官方消息,DeepSeek-V4-Flash 正式版的模型架构、大小和与预览版相同,即 MoE(混合专家)架构、2840 亿总参数、130 亿激活参数、1M 上下文,在此基础上,正式版仅重新进行了后训练,Agent 能力便大幅增强,基准测试得分远超 V4-Pro-Preview。

官方性能对比的是国产编程代表 GLM-5.2 及美国的 Opus 4.8。DeepSeek-V4-Flash 正式版的整体性能超过了 GLM-5.2,逼近 Opus 4.8。相比对标模型,V4 Flash 只是个小参数模型,GLM-5.2 总参数高达 7440 亿,激活参数为 400 亿,均远高于 V4 Flash。

具体来看官方给出的 9 项 Agent 基准测试得分,在考察终端操作能力的 Terminal Bench2.1 上,DeepSeek-V4-Flash 正式版的得分从 61.8 涨到了 82.7;在代码仓库理解与修改任务 NL2Repo、DeepSWE 上,分别得分 54.2 和 54.4,而其前身 Flash Preview 在 DeepSWE 项目上的得分仅为 7.3。
另外,其指向网络安全任务的 Cybergym 得分为 76.7,反映工具调用能力的 Toolathlon-Verified 达到 70.3。
在更综合的智能体评测中,DeepSeek-V4-Flash 正式版在 Agent Last Exam 和 Automation Bench Public 上的得分分别为 25.2 和 25.1,这两个项目都是 2026 年新推出、面向 AI 智能体的现实任务评测基准,用来检验大模型 Agent 能不能真正完成真实工作,区别于 MMLU、Humanity ’ s Last Exam 这类纯问答测试。
在内部全栈开发测试 DSBench-FullStack 与高难度编码测试 DSBench-Hard 上,得分则达到 68.7 和 59.6。多项指标远超今年 4 月上线的 V4-Pro 预览版。
新版本上线后,Artificial Analysis 和 Arena.ai 两大 AI 评测平台同步更新了该模型的基准测试结果。
Artificial Analysis 智能指数显示,DeepSeek-V4-Flash 获得 50 分,比 4 月发布的 Flash 版本高出 10 分,仅比 OpenAI 的 GPT-5.6 Luna(51 分)低 1 分。该平台发文称,即使 OpenAI 将 GPT-5.6 Luna 的价格下调了 80%,DeepSeek-V4-Flash 正式版在其自有 API 上的单任务成本仍然比 GPT-5.6 Luna 低约 60%。
Arena.ai 的报告称,DeepSeek-V4-Flash 正式版以 1586 分的成绩重塑了 Frontend Code Arena 跑分榜单。每 MToken 的价格为 0.14 美元 /0.28 美元,是同类产品中性价比最高的。
申万宏源证券最新研报称,DeepSeek-V4-Flash 继续展现国产模型超高性价比;国联民生证券称,DeepSeek-V4-Flash 轻量模型追平旗舰性能,利好 AI 应用产业链。


