日前,DeepSeekV4-Flash 正式版上线公测。最新公布的数据显示,在目前全球主流大模型中,该模型已经成为推理成本最低的模型之一。
DeepSeek 战略转向 Agent,Token 成本成为核心突破点。日前,DeepSeekV4-Flash 正式版上线公测,截至目前,公测仍在进行中。
Artificial Analysis 最新公布的数据显示,在目前全球主流大模型中,DeepSeek V4 Flash 已经成为推理成本最低的模型之一。
据 DeepSeek 于 7 月 31 日在 API 文档更新的日志显示,V4-Flash 正式版版本名为 DeepSeek-V4-Flash-0731。截至目前,DeepSeek 网页端和 App 端使用的模型尚未同步更换。

Artificial Analysis 官网截图
V4-Flash 正式版上线当天,第三方评测机构 Artificial Analysis 给其综合能力打出 50 分,这与谷歌 Gemini 3.6 Flash 相当,但仍低于月之暗面的 Kimi K3、OpenAI GPT-5.6 以及 Anthropic Claude Opus 5 等模型。
同日,DeepSeek 也明确表示,V4-Pro 正式版能力更强,但目前尚未发布。
相比模型能力本身,此次升级引发业内更多讨论的是 V4-Flash 的成本控制能力。
财闻注意到,2023 年以来,大模型竞争更多围绕参数规模、推理能力和基准测试成绩展开。而随着模型能力逐渐趋同,国内外模型厂商持续加码 Agent、企业级 AI 应用和 API 生态,模型价格也再次成为竞争焦点。
01
参数规模未变
重点转向 Agent 能力
DeepSeek 早在 4 月 24 日就发布了 V4 预览版,包括 V4-Pro 和 V4-Flash。Flash 预览版总参数约 2840 亿,单 Token 激活约 130 亿,支持 100 万 Token 上下文。
此次 0731 版本的模型结构和规模均未变化,DeepSeek 明确表示,升级主要来自重新后训练。
V4-Flash 正式版原生支持 Responses API 格式,支持 Agent 任务、工具调用(Tool Calling)、多轮推理等能力,并进一步兼容 Codex 接口,为开发者提供更完整的智能体开发能力。
相比此前版本,V4-Flash 更加面向开发者和企业场景,而不仅仅是普通用户聊天应用。
官方公布的测试结果显示,V4-Flash-0731 在 Terminal Bench 2.1、DeepSWE、Toolathlon 等九项代码和智能体测试中,均超过 V4-Pro 预览版。其中,DeepSWE 成绩由预览版的 7.3 分提高至 54.4 分,Terminal Bench 2.1 由 61.8 分升至 82.7 分,Toolathlon-Verified 由 49.7 分升至 70.3 分。
02
每百万输出 Token 仅需 2 元
V4-Flash 目前的 API 价格为每百万输入 Token 0.14 美元、每百万输出 Token 0.28 美元。Artificial Analysis 估算,它完成一项基准测试任务的平均成本约为 0.03 美元,同一套测试中,Kimi K3 约为 0.86 美元,OpenAI GPT-5.6 Sol 约为 1.86 美元,Claude Fable 5 约为 3.15 美元。V4-Flash 与后者的成本差距超过 100 倍。

DeepSeek 官网截图
国内模型市场此前已进行多轮降价。官网数据显示,阿里 Qwen3.6-Flash 在较短上下文下,每百万 Token 输入和输出价格分别为 1.2 元和 7.2 元;字节跳动豆包 Seed-2.1-turbo 分别为 3 元和 15 元,面向代码和 Agent 任务的 Seed-Evolving 分别为 6 元和 30 元;月之暗面 Kimi K2.7 Code 分别为 6.5 元和 27 元,旗舰模型 Kimi K3 则达到 20 元和 100 元。
一些轻量模型的输入价格低于 V4-Flash,但在代码能力、上下文长度和复杂任务定位上并不完全相同。V4-Flash 的特殊之处,在于同时提供 100 万 Token 上下文、较强的代码和工具调用能力,以及每百万输出 Token 仅 2 元的价格。
棱镜咨询创始人况玉清接受财闻采访时称,中国开源模型在部分尖端任务上仍与 OpenAI、Anthropic 存在差距,但在通用任务和中高端应用场景中,替代效应已经十分明显。
" 当模型能力相差不大,竞争的核心就会转向性价比,这将直接压缩头部厂商的定价能力和盈利空间。" 况玉清说。
不过,较低的 API 报价并不一定意味着企业最终承担的成本更低。
燕基空间研究中心何基永向财闻表示,价格将成为下一阶段大模型竞争的 " 入场券 ",但真正的衡量标准是单位有效产出成本。
" 企业最终比较的不是每百万 Token 的标价,而是完成一项任务需要多少钱,其中还包括准确率、响应速度、重试次数和人工干预成本。" 何基永说。
输出价格对 Agent 应用尤其重要。传统聊天通常只需要模型完成一次回答,而智能体需要反复读取文件、搜索资料、调用工具、修改代码并验证结果,一项任务可能产生几十次模型调用,消耗数十万乃至数百万 Token。


登录后才可以发布评论哦
打开小程序可以发布评论哦