DeepSeek 在 7 月 31 日低调放出 V4-Flash 正式版公测,模型参数没变,但 Agent 和代码能力突飞猛涨,多项基准甚至反超了自家更大的 Pro 预览版。
一、更新核心:后训练让轻量版 " 逆袭 "
发布时间:7 月 31 日下午,DeepSeek 在 API 文档更新日志中挂出通知,V4-Flash 正式版(V4-Flash-0731)上线公测。
模型参数:采用 MoE 架构,总参数 2840 亿、激活参数 130 亿,与之前的预览版完全一致。
能力飞跃:仅通过重新进行后训练(post-training),重点强化了智能体(Agent)与工具调用方向,使代码修改、多步骤任务执行等能力大幅提升。
基准成绩:在 TerminalBench、Cybergym、Toolathlon 等九项 Agent 与代码类基准测试中,全部超过 1.6 万亿总参数的 V4-Pro 预览版。其中在 DeepSWE 基准上分差达 41.6 分,在 ALE 基准上与顶级模型 Claude Opus 4.8 仅差半分。

二、技术逻辑:告别单纯堆参数
Scaling Law 再受挑战:2026 年以来,行业重回 " 万亿参数时代 ",阿里 Qwen 3.8-Max 总参数达 2.4 万亿,月之暗面 Kimi K3 达 2.8 万亿。而 DeepSeek 此次证明,后训练优化同样能带来质变,无需大幅增加算力。
自研工具:基准测试采用了自研的 DeepSeek Harness 极简模式跑分,类似 Codex 工具,并加大了智能体方向的专家训练力度。
原生适配:首次原生支持 Responses API 格式,并针对 Codex 进行深度适配,方便开发者接入 Agent 和 AI 编程场景。
三、定价与市场影响
超低价格:每百万 tokens 输入仅 0.14 美元,输出 0.28 美元,远低于同类模型。国产模型正将前沿 Agent 能力变为 " 所有人都用得起的基建 "。
仅限 API:此次更新仅针对 API 接口,App 和网页端暂未调整。V4-Pro 正式版预计 8 月初完成接入。
行业点评:分析认为,AI 竞争正从 " 谁参数多 " 转向 " 谁在真实场景中又好又便宜地干活 "。
精选参考来源 查看全部
本文由 AI 生成


登录后才可以发布评论哦
打开小程序可以发布评论哦