DeepSeek 在 7 月 31 日放出了今年最有分量的一次更新—— V4 ‑ Flash 正式版(0731)API 公测,模型架构和参数规模没变,但纯靠后训练让代码与智能体能力实现 " 突变式 " 跨越,多项评测反超自家体量更大的 Pro 预览版。

一、更新核心:轻量版 Flash 逆袭,Agent 能力质变
后训练驱动:V4 ‑ Flash 正式版总参数和激活参数与 4 月的预览版完全一致(MoE 架构,2840 亿总参数 /130 亿激活参数),仅通过大幅优化后训练流程,重点强化了工具调用、多步骤任务执行等 Agent 方向。
基准全面超越:在 TerminalBench、Cybergym、Toolathlon 等九项 Agent 与代码评测中,V4 ‑ Flash 正式版全部超越自家 1.6 万亿参数的 V4 ‑ Pro 预览版;其中在 DeepSWE 基准上分差高达 41.6 分,在 ALE 基准上距离顶尖闭源模型 Claude Opus 4.8 仅差半分。
" 小模型 " 的逆袭:用 Pro 预览版六分之一的总参数和不到四分之一的激活参数,实现了对 Pro 预览版的大幅反超,打破业内 " 堆参数才能提性能 " 的固有认知。
二、技术亮点:开发原生适配与极致性价比
原生支持 Responses API:首次适配 Codex 生态,开发者只需一次配置即可在 Codex CLI、ChatGPT 桌面端和 VSCode Codex 插件中直接调用 V4 ‑ Flash,极大降低了 Agent 和 AI 编程场景的集成门槛。
Pro 版本将随后接入:当前 Responses API 仅对 V4 ‑ Flash 开放,V4 ‑ Pro 预计 8 月初完成接入;App 和 Web 端暂未变化,非开发者用户体验不变。
定价依旧 " 屠夫 ":V4 ‑ Flash 每百万输出 Token 平时仅 0.28 美元,高峰期 0.56 美元,缓存命中时输入费用低至 0.0028 美元,远低于海外头部模型(如 Fable5 高达 50 美元)。
三、行业破局:从 " 算力竞赛 " 转向 " 效率竞争 "
颠覆规模法则惯性:2026 年以来,阿里 Qwen 3.8 ‑ Max、Kimi K3 等模型纷纷冲上万亿参数,DeepSeek 却用参数不变的 Flash 版本证明,后训练优化和工程创新同样能带来能力跃升。
Agent 能力普惠化:V4 ‑ Flash 将前沿 Agent 能力以极低成本开放给中小开发者和创作者,意味着 AI 竞争正从 " 谁的参数多 " 转向 " 谁在真实场景中又好又便宜地干活 "。
Pro 正式版蓄势待发:官方表示 V4 ‑ Pro 正式版(GA)将尽快上线,届时可能引入全新峰谷计费机制,与 Flash 形成高低搭配的完整产品矩阵。
精选参考来源 查看全部
本文由 AI 生成


登录后才可以发布评论哦
打开小程序可以发布评论哦