【TechWeb】8 月 1 日消息,AI 圈又炸了。DeepSeek 悄然上线了 V4-Flash 正式版 API,一个 " 廉价版 " 模型,却在 Agent 能力上碾压了三个月前的 Pro 预览版。更让人震惊的是——它只重新做了后训练,模型骨架一点没变。
昨晚,DeepSeek-V4-Flash 正式版 API 上线。
消息一出,开发者社区瞬间沸腾。
这不是一次普通的版本迭代。一个 2840 亿参数的 MoE 模型,激活参数仅 130 亿,价格低至 0.2 元 / 百万 tokens(缓存命中),却在多项 Agent 基准测试中,硬生生把三个月前的 V4-Pro 预览版摁在地上摩擦。
最让人细思极恐的是模型结构、尺寸一点没变,只是重新做了一遍后训练。
这意味着什么?后训练优化的空间,可能比我们想象的大得多。
九项基准测试,全面碾压
先看硬指标。
DeepSeek-V4-Flash 正式版采用 MoE 架构,总参数量 2840 亿,激活参数 130 亿,支持 100 万 token 上下文,可切换思考 / 非思考模式。
官方公布的 9 项 Agent 基准测试成绩,堪称惊艳:
最大的亮点在 DeepSWE(专门用于评估 AI Agent 在真实、长周期、多步骤编程任务中的自主解决能力)从预览版的 7.3 分飙升至 54.4 分,暴涨超过 6 倍。在 Terminal Bench 2.1(评估 AI Agent 在 Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力的权威基准测试) 中,Flash 正式版得分 82.7,高于 V4-Pro-Preview 的 72.1 和 GLM-5.2 的 81.0,逼近 Opus-4.8 的 85.0。
在海外模型评测机构 Artificial Analysis 的智能指数测试中,V4-Flash-0731(最高推理档位)拿下 50 分,而同类可比模型的中位数仅为 17 分。
差距,肉眼可见。
真正恐怖的是:模型没变,只重做了后训练
如果说性能提升是常规操作,那这次升级的方式才真正值得细品。
DeepSeek 官方确认:V4-Flash-0731 的模型结构、尺寸与预览版完全一致,仅重新进行了后训练。
同一个骨架,同一套参数规模,只是后训练的策略更精细了,结果就在 Agent 基准测试上产生了质的飞跃。
这让很多人开始重新思考:堆参数真的是唯一出路吗?
后训练阶段的优化空间,可能被严重低估了。
与此同时,DeepSeek 自研的 Agent 测试框架 DeepSeek Harness 也首次正式亮相。
开发者实测:便宜到离谱,干活还不赖
性能是纸面上的,真正让开发者兴奋的是实测体验。
有用户晒出账单:" 蹬了一小时才不到一块钱 "。
价格有多夸张?输入命中缓存 0.02 元 / 百万 tokens,未命中 1 元,输出 2 元。大约只有 Claude 的 1/90(DeepSeek-V4-Flash 的输出价格约 0.28 美元,Claude Opus 4.8 输出 25 美元)。
最让人上头的场景是 Claude Code。
有开发者分享:" 今天正式版出来后,就用官方 API 接入 Claude Code 中开始干活,不到 4 个小时,差不多消耗了 1 亿 token,缓存命中率竟然达到了 99%,关键是干活质量还不错,很少返工。"
另一位用户更直接:" 一遍写完,真实测试一遍完美通过,顺手还修了十几个 bug ……最恐怖的是 opencode 花了 0.1 美元。"
从事 Qt/C++ 上位机、STM 嵌入式开发的个人开发者反馈:"flash0731 的 agent 表现与 v4-pro-preview 的表现非常接近 "," 目前初步使用感觉 flash 在能力上和 pro-preview 相比没有明显差异,但是人是便宜啊!!!"
微博上有用户评价:" 最近又高强度的使用了 DeepSeek V4 Flash,感觉优势貌似又回来了点儿,在代码和 Terminal 指令这块貌似也提升很大。"
槽点也很真实:普通用户玩不了
当然,质疑声也不少。
最大的槽点是仅限 API 公测。网页端和 App 都没有更新,普通用户暂时无法体验。" 对大众玩家不够友好 " 是高频反馈。
指令遵循仍有短板。有开发者指出:" 这版本太喜欢框框干了,没说清楚的事情不太适合交给他干,会出错岔子的;很清晰、有边界的任务可以交给他。"
另外,Agent 模式下推理语言被锁定为英文,系统提示词完全无效。GitHub 上已有用户提出希望开放语言控制参数。
嵌入式开发仍有瑕疵。有开发者反馈:" 在嵌入式开发表现已经比上半年的许多模型表现好很多了,但是还是会出现端口识别不清、写出连编译都通过不了的代码。"
原生支持 Responses API,剑指 Codex 生态
除了模型本身,工程侧的适配同样值得关注。
V4-Flash 正式版原生支持 OpenAI 的 Responses API 格式,并针对性适配了 Codex。开发者可以在 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件中直接调用 DeepSeek 模型。
Responses API 目前仅支持 V4-Flash,V4-Pro 预计 8 月初接入。
这意味着开发者可以用更低的成本,无缝接入 Codex 生态。
长上下文效率:单 token 计算量降至 27%
V4-Flash 在长上下文场景下的工程优化同样值得一提:
100 万 token 场景下,V4 系列的单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降至约 10%。
长链路任务的算力与显存成本,被大幅压缩。
巧合还是狙击?同日 OpenAI 宣布降价 80%
就在 DeepSeek-V4-Flash 正式版上线的同一天,OpenAI 宣布 GPT-5.6 Luna 降价 80%。
时间点耐人寻味。
一边是国际巨头主动降价,一边是中国厂商用 1/90 的价格交出更强的 Agent 能力。
有评论一针见血:"DeepSeek-V4-Flash 正式版的 Agent 能力全面超越此前的 Pro 预览版,相当于用更便宜的价格交出了更强的干活能力。这是在证明,低价不等于低能。"
有业内人士指出,这次升级释放了一个明确的信号,大模型竞赛正在从 " 堆参数 " 转向 " 精调优 "。同样的模型骨架,仅靠后训练的优化,就能在 Agent 能力上实现 6 倍增长。这对整个行业的启发是深远的,参数的尽头可能不是更大,而是更聪明地训练。


登录后才可以发布评论哦
打开小程序可以发布评论哦