虎嗅APP 19小时前
DeepSeek又更新了,这次梁文锋没放大招
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

出品|虎嗅科技组

作者|宋思杭

编辑|苗正卿

头图|视觉中国

这是进击的独角兽第 31 篇,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和 DeepSeek 共 8 家大模型独角兽公司。

梁文锋的热度一直在 AI 圈的 Top 级,尤其是今年。

从 V4 预览版发布,到后来的融资与 IPO 传闻,再到一份流传甚广的四小时谈话实录,DeepSeek 的每一次动作,都能迅速成为行业话题。

7 月 31 日下午,DeepSeek 又更新了。

这次,DeepSeek 只是在 API 文档的更新日志里宣布,V4-Flash 正式版 API 上线公测。

从 " 正式版 " 和 " 公测 " 两个词同时出现来看,这并不是 V4 的最终形态。DeepSeek 也特意强调,本次更新只涉及 V4-Flash 的 API,V4-Pro 及 App、Web 端模型均未发生变化,V4-Pro 正式版还要再等等。

但这次更新依然值得关注。

从最新版本来看,V4-Flash-0731 没有改变模型架构和参数规模,只重新进行了一次后训练。更新后,DeepSeek 把几乎所有篇幅都用来强调它在 Agent,尤其是 Code Agent 上的进步。

这意味着,V4-Flash 并不是一次简单的模型更新。

DeepSeek 正在尝试回答一个新的问题:到了 Agent 阶段,一家公司最需要的,究竟是一个能力最强的模型,还是一个足够强、足够快,也足够便宜的模型?

这一次,DeepSeek 没有继续堆参数

V4-Flash 并不是 7 月 31 日才第一次出现。

4 月 24 日,DeepSeek 发布 V4 预览版时,已经同时推出 V4-Pro 和 V4-Flash。两者都是 MoE 模型,但体量差距明显:V4-Pro 拥有 1.6 万亿总参数,每次推理激活 49B 参数;V4-Flash 拥有 284B 总参数,每次只激活 13B 参数。两款模型均支持 100 万 Token 上下文。

在 DeepSeek 的定位里,Pro 负责能力上限,Flash 负责效率。

参数规模更大的 V4-Pro,在世界知识以及高难度 Agent 任务上表现更好;V4-Flash 则可以通过增加思考预算,在部分推理任务上接近 Pro。换句话说,Flash 牺牲了一部分知识容量,却用更小的激活参数换来了速度和成本。

7 月 31 日的更新没有改变这套架构。

DeepSeek 明确表示,V4-Flash-0731 与预览版的模型结构、尺寸完全一致,仅重新进行了后训练。

但就是这次后训练,让 V4-Flash 的 Agent 能力出现了明显变化。

按照 DeepSeek 公布的结果,V4-Flash-0731 在 Terminal Bench 2.1 上达到 82.7,在 NL2Repo 上达到 54.2,在 DeepSWE 上达到 54.4,在 Toolathlon Verified 上达到 70.3。DeepSeek 称,这些结果已经大幅超过 V4-Pro 预览版。

这件事的意义在于,DeepSeek 没有通过增加参数和重新预训练,来提高模型的 Agent 能力。

用通俗的话来讲就是,DeepSeek 虽然继续在追求 AGI,但是并没有通过一味地增加参数来实现这件事情,而是让模型学会更好地拆解任务、调用工具、执行代码,并在更长的任务轨迹中减少错误。

过去,大模型公司的主要竞争发生在预训练阶段。谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入 Agent 阶段后,模型能力不再完全由预训练决定。

一个模型会不会使用终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知道什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的执行框架。

V4-Flash 的变化,恰好说明了这一点。

这也是为什么,DeepSeek 这次除了更新模型,还原生支持了 Responses API,并专门适配 Codex。同时,DeepSeek 在测试 Code Agent 任务时,使用了尚未正式发布的 DeepSeek Harness minimal mode。

换句话说,这些 Agent 成绩不完全属于模型本身,而是属于 " 模型、推理预算与 Harness" 共同组成的系统。

这当然也意味着,目前公布的数据仍需谨慎看待。

一方面,部分结果来自 DeepSeek 内部测试集;另一方面,DeepSeek Harness 尚未公开,外界还无法在完全相同的环境下复现这些成绩。正式版 V4-Flash 究竟比预览版进步了多少,还需要等待独立评测以及真实开发场景验证。

但至少从这次更新可以看出,DeepSeek 正在从只提供模型和 API,向 Agent 所需要的执行环境多走一步。

但 DeepSeek 目前还没有亲自做一个完整的 Agent 产品,却开始提供让模型进入 Agent 工作流所必需的接口、适配和 Harness。

这是一种非常克制的产品化。

为什么是 Flash?

既然 V4-Pro 的能力上限更高,DeepSeek 为什么不先更新 Pro?

最直接的原因是,Agent 并不是一次模型调用。

在聊天机器人阶段,用户提出一个问题,模型生成一次答案,一次交互就结束了。但在 Agent 任务里,模型需要先理解目标,再拆解任务、检索信息、调用工具、读取结果、修正错误,最后完成交付。

一个复杂任务,可能包含几十次甚至数百次模型调用。

这时,模型单次推理增加的成本和延迟,会在整个任务轨迹中被不断放大。一个能力更强、但速度更慢、成本更高的模型,未必能带来更好的实际结果。

Agent 真正需要的,往往不是每一步都调用能力最强的模型,而是在绝大多数步骤中,使用一个能力足够、价格更低、响应更快的模型。

这正是 V4-Flash 的价值。

根据 DeepSeek 技术报告,在 100 万 Token 上下文下,V4-Flash 单 Token 推理所需的计算量,约为 V3.2 的 10%,KV Cache 则约为 V3.2 的 7%。它的总参数只有 V4-Pro 的约六分之一,每次激活参数也只有 Pro 的约四分之一。

这种差距最终也体现在 API 定价上。

目前,V4-Flash 每百万 Token 未命中缓存的输入价格为 1 元,输出价格为 2 元;V4-Pro 分别为 3 元和 6 元。V4-Flash 的并发限制为 2500,Pro 则为 500。Responses API 目前也只有 V4-Flash 支持,V4-Pro 预计到 8 月初才会接入。

在 V4 的产品体系里,Pro 负责证明 DeepSeek 的模型能力能够达到什么位置,Flash 则负责承担真正高频、长链条的 Agent 任务。前者是能力模型,后者更像生产模型。

梁文锋曾在内部公开说道," 模型应该放在相同成本下比较;在现阶段,Coding Agent 的优先级高于其他垂直 Agent。"

从这个角度来看,V4-Flash 此次更新的方向,确实与这两个判断形成了呼应。

DeepSeek 没有选择通过扩大参数,让 Flash 在所有能力上追上 Pro;它选择在模型架构不变的情况下,通过后训练和 Agent 框架,提高 Flash 完成真实任务的能力。

这背后是一种更现实的计算。

如果 Agent 最终要进入企业和开发者的日常工作流,那么决定模型能否被大规模使用的,不只是 Benchmark,而是完成一个任务需要多少时间、消耗多少 Token,以及最终成功率是多少。

不过,这也是 V4-Flash 目前最需要证明的地方。

DeepSeek 公布的 Agent 成绩大多使用 Max reasoning effort 完成。更高的思考强度通常意味着更长的推理过程和更多 Token 消耗。一个模型每百万 Token 的价格很低,不等于完成一项任务的总成本一定更低。

如果 V4-Flash 需要消耗更多 Token 才能达到接近 Pro 的效果,那么它在单价上的优势,可能会被更长的任务轨迹部分抵消。

因此,真正有价值的对比,不是 V4-Flash 在某一项 Benchmark 上超过了谁,而是在完成同一个 Agent 任务时,它与 V4-Pro、Kimi、GLM 以及闭源模型分别需要多少 Token、多少时间和多少次重试。

DeepSeek 暂时还没有给出这个答案。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash 独角兽 零一万物 虎嗅 融资
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论