易简读书 17小时前
DeepSeek杀死了V4 Pro,享年32天!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

作者 | 王馨

编辑 | 汤安迪

9 月 10 日,DeepSeek V4.1 Flash 正式上线了。

这次被 " 背刺 " 的不只是同行。DeepSeek 直接宣布,V4.1 Flash 在性能、成本、速度和完成任务的总耗时上,已经干掉了自家的 V4 Pro。

因此,从北京时间 9 月 14 日中午 12 点开始,所有发往 V4 Pro 的 API 请求,都会被自动转给 V4.1 Flash,并按照 Flash 的价格收费。

V4 Pro 今年 8 月 13 日发布,9 月 14 日就下线,享年 32 天。

听起来像免费升舱,用户却不全领情。

DeepSeek 团队成员崔添翼发推后,评论区出现大量反对声音:" 请不要替用户做决定 "、" 你们没有主动和用户对齐需求 "。

原因是一些开发者认为,model_id   不只是一个名字,还代表相对稳定的模型行为。提示词和业务流程都调好了,不能说换发动机就换发动机。

另一边,已经用上的人明显更兴奋。有人说它快到像在聊天中写代码,也有人表示它便宜到可以让编程智能体全天干活,还有人认为它已经重回开源模型榜首,能硬刚 GPT-6 Astra 了。

一个让开发者一边抗议、一边真香的 Flash,为什么敢让 Pro 提前退休?

名字叫 Flash,打的却是旗舰局

V4.1 Flash 是一个原生支持文本和图片的 MoE 模型,主干参数量为 552B,支持最长 100 万 token 上下文,还允许用户在 1 到 100 之间调节推理强度。

简单问题少想一点,复杂任务再开足马力。

从 DeepSeek 官方跑分看,它最强的是代码和智能体:Terminal-Bench 2.1 得分 90.6,DeepSWE v1.1 得分 74.2,两项都略高于 Claude Opus 5。在 CyberGym 和 AutomationBench 中,它也超过了 GPT-5.6 Sol、Claude Opus 5 等旗舰模型。

但在更难的 Terminal-Bench 4.0 和 HLE 中,V4.1 Flash 与 Claude Opus 5 仍有明显差距。简单说,它已经能在代码和智能体任务中打进第一梯队,高难推理还没有全面追上最强闭源模型。

真正让同行难受的,是这个成绩背后的成本。

按照 DeepSeek 官方价格,V4.1 Flash 高峰期每百万 token 的未缓存输入为 ¥ 2,输出为 ¥ 8;低峰期价格减半。缓存命中的输入更便宜,高峰期为 ¥ 0.04,低峰期只要 ¥ 0.02。

与 V4 Pro 切换前的高峰价格相比,V4.1 Flash 的未缓存输入便宜约 78%,输出便宜约 70%,缓存命中费用则下降接近 87%。

单价低只是第一层。更关键的是,它完成任务需要的时间和 token 也在减少。

第三方评测机构 Vals 将 V4.1 Flash 评为目前综合成绩最高的开放权重模型:正确率为 57.86%,略高于 Kimi K3 的 57.81%。两者成绩几乎相同,但完成一次测试,V4.1 Flash 平均花费约 0.30 美元,Kimi K3 需要 6.47 美元。

Vals 还发现,V4.1 Flash 的目录价格虽然高于上一代,但因为完成任务更快、消耗的 token 更少,多数智能体测试的最终费用反而下降了。

独立评测机构 Artificial Analysis 给出的画像也很直观:智能指数 40,在同级开放权重模型中处于前列;平均输出速度约为每秒 198 个 token,约为同级模型中位数的 3 倍;完成一项综合测试平均花费约 0.27 美元。

不只是对比国内模型,V4.1 Flash 已经开始被网友拿来和 GPT-6 Astra 正面对打。

在 OpenDesign 的测试中,13 款模型需要完成真实用户提出的网页、应用和界面设计需求。V4.1 Flash 平均得到 81.2 分,排名第一的 GPT-6 Astra 是 82.7 分,两者只差 1.5 分。

但 V4.1 Flash 完成任务的平均成本只有 0.023 美元,Astra 为 1.61 美元;前者平均用时 5.3 分钟,后者需要 11.1 分钟。也就是说,它用 Astra 约 1.4% 的成本,拿到了 98% 的分数,速度还快了一倍。

具体效果比数字更有意思。

有网友让两款模型生成低多边形射击游戏,Astra 的场景更开阔,但 V4.1 Flash 的地图、武器和角色也相当完整,整体完成度已经接近。

AVIS 用两款模型制作 3D 汽车展示页,Astra 的细节更精致;V4.1 Flash 也做出了完整的交互场景,成本约为前者的十分之一。

在日落海面测试中,V4.1 Flash 花费 0.03 美元、用时 3 分 28 秒,效果不输花费 0.59 美元的 Astra,甚至有网友认为它的光线更自然。

到了结构更复杂的 3D 打印机模拟器,Astra 则明显胜出,机械结构和打印细节都更加真实。

因此,V4.1 Flash 能不能硬刚 Astra,还要看具体任务和效果要求。但它确实已经把接近旗舰的效果,压到了几十分之一的价格。

而这份超强性价比,是 DeepSeek 从底层架构里一点点抠出来的。

更强还更便宜,

秘密是 " 少算、少存 "

V4.1 Flash 的低价,并不是单纯少用几张显卡。它主要做了两件事:让模型读资料时少算一点,再让它记住资料时少占一点空间。

CED 非对称架构:读和写,使用不同算力

传统大模型读题和生成答案,基本使用同一套计算方式。无论是阅读几十万字的代码,还是最后只修改几百行,都要调动相近规模的参数。

V4.1 Flash 用新的 Causal Encoder-Decoder 架构,把这两个阶段拆开了。

模型的主干参数量达到 552B,但读取输入时,每个 token 只激活约 8B 参数;真正开始生成答案后,才提高到约 16B。

可以把它理解成一个工作室:先让一支轻量团队快速阅读资料、提炼重点,再交给更强的团队写出答案。

这特别适合 " 读得多、写得少 " 的 Agent 任务。检查整个代码仓库可能需要读取几十万个 token,最后真正修改的却只有几百行。把漫长的读题阶段做轻,模型自然跑得更快、花得更少。

为了避免 " 少算 " 带来能力下降,DeepSeek 又增加了预训练和强化学习的规模。最终,这个每次只激活少量参数的 Flash 模型,在多项测试中反而超过了体量更大的 V4 Pro。

KV   Cache 压缩,真正的成本杀手

CED 架构解决的是 " 算多少 ",KV Cache 压缩解决的是 " 存多少 "。

大模型每读一段内容,都要把关键信息暂时存进 KV Cache。上下文越长,这份工作记忆越大,也越占显存和硬盘。

V4.1 Flash 把单个 token 的缓存压到了约 890 字节,只有上一代 V4 Flash 的 1/4、初代 V1 的约 1/437。

具体做法可以概括为三招:

CSA2 跨层复用:少数层完整处理信息,其他层重新索引或直接复用,不必每层都保存一整套资料。就像把 " 每个部门都复印一套资料 ",改成 " 几份资料全公司共享 "。

FP4 量化:用更精简的数字格式保存缓存,进一步压缩文件体积。

SWA 有界回放:短期记忆用完即弃,需要时只重新计算最近一段,不再全部保存到硬盘。

三者结合后,KV Cache 占用的 HBM 降到上一代的约 1/4,SSD 存储需求降到约 1/8。一套硬件因此能同时服务更多用户,百万 token 上下文也不再那么昂贵。

另外,V4.1 Flash 还加入了   196B 参数的  Engram 条件记忆。它有点像一个 " 可插拔的知识外挂 ":遇到熟悉的 token 组合,就直接查找相关知识,不必每次都让整个模型从头计算。

整套思路其实很简单:CED 负责少算,KV Cache 压缩负责少存,Engram 负责快速查。V4.1 Flash 的低价,就是这样一点点省出来的。

结语

V4.1 Flash 已在 Hugging Face 开放权重,并采用 MIT 许可证。不过,模型体量庞大,普通电脑很难直接部署。DeepSeek 还专门向大规模部署方喊话:如果计划使用 2000 张 GPU 和存储集群部署,可以直接联系他们。

代码管够,显卡自备。

DeepSeek 这次打磨的也不只是模型。V4.1 Flash 的训练覆盖了不同 Harness、代码仓库和软件环境,官方还专门测试了 DSH 的 Minimal、Standard 和 PTC 等模式,以及它在 Claude Code、Codex、OpenCode 中的表现。

现在的 Agent 有点像赛车,模型是发动机,Harness 是变速箱和底盘。发动机参数再漂亮,装错车也跑不快。DeepSeek 显然准备把这几部分一起做。

至于 V4.1 Pro,目前还只活在官方公告的一句话里。Flash 已经跑成这样,Pro 接下来准备干什么, 压力已经给回 DeepSeek 了。

END •

Question. Write. Narrate. Believe.  

Become a story.

易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

↓↓↓

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论