DeepSeek V4.1 Flash 上线,跑分重回国产一哥!
而且这次,是完全重新训练的非对称模型新架构。
552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B。
这种架构成本显著低于已知的同尺寸模型,难怪这两天测试感觉速度飞快,原来不光是因为用的人少。
这次重新预训练、用了新的数据、强化学习后训练规模更大,训练过程还与新版 DeepSeek Harness v0.1.5 深度结合。
所以 Flash 打败自家 Pro(除了知识容量),昨天还觉得离谱,今天一下子合理了起来。
V4.1 Flash 也是 DeepSeek 首个原生支持多模态视觉理解的正式版模型,此前视觉能力以实验版 V4 Flash Vision Exp 的形式单独提供,现在统一到了一个模型里。
再加上 9 月 14 日起所有 V4 Pro 的请求会被重新路由到 V4.1 Flash。
所以未来一段时间内,直到 V4.1 Pro 上线,DeepSeek API 将只提供这一个模型。
此外,还有一个能影响整个行业的消息。
推理效率方面,V4.1 Flash 的 KV Cache 缓存大小相比上一代模型,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。
从初代 V1 到 V4.1 Flash,KV Cache 足足缩小到原来的 1/437。
咱就是想问,内存啥时候降价?
51 页论文解析
模型变化这么大,论文也少不了,刚放出的 pdf 足足有 51 页。
从标题就在强调 " 把 KV 缓存压缩到极致 "。
究竟怎么压缩这么狠的呢,先从架构开始说起。
非对称 Transformer,提示词不必走完整 40 层
新架构是 40 层因果 Transformer,被切分为前 20 层的因果编码器和后 20 层的解码器,这套结构命名为 Causal Encoder-Decoder(CED)。
CED 受 YoCo 架构启发,但做了一系列结构改进来提升 KV Cache 容量和 KV 生成的计算深度。
CED 的核心在于非对称。编码器处理输入时激活 8B 参数,解码器生成输出时激活 16B 参数。
在 Agent 工作负载中,频繁的工具调用会产生大量 prefill 请求,CED 的处理方式是:解码器的全局 KV Cache 不从各层自身的隐藏状态生成,而是直接从编码器最后一层(第 20 层)的隐藏状态投射得到,每层使用独立的投射权重。
这样一来,大部分 prompt token 只需通过前 20 层编码器,不必再走完整的 40 层。
对于序列长度远大于滑动窗口的场景,prefill 计算复杂度直接从 O ( NL ) 降至约 O ( NL/2 ) ,接近减半。
CSA2 注意力:沿三个维度同时压缩缓存
接下来是注意力机制的改动。
Compressed Sparse Attention 2(CSA2)取代了 V4 中 CSA 与 HCA 的混合架构。
CSA2 沿三个维度同时压缩缓存:条目大小、序列维度和层维度。
跨层复用全局 KV 和 Top-K 索引来减少存储和计算。
CSA2 的压缩器和索引器也做了简化,去掉了 CSA 中相邻压缩条目之间的重叠和绝对位置嵌入,索引器 K 改为从主 KV 条目投射获得,而非从隐藏状态单独压缩。
CSA2 定义了三种静态分配的工作模式。
Full 模式执行完整计算路径,生成自己的全局 KV,投射索引器 K,运行索引器产生 Top-K 索引。
Reindex 模式复用前序 Full 层的全局 KV 和索引器 K,但用自己的索引器查询重新评分,选出新的 Top-K。
Reuse 模式最轻量,直接复用前序层的全局 KV 和 Top-K 索引,不做任何索引计算。三种模式下每层都保留自己的查询和滑动窗口 KV(SWA KV)。
三种模式下每层仍保留自己的查询和滑动窗口 KV。编码器以少数纯 SWA 层开场,其余按组编排,每组一个 Full 带若干 Reuse;解码器则大量使用 Reindex 打头的组,在复用缓存的同时保留逐层重新选择注意力目标的能力。
解码器另外引入层次化稀疏索引器。
第一个 Full 层在扫描全部可见位置的同时,通过逐块评分构建一个共享候选池;后续 Reindex 层只在池内搜索。
由于池的大小固定,深层索引器的每查询计算量不再随上下文长度增长。这个机制是 training-aware 的,在后训练中引入,训练与推理施加相同的候选约束。
缓存精度与持久化分层
缓存精度上,V4.1 Flash 将主 KV Cache 从 FP8 进一步压到 FP4,采用分组缩放因子的 E2M1 方案,并在论证数值范围安全后省略了二级全局缩放因子。
对量化更敏感的 SWA KV 仍保留 FP8。FP4 通过 QAT 在后训练阶段引入,量化点选在 RoPE 之后——放在之前只有边际精度收益,却要付出解码开销。
部署侧引入SWA Bounded Replay。
上一代精确重建 SWA KV 需要按层数成倍回放 token,生产环境成本过高,V4.1 改为只回放最近一个窗口的 token 做近似重建,对响应质量影响可忽略。
于是 KV Cache 被拆成两级,SWA KV 移出持久化层,改放在各机预留的一小部分主机 DRAM 组成的分布式内存池中,TTL 只有分钟级,过期即回收;全局 KV 留在 SSD 上的持久化缓存,保证数十小时生命周期。
其他架构扩展
- Single-Pass mHC:将输入混合系数偏移一个块,消除原始多核实现中的数据依赖;配合 Mega-mHC 部署内核,激活内存流量减半并触到理想下界。
- Engram 条件记忆模块:在浅层和中层各插入一处,多阶 n-gram、多 hash head 索引,推理时通过后台 RDMA 从主机内存预取嵌入。它贡献了模型中相当大比例的参数量。
- DSpark 投机解码:在骨干冻结后独立训练,用少量 Transformer 块并行产出多个草稿位置的 logits,配一个 Markov head 建模草稿 token 间依赖、一个置信度 head 预测逐位置接受概率,调度器再结合引擎吞吐曲线为每个请求动态选择验证长度。
45 万亿 token 预训练,后训练只改数据不改算法
预训练,数据重新清洗
模型在数十万亿 token 的多模态语料上预训练,全程无不稳定。
稀疏注意力从零开始训练,没有任何密集注意力预热阶段;多模态数据从第一步就混入;长上下文扩展在训练后段一次完成。
这次 DeepSeek 在数据侧提出两个判断。
一是把弱模型生成内容和低质量机器翻译定义为 "隐性重复" 并过滤掉,理由是它们主要是对已有信息的改写,在长训练周期中可能有害。
二是发现爬虫系统过度偏向纯文本网页,于是从 Common Crawl 重新引导抓取以提高多模态来源覆盖。
交错图文数据的构建被组织成成本递增的流水线:在昂贵的图像检索之前先用启发式过滤、去重和质量模型筛出高价值文档,组装成交错序列后再做图像感知的过滤与去重,最后交给 VLM 严格评分;被淘汰的文档还会部分回收为图文对。
优化器是分层的:线性变换权重用 Muon,归一化与非矩阵参数用 AdamW,嵌入表和预测头则用基于 Sinkhorn 平衡的动量更新。交替对行列归一化以近似均衡更新矩阵的行列 RMS,只需一个动量缓冲区而非 Adam 的两个状态,直接压掉了巨量 Engram 参数带来的优化器状态内存。
Q/K 权重使用 head-wise Muon,为不同注意力头提供不同预条件器。视觉编码器在学习率衰减前保持冻结,仅归一化层与投射器可训练,衰减开始后再以更小学习率解冻联合优化。
后训练,只改数据不改算法
这次 V4.1 Flash 后训练流程沿用 SFT + RL + OPD 的标准范式,所有改变集中在数据与环境管线。
原文写道:" 在当前阶段,工程化数据和环境管线的边际回报远超后训练中算法创新的边际回报。"
任务合成管线把每个训练任务形式化为(问题、环境、验证系统)三元组,沿难度与正确性两个维度评估,再用这两个信号迭代训练 " 造任务的模型 ",并在任务每次进入新的 RL 运行时用产生的轨迹重新审计质量。
环境构建走了两条路。
General Agent 环境取材于内部员工和合作伙伴的真实交互数据与失败案例,据此重建 SaaS、企业应用和后端系统的 mock 工具集,连工具上下文、交互模式和失败条件一起复现。
Coding Agent 环境则由多个专门化 Agent 协作流水线产出。构建 Agent 判断项目可运行性与可验证性并设计评测点,搭建 Agent 配置依赖、清除泄露解答的痕迹并打包镜像层,解题 Agent 尝试完成任务,独立质检 Agent 审查事实错误、评测点匹配度和可攻击性风险,不通过则交修复 Agent 返工重验。
支撑规模的是自研沙箱平台DSec,训练期间并发实例达到百万级。它没有用 Kubernetes,而是自研放置引擎,以弱一致性换扩展性,多个副本不做同步协调,各自依据近期测量预测资源可用性独立决策,准入约束由各节点本地执行。单物理节点通过 sub-NUMA 分区与 NUMA 绑定,把容器密度提升了一倍以上,再配合延迟敏感执行类和超线程核心调度消除干扰。
RL 中出现了大量奖励黑客和环境破坏行为。
Agent 利用了真实披露的内核驱动权限问题、安全模块的非法内存访问、从软件包镜像服务泄露答案,也删过关键二进制、破坏系统文件、甚至移除整个文件系统。
防御手段是 per-sandbox 的 AppArmor 配置和基于 eBPF 的细粒度网络策略;Agent 弄崩环境会被当作失败轨迹,并向 RL 框架回报一个 "repercussion" 信号。测试阶段同样出现类似行为。Agent 会去反编译系统软件包挖漏洞。
可控推理强度
系统提示词中可加入一个标量 effort 级别,token 惩罚系数随其指数衰减,API 对外只暴露三档。
从低档到最高档,推理基准与 Agent 基准的成绩都有可观提升,代价是数倍输出 token;但收益并不线性,中高区间就能恢复最大设置的大部分准确率而 token 消耗不到一半,最后一段提升要用近两倍的轨迹长度换边际改善。
虽然训练只用了有限几个级别,部署时中间值仍能引出插值后的推理行为。
OPD:多教师与 token 级中断恢复
蒸馏阶段动用了四十余个教师模型,不同领域的最优教师可能来自模型开发的不同阶段,彼此架构也未必相同。
配套的异步生成机制支持token 级中断与恢复:rollout 状态(含 KV Cache 与专家路由)以 token 粒度持久化,切换检查点后直接复用,彻底消除重新 prefill 的成本。
一句话总结
V4.1 Flash 的全部架构创新几乎都指向同一个目标,让 KV Cache 在层与层之间尽可能被复用、在精度和存储层级上尽可能被压缩。
从而让长上下文 Agent 负载在经济上成立。
在后训练上,DeepSeek 公开承认算法已非瓶颈,几乎把资源全押在数据与环境工程。
论文地址:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
参考链接:


登录后才可以发布评论哦
打开小程序可以发布评论哦