快科技 9 月 10 日消息,今日,深度求索正式发布 DeepSeek V4.1 Flash 模型,这是其全新模型结构系列中尺寸最小的一款模型,并原生支持多模态视觉理解。
据介绍,新一代模型结构的设计目标是进一步提升能力上限,同时实现更快推理速度、更高吞吐,并为后续扩展至更大参数规模模型打下基础。
DeepSeek V4.1 Flash 采用 552B 参数 MoE 架构,并引入全新的 Causal-Encoder-Decoder 结构。
该结构采用输入、输出不对称设计,其中输入侧仅激活 8B 参数,输出侧激活 16B 参数,因此在保持大参数规模的同时,推理成本显著低于已知同尺寸模型。
与此同时,V4.1 Flash 采用新的预训练方式,并经过更大规模的强化学习后训练。

根据官方公布的基准测试结果,DeepSeek V4.1 Flash 在多项测试中已经超过包括 DeepSeek V4 Pro 在内的一众旗舰模型。

在推理效率方面,新一代模型还大幅压缩了 KV Cache 缓存规模,相比上一代模型,其对 HBM 的需求降低至 1/4,对 SSD 的需求降低至 1/8。
对于 Agent 应用而言,缓存命中往往占据较高成本,因此 KV Cache 的大幅压缩,也将进一步降低 Agent 类任务的实际使用成本。

目前,DeepSeek V4.1 Flash 已同步上线 DeepSeek API,并原生支持多模态能力。开发者只需将模型名称更改为 "deepseek-flash",即可调用最新的 V4.1 Flash 模型。
与此同时,旧版本 V4 Flash 与 V4 Flash Vision Exp 已经下线。
出于兼容考虑,deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 两个模型名称目前将暂时路由至 V4.1 Flash。
官方表示,经多方测试,V4.1 Flash 在性能、费用、速度以及任务总用时等指标上均已全面超过 V4 Pro,因此 DeepSeek 计划有序下线 V4 Pro。
根据安排,北京时间 2026 年 9 月 14 日 12:00 之后,直至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求都将自动路由至 V4.1 Flash,并按照 V4.1 Flash 价格计费。
目前,腾讯 WorkBuddy、CodeBuddy 以及 OpenCode 作为官方合作伙伴,也已经全量接入 DeepSeek V4.1 Flash。
API 价格方面,得益于新模型架构带来的成本下降,DeepSeek 此次同步下调了 V4.1 Flash 的 API 价格。
同时,官方继续采用峰谷定价机制,其中闲时价格为高峰时段的一半,鼓励用户根据实际需求调整任务执行时间。
新价格已于 2026 年 9 月 10 日 12:00 正式生效。




登录后才可以发布评论哦
打开小程序可以发布评论哦