快科技 9 月 10 日消息,寒武纪今日宣布已基于 vLLM 推理框架完成对 DeepSeek 最新开源模型 V4.1 Flash 的 Day 0 适配。这意味着 DeepSeek V4.1 Flash 发布当天即可在寒武纪芯片上稳定运行。
DeepSeek V4.1 Flash 是 DeepSeek 全新模型结构系列中尺寸最小的一款,总参数 552B 的 MoE 模型。该模型采用全新的 Causal-Encoder-Decoder 结构,输入侧激活仅 8B 参数,输出侧激活 16B 参数,原生具备多模态视觉理解能力。官方称其成本显著低于已知同尺寸模型。
值得关注的是,V4.1 Flash 在 KV 缓存压缩上实现了重大突破。新模型对 HBM 的需求降至上一代的 1/4,对 SSD 的需求降至 1/8。相对初代模型,KV 缓存已缩小 437 倍。
在性能优化上,寒武纪利用自研高性能融合算子库 Torch-MLU-Ops 对 Engram、Compressor 等模型结构进行专项加速,并利用 BangC 高性能编程语言编写稀疏 / 压缩 Attention 等热点算子的优化 Kernel。
在推理框架优化层面,寒武纪在 vLLM 中全面支持 TP/PP/SP/DP/EP 5D 混合并行、通信计算并行、低精度量化以及 PD 分离部署等优化技术,显著提升端到端推理效率。
寒武纪此次快速适配的背后,是 NeuWare 软件生态的长期积累。就在两天前的 9 月 8 日,寒武纪正式加入 PyTorch 基金会,成为最高级别的白金成员,将在基金会管理委员会拥有一个席位。与 Meta、AMD、AWS、Google Cloud、Microsoft 和 NVIDIA 等全球巨头处于同一级别。
截至目前,寒武纪已完成 GLM、DeepSeek、Qwen、Kimi、MiniMax 五大国产主流大模型的推理适配,分别对应智谱、深度求索、阿里、月之暗面、MiniMax 五家模型厂商。



登录后才可以发布评论哦
打开小程序可以发布评论哦