驱动之家 昨天
国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 10 日消息,寒武纪今日宣布已基于 vLLM 推理框架完成对 DeepSeek 最新开源模型 V4.1 Flash 的 Day 0 适配。这意味着 DeepSeek V4.1 Flash 发布当天即可在寒武纪芯片上稳定运行。

DeepSeek V4.1 Flash 是 DeepSeek 全新模型结构系列中尺寸最小的一款,总参数 552B 的 MoE 模型。该模型采用全新的 Causal-Encoder-Decoder 结构,输入侧激活仅 8B 参数,输出侧激活 16B 参数,原生具备多模态视觉理解能力。官方称其成本显著低于已知同尺寸模型。

值得关注的是,V4.1 Flash 在 KV 缓存压缩上实现了重大突破。新模型对 HBM 的需求降至上一代的 1/4,对 SSD 的需求降至 1/8。相对初代模型,KV 缓存已缩小 437 倍。

在性能优化上,寒武纪利用自研高性能融合算子库 Torch-MLU-Ops 对 Engram、Compressor 等模型结构进行专项加速,并利用 BangC 高性能编程语言编写稀疏 / 压缩 Attention 等热点算子的优化 Kernel。

在推理框架优化层面,寒武纪在 vLLM 中全面支持 TP/PP/SP/DP/EP 5D 混合并行、通信计算并行、低精度量化以及 PD 分离部署等优化技术,显著提升端到端推理效率。

寒武纪此次快速适配的背后,是 NeuWare 软件生态的长期积累。就在两天前的 9 月 8 日,寒武纪正式加入 PyTorch 基金会,成为最高级别的白金成员,将在基金会管理委员会拥有一个席位。与 Meta、AMD、AWS、Google Cloud、Microsoft 和 NVIDIA 等全球巨头处于同一级别。

截至目前,寒武纪已完成 GLM、DeepSeek、Qwen、Kimi、MiniMax 五大国产主流大模型的推理适配,分别对应智谱、深度求索、阿里、月之暗面、MiniMax 五家模型厂商。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

寒武纪 flash 芯片 ssd kimi
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论