咸宁融媒 8小时前
国产GPU大模型适配再提速:摩尔线程实现 Kimi K3 2.8 万亿参数模型 Day-0 支持
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 27 日 , 月之暗面正式开源 2.8 万亿参数模型 Kimi K3, 并发布模型权重与技术报告。作为国产 GPU 适配前沿大模型的最新实践 , 同日 , 摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈 , 率先完成 Kimi K3 的极速适配与稳定拉起。这不仅展现了 MUSA 软件生态面向前沿模型的快速响应与全栈协同能力 , 也再次验证了国产全功能 GPU 支撑万亿级大模型创新的工程实力。

作为全球首个开源的 3 万亿级别模型 , 也是 Kimi 迄今能力最强的模型 ,Kimi K3 拥有 2.8 万亿参数 , 基于 KDA 混合线性注意力机制 ( Kimi Delta Attention ) 和注意力残差 ( Attention Residuals ) 技术构建 , 采用 Gated MLA 与 Stable LatentMoE 等架构创新 , 原生支持视觉理解 , 并拥有 100 万 token 上下文窗口 , 面向长程编程、知识工作和推理等前沿智能场景而设计。

与传统 Transformer 模型相比 ,Kimi K3 并非简单扩大参数规模。69 层 KDA 与 24 层 Gated MLA 共同构成混合注意力主干 ,AttnRes 重新设计跨层信息流 ,Stable LatentMoE 则以 896 个专家、每个 token 激活 16 个专家的方式进一步提升模型容量。新架构同时改变了算子、缓存、通信与调度方式 , 对 AI 芯片的软件栈提出了系统性挑战 , 也为国产 GPU 的软件栈适配能力带来了全新考验。

面向新架构 , 构建 Day-0 系统级工程路径

摩尔线程在模型开源后第一时间完成模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配 , 并打通从 SGLang-MUSA 推理框架 , 到 MATE 算子库、Triton MUSA、TileLang MUSA 适配路径。MTCC 编译器 ,MUSA 运行时均高效支持 SGLang JIT、DSL 算子在 MTT S5000 上快速部署运行。

面对 KimiK3 官方 MXFP4 checkpoint, 摩尔线程设计了加载期在线逐层量化方案 , 无需离线转换 , 为 Day-0 快速拉起 K3 模型推理提供了关键支撑。

这条链路既保证了 Kimi K3 架构语义的准确复现 , 也为国产 GPU 后续融合算子、图执行、长上下文缓存和大规模 PD 分离优化预留了清晰的演进空间。

KDA: 打通线性注意力与状态管理

KDA 是 Kimi K3 最核心的架构创新之一。它以固定大小的递归状态压缩历史信息 , 减少长上下文场景下随序列长度持续增长的 KV Cache 压力 , 但也引入了与传统 Attention 完全不同的计算和内存管理方式 , 这也对国产 GPU 的内存调度与算子适配能力提出了差异化要求。

针对 Prefill 阶段的大批量 token 计算与 Decode 阶段的逐 token 递归更新 , 摩尔线程分别完成了 KDA Prefill、KDA Decode、短卷积和递归状态更新等关键路径适配。Day-0 版本以 Triton MUSA 正确性实现作为稳定基线 , 并通过 MATE 统一算子接口衔接后续高性能内核。

在运行时侧 ,SGLang-MUSA 同步适配 Hybrid State Pool, 用于管理 KDA recurrent state 与 conv state, 并支持状态分配、原地更新、快照和恢复。相较于只移植一个 KDA 算子 , 这套实现进一步覆盖了 Prefix Cache、分块 Prefill 以及 PD 分离场景所需的状态生命周期 , 为国产 GPU 落地百万上下文大模型能力打下工程基础。为百万上下文能力的工程落地打下基础。

AttnRes 与 Gated MLA: 准确复现 K3 信息流

AttnRes 通过可学习的跨层残差连接 , 让模型能够从前序多个 Block 的输出中动态聚合信息。它并不是普通 Residual Add 的简单替换 , 而是贯穿模型深度方向的一套状态与权重管理机制 , 相关机制的适配也是国产 GPU 支持新型大模型的重要环节。

摩尔线程完成了 AttnRes block bank、跨层残差聚合和模型执行顺序的框架适配 , 确保 Kimi K3 在深度方向上的信息流与官方模型定义一致。

与此同时 ,Gated MLA 在 MLA 输出路径中增加门控机制。MUSA 软件栈完成相关投影、门控、归一化与注意力路径的组合适配 , 并与 KDA 层共同纳入 SGLang-MUSA 的 Hybrid Attention 调度 , 使两类注意力模块能够在同一模型中稳定交替执行。

Stable LatentMoE: 承载 896 选 16 的稀疏专家计算

Kimi K3 将 MoE 规模扩展至 896 个专家 , 每个 token 激活 16 个专家。面对更高的专家稀疏度 , 单纯完成 TopK 路由并不足以支撑分布式推理 , 还需要打通 token dispatch、expert GEMM、combine 以及跨卡 All-to-All 通信 , 这一规模也对国产 GPU 的分布式通信与调度能力提出了更高要求。

围绕 Stable LatentMoE, 摩尔线程快速完成了 DeepEP 对 896 专家、TopK 16 激活规模的适配 , 打通面向 Kimi K3 的 token dispatch、combine 与跨卡 All-to-All 通信链路 , 为模型 Day-0 拉起补齐了关键的 MoE 通信能力。

在此基础上 ,MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配 , 并通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信 , 为 Kimi K3 在多机多卡环境中的规模化部署提供基础为国产 GPU 集群承载万亿参数大模型的规模化部署提供基础。。

MATE、Triton-MUSA 与 TileLang-MUSA 协同加速

Kimi K3 Day-0 适配并不依赖单一算子方案 , 而是由多层次算子生态共同支撑 , 这也是国产 GPU 构建完整软件生态的典型思路。

▼ 完整的主流生态兼容迁移能力 :

MUSA 在编程模型、运行时接口和主流 AI 生态接入层具备高度生态兼容与迁移能力 , 使上游主流生态实现能够被快速识别、迁移和验证 , 大幅缩短新模型从社区代码到摩尔线程全功能 GPU 的适配周期。

▼ Triton-MUSA 提供稳定基线 :

对 KDA、Gated MLA 及相关融合计算 ,Triton-MUSA 能够快速承接参考实现与正确性回退 , 在 Day-0 阶段优先保障模型语义、数值结果和执行稳定性。

▼ TileLang-MUSA 打通高性能内核开发 :

TileLang-MUSA 工具链已经完整接入 MUSA 软件栈 , 可直接承载 KDA、AttnRes、MoE 等自定义算子的原型开发、JIT 编译和性能迭代 , 让面向新架构的算子优化可以从高层 DSL 快速下沉到 MTT S5000。

▼ MATE 提供统一算子调度 :

自研 MATE 算子优化引擎负责能力检测、算子选择与后端调度 , 将 Triton、TileLang、预编译内核和稳定回退路径统一到同一调用接口中。由此形成 "SGLang-MUSA → MATE → Triton/TileLang/MTCC → MUSA Runtime" 的完整软件栈闭环。

分布式推理链路同步就绪

面向万亿级模型 , 单机算子支持只是第一步。摩尔线程进一步打通 SGLang-MUSA 与 MCCL、DeepEP、MTSHMEM、Mooncake 等组件的协同链路 , 覆盖张量并行、专家并行以及 Prefill/Decode 分离所需的模型执行、通信与状态传输能力。

其中 ,MCCL 承担集合通信 ,DeepEP 承载 MoE token dispatch 与 combine,Mooncake 负责 PD 分离场景下 KV Cache 与 KDA state 的跨节点迁移。框架、算子、通信和状态池由同一套调度体系衔接 , 使 Kimi K3 能够从单域正确性验证平滑扩展到多机多卡部署。

MTT S5000 稳定承载 Kimi K3

在 MTT S5000 平台上 ,Kimi K3 已经完成模型加载、服务启动和基础推理链路验证。运行过程中 ,Prefill 和 Decode 节点 ,MTT S5000 均展现出卓越的计算承载力 , 系统全程稳定运行 , 显存管控高效 , 充分体现了国产 GPU 硬件平台对超大参数模型的承载能力。

从 Day-0 支持到持续性能演进

此次实现 Kimi K3 的极速支持 , 标志着摩尔线程在极短时间内完成了对前沿架构的精准解构、全链路打通与稳定验证。在此基础上 , 摩尔线程将继续推进 KDA 融合内核、TileLang-MUSA 算子优化、MUSA Graph、Prefix Cache、长上下文内存管理以及大规模 PD 分离等能力 , 持续释放 Kimi K3 在 MTT S5000 上的性能潜力。

未来 , 摩尔线程将继续依托 MUSA 软件栈强大的生态兼容性 , 持续在第一时间拥抱并赋能前沿大模型生态 , 以高性能、可规模化的全功能国产 GPU 基础设施 , 加速 AGI 技术的创新与产业化落地。

免责声明:此文内容为本网站转载企业资讯,仅代表作者个人观点,与本网无关。所涉内容不构成投资、消费建议,仅供读者参考,并请自行核实相关内容。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

kimi 摩尔 gpu 开源 准确
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论