第一财经 11小时前
Kimi K3部署能力突破英伟达生态,完成45纳米推理芯片原型设计
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

北京时间 7 月 27 日晚,月之暗面 Kimi 在全球开源社区 Hugging Face 正式发布 Kimi K3 完整模型权重。同步公开的还有详细技术报告,以及支撑该模型训练的三项关键基础设施技术—— MoonEP、FlashKDA 和 AgentEnv。此次开源采用修改版 MIT 许可证,开发者可按需下载、修改并本地部署。

Kimi K3 总参数规模达 2.8 万亿,激活参数 1040 亿,是全球首个迈入 3 万亿参数级别的开源模型。模型基于混合专家(MoE)架构,在 896 个路由专家中每个 Token 仅激活 16 个。架构上采用自研 Kimi Delta Attention(KDA)混合线性注意力机制与 Attention Residuals(注意力残差)技术,原生支持视觉理解,上下文窗口达 100 万 Token。相比上一代 Kimi K2,整体扩展效率提升约 2.5 倍。

技术报告披露,Kimi K3 在编程、智能体、推理与视觉等数十项基准测试中超越所有开源模型及多数闭源模型。在 Arena Intelligence 的 WebDev Arena 中,Kimi K3 以 1679 Elo 登顶,成为首个在该榜单夺冠的开源模型;Artificial Analysis Intelligence Index v4.1 得分 57.1,排名全球第四。报告同时指出,其整体性能仍略逊于 Claude Fable 5 和 GPT-5.6 Sol。

此次开源尤为值得关注的是 Kimi K3 在 GPU 与芯片算力层面展现的自主工程能力。

技术报告显示,在 GPU 内核优化测试中,Kimi K3 在 24 小时内独立完成了 AttnRes、DeepSeek Sparse Attention、KDA 和 MLA 四种代表性内核的优化。其中 AttnRes 延迟从 283.6 毫秒降至 114.4 毫秒,DSA 和 KDA 运行时间分别减少 55.1% 和 73.6%,MLA 接近峰值 TFLOPS。该表现与 Claude Fable 5 持平,显著优于 Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5。

需注意的是,测试环境同时覆盖了 NVIDIA H200 与来自其他供应商的 GPGPU,意味着 Kimi K3 的部署能力已不局限于英伟达生态。

报告还显示,Kimi K3 自主开发了名为 MiniTriton 的紧凑型 GPU 编译器,从 Python 前端到 PTX 代码生成全链路均由模型完成,在 NVIDIA L20 上性能超越 PyTorch eager、torch.compile 和标准 Triton 实现。

作为早期的概念验证,技术报告披露 Kimi K3 在 48 小时自主运行中,基于开源 EDA 工具和 Nangate 45nm 工艺库,完成一款推理芯片原型的设计、优化与验证。该芯片面积仅 4 平方毫米,集成 146 万个标准单元、0.277MB SRAM 及带融合去量化的 INT4 MAC 阵列,是一款由模型设计、为模型服务的芯片,标志着 AI 已具备从算法到硬件的全栈自主工程能力。

与模型权重同步开源的还有三项基础设施技术:MoonEP 是为超大规模 MoE 设计的高性能专家并行通信库,可实现完美负载均衡;FlashKDA 是 KDA 注意力机制的高性能算子,在英伟达 H20 上预填充速度相比基线提升 1.72 至 2.22 倍;AgentEnv 是与 KVCache.ai 合作开发的智能体沙箱系统,支持快速快照、恢复与 Fork,用于大规模 Agent 训练环境。

月之暗面表示,此次开源旨在加速前沿智能的部署与普及,促进 AGI 研究。随着 Kimi K3 完整权重、技术报告及核心 Infra 技术的同步开放,开源大模型正式迈入 2.8 万亿参数阶段。

( 本文来自第一财经 )

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

kimi 英伟达 开源 芯片 gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论