21 世纪经济报道记者 雷晨
7 月 27 日晚,月之暗面正式发布 Kimi K3 技术报告,并同步开放完整模型权重。
作为总参数达 2.8 万亿、激活参数约 1040 亿的大模型,Kimi K3 凭借在核心架构上的原始创新,在多项评测中展现出逼近全球顶尖闭源模型的性能。
7 月 28 日,K3 模型即获海内外数十家 AI 基础设施厂商的首日(Day0)适配,引发了全球开发者社区的强烈反响。
值得注意的是,Kimi K3 采用了专门的许可证,为商业化应用设定了门槛。
训练效率跃升
Kimi K3 的技术底座与上一代 Kimi K2 相比有明显变化。技术报告显示,该模型采用了三项核心架构设计:Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)以及 Stable LatentMoE 框架。

KDA 是一种线性注意力机制,它将传统 Transformer 中随序列长度增长的 KV 缓存替换为固定大小的循环状态,从而在 1M 上下文窗口下保持较低的计算开销。Attention Residuals 则允许每一层网络选择性检索前面所有层的表征,改善了信息在深度网络中的流动效率。在 MoE 设计上,Kimi K3 将路由专家数量扩展到 896 个,每个 token 激活其中 16 个,配合 2 个共享专家,实现了约 56 倍的稀疏比例。
月之暗面企业业务负责人黄震昕此前在接受媒体群访时介绍,围绕 token efficiency,团队自研了 Moon Clip 新型二阶优化器,Kimi 团队在全球首次将其落地到大模型训练中。简单理解 Moon Clip 的效果:原本需要 40T 数据才能达到的训练效果,现在只用 20T 训练数据就能实现。目前全球可使用的优质训练数据基本已经挖掘殆尽,这项技术能带来两大价值:一是有限的数据可以激发出模型更高的智能水平;二是想要达到相同性能,模型训练成本、训练计算量(FLOPs)直接减半。
从技术报告披露的缩放曲线来看,上述架构和工程改进共同带来了约 2.5 倍于 Kimi K2 的整体缩放效率提升。模型包含 93 层,其中 69 层为 KDA 注意力层,24 层为 Gated MLA 层。
在视觉能力方面,Kimi K3 的视觉编码器 MoonViT-V2 是一个约 4 亿参数的视觉 Transformer。与以往做法不同,该编码器从头开始通过下一 token 预测训练,而非从 SigLIP 等对比预训练模型初始化。月之暗面团队表示,这种方式在训练稳定性上表现更优,且最终视觉评测结果与 SigLIP 初始化的基线相当。
在训练基础设施方面,月之暗面开源了支撑 Kimi K3 训练的三项关键 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。MoonEP 是为超大细粒度 MoE 设计的高性能通信库;FlashKDA 是 KDA 的高性能算子;AgentEnv 是与 KVCache.ai 合作开发的沙箱系统。
在量化方面,Kimi K3 从监督微调阶段起就采用了量化感知训练,专家权重使用 MXFP4 格式,激活值使用 MXFP8 格式,以降低部署时的显存占用。
评测表现亮眼
Kimi K3 的评测结果显示,其在与主流闭源模型的竞争中具备一定竞争力。
在研究生级科学问答 GPQA Diamond 上,Kimi K3 得分 93.5%,落后于 GPT-5.6 Sol 的 94.1%,略高于 Claude Fable 5 的 92.6%。在更具挑战性的 HLE-Full 评测中,无工具辅助下 Kimi K3 得分为 43.5%,低于 Claude Fable 5 的 53.3% 和 GPT-5.6 Sol 的 44.5%。
在编程能力方面,Kimi K3 在 ProgramBench 上以 77.8% 得分位居第一。在 DeepSWE 评测中得分为 67.5%,落后于 GPT-5.6 Sol 的 73.0% 和 Claude Fable 5 的 70.0%。在 SWE-Marathon 这一面向 GPU 内核优化的评测中,Kimi K3 以 42.0% 领先于 Claude Fable 5 的 35.0% 和 GPT-5.6 Sol 的 39.0%。
值得关注的是 Kimi K3 的成本效率表现。据技术报告披露,在 Kimi Code Bench 2.0 上,Kimi K3 得分比 Claude Fable 5 低约 4 个百分点,但推理成本仅为后者的 38%。在 BrowseComp 上,Kimi K3 以每任务约 2.03 美元的成本获得最高分。这一 " 高性价比 " 特质,证明了开源模型在保证顶尖性能的同时,能够以远低于闭源模型的成本运行,为开源商业路线提供了可行性样本。
在第三方评测方面,Kimi K3 在 Artificial Analysis 的智能指数 v4.1 中以 57.1 分位列第四;在 Vals AI 的行业基准中,以 74.7% 位列第二;在 WebDev Arena 中,Kimi K3 以 1678 Elo 排名第一,是该榜单首个登顶的开源模型。
关于开源与闭源路线之争,黄震昕曾在群访中表示,开源和闭源不存在相互竞争、非此即彼的对立关系,二者面向不同客户需求,在市场上都有存在价值。很多企业有私有化部署、基于开源模型微调的需求,这是开源路线的核心价值;闭源则主打顶级 SOTA 模型能力。他同时强调,Kimi 依托自研底层技术,在 Code 等多项权威榜单中达到全球 SOTA 水平,同时没有陷入行业价格战,希望向全球市场证明中国自研、开源属性的大模型不需要靠低价内卷。
多家厂商 Day0 适配
Kimi K3 开源后迅速引爆开发者社区。Hugging Face CEO 发文称,模型在 30 分钟内获得超 4000 个赞,登顶平台趋势榜榜首。北美 AI 基础设施创企 OsmanticAI 创始人将其称为本地版 Fable 5;美国 AI 创企 Cognition 宣布 Kimi K3 接入 Devin 桌面客户端与命令行工具,并表示在 FrontierCode 1.1 评测基准上,Kimi K3 是其测试过的首款性能逼近前沿水准的开源模型。
开源当天,海内外多家厂商宣布 Day0 适配。
国内方面,阿里云真武 M890 超节点实例完成对 Kimi K3 的首日全面适配,成为国内首个跑通近 3 万亿参数模型的超节点。阿里云、平头哥与 Kimi 团队从软件栈、算子等层面进行了深度联合适配,优化后首 token 时延降低约 35%,单卡解码吞吐提升 1.8 倍,可稳定支持 1M 长上下文。千问 AI 平台和阿里云百炼也将提供 Kimi K3 的模型 API。
华为昇腾同步实现 Day0 全链路适配,依托 Atlas 系列算力硬件、MindSpeed MM 训练套件、vLLM Ascend 与 SGLang 推理引擎,完整覆盖模型训练复现与线上推理部署。
海外方面,Nebius、Baseten、Fireworks 等 AI 基础设施厂商同步宣布支持。vLLM 和 SGLang 两大开源推理框架均提供首日支持,开发者拿到权重即可直接部署。
模型热度高涨的同时,Kimi K3 的许可证设计引发了业内关注。协议允许免费使用、修改和分发,但设置了明确的商业化门槛:如果使用方的模型即服务业务连续 12 个月总收入超过 2000 万美元,需与月之暗面签署额外商业协议;如果基于 Kimi K3 的产品月活用户超过 1 亿或月收入超过 2000 万美元,需在界面中显著标识 Kimi K3 名称。内部使用和通过月之暗面官方产品访问不受此限。
换言之,底层开发者免费使用;中型企业通过官方 API 按 token 付费;顶层超大客户签署单独协议。
据行业测算,国内头部云厂商的单条大模型 API 产品线,年收入跨过 2000 万美元后,边际成本开始陡降,毛利率从负转正。云厂商部署开放权重后以 API 形式对外售卖,定价可比官方低 20% 至 40%。
多位业内人士对记者指出,单独协议涉及的内容可能包括收入分成比例、品牌露出要求、技术支持费用、优先更新权或排他性条款。
更多内容请下载 21 财经 APP


登录后才可以发布评论哦
打开小程序可以发布评论哦