新浪科技讯 7 月 23 日下午消息,近日,月之暗面企业业务负责人黄震昕回应了外界关于 "K3 是蒸馏小模型 " 的猜测,明确否认这一说法,强调 K3 性能跃升的核心来自底层原创架构创新,而非对现有模型的蒸馏复刻。
7 月 16 日,月之暗面 Kimi K3 发布,该模型以 2.8 万亿参数规模成为全球最大的开源模型,并凭借在 Arena 前端代码榜单登顶的表现引发全球 AI 圈震动。然而,部分业内人士质疑其性能突增可能源于对闭源大模型的蒸馏——即通过 " 师承 " 已有大模型输出进行训练,而非独立研发。黄震昕的表态否定了这一质疑,指出 K3 的竞争力来自三项原创技术:Kimi Delta Attention(KDA)混合线性注意力机制、Attention Residuals(AttnRes)注意力残差技术,以及首次应用于大模型训练的 Moon Clip 二阶优化器。
其中,Moon Clip 优化器能在训练数据见顶的背景下,让 20T 数据跑出 40T 的训练效果,同等性能下训练成本与算力功耗直接减半。配合 896 个专家中仅激活 16 个的极致稀疏 MoE 架构,K3 相较前代 K2 的整体扩展效率提升约 2.5 倍。


登录后才可以发布评论哦
打开小程序可以发布评论哦