日前,月之暗面方面宣布正式开源 Kimi K3 模型,并同步发布模型权重、技术报告,此外还开源了支撑 Kimi K3 训练的三项关键 Infra 技术 MoonEP、FlashKDA、AgentEnv,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。据悉,这也是 Kimi K3 自本月早些时候发布以来,完整开放模型及相关技术。

作为首个达到 2.8 万亿参数规模的开源大模型,Kimi K3 是基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并提供 100 万 token 上下文窗口。在过去 12 个月中,Kimi 系列有 9 个月保持了开源模型参数规模的领先。
模型架构方面,Kimi K3 进一步提升了 Mixture of Experts(MoE)的稀疏度,结合 Stable LatentMoE 框架后,可在 896 个专家中高效激活 16 个。官方公布的数据显示,与 K2 相比,K3 整体扩展效率提升约 2.5 倍。此外,Kimi K3 还具备长程编码能力,可处理大型代码库、持续执行长时间工程任务,并支持结合截图等视觉信息完成游戏开发、前端开发、CAD 等软件工程场景任务。

此前在 7 月 16 日,月之暗面正式发布 Kimi K3。当时官方表示,Kimi K3 整体表现仍落后于最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol 等闭源模型,但在评测中已达到前沿水平,超过了其他所有模型。随后由于访问量快速增长,还曾一度暂停面向新用户开放订阅,以缓解算力压力。
【本文图片来自网络】
加入收藏 点赞 ( 0 ) 踩 ( 0 )


登录后才可以发布评论哦
打开小程序可以发布评论哦