艾瑞网 昨天
月之暗面发布 Kimi K3:2.8 万亿参数,成全球最大开源权重模型
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

导语:7 月 17 日凌晨,月之暗面正式发布新一代大模型 Kimi K3,参数规模 2.8 万亿,配 100 万 token 上下文窗口,原生支持视觉理解。

摘要:

7 月 17 日凌晨,月之暗面正式发布新一代大模型 Kimi K3,参数规模 2.8 万亿,配 100 万 token 上下文窗口,原生支持视觉理解。按官方与多家媒体的说法,它超过参数 1.6 万亿的 DeepSeek-V4-Pro,成为目前参数量最大的开源权重模型。架构上,K3 采用 KDA 混合线性注意力机制与注意力残差技术。编程能力上,它在 FrontierSWE 基准得分 81.2,位列前部,低于 Fable 5 的 86.6。价格方面,每百万 token 缓存命中输入 2 元、未命中 20 元、输出 100 元。月之暗面表示,Kimi K3 的完整模型权重将在 7 月 27 日前放出。

正文:

在多项权威基准测试中,Kimi K3 展现出逼近全球顶尖闭源模型的实力。

7 月 17 日凌晨,月之暗面(Moonshot AI)正式发布新一代大模型 Kimi K3。该模型参数规模达 2.8 万亿,超越参数规模 1.6 万亿的 DeepSeek-V4-Pro,成为迄今为止参数量最大的开源权重模型。

(Kimi 网页版使用界面)

核心参数与架构

Kimi K3 基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。

在模型架构层面,K3 采用 Mixture of Experts(MoE,混合专家)架构,结合 Stable LatentMoE 框架,可在 896 个专家中高效激活 16 个。

这意味着虽然模型总参数量达到 2.8 万亿,但单次推理仅调用其中一小部分参数,从而在控制计算成本的同时扩大模型容量。

在 API定价方面,Kimi K3 采用按量计费模式:缓存命中输入为 0.30/ 百万 ??????????,缓存未命中输入为 3.00/ 百万 token,输出为 $15.00/ 百万 token。模型默认最大生成长度为 131072token,最高可设置为 1048576token。

月之暗面表示,完整模型权重将于 2026 年 7 月 27 日前发布,模型架构、训练和评测细节将随技术报告一同公布。

(各厂商旗舰模型参数规模演变,图源:Kimi)

与前代模型比较

首先是扩展效率的显著提升。通过模型结构、训练方法和数据配方的协同优化,K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地将算力转化为模型能力。

其次是上下文窗口的大幅扩展。相较 K2.7 Code 等前代模型的 256K 上下文,K3 提升至 100 万 token,可一次性处理相当于《三体》三部曲体量的文本,适用于大型代码库分析、长篇法律卷宗检索、金融研报深度解析等长程任务。

第三是多模态能力的原生集成。K3 并非简单拼接文本与视觉模块,而是原生支持图像和视频理解,可将截图、界面录屏、示意图与代码、工具调用置于同一会话中处理,适用于前端工程、游戏开发、CAD 设计等需要视觉反馈的编程场景。

此外,K3 始终开启思考模式,在推理过程中展示完整思维链,用户可通过流式输出分别获取推理增量和最终答案。

主流大模型横向对比

根据月之暗面公布的评测数据,K3 在多个主流编程和智能体基准中与目前全球最强的两款大模型 Claude Fable 5 和 GPT-5.6 Sol 达到可比区间,并超越了此前被认为代表国产模型编程能力的 GLM-5.2。

在编程能力方面,K3 在 FrontierSWE 基准中得分 81.2,仅次于 Fable 5 的 86.6,高于 GPT-5.6 Sol 的 71.3;在 Program Bench 中得分 77.8,超过 GPT-5.6 Sol 的 77.6 和 Fable 5 的 76.8;在 SWE Marathon 长程编程任务中得分 42.0,领先 Opus-4.8 的 40.0、GPT-5.6 Sol 的 39.0 和 Fable 5 的 35.0。

(编程能力得分)

在智能体(Agentic)任务方面,K3 表现尤为突出。根据 BenchLM 的对比数据,K3 在 Agentic 类别平均得分 91.2,大幅领先 DeepSeek V4 Pro(Max)的 74.5。在 BrowseComp 网页浏览任务中,K3 得分 91.2%,高于 DeepSeek V4 Pro(Max)的 83.4%。

在知识推理方面,K3 在 GPQA 基准中得分 93.5%,高于 DeepSeek V4 Pro(Max)的 90.1%;在 HLE(Humanity's Last Exam)高难度测试中,K3 得分 56%,显著高于 DeepSeek V4 Pro(Max)的 37.7%。

不过,K3 在部分基准中仍与顶尖闭源模型存在差距。例如在 DeepSWE 编程基准中,K3 得分 67.5,低于 GPT-5.6 Sol 的 73.0 和 Fable 5 的 70.0;在 GDPval-AA v2 Elo 评分中,K3 为 1668.0,低于 Fable 5 的 1760.0 和 GPT-5.6 Sol 的 1748.0。

2.8 万亿参数的意义

参数即能力上限。2.8 万亿参数让 K3 成为全球首个触及 3 万亿级别的开源模型,也意味着中国大模型在预训练规模上已与国际顶尖水平并跑。月之暗面官方数据显示,在过去 12 个月(2025 年 7 月至 2026 年 7 月)中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。

与闭源模型不同,K3 选择以开源权重形式发布。这意味着研究机构、开发者和企业可以下载模型权重,进行学术研究、二次开发或私有化部署。对于金融、医疗、法律等对数据隐私要求极高的行业,这一开放路径具有不可替代的价值。

但开源不等于免费午餐。2.8 万亿参数的 MoE 模型对推理硬件要求极高,本地化部署需要大量高端 GPU 集群,中小团队难以独立承担。更关键的是,具体的开源协议、商用授权条款、是否允许微调等细节,仍需等待 7 月 27 日权重正式发布时才能明确。在协议落地之前," 开源 " 的商业价值仍是一个待解的问号。

定位与使用建议

月之暗面将 K3 定位为 " 通用旗舰智能 " 模型,而非 K2.7 Code 的替代者。K2.7 Code 仍专注于编程专精场景,K2.6 继续服务于通用长程 Agent 任务,而 K3 面向的是 " 难、跨领域且被 256K 上下文卡住 " 的复杂任务。

K3 特别适合以下场景:大型代码库理解与修改、多步骤金融研究与产业分析、结合视觉反馈的交互式开发、需要 100 万上下文窗口的长文档推理等。对于日常 IDE 编程、低延迟自动补全等任务,K2.7 Code 仍是更经济高效的选择。

(文章为作者独立观点,不代表艾瑞网立场)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai kimi 开源 界面 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论