作者 | 王馨
编辑 | 汤安迪
7 月 27 日晚,月之暗面正式开放了 Kimi K3 模型权重。
这是全球首个进入 "3T 俱乐部 " 的开放权重模型:总参数量 2.78 万亿,拥有 896 个专家,原生支持视觉和 100 万 token 上下文。
一个训练成本可能达到数千万美元的前沿模型,现在任何人都可以免费下载、保存和修改。
650 元,可以买一块硬盘,装下完整的 Kimi K3。
但 " 可以下载 " 和 " 真正拥有 ",是两回事。
下载免费,跑起来要 3000 万元
先看模型的实际体积。K3 完整权重约为 1.56TB。作为对比,一台 8 卡 H200 服务器的总显存约为 1.13TB。
也就是说,即使不考虑模型运行时产生的任何额外数据,原始版本的 K3 也装不进一台顶配单机。
K3 一共拥有 2.78 万亿参数,可以把它理解为 896 名随时待命的专家。每回答一个问题,模型只会选择其中 16 名专家工作,因此实际计算量没有 2.78 万亿听起来那么夸张。
但即使只有 16 名专家工作,896 名专家的全部资料仍然要存放在显存里,等待随时被调用。
就像一家医院不需要让 896 名医生同时会诊,却必须为所有医生保留诊室。
月之暗面官方建议生产环境使用 64 张或更多加速卡组成超级节点。这不是能跑起来的下限,而是保证推理延迟可接受的生产级门槛。
16 个激活专家分布在十几张不同的卡上,跨卡通信效率直接决定用户体验。卡少了不是不能跑,是慢到没有实用价值。
那么,64 张卡要花多少钱?
H100 单卡当前约 2-3 万美元,64 张 GPU 采购约 160 万美元(约 1150 万人民币)。加上 NVLink 互联、InfiniBand 网络、服务器机箱和散热,整体硬件投入约 250 万 - 350 万美元(1800 万 - 2500 万人民币)。
追求生产级稳定性和高并发,预算更接近 3000 万甚至 4000 万。
如果只是做实验,则需要更激进的二次量化、CPU 内存卸载或者消费级显卡集群。代价是速度下降,并且可能牺牲模型效果。
已经有团队用 80 张 RTX 5090 运行了完整 K3。负责人公布的首日结果是:未经充分优化,单条请求约为每秒 20 个 token。他还特意补充,同一套集群此前运行 GLM-5.2 时,经过优化后速度从每秒 30 个 token 提高到了 110 个,因此 K3 的数字还会继续上升。
只是 80 张显卡带来的网络、供电、散热和故障率,也再次说明,这不是普通公司可以轻松复制的 " 本地部署 "。
对大多数公司来说,API 更便宜
既然自建这么贵,直接用月之暗面的 API 呢?
K3 的 API 定价为 $3/M token 输入(缓存命中 $0.3/M)、$15/M token 输出。在编码类负载中,缓存命中率超过 90%,实际输入成本远低于标价。
算一笔直观的账:生成 10 亿个输出 token,API 费用约 10 万元人民币。前述 2000 万人民币的硬件投入,如果纯粹用 API 来替代,需要连续使用约 200 个月才达到硬件成本线。超过 16 年。而这还没有计入自建机房的电费、运维工程师、维修和折旧。
所以对大多数公司来说,用 API 是理性的。真正需要花费数千万元私有部署 K3 的,通常不是普通创业公司,而是以下四类机构:
数据不能离开本地的金融和政企客户;需要深度修改模型的研究机构;拥有巨大调用量的云厂商;以及希望自主掌握前沿 AI 能力的国家级计算中心。
它们购买的不只是更便宜的模型服务,而是控制权:数据留在哪里、模型如何修改、服务是否会突然涨价,都可以由自己决定。
国产芯片的 K3 时刻
K3 开放权重后,华为昇腾和阿里云迅速宣布完成适配。
趋境科技基于 SGLang 完成了 K3 在昇腾 Atlas A3 上的推理适配,并针对 KDA 注意力、896 个专家之间的通信等环节进行了优化。昇腾方面还表示,K3 的大规模专家部署可以发挥国产超节点的高速互联优势。
阿里云、平头哥和月之暗面也共同完成了 K3 在真武 M890 超节点上的 Day 0 适配。千问 AI 平台和阿里云百炼也宣布将提供 K3 的托管服务。从芯片到超节点到云平台,一天之内全链路贯通。
这不只是在证明 " 国产芯片也能跑 K3"。
如前文所算,K3 的部署可能是一笔 3000 万至 4000 万元的生意。未来金融机构、地方智算中心和大型企业决定私有部署 K3 时,使用英伟达、华为昇腾还是阿里云超节点,会直接决定大量硬件订单流向谁。
而且 K3 是一个很苛刻的测试对象:模型接近 3 万亿参数,拥有 896 个专家,还需要大量芯片高速协同。
如果一个国产平台能够低成本、高效率地运行 K3,就说明它提供的不只是单颗芯片,而是一整套可以承载前沿模型的计算系统。
80 张 RTX 5090 的实验已经证明,模型可以通过工程手段在不同硬件上 " 拼 " 出来。但对国产超节点来说,真正的考题不是能不能生成第一个 token,而是能否把它变成一项金融机构和大型企业愿意购买的稳定服务。
K3 生万物
这次 K3 开放的,远不止权重本身。
它还同步开放了 FlashKDA、MoonEP 和 AgentEnv 三个基础项目,构成了完整的底层基础设施矩阵。
简单来说,FlashKDA 负责让 K3 的注意力机制跑得更快,降低单次推理的计算成本;MoonEP 负责疏通 896 个专家之间的 " 交通 ";AgentENV 让开发者可以在本地构建 agent 工作流而不是依赖云服务。
这些项目无法让昂贵芯片变便宜,却可以让同样数量的芯片完成更多工作。
这也是月之暗面超越单纯 " 开源模型 " 的深层逻辑:模型与基础设施一旦开源,英伟达、AMD、华为昇腾、阿里云以及各大推理引擎厂商,都会主动围绕 K3 及其技术栈进行深度适配与硬件优化。
当采用 K3 体系的平台与企业越来越多,K3 及其配套的基础设施,便极有希望演变为下一代大模型算力领域的事实标准。
Kimi 为这次开放权重,还制作了一支短片。
短片中,是水墨变幻的 " 道生一,一生二,二生三 "。K3 恰好是 Kimi 的第三代模型。
权重一旦被开放,它就不再只是一家公司服务器里的能力,而开始成为所有人继续建设的技术地基。
所以开放权重不是终点,而是 K3 开始 " 生万物 " 的起点。
参考阅读:
K3 技术博客:https://www.kimi.com/blog/kimi-k3
•END •
Question. Write. Narrate. Believe.
Become a story.
易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
↓↓↓


登录后才可以发布评论哦
打开小程序可以发布评论哦