易简读书 17小时前
Kimi K3正式开放权重,入场券3000万元
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者 | 王馨

编辑 | 汤安迪

7   月   27   日晚,月之暗面正式开放了   Kimi K3   模型权重。

这是全球首个进入 "3T   俱乐部 " 的开放权重模型:总参数量   2.78   万亿,拥有   896   个专家,原生支持视觉和   100   万   token   上下文。

一个训练成本可能达到数千万美元的前沿模型,现在任何人都可以免费下载、保存和修改。

650   元,可以买一块硬盘,装下完整的   Kimi K3。

但 " 可以下载 " 和 " 真正拥有 ",是两回事。

下载免费,跑起来要 3000 万元

先看模型的实际体积。K3   完整权重约为   1.56TB。作为对比,一台   8   卡   H200   服务器的总显存约为   1.13TB。

也就是说,即使不考虑模型运行时产生的任何额外数据,原始版本的   K3   也装不进一台顶配单机。

K3   一共拥有   2.78   万亿参数,可以把它理解为   896   名随时待命的专家。每回答一个问题,模型只会选择其中   16   名专家工作,因此实际计算量没有   2.78   万亿听起来那么夸张。

但即使只有   16   名专家工作,896   名专家的全部资料仍然要存放在显存里,等待随时被调用。

就像一家医院不需要让   896   名医生同时会诊,却必须为所有医生保留诊室。

月之暗面官方建议生产环境使用   64   张或更多加速卡组成超级节点。这不是能跑起来的下限,而是保证推理延迟可接受的生产级门槛。

16   个激活专家分布在十几张不同的卡上,跨卡通信效率直接决定用户体验。卡少了不是不能跑,是慢到没有实用价值。

那么,64   张卡要花多少钱?

H100   单卡当前约   2-3   万美元,64   张   GPU   采购约   160   万美元(约   1150   万人民币)。加上   NVLink   互联、InfiniBand   网络、服务器机箱和散热,整体硬件投入约   250   万   - 350   万美元(1800   万   - 2500   万人民币)。

追求生产级稳定性和高并发,预算更接近   3000   万甚至   4000   万。

如果只是做实验,则需要更激进的二次量化、CPU 内存卸载或者消费级显卡集群。代价是速度下降,并且可能牺牲模型效果。

已经有团队用   80   张   RTX 5090   运行了完整   K3。负责人公布的首日结果是:未经充分优化,单条请求约为每秒   20   个   token。他还特意补充,同一套集群此前运行   GLM-5.2   时,经过优化后速度从每秒   30   个   token   提高到了   110   个,因此   K3   的数字还会继续上升。

只是   80   张显卡带来的网络、供电、散热和故障率,也再次说明,这不是普通公司可以轻松复制的 " 本地部署 "。

对大多数公司来说,API 更便宜

既然自建这么贵,直接用月之暗面的   API   呢?

K3   的   API   定价为   $3/M token   输入(缓存命中   $0.3/M)、$15/M token   输出。在编码类负载中,缓存命中率超过   90%,实际输入成本远低于标价。

算一笔直观的账:生成   10   亿个输出   token,API   费用约   10   万元人民币。前述   2000   万人民币的硬件投入,如果纯粹用   API   来替代,需要连续使用约   200   个月才达到硬件成本线。超过   16   年。而这还没有计入自建机房的电费、运维工程师、维修和折旧。

所以对大多数公司来说,用   API   是理性的。真正需要花费数千万元私有部署   K3   的,通常不是普通创业公司,而是以下四类机构:

数据不能离开本地的金融和政企客户;需要深度修改模型的研究机构;拥有巨大调用量的云厂商;以及希望自主掌握前沿   AI   能力的国家级计算中心。

它们购买的不只是更便宜的模型服务,而是控制权:数据留在哪里、模型如何修改、服务是否会突然涨价,都可以由自己决定。

国产芯片的 K3 时刻

K3   开放权重后,华为昇腾和阿里云迅速宣布完成适配。

趋境科技基于   SGLang   完成了   K3   在昇腾   Atlas A3   上的推理适配,并针对   KDA   注意力、896   个专家之间的通信等环节进行了优化。昇腾方面还表示,K3   的大规模专家部署可以发挥国产超节点的高速互联优势。

阿里云、平头哥和月之暗面也共同完成了   K3   在真武   M890   超节点上的   Day 0   适配。千问   AI   平台和阿里云百炼也宣布将提供   K3   的托管服务。从芯片到超节点到云平台,一天之内全链路贯通。

这不只是在证明 " 国产芯片也能跑   K3"。

如前文所算,K3   的部署可能是一笔   3000   万至   4000   万元的生意。未来金融机构、地方智算中心和大型企业决定私有部署   K3   时,使用英伟达、华为昇腾还是阿里云超节点,会直接决定大量硬件订单流向谁。

而且   K3   是一个很苛刻的测试对象:模型接近   3   万亿参数,拥有   896   个专家,还需要大量芯片高速协同。

如果一个国产平台能够低成本、高效率地运行   K3,就说明它提供的不只是单颗芯片,而是一整套可以承载前沿模型的计算系统。

80   张   RTX 5090   的实验已经证明,模型可以通过工程手段在不同硬件上 " 拼 " 出来。但对国产超节点来说,真正的考题不是能不能生成第一个   token,而是能否把它变成一项金融机构和大型企业愿意购买的稳定服务。

K3   生万物

这次   K3   开放的,远不止权重本身。

它还同步开放了   FlashKDA、MoonEP   和   AgentEnv   三个基础项目,构成了完整的底层基础设施矩阵。

简单来说,FlashKDA   负责让   K3   的注意力机制跑得更快,降低单次推理的计算成本;MoonEP   负责疏通   896   个专家之间的 " 交通 ";AgentENV   让开发者可以在本地构建   agent   工作流而不是依赖云服务。

这些项目无法让昂贵芯片变便宜,却可以让同样数量的芯片完成更多工作。

这也是月之暗面超越单纯 " 开源模型 " 的深层逻辑:模型与基础设施一旦开源,英伟达、AMD、华为昇腾、阿里云以及各大推理引擎厂商,都会主动围绕   K3   及其技术栈进行深度适配与硬件优化。

当采用   K3   体系的平台与企业越来越多,K3   及其配套的基础设施,便极有希望演变为下一代大模型算力领域的事实标准。

Kimi   为这次开放权重,还制作了一支短片。

短片中,是水墨变幻的 " 道生一,一生二,二生三 "。K3   恰好是   Kimi   的第三代模型。

权重一旦被开放,它就不再只是一家公司服务器里的能力,而开始成为所有人继续建设的技术地基。

所以开放权重不是终点,而是   K3   开始 " 生万物 " 的起点。

参考阅读:

K3 技术博客:https://www.kimi.com/blog/kimi-k3

END •

Question. Write. Narrate. Believe.  

Become a story.

易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

↓↓↓

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

kimi
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论