快刀青衣 昨天
老板让我部署免费的K3,我先算了一笔“承担不起”的机房账
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

这两天,全球的 AI 圈被一个中国公司的模型炸了一下,成为了关注的焦点。

这家公司就是月之暗面,对,就是我们非常熟悉的推出 Kimi 的那家,他们之前沉寂了好一阵子,突然甩出了最新的 K3 大模型。

要知道这个版本达到了惊人的 2.8 万亿参数,多项国际权威评测冲到全球第三,前端编程单项一度登顶世界第一。

7 月 27 日,Kimi K3 开放日,完整模型权重正式向全世界开放,任何人都可以免费下载,允许大部分商用,达到一定收入或用户规模的对外模型服务,需要遵守额外条款。

要知道,此前 K3 发布后的首个交易日,美股芯片股和 AI 板块出现大幅震荡。马斯克也在相关评测下留言说 " 令人印象深刻 ",还透露 xAI 正在训练一款 2 万亿参数的新模型来竞争。

好家伙,一家中国公司放出一个开源模型,半个硅谷都坐不住了。

这也是大模型公司的一个特点:哪怕沉寂一段时间,只要不下牌桌,下一个版本足够强,立刻就能上桌。

一、开源了为啥仍用不起

听说 K3 这么猛,又属于免费开源,于是就有同学跑来问我一个特别真实的问题。

他说:" 刀哥,听说 K3 开源了,是免费模型对吧?那我是不是可以下载下来,自己在电脑上部署一个,以后就不用花钱了?"

这个问题问得太好了,好到我可以直接拿它当这篇文章的选题。因为它正好踩中了开源模型最反常识的地方。

大多数人听到 " 开源 " 两个字,脑子里自动调出来的画面是 Linux、Firefox、开源播放器这些软件。下载、安装、运行,就完事了。你那台几千块钱的笔记本电脑,就是全部工具。

但开源大模型的部署,特别是 K3,可不是这么回事。

我来打个比方。米其林三星餐厅把招牌菜的完整菜谱免费公开了,配料克数、火候时间、每个步骤都写得清清楚楚。你能照着做吗?看起来能。

直到你翻到第一页的厨房要求:需要 64 口专业灶台同时开火,厨房供电要达到一个小型工厂的水平,光是买齐这套设备就要花掉两千万。

菜谱是真免费,厨房是真买不起。

当然,要理解为什么跑不动,得先搞清楚一个根本问题:开源模型到底 " 开源 " 了个什么?

以前我们说的开源软件,开的是源代码。源代码是人写的,也是人能读懂的。它像一份详细的说明书,程序员可以逐行阅读、找出问题、修改功能。

但开源模型开的是另一样东西,叫权重。

权重是啥?你可以把大模型想象成一个人工大脑,权重就是这个大脑里神经元之间几万亿个连接的强度数值。

问题来了:权重不是代码,它就是一坨纯粹的数字。K3 有 2.8 万亿个参数,打包起来约 1.4TB。这些权重文件也不是普通文档,即使用专门的工具解析,你看到的也只是一层层巨大的数字矩阵。

你可以对权重做微调、量化,甚至训练出衍生版本,但不能像阅读源代码那样,逐行看懂某个数字究竟代表了什么。权重可以被分析和修改,却很难被人类直接解释。

所以,第一个反常识就在这里:开源软件给你的是一份能看懂的图纸,但开源模型给你的是一颗已经制造好的大脑。

拿到图纸的价值,在于人人都可以学习和修改。但拿到这颗大脑最直接的价值,并不在于拆开了解它的组成,只有把它放在足够强大的机器上,通电运转起来,它才有价值。

二、开源不等于没有门槛

这里还有个特别容易让人误解的地方。K3 是 MoE 模型,也就是混合专家模型,内部有 896 个专家子网络,每次推理只激活其中 16 个。

很多人一听,每次只用 16 个,那我不需要把 896 个都装下吧?

不行。这就像一所拥有 896 个专科的超级医院。每位病人确实只需要其中 16 个科室会诊,但你不知道下一位病人需要哪 16 个科室。

你不能只开 16 个科室,然后把其他 880 个锁了。整所医院的科室都得在那里,随时待命,保证需要的时候能够迅速调度。

K3 也一样。每次计算虽然只调用一小部分专家,但完整的 2.8 万亿参数仍然需要被系统保存,并且随时能够访问。而真正要做到响应够快、多人同时使用,就得把这些权重分布在大量高速显存里。

所以,我非常支持软件和 AI 模型开源。但是,开源可不是没有了门槛,而是把门槛从法律世界搬到了物理世界。

以前闭源模型的门槛,是对方让不让你用、收你多少钱,不付钱就用肯定会有法律风险。现在开源模型 K3 虽然把门打开了,但想进门,前提是你得有一个机房。

那这个机房到底要多大?我们来算一笔账。

目前你能买到的最顶级消费级游戏显卡,显存是 32GB。K3 的权重超过 1400GB,一张顶配游戏卡,只装得下这个模型极小的一部分。

月之暗面官方给出的正式部署建议,是使用由 64 张以上加速卡组成的超节点。按同类硬件估算,光是采购成本就至少超过 240 万美元,约合人民币 1700 多万元。

买完设备就完了吗?别着急,故事才刚开始。

64 张这种级别的显卡满载运行,光显卡本身的功耗就接近 45 千瓦。而普通家庭的入户电力容量,一般只有 8 到 12 千瓦。换句话说,就算有人把这套设备白送到你家,你家的电表和电线也带不动它。

传统软件的经济学逻辑是,开发很贵,复制和运行几乎免费。而大模型的经济学是,开发极贵,复制免费,但每一次运行都在真金白银地烧电、烧显卡。

免费下载解决的只是复制环节,真正昂贵的运行环节,一分钱都省不下来。

三、顺利使用 vs 绝对拥有

我们其实做过一次对照实验。K3 发布后,我让同事抓紧接入了 K3 的 API,直接看到了这个模型的调用成本。

API 的定价对企业和个人开发者来说都不算贵,每百万输出 token 是 15 美元,而能力相当的顶级闭源模型,比如 OpenAI 的一些模型,要 50 美元左右。

三倍多的差价,就是开源竞争压出来的。一个月用下来,开源模型的调用费,对一家公司来说只是日常开支里很小的一项。

而如果你要自己完整部署同样一个模型呢?

如果只算显存容量,社区有人估算,至少需要 16 张 H200,才有可能把完整权重装进机器里。但装得进去,不等于跑得高效。即便如此,硬件开销也是几百万元人民币。

一边是每个月几千到几万元的 API 调用费,另一边是几百万元的硬件投入,还不算电费、机房和运维团队。

这就是 " 顺利使用 " 和 " 绝对拥有 " 之间的距离。

顺便说一句,上一代 Kimi K2 有 1 万亿参数。社区里有达人做过极限压缩版,一台顶配 Mac Studio 勉强能跑起来,算是能玩。

而 K3 的参数直接涨到 2.8 万亿,单机可部署这条路基本被堵死了。它几乎就是一个只属于数据中心或者企业能运行的物种。

四、公开信:保护开源模型

说到这里,整个故事里还有一个人特别值得提一嘴。7 月 24 日,黄仁勋注册了 X 账号,发出了人生第一条推文。

这位全球市值近 5 万亿美元的公司的掌门人,第一次发声,不是宣传自家显卡,而是分享了一封由英伟达、微软、Meta 等二十多家科技企业和机构联署的公开信,主题只有一个:保护开源模型。

一个卖硬件的,替免费模型站台,是不是有点反常?

一点都不反常。黄仁勋可能是全场算账算得最清楚的人。他在接受采访时说过一句话:免费 AI 对硬件是好事,对芯片是好事,对数据中心也是好事。

道理就藏在我们前面算的那笔账里。模型免费了,但跑模型的 GPU 一张都不能少。想部署 K3?先买上几十张顶级显卡。

模型越免费,想跑模型的人越多,铲子就卖得越好。

开源模型烧掉的不是英伟达的生意,而是闭源模型的护城河。这就解释了为什么那封公开信上,几乎半个硅谷都签了名。

值得注意的是,同样缺席首发名单的 OpenAI 和 Google,后来也陆续补上了签名。不过截至 7 月 28 日,另一家闭源 AI 巨头 Anthropic 仍未出现在官方签署名单中。

黄仁勋替免费模型站台,因为他卖的就是厨房里必备的灶台。那谁有厨房,需要这些灶台呢?

云计算厂商有,可以部署 K3,把它变成按量付费的服务。有合规需求的大企业也有,可以部署在自己的内网里,让数据不出门。

五、写在最后

那回到最初那位朋友的问题。不能自己部署,不等于用不上。

K3 的菜谱已经向全人类公开了。变化只有一点:当年运行开源软件的厨房,人人家里都有。今天运行前沿开源模型的厨房,是一座座耗电如小型城镇的数据中心。

所以,以后再看到新闻说某某大模型开源了,先别急着兴奋地喊 " 免费了 ",先问自己一个问题:跑它需要多少电、多少卡?

这个问题能帮你一秒看清,这个 " 免费 " 到底有多高的门槛。

特别是一些老板,如果只是看了新闻,说 Kimi 很强大,而且免费开源,就让你赶紧自己部署一个,你可以把这篇文章转给他,然后补一句:

" 老板,这个 AI 模型下载是免费,但要运行起来,还得花这么多钱。你看看,真的要装吗?"

我相信,这个账单只要一摆出来,大部分人都会放弃自己部署。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 源代码 kimi 程序员 阅读
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论