新京报 6小时前
月之暗面回应K3:做难而正确的事,不惧马斯克挑战
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

7 月 21 日下午,北京海淀知春路月之暗面总部,在一个充满摇滚风格的会议室里,月之暗面企业业务负责人黄震昕接受了新京报贝壳财经记者的采访,这也是 Kimi K3 大模型发布后 Kimi 首次公开接受媒体采访。

月之暗面企业业务负责人黄震昕回答新京报贝壳财经记者问题。罗亦丹 摄

K3 大模型参数量达 2.8 万亿,是目前全球参数规模最大的开源权重模型,在多个权威榜单上拿到第一,受到了国际上的广泛关注。连马斯克都在 K3 评测报道的评论区留言称 " 令人印象深刻 ",并表示后续将推出 2 万亿参数的模型 " 可能超越 Kimi"。K3 的火爆程度也导致需求量激增,7 月 19 日,月之暗面暂停了 C 端新用户订阅。

对于算力紧缺的现状以及未来企业的发展。黄震昕坦言 "K3 过于火爆,我们其实已经做了预案,但挡不住用户热情,有人说这和去年的‘ DeepSeek 时刻’一样,最后我们选择优先保证老客户的体验。"

而对于马斯克的 " 挑战 ",黄震昕笑言,可能这次的表现(让他们)得到一点震撼的感觉,现在拭目以待,希望他们出来跟我们掰一掰手腕," 我们的技术有很多都开源给了全世界,我们也不担心技术会马上被别人学走,我们有这样的胸襟和气度,希望马斯克也能做出 2 万亿的模型,我们一起共同进步。"

" 其实已经做了比较充分的准备,但挡不住用户热情 "

7 月 17 日凌晨,Kimi K3 正式对外发布。消息传开后的 48 小时内,全球开发者的使用请求涌入了月之暗面的服务器,远超团队此前的预估,用户量迅速逼近现有算力集群的承载极限。7 月 19 日晚间,Kimi 官方发布说明称 " 收获了远超预期的支持,但也面临始料未及的算力挑战 ",随即暂停 C 端新用户订阅。

" 我们提前做了充分的算力储备预案,但用户和客户的热情还是超出了预估。" 黄震昕在采访中坦言。他表示,目前公司的优先级是保障存量付费用户的使用体验," 不愿为了扩大用户规模牺牲存量用户体验 "。与此同时,团队正通过两条路径缓解供需矛盾——一是模型效能的持续优化,二是算力供给的快速扩容。

这种 " 幸福的烦恼 " 并非没有先兆。K3 的技术实力在发布前就已引起业内关注。其核心支撑技术之一 "Attention Residuals"(注意力残差)早在 2026 年 3 月就以技术报告形式开源,该技术方案可让模型训练与推理效率提升 25%。马斯克当时就在社交媒体上公开称赞,评价其为 " 非常令人印象深刻的工作 "。

当 K3 的完整性能数据在发布后揭晓,行业反应剧烈。在被业内视为最贴近真实工程开发的编程 " 金标准 "Frontend Code Arena 榜单上,K3 以 1679 分登顶。K3 的上一代模型 K2.6 在同一榜单上排第 18 位,一代之间跃升 17 个位次。Vercel 的 CEO Guillermo Rauch 发帖称,K3 在 Next.js 官方综合 Web 工程基准(nextjs.org/evals)评测中领先 Fable," 这是开源模型首次在该综合 Web 工程评测上全面超过闭源模型。"

和 DeepSeek-R1 推出后英伟达一度大跌类似,K3 也影响到了美股表现,美东时间 7 月 17 日,CNBC 报道美股半导体板块走出今年以来最差单周行情,跌幅创下 2025 年 4 月之后新低,而导火索是 " 中国月之暗面发布全新 AI 大模型。"

对于 K3 在全球的影响,黄震昕表示," 我们在全球市场上真正做出了 SOTA 级别的模型,定价不是朝便宜去定的,我们也摆脱了‘开源模型就是要做便宜的、低价的’这样的印象。"

" 模型公司一定要做模型 "

面对用户的热情与海外广受关注的表现,Kimi 显得颇为低调。

" 不做高性价比的标准化业务,而是聚焦‘难而正确’的前沿探索。" 黄震昕这样解释公司的核心理念。如同登月一般,一旦实现突破,将为全人类创造巨大价值——这并非一句口号,而是贯穿在月之暗面从技术研发到商业布局的每一个决策之中。

在当前,越来越多的 AI 企业开始聚焦落地和 Agent 时,月之暗面却一直保有对基础模型的执念," 模型公司一定要做模型。" 黄震昕说。

基础模型的强度是所有上层应用的前提,Agent、C 端产品、行业解决方案都是模型能力提升到一定阶段后的自然产物。只有持续打磨最强模型,才能构建长期竞争壁垒。

这种执念在 K3 身上得到了集中体现。根据月之暗面公布的技术文档,K3 基于月之暗面自研的 KDA 混合线性注意力机制和 Attention Residuals 技术构建,采用 MoE(混合专家)架构,在 896 个专家中高效激活 16 个,扩展效率较前代 K2 提升约 2.5 倍。更关键的是,月之暗面是 Scaling Law(缩放定律)的坚定信仰者——模型参数量、训练数据量、计算量三者同步提升,模型性能就会持续增强——但传统 Scaling Law 面临指数级成本的硬约束:算力投入扩大 100 倍,模型性能仅提升 10 倍。

月之暗面的解法不是简单的工程效率优化,而是底层架构创新。

黄震昕透露,过去 8 到 11 年间,大模型领域的三大核心基础技术从未出现本质迭代,而公司在 2025 至 2026 年完成了对这三项底层技术的突破,这也是 K3 能够实现 SOTA 性能的核心支撑。其中,Moon Clip 二阶优化器是行业首次在万亿级大模型训练中应用该新型优化器,大幅提升 Token 效率,可让 20TB 训练数据发挥出相当于 40TB 的效果。K2 系列曾在过去 12 个月中保持 9 个月的参数量领先,K3 也将在参数量与性能上保持一段时间的领先优势。

黄震昕告诉记者,Kimi 现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部 AI 企业,核心发力打磨模型基础能力,他也明确了行业参数规模趋势,表示 Kimi 的大模型参数规模会持续向上拓展,不会止步于当前 2.8 万亿规模。

Kimi 的 " 审美 ":不做娱乐性场景,聚焦生产力

技术突破只是起点,商业化落地才是检验模型价值的关键。

K3 在编程能力上的表现已经为它赢得了开发者生态的初步认可,其在多项评测中展现出与顶级闭源模型抗衡的实力。在 Program Bench 评测中,K3 得分 77.8,以 0.2 分的微弱优势超过 GPT-5.6 Sol 的 77.6;在 FrontierSWE 上得分 81.2,大幅领先 GPT-5.6 Sol 的 71.3,但次于 Fable 5 的 86.6。在实际应用中,K3 展示了长程工程能力——在计算天体物理 "I-Love-Q" 普适关系复现任务中,K3 用约两小时完成了通常需要资深研究人员一到两周才能完成的工作。

但月之暗面的商业化视野不止于此。黄震昕在采访中透露,公司即将推出 Kimi Hosted Agent 企业级服务,开放 Agent 编排调度(Harness)能力,将沙箱环境与智能体调度框架整合为标准化平台,向企业客户提供 PPT 生成等场景的 API 接口,支持嵌入企业内部系统,可自定义内容风格,适配投研分析、内容生产、办公自动化等多元场景。

谈及与海外头部模型公司的竞争,黄震昕表示,全球模型公司在商业化方面已找到一条可行路径,Kimi 在产品创新上持续投入,包括 AgentSwarm 路由在行业做 Agent 之前就已经做出来。" 我们还是希望从产品驱动,然后设计不同的商业模式,打造出非常有竞争力的产品。"

黄震昕在采访中强调了 Kimi 一贯的 " 产品审美 "," 我们不会做娱乐性的场景,也不做生图、生视频,我们一直的定位就是生产力场景,包括编程、金融、法律、科学研究等领域,这就是我们的审美,我们会一直按照这个价值观去努力奋斗。"

在北京,从海淀知春路到清华校门口,短短一段路程聚集了智谱、Kimi 等多家国内头部 AI 企业。黄震昕说,这里的产业集聚并非偶然—— " 人才密度高、政策支持完善,端一杯咖啡就能找到对应领域的专业人才 "。这片被业内称为中国 AI" 卧龙池 " 的土地上,蛰伏的故事远不止一个。而 K3 的全球爆火和随之而来的算力告急,或许只是月之暗面 " 登月计划 " 的一个阶段性注脚。

新京报贝壳财经首席记者 罗亦丹

视频 罗亦丹 陈蜜蜜 实习生 彭紫桐

编辑 杨娟娟

校对 杨利

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

马斯克 kimi 开源 新京报 海淀
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论