壹DU财经 19小时前
K3 2.8万亿参数封神!Kimi凭啥碾压海外巨头?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

风车车

排版|小西

2.8 万亿参数,全球参数最大。这是 K3 近期震动全球的成绩。

瞬间,春节之后沉浸了许久的大模型行业再度迎来喧嚣时刻,K3 全新模型收获海内外广泛关注,复刻了此前 DeepSeek R1 横空出世时轰动行业的高光。

不着急赚钱的 DeepSeek 与 Kimi 在应对商业化、算力生态以及资本市场方面有些截然不同的态度与打法,不过这并不影响两家中国 AI 公司身上如出一辙的标签。

两者先后依靠技术突破打破海外厂商的技术壁垒,背后是相近的生存思路:不靠低价补贴抢占用户,依托硬核模型能力争夺行业话语权,换取可持续的商业收益。

|  再现 DeepSeek 高光时刻,

K3 出圈的不只有训练成本 |

大模型是人工智能产业的重要底座,是 AI 走向物理世界的大脑。

但近一段时期的 AI 产业,舆论关注重点持续向硬件端倾斜,具身智能热度攀升,各类人形机器人、AI 便携终端接连亮相,纯基础大模型赛道获得的关注度开始降温。

甚至不少观点开始认为,在开源商业模式以及国内大规模算力投资背景下,基础模型能力接近瓶颈,后续行业竞争的主战场将集中在应用落地层面。

作为拥有 2.8 亿参数的全球最大来源模型,K3 的惊艳实力,对这类判断形成有力冲击,即,基模仍能且需要不断走向极致创新。

在近期 Artificial Intelligence 独立测试中,K3 在衡量长周期知识工作的 AA-Briefcase 中位列第二,仅次于 Claude Fable 5。同时,K3 还以 1677 分登顶 Arena 前端开发榜,压过一众海外闭源模型。 

对于 K3 的影响力,有外媒甚至直言美国领先的逻辑不再绝对。连马斯克也在评论区用 "Impressive(令人印象深刻)" 来评价 K3,并在隔天介绍 xAI 正在训练的下一代模型时候表示,其 " 有可能超过 Kimi"。 

它的惊艳之处在哪里?

K3 拥有 2.8 万亿总参数、原生视觉理解和 100 万 Token 上下文,官方将其核心场景概括为长周期编程、知识工作和复杂推理。官方展示的能力评测结果也主要围绕这三个层面。

以推理为例,K3 在 OmniDocBench 达到 91.1 分,高于 Fable 5 的 89.8 分," 它不是靠后天很多技能学习或者打磨出来的强模型,是一个原生就非常聪明的模型。" 月之暗面企业业务负责人黄震昕表示,K3 最核心的特点是长时程高难度推理能力。 

虽然 K3 单任务成本约 0.94 美元,与 GPT-5.6 Sol 的 1.04 美元接近,约为 Claude Opus 4.8(1.80 美元)的一半,也具有性价比优势,可价值还不止如此。

这需要从技术逻辑去理解 K3 的优势。理论上,我们认为模型变越大可能就需要更多计算成本,但实际上通过优化改造模型的容量、注意力和跨层信息流,也可以在控制成本的同时得到相当好的产出。K3 的策略便是把 MoE 的稀疏激活率推向了 1.79%(16/896)。

直白地讲,如此可以容纳更多知识和技能,从而得到更高的能力上限,据了解相比上一代 K2 的整体训练效率提升了约 2.5 倍,能更有效地把算力转化为能力,即,算力效率更高。

 

但回过头来看,技术的创新大概率可以从创始人的履历中去理解,也就是说,K3 能够交出这样的技术答卷,并非偶然。

月之暗面创始人杨植麟拥有扎实的学术背景,公开履历显示,其本科就读清华大学计算机系,博士阶段深造于卡内基梅隆大学。作为 Transformer-XL、XLNet 核心作者,两篇经典论文持续影响大模型技术演进,累计引用规模位居行业前列,深厚的学术积淀,奠定企业技术优先的发展基调。

与梁文锋一样,两个企业家走红的轨迹高度相似,尤其是没有如同互联网大模型厂家动辄数十亿的大规模营销造势,去赢得月活规模优势,却能依托于关键技术迭代,拿到全球产业舞台的入场资格。

在行业追逐用户规模留存之际,还能沉下心打磨基础能力的玩家,更容易掌握博弈主动权。只不过产品技术验证完成之后,商业化道路如何布局,是考验企业长久发展能力的核心难题。

|  Kimi 商业化逻辑,价格竞争力成色如何? |

杨植麟和梁文锋有相同,也有不同,不同体现在商业化角逐中。梁文锋更愿意强调多一些克制,月之暗面推进商业化的节奏则似乎更加主动清晰。

Kimi 目前同时发力 B 端和 C 端,其负责人表示,互联网、金融、制造、教育、医疗是目前主要的企业客户来源。同时,海外市场增长更快,付费用户和 API 收入都增长了 400%,产品进入 200 多个国家和地区,至于 C 端,核心策略与主流通用大模型并无差别,都是面向用户收取会员费。

无论是 B 端还是 C 端,模型能力效果影响其商业化深度,而价格水平影响其市场广度。对Kimi 而言,B 端与 C 端在价格层面的逻辑不同。

其中,针对 B 端的涨价,已成了行业风向。例如,此前智谱 GLM-5 系列已经过三轮上调价格。DeepSeek 也宣布过 V4 正式版上线后实行峰谷定价,高峰时段价格翻倍。Kimi 价格也有所上涨,从 K2 的每百万 Token 4 元涨到 K2.7 Code 的 6.5 元,涨幅约 60%。

在涨价趋势下,大模型厂商的定价会影响其客户接受度,所以定价权就显得非常重要。

时下 K3 的价格是较高的,按照混合 API 定价来看,K3 的每百万 token 2.3 美元,也显著高于国内同类竞品:阿里 Qwen3.7 Max 为 1.4 美元,智谱 GLM5.2 为 0.9 美元,MiniMax M3 为 0.22 美元,DeepSeek V4 Pro 为 0.18 美元。

考虑到 K3 登顶的实力,倒有些符合产品实力决定价格的商业规律了,华泰证券也指出,K3 智能的提高直接带来了 Token 定价的提高。

而面向全球市场,K3 则有价格优势。K3 的输出价格(约 15 美元 / 百万 token)与 GPT-5.6 Terra(OpenAI 的中端层)持平,约为 Claude Opus 4.8(25 美元)的 60%、GPT-5.6 Sol(30 美元)的 50%、Claude Fable 5 的三分之一。

上述两个市场的价格不会一成不变,但终归来说K3 的价格需要建立在持续迭代的模型能力之上,否则难以持续保持优势定价权。

再看 C 端,Kimi 目前是 4 档付费(49~699 元 / 月),价差跨度极大,699 元顶配远超豆包,年付最低可用 K3 折合 79 元 / 月;豆包是 3 档付费(68~500 元 / 月),梯度平缓,无天价顶配不同档位对应差异化的智能体调用额度、代码功能权限、高级模型使用权限,面向普通办公人群、专业开发者等分层人群实现精准覆盖。

如果横向对比豆包专业版定价体系,两者档位设置总体思路相近,但面向使用者的定价区间形成错位竞争。例如,Kimi 的免费、49 元档都无旗舰模型,轻度使用也受限长文本,豆包基础聊天永久免费不限次,只有重度生产力功能才消耗付费额度。

理解两者定价策略差异背后,要认清企业截然不同的基本面。豆包背靠字节跳动生态,手握行业规模领先的数亿 C 端月活基数,庞大用户底盘支撑商业化稳步推进。Kimi 个人用户体量存在差距,核心筹码是稀缺的长文本、复杂推理模型能力,相较于某些友商,走能力溢价路线的偏向更为显现。

放眼未来,一旦行业各类模型性能持续靠拢,这套依靠性能获取溢价的模式能否延续,是所有大模型厂商共同面对的命题。

|  Kimi 要回答的,

是未来模型厂家的生存策略 |

K3 收获市场赞誉,再度点燃基础大模型赛道热度,但性能优势无法永久维系。伴随着全行业技术持续迭代,各家模型基础能力差距会不断缩小,仅凭跑分优势拉开的产品溢价,长期存在收窄趋势。

这也是科技行业反复印证的周期特征。智能手机、云计算多个赛道都重复过相似历程:发展初期企业比拼硬件参数、基础性能,等到行业技术走向成熟,主流产品基础体验差距持续缩小。如今大模型赛道正处在性能竞赛走向能力趋同的过渡期,一家企业当下领先的推理水平,很可能在数个月内被同行追上。

头部厂商已经意识到单一模型性能不足以构筑长久壁垒,开始搭建多层竞争防线。DeepSeek 选择绑定国产算力生态,打通高效算法与本土硬件协同路径,叠加开源生态聚拢开发者,构建技术与供应链双重屏障。

月之暗面选择深耕长上下文、复杂推理特色赛道,持续优化办公、代码场景体验,依靠 C 端与 B 端双向商业化搭建稳定现金。两者路线选择不同,目标一致,即在通用模型能力趋同前,建立性能之外的护城河。而其市场价值也日渐增大,其在 2025 年 12 月估值 43 亿美元,今年 5 月 D 轮后跃至 200 亿美元,6 月又被曝出新一轮融资投前估值达 315 亿美元,半年增长超 6 倍。

用估值定价值是市场常见手段,由此回归行业竞争能观察到,头部大模型企业陆续奔赴资本市场属于行业发展大势,智谱、MiniMax 已先后登陆港股,在股价高点时市值分别冲到万亿港元、千亿港元级别。

但登陆资本市场之后,企业之间的市值分化大概率会随着时间推移被进一步拉大。拥有稳定造血能力、完整生态壁垒的企业能够收获更高估值;单纯追逐热点、无法跑通商业化的参与者,会逐步被市场淘汰。

严格来说,月之暗面并非科技、互联网大厂,它的生存这些却对于大量中小模型厂商具有启示价值。我国有超过 1500 个大模型,中小玩家如果继续跟随头部企业比拼通用模型参数、综合性能并不具备可行性,算力、人才、数据资源均存在明显短板。想要持续经营,需要跳出通用赛道内卷,挖掘专属生态位。

例如,可以扎根医疗、工业、法律等垂直领域,沉淀行业专属数据与场景方案;或是聚焦配套服务,深耕模型微调、推理优化等工具层业务;亦可与硬件终端深度绑定,打造嵌入式场景化解决方案。

行业不断成熟之后,市场自然不需要千篇一律的竞争者,各有所长才能长久共存。找到自身不可替代的定位,远比盲目跟风追逐风口更加重要。

可以预判的是,接下来的日子里大概率还会有新的模型登顶,甚至可能会有新的公司出圈。但可以确定的是,最后能留下来的,将是那些有自己清晰生存逻辑,并将优势无限放大的玩家。做人如此,大模型耐心赛竞争亦如此。

图片源于网络,侵删。 

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

kimi ai 高光 春节 资本市场
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论