(来源:新财富产业研究院 新财富)

现在想在 Kimi 的聊天框里使用 K3,要先成为付费会员。
按照年付价格计算,Kimi 目前四档会员 Andante、Moderato、Allegretto 和 Allegro,分别为每月 39 元、79 元、159 元和 559 元,对应每年 468 元、948 元、1908 元和 6708 元。不同档位的主要区别,是 Agent 额度、并行任务数量、Kimi Code 额度和超长对话容量。

K3 并不是国内第一个放在付费墙后的聊天模型。早在 2023 年,百度文心一言 4.0 就曾采用会员模式,免费用户只能使用较早版本。
7 月 19 日,K3 上线不到 48 小时,月之暗面宣布暂停 C 端新用户订阅。公司给出的解释是,请求量远超预期,现有 GPU 集群已经接近负载上限,有限算力需要优先保障存量付费用户。
模型太火,免费开放会迅速挤占有限算力。月之暗面只能提高使用门槛,把 K3 暂时留给愿意付费、需求更明确的用户。
API 的定价则更加醒目。每输出 100 万个 Token,Kimi K3 收费 100 元。
K3 缓存未命中的输入价格为 20 元 / 百万 Token,缓存命中为 2 元,输出为 100 元。相比上一代旗舰 K2.6 的 6.5 元和 27 元,K3 的输入价格上涨 208%,输出价格上涨 270%。
阿里 Qwen3.7-Max 的输入、输出价格分别为 12 元和 36 元;DeepSeek V4-Pro 最高时段的输入和输出价格均为 6 元。K3 的输出价格约为 Qwen3.7-Max 的 2.8 倍、DeepSeek V4-Pro 的 16.7 倍。
K3 每百万 Token 的输入、输出价格约为 3 美元和 15 美元,已经进入海外闭源前沿模型的价格区间。
放在过去两年的市场里,这套收费方式显得很不合群。
从 DeepSeek R1 开始,国产模型逐渐形成一种熟悉的发布方式:参数更大,能力更强,价格继续下降。模型公司用海外旗舰几分之一的 API 价格争夺开发者,再把最新模型免费放进聊天产品,用来获取用户和流量。
久而久之," 免费聊天 " 和 " 低价 API" 几乎成了国产大模型的默认配置。
就比如最近传出某模型公司定价策略按照十个月回本,并表示在当前价格区间内,用户对 API 价格并不敏感。即使价格提高一倍,Token 使用量可能也不会明显下降,收入则可能接近翻倍。
K3 改变了这种预期。
贵了,也确实更强了
2.8 万亿参数,是全球首个开放的 3T 级模型,也是目前最大的开源模型;原生 100 万 token 上下文,原生视觉理解。架构上,K3 用 Kimi Delta Attention(KDA)加注意力残差(AttnRes)搭建,采用 Stable Latent MoE,896 个专家里每次只激活 16 个,相较 K2 整体缩放效率提升约 2.5 倍。月之暗面甚至从零写了一个类 Triton 的 GPU 编译器 MiniTriton,自主完成了一颗专用推理芯片的架构设计与验证。
Frontend Code Arena 1679 分登顶全球第一,超过 Claude Fable 5 和 GPT-5.6 Sol,在七个前端细分领域中拿到六个第一。这个榜单采用匿名模型对战和用户盲选,最终结果会同时受到视觉效果、交互体验和任务完成度影响。从 K2.6 的第 18 名跃升到 K3 的第一名,说明月之暗面找到了自己的优势场景。

BrowseComp 在 100 万 token 不做任何上下文管理时拿到 90.4 分。它证明了国产模型在特定维度上,已经能正面对抗最强的闭源。
K3 的综合能力还没有达到全球第一。在 Artificial Analysis 智能指数中,K3 得到 57 分,排在 Claude Fable 5 和 GPT-5.6 Sol 之后。月之暗面对此相当坦率,其技术说明直接承认,K3 的整体表现仍落后于最强的海外闭源模型。
K3 选择集中火力:前端开发、长程编程、知识工作和视觉 Agent。
通用聊天模型需要照顾海量低价值请求,用户对价格很敏感,也很容易切换平台。编程 Agent 承担的任务更长,进入用户工作流更深。代码库、工具权限、提示词和历史记录一旦配置完成,更换模型的成本也会上升。
在编程 Agent 中,模型需要反复读取相同的代码库、系统提示和对话历史。月之暗面披露,K3 在高频编程场景下的缓存命中率可以超过 90%。缓存命中后的输入价格只有 2 元,相当于未命中价格的十分之一。
价目表上的 20 元并不等于企业的实际平均输入成本。如果大部分长上下文都能命中缓存,真正昂贵的部分主要是模型新生成的内容。K3 输出价格达到 100 元,恰好把收费重点放在模型完成任务的过程和结果上。
Artificial Analysis 测算,按照其测试任务中的 Token 结构,K3 单项任务的平均调用成本约为 0.94 美元,与 GPT-5.6 Sol 的 1.04 美元接近,约为 Claude Opus 4.8 的一半。100 元听起来很贵,分摊到具体任务里,差距并没有价目表看起来那么大。
不过,缓存只能降低输入成本,无法解决另外两个问题:速度和输出长度。
Artificial Analysis 测得 K3 平均输出速度约为每秒 33 个 Token,在同级模型中偏慢。它完成整套智能指数测试时生成约 1.3 亿个输出 Token,接近同类模型中位数的两倍。输出越长,用户等待的时间越久,账单也越高。
因此,K3 现阶段最适合高价值、长周期、可以异步完成的工作。
让它调试代码、制作网页、分析大量材料,等待几十分钟通常可以接受;把它放进需要高频沟通、即时修改的工作流,速度和额度就会成为阻力。K3 已经具备了卖高价的能力,还没有提供与高价完全匹配的稳定体验。
Kimi K3 证明 Scaling Law 仍是有效的
过去一年,大模型行业不断出现 "Scaling Law 即将失效 " 的判断:公开数据接近耗尽,参数增加的边际收益下降,新模型在传统基准上的进步也越来越小。
Kimi K3 提供了一个不同的样本,从 K2 的 1 万亿参数扩大到 K3 的 2.8 万亿参数后,模型在前端开发、复杂搜索、长程编程和视觉 Agent 等场景继续提升。它的综合能力尚未超过最强闭源模型,但开放模型的能力上限再次被向前推进。这至少说明,大模型还没有撞上一堵无法跨越的技术高墙,更多计算投入仍然可以转化为更强能力。
只是今天的 Scaling,已经不再是简单堆参数。
如果每生成一个 Token 都调用全部 2.8 万亿参数,K3 很难大规模提供服务。为此,月之暗面采用混合专家架构,在 896 个专家中每次只激活 16 个;又通过 Kimi Delta Attention、Attention Residuals 和 Stable Latent MoE,降低长上下文开销并提高训练稳定性。按照公司披露,K3 相较 K2 的整体缩放效率提升约 2.5 倍。
Scaling Law 正在从 " 扩大模型 " 升级为 " 扩大系统 "。
参数规模仍然重要,但决定能力上限的已经不只是参数。数据质量、专家路由、注意力结构、强化学习、上下文长度、推理系统、编译器和 Agent 环境,都成为 Scaling 的一部分。任何一个环节没有同步升级,更大的模型都可能只是一台更昂贵的机器。
Scaling 的方向也在改变。过去,模型主要回答一次性问题;现在,Agent 需要读取代码、调用工具、检查结果、修复错误并重新规划。模型不仅要知道得更多,还要在更长时间里保持目标并完成任务。计算投入也从预训练延伸到后训练和推理阶段:模型可以思考更久、调用更多工具,用更多计算换取更高的任务成功率。
因此,K3 传递给行业的信号并不是简单的 " 大力出奇迹 ",而是前沿模型仍有继续扩展的空间,只是扩展变得更加系统,也更加昂贵。
模型还会更大,工作时间还会更长,承担的任务还会更复杂。大模型行业真正的问题已经从 " 能力还能不能提高 ",变成了 " 下一次提高需要多少钱,以及谁来支付这笔钱 "。

100 元是产品力,也是生存方式
每百万输出 Token 收费 100 元,是月之暗面对这个问题给出的回答。
Kimi 没有微信、淘宝这样的超级入口,也缺少成熟业务长期补贴模型。对于一家独立模型公司,持续参与低价竞争并不是最有利的选择:无论价格降到多低,市场上总会有成本更低、资本更充足或者生态更完整的平台。
K3 因此选择把能力集中在编程、复杂搜索和长程 Agent 等高价值场景,再向真正节省了时间和人力的用户收费。用户购买的表面上是 Token,实际购买的是任务完成率。只要 K3 能够少重试几次、减少人工接管,100 元的输出价格未必会带来更高的项目总成本。
这一定价也有合理的产业逻辑。更高收入可以支付推理成本,支持算力扩容,并继续投入下一代模型。产品力形成收入,收入反过来支撑研发,独立模型公司才可能建立可持续的循环。如果始终依靠融资补贴调用量,模型越受欢迎,反而可能带来越大的服务器账单。
当然,发布初期的供不应求还不能证明 Kimi 已经拥有稳定的定价权。真正的检验,是用户用完额度后是否续费,企业测试结束后是否把 K3 留在生产流程中。高价格还意味着更高要求:稳定性、速度、并发能力和工具兼容都必须与模型能力匹配。
但 K3 至少迈出了关键一步。中国大模型过去证明了自己可以用更低成本追赶前沿;现在,Kimi 开始证明,国产模型也可以凭借产品力建立自己的价格体系。
100 元不是价格战的终点,而是月之暗面为持续发展选择的起点。


登录后才可以发布评论哦
打开小程序可以发布评论哦