21世纪经济报道 10小时前
Kimi学会了“自己干活”,中国大模型坐到了全球AI牌局主桌
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

21 世纪经济报道记者 石恩泽 深圳报道

两周前,月之暗面(Kimi)向全球 AI 大模型玩家扔出了一颗重磅炸弹—— K3 大模型。

瑞银分析师将其称为 " 第二个 DeepSeek 时刻 "。不同于 "DeepSeek 1.0 时刻 " 一切从大模型性价比出发,K3 带来的则是另一条叙事——当 AI Agent 嵌入工作流后,能给 C 端用户带来哪些效率的提升。

用户惊奇地发现,Kimi K3 大模型不再是 " 一问一答 " 的聊天工具,而是开始像一名人类分析师那样,规划任务、检索信息、调用工具、并行协作、交付成果。也就是说,Kimi 学会了 " 自己干活 "。

当 DeepSeek 证明中国模型可以 " 跑得快 " 之后,Kimi 出色的 Agent 能力正在将中国大模型整体推入一个新的竞争维度。这次比拼的不再是参数规模或数学题得分,而是谁的模型能嵌入真实工作流,在用户离开后仍持续交付成果。

这个改变也在向世界传递一个信号:中国大模型不再只是全球 AI 竞赛的跟随者,而是正在用 " 自己干活 " 的能力,参与到全球用户的争夺战中,在全球 AI 牌局里坐上了主桌。

烧卡换参数的阶段过去了

过去两年,中国大模型的叙事主线并不复杂:用更低的成本,训练出逼近甚至超越 GPT-4 性能的模型。

2025 年初,DeepSeek 以极低训练成本和开源策略震动全球,被业界称为 " 国运级突破 "。一时间,国内 AI 赛道集体卷入一场 " 烧钱换参数、堆卡换性能 " 的消耗战。

然而,一个无法回避的事实是,纯粹的模型性能比拼正在陷入边际效益递减的困境。实际上,用户不关心各家大模型的分数、排名,他们只关心程序能不能跑通、结果是否可靠。

Agent 能力的跃迁,恰好打破了这一僵局。2025 年 7 月,月之暗面发布并开源 Kimi K2 大模型,首次提出大模型要为工作流而生。为此,Kimi K2 在代码生成、工具调用和多步骤任务执行上进行了深度优化,被业内评价为 " 专为 AI Agent 打造的大模型 "。

时隔一年,K3 版本的落地则将这一趋势推向了更具说服力的生产场景。据月之暗面官方披露,K3 在生成一个 AI ASIC 行业研究网站时,经历了 120 轮以上递归改进,完成 2800 次以上网页搜索与抓取、1100 次以上终端数据调用,处理超过 1.1 万页内容,覆盖 87 份季度报告和 99 份原始 PDF。

这些任务已不再是传统意义上的一次问答,而是由检索、执行、校验、绘图和修改组成的长链路流程。华泰证券在研报中指出,Agent 渗透带来的核心增量并非用户请求数量本身,而是每个任务内部 Token 消耗、工具调用次数和并行执行宽度的共同增长,这意味着真实工作流的渗透正在实质性提升。

支撑这种长程执行能力的,是一整套 Agent 基础设施的重新设计。据月之暗面技术报告披露,K3 训练和评估期间,系统共创建了超过 5100 万个沙箱,使长任务可以在等待模型推理时暂停以释放计算资源,在模型生成下一步动作后快速恢复。这相当于把一次原本几分钟的回答,拉长成一条可持续数小时的执行链。

要知道,传统强化学习训练会被少数特别慢的任务拖住整批 GPU,而 K3 通过 partial rollout 机制,让已完成的部分轨迹先进入模型更新,未完成的轨迹暂停后再恢复执行,从而容忍异步和延迟,真正让长程 Agent 任务进入了规模化训练阶段。

模型能力的跃迁也反映在硬性的工程评测中。K3 在 Program Bench 中得分 77.8,超过 GPT-5.6 Sol 的 77.6;在 FrontierSWE 中得分 81.2,较 GPT-5.6 Sol 和 Claude Opus 4.8 分别高出 9.9 和 14.5。

这种长程 Agent 能力也体现在智能体专项评测中。据月之暗面披露,K3 在 BrowseComp 等智能体任务评测中表现突出,在 AutomationBench 测试中取得最高成绩。

有工程师在社交平台上称,在智能体工作流中,K3 的表现接近 Claude Fable 5,但成本显著降低。这让 Agent 能力从少数大厂的昂贵实验,变成了更多开发者可以负担和复用的工程选项。

" 大模型真正的护城河,不在于单次对话的质量,而在于能否嵌入用户的工作流,成为无法被轻易替代的生产力环节。" 一位长期跟踪 AI 赛道的分析师向记者表示,Kimi 的升级意味着中国大模型竞争从模型层向应用层的实质性迁移," 烧 Token 的阶段正在过去,拼落地、拼不可替代性的时代已经到来。"

Kimi 为什么非要走 C 端这条难走的路

与智谱 AI、百度文心等早期以 B 端企业服务和 API 输出为主的大模型厂商不同,Kimi 自诞生起就选择了一条更难走的路——直面 C 端用户。

这条路曾经备受质疑。B 端市场合同金额高、客户忠诚度高,是大模型厂商最自然的商业化路径;而 C 端用户付费意愿低、获客成本高、产品迭代压力大,此前并无成功案例。然而,Kimi 的 C 端策略在 2025 年下半年开始显现回报。

Kimi 在和投资人的沟通中透露,公司海外收入已超过国内收入,2025 年 11 月以来海外 API 收入增长 4 倍,全球付费用户在 K2.5 发布后实现 4 倍增长。在第三方平台 OpenRouter 上,K2.5 的排名已升至第三位,仅次于 Claude Sonnet 4.5 和 Gemini 3 Flash。这意味着,一个中国原生的大模型产品,正在全球 C 端市场获得真实付费用户的认可。

更值得关注的是其产品形态的创新。2025 年 9 月,月之暗面推出全栈智能体助手 OK Computer(Kimi Agent),随后又迭代出 Kimi K2.5 的 Agent 集群能力。当面对分析 100 家竞争对手等复杂任务时,模型可扮演 " 中央调度器 ",动态创建并协调数十个具备不同虚拟角色的 Agent 分身并行工作,将原本需要数天的工作周期压缩至十几分钟。

K3 的发布进一步验证了这一商业化逻辑。其 API 定价中,缓存命中输入、未命中输入和输出价格分别为 0.30 美元 / 百万 Token、3.00 美元 / 百万 Token 和 15.00 美元 / 百万 Token,较 K2 系列明显提价,输出价格已与 GPT-5.6 Terra 相当。

瑞银证券中国互联网分析师熊玮指出,K3 定价在国产模型的高端位置,恰恰说明了真正好的模型能力有溢价权,企业也能找到相应的用户为之付费。

华泰证券亦在研报中认为,K3 通过自动缓存和推理系统优化降低实际调用成本,使模型厂商能够在提升名义 Token 价格的同时不提高用户使用门槛,行业商业化竞争正由单纯低价转向模型能力、缓存效率与算力利用率的综合比拼。

" 如果说 DeepSeek 证明了中国的模型可以便宜又好用,那么 Kimi 证明了中国团队也能做出世界级的 C 端 AI 产品。" 前述分析师认为,这种从产品形态到商业模式的双重突破,填补了中国大模型在消费级应用上的空白。

全球 AI 牌局里中国坐到了主桌

2026 年 1 月,英伟达 CEO 黄仁勋在 CES 主题演讲中,用 Kimi K2 Thinking 取代此前常见的 DeepSeek-R1,作为演示其 Rubin NVL72 系统性能的案例。这一细节被市场解读为中国大模型在全球 AI 基础设施供应链中话语权的提升。

事实上,Kimi 的路径选择正影响着整个行业对 " 中国大模型能做什么 " 的认知边界。2025 年 7 月 Kimi K2 开源后,在 Hugging Face 平台一周内下载量突破 10 万次,并获得硅谷知名投资人在播客中的公开推荐。其采用的 MIT 开源协议、OpenAI 兼容 API,以及对 vLLM 等主流工具的支持,大幅降低了海外开发者的使用门槛。

更具生态意义的是,月之暗面将 AgentENV、MoonEP 和 FlashKDA 等训练部署基础设施一并开放,意味着开发者获得的不仅是一个可调用的模型,也是一套可以进一步研究、修改和复用的 Agent 工程资源。

开源模型的强劲势头,也正在倒逼全球领先玩家采取应对动作。瑞银分析师熊玮指出,近期 OpenAI 等海外厂商相继采取额度重置、Token 降价等措施,恰恰体现了中国模型在全球范围内开始得到更多市场以及行业对手的重视。

中国模型得以参与全球竞争,背后是一套结构性的成本优势。据瑞银调研,目前中国头部模型训练成本约为海外领先模型的十分之一,API 价格通常只有海外同类模型的 10% 至 20%,与此同时,国内模型厂商 API 业务仍能够保持 20% 至 40% 的毛利率。

熊玮分析称,这种结构性成本优势来自模型架构创新、GPU 使用效率提升、兼顾性能与成本效率的训练策略,以及开源生态带来的技术扩散等因素,并且这一优势有望长期保持。

从技术演进来看,Kimi 的迭代轨迹也映射出中国大模型能力的跃迁:2024 年聚焦长文本处理,2025 年 K1.5 在多模态推理上逼近 OpenAI o1 水平,2025 年下半年 K2 系列专攻 Agentic 任务与代码能力,2026 年 K2.5 引入原生多模态与 Agent 集群,再到 2026 年 7 月 K3 模型将参数规模推至 2.8 万亿、上下文长度拓展至 100 万 Token。

K3 的架构升级也预示着推理基础设施竞争格局的变化。该模型采用 Kimi Delta Attention 与 Attention Residuals 架构,配合 Stable LatentMoE 将专家数量扩展至 896 个,并明确提出 64 张以上加速卡组成的超节点部署建议。

华泰证券认为,这意味着推理基础设施的竞争指标正在从单卡算力扩展至超节点内部互联、共享内存域、集合通信效率和系统级稳定性,高速网络与整机系统的价值量有望随模型规模同步提升。

" 中国大模型已经不再是追赶者的角色。" 一位 AI 行业投资人向记者表示,DeepSeek 在推理能力上的突破、Kimi 在 Agent 应用上的落地,标志着中国 AI 力量正在从单点技术跟随走向生态能力并跑," 全球 AI 竞赛从‘美国创新、中国复制’的旧脚本,进入了多极竞争的新阶段。"

不过,竞争远未到终局。月之暗面创始人杨植麟曾在公开场合坦承:"Agent 集群的规模化训练在技术上很有挑战。"

熊玮亦表示,目前两家大模型公司的上市时间都只有六七个月,整个行业仍处于市场不断学习和重新定价的阶段," 投资者交易仍然呈现较强的‘动能驱动’特征 "。因此,当行业出现新的模型发布、技术突破等积极催化时,相关公司股价往往会走强;而当市场对竞争格局、商业化前景产生新的担忧时,股价也可能随之回调。

如何在 C 端持续扩大付费用户规模、在 B 端创造更稳固的企业服务收入、在全球化进程中应对地缘政治与合规风险,仍是摆在 Kimi 面前的未解之题。

但至少,中国大模型正在证明,在这个由 Agent 重新定义应用范式的时代,来自中国的创新者,不再只是牌桌上的旁观者。

更多内容请下载 21 财经 APP

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai kimi 开源 华泰证券 竞赛
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论