IT时报 11小时前
Kimi算力“熔断”!从卖不掉到算力紧缺,只隔了一年
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Token 工厂第一客户不是人类!

作者/   IT 时报  孙妍

编辑/   郝俊慧  

2026 年的世界人工智能大会(WAIC 2026),若用一个词形容,那无疑是 " 热 " —— 7 月骄阳似火,算力基础设施赛道更是热度飙升。

" 去年 WAIC 我们愁的是卖不掉,今年供需反转了,算力不够、算力太贵、算力涨价。"PPIO 联合创始人兼 CEO 姚欣对《IT 时报》记者坦言。

一年之间,从 " 算力卖不掉 " 到 " 算力紧缺 "。表面看,这是 Token 工厂的集体爆发。但水面之下,一场围绕智能体时代算力基础设施定价权与话语权的深层博弈,已在供需反转的大幕下悄然拉开。

WAIC 2026 上,Token 工厂模式不尽相同,却有着高度的共识:第一客户从人变成 Agent。硬件见顶,软件是下一个 10 倍降本的主战场。

Kimi 算力 " 熔断 "

算力供需大反转

7 月 17 日,在 WAIC 2026 开幕当天,月之暗面发布新一代旗舰模型 Kimi K3,在权威的 Text Arena 综合排行榜中,该模型以 1486 分位列第 9 名,成为首个进入全球前十的开源模型。

然而,发布 48 小时后,因用户请求量大幅超出预期并逼近集群承载极限,Kimi 不得不在 7 月 19 日宣布暂停 C 端新用户订阅。"Kimi 很好用,但是动不动就得订阅会员,用不起。" 上游算力涨价潮已直接影响 C 端用户的选择。

算力紧缺,是当前大模型行业的共性困境。" 计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的鸿沟。" 无问芯穹联合创始人兼 CEO 夏立雪这样描述当前市场紧绷状态。

商汤大装置披露的数据也印证了这一趋势:其日均 Token 服务量已达 2.42 万亿,预计 2026 年全年服务规模实现 25 倍增长。

供需反转背后有两个动因。AI 应用从聊天交互向智能体任务进化,单智能体 Token 消耗可达传统对话应用的百倍至千倍级,正如中国工程院院士郑纬民指出的:" 驱动智能体的 Token 正在成为新的‘石油’。"

姚欣观察到,企业内部大量重复性劳动正在被 AI 改造,而使用最积极的不是技术人员,而是财务、人事、行政、市场这类非技术岗位。与此同时,OPC(一人公司)正在涌现,它们的 Token 月消耗量可达百亿级别,这一量级以前只有大型企业才能达到,而且 OPC 公司的人类员工与 AI 员工比例可以达到 1:10,甚至 1:20。

第一客户

从人变成智能体

" 云的第一客户从人变成了 Agent(智能体)。" 姚欣的这一判断,在 WAIC 2026 上获得了来自产学研各界的呼应。中国信通院云计算与数字化研究所副所长栗蔚给出了一个新的定义—— Agentic Cloud:以云计算资源为基础底座、大模型能力为核心驱动、智能体服务为基本单元,具备理解用户意图并自主完成复杂任务能力的新一代云计算服务体系," 正在成为未来主要云服务模式 "。

云服务正从 " 降本 " 转向 " 增值 ",交付的不再只是低成本算力资源,而是承载智能与能力的新模态服务。PPIO 升级为 Agentic Cloud,商汤大装置进化为 " 算力 + 平台 + 服务 " 全栈 AI 基础设施服务商,无问芯穹延伸至 " 前店后厂一中心 "。三家的演进方向,都是从单点的算力基础设施走向融合运行环境、任务编排和应用的服务体系,目标都是要打造面向 Agent 时代的 Token 工厂。

正因客户主体发生转变,智能体的消费模式与人类存在本质差异。姚欣将其概括为 " 脉冲式使用 ":人在使用虚拟机时,开启后往往连续运行数月不关机;而 Agent 调用沙箱时,完成任务即停止,一台虚拟机的单次使用时长可能仅 1 分钟便会关闭。这种模式对时延和并发的要求远高于传统场景。

对此场景,PPIO 的应对措施是通过 Harness 手段托管 Agent,实现 7x24 小时长时间运行,并且可以自我修复;无问芯穹用智能体能力反哺基础设施自身,打造运维智能体蜂群,以 Agent 能力驱动整套 AI Infra 形成自主迭代、自我优化的闭环。

硬件见顶

软件是下一个 10 倍降本的主战场

共识正在形成:GPU 硬件的性能提升正在触达物理天花板,未来 Token 成本的下降将越来越依赖软件层面的系统级优化。

姚欣的分析最为直白:"GPU 芯片已经到了物理极限,现在用的是 3nm 制程,2nm 应该就到顶了,根据相关技术数据,2nm 工艺相比 3nm 制程仅能实现约 20% 的晶体管密度提升、15% 左右的性能提升,晶体管密度最多提升 1.15 倍,已经没有再提升 10 倍的能力了。"

他将未来成本下降的希望寄托于软件:" 每隔 12 个月,智能体的使用成本就会下降至十分之一,软件的增长空间极其巨大。"

他还指出,推理侧最大的成本变量已经从 GPU 转向了存储。因为 Agent 追求长期记忆,上下文已经扩展到百万级,"100 万 KB 的上下文要全部保存下来,只能先放显存,然后是内存,最后再到硬盘,由此直接推高了存储成本 "。

降本,是所有使用者的诉求,必然也是所有 Token 工厂的核心思路。商汤大装置通过异构混推技术提升国产算力性价比,相比国产同构推理,异构混推集群实现同成本 Token 产出规模扩大 2.5 倍;无问芯穹在过去一年通过全栈技术实现推理成本下降 10 倍,并预期跨集群异构 PD 分离架构的规模化落地,还能再带来 10 倍下降空间。摩尔线程通过异构流水线组合,在硬件规格仅为国际主流产品一半的情况下,达到同等的推理水平。

Token 工厂

不同的战略锚点

在 WAIC 2026 上,PPIO、商汤、无问芯穹、摩尔线程等多家 Token 工厂都抛出了战略之锚。

全栈优化派 PPIO

姚欣将黄仁勋的五层蛋糕模型(能源—芯片—基础设施—模型—应用)作为参照,指出 PPIO 从第二层到第五层全部涉及。

" 今天不仅仅要看 Token 生产的数量有多少,更要看 Token 的智能和毛利率,所以一定要做端到端的全栈式优化。" 姚欣强调,目前国内真正能够做到全栈优化的厂商仍极其稀缺。

基于这一逻辑,PPIO 推出的核心利器是智能模型网关。智能模型网关是 AI Agent 的智能调度中心,关键决策由混合模型把控以提升质量,简单任务则通过模型调度自动分流至轻量模型,确保 Agent 以最低 Token 成本、最优智能性能完成任务。当用户提出法律合同审查、医疗初步诊断等需求时,网关会将问题同时分发给多个擅长此道的专家模型,通过交叉验证和融合生成最终答案。

PPIO 的混合模型可以将性能提升至接近 Claude Fable5 的水平,而成本却大幅降低。据综合测算,智能模型网关可以将智能水平提升 20%,将成本降低 50%~60%。

商汤大装置的国产化叙事

Token 工厂叙事,则嵌在一条更大的国产化替代主线下。

商汤科技联合创始人、大装置事业群总裁杨帆判断:" 未来五年国产化替代绝不仅仅是 GPU 的替代,而是背后整个 AI 基础设施生态体系的重构。"

摩根士丹利预测,最乐观的市场情景下,中国 AI 芯片自给率有望在 2030 年达到 76%。

在国产芯片突围的背景下,商汤大装置的核心突破是异构混合推理。商汤大装置事业群 CTO 宣善明披露,通过异构混推,主流国产芯片 MFU 提升 85% 至 152%,整体推理性价比达到 NVIDIA H 系列的 1.25 倍。在能效方面,商汤大装置提出了 TPW(Tokens Per Watt)指标,将电力消耗与 Token 产出直接挂钩,替代传统的 PUE 能效指标。据商汤大装置数据,通过端到端全链路优化,单位电力成本 Token 产出已提升 80%。

在产业落地的 " 最后一公里 ",商汤大装置与电信运营商殊途同归,以 FDE(前沿部署专家)模式交付结果。在先进制造领域,商汤大装置已服务 5 家上海大型国企,并总结出 "1 天明确业务价值、2 天完成 Demo 验证、30 天实现稳定版本上线 " 的 AI"123" 交付法则。

无问芯穹

" 前店后厂一中心 "

无问芯穹将 Agentic Infra 打造为 " 前店后厂一中心 ":算力集散中心(自主式基础设施平台)、Token 工厂(MaaS 平台)、AI 生产力商店(行业解决方案)。

它想通过全局资源一盘棋调度,实现十万卡级别以上的跨域计算资源支撑规模。无问芯穹的核心技术壁垒之一在于异构算力聚合," 算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。" 夏立雪认为。

无问芯穹联合中国电信完成国内首例超 4000 公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升 165%。同时,它还打通 4 个不同代际、不同型号的 GPU 集群,四集群协同性能提升 41%。目前这套跨域训练系统已在全国部署触达超 37000P 算力、覆盖 16 种主流芯片,盘活了广域分散的异质算力。

在 Token 工厂层面,无问芯穹于 2026 世界人工智能大会发布了首创的新一代推理系统优化成果——跨集群异构 PD 分离架构(PDD),相当于让 " 偏科 " 的硬件只刷自己最擅长的题,实测显示该架构在实现首 Token 延迟降低 51.5% 的同时,单 Token 成本降低 37.5%。

摩尔线程

从 " 芯 " 出发

与前三家从云服务或基础设施层切入不同,摩尔线程从芯片出发,提出了三大 "AI 工厂 " 的框架:模型训练工厂、词元生产工厂、智能体生产工厂。

摩尔线程创始人、董事长兼首席执行官张建中强调 " 全功能 GPU" 的概念,不仅能做训练和推理,还具备光线追踪和图形渲染能力,并称摩尔线程 S5000 是国内唯一具备光线追踪能力的智算芯片。

在 Token 生产工厂方面,摩尔线程的核心卖点是基于 S5000 的 PD 分离异构推理方案:将高算力需求的 Prefill 放在 S5000 上,将高带宽的 Decode 放在国际主流 GPU 上,相比于单独部署国际主流 GPU 同构方案,性价比优势显著。

从 " 种草 " 到 " 种树 "

转化效率之争

当所有玩家都在谈论 Token 产能时,生产出 Token 还不是终点,将 Token 高效转化为产业生产力才是终局。

郑纬民表示:"Token 与 Token 并不等值,如火如荼的算力基建也不等同于高效 Token 产能。" 夏立雪提出的 AI 生产力公式或许是对这一趋势最凝练的概括:"AI 生产力 = 智能资源规模 × Token 转化效率 × AI 生产力转化效率。"

行业正在从概念 " 种草 " 阶段进入实质 " 种树 " 阶段。PPIO 的日均 Token 调用量超 1.2 万亿,商汤大装置的日均 Token 服务量已达 2.42 万亿,预计到 2026 年底将攀升至日均 10 万亿,全年实现 25 倍增长;无问芯穹半年增长曲线是 40 倍……这些不再是对未来的预测,而是已经发生的数字。但算力的终局不会是比谁能生产最多的 Token,而是跑通从算力生产到价值落地的闭环。

Token 使用者吐槽算力价格太贵,Token 小厂坦承上游存储太贵,又面临国内 Token 市场面临大厂恶性价格战,毛利率接近负 100%。

正如商汤大装置杨帆所言,人工智能企业如何实现持续的规模化盈利," 不仅是商汤的课题,也是当下众多大模型企业、AI 应用企业所有人共同的课题 "。

排版/   季嘉颖

图片/   IT 时报   采访对象

来源/《IT 时报》公众号 vittimes

E   N   D

大家都在看

IT 时报

怕被 AI 替代?

不如先学会用好它

「挨踢妹 @AI 茶水间」

扫码即可加入↓↓↓

请加「星标」不错过我们

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

基础设施 世界人工智能大会 创始人 ceo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论