芯东西 昨天
213:1的Token悬殊背后,智能体正在改写推理方式
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

AICC 现场,拆解 Agent 时代的推理底座。

作者 |  江宇

编辑 |  漠影

9 月 21 日下午,北京中关村国际创新中心,开源推理框架 SGLang 核心贡献者王书文放出一组数据:在 Agent 流量里,一次请求的中位数输入是 8.8 万个 Token,输出却只有 413 个 Token,两者相差 213 倍

" 智能体时代,算力并不是花在输出上,而是花在反复携带的历史上下文上。" 他说。

这里,便是 AICC2026 人工智能计算大会下设的 "AI 软件栈 " 分论坛。现场,SGLang 团队围绕 Agent 时代推理负载的变化进行了分享。

当天,AICC2026 人工智能计算大会在北京中关村国际创新中心举行,近 3000 名产业人士来到现场。大会一口气设置了 AI 芯片、Token 工厂、开放超节点、大模型、AI 软件栈、具身智能与智算发展、AI Work 智能体七场专题论坛,把芯片、系统、软件、模型与应用等产业链不同环节聚到了一起。

就在同一天、同一个大会里,芯片厂商、系统厂商与推理框架的开发者,都聚到了同一张桌子前。

从长上下文带来的缓存压力,到多元芯片适配,再到互连、调度与软件栈协同,讨论的焦点已经很难被拆成某一个环节的问题。

他们最终指向的是同一道题——当智能体从一次调用走向持续任务链,中国 AI 计算的下一步,该怎么走?

01.

智能体爆发

AI 计算每一层都在被重新定义

智能体的爆发,正在把算力推上国家战略基础设施的位置。

2026 年,智能体从发布会上的演示,走进了真实的生产、科研和社会服务;一次智能体任务,可能包含规划、多轮推理、工具调用、记忆、校验和重试,负载变长、并发增加,系统还必须可恢复、可观测、可承担成本。

在 AICC 现场,大会把这种变化拆成了三层产业信号来讨论。

其一,智能体改变了计算的服务对象。

基础设施过去服务一次模型调用,现在要服务一段持续的任务。

其二,真实应用负载正在反向定义计算体系。

2026 年 6 月,OpenAI 与博通发布的 Jalape ñ o 芯片,直接以模型路线、计算内核、推理服务和产品需求来指导芯片设计,模型与应用的需求,正沿着产业链向上游延伸。

其三,全球同时发生技术路线多元化与系统级整合加深。

在 Hot Chips 2026 上,GPU、定制芯片、晶圆级计算、RISC-V、Chiplet、存算一体同台出现,头部企业又在围绕真实负载,加强从芯片到软件的全栈协同。

放到中国 AI 计算产业的语境里,AI 正在同时向两个方向延伸:

一场向上,推理、工具使用、长程任务和科学发现能力不断突破智能上限;一场向外,成本下降与智能体普及,让智能从少数机构掌握的能力,走向企业、个人和社会普遍需要的生产力。

智能体改变的是整条 AI 计算产业链的组织方式。理解这一点,是读懂这场大会、以及下文聚焦的 infra 层的起点。

02.

从回答一个问题到持续干活:

一次 Agent 任务,推理侧发生了什么

回到开篇王书文的那组数据,这直接揭示了一个变化:Agent 正在把推理从一次调用,变成一段连续的任务链。

过去,一次推理就是 " 回答一个问题 ":请求进来,模型算一遍,Token 返回,结束。现在,智能体要 " 持续干活 ":为了完成一个任务,它一遍遍调用模型,先规划、再搜索、再调用工具、再读取结果,上下文随之越积越长,并且每一次调用模型,都需要输入完整的历史上下文。

推理系统要面对的,从一次次独立的计算,变成了一段连续的任务链。

负载的形态变了,计算压力也随之发生变化。213:1 的输入输出比例意味着,在智能体场景里,大量历史信息会随着每轮调用反复进入模型,真正新增的内容反而只占很小一部分。

这些负载高度集中在三种模式上:多轮复用与追加、子智能体分叉,以及工具循环与重试。

三种模式叠在一起,数据的结构 " 更像一棵树 ":用户只和智能体对话了几轮,智能体后端却已经和模型交互了几十轮,到后来 90% 以上的 Token,都花在了历史上下文的累积上,真正需要重新计算的只是一小段。

据 SemiAnalysis 的报告,智能体现在已经贡献了约 70% 的推理流量。

负载变了,推理系统的优化目标也要随之变化。这正是SGLang 这类开源推理框架多年在做的事:既然大量 Token 是在重复计算同一个上下文,那就想办法让它 " 复用 ",而不是重算

SGLang 最早提出的 RadixAttention,用一个前缀数来查找 KV Cache,让共享前缀的 Request 能够通过前缀数快速查找到已经计算好的 KV Cache,并进行复用;显存放不下时,再用 HiCache 把缓存下沉到内存甚至 SSD,把上下文拉得更长。

这种变化的效果是实打实的。王书文现场给出的实测数据显示,早期缓存命中率只有 10% 至 30%,接入跨实例存储后,可以提升至 80% 至 90%,首 Token 延迟也随之明显下降。

从回答一个问题到持续干活,推理侧的核心矛盾,从算得快变成了少重复算。理解了这一点,才能看懂接下来两层:推理框架和算子系统,各自在解决什么。

03.

从模型发布到跑起来

infra 层要闯过 " 九道关 "

用户看到的只是一个 " 能用 " 的模型,但一个模型从发布到真正跑进产业,中间隔着一条很长的流水线。

应用与智能体提出需求、模型发布、推理框架支持、算子补齐、芯片适配、功能跑通(day 0)、精度对齐、单算子 / 单机性能调优、系统级推理优化,再到生产化投产。

在 AICC 现场,这条链路被多位讲者反复梳理,业内把它称作 "九道关"。

这条流水线,大体可以分成两层来看。

上层是推理框架,回答一款新模型今天发布,推理服务最快什么时候能跑起来;下层是算子与系统,回答一款模型要在国产多元芯片上都跑起来、结果对、性能也够好,需要解决什么。

这两层在大会前后,各有一个看得见的标志性进展。

框架这一侧,答案落在 "Day-0" 上——新模型发布当天,推理框架就能完成支持。SGLang 核心贡献者在现场列出了近期第一时间完成支持的 DeepSeek-V4.1、千问 3.8 Flash、Nemotron 3.5 等模型。

算子这一侧,变化发生在大会召开前不到一个月。阿里 Qwen3.8-Flash-Next、智谱 GLM-5.3-Flash、腾讯 Hy4 preview 三款 MoE 模型接连上新,带来了全新的注意力结构、复杂的混合注意力部署,以及 770B 超大参数等不同适配难题。

智源牵头的众智 FlagOS 社区,在四天之内连续完成三轮多芯适配,其中两款实现了发布当日 Day0,适配范围覆盖摩尔线程、沐曦、昆仑芯、海光、天数智芯、清微智能等 10 款 AI 芯片。

这种速度背后,是一套逐渐沉淀下来的公共技术资产,包括算子库、编译器,以及对接 vLLM 和 SGLang 的插件层。

新模型出现后,共性的能力可以沉淀在公共层,芯片之间的差异则尽可能收敛到插件和底层适配环节,从而减少各家重复完成同一套工作的成本。

我们在现场观察到,这条过去由各家厂商各自为战的流水线,正在变成一套可以复用的公共基础设施。

04.

需求在涨、供给受限

中国 AI 计算的答案是开源协同

当然,对中国市场来说,这条流水线还有一层更现实的约束。当智能体加速进入生产、科研和社会服务,推理需求持续增长,对算力供给的规模、效率和适配能力也提出了更高要求。

这道题怎么解?

我们在大会现场看到的一个共同方向,是开源与多元

围绕这一方向,产业正在形成多种探索路径,其中,开源框架、基础软件与多元算力适配,是一条值得关注的路线:把不同芯片、系统和软件组织起来,转化为稳定、高效、可规模供给的系统能力。

具体来看,可以观察两类样本。

SGLang 等开源推理框架,就是其中一个缩影。通过缓存、调度和系统级优化,推理框架正在进一步提升计算资源利用效率,让有限的硬件资源承载更多推理任务。

另一类探索发生在多元芯片适配层。以智源牵头的 FlagOS为例,其希望通过更加统一、开放的基础软件体系,降低不同模型、框架与 AI 芯片之间的适配成本,让新模型能够更快运行在不同计算平台之上。

FlagOS 社区将这一问题概括为,让复杂的 "M × N" 适配尽可能向 "M+N" 模式演进。过去,每种模型框架和每款芯片都可能需要单独适配;如果算子、编译、框架等公共层能够形成更统一的接口和协作方式,框架侧与硬件侧分别对接公共层,就有机会减少重复适配,提高技术复用效率。

这种开源协同的价值,也开始落到具体的数字上。我们在现场听到一种形象的说法,是把推理服务看成一座 "Token 工厂 ":投入的是 GPU、服务器、网络和电力等固定成本,产出的是 Token 这一可变收益。

有厂商基于开源推理框架和分布式缓存系统搭建推理底座,日均 Token 产量已稳定突破 1 万亿,生产效率较此前提升 3 倍总产能增长超过 30 倍

可以看到,在算力需求持续增长、硬件供给存在约束的情况下,中国 AI 计算正在尝试借助开源协同,把有限的单卡性能、分散的多元芯片和快速变化的模型,组织成更稳定、更高效、可规模供给的推理能力。

05.

结语:让智能可获取、可负担

是中国 AI 计算的下一个命题

智能体时代,中国 AI 计算的真正命题,是如何把多元的芯片、系统和软件组织起来,持续支撑智能体的规模化运行——既让前沿智能不断突破上限,也让智能普遍进入千行百业。

AICC2026 给出的答案是开放与协同。大会现场,推理框架与算子层所呈现的进展,看似技术而细微,其实都在回答同一个问题:如何让一款新模型更快地跑起来、在更多芯片上跑起来、让更多人以更低的成本用上它。

当智能体从少数机构的演示,变成企业、个人和社会普遍需要的生产能力,AI 计算的竞争,已经升级为一场开放协同的竞争。谁能把多元的芯片与软件拧成一股可以规模供给的算力,谁就能定义智能普惠的底座。

这正是这场大会,以及中国 AI 计算产业,正在书写的下一步。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 中关村 北京 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论