炒股到现在最对不起的,就是家人。
而智谱的这一轮暴跌,确实已经到需要认真向家人解释的程度了。
7 月 17 日(周五),智谱收跌 28.49%,股价报 1107 港元,单日市值蒸发超过 2000 亿港元。
7 月 20 日(周一),股价盘中再度跌超 16%,跌破 1000 港元。若按 6 月 22 日盘中 2980 港元的历史高点计算,累计最大回撤已超过66%。
对于智谱的这波 " 回撤 ",外界已经有很多说法,但最扎眼的导火索可能来自同行。
7 月 16 号,月之暗面放出了 Kimi K3。总参数 2.8 万亿,原生支持视觉理解和 100 万 Token 上下文,Kimi 称它为全球首个开源的 3 万亿级模型。
接下来的几天,大家都知道了。
不过,也就是这周开盘前一天,有网友跑到智谱首席科学家唐杰的微博评论区,追问在千问、Kimi 接连完成史诗级进化后,智谱还有戏吗?
唐杰只回了一句:史诗级 Plus。
模型名没有,发布时间没有,参数规模也没有,气氛这一块先给足了。
不过,顺着这条评论往上翻,还真能找到一条技术线索。
唐杰微博原 po 里介绍的,是智谱与清华团队的一篇论文——
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse。
论文 3 月挂上 arXiv,7 月被 COLM 接收。
在 po 文里,唐杰表示 IndexCache 只改几行代码,就能把 DSA 留下的一笔隐性开销削掉。
按理说,一篇 3 月上线的论文,到了 7 月又被单独拎出来,本来就有点显眼,再加上唐杰这种大佬,现在也很少单独宣传某篇工作。
细思之下,史诗级 Plus 的回应恰好出现在这条技术帖下面。
这……上下文顿时变得微妙起来。
所以,这篇论文和史诗级 Plus,到底有什么关系?
IndexCache
简单来说,IndexCache 并不是一种新的注意力机制,它主要面向的是长上下文推理,解决 DSA 在上下文变长后,索引器反而成为计算瓶颈的问题。
以往 DSA 的思路,是在每层注意力前放一个轻量级索引器。
索引器先从完整上下文里挑出最重要的部分 Token,让主注意力只处理这些 Token,从而大幅降低计算量。
但问题在于,虽然主注意力不用再看完整上下文,但索引器仍要扫描一遍,而且模型的每一层都要重新扫描。
由此,上下文越长,索引器越容易从省算力的帮手,变成新的计算瓶颈。
在论文测试的 30B 模型中,上下文拉到 200K 时,索引器已经占掉 81% 的预填充时间。
IndexCache 的创新之处就在于抓住了这个明显的重复动作。
相邻模型层选出的重要 Token 高度相似,top-k 索引重合率达到 70% 到 100%。既然几层挑出的结果差不多,就没必要每层都重新算。
所以,它的核心思路就是:少数层负责计算索引,其他层直接复用。
在具体实现方面,模型只保留少数索引器,算出 top-k 后缓存;其余层跳过计算,直接沿用最近的结果。
对现有模型,可以根据损失变化搜索哪些层适合保留。
训练新模型时,则让一个索引器同时学习服务后面几层。推理代码只需增加一次条件判断,也不额外占用 GPU 显存。
实验效果上,在 30B 模型上,IndexCache 最多能砍掉 75% 的索引器计算,模型效果基本不变。
200K 上下文下,生成第一个 Token 前的速度最高提升 1.82 倍,后续出字速度提升 1.48 倍。
在 GLM-5 上的初步实验中,砍掉一半索引器计算后,长上下文和推理能力也基本保持不变。
到这,这篇论文的内容也就差不多结束了,但这和史诗级 plus 有啥关系?
GLM-5.2 已经用过了
虽然唐杰在微博里说史诗级 plus,但略显遗憾的是,这篇工作的核心思路其实已经在一个月前发布的 GLM-5.2 里用过了。
在 GLM-5.2 里,这套思路名叫IndexShare。
具体的,GLM-5.2 每四个 Transformer 层共享一个索引器。第一层负责选出 top-k 索引,后面三层直接复用。
这和 IndexCache 的核心思路基本一致。上面的论文给出免训练搜索、多层蒸馏和完整实验,GLM-5.2 则把四层共享一次索引真正装进了模型。
靠着 IndexShare 等改动,GLM-5.2 把上下文窗口推到 100 万 Token。在 100 万上下文下,每 Token 计算量降低 2.9 倍。
而这种工程优化释放出的信号,不是智谱准备换掉 DSA,而是还在沿着这条路线继续榨效率。
对模型厂商来说,能不能支持百万 Token 是一回事,能不能以可接受的成本真正用起来,又是另一回事,而 IndexShare 就表明智谱仍在通过跨层复用压低长上下文的推理成本。
难不成?这 GLM-5.3,又是极致的性价比??
One more thing
除了模型软件侧的优化外,刚刚,智谱又落下了一块更重的拼图。
据悉,就在今天 7 月 21 日,智谱已落地 1GW 级国产 AI 算力数据中心,并全部采用国产 AI 芯片。
与此同时,智谱还完成了对国产 AI 异构算力软件公司中科加禾(XCore Sigma)的收购。后者源自中科院计算所编译实验室,长期研究异构算力软件栈和编译优化,被业内视为国内顶尖 AI Infra 团队之一。
两项动作,一个解决算力从哪里来,一个解决算力怎样用得更彻底。
1GW 国产算力为大模型训练提供资源,中科加禾则通过编译器、Runtime 和推理引擎,提高不同国产芯片的利用率,降低模型训练与推理成本。
从 IndexCache、IndexShare,再到国产算力中心和 AI Infra 收购,智谱最近补的似乎不只是一款模型,而是从芯片、软件栈到模型的整条链路。
这些动作和史诗级 Plus 有没有关系,目前还没有答案。
但留给智谱的悬念,显然又多了一层。
史诗级 plus,你快来吧!
参考链接
[ 1 ] https://arxiv.org/abs/2603.12201
[ 2 ] https://z.ai/blog/glm-5.2
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦