平头哥发布真武芯片与千卡超节点,以算存网全栈协同回应大模型和智能体需求,推动算力竞争从单芯片走向计算系统。
撰文|张贺飞
编辑|沈菲菲
9 月 22 日的 2026 云栖大会上,阿里平头哥发布了新一代训推一体 AI 芯片——真武 V900,搭载 216GB 大容量显存,片间互联带宽达 1200GB/s,单芯片性能是真武 M890 的 3 倍。
单就参数来看,真武 V900 可以说是目前算力性能最强的中国自研 AI 芯片。可如果只盯着 AI 芯片,可能会低估平头哥的算力野心。
和真武 V900 一同发布的,还有基于真武 V900 和自研 ICN Switch 互联芯片的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,让上千颗真武 V900 能像一颗 " 超级芯片 " 一样协同工作,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。
以及阿里全新升级的超节点服务器,将真武 V900、ICN Switch、磐脉智能网卡及镇岳 SSD 主控芯片进行了算、存、网全栈系统级协同,通过阿里云的智算中心网络架构,可稳定支撑 50 万卡规模单一 AI 集群。
在成立的第八个年头,一直保持高强度、高频率迭代节奏的平头哥,终于亮出了全栈布局的底牌。
- 01 -
一颗"中国最强AI芯片"
真武 V900 的发布在预料之中,也在预期之外。
2024 年,平头哥推出了首颗训推一体 AI 芯片真武 810E,采用自研的并行计算架构和片间互联技术,配合 T-Head SAIL 软件栈,有效支撑了千问系列大模型的训练和推理。
2026 年 5 月的阿里云峰会上,真武 M890 芯片首次亮相,显存容量达到 144GB,片间互联带宽提升至 800GB/s,性能是真武 810E 的 3 倍,并支持 FP32 到 FP4 多种数据精度。
仅仅四个月后,真武 V900 再次把性能推高到 M890 的 3 倍,显存从 144GB 增加到 216GB,片间互联带宽则 800GB/s 提升到 1200GB/s,时间比外界预期大幅提前。
不惜打破常规的研发节奏,和 AI 产业的演变趋势不无关系。
时间来到 2026 年 9 月末,万亿参数大模型已经是一种常态,有望在极短时间内出现 5 万亿乃至 10 万亿参数的 " 超大模型 "。模型参数倍增的同时,MoE 几乎成了所有主流大模型的技术架构。
不同于所有参数都参与计算的稠密模型,MoE 通过 " 稀疏激活 ",让每个 Token 只调用部分 " 专家 ",能够在扩大模型参数规模的同时,把单次推理的计算量控制在相对有限的范围内。
代价则是更复杂的通信。
在计算集群中," 专家 " 往往分布在不同 AI 芯片上,每个 Token 都要根据路由结果,将被动态发送给对应的专家,计算完成后再重新汇集,由此产生了大量 All-to-All 通信。如果 AI 芯片的带宽和时延跟不上," 专家并行 " 模式的计算收益可能被通信开销抵消。
2026 年以来的 Agent 浪潮,进一步改变了推理负载。
Agent 在执行复杂任务的过程中,可能经历规划、推理、调用工具、读取数据、再次推理等几十轮循环,上下文窗口突破百万级,导致 KV Cache 不断膨胀。再加上多 Agent 协同带来海量并发请求、数据中心训推分离的架构设计,数据开始越来越频繁地跨越计算资源流动。
衡量算力基础设施性能的核心公式,由过去单一的算力指标,变成了 " 算力 × 内存 × 互联 "。
真武 V900 的升级,对应的恰好是三个方向:原生支持 FP8、FP4 低精度计算,可显著降低推理成本;216GB 显存,增加了单卡能够承载的模型和数据规模;1200GB/s 片间互联,旨在缓解大规模并行计算的通信压力。
平头哥想证明的,绝不是在实验室里跑出一组漂亮数字。
按照阿里官方公布的数据,目前真武系列芯片已经服务超过 650 家企业客户,覆盖智驾、金融、基模、具身智能、能源、制造等行业。阿里巴巴集团 CEO 吴泳铭在云栖大会的演讲中表示:" 由于平头哥芯片产品线的成熟和客户的广泛应用,平头哥的年出货量将大幅提升。"
- 02 -
一个"真超节点"
提升单卡的 " 算存互联 " 性能,只是第一步。
一个万亿参数的 MoE 模型,通常需要几十张、几百张甚至上千张算力卡,真正决定系统效率的,是不同算力卡能否高效交换数据。
超节点因此成了当下最热门的概念之一。
可什么是超节点呢?把 128 张、512 张甚至 1000 张算力卡用高速网络连起来,就能叫 " 超节点 " 吗?
在理解这个概念前,先分清两个容易混淆的名词—— Scale-up 和 Scale-out。英伟达给出了很直观的定义:Scale-out 负责连接数据中心里的不同服务器;Scale-up 要让同一个集群里的算力卡像一个统一的计算引擎。
所以说,超节点不是 " 把更多卡连起来 ",需要跨越三道门槛。
第一道门槛:内存语义。
在传统的 TCP/IP 通信中,节点间的数据交换必须经过繁琐的 " 发包、封包、路由、解包、收包 " 机制。
对于需要微秒级响应的 AI 计算,数据来回交换的通信开销是不可忍受的。超节点的第一要义正是彻底摒弃消息语义,走向更底层的 Load/Store 级内存直接访问,让芯片 A 读取芯片 B 显存中的数据,像读取本地内存一样。
第二道门槛:统一编址。
物理上连接起来,不等于逻辑上是一台机器。
倘若几百上千颗 AI 芯片拥有各自独立的资源空间,仍需要处理复杂的数据放置、资源访问和跨节点通信。统一编址进一步把物理上分散的资源抽象为统一资源空间,降低大规模并行计算时资源访问和编程的复杂度。
第三道门槛:全带宽高速互联。
8 张卡的高速互联并不难,难的是规模从几十卡扩大到几百乃至上千卡后,依然能够保持足够高的带宽、低时延和稳定通信。
平头哥给出的答案是自研的 ICN Switch 互联交换芯片。
其中真武 V900 通过 ICN Switch 互联芯片连接后的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,同一套架构可覆盖从单机 8 卡到千卡集群的全场景部署,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。
在真假超节点鱼龙混杂的局面下,平头哥发布了一个 " 真超节点 "。
可以佐证的是:目前真武超节点实例已经规模化商业落地,是国内首个跑通 Qwen3.8、Kimi K3 两大超 2 万亿参数模型的超节点。
当然,背后离不开阿里云沉淀多年的工程能力,通过从芯片到云平台的全链路优化,显著提升了真武超节点实例的推理效率。比如通过算子优化和软硬件架构协同,在 Agentic 推理场景中最多可实现 1.5 倍的性能提升。
- 03 -
一套"为AI而生"的计算系统
把上千颗 AI 芯片变成一颗 " 超级芯片 ",依然不是终点。
很长一段时间里,数据中心产业建立在高度标准化的分工上:CPU、GPU、网卡、SSD 等来自不同供应商,通过 PCIe、以太网等标准接口组装成服务器,再由一个个服务器组成计算集群。
到了 Agent 时代,过去习以为常的范式,渐渐出现了裂痕。
以 Agent 的运行为例,并非是简单地把问题交给大模型、等待推理结果,涉及 CPU、GPU、网卡、SSD 等不同模块的协同。
模型推理时,需要 AI 芯片提供算力;多专家并行计算,需要跨芯片的高速互联;模型权重、企业数据等内容,要不断从存储系统中读取;任务规划、状态管理、工具调用等工作,还要交给 CPU 处理。
任何一个环节跟不上,都将拖慢整个任务的效率。
回头再看平头哥过去八年的布局,会发现一个有意思的变化:陆续推出了倚天系列服务器 CPU、真武系列 AI 芯片、ICN Switch 互联芯片、磐脉智能网卡和镇岳 SSD 主控。以前像是一条条独立的产品线,放在 Agent 的任务流里,形成了有序的分工协作。
倚天 CPU 负责通用计算和 Agent 调度,真武训推一体 AI 芯片负责大模型训练与推理,ICN Switch 负责超节点内的高速互联,磐脉智能网卡负责更大规模集群间通信,镇岳 SSD 主控把存储 I/O 接进整个系统。
有别于 " 组合采购 " 的标准化协议制约,平头哥的算、存、网全栈布局,为模型、芯片、云的协同优化提供了基础。
比如在 2026 年 4 月,平头哥发布了旗下首款智能网卡磐脉 920,不仅提供最高 400Gbps 的网络吞吐,还在芯片内部集成了 PCIe Switch,让 AI 芯片、网络与存储间的数据搬运进一步缩短路径。
放在传统服务器里,网卡主要解决 " 怎么把数据传出去 ";到了大规模 AI 集群里,开始参与到整个数据流的调度中,尽量减少 CPU 在数据搬运上的额外开销。简而言之,平头哥正在把网络从 " 连接设备 ",变成计算系统的一部分。
再比如平头哥在 2026 云栖大会上首次公布了倚天服务器 CPU 的后续规划:2027 年将推出倚天 720 和倚天 730,未来还将推出基于第二代自研核的倚天 750,将支持平头哥自研 ICN 片间互联总线协议,让倚天 CPU 与真武 AI 芯片通过 ICN 总线直接互联。
不难发现,平头哥的思路已经越来越清晰:不再分别把 CPU、AI 芯片、网卡和存储主控做强,正在将原本独立的芯片,围绕 AI 任务协同优化;不再是一组组彼此独立的产品,而是一套为 AI 而生的计算系统。
- 04 -
写在最后
八年前平头哥创立时,外界对一家互联网大厂能否做好芯片多有存疑;八年后的云栖大会,平头哥用一套覆盖 CPU、AI 芯片、交换芯片、智能网卡到存储主控的系统级布局给出了答案。
当模型参数向数万亿 MoE 迈进、复杂 Agent 任务重塑数据流向,传统 " 积木式拼凑 " 的服务器架构正逼近物理与通信的瓶颈。平头哥亮出了真武、倚天、磐脉、镇岳与 ICN 互联构成的全栈底牌,把目标从 " 造出一颗更强的芯片 ",推向了 " 造一个更高效的计算系统 "。
推荐阅读
点 "推荐 ",变好看哦。


登录后才可以发布评论哦
打开小程序可以发布评论哦