Alter聊科技 昨天
真武V900 AI芯片发布,平头哥亮出八年全栈底牌
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

平头哥发布真武芯片与千卡超节点,以算存网全栈协同回应大模型和智能体需求,推动算力竞争从单芯片走向计算系统。

撰文张贺飞

编辑沈菲菲

9 月 22 日的 2026 云栖大会上,阿里平头哥发布了新一代训推一体 AI 芯片——真武 V900,搭载 216GB 大容量显存,片间互联带宽达 1200GB/s,单芯片性能是真武 M890 的 3 倍。

单就参数来看,真武 V900 可以说是目前算力性能最强的中国自研 AI 芯片。可如果只盯着 AI 芯片,可能会低估平头哥的算力野心。

和真武 V900 一同发布的,还有基于真武 V900 和自研 ICN Switch 互联芯片的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,让上千颗真武 V900 能像一颗 " 超级芯片 " 一样协同工作,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。

以及阿里全新升级的超节点服务器,将真武 V900、ICN Switch、磐脉智能网卡及镇岳 SSD 主控芯片进行了算、存、网全栈系统级协同,通过阿里云的智算中心网络架构,可稳定支撑 50 万卡规模单一 AI 集群。

在成立的第八个年头,一直保持高强度、高频率迭代节奏的平头哥,终于亮出了全栈布局的底牌。

-  01  -

一颗"中国最强AI芯片"

真武 V900 的发布在预料之中,也在预期之外。

2024 年,平头哥推出了首颗训推一体 AI 芯片真武 810E,采用自研的并行计算架构和片间互联技术,配合 T-Head SAIL 软件栈,有效支撑了千问系列大模型的训练和推理。

2026 年 5 月的阿里云峰会上,真武 M890 芯片首次亮相,显存容量达到 144GB,片间互联带宽提升至 800GB/s,性能是真武 810E 的 3 倍,并支持 FP32 到 FP4 多种数据精度。

仅仅四个月后,真武 V900 再次把性能推高到 M890 的 3 倍,显存从 144GB 增加到 216GB,片间互联带宽则 800GB/s 提升到 1200GB/s,时间比外界预期大幅提前。

不惜打破常规的研发节奏,和 AI 产业的演变趋势不无关系。

时间来到 2026 年 9 月末,万亿参数大模型已经是一种常态,有望在极短时间内出现 5 万亿乃至 10 万亿参数的 " 超大模型 "。模型参数倍增的同时,MoE 几乎成了所有主流大模型的技术架构。

不同于所有参数都参与计算的稠密模型,MoE 通过 " 稀疏激活 ",让每个 Token 只调用部分 " 专家 ",能够在扩大模型参数规模的同时,把单次推理的计算量控制在相对有限的范围内。

代价则是更复杂的通信。

在计算集群中," 专家 " 往往分布在不同 AI 芯片上,每个 Token 都要根据路由结果,将被动态发送给对应的专家,计算完成后再重新汇集,由此产生了大量 All-to-All 通信。如果 AI 芯片的带宽和时延跟不上," 专家并行 " 模式的计算收益可能被通信开销抵消。

2026 年以来的 Agent 浪潮,进一步改变了推理负载。

Agent 在执行复杂任务的过程中,可能经历规划、推理、调用工具、读取数据、再次推理等几十轮循环,上下文窗口突破百万级,导致 KV Cache 不断膨胀。再加上多 Agent 协同带来海量并发请求、数据中心训推分离的架构设计,数据开始越来越频繁地跨越计算资源流动。

衡量算力基础设施性能的核心公式,由过去单一的算力指标,变成了 " 算力 × 内存 × 互联 "。

真武 V900 的升级,对应的恰好是三个方向:原生支持 FP8、FP4 低精度计算,可显著降低推理成本;216GB 显存,增加了单卡能够承载的模型和数据规模;1200GB/s 片间互联,旨在缓解大规模并行计算的通信压力。

平头哥想证明的,绝不是在实验室里跑出一组漂亮数字。

按照阿里官方公布的数据,目前真武系列芯片已经服务超过 650 家企业客户,覆盖智驾、金融、基模、具身智能、能源、制造等行业。阿里巴巴集团 CEO 吴泳铭在云栖大会的演讲中表示:" 由于平头哥芯片产品线的成熟和客户的广泛应用,平头哥的年出货量将大幅提升。"

-  02  -

一个"真超节点"

提升单卡的 " 算存互联 " 性能,只是第一步。

一个万亿参数的 MoE 模型,通常需要几十张、几百张甚至上千张算力卡,真正决定系统效率的,是不同算力卡能否高效交换数据。

超节点因此成了当下最热门的概念之一。

可什么是超节点呢?把 128 张、512 张甚至 1000 张算力卡用高速网络连起来,就能叫 " 超节点 " 吗?

在理解这个概念前,先分清两个容易混淆的名词—— Scale-up 和 Scale-out。英伟达给出了很直观的定义:Scale-out 负责连接数据中心里的不同服务器;Scale-up 要让同一个集群里的算力卡像一个统一的计算引擎。

所以说,超节点不是 " 把更多卡连起来 ",需要跨越三道门槛。

第一道门槛:内存语义。

在传统的 TCP/IP 通信中,节点间的数据交换必须经过繁琐的 " 发包、封包、路由、解包、收包 " 机制。

对于需要微秒级响应的 AI 计算,数据来回交换的通信开销是不可忍受的。超节点的第一要义正是彻底摒弃消息语义,走向更底层的 Load/Store 级内存直接访问,让芯片 A 读取芯片 B 显存中的数据,像读取本地内存一样。

第二道门槛:统一编址。

物理上连接起来,不等于逻辑上是一台机器。

倘若几百上千颗 AI 芯片拥有各自独立的资源空间,仍需要处理复杂的数据放置、资源访问和跨节点通信。统一编址进一步把物理上分散的资源抽象为统一资源空间,降低大规模并行计算时资源访问和编程的复杂度。

第三道门槛:全带宽高速互联。

8 张卡的高速互联并不难,难的是规模从几十卡扩大到几百乃至上千卡后,依然能够保持足够高的带宽、低时延和稳定通信。

平头哥给出的答案是自研的 ICN Switch 互联交换芯片。

其中真武 V900 通过 ICN Switch 互联芯片连接后的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,同一套架构可覆盖从单机 8 卡到千卡集群的全场景部署,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。

在真假超节点鱼龙混杂的局面下,平头哥发布了一个 " 真超节点 "。

可以佐证的是:目前真武超节点实例已经规模化商业落地,是国内首个跑通 Qwen3.8、Kimi K3 两大超 2 万亿参数模型的超节点。

当然,背后离不开阿里云沉淀多年的工程能力,通过从芯片到云平台的全链路优化,显著提升了真武超节点实例的推理效率。比如通过算子优化和软硬件架构协同,在 Agentic 推理场景中最多可实现 1.5 倍的性能提升。

-  03  -

"AI而生"的计算系统

把上千颗 AI 芯片变成一颗 " 超级芯片 ",依然不是终点。

很长一段时间里,数据中心产业建立在高度标准化的分工上:CPU、GPU、网卡、SSD 等来自不同供应商,通过 PCIe、以太网等标准接口组装成服务器,再由一个个服务器组成计算集群。

到了 Agent 时代,过去习以为常的范式,渐渐出现了裂痕。

以 Agent 的运行为例,并非是简单地把问题交给大模型、等待推理结果,涉及 CPU、GPU、网卡、SSD 等不同模块的协同。

模型推理时,需要 AI 芯片提供算力;多专家并行计算,需要跨芯片的高速互联;模型权重、企业数据等内容,要不断从存储系统中读取;任务规划、状态管理、工具调用等工作,还要交给 CPU 处理。

任何一个环节跟不上,都将拖慢整个任务的效率。

回头再看平头哥过去八年的布局,会发现一个有意思的变化:陆续推出了倚天系列服务器 CPU、真武系列 AI 芯片、ICN Switch 互联芯片、磐脉智能网卡和镇岳 SSD 主控。以前像是一条条独立的产品线,放在 Agent 的任务流里,形成了有序的分工协作。

倚天 CPU 负责通用计算和 Agent 调度,真武训推一体 AI 芯片负责大模型训练与推理,ICN Switch 负责超节点内的高速互联,磐脉智能网卡负责更大规模集群间通信,镇岳 SSD 主控把存储 I/O 接进整个系统。

有别于 " 组合采购 " 的标准化协议制约,平头哥的算、存、网全栈布局,为模型、芯片、云的协同优化提供了基础。

比如在 2026 年 4 月,平头哥发布了旗下首款智能网卡磐脉 920,不仅提供最高 400Gbps 的网络吞吐,还在芯片内部集成了 PCIe Switch,让 AI 芯片、网络与存储间的数据搬运进一步缩短路径。

放在传统服务器里,网卡主要解决 " 怎么把数据传出去 ";到了大规模 AI 集群里,开始参与到整个数据流的调度中,尽量减少 CPU 在数据搬运上的额外开销。简而言之,平头哥正在把网络从 " 连接设备 ",变成计算系统的一部分。

再比如平头哥在 2026 云栖大会上首次公布了倚天服务器 CPU 的后续规划:2027 年将推出倚天 720 和倚天 730,未来还将推出基于第二代自研核的倚天 750,将支持平头哥自研 ICN 片间互联总线协议,让倚天 CPU 与真武 AI 芯片通过 ICN 总线直接互联。

不难发现,平头哥的思路已经越来越清晰:不再分别把 CPU、AI 芯片、网卡和存储主控做强,正在将原本独立的芯片,围绕 AI 任务协同优化;不再是一组组彼此独立的产品,而是一套为 AI 而生的计算系统。

-  04  -

写在最后

八年前平头哥创立时,外界对一家互联网大厂能否做好芯片多有存疑;八年后的云栖大会,平头哥用一套覆盖 CPU、AI 芯片、交换芯片、智能网卡到存储主控的系统级布局给出了答案。

当模型参数向数万亿 MoE 迈进、复杂 Agent 任务重塑数据流向,传统 " 积木式拼凑 " 的服务器架构正逼近物理与通信的瓶颈。平头哥亮出了真武、倚天、磐脉、镇岳与 ICN 互联构成的全栈底牌,把目标从 " 造出一颗更强的芯片 ",推向了 " 造一个更高效的计算系统 "。

推荐阅读

" 智企 " 为何成了 AI 时代的必答题?

华为计算模组解锁算力释放新范式

医疗自主创新的 " 常德样本 "

华为云联手伙伴帮企业做好、用好智能体

点 "推荐 ",变好看哦。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

平头哥 ai芯片 芯片 阿里 switch
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论