东方财务网 6小时前
昆仑芯欧阳剑WAIC演讲:三万卡集群与超节点架构的前瞻性产业实践
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 世界人工智能大会(WAIC)期间,在国泰海通主办的 " 智见 AI   合创未来 " 人工智能投融资论坛上,昆仑芯 CEO 欧阳剑以 "AI 算力发展的新机遇,新范式 " 为主题发表演讲。

Token 作为 AI 时代的 " 水电煤 ",其成本能否以每年下降一个量级的速度持续走低,将直接决定产业能否进入真正的普惠化阶段。

面对这一挑战,技术架构与社会基础设施层面都需建立新范式。欧阳剑表示,技术层面,需通过芯片、硬件系统与软件系统的协同创新,解决系统规模与计算效率的核心挑战;社会层面,则需按照基础设施建设和运营算力的思路,带动半导体、能源等产业的协同发展。昆仑芯实现了三代自研架构产品的量产和大规模商业落地,于 2024 年底至 2025 年初率先建成 3.2 万卡国产集群。

作为完整经历从深度学习到大模型爆发全周期的国产 AI 芯片企业,昆仑芯的战略演进与 AI 产业发展高度同频。从 2011 年 AI 加速器立项,到 2015 年落地百度搜索推荐等核心业务,再到 2020 年昆仑芯 1 代量产、2021 年 2 代量产、2024 年 3 代量产,每一代产品均精准预判了技术趋势:昆仑芯 1 代奠定 XPU 核心架构并实现互联网场景大规模部署,2 代前瞻性布局片间互联并率先采用 GDDR6 显存,3 代则直接面向大模型训推一体需求,落地首个 3 万卡国产集群。" 前瞻定义、代代成功 " 的产品能力,源于昆仑芯对算法演进与算力需求的深度耦合理解。

在系统层面,昆仑芯率先落地的 3.2 万卡集群将有效训练率提升至 98%,集群 MFU 达到 58%,展现了国产 AI 芯片在超大规模工程化部署上的突破。其超节点产品通过 32/64 卡超高密度集成方案,卡间互联带宽提升 8 倍,综合训推性能提升 5 至 13 倍,单节点即可支持万亿参数超大规模模型训练。

昆仑芯超节点架构重新定义了 AI 算力效能,为 MoE 等新一代模型架构提供了高效的 Scale-up 路径。昆仑芯早在 2023-2024 年 MoE 尚未流行之时,已完成超节点的技术规划与产品布局,使其适配于 MoE 模型的计算,性能提升显著,并在诸多客户中实现大规模量产。

目前,昆仑芯已服务互联网、运营商、金融、能源、自动驾驶等多个领域的头部客户,以 " 让计算更便宜、让计算效率更高 " 为使命,持续推动国产 AI 算力基础设施的规模化发展。

以下为「明亮公司」整理的演讲内容(未经本人审阅):

Token 普惠化,成本「向下 Scaling Law」

当模型能力持续突破,Token 消耗量呈指数级增长,已成为开发者、内容创作者及普通用户的新型刚需。Sam Altman 曾预言," 我们看到未来,智能就像电力或水一样,人们通过电表、水表从我们这里购买,随心所欲地使用它。"

从实际消耗来看,开发者每日调用可达 200-2000 次,单次消耗 2 万至 3 万 Token,Claude Code 最高日调用量达 77 亿;内容创作者单次消耗 5 万至 30 万 Token,每日支出可达 50-500 元。当前 Token 价格虽基于 DeepSeek V3.2 官方定价(输入 2 元 / 百万 Token,输出 3 元 / 百万 Token)已大幅下降,但开发者月均支出仍达数千至数万元,对普通用户而言仍是负担。

技术进步与应用落地正驱动 Token 需求持续爆发。部分科技公司月度 Token 调用量从 2024 年 5 月的 10 万亿快速增长至 2026 年 6 月的 5400 万亿中国推理 Token 消耗的年复合增长率预计高达 230%,2030 年将达 3900 千万亿 Tokens/ 年。Scaling Law 仍然成立并得到拓展,预训练、后训练 RL 新范式、推理 CoT 共同推动模型性能提升。

与此同时,Token 成本必须大幅下降,AI 才能真正成为基础设施。过去 3-5 年,Token 价格以每年 10 倍以上的速度不断下降,o1 同等水平模型的调用价格相比发布时点已降低 100 倍以上。但这还远远不够。算力产业正在经历一场从芯片到系统的全栈式范式变革。

算力产业从芯片到系统的爆发式创新

面对 Token 成本每年必须下降一个量级的刚性约束,技术层面的创新不能再局限于单点突破。我们不能只盯着芯片制程,也不能只盯着模型压缩,必须是芯片、硬件系统、软件系统三层协同创新。与此同时,芯片架构上的 HBM2E 存储配置、推理架构优化以及模型压缩技术的全栈配合,才能推动算力效率的持续跃升。

但技术只是问题的一半。当 Token 用量真正达到水电煤级别,社会基础设施的范式也必须重构。

能源侧,GW 级数据中心与绿电布局不再是可选项;供应链侧,Foundry 和 OSAT 的产能扩张、HBM 与 CoWoS 封装的产能竞争,都需要全产业链提前布局;运营模式侧,运营商必须从单纯的管道角色转向 Token 运营,构建多管齐下的基础设施服务体系。Token 成为核心基础设施,它会像涟漪一样辐射到能源、半导体、零部件、运营服务等每一个维度,带动整个产业协同发展。

昆仑芯实践:完整经历 AI 浪潮,三代产品代代成功

昆仑芯从 2011 年就开始做 AI 加速器,完整经历了从深度学习到大模型爆发的每一个阶段。从 2015 年落地百度搜索、推荐等核心业务场景,到 2017 年启动 AI 芯片系列产品设计、2018 年 XPU 架构亮相 Hot Chips,再到 2020 年 1 代量产实现规模化商业落地,每一步都与产业演进同频共振。

做芯片最怕的是产品定义滞后于市场需求。我们的经验是,必须对算法演进趋势有前置判断。三代产品的预判逻辑很清晰:1 代奠定 XPU 核心架构时,国内互联网场景的大规模部署需求刚刚爆发;2 代精准预判了大模型发展趋势,前瞻性布局片间互联并率先采用 GDDR6 显存;3 代则直接面向大模型训推一体需求,8 张卡就能跑满血版 DeepSeek-R1,这在当时是很多同行不敢想的事。而面向 2026 至 2027 年的下一代产品,我们将进一步结合前沿算法趋势,实现软硬协同设计,为超大规模系统奠定基础。

三代产品下来,我们验证了一个道理:前瞻定义、代代成功,靠的是对算法和算力需求的深度耦合理解,而不是闭门造车。

系统层面率先落地 3 万卡集群,超节点产品开创先河

刚才提到那么多的挑战,我们也在新一代的产品里面努力解决这些问题,包括下一代的高性能推理芯片,以及下一代高性能的训推一体产品。从技术层面,为了解决算力效率和成本的问题,有一个特别好的办法就是 Scale-up 系统,这也是我们在几年前预判到的一个技术解法。

超节点是我们在 2023、2024 年就开始做的,当时 MoE 还没那么流行,我们提前做了一些技术规划。做完之后,确实在 2025 年 DeepSeek 出来之后,大家认识到这种大的 MoE 模型肯定就是以后的主流方向MoE 特别明显的一个瓶颈就是传输的挑战,因为多个专家之间的数据要做交换,而我们超节点特别适合这种大 MoE 模型的计算,性能提高的非常多,也在很多客户实现了大规模量产。

具体而言,我们率先推出的 32/64 卡超高密度集成方案,将单卡性能提升了 95%,卡间互联带宽提升了 8 倍,综合训推性能提高了 5 到 13 倍;256/512 卡方案已全面落地,未来可扩展至 4 千卡规模,单节点即可支持万亿参数超大规模模型训练。超节点架构重新定义了 AI 算力效能。过去大家比的是单卡算力,未来比的是单节点、单集群的系统效率。MoE 模型对互联带宽的需求,让 Scale-up 不再是可选项,而是必选项。

从芯片到系统,从万卡到超节点,我们正在完成从卖芯片到定义系统的关键跨越。我们的使命是让计算更智能,拆解下来就是两个维度:让计算更便宜,让计算效率更高。三万卡集群和超节点产品,是这两个维度在系统层面的集中体现。目前,昆仑芯已服务互联网、运营商、金融、能源、自动驾驶等多个领域的头部客户,以芯片和系统层面的双重突破,支撑 AI 业务的规模化落地。

追加内容

本文作者可以追加内容哦 !

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai ai芯片 自动驾驶 基础设施 互联网
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论