明亮公司 昨天
东方算芯魏少军WAIC演讲:中国AI算力如何突破算力墙、内存墙、通信墙
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

作者:罗宾

出品:明亮公司

2026 世界人工智能大会(WAIC)期间,由国泰海通主办的 " 智见 AI   合创未来 " 人工智能投融资论坛上,国际欧亚科学院院士、清华大学教授、东方算芯董事长魏少军以《中国人工智能芯片需要原创技术》为题发表演讲,分享了他对 AI 芯片发展路径及国产算力突围的系统性思考。

魏少军表示,若以人的身体作为类比,农业革命解决了躯干的生命维持问题,工业革命延伸了四肢的能力,信息革命扩展了五官的感知,而正在发生的智能革命则是在延伸人类的大脑 , 即认知能力。而算力作为人工智能的技术底座,没有芯片就无法实现认知能力的延伸。

然而,当前 AI 芯片面临 " 更聪明的模型 " 与 " 更低成本的应用 " 之间的矛盾,训练需要极致算力,推理需要极致性价比,这给 AI 芯片带来系统性复杂度的挑战。

目前,国内大模型与英伟达 GPGPU 架构及 CUDA 生态的深度绑定,使底层算力基础设施的自主性面临严峻考验。中国 AI 芯片面临先进制程缺失、先进存储受限、高速互连落后等三大主要瓶颈。

对此,魏少军提出中国必须走一条颠覆性原创技术之路

近期,东方算芯正式发布软件定义近存计算 3D AI 芯片 DF1000。东方算芯以软件定义计算架构(SDC)为核心,通过粗粒度可重构计算、3D-DRAM 三维堆叠和 Infinity Chiplet 3.5D+ 扩展结构,在 14nm 国产工艺下实现 520 TFLOPS(BF16)算力、6.4TB/s 访存带宽和 900GB/s Scale-up 互连带宽,性能对标国际先进制程产品。

"DF1000最重要的价值在于实现了全国产供应链,而非单项性能指标的领先。"魏少军表示,没有稳定、可靠、安全的供应链,再好的技术最终都很难实现。他还指出,AI 芯片的发展不仅是技术问题,更重要的是方法学的根本变革,要从传统的单点优化思维,转向算力、存储与通信的协同优化,重构芯片设计全流程

以下为「明亮公司」对演讲内容的精编(未经演讲人审阅):

人工智能芯片的演进需求

人工智能芯片的发展经历了四个阶段:从借用传统芯片,到开发专用芯片,再到面向灵活性的可重构芯片,最后到大模型对算力的极致需求。但问题在于,应用以周为单位更新,算法以月为单位迭代,芯片设计却以年为单位,系统部署周期甚至长达 5 至 10 年。这种时间周期的严重错配,使得 " 更聪明的模型 " 与 " 更低成本的应用 " 成为芯片发展面临的核心矛盾——训练要更高效,推理要更便宜。

从训练端看,预训练占整个训练时间的 75%,强化学习占 20%;过去五六年,强化训练时间增加了 20 倍,算力需求却增加了 50 倍。从推理端看,用户要求响应时间越短越好,从而需要高访存带宽、大容量内存,但同时又希望 Token 成本越低越好。速度快、容量大、成本低,这些互相矛盾的指标对芯片开发构成了极大挑战。因此,人工智能需要一款新型的芯片。

算力、内存、通信三大鸿沟

这就对芯片提出了三个最基本的要求:第一要灵活、可编程,能适应各类不同应用。二要有高算力和高存储密度,以适应大模型发展的需要。第三要具备高能量效率,满足终端侧(如手机)的续航需求。在这三点归结出来以后,我们发现最大的问题是现在的计算架构不适应 AI 的发展。

我们在 AI 算力这方面起步的不算太晚,但是我们在发展当中遇到很多的困难。我们做大模型的人比较担心,当大模型发展与英伟达的芯片全面捆绑的时候,也就意味着人工智能的发展与英伟达深度捆绑。中国需要有自己的道路。

如何来破解这样的状况?

首先,挑战主要是三个:第一,我们想做高算力芯片所需的半导体工艺;第二是需要大容量高访存带宽的半导体存储器;第三是保证大集群运行稳定的高速互联。我们把它归纳成算力墙、内存墙、通信墙

要解决它们,我们就要回答在没有足够先进制程下如何提升算力、访存带宽如何能够匹配高增长的算力,避免算力的闲置,以及如何利用有限封装尺寸提供更大的互连带宽。

实际上算力的高低只是一维参数,算力高低跟存储、互联之间的适配程度才是真正关键的问题。高算力若无法输出则浪费,大存储若与计算引擎无法交互则失效。因此,这不是单项指标最优,而是多项指标协同最优。所以制程、存储容量、高带宽等挑战,本质上都是就是 AI 芯片把我们原来所熟悉的半导体领域所有参数推向极致的结果。

东方算芯的解决方案

介绍一下东方算芯的解决方案。面对算力、访存带宽、互联这三大问题,我们的方法是架构创新、三维堆叠技术以及系统组合的技术。

首先是架构。若架构不变,仅在工艺、封装等其他方面改进的空间有限。东方算芯采用粗颗粒度块状计算架构,即软件定义架构,通过分布式集合通信机制,复用计算单元与数据通路以提升计算效率。计算效率可达 85% 以上,相较其他方案高出 30% 甚至更多。原因在于计算、存储与互联三者匹配最优,而非单点指标最高,这是系统工作者的基本共识,也就是提升硬件利用率。

内存层面,通过三维方式缩短通信距离,将访存带宽压到最低。访存带宽可提高 5 倍,带宽容量比提升 5 倍。同等存储与计算能力下,计算效率进一步得以保证,突破了内存墙

通信层面,突破通信墙极为困难,因为通信必然存在损耗。东方算芯提出3.5D扩展结构,融合三维与 2.5D 技术,将更强算力、更宽带宽与更大互联规模有效结合,在相同封装尺寸下实现更优性能。

简言之,我们的 " 软件定义近存计算芯片 " 可实现计算效率高、通用性好、访存带宽大、能效优越。这一技术路线带来的重要变化是可完全避开受限的先进内存,不依赖最先进的制造工艺,实现国产供应链上的全面稳定发展。没有稳定、可靠、安全的供应链,再好的技术也难以实现。因此,东方算芯最重要的价值在于供应链的全国产化,而非单个指标领先。

通过上述努力,东方算芯以 14nm 工艺实现 520 万亿次浮点运算,提供 6.4TB 带宽(较国际最优高 50%),Scale-up 带宽达 900GB/s,以较先进技术打造了可与国际先进制程产品比肩的性能。

当然,并不是知道了这些就一定能把这个芯片做出来。这里面对于方法学、设计方法的变革是更深层次的。

传统芯片设计流程是线性串行的,而基于 AI 发展需要新的设计流程。

东方算芯是基于一整套新的设计方法才发展出了今天的 3D 芯片,没有这套新的方法,难度将大得多。因此我也想跟同行讲一句,恐怕我们在后续的发展当中不能只看单点,要系统地看待问题,发展出成套的技术解决方案,这样才能推动中国的算力芯片走向新的高度。

| 发福利!添加下方明亮公司主编微信有惊喜!

估值叙事

从寒武纪走势看摩尔线程、沐曦股份袁记食品和老乡鸡阿里 " 千问 " 补课雷军的声量,小米的估值英矽智能 AI 制药泡泡玛特做家电理想 L9 Livis 的 AI 豪赌蔚来击穿估值折价|美光与 AI 瓶颈叙事腾讯市值叙事拐点|MiniMax 和智谱的估值锚阿里的「割裂叙事」智谱与 Anthropic垣信卫星的估值锚  |  Momenta 的「物理 AI」叙事|MiniMax 重估的关键指标

当季公司

霸王茶姬SKP联想泡泡玛特伯希和白犀牛智达DeepSeek阿里腾讯字节SharkNinja

#领先认知

新茶饮上市收官Paradigm 谈早期投资字节AI 医疗独角兽 Abridge 访谈龚虹嘉谈「杭州六小龙」开源人形机器人马克 · 安德森谈 AI 科技霸权九阳资本跷跷板阿里与拼多多 AI 殊途

#一手信息

ASML洛阳钼业锅圈安琪酵母蘑菇街活力银发访谈雷鸟创新熵简科技

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 芯片 ai芯片 世界人工智能大会 清华
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论