报告目录
壹 竞品对比:9050 Pro 处在什么位置 贰 性能实现原理:τ 定律与 LogicFolding 叁 Die Shot 深度剖析:双层版图逐块解读 肆 国产工艺水平评估与未来方向
核心结论
麒麟 9050 Pro 是全球首款将同一逻辑功能电路拆分、垂直分布到两层有源硅片上的商用移动 SoC:计算 die 采用中芯国际 N+3,SRAM die 采用 N+2,两片 die 均为 11.13 × 10.84 mm(120.65 mm ²),通过约 5000 万个、间距 1.5 µ m 的混合键合互连面对面键合。在工艺节点与 CPU 微架构均未换代的前提下,它实现了晶体管等效密度 155 → 238 MTr/mm ²(+55%)、大核能效 +41%、最高频率 3.1 GHz(+13%)、SRAM 工作频率 +40%——用封装与设计方法学换回了约三年的几何微缩收益。
但必须同时承认:"238 MTr/mm ² " 是按封装投影面积计算的 " 等效密度 ",并非图案化单 die 密度;其单核性能仍落后苹果 A18 Pro 约 40%,整体 CPU 处于骁龙 8 Gen 2 与 8 Gen 3 之间。它的真正意义不在跑分,而在于证明了一条不依赖 EUV 的性能缩放路线已经走完从论文到量产的闭环。
第一章
竞品对比:9050 Pro 处在什么位置
对比对象:骁龙 8 Gen 3 / 8 Elite、苹果 A18 Pro、谷歌 Tensor G6、前代麒麟 9030 Pro
1.1 规格与工艺对比总表
1.2 CPU 性能:处于骁龙 8 Gen 2 与 8 Gen 3 之间
综合极客湾实测与泄露跑分,9050 Pro 相对 9030 Pro 的 CPU 提升为单核 +13%、多核 +19%(官方口径为峰值单核 +24%、多核并发 +52%,基于 SMT 全开场景)。整体 CPU 水平接近骁龙 8 Gen 3,与当代 2nm 新旗舰仍有约一代半差距:
关键判断:9050 Pro 的 +13% 单核提升几乎全部来自频率拉高(2.5 → 3.1 GHz 级别的大核频率跃进)+ 互连延迟压缩,而非 IPC 改进——极客湾确认其 CPU 微架构与 9030 Pro 基本一致。这与竞品靠 N3E/N2 节点红利换性能的路径形成鲜明对照:HW 是在锁定晶体管的前提下榨取时序收益。
1.3 GPU 与能效:本代最大惊喜
绝对性能:
Maleoon 955 较上代渲染性能 +142%(官方)/ 实测综合约 +40%(极客湾),已 明显超越骁龙 8 Gen 2、逼近 8 Gen 3 ;在《原神》《鸣潮》实测中(Mate XT 2 vs 三星 Galaxy Z TriFold),帧率表现 与骁龙 8 Elite 基本持平 ——但需注意鸿蒙平台专属适配带来的优化红利,不能直接等同硬件算力。
能效:
据产业链消息(@tphuang),9050 Pro 的功耗表现 优于采用 TSMC N3P 的谷歌 Tensor G6 ——一颗 DUV 7nm 级芯片在能效上反超 EUV 3nm 芯片,这是 LogicFolding" 缩短互连 → 降低动态功耗 " 机理的直接证据,也是本报告第二章的核心。
对照前代的短板修复:
9030 Pro 曾被实测 " 中核与小核无法维持标称最高频率 "(热 / 功耗墙),9050 Pro 通过堆叠缩短时钟网络(时钟 buffer 数量减半、skew -25%)直接缓解了这一问题。
1.4 综合定位
一句话定位:硬件绝对性能处于 " 次旗舰 +" 位置,但工程路径的独创性是全行业独一份。对 HW 而言,9050 Pro 的任务不是赢下跑分榜,而是验证 τ 定律路线可量产—— Bernstein 在 9 月 21 日报告中已将其定性为 " 首个达到 3nm 级性能的 LogicFolding 芯片 "。
文中深度对比各个 SoC 性能和 DRAM(顶配多是三星海力士的颗粒)
第二章
性能实现原理:τ 定律与 LogicFolding
为什么在晶体管不变的前提下,功耗能降 41%、频率还能升 13%
2.1 问题本质:互连,而非晶体管,才是延时的主体
在现代 SoC 中,制约频率与功耗的关键路径延时(critical path delay)由两部分构成:晶体管本征开关延时 + 晶体管之间的互连 RC 延时。进入 7nm 以下节点后,互连 RC 已经取代晶体管成为延时的主要矛盾——导线越细越长,电阻电容越大,信号越慢、动态功耗(P = α· C · V ²· f)越高。
HW 被切断 EUV 供应后,晶体管维度(FinFET → GAA、间距微缩)的改进通道被基本锁死。何庭波在 2026 年 5 月 25 日 IEEE ISCAS 大会上提出的 τ(韬)时间缩放定律正是对这一约束的正面回应:既然不能把晶体管做小,就把信号要走的路变短。摩尔定律本质上也是关于时间的定律(小晶体管开关更快、密布线传输更短),τ 定律把这个 proxy 直接扶正为优化目标——以单一特征时间常数 τ 作为从晶体管到数据中心负载、横跨 12 个数量级的统一优化指标。
2.2 LogicFolding:从 "die 对 die" 到 "cell 对 cell"
2.3 热问题怎么解决?
双层有源硅最大的物理质疑是热密度。9050 Pro 的答案有三层:其一,折叠本身降低动态功耗(互连电容 C 减小),发热源头被削弱而非转移;其二,SRAM die(N+2 成熟节点,漏电与动态功耗均低)承担大量面积,高发热逻辑集中在 N+3 层,功能分区即热分区;其三,整机端配合 " 极速散热 " 系统。极客湾实测中核心能够维持 3.1 GHz 标称频率,说明热设计在当前功耗包络内成立——但这也解释了为何折叠只施加于关键路径、堆叠只有两层,而非论文路线图中的四层。
2.4 代价:硅的账单
成本是这条路线的真正约束。折叠芯片从两张键合晶圆中取材,每个晶体管的硅用量约多 30%(Hello China Tech 测算)。单 die 缩小到 120.65 mm ²(小于 9030S 的 122 mm ²)提高了单片良率和每片晶圆出片数,但 " 单 die 良率 × 键合良率 × 互连良率 " 的连乘决定了封装成品率。这解释了 9050 Pro 为何只用于 Mate XT 2 / Mate 90 Pro Max / RS 等超高端机型——年出货百万级以内,用价格覆盖硅成本与良率风险。
"1.4nm 等效 " 是会计口径,不是制造事实。路线图标称 2031 年达 400+ MTr/mm ²(" 对标 TSMC A14"),该口径按封装投影面积计算。按同一口径,AMD MI450X(N2 顶 die + N3P 底 die)2026 年即可 " 等效 "460 MTr/mm ²。密度数字的真正价值不在对标节点名,而在于频率与 SRAM 增益这些无法注水的物理量——它们已被独立实测部分验证。
第三章
Die Shot 深度剖析:双层版图逐块解读
基于 Kurnal Insights 发布的 Hi36E0(Kirin 9050)标注版 die shot,2026-10-02
3.1 总体结构:互为镜像的两层
两张 die shot 是同一芯片的上下两层,平面布局高度镜像—— GPU 居左上、CPU 居中上、NPU 居中下、基带居右下、ISP 居右。这种镜像对位布局正是 LogicFolding 的版图证据:上下对应模块通过 1.5 µ m 间距的键合阵列垂直互连,使 " 逻辑—缓存 " 之间的物理距离压缩到极致。两层各 120.65 mm ²,合计晶体管数推算约 280 亿 +,封装投影面积却与上代单层芯片相当。
3.2 逻辑层(SMIC N+3):计算电路所在
图 1 | 麒麟 9050 Pro 逻辑 die(Hi36E0,SMIC N+3)。可见 6 核 GPU 逻辑、LinXi CPU 各核逻辑、达芬奇 NPU 4 核、巴龙 5G 基带、Kirin ISP 及四组内存控制器。图片来源:Kurnal Insights
版图层面的三个细节值得工艺工程师注意:其一,CPU 大核与中核各自紧邻独立 FPU 单元布放,说明 LinXi 核采用 FP/SIMD 与整数部分物理分离的 floorplan,有利于 3.1 GHz 关键路径的绕线优化;其二,小核(Small-CPU /)与 "Small CPU L2 控制器 " 紧贴 SLC 控制器,构成低功耗岛,配合常开微核处理 AOD/ 传感器轮询;其三,逻辑层可见多处深色斑块(GPU 区域与边缘),为去层(delayering)成像中金属层残留 / 染色差异,非结构缺陷。
3.3 SRAM 层(SMIC N+2):一座 " 缓存之城 "
图 2 | 麒麟 9050 Pro SRAM die(SMIC N+2)。整层几乎被规则阵列填满:12MiB SLC、8MiB 大核 L3、8MiB 中核 L2、4MiB GPU L2、NPU/ 基带缓存及全部 PHY。图片来源:Kurnal Insights
下层的视觉特征与上层截然不同:大面积高度规则的棕红色 SRAM 阵列(位单元的周期性纹理清晰可辨),这正是把存储阵列整体迁移到 N+2 成熟节点的直接证据。逐块拆解:
这是教科书级的异构节点分配:数字逻辑吃节点红利 → 放 N+3;SRAM 微缩早已停滞(N5 之后 SRAM 密度几乎不涨)→ 放 N+2 反而良率成本双优;模拟 /PHY 不缩放 → 放 N+2。LogicFolding 让 HW 得以把最稀缺、最贵、良率最低的 N+3 产能只花在真正需要它的地方——在先进产能被管制的现实下,比起其他单点技术,这一点遥遥领先
3.4 从版图反推工艺约束
两层 die 同尺寸(11.13 × 10.84mm)是 W2W 键合的必然
晶圆对晶圆键合要求两层版图边界完全对位,无法像 D2W 那样混合不同尺寸 die,这也是良率连乘风险的来源。
SRAM 层的 "Safe Island?" 标注
(图 2 中部)暗示存在独立供电 / 隔离的安全岛区域,可能用于小核低功耗岛或安全子系统(EAL5+ 安全核)。
键合层的版图证据
两层标注中所有 " 控制器—阵列 " 对(SLC 控制器↔ SLC bank、GPU 逻辑↔ GPU 缓存、NPU 核↔ NPU Cache)在平面坐标上几乎重合——信号垂直下楼即达,这就是 5000 万互连中那 10 – 15% 高速信号的路径。
保守的第一代
对照论文路线图,本代 TSV 落点仅比顶层金属低一层(路线图目标是下探至 M6,可再释放 30%+ 上层绕线资源),折叠仅施加于关键路径而非全芯片。9050 Pro 是 刻意保守的量产首秀 ,为后续代际留出了明确的工程余量。
第四章
国产工艺水平评估与未来方向
从 N+3 的真实坐标,到 τ 定律路线图的十年赌注
4.1 当前坐标:密度已到 N6 级,性能与良率仍在补课
综合 TechInsights 与 SemiAnalysis 对麒麟 9030/9050 系列的拆解测量,N+3 的真实面貌是" 选择性微缩 ":
结论:出口管制没有阻止中国达到 N6 级密度,但让它变得昂贵且脆弱。每一次 DTCO 手段(fin depopulation、COAG、单扩散断开)都在叠加掩膜数、套刻敏感度与良率风险。9050 Pro 用 LogicFolding 把等效密度推到 238 MTr/mm ²,本质上是承认平面路线(假想 N+4/N+5)的边际收益已经不值得其成本—— N+4 需更矮单元 + 新一层 SAQP + 更紧栅距才勉强接近 N5,N+5 则需背面供电级别的集成革命。
4.2 τ 定律路线图:被封装的十年
频率与密度的同步爬坡意味着 τ 定律不是一次性技巧,而是可迭代的方法学平台:更多堆叠层数(2 → 4)、更深 TSV 落点(顶层金属下一层→ M6)、更大面积折叠(关键路径→全芯片)、配合 UnifiedBus/Hi-ONE 光互连向系统层延伸(集群通信延时从数十微秒压到 ~100ns,superPoD 算力 2030 年提升 125 倍)。
4.3 未来五大方向研判
① DUV 上的 GAA:晶体管层的最后一张牌
国产代工已在推进 DUV 制造 GAA 结构(τ 论文晶体管层方向),可实现 3nm 级器件特性,但 MEOL 约束使其整体仅达 5nm 级等效性能。这是 EUV 缺席下晶体管维度仅剩的结构性升级。
② LogicFolding 向 AI 芯片外溢
昇腾 950/990 先用 chiplet + 常规 3D,2030 年前后导入正式 LogicFolding。手机 SoC 是验证载体——几瓦功耗包络内证明的技术,将移植到 HW 真正看重的 AI 算力战场。
③国产 EDA 的真空补位
跨层拆分逻辑块在西方工具链(Synopsys/Cadence)中没有任何现成 flow,北大已有 LogicFolding 多层布局规划原型工具。这是国产 EDA 罕见的 " 定义权窗口 " ——在新范式上,大家站在同一起跑线。
④设备与产能生态化
N+2/N+3 正向良腾路 6 号输出(zf 主导而非商业行为),单点受制裁产能变成生态;键合设备(拓荆)、先进逻辑设备(北方华创)需求结构性受益。国产浸没式 DUV 已小批量交付(今年 5 台、明年约 20 台),但国产 EUV 的 LDP 光源仍停留在 100 – 150W(商用需 250W+,ASML 出货 600W)——五年内不要指望国产 EUV 救场。
⑤最大短板:存储
9030 Pro 部分版本仍用三星 1a LPDDR5X,国产在高端 DRAM 上仍在追赶,余承东公开抱怨存储成本挤压定价。逻辑制造已在封锁中趟出路径,存储是下一个必须攻克的依赖项。
4.4 结语: chokepoint 的迁移
出口管制的设计假设是 " 光刻节点是咽喉 "。9050 Pro 的回答是:让节点变成若干输入变量之一——用设计方法学(EDA)、电路架构(LogicFolding)、封装集成(混合键合)和系统互连(UnifiedBus)的联合优化,在锁定晶体管的前提下继续缩放时间常数 τ。这个论点当然是自利的,但它恰好也是 TSMC(A14 跳过 High-NA EUV)、Intel(Foveros Direct)、三星共同的方向——全行业都在发现同一组物理规律,HW 只是在压力下先到了,并且需要给它一个名字。
未决的问题只剩一个:良率。W2W 键合意味着任一层缺陷两片俱废,1.5 µ m 间距、<100ppm 失效率要在百万量级出货下持续成立。如果成立,2031 路线图就是真实威胁,出口管制框架瞄准的就是错误的器官;如果不成立,Mate XT 2 就是一台两万元的技术演示机。答案不会来自 HW,而会来自俄勒冈的拆解实验室和 Mate 90 系列的放量数据。
对工艺工程师的一句话总结:9050 Pro 证明了在互连主导延时的时代," 集成 " 可以替代 " 微缩 " 成为缩放的第一驱动力。晶体管是租来的(受限于设备),但拓扑是自己的。
主要信源
① Bernstein《China Semis: Huawei's Tau ( τ ) Law, another DeepSeek moment》2026-05-25;② Bernstein《Huawei's LogicFolding, an underestimated breakthrough》2026-06-04;③ 何庭波等《A Time Scaling Theory for Multi-Layer Electronic Systems》ISCAS 2026 / ChinaXiv;④ Kurnal Insights Hi36E0 die shot(2026-10-02);⑤ SemiAnalysis 麒麟 9030 Pro 拆解(2026-06);⑥ TechInsights SMIC N+3 分析;⑦ 极客湾麒麟 9050 Pro 性能解析(2026-09);⑧ M1k.tech《Kirin 9050 Pro: Huawei Folded the Chip Instead of Shrinking It》;⑨ Hello China Tech《The Silicon Bill Behind Huawei's Folded Kirin》;⑩ Wccftech / Huawei Central / 宇量信息知识库。


登录后才可以发布评论哦
打开小程序可以发布评论哦