Meta 在 AI 基础设施领域的一系列决策失误,正以数十亿美元的代价暴露出其组织文化的深层问题。
据芯片行业研究机构 SemiAnalysis 最新披露,Meta 正要求 AMD 为其定制一款大幅削减规格的 MI450X 芯片——计算单元减半、HBM 内存堆叠数从 12 层降至 8 层,内存容量缩水近三分之二。SemiAnalysis 直接将这一决定定性为 " 灾难性 ",并公开呼吁 AMD 绕开 Meta 基础设施团队,直接与 Meta 旗下超级智能实验室 TBD Lab 对接,推动采购标准版 MI450X。
这一事件并非孤立。SemiAnalysis 指出,从逾 25 亿美元的 Rivos 收购案,到 H100 定制服务器 Grand Teton、再到 GB200 定制方案 Ariel,Meta 基础设施团队的决策模式呈现出一贯的过度工程化、缺乏软硬件协同设计、以及短期政治导向压倒长期技术合理性的特征。"Meta 基础设施团队需要一次文化重置,"SemiAnalysis 写道。

AMD 最强芯片遭 " 阉割 ",GenAI 性能严重受损
AMD MI450X 是目前市场上硅工程规格最为激进的 GPU 之一:采用 2 纳米制程、混合键合封装技术、12 层 HBM4 内存堆叠,以及市场上最大的 CoWoS 光罩尺寸,代表了当前封装与存储密度的天花板。

然而据 SemiAnalysis 披露,Meta 所订购的定制版本将计算硅面积减半、HBM 堆叠从 12-Hi 降至 8-Hi,相当于同时压缩了算力与内存带宽两项核心指标。Meta 基础设施团队给出的理由是:该配置面向推荐系统(RecSys)工作负载设计,旨在提升 CPU 与 GPU 的计算比例。
问题在于,这一决定是在 TBD Lab 成立之前作出的,后者作为 Meta 核心大模型研究团队,对这款芯片毫无兴趣。SemiAnalysis 明确表示,相较于英伟达的 Vera Rubin,被削减规格的 MI450 对 TBD Lab 毫无吸引力,"TBD 将大幅倾向于 Rubin"。这意味着 AMD 在 Meta 的出货量将因这一决策受到严重冲击。
SemiAnalysis 在报告中罕见地直接向 AMD 喊话:"AMD 需要站出来,直接与 TBD 团队合作,确保他们拿到正常版 MI450,而不是这个对 GenAI 毫无价值的阉割版。"
Rivos 收购:逾 25 亿美元换来一地鸡毛
Meta 基础设施决策失误的另一典型案例,是 2024 年以逾 25 亿美元完成的 Rivos 收购。
据 SemiAnalysis,Meta 内部芯片部门鲜有人真正理解这笔收购的战略逻辑,当初推动该交易的人士此后已趋于沉默。主流看法是:Meta 资金充裕,定制芯片赛道升温,加之此前已在授权 Rivos 知识产权,管理层认为不如将其整体收入囊中。
然而交易结构本身已埋下隐患。Rivos 创始团队坚持全员打包出售,Meta 不得不买下整家公司,随后大幅裁撤其不需要的部门。报道援引前 Meta 芯片员工称,收购由 Meta 硅片负责人 Yee Jiun Song 主导,过程中遭遇内部反对,但交易完成后其本人兴趣已然减退。现有芯片团队管理者将 Rivos 工程师视为 " 免费人力 ",各自划入麾下,原有团队架构迅速瓦解。
从技术层面看,收购的核心价值—— Rivos 的 SIMT 架构 GPU IP ——已随着原计划搭载该技术的 "Olympus" 芯片项目被取消而烟消云散。接替方案 "Phoebe" 项目预计最早 2028 年流片,但 SemiAnalysis 指出,内部对其能否落地并不乐观。
人员流失同样触目惊心。据 SemiAnalysis,约 30% 的 Rivos 员工在近期裁员中离职,联合创始人 Mark Hayter 已经离开,另有多名前 Rivos 人员在首批 RSU 于今年 5 月归属后转投 Gerard Williams 创立的芯片初创公司 Nuvacore。SemiAnalysis 还透露,Rivos 首席执行官兼联合创始人 Puneet Kumar 可能在其 Meta 股份全部归属后一两年内离职。
Grand Teton 与 Ariel:重复上演的设计代价
Meta 的定制化偏执并非新近才有。其 H100 定制服务器 Grand Teton,在标准 HGX 服务器基础上额外增加了一个交换机托盘,搭载四颗博通 PCIe 交换机、16 块 SSD 和八块网卡,目的是为每台服务器提供更多直连存储,用于训练检查点保存。
然而实际投入生产后,模型团队对这些存储的使用远低于预期,该设计最终被放弃。SemiAnalysis 指出,这是 Meta 硬件与软件团队缺乏协同设计的典型体现——基础设施团队为未被充分使用的功能付出了更高的物料成本与功耗代价,同时还增加了对博通的依赖,而这与 Meta 试图降低对英伟达网络设备依赖的初衷背道而驰。
进入 Blackwell 时代,Meta 的定制方案 "Ariel" 延续了类似逻辑。标准 GB200 规格为每颗 Grace CPU 搭配两颗 B200 GPU,而 Ariel 将其改为一对一配置,GPU 数量减半。理由同样是为 RecSys 工作负载提升 CPU 比例。

据 SemiAnalysis 测算,Ariel NVL36x2 方案的总拥有成本(TCO)比标准 GB200 NVL72 高出 14%,而额外支出换来的更多 CPU 与 DRAM 资源,恰恰是大模型团队不需要的。由于采用跨机架连接方案以弥补 GPU 数量减少导致的组网缺口,网络延迟与可靠性问题随之而来。与此同时,最初被认为不稳定的 NVL72 背板已逐渐成熟,Meta 对这一技术风险的判断事后证明有误。
SemiAnalysis 表示,Meta 的 GB300 服务器已回归标准配置——这本身即是对 Ariel 方案的否定。
文化根源:短期考核压倒长期战略
SemiAnalysis 将上述问题归因于 Meta 基础设施团队的组织文化。
该机构指出,Meta 的六个月绩效考核周期每轮淘汰最末 10% 至 15% 的员工,导致团队倾向于追求短期可见成果而非长期技术布局。部分管理者热衷于推动高曝光度但快速可交付的项目,交付后迅速转向,这一做法被内部称为 " 粉刷门面 "(window washing)。与此同时,鲜少有人公开挑战上级决策,导致错误难以被及时纠正。
供应链团队在工程决策中话语权有限,进一步放大了上述问题。SemiAnalysis 指出,部分供应商已因 Meta 频繁的方向变动而降低对其新项目的优先级,转而优先保障亚马逊或谷歌的需求。
SemiAnalysis 将这一现象类比于 Meta 旗下 Reality Labs 的扩张历程——在大规模裁员到来之前,数十亿美元被投入庞大的工程团队与研发项目之中。如今,随着 Meta 着手向外部客户出售算力,这种内部文化的代价将更加直接地暴露在市场面前。


登录后才可以发布评论哦
打开小程序可以发布评论哦