SpaceX 正对其数据中心建设方式进行系统性改革,以可靠性换取速度的战略转变,标志着马斯克旗下 AI 业务在基础设施扩张路径上的重要拐点。
据 The Information 援引知情人士透露,SpaceX 新任管理团队正着力加装更多电力与冷却备用系统,要求在数据中心投入运营前完成更全面的测试,并着手减少对临时性电力和冷却设备的依赖。数据中心扩张速度可能显著放缓。
这一做法与 xAI 此前 " 边建设边运营、后期补充冗余 " 的快速部署模式形成鲜明对比。与此同时,管理层在部分现有数据中心推进重新设计工程。
上周,施工作业意外影响一条输电线路,导致 SpaceX 位于田纳西州孟菲斯的大型数据中心发生一次备受关注的宕机事故。
SpaceX 表示,此次故障导致部分 Grok 模型下线,并对 Anthropic、谷歌等算力租赁客户产生连锁影响。马斯克随后在 X 平台发帖称,公司正在 " 采取纠正措施,确保此类事件不再发生 "。
截至发稿,SpaceX 周四美股盘中上涨 1.63%,早盘受获英国政府约 4000 万美元卫星服务订单的消息影响,一度涨超 3%,后有所回落。

此外,根据招股书披露的安排,SpaceX 9 月 9 日前后迎来 IPO 后第 90 天的一轮解禁,最多约 3.19 亿股 Class A 普通股获得出售资格,占相关 180 天锁定股份约 7%。
速度优先埋下隐患
SpaceX 曾将极速建设数据中心视为其在 AI 竞赛中的核心竞争优势。
xAI 曾宣称,其首座数据中心仅用 122 天便完成了搭载 10 万块 GPU 的上线部署——在通常需要数年才能完成同等规模建设的行业内,这一纪录被英伟达 CEO 黄仁勋称赞为 " 超人的 "、" 令人难以置信的 " 成就。
为实现这一速度,xAI 调集数千名承包商,采用多工序并行作业的方式推进建设:冷却管道铺设、电气和网络布线等工序往往在同一区域同步进行,而非等待上一阶段完工后再启动下一阶段。
SpaceX 甚至在今年 6 月的 IPO 文件中,将快速建设能力作为重要卖点加以强调。然而,这种激进的建设节奏带来了明显的可靠性代价。
据知情人士介绍,前两座数据中心上线时,其冗余度仅为其他超大规模云计算服务商的一小部分,这意味着单点设备故障便可能导致整个算力集群瘫痪。数据中心建成初期,频繁断电曾迫使 AI 研究人员将项目搁置数小时,并损失部分模型训练进度。
此外,由于团队成员曾被赋予较高的采购自主权,数据中心内部设备规格参差不齐,进一步削弱了系统稳定性。
人事大换血,火箭团队接管
今年 6 月下旬,马斯克对数据中心管理层实施大规模调整,由 SpaceX 老将 Wesley Salandro 接替 Dan Rowland 出任团队负责人。
Rowland 曾主导基础设施工程工作,并一度直接向马斯克汇报;他在加入 xAI 之前曾参与特斯拉 Dojo 超级计算机项目,在 Salandro 接手后不久便离开了团队。Salandro 在 SpaceX 任职超过七年,曾担任 Falcon 和 Dragon 火箭的生产副总裁。
在此之后数周内,多位核心负责人相继出走:
负责物理基础设施的 Jake Palmer、数据中心安全负责人 Logan Beach、采购负责人 Tiffany Wilson、财务负责人 Pablo Mendoza 均已离职。
Duke Energy 站点项目工程师 Aakash Verma 于 8 月转投 OpenAI,站点建设经理 Brent Mayo 亦随之离开。
数据中心设计参与者 Liz Balke 目前已加入 Anthropic 基础设施团队。
为填补人力缺口,SpaceX 向德克萨斯州 Bastrop 和佛罗里达州卡纳维拉尔角的火箭及 Starlink 工程师发出志愿支援号召,招募参与为期六至八周的轮岗工作。据悉,逾 1300 名工程师报名,其中超过 300 人在过去一个月内正式加入数据中心项目。
重建秩序,扩张节奏趋缓
新管理层不仅调整了技术路线,也重塑了组织架构。据知情人士透露,SpaceX 在此前相对扁平的管理结构中增设了多个中层管理职位,员工的设备采购授权和现场决策权随之收窄,这在客观上将进一步拖慢建设进度。
马斯克本人似乎对这一新策略持支持态度。据两位知情人士称,近几个月来他几乎每周都会造访孟菲斯的数据中心设施,通常选择在周日到访,最近一次到访正是上周日。
知情人士表示,尽管提前建设备用系统、加强测试的新做法势必放缓整体建设进程,但 SpaceX 可能不会完全放弃 xAI 此前的加速建设模式。
与此同时,在重建可靠性与保持扩张速度之间如何取得平衡,仍是这支新团队面临的核心挑战——尤其是在算力租用业务加速扩张、外部客户依赖度日益上升的当下。


登录后才可以发布评论哦
打开小程序可以发布评论哦