财联社 8 月 6 日讯(编辑 李莹)AI 对电力的巨大需求早已众所周知。但鲜为人知的是,AI 数据中心电力的剧烈波动可能会损坏内部关键电力设备,加速设备的折旧或导致报废。电力设备磨损后,如不及时检修更换,可能进一步损害芯片。
市场日益担忧相关设备的实际折旧速度可能远快于预期,投资者对超大规模云厂商数千亿美元的支出感到不安。
电力剧烈波动损害设备
几十年来,数据中心一直在大量消耗电力,但专为 AI 计算设计的数据中心有所不同:其电力需求极为庞大,且波动要剧烈得多。
数据中心和电力供应商咨询机构 Uptime Institute 英国首席顾问 Amber Villegas-Williamson 表示:
"AI 确实创造了‘异常’的电力需求。这就像让汽车引擎超频运转,会比保持恒定车速更快地磨损发动机。"
业内指出,AI 数据中心训练新模型时,需要调动全部 GPU 同时投入运算。数十万颗 GPU 在毫秒之间同步启停,就好比蜂群集结、鱼群同步转向。
工业及数据中心微电网服务商 Mainspring Energy Inc. 创始人兼总裁 Shannon Miller 表示:一个吉瓦级的数据中心耗电规模相当于波士顿,其一半的用电量可能每隔几秒就会启停一次;部分 AI 园区规模甚至还要大五倍以上,平均耗电量与纽约市相当。
电力波动管理设备研发商 Heron Power Electronics Co. 创始人、特斯拉前高管 Drew Baglino 表示,AI 有时会导致用电量激增至设计容量的 150%,因此一个 1 吉瓦的设施可能会在极短的时间内使用 1.5 吉瓦的电力。
绝大多数设备在设计之初,并未考虑应对幅度如此剧烈的电力波动。能源储存开发商 Terraflow Energy 首席执行官 Jon Parrella 将其比作驾驶一辆法拉利并直接从六档换到一档。
他表示:" 你无法做到那么快地切换。"
有媒体近期采访了美国和欧洲三十多位电力专家,多名人士表示,数据中心所用小型天然气内燃机已发生曲轴断裂故障。
有知情人士透露,在 xAI 位于田纳西州的 Colossus 数据中心中,燃气轮机出现了裂纹。
氢燃料电池服务商 GeoPura Ltd. 首席执行官 Andrew Cunningham 表示,英国规模小得多的数据中心内的轮机也出现了裂纹。
测试与认证服务机构 UL Solutions Inc. 首席执行官 Jennifer Scanlon 表示,设备的裂纹或磨损可能会导致电弧闪络(电流在导体之间跳跃),从而损坏 AI 芯片。
几位知情人士表示,在快速推进数据中心建设的过程中,并未充分配置电池、电容器、飞轮、变压器等多种可平抑电力波动的设备。
据数据中心咨询机构 Uptime Institute 以及其他与运营商合作的人士称,为平抑电力波动安装的电池,高负荷下有时需要在几个月甚至几周内更换。
Uptime Institute 的 Villegas-Williamson 指出,从中东、非洲到欧洲和美国,全球各地的数据中心都存在这一问题。
收益承压
业内指出,这些问题已经在导致部分 AI 数据中心建设延期或缩减运营规模,进而影响收益。
基础设施开发商 Joulent Inc. 正与能源巨头雪佛龙公司共同开发得克萨斯州西部一个规划为 2.67 吉瓦的 AI 园区。
Joulent Inc. 首席执行官 Chris James 表示,为了确保该园区能够达到微软公司所需的 99.999% 基础设施可用性,规划日程中额外预留了工程时间。他透露,这意味着供电开始时间将从 2027 年推迟至 2028 年。
数据中心建设及运营商 Switch 首席战略官 Jason Hoffman 表示,如果关键设备提前故障,财务后果主要不在于更换水泵、断路器或某种电力部件,而在于计算能力因关机而无法产生的收入。
业内指出,停机所造成的收入损失因设施类型和工作负载而异,估计从每分钟数千美元到数十万美元不等。
有知情人士称,数据中心的建设预设是,项目投用后便可实现全年 365 天不间断运转。但该人士透露,部分数据中心实际可用率仅接近 80%;若相关问题得不到解决,未来一至两年内,部分项目的投资者或将因此遭受损失。
与此同时,GPU 机架受芯片技术快速迭代影响而加快的折旧速度,同样让市场对该行业的盈利兑现能力打上问号。
威胁大电网
业内指出,上述隐患还可能波及整个大电网的稳定。
施耐德电气电力质量专家兼全球产品经理 Sreemant Roy 表示:
" 这些负荷极具动态性且波动剧烈,会导致电网不稳定,如果不加以改善,可能导致停电。"
他特别指出,数据中心容易在电流量中引起亚同步振荡,这可能会损坏连接到网络其他部分的设备。
Roy 表示:
" 这让全球的公用事业公司感到非常担忧。"
在过去两年中,北美电力可靠性公司(NERC)——美国负责制定电网供电可靠性标准的核心机构——已多次发出警告和警报,指出数据中心是电网稳定性的最大风险之一。
NERC 此前对美国总规模超 33 吉瓦的在运数据中心开展评估,发现约四分之三的负荷模型 " 无法反映数据中心的动态用电特征 "。今年早些时候,该机构罕见发布三级警报,要求大型数据中心处置上述紧迫风险,并于 8 月 3 日前提交整改反馈。
仍在寻求解决方案
AI 行业已经意识到这些问题并正在积极寻求解决方案。
英伟达基础设施解决方案高级总监 Dion Harris 表示,英伟达在 2024 年开发 Blackwell GPU 时,就开始与电力专家开展更紧密的合作,致力于让数据中心的设计、建设、工程实施以及电力供给各个环节都更加顺畅。
Harris 表示:
" 我们正在制造芯片和处理器,但也将其应用于公司自己的数据中心。"
部分数据中心运营方正通过执行辅助计算平抑电力波动。但该方案也饱受诟病,原因是在用电紧张的背景下,这种做法会造成电力浪费。
辅助计算是和模型训练无关的虚拟运算。当真实训练任务负荷下降时,通过额外运行无效运算,强制让 GPU 保持高负载运行,避免用电量急剧跌落,以此抹平电力波动。
落基山国家实验室(NLR)的美国能源部电力办公室项目经理 Martha Symko-Davies 表示,该实验室去年代表美国能源部设立了一个测试平台,以研究如何安全地将 AI 用电整合到电网中。
该站点配备本地 GPU 及发电设施,可供开发者测试自有配置能否应对 AI 业务的用电波动。
NLR 的 Symko-Davies 表示:" 我们现在有机会把它做好。"


登录后才可以发布评论哦
打开小程序可以发布评论哦