首页  >  全球资讯 >  科技 >  AI的电力“抽风” 正在反噬数据中心
AI的电力“抽风” 正在反噬数据中心
林天心 来源: 2026-08-07 05:54
        
重点摘要
AI数据中心功率剧烈波动,导致关键设备加速老化,既推高运营成本、威胁投资者回报,也可能影响电网稳定。行业边跑边修,系统性解决方案仍待落地。

数十亿美元的AI数据中心,正在被自己的电力需求反噬——这句话听起来像耸人听闻的标题党,但行业里的工程师们正实打实地面对着这个麻烦。
当数十万张GPU同时开工训练一个新模型时,整座设施的用电量可以在几秒钟内蹿升到设计容量的1.5倍,然后又像什么都没发生过一样掉下来。一座吉瓦级数据中心的规模相当于整个波士顿市,而它有一半的负载每隔几秒就启停一次。美国中西部和得州还在规划一些更大的园区,规模是前者的五倍,平均耗电量几乎赶上纽约市。
这种剧烈波动让关键设备苦不堪言。多位电力行业专家向媒体透露,数据中心里那些小型天然气内燃机已经出现了曲柄断裂的情况。在xAI位于孟菲斯的"巨像"计算中心,燃气轮机甚至发现了裂缝。Uptime Institute的一位顾问打了个比方:就像让一辆车长期在红线转速下跑,发动机磨损当然比匀速行驶快得多。那些为了平抑波动而装的电池,有时候几个月甚至几周就得换新的。涡轮机、变压器、电容器——几乎整个供电链条都在超负荷运转。UL Solutions的CEO警告说,设备上的裂纹可能引发电弧闪络,电流在空中跳跃,直接烧掉那些昂贵的AI芯片。
这些技术故障从两个方向同时制造压力。向内看,停机就是烧钱。Switch公司的首席战略官算得很直白——换水泵或断路器的钱都是小事,真正肉疼的是算力闲着没法产生收入。有人估算过,每分钟停机损失从几千到几十万美元不等,具体看你在跑什么任务。更让人不安的是,有参与数据中心融资的人透露,部分设施的实际正常运行时间只有80%左右,离承诺的"全年无休"差了一大截。如果未来一两年内这个问题解决不了,投资者恐怕要重新掂量掂量了。
向外看,这些波动还威胁着更大的电网稳定。施耐德电气的电能质量专家提到一个专业术语叫"次同步振荡"——翻译成大白话就是,数据中心的用电模式会在电网里制造杂波,可能把其他地方接在电网上的设备也搞出毛病。过去两年,美国最高电力监管机构NERC已经多次敲警钟,说数据中心是目前电网稳定性的头号风险之一。他们评估了全美超过33吉瓦的数据中心,发现大约四分之三的负载模型根本没法真实反映这些设施的用电行为。今年早些时候甚至发了个罕见的三级警报,要求大型数据中心在8月3日前拿出紧急应对方案。
行业当然没闲着。英伟达在开发Blackwell GPU时就开始跟电力专家合作,试图从芯片层面让负载更平滑。有的数据中心用户想了个笨办法——在训练任务之外跑一些辅助计算,让GPU保持忙碌状态,这样功率就不会上蹿下跳。但这个做法被批评浪费电。美国能源部去年在科罗拉多搭了个测试平台,让开发人员带着自己的方案去实地验证,看看能不能扛住AI那种抽风式的用电节奏。
回头看,数据中心这行已经干了几十年,但AI带来的用电模式完全不一样。传统的云计算负载相对平稳,而AI训练就像心电图一样狂跳。行业在抢建算力的过程中,显然低估了供电基础设施的适配难度。那些几百亿美元的投资计划,都建立在"GPU够快、电也够稳"的双重前提上,现在后者开始露馅了。更深层的问题是,如果一座数据中心设备折旧比预期快得多,如果正常运行时间只能做到八成,那些回报模型还站得住吗?
目前行业的状态基本是边跑边修。xAI的涡轮机裂了就加电池缓冲,微软在得州的项目工期往后推了一年——都是零敲碎打的补救,还没形成系统性的解决方案。而NERC那纸三级警报和8月3日的截止日期,正在把这个工程问题变成合规问题和融资问题。AI行业花了两年时间证明自己有多能吃电,接下来得证明自己能稳稳当当把电吃完。