面向 AI 时代的数据中心供电层级结构设计
Designing Datacenter Power Delivery Hierarchies for the AI Era
论文信息
标题: Designing Datacenter Power Delivery Hierarchies for the AI Era
作者: Grant Wilkins, Fiodar Kazhamiaka, Alok Gautam Kumbhare, et al.
发布日期: 2026-05-15
arXiv ID: 2605.16255v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:随着 AI 加速器机架功率密度快速增长,传统数据中心供电架构在长期运行中出现大量 “搁浅” 功率——即虽然总容量充足,却因拓扑约束无法部署新设备。论文研究如何设计供电层级,使数据中心在整个生命周期(15–25 年)内高效利用功率。
- 核心方法:提出一个覆盖多资源层级约束的全生命周期评估框架,结合机架放置仿真、基础设施成本模型和 LLM 推理吞吐量模型,比较分布式冗余与块冗余两类拓扑在 8 年舰队规模演进中的可部署容量、有效成本和性能。
- 关键结果:在相同初始高可用容量下,分布式冗余(4N/3)在 AI 高功率密度场景中的尾端搁浅率显著低于块冗余(3+1),有效成本差距从静态的约 3% 扩大到 5.8%(高 TDP 轨迹),且块冗余需要多建 23 个数据大厅(见第 6.2 节、图 13、图 14)。
- 主要局限:推理吞吐量模型为一阶比较模型,忽略精确的集体通信重叠和拓扑细节;冷却和资源模型做了较多简化;需求轨迹虽源自生产数据,但生长率假设仅为情景分析,并非实际预测。
- 适合读者:数据中心供电系统设计师、云基础设施架构师、AI 集群规划者,以及对大规模电力输送拓扑与硬件演进匹配性感兴趣的系统工程师。
论文背景和研究动机
生成式 AI 的需求正驱动数据中心大规模新建,而新设施的供电层级必须支撑远高于传统云计算的功率密度。十年前,单机架功率通常低于 20 kW,如今 AI 加速器机架已超过 150 kW,未来数年甚至可能逼近 1 MW,形成机架级甚至 pod 级的兆瓦级部署单元(见论文图 1)。然而,数据大厅的供电架构在建设时即固定,通常要沿用 15–25 年,覆盖多代硬件。这使得设计问题从单纯的 “建设成本/兆瓦” 转变为跨硬件代的生命周期可部署性挑战。
传统规划指标(如安装 MW 和 CapEx 每瓦)只反映建设完成时刻的电气容量,却无法反映多年递进部署后剩余容量是否真正可用。由于部署可行性是层次化的——一个机架或 pod 必须同时满足从行级、UPS 域到变电站各级的容量与冗余约束,总剩余功率充足时也可能因碎片化而拒绝下一个大功率部署。这种无法利用的容量被称为搁浅功率。AI 加速器的部署粒度(单个机架或 pod 的功率)正逐渐接近甚至超过单一行、单个 UPS 块的有效容量,使得搁浅现象变得不可忽视。此外,工作负载吞吐量(如 LLM 推理的 tokens/s)又引入另一维度:更高密度的互联 pod 能提升推理效率,但要求更粗粒度的电力资源,进而增加基础设施成本。论文正是在这些缺口与挑战下,提出了一套以 “时间轴上可部署容量” 为目标的供电架构评估框架。
核心方法和技术细节
框架的核心是模拟整个数据中心舰队在 8–10 年内的机架到达、放置、超配(harvesting)和退役过程,输出可部署容量、搁浅率、有效资本支出和推理吞吐量。
资源与部署模型 部署单元为机架或 GPU pod(多台机架共同放置)。每个机架在安装时具备电力需求 以及由功率导出的冷却需求(风冷和直接到芯片的液冷)。机架分为高可用(HA,需满足故障转移冗余)和低可用(LA,可使用全部容量但不保证故障时供电)两类。GPU pod 需要连接多个独立馈电,因而限定在高密度行。模型允许将来进行功率超配(harvesting)和退役,寿命采用正态分布,GPU 类设备约 5 年,通用计算和存储约 7 年。
层级放置约束 供电树从变电站到行级逐级约束。对于分布式冗余()拓扑,每个活跃线规(line-up)仅可使用其额定容量的 比例作为 HA 负载,其余留作故障转移储备。这导致放置时必须同时满足多个父节点的局部余量条件:一台功率为 的机架连接到 个父节点,若一个父节点故障,各幸存父节点需承担 的额外负荷。因此,仅聚合 slack 充足是不够的——要求每个参与父节点都具备足够局部余量,否则发生 “储备碎片化” 搁浅。块冗余()则完全分离活跃线规与备用线规,每个活跃线规可满载,但容量以块为单位划分,导致在部署功率接近块容量整数分界线时,大量容量因不可分割而搁浅,称为 “线规量化” 效应。
舰队仿真与指标 仿真首先生成月度机架到达序列(基于 GPU、通用计算、存储三类工作负载的长期需求包络),然后在线将机架按方差最小化策略放置到现有大厅的行级,若现有大厅无法容纳,则新建一个大厅。仿真过程跟踪各资源的搁浅量,并计算两个核心成本指标:初始 \/MW$/MW$(总建设 CapEx 除以最终实际部署的 IT MW 数)。后者直接捕捉搁浅带来的额外成本。
推理吞吐量模型 为了评估 pod 规模对性能的影响,引入一个比较性的 MoE 推理吞吐量模型。吞吐量受限于计算、HBM 带宽和通信三者中的最慢者。通信时间根据张量并行(TP)和专家并行(EP)数据流分裂,并考虑专家被多个 NVLink 域分布时跨域 InfiniBand 流量的比例。该模型不预测绝对延迟,仅用于对比不同本地加速器域规模下的每瓦吞吐量差异。
创新点和贡献
论文的主要创新在于将数据中心供电设计的评价从静态建设成本转移到生命周期可部署容量,并系统性地揭示了两种主要冗余拓扑的搁浅机理。
生命周期可部署容量的定量框架 过去的研究多关注初始冗余成本或在线放置优化,但忽略了多代硬件演进中层级的搁浅效应。本文的框架首次结合长期需求包络、多资源层级约束、功率超配和退役,输出有效成本和尾端搁浅率等可直接用于设计决策的指标。通过 Azure 生产数据的验证,模拟未利用功率分布与真实情况的中位数差异在 6% 以内(见第 4.4 节图 9),说明框架具有代表性。
拓扑搁浅机理的分离与对比 论文通过单 SKU 扫描实验(图 6)将分布式冗余的 “储备碎片化” 与块冗余的 “线规量化” 效应清晰分离。在舰队层级,分布式设计(如 4N/3)在高 GPU TDP 轨迹下尾端搁浅率约在 10% 以下,而块冗余(3+1)则超过 20%(图 13)。这表明分布式拓扑在未来高密度 AI 负载下具有结构上的优越性,因为其储备可以灵活分担,而块冗余的粗粒度边界更容易与不断增大的部署量子失谐。
性能与部署可行性的交叉分析 论文进一步将推理吞吐量的增益与部署粒度导致的成本上升挂钩,提出 pod 收益指标(图 18)。结果表明,仅当模型大到跨域通信占比显著时,大 pod 的每瓦吞吐量增益才能覆盖其带来的额外搁浅成本。例如,10N/8 分布式架构能更早实现正收益,而 8+2 块冗余则需要更大的模型才能跨越阈值。这种综合分析为 AI 集群中 “多大 pod 值得部署” 提供了量化依据。
实验结果分析
论文在固定 10 GW 累计 IT 需求下,对比了两种容量等级(7.5 MW HA 和 20 MW HA)的分布式与块冗余设计,并嵌入了低、中、高三种 GPU 功率密度增长轨迹。
搁浅与有效成本 图 13 展示了随时间推移的 P90 尾端站点搁浅率。低 TDP 轨迹下各设计差别不大;但到高 TDP 轨迹的 2033 年,3+1 块冗余的搁浅率迅速攀升至 20% 以上,而 4N/3 分布式保持在 10% 以下。增加线规数(如 8+2 vs. 3+1)可缓解但无法消除差距。图 14 将有效成本的增加分解为基础成本、储备成本和搁浅诱导成本。基础成本各设计相近,储备成本随架构略有变化,但主导变动项是搁浅诱导成本——即必须多建大厅才能维持相同部署 IT 负载。在高 TDP 轨迹下,3+1 的有效成本比 4N/3 高出约 5.8%,这一差距远大于静态安装成本的 3% 差异。
搁浅原因与部署功率的关系 图 15 将尾端搁浅率对每域有效部署功率绘制。3+1 的搁浅在 2.5 MW UPS 块量化阈值附近呈现尖峰,直接反映块整除性损失;4N/3 则随功率上升平滑增加,符合储备碎片化的预期。这证实了舰队级的搁浅同样由拓扑特定机制支配。
Pod 收益的拓扑依赖性 图 17 针对 132T 参数的 MoE 模型,显示 pod 规模从 1 机架增至 7 机架时,10N/8 分布式在每瓦吞吐量和有效成本之间取得了更优的权衡,而 8+2 的吞吐量增益被更高的搁浅成本严重侵蚀。图 18 进一步揭示,随着模型尺寸增大,分布式设计的 pod 净收益更早转正,而块冗余则需要模型达到非常大(例如 401T)才能显现正收益。这为设施设计者在选择冗余拓扑时提供了清晰的参考:若未来工作负载需要更大 pod 以实现高效推理,分布式架构将比块冗余更经济。
实践建议
-
用 “可部署容量” 替代 “安装兆瓦” 作为设计指标。数据中心业主和运营商在规划新设施时,不应只根据静态 $/MW 做决策,而必须模拟未来 10 年的硬件密度增长和部署序列,评估实际可部署 IT 容量和有效 $/MW。论文提供的框架可作为参考原型,输入自身需求预测和供电拓扑,计算尾端搁浅和生命周期成本。
-
在 AI 高密度区域优先采用分布式冗余架构。当预期单机架功率将突破 200 kW 且未来可能进一步上升时,分布式 4N/3 或 10N/8 等比块冗余 N+1 或 N+2 更能避免因粒度不匹配造成的大量搁浅。对于现有块冗余大厅,可考虑将新增的 AI 集群部署在新型分布式大厅中,避免在旧拓扑中强行放置大功率 pod。
-
匹配部署粒度与供电层级容量。在设计高密度行和 UPS 域时,应使其有效容量与未来几代加速器的预期功率成良好整除关系,或预留足够的余量以免频繁跨越量化阈值。对于已知会使用多机架 pod 的工作负载,合理增大高密度行的容量(例如采用更多并联母线)以吸收粗粒度部署,同时又不过度牺牲低密度行的空间。
-
结合工作负载特性权衡 pod 规模。若主要运行中小尺寸模型或吞吐要求不高的推理任务,过度增大 pod 带来的通信收益有限,却会显著增加搁浅成本。可参照论文的吞吐量-成本权衡图,对不同模型和预期负载进行 “pod 收益” 分析,选择能实现正收益的最小 pod 规模。
-
将功率超配与拓扑评估结合。虽然 harvesting 能在一定程度上回收容量(图 16 显示约降低 1% 的总成本),但它无法根本改变高层次拓扑约束导致的搁浅结构。因此,不应将功率超配视为解决搁浅的主要手段,而应在设计阶段就选择对高密度部署更友好的拓扑。