面向硬件生命周期的超大规模数据中心功率规划(OSDI 2026)
原题:Hardware Lifecycle-Aware Power Planning in Commercial Hyperscale Datacenters (Operational Systems)
一句话总结:生产服务的整机功率通常达到设计功率的 85.6%,且不同服务的峰值并不同时出现;论文据此把机架功率预算按硬件生命周期持续校准,并用只依赖性能计数器的 PowerSight 在传感器尚不可用时预测功率,使全 fleet 平均多部署约 20% 的机架,未见硬件的新平台机架设计功率预测误差为 1.7%。
问题与动机
超大规模数据中心同时运行多代 CPU、GPU、存储设备和大量服务。用电气设计给出的峰值功率规划机架,会把“所有服务器同时达到最坏功率”当成常态,造成电力容量闲置;预算过低又可能触发上游 power capping,损害性能和效率。
论文把服务器从 pre-EVT、EVT、DVT、PVT 到量产和后续调优视为一个硬件生命周期。量产后的 fleet 有功率传感器和生产流量,早期平台设计却要在传感器数据出现前决定机架密度、机架功率预算(RPB)以及是否需要新数据中心。核心问题是如何在硬件和工作负载都异构、信息逐阶段增加的情况下规划功率。
关键观察 / 隐含假设
- 观察 1:标准基准低估整机功率。 SPEC CPU2017 的核心功率与生产服务接近,但生产服务平均达到设计功率的 85.60%,SPEC 只有 75.51%,相对低 11.8%(图 4)。生产服务的 SoC non-core、内存、网卡和风扇功率更高。
- 依赖假设:生产流量的指令 footprint 和内存/I/O 行为比通用基准更能代表规划目标。
- 可能失效场景:服务迁移到更计算密集、内存占用下降或硬件配置变化后,历史生产分布未必仍适合作为代理。
- 观察 2:功率存在显著的空间和时间异质性。 不同服务和同一服务的机器功率约分布在设计功率的 20%–90%(图 5);一个机架中约 15% 的服务器低于设计功率的 50%。三个主要工作负载的峰值时段也不重合(图 9)。
- 依赖假设:服务混部和故障场景下的峰值相关性仍可由历史 fleet 数据估计。
- 可能失效场景:大规模同步发布、流量突发、相关故障或 AI 训练长时间满载会降低时间复用带来的缓冲。
- 观察 3:代际改进在组件间不均衡。 CPU-E 相比 CPU-B 在相同 IPC 下的单位吞吐 socket 功率约下降 2 倍,而 DDR5 相比 DDR4 的等带宽内存功率只改善约 1.2 倍;最新代内存功率占系统功率超过 20%(图 6、图 7)。
- 依赖假设:性能计数器能够稳定反映内存、存储、网络和加速器活动。
- 假设 1:早期平台的工作负载组成可由上一代或服务所有者提供的先验近似。 PowerSight 的 RPB 案例使用上一代的工作负载占比;该假设证据强度为中,因为论文展示了一个新平台案例,但没有覆盖业务迁移导致的组成突变。
核心方法
论文首先利用 Meta 生产流量,覆盖数千服务、数百万机器、8 代 CPU、2 代 GPU 和 42 种机器配置,收集组件级性能计数器与多层功率传感器。dynolog 以轻量 daemon 方式采集 CPU、DRAM/HBM、磁盘和网络等指标,避免只用 CPU/GPU 单一利用率推断整机功率。
生命周期规划分三步。pre-EVT/EVT/DVT 阶段用电气规格和历史 derating factor 预测 RPB;PVT/MP 阶段根据服务所有者的负载测试,建立功率—目标利用率曲线,并按工作负载占比加权。MP+1 year 后,利用工作负载峰值不重合计算 inter-workload max correlation score,将空间异质性与时间异质性共同纳入 refined RPB(§4.1)。
PowerSight 将整机功率建模为回归问题,输入机器配置和多组件性能计数器,输出系统功率。作者比较 Lasso、Ridge、SVR、DT、GBDT 和 MLP,使用 PCA 聚类筛选特征;筛选后的特征与全量特征准确率差异在 0.1% 以内。最终选用 MLP,以适应跨架构的非线性关系和百万级训练数据(§5.1–§5.2)。
该模型服务于三类早期决策:预测机架可容纳的服务器数、预测 RPB,以及扫描有限频率范围寻找更高 Perf/W 的配置。设计的收益依赖于性能计数器在传感器尚不可用时仍可获得,并不要求为每个服务完整执行频率 sweep。
设计取舍
- 用概率/相关性换取容量利用率:RPB 低于 design power 可释放 stranded power,但错误估计会导致上游超载和 power capping,或使机架密度偏低。
- 用 fleet 级数据换取泛化能力:模型依赖数百万样本来消除温度、芯片批次和 BMC 校准噪声;小数据训练时误差超过 10%,因此早期新架构若缺少相似样本,泛化风险仍在。
- 用整机特征换取部署开销:排除 kernel-level GPU counters 以避免较高 profiling overhead,但这也可能丢失 GPU 工作负载内部差异。
实验与结果
- 生产服务平均使用设计功率的 85.60%,SPEC CPU2017 为 75.51%,说明仅用标准基准会低估约 11.8%(图 4)。
- forecast RPB 相比 design power 提高机架密度 13%;加入时间峰值相关性后再提高 11%,全 fleet 平均约多部署 20% 机架(图 10)。
- 在多架构、compute/storage/AI 混合训练中,MLP 的功率预测准确率为 96.19%,DT 和 GBDT 分别为 95.59% 和 95.53%(图 12b)。
- 使用至少数百万数据点才能得到稳定预测;只有数万样本时误差超过 10%(图 13)。
- 对训练中未出现的 CPU-H/GPU-B inference 平台,MLP 在既有和新架构/新工作负载场景都优于 DT、GBDT(表 4),但表中绝对误差需结合具体配置解读。
- 新 CPU-E 平台的 rack design power 预测 MAPE 为 1.7%,换算机架服务器数的误差为 8.7%;RPB 预测误差为 2.5%(§5.3.1–§5.3.2)。Video 工作负载中,真实最优频率为 2.6 GHz,PowerSight 给出的候选区间为 2.4–2.8 GHz(图 14)。
论断—证据表
| 论断 | 证据 | 评测边界 | 置信度 |
|---|---|---|---|
| 生产服务比 SPEC 更接近整机设计功率 | 图 4:85.60% vs. 75.51% | Meta 生产服务、8 代 CPU 相关配置、SPEC CPU2017 | 强 |
| 生命周期化 RPB 能提升机架容量 | 图 10:13% + 11%,平均约 20% | Meta fleet 的 compute、storage、AI 机架;依赖历史峰值相关性 | 中 |
| PowerSight 可跨架构预测整机功率 | 图 12、表 4:MLP 96.19% 准确率并测试未见平台 | 数十种配置、数百万生产样本;新平台案例数量有限 | 中 |
| PowerSight 可支持早期规划 | §5.3:design power MAPE 1.7%、RPB 误差 2.5% | CPU-E 机架案例,工作负载占比使用上一代先验 | 中 |
批判性分析
论证链条
“生产功率高于基准”支持使用 fleet telemetry;“峰值不重合”支持 refined RPB;“传感器晚于平台决策”支持 PowerSight。链条在 Meta 的部署流程内是闭合的。约 20% 的 fleet 容量收益是长期运营结果,但论文没有给出按年份、故障类型或单个上游电力层级拆分的违规率与 power-capping 代价,因此难以独立复现安全边界。
假设压力测试
RPB 的时间相关性可能在同步流量、共同故障或 AI 训练集群中失效。论文承认 AI 训练的 CR 可能更低,但没有给出不同故障相关性下的尾部保证。PowerSight 的跨架构结论也主要依赖拥有大量相似生产数据的 fleet;真正全新架构、全新服务组合和传感器校准变化下的误差分布未充分展示。
实验可信度
生产规模、跨代覆盖和真实传感器数据是本文最有说服力的部分。模型比较包含线性模型、树模型和 MLP,并使用独立日期数据测试。另一方面,论文主要报告 MAPE/准确率,未系统呈现 P95/P99 功率误差、过估计与低估的非对称代价,也未以公开数据或可复现实验产物支持结果。
系统性缺陷
论文未详细讨论模型在线更新、漂移检测、错误预算触发后的回滚流程和跨区域运维成本。RPB 过低可能导致上游 power capping,且其性能影响没有量化;RPB 过高则浪费容量。DVFS 作为低估后的补救措施可能影响尾延迟,论文没有给出 SLO 约束下的验证。
局限与后续工作
- 局限 1:训练数据需要数百万生产样本;早期平台若与历史架构差异很大,论文给出的泛化证据不足以保证安全规划。
- 局限 2:工作负载占比和峰值相关性使用历史数据或先验,突发流量、相关故障、模型更新和 AI 长时任务可能使 RPB 偏低。
- 后续工作 1:按工作负载类型、故障域和电力层级报告功率预测的高分位误差,并验证在固定 SLO 下 power capping 的概率与性能损失。
- 后续工作 2:建立面向新架构的校准流程,比较迁移学习、保守置信区间与纯 MLP 在无传感器阶段的机架密度决策误差。