空调系统电力损耗视角下的数据中心内部供电架构可靠性分析
作者: Kazi Main Uddin Ahmed, Manuel Alvarez, Math H.J. Bollen
机构: 瑞典吕勒奥理工大学电力工程系 (Electric Power Engineering, Luleå University of Technology)
期刊: Electric Power Systems Research
发表时间: 2021年1月27日在线发表
研究背景与目标
随着信息与通信技术(ICT)的飞速发展,全球数据中心的数量及其能源需求持续攀升。数据中心运营商面临着双重挑战:一方面要限制内部供电系统(Internal Power Supply System, IPSS)的电力损耗(Power Losses),另一方面要防止计算资源或服务器发生意外宕机。IPSS的电力损耗随着服务器数量的增加而上升,这会导致系统中配电单元(Power Distribution Unit, PDU)出现供电容量短缺(Power Supply Capacity Shortage)的问题。服务器作为数据中心信息技术(IT)的核心计算资源,其在机架层级(Rack-level)的宕机概率直接定义了数据中心的服务可用性(Service Availability)。尽管已有众多研究对不同层级(Tier I-IV)数据中心的可用性和可靠性进行了评估,但服务器数量增加对IPSS总电力损耗及机架层计算资源服务可用性的影响尚未得到量化分析。因此,本研究旨在填补这一空白,提出并应用一种定量研究方法,量化机架内服务器数量增加如何影响IPSS的总电力损耗和机架层计算资源的服务可用性。
研究方法与工作流程
本研究的方法论主要包含三个部分:建立IPSS各组件及IT负载的功耗模型、构建IPSS的可靠性框图(Reliability Block Diagram, RBD)以计算系统可用性、以及对两种典型IPSS架构进行定量案例分析。
首先,本研究为数据中心内部主要负载和供电设备建立了详细的功耗模型。IT负载的功耗建模基于中央处理器(CPU)的利用率。CPU功耗被定义为其空闲功耗与由利用率决定的活动功耗之和,而服务器的总功耗则与CPU功耗成正比,同时包含一个恒定的空闲功耗。一个机架的总功耗是该机架内所有服务器功耗的总和。对于IPSS中的电力调节设备,研究也提出了相应的功耗模型:不间断电源(Uninterrupted Power Supply, UPS)的电力损耗包括固定的空闲损耗和与所供总负载成比例的损耗;PDU的损耗包括固定的空闲损耗和与所供负载平方成比例的损耗;电源单元(Power Supply Unit, PSU)的损耗则被假定为其供电功率的1%。此外,电缆的传导损耗通过负载电流和电缆电阻计算得出,其中假设系统功率因数维持在一个较高的水平(0.98)。
其次,研究采用可靠性框图法来评估IPSS的可用性。系统可用性取决于其组件的可用性以及它们在框图中的串并联关系。组件的可用性由其平均无故障时间(MTTF)和平均修复时间(MTTR)计算得出。串联分支的可用性是各组件可用性的乘积,而并联分支的不可用性则是各组件不可用性的乘积。研究中关键组件的MTTF和MTTR等可靠性参数主要取自IEEE黄金标准(IEEE Gold Book)。
最后,研究对两种IPSS架构进行了定量分析。第一种架构(系统1)被定义为无组件冗余的系统,其结构与Tier I级数据中心等效。该系统包含一个UPS、一个PDU、以及机架内由单个PSU供电的多台服务器。研究首先分析了机架内服务器数量从1台增至10台时,系统可用性和电力损耗的变化。为探究PDU额定容量(本研究设定为8kW)的瓶颈效应,研究者对系统1进行了改造,增加了一个额外的PDU,并将服务器总数扩展至20台。第二种架构(系统2)被定义为具有冗余组件的系统,其结构等效于Tier IV级数据中心。该系统拥有两条完全相同的供电通路,每条通路均包含UPS、PDU等设备,正常运行时各承担一半负载,但任一路均可支持全部负载,实现了容错设计。研究同样分析了该架构下,服务器数量增加对系统可用性和电力损耗的影响。
主要研究结果
研究发现,随着机架内服务器数量的增加,IPSS的总电力损耗线性增长。然而,电力损耗百分比(系统总损耗与UPS供电总功率之比)的变化并非线性。在系统1中,当服务器从1台增至4台时,损耗百分比从14.70%下降至8.80%,但此后随着服务器数量增至10台,损耗百分比又反弹至12.85%。这是因为PDU的电力损耗与负载的平方成正比,在高负载下,PDU损耗开始主导系统的总损耗。
更重要的是,电力损耗的增加导致了严重的服务可用性问题。在系统1的分析中,当第八台服务器接入机架时,PDU所供应的总功率(IT负载加上PSU、电缆及PDU自身的损耗)就已达到其额定的8kW容量。这意味着,理论上机架所能容纳的最后两台服务器(占总计算资源的20%)将因PDU供电容量不足而无法运行,从而产生20%的机架层级服务器宕机概率。为了验证这一现象的普适性,改造后的系统1和系统2在服务器扩展至20台的研究中,均重现了类似结果。在系统2中,即使两条供电路径的PDU总额定容量高达16kW,当服务器数量增加至第17台时,系统总电力损耗再次使得总需求超出PDU的供电极限,导致最后四台服务器(即20%的计算资源)面临宕机风险。
本研究还展示了系统可用性与电力损耗之间的权衡。在系统1中,添加第二个PSU能使IPSS的可用性从“4.88个9”提升至“5.31个9”。然而,之后再增加更多的PSU,系统可用性指标将保持不变,但总电力损耗却持续线性增加。系统2由于采用了冗余并行路径,其系统可用性远高于系统1,达到了“10.62个9”,但其总电力损耗也因冗余组件的增加而高于同等IT负载下的系统1。
研究结论与价值
本研究的核心结论是,IPSS的可靠性不仅取决于组件的物理故障,还受到系统自身电力损耗的严重影响。电力损耗导致的PDU供电容量短缺,会引发计算资源的服务不可用,而这在传统的系统可用性评估中是无法体现的。研究表明,无论IPSS的整体可用性数值多高,都存在一个由电力损耗引发的恒定服务器宕机概率,在本研究的案例中该概率为20%。
本研究的科学价值在于提出了一种新颖的、将电力损耗纳入可用性评估的集成分析框架。通过建立负载相关的设备功耗模型和系统RBD,此方法能够量化电力损耗对服务可用性的影响。其应用价值体现在为数据中心的设计和运营提供了关键指导。在设计阶段,该方法和结论可帮助运营商避免机架层面计算资源的过度配置,并精确识别PDU的负载瓶颈,选择合适的PDU额定功率或确定每个PDU所带服务器的最优数量。在运营阶段,该研究启示运营商必须有效管理计算工作负载,以防止机架能耗需求达到PDU的功率瓶颈,从而确保服务可用性和能效。
研究亮点
本文的主要亮点在于: 1. 揭示了电力损耗导致服务中断的新机制:首次定量分析了IPSS内部电力损耗如何通过造成PDU供电容量短缺,进而引发确定比例(如20%)的计算资源宕机,这是对传统基于组件故障的可靠性分析的重要补充。 2. 提出了集成可用性与能效的评估方法:研究将设备级的详细功耗模型与系统级的可靠性框图相结合,构建了一个能够同时评估IPSS服务可用性和电力损耗的完整方法论,这在以往的研究中较为少见。 3. 验证了问题的普遍性:研究不仅在简单的单通路Tier I结构(系统1)中发现了PDU容量瓶颈问题,还在更为复杂和冗余度更高的Tier IV结构(系统2)中证实了同样的问题,增强了结论的普适性。 4. 明确指出了可用性指标的局限性:研究发现,仅依靠系统可用性的“9的个数”来衡量系统可靠性是不充分的。即使系统可用性指标极高且保持恒定,总电力损耗仍在持续增长,并最终在某个临界点导致服务不可用。这一发现对数据中心可靠性的评估标准提出了新的思考。