唐雪阳
安科瑞电气股份有限公司 上海嘉定 201801
单机柜功率从5-10kW一路飙到50kW以上,还在往上走,AI算力的爆发速度远超大多数人的预期。
算力集群越做越大,配电系统的压力也跟着水涨船高。服务器可以堆,芯片可以换,但底层配电一旦出了岔子,整个集群都得跟着停。
一、高功率密度场景下,配电系统扛着三座大山
第一座山:可靠性。AI训练集群一旦断电,恢复成本高。机房扩容导致配电设备数量激增,链路越来越复杂,任意一个节点出问题都可能引发连锁反应。过去一台精密配电柜管十几台服务器,现在一台柜子管几十台GPU,负载翻了几倍,故障的影响范围也跟着翻倍。
第二座山:电能质量。GPU服务器属于非线性负载,运行中会产生大量谐波。谐波增大线路损耗,干扰UPS和精密设备的正常运行。但很多数据中心的配电监测还停留在看看电压、电流的阶段,谐波畸变率、三相不平衡这些关键指标压根没覆盖。
第三座山:运维模式跟不上。精密配电柜越加越多,巡检范围越来越大,人工根本跑不过来。设备告警了,运维人员只能凭经验判断问题在哪,排查效率取决于个人经验,新人来了两眼一抹黑。
算力硬件在迭代,配电监测和运维管理的手段也必须跟着迭代。
二、把配电链路打通,让数据替人跑腿
安科瑞电力运维云平台,针对数据中心高功率密度场景,把配电和动环监测整合到一起。

配电全链路,从10kV到列头柜都能看。平台采集范围覆盖10kV进线、变压器、低压配电到列头柜的各级数据,同时接入UPS、暖通等设备的运行信息。电压、电流、功率、谐波,所有电气参数在线可查,整条配电链路的运行状态一目了然。

母线温度,用3D热力图看见发热点。在母线槽接头、插接箱等容易发热的位置部署温度传感器,依托平台的三维模型生成3D热力图。哪个点温度异常,一眼就能看出来,不用等设备报警了再去翻图纸找位置。

电能质量,异常自动告警、联动处置。系统持续监测谐波畸变率、三相不平衡、电压暂降等指标。参数异常自动推送告警,还可以对接治理设备,及时响应。

告警辅助分析,缩短故障排查时间。出现告警后,系统自动调取历史运行数据,结合同类事件的参考信息,输出故障诱因参考和处理建议。运维人员不用凭经验摸索,排查效率大幅提升。

三、算力中心的能力,不止看芯片
单机柜功率向50kW以上演进,原有的配电管理模式已经难以匹配高功率密度机房的运行要求。服务器的密度在涨,芯片的功耗在涨,配电系统的压力也在涨,配电底座如果跟不上,算力再强也白搭。
借助安科瑞电力运维云平台,可以实时查看机房用电数据,掌握各类设备运行状态,梳理分析告警事件,为数据中心配电运维提供系统化支撑。
算力的上限,从来不只由芯片决定。配电底座稳不稳,同样重要。
电话
微信扫一扫