这两年做 AI 算力集群的朋友应该都发现一个事儿:GPU 服务器一满负载跑起来,瞬时吃电流比传统服务器猛太多了,传统 UPS 那套铅酸备电或者直接挂在母线上的方案,越来越顶不住。所以在机房供电架构里,BBU(Battery Backup Unit,机柜级锂电备电单元)开始往上铺------简单说它就是在每个机柜旁边塞一组锂电,市电一掉,它无缝接管给这台柜子的 GPU 服务器供电,撑到柴发起来或者平滑切到集中式备电。我们 KRASSATE 嘉仕新能(新能源测试设备厂商)这两年跟不少做这类电源模块的客户打交道,发现一个普遍痛点:BBU 单体生产出来容易,但要把它"放到真实数据中心工况下去验证"这件事,很多团队是拍脑袋搭的,测出来数据好看、现场一跑就翻车。今天不卖货,纯粹从测试工程角度聊聊,一套能打的 BBU 备电单元测试系统到底该怎么分层搭。
先说清楚 BBU 测试为什么不能按普通电池那么测。普通pack老化测试,基本是恒流放到底、看容量曲线完事。但 BBU 的工况是:平时挂在母线当个"待命的备胎",市电正常时它在充电或浮充;一旦掉电,它要在毫秒级把母线电压顶住,然后以很大的倍率持续放电直到负载转移。中间还经常碰到 GPU 训练任务的负载忽高忽低。所以测试必须分三层往下钻:大倍率放电层 → 负载阶跃层 → 并机均流层,缺一层都是埋雷。
第一层:大倍率放电层
这一层解决的是"真掉电时它扛不扛得住"。数据中心 BBU 的放电倍率普遍在 3C 到 5C,什么概念------满电容量如果是 10Ah,5C 就是 50A 放电,几分钟就放完。所以你不能拿小电流慢慢放去评估它,那根本不是真实工况。
这层要抓的指标:
- 放电曲线:电压随 SOC 掉落的形态,末端是不是断崖式
- 端子温升:大倍率下放,极柱和连接片发热最猛,温升超了就是火灾隐患
- 放电末端截止保护:电压到截止点 BBU 是不是干净利落地断,别拖泥带水带出反向
实测时一般让双向电源先给 BBU 充到满电(模拟电网侧),然后切到电子负载拉 3C/5C 恒流放电,全程记录电压、电流、温度、时间戳。这里有个细节:放电末端一定要有"强制截止+记录残余"的动作,很多便宜方案放到截止就停了,你根本不知道它最后那几百毫秒内部 MOS 是怎么动作的。
第二层:负载阶跃层
这层是我最想敲黑板的。很多团队第一层测完觉得"放电 OK 了"就放行,结果现场 GPU 一跑训练任务,母线电压就开始抖,BBU 还偶尔误保护掉线。问题就出在只测了稳态放电,没测阶跃。
GPU 训练负载的特征是:不是平滑的,是 10% 负载和 90% 负载之间反复横跳。比如一个 batch 计算空窗期电流很低,一到矩阵乘爆发就拉满。BBU 要在这中间把母线稳稳顶住。
这层用电子负载做"阶跃模式":从 10% 额定电流一脚踩到 90%,再弹回 10%,循环跑。重点看两个量:
- 瞬态电压偏差:阶跃瞬间母线电压被拉偏多少,一般要求压在 ±5% 以内,偏太多 GPU 电源模块就报警了
- 恢复时间:从被拉偏到回到稳态窗口要多久,这个得是毫秒级
同时盯着 BBU 有没有"误保护"------阶跃冲击下,一些采样滤波没做好的 BMS 会把正常瞬态电流当成过流,直接切断,那在真实机房就是一次非预期掉电。所以这层不是看它能不能放,是看它"在乱负载下稳住不抽风"。
第三层:并机均流层
单机测完还不算完。真实机柜群里是 N 台 BBU 并联挂在同一母线上,一起扛那台柜子的峰值。这时候就出来两个麻烦事:均流精度 和环流。
均流不平衡度一般要求 <5%,也就是说 10 台并联每台出力偏差不能太离谱,否则有的早放光有的还满着,整体备电时长被短板拖死。环流更阴------并联单元之间电压基准有细微差异,就会在彼此之间来回倒灌,不光白耗电还发热。
测试做法:拿多台 BBU 并联到同一条母线,拉总负载,分别采每台的输出电流,算均流不平衡度。再故意把其中一台搞"单点故障"(模拟通信断线或人为关掉),看剩下几台能不能平滑再分配电流、母线不掉坑。这一步模拟的是机房里某台 BBU 挂了,其余单元能不能顶上------真正决定可用性的就是这最后一个分支。
测试系统架构怎么搭
把上面三层串起来,一套像样的 BBU 单元测试台大致长这样:
几个关键件:
- 双向电源:既当电网给 BBU 充电,又能做源又能当载,省得再单独配充电机。像 KS983X 这类双向电源,充放电切换无间隙,做掉电接管测试时母线不会"塌"一下。
- 电子负载 :必须选回馈式。BBU 大倍率放电功率动辄上千瓦,耗散式负载那发热量能把测试间变蒸笼,空调都救不回来;回馈式直接把能量送回电网,省电还能 7×24 连轴转。8714 这类回馈电子负载做阶跃响应也够快,毫秒级拉载没问题。
- 温度采集:别只测环境温度,端子、连接片、壳体三处都得有,大倍率下极柱温升是安全边界。
- BMS 通信解析:CAN 或 PMBus 把 BBU 内部 SOC、单体电压、故障码读出来,跟外部仪表数据对齐,才能判断"它自己报的状态"和"我测到的真实量"一不一致。
几个关键参数汇总
|-------|--------------------|-------------|
| 测试项 | 关注参数 | 典型要求 |
| 大倍率放电 | 放电倍率 / 末端压降 / 端子温升 | 3C-5C,温升不超限 |
| 负载阶跃 | 瞬态电压偏差 / 恢复时间 | ±5% 内,毫秒级恢复 |
| 并机均流 | 均流不平衡度 / 环流 | <5%,无显著环流 |
为什么死磕回馈式负载
单独拎出来说,因为这点最容易被砍预算时牺牲掉。BBU 大倍率放电时,一台几百瓦到上千瓦的功率全灌进负载。如果用耗散式,全变成热,测试间温度失控不说,连续跑老化时电表里跳的字也肉疼。回馈式负载把能量逆变回电网,实测能效能到 90% 上下,长期跑下来电费和空调费都省回来,关键是能真刀真枪连轴测,不会因为"怕烧设备"而缩短测试时长------很多批次问题恰恰是长时间跑才暴露的。
踩过的坑
最后说几个现场翻车点,都是真金白银换来的:
- 只测稳态放电不测阶跃:实验室数据漂亮,上线遇到 GPU 负载跳变就母线抖动、GPU 电源报警。
- 只测单机不测并机:单体均流 OK,并联后环流把其中一台烤到保护,整体备电时间打折。
- 忽略 BMS 通信异常分支:测试时永远通信正常,但机房里 CAN 干扰、PMBus 超时是常态,BBU 在通信断了之后是"保持输出"还是"直接切断",这个分支不测,现场就是一次非预期掉电。
- 截止保护不验证末端动作:放到截止就停采,最后几百毫秒 MOS 怎么动作的完全未知,出事就在这。
把这三层(大倍率放电 / 负载阶跃 / 并机均流)按架构搭起来,再补上通信异常分支和末端动作验证,一套 BBU 备电单元的测试才算完整。嘉仕新能在新能源测试设备这块攒了不少这类机架供电测试的经验,上面提到的分层思路和坑位,基本都是跟客户一起在测试间里磨出来的。