说好了要按时间线记录,那就老老实实按时间线写。
这家水泥厂在安徽宣城,年产能180万吨,主要设备是回转窑、辊压机、球磨机、斗提机和煤立磨。2024年初找到我们的时候,老板原话是"被非计划停机搞怕了,去年一年烧了400多万"。这个背景很重要------后面的很多决策都是基于这个痛点做的。
第1周:现场调研,别急着画大饼
我们一行四人到现场,住在厂区边上的招待所。白天跟设备副厂长、电气主管、运维班长各聊两小时,晚上翻厂里的设备档案。
第一周我发现三件事:
-
故障记录烂得一塌糊涂。他们有台账,但只记"故障"和"原因",没有停机时长、损失、维修细节。问运维班长"上次辊压机轴承坏了是几月份",他想了想说"好像是去年夏天"。这种数据质量,后面要打"数据治理"的硬仗。
-
关键设备只有电流表,没有振动。所有旋转设备------回转窑、辊压机、球磨机------都靠电控柜的电流信号做状态判断。电气主管说"我们以前装过振动传感器,被电磁干扰搞废了"。这就是个明确的技术坑,后面我们要重点解决。
-
管理层最关心的是回转窑和辊压机。球磨机和煤立磨他们能容忍停机(备用机多),但回转窑一停就是大事故,辊压机轴承坏了换一次要20多万。
第一周的结论:项目先聚焦回转窑(3台)和辊压机(2台)这两类设备,其余后面再说。
第2-4周:传感器布点与电磁干扰攻坚
回转窑是低速重载设备(转速1-3rpm),振动信号很难采。我们最后选了"温度+电流"双路------窑体表面温度监测(K型热电偶,每米一个点,共16个点)+ 主电机电流(霍尔传感器,量程0-200A)。
辊压机就简单了------轴承座装IEPE加速度传感器,每个轴承2个点(垂直+水平),共8通道。
电磁干扰问题怎么解决?电气主管说的"被搞废",我们后来一查,是他当年用了非屏蔽电缆。我们这次走的方案:
- 全用双屏蔽电缆(铜编织+铝箔)
- 传感器外壳单独接地,不要串到设备本体
- 数据采集站用工业级浪涌保护器(菲尼克斯 VAL-MS 230)
- 信号进采集卡前加软件滤波(中值滤波去尖刺)
python
# 我们的采集卡配置代码(PyDAQmx 驱动 + Python 3.10)
import PyDAQmx
from PyDAQmx.DAQmxFunctions import DAQmxCreateTask, DAQmxStartTask
task = DAQmxCreateTask("vib_acquisition")
DAQmxCreateAIVoltageChan(
task, "Dev1/ai0:7", # 8通道
"", DAQmx_Val_Diff, # 差分模式抗干扰
-5.0, 5.0,
DAQmx_Val_Volts, None
)
DAQmxCfgSampClkTiming(task, "OnboardClock", 25600.0, DAQmx_Val_Rising,
DAQmx_Val_FiniteSamps, 25600*10) # 10秒一帧
注意一个细节:差分模式比单端模式抗干扰能力高一个数量级,但接线要严格按规范。现场踩过的坑------一根传感器的信号线接反了,结果测出来的全是 -5V 反向饱和。
第2个月:第一次模型上线,差点翻车
第8周我们做了第一版模型------基于历史电流和温度数据,训练了一个XGBoost 1.7二分类器(正常/异常)。上线第一周,准确率96%,运维群里一片叫好。
第90天,模型开始大量误报------一周内报了47次"异常",现场去检查全是正常的。我去现场一看日志,傻了:第90天前后几天,厂里换了一批新钢球(辊压机研磨体更换),工况明显变了。
这不是模型的bug,是数据分布漂移(concept drift)。我们的训练数据全是"旧钢球"工况下的,模型没学过"新钢球"的特征分布。
紧急应对:
- 把近7天的报警全部回滚为"待观察"
- 收集"新钢球"工况下的数据重新训练(用了 3 天)
- 加了一个 KS 检验模块,每天对比训练数据和最新数据的分布,发现 p<0.05 自动告警"模型可能漂移"
python
from scipy.stats import ks_2samp
import numpy as np
def detect_drift(reference_data, current_data, threshold=0.05):
"""KS检验检测数据漂移"""
stat, p_value = ks_2samp(reference_data, current_data)
return p_value < threshold, p_value
# 每天凌晨2点跑一次
# 如果检测到漂移 → 自动用新数据 finetune 模型
这次踩坑之后,我们把"模型监控"列为系统的标配功能------没有漂移检测的预测性维护系统,都是在裸奔。
第4-5个月:回转窑专项攻坚
回转窑的预测性维护是公认的难题。它的转速极低(1-3 rpm),振动信号几乎没有诊断价值,温度监测是主力。但窑体温度梯度大(窑头1200℃,窑尾200℃),怎么从温度里识别"窑皮"(窑内耐火材料层)异常?
我们和华东理工的一位教授合作,用红外热成像+窑体表面温度阵列+窑电流,构建了一个"窑皮健康度"指标。简单来说:
- 正常情况下,窑体表面温度沿窑长方向是一条平滑曲线
- 窑皮局部脱落时,脱落段表面温度会突升 50-100℃
- 严重结圈时,特定区段温度会周期性波动(因为窑转动时结圈反复接触热气体)
这个模型上线后,第5个月成功预警了一次窑皮大面积脱落------比现场老师傅用"看火"判断提前了14个小时。老板亲自打电话来感谢,运维群里发了1000块红包。
这个案例让我相信:在工业现场,领域知识和数据建模结合,比任何一种"纯算法"都管用。
第6个月:组织配套和验收
技术上线只是开始。第6个月我们干了两件事:
一是给厂里培训"预测性维护运营岗"------选了2个年轻的电气工程师,每天上午10点和下午4点各看一次Grafana面板,确认报警、派工单、回填故障原因。一开始他们嫌烦("又多一项工作"),后来发现确实能提前发现问题,变成了主动看。
二是和厂里签了"持续优化"合同------模型上线后每月根据新故障数据做一次迭代优化,半年一次现场回访。这是预测性维护项目最容易被忽视的部分:模型不是一次性产品,是持续服务。
写在最后
整个项目半年下来,总投入是传感器+网关+工控机+软件系统合计65万。回报呢?半年内成功预警了 3 次重大故障(其中1次避免回转窑大修,节省约120万),减少非计划停机 67 小时。
说点得罪人的话:很多做预测性维护的同行,看到这个案例会觉得"我们算法比他们强",但其实真正难的是把这些技术在一个水泥厂的复杂现场稳定地跑起来------电磁干扰、数据漂移、运营配套、组织阻力,每一项都是硬骨头。
一点碎碎念:水泥厂这种重工业场景,最大的敌人不是设备,是"老师傅凭经验已经能解决大部分问题"。我们系统上线后,老师傅一开始是抵触的("你那个机器比我还准?")。后来几次成功预警打消了他们的疑虑,他们现在反过来会主动反馈"这台机子最近声音有点不对劲,你看看数据"。这才是真正的"人机协同"。
如果你正在做类似项目,可以把这篇手记当个参考------尤其是电磁干扰、模型漂移、组织配套这三块。不要怕出问题,怕的是出问题之后没有应对预案。半年下来的最大感悟:预测性维护是马拉松,不是百米冲刺。