产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:基于用电数据的污染企业环保工况异常识别方法
专利类型:发明专利
专利申请号:CN202210873793.2
专利申请(专利权)人:福州大学
权利人地址:福建省福州市闽侯县福州大学城乌龙江北大道2号福州大学
专利发明(设计)人:张逸,陈锦涛,姚文旭,张良羽
专利摘要:本发明提出一种基于用电数据的污染企业环保工况异常识别方法,通过在企业进线处安装用电监测装置,在环保设备处安装简易用电监测装置,先对企业内部生产工况进行监测,再将企业的生产工况结合企业环保设备的工况得到企业的环保工况。将环保工况作为标签,用电数据作为输入,放入到LightGBM中进行训练,根据特征重要度对用电数据进行筛。玫阶詈蟮钠笠祷繁9た鍪侗鹉P,对污染企业的环保工况进行识别。
主权利要求:
1.一种基于用电数据的污染企业环保工况异常识别方法,其特征在于,包括以下步骤:步骤S1:在涉污染企业电力进线处安装用电数据采集装置,采集企业的用电数据,在企业环保设备进线处安装用电终端,监测环保设备的启停工况;
步骤S2:对采集获得的用电数据中的三相总有功功率及各相有功功率四维数据进行K?means聚类,得到企业的生产工况;
步骤S3:利用步骤S2得到的企业生产工况,根据环保规则,结合环保设备工况得到企业的环保工况;
其中具体环保规则为:若生产正常,且环保设备同时启动,那么环保工况即为正常,当环保设备关闭,则视为异常,其中,生产设备关闭时视为环保工况正常;
步骤S4:将得到的企业环保工况作为结果,以基本电气数据、电能质量监测数据作为输入,放入到LightGBM中进行训练,调试参数,得到初步模型;
步骤S5:利用LightGBM中的特征重要度筛选重要数据,分别进行训练与测试,对比各项指标结果,得到最优的输入数据,作为最终模型;
步骤S6:将待评估的用电数据筛选后,输入到最终模型中,识别出污染企业环保工况异常的情况;
在步骤S1中,电力进线处用电数据采集装置采集的数据包括基本电气数据、电能质量数据和环保设备的工况;基本电气数据包括各相电压和电流有效值、各相有功、无功、视在功率与总功率;电能质量数据包括1?31次谐波电流均方根值与电流总谐波畸变率、1?31次谐波电压与电压总谐波畸变率、0.5?10.5次间谐波电压含有率、三相电压不平衡度、正序、负序、零序电流、电压、各相电压偏差、频率;每3min进行一次数据采集,一天24小时共得到
480个数据点;
步骤S4当中,LightGBM模型预测的步骤为:
步骤S401:设有n维用电数据x{x1,x2,…,xn},且对应的环保工况为y,初始化第一个弱学习器F0(x):其中,P(y=1|x)是训练样本中y=1的比例,y=1与y=?1分别代表企业环保工况正常与异常;
步骤S402:建立m棵分类回归树,对于i=1,2,…,n,计算m棵树对应的负梯度:步骤S403:对于i=1,2,…,n,利用CART回归树拟合数据(xi,xm,i),得到第m棵回归树,其对应的叶子节点区域为Rm,j,其中j=1,2,…,Jm且Jm为第m棵回归树叶子节点的个数;对于Jm个叶子节点区域j=1,2,…,Jm,计算出最佳拟合值:步骤S404:根据迭代公式:
得到最终的强学习器FM(x)的表达式:
得到两个分类的概率分别为:
步骤S405:通过以上计算,当得到的概率P?(x)大于0.5时,则模型预测为环保工况正常;
当得到的概率P+(x)大于0.5时,则模型预测为环保工况异常;
在步骤S5中筛选LightGBM特征重要度的步骤如下:步骤S501:将所有用电数据放入模型中进行一次训练,计算每一个特征数据的特征重要度;
步骤S502:特征的全局重要度通过特征在单颗树中的重要度的平均值来衡量:其中,M是树的数量;特征j在单颗树中的重要度的如下:其中,L为数的叶子节点数量,L?1即为树的非叶子节点数量,vt是和节点t相关联的特征, 是节点分裂之后平方损失的减少值;
步骤S503:对数据的特征重要度进行降序排列,筛选特征重要度排序前20,前40,前60,前80,前100项数据分别进行训练与测试,对比各项指标结果;
步骤S504:引入混淆矩阵与机器学习模型评价指标;所述混淆矩阵表示的是模型判断的环保工况正常与异常两种情况与其真实值的对比情况;其中TP表示模型正确识别出环保工况异常情景下的数量,TN表示模型正确识别出环保工况正常情景下的数量,FN表示模型错误识别出环保工况异常情景下的数量,FP表示模型错误识别出环保工况正常情景下的数量;在此基础上,进一步引入如下4个指标,准确率SACC、精确率SPRE、召回率SREC,SF1;公式如下:步骤S506:对比各项指标结果,取指标结果相对好的作为最终模型。
2.根据权利要求1所述的基于用电数据的污染企业环保工况异常识别方法,其特征在于:步骤S2中的K?means聚类包括以下步骤:
步骤S201:设用电数据中的三相总有功功率及各相有功功率为P:步骤S202:对P进行数据归一化,得到P',其具体归一化公式如下:步骤S203:采用K?means++算法得到2个初始的聚类中心;
步骤S204:计算P'中每个值到2个聚类中心的距离,采用欧式距离:步骤S205:将P'中每个值分配给离聚类中心最近的类别中;
步骤S206:计算每个类别中各维数据的平均值;
步骤S207:重复步骤S203?步骤S206,直到类别分配不变,得到两个聚类中心,其中聚类中心大的簇表示企业生产正在生产,聚类中心小的簇表示企业停止生产。 说明书 : 基于用电数据的污染企业环保工况异常识别方法技术领域[0001] 本发明属环保工程、大数据分析技术领域,尤其涉及一种基于用电数据的污染企业环保工况异常识别方法。背景技术[0002] 传统的环保监测,大多采用对企业的污染排放物进行化学含量检测。该方法并不能实时对企业的环保工况进行监测,只是不定期由监管部门进行对排放物的采样再进行分析,某些企业可能会为了应付检查而临时开启环保设备,这便失去了监测的真正意义。[0003] 而用电数据具有实时性高,维度高,可挖掘性强等特点,现有方案通过对企业内部各个生产设备与环保设备安装用电监测装置,通过对用电数据的分析判定设备的运行情况,进而监测企业的环保情况。该方案成本高,设计复杂,较为不便。[0004] 大数据分析技术、智能电网等的发展为负荷监测提供了更好的技术导向,采用非侵入式方法,通过对电力进线端的电压、电流、功率等数据进行分析,来达到对企业生产设备的工作情况检测检测。发明内容[0005] 考虑现有方案中,在企业内部的生产设备与环保设备进线处分别安装用电监测装置,监测其工况。但是企业内部设备众多,线路复杂,且安装多个电力监测装置与后期装置的维护太过消耗财力与人力,对企业的束缚较多,对企业的生产也有一定的影响。[0006] 本发明的目的在于提供一种基于用电数据的污染企业环保工况异常识别方法,采用非侵入式监测方案,成本低,安装简单,对企业影响小。同时,本发明能进一步筛选合适的数据对企业的环保工况进行识别,减少了数据维度,加快了识别速度,降低了数据存储成本,并且能针对不同企业筛选不同的特征数据得到不同的模型,对企业的环保工况进行识别。[0007] 本发明通过在企业进线处安装用电监测装置,在环保设备处安装简易用电监测装置,先对企业内部生产工况进行监测,再将企业的生产工况结合企业环保设备的工况得到企业的环保工况。将环保工况作为标签,用电数据作为输入,放入到LightGBM中进行训练,根据特征重要度对用电数据进行筛。玫阶詈蟮钠笠祷繁9た鍪侗鹉P,对污染企业的环保工况进行识别。[0008] 本发明利用大数据技术,解决环保监测问题,可以更有效地应用电力数据,为环保部门提供数据支持,寻求优化方案,提升监测效率,给环保部门的管理带来质的变化。进一步地,建立一套环保工况异常识别方法,可以加强企业与环保部门的联系,降低环保监测的困难程度,给企业环保设备的管理提供一些切实的建议,协调生态保护与生活生产的关系。[0009] 本发明具体采用以下技术方案:[0010] 一种基于用电数据的污染企业环保工况异常识别方法,其特征在于,包括以下步骤:[0011] 步骤S1:在涉污染企业电力进线处安装用电数据采集装置,采集企业的用电数据,在企业环保设备进线处安装用电终端,监测环保设备的启停工况;[0012] 步骤S2:对采集获得的用电数据中的三相总有功功率及各相有功功率四维数据进行K?means聚类,得到企业的生产工况;[0013] 步骤S3:利用步骤S2得到的企业生产工况,根据环保规则,结合环保设备工况得到企业的环保工况;[0014] 其中具体环保规则为:若生产正常,且环保设备同时启动,那么环保工况即为正常,当环保设备关闭,则视为异常,其中,生产设备关闭时视为环保工况正常;[0015] 步骤S4:将得到的企业环保工况作为结果,以基本电气数据、电能质量监测数据作为输入,放入到LightGBM中进行训练,调试参数,得到初步模型;[0016] 步骤S5:利用LightGBM中的特征重要度筛选重要数据,分别进行训练与测试,对比各项指标结果,得到最优的输入数据,作为最终模型;[0017] 步骤S6:将待评估的用电数据筛选后,输入到最终模型中,识别出污染企业环保工况异常的情况。[0018] 进一步地,在步骤S1中,电力进线处用电数据采集装置采集的数据包括基本电气数据、电能质量数据和环保设备的工况;基本电气数据包括各相电压和电流有效值、各相有功、无功、视在功率与总功率;电能质量数据包括1?31次谐波电流均方根值与电流总谐波畸变率、1?31次谐波电压与电压总谐波畸变率、0.5?10.5次间谐波电压含有率、三相电压不平衡度、正序、负序、零序电流、电压、各相电压偏差、频率;每3min进行一次数据采集,一天24小时共得到480个数据点。[0019] 进一步地,步骤S2中的K?means聚类包括以下步骤:[0020] 步骤S201:设用电数据中的三相总有功功率及各相有功功率为P:[0021][0022] 步骤S202:对P进行数据归一化,得到P',其具体归一化公式如下:[0023][0024][0025] 步骤S203:采用采用K?means++算法得到2个初始的聚类中心;[0026] 步骤S204:计算P'中每个值到2个聚类中心的距离,采用欧式距离:[0027][0028] 步骤S205:将P'中每个值分配给离聚类中心最近的类别中;[0029] 步骤S206:计算每个类别中各维数据的平均值;[0030] 步骤S207:重复步骤S203?步骤S206,直到类别分配不变,得到两个聚类中心,其中聚类中心大的簇表示企业生产正在生产,聚类中心小的簇表示企业停止生产。[0031] 进一步地,步骤S4当中,LightGBM模型预测的步骤为:[0032] 步骤S401:设有n维用电数据x{x1,x2,…,xn},且对应的环保工况为y,初始化第一个弱学习器F0(x):[0033][0034] 其中,P(y=1|x)是训练样本中y=1的比例,y=1与y=?1分别代表企业环保工况正常与异常;[0035] 步骤S402:建立m棵分类回归树,对于i=1,2,…,n,计算m棵树对应的负梯度:[0036][0037] 步骤S403:对于i=1,2,…,n,利用CART回归树拟合数据(xi,xm,i),得到第m棵回归树,其对应的叶子节点区域为Rm,j,其中j=1,2,…,Jm且Jm为第m棵回归树叶子节点的个数;对于Jm个叶子节点区域j=1,2,…,Jm,计算出最佳拟合值:[0038][0039] 步骤S404:根据迭代公式:[0040][0041] 得到最终的强学习器FM(x)的表达式:[0042][0043] 得到两个分类的概率分别为:[0044][0045][0046] 步骤S405:通过以上计算,当得到的概率P?(x)大于0.5时,则模型预测为环保工况正常;当得到的概率P+(x)大于0.5时,则模型预测为环保工况异常。[0047] 进一步地,在步骤S5中筛选LightGBM特征重要度的步骤如下:[0048] 步骤S501:将所有用电数据放入模型中进行一次训练,计算每一个特征数据的特征重要度;[0049] 步骤S502:特征的全局重要度通过特征在单颗树中的重要度的平均值来衡量:[0050][0051] 其中,M是树的数量;特征j在单颗树中的重要度的如下:[0052][0053] 其中,L为数的叶子节点数量,L?1即为书的非叶子节点数量,vt是和节点t相关联的特征, 是节点分裂之后平方损失的减少值;[0054] 步骤S503:对数据的特征重要度进行降序排列,筛选特征重要度排序前20,前40,前60,前80,前100项数据分别进行训练与测试,对比各项指标结果;[0055] 步骤S504:引入混淆矩阵与机器学习模型评价指标;所述混淆矩阵表示的是模型判断的环保工况正常与异常两种情况与其真实值的对比情况;其中TP表示模型正确识别出环保工况异常情景下的数量,TN表示模型正确识别出环保工况正常情景下的数量,FN表示模型错误识别出环保工况异常情景下的数量,FP表示模型错误识别出环保工况正常情景下的数量;在此基础上,进一步引入如下4个指标,准确率SACC、精确率SPRE、召回率SREC,SF1;公式如下:[0056][0057][0058][0059][0060] 步骤S506:对比各项指标结果,取指标结果相对好的作为最终模型。[0061] 相比于现有技术,本发明及其优选方案提供的:[0062] (1)提出了一种对企业生产工况进行非侵入式监测的方法,能够识别企业的生产设备的工作情况。[0063] (2)建立了一种识别企业环保工况异常的模型,能够对企业内环保工况异常时段与正常时段进行区分。[0064] (3)对用电数据进行筛。圆煌笠低ü秆∈萁斜冉,能够建立更为适合该企业的环保工况异常识别模型。[0065] (4)采用以上算法与模型,实现了对企业生产工况的监测与环保工况异常的识别,并给环保部门提供数据支持。[0066] 提出一种新的污染企业环保工况异常识别方法,区别于传统的排放末端化学物质含量检测,通过对企业用电数据分析,得到企业生产工况;通过将企业生产工况与环保设备工况结合得到企业环保工况;通过特征重要度对用电数据进行筛。玫礁邮屎掀笠档幕繁9た鍪侗鹉P。[0067] 其有益效果包括:将企业生产工况与环保设备工况结合得到企业环保工况,更好地直观地衡量企业的环保情况,为环保部门提供数据支持;针对不同企业,通过特征重要度能够筛选更加合适的数据,作为环保工况识别模型的输入数据。附图说明[0068] 下面结合附图和具体实施方式对本发明进一步详细的说明:[0069] 图1为本发明实施例总体流程示意图;[0070] 图2为本发明实施例环保工况生成示意图。具体实施方式[0071] 为让本专利的特征和优点能更明显易懂,下文特举实施例,作详细说明如下。[0072] 应该指出,以下详细说明都是示例性的,旨在对本申请提供进一步的说明。除非另有指明,本文使用的所有技术和科学术语具有与本申请所属技术领域的普通技术人员通常理解的相同含义。[0073] 需要注意的是,这里所使用的术语仅是为了描述具体实施方式,而非意图限制根据本申请的示例性实施方式。如在这里所使用的,除非上下文另外明确指出,否则单数形式也意图包括复数形式,此外,还应当理解的是,当在本说明书中使用术语“包含”和/或“包括”时,其指明存在特征、步骤、操作、器件、组件和/或它们的组合。[0074] 如图1、图2所示,本发明提供的基于用电数据的污染企业环保工况异常识别方法,具体包括以下步骤:[0075] 步骤S1:在涉污染企业电力进线处安装用电数据采集装置,采集企业的用电数据,在企业环保设备进线处安装用电终端,监测环保设备的启停工况。[0076] 其中,电力进线处用电数据采集装置采集的数据包括基本电气数据、电能质量数据和环保设备的工况。基本电气数据包括各相电压(电流)有效值、各相功率与总功率(有功、无功、视在)。电能质量数据包括1?31次谐波电流均方根值与电流总谐波畸变率、1?31次谐波电压与电压总谐波畸变率、0.5?10.5次间谐波电压含有率、三相电压不平衡度、正序、负序、零序电流、电压、各相电压偏差、频率。每3min进行一次数据采集,一天24小时共得到480个数据点。[0077] 步骤S2:对采集获得的用电数据中的三相总有功功率及各相有功功率四维数据进行K?means聚类,得到企业的生产工况。[0078] 步骤S3:利用步骤S2得到的企业生产工况,根据环保规则,结合环保设备工况得到企业的环保工况。[0079] 其中具体环保规则为:若生产正常,且环保设备同时启动,那么环保工况即为正常,当环保设备关闭,则视为异常,其中,生产设备关闭时视为环保工况正常。[0080] 步骤S4:将得到的企业环保工况作为结果,以基本电气数据、电能质量监测数据作为输入,放入到LightGBM中进行训练,调试参数,得到初步模型。[0081] 步骤S5:利用LightGBM中的特征重要度筛选重要数据,分别进行训练与测试,对比各项指标结果,得到最优的输入数据,作为最终模型。[0082] 步骤S6:将待评估的用电数据筛选后,输入到最终模型中,识别出污染企业环保工况异常的情况。[0083] 进一步的,步骤S2中的K?means聚类包括以下步骤:[0084] 步骤S201:设用电数据中的三相总有功功率及各相有功功率为P:[0085][0086] 步骤S202:对P进行数据归一化,得到P',其具体归一化公式如下:[0087][0088][0089] 步骤S203:采用采用K?means++算法得到2个初始的聚类中心;[0090] 步骤S204:计算P'中每个值到2个聚类中心的距离,采用欧式距离:[0091][0092] 步骤S205:将P'中每个值分配给离聚类中心最近的类别中;[0093] 步骤S206:计算每个类别中各维数据的平均值;[0094] 步骤S207:重复步骤S203?S206,直到类别分配不变,得到两个聚类中心,其中聚类中心大的簇表示企业生产正在生产,聚类中心小的簇表示企业停止生产。[0095] 进一步的,步骤S4当中,LightGBM模型预测的步骤为:[0096] 步骤S401:设有n维用电数据x{x1,x2,…,xn},且对应的环保工况为y,初始化第一个弱学习器F0(x):[0097][0098] 其中,P(y=1|x)是训练样本中y=1的比例,y=1与y=?1分别代表企业环保工况正常与异常;[0099] 步骤S402:建立m棵分类回归树,对于i=1,2,…,n,计算m棵树对应的负梯度:[0100][0101] 步骤S403:对于i=1,2,…,n,利用CART回归树拟合数据(xi,xm,i),得到第m棵回归树,其对应的叶子节点区域为Rm,j,其中j=1,2,…,Jm且Jm为第m棵回归树叶子节点的个数;对于Jm个叶子节点区域j=1,2,…,Jm,计算出最佳拟合值:[0102][0103] 步骤S404:根据迭代公式:[0104][0105] 得到最终的强学习器FM(x)的表达式:[0106][0107] 得到两个分类的概率分别为:[0108][0109][0110] 步骤S405:通过以上计算,当得到的概率P?(x)大于0.5时,则模型预测为环保工况正常;当得到的概率P+(x)大于0.5时,则模型预测为环保工况异常。[0111] 进一步的,步骤S5中筛选LightGBM特征重要度的步骤如下:[0112] 步骤S501:将所有用电数据放入模型中进行一次训练,计算每一个特征数据的特征重要度;[0113] 步骤S502:特征的全局重要度通过特征在单颗树中的重要度的平均值来衡量:[0114][0115] 其中,M是树的数量;特征j在单颗树中的重要度的如下:[0116][0117] 其中,L为数的叶子节点数量,L?1即为书的非叶子节点数量,vt是和节点t相关联的特征, 是节点分裂之后平方损失的减少值;[0118] 步骤S503:对数据的特征重要度进行降序排列,筛选特征重要度排序前20,前40,前60,前80,前100项数据分别进行训练与测试,对比各项指标结果;[0119] 步骤S504:引入混淆矩阵与机器学习模型评价指标;所述混淆矩阵表示的是模型判断的环保工况正常与异常两种情况与其真实值的对比情况;其中TP表示模型正确识别出环保工况异常情景下的数量,TN表示模型正确识别出环保工况正常情景下的数量,FN表示模型错误识别出环保工况异常情景下的数量,FP表示模型错误识别出环保工况正常情景下的数量;在此基础上,进一步引入如下4个指标,准确率SACC、精确率SPRE、召回率SREC,SF1;公式如下:[0120][0121][0122][0123][0124] 步骤S506:对比各项指标结果,取指标结果相对好的作为最终模型。[0125] 以上所述,仅是本发明的较佳实施例而已,并非是对本发明作其它形式的限制,任何熟悉本专业的技术人员可能利用上述揭示的技术内容加以变更或改型为等同变化的等效实施例。但是凡是未脱离本发明技术方案内容,依据本发明的技术实质对以上实施例所作的任何简单修改、等同变化与改型,仍属于本发明技术方案的保护范围。[0126] 本专利不局限于上述最佳实施方式,任何人在本专利的启示下都可以得出其它各种形式的基于用电数据的污染企业环保工况异常识别方法,凡依本发明申请专利范围所做的均等变化与修饰,皆应属本专利的涵盖范围。
专利地区:福建
专利申请日期:2022-07-21
专利公开日期:2024-11-29
专利公告号:CN115291006B