基于特征指标降维与改进密度峰值聚类算法的异常用电行为辨识

郭贺宏 ,  任宇路 ,  姚俊峰 ,  肖春

太原理工大学学报 ›› 2026, Vol. 57 ›› Issue (2) : 309 -320.

PDF (2939KB)
太原理工大学学报 ›› 2026, Vol. 57 ›› Issue (2) : 309 -320. DOI: 10.16355/j.tyut.1007-9432.20240037
电气与动力工程(能源互联网专题)

基于特征指标降维与改进密度峰值聚类算法的异常用电行为辨识

作者信息 +

Identification of Abnormal Power Consumption Behavior Based on Dimensionality Reduction of Characteristic Index and Improved Density Peak Clustering Algorithm

Author information +
文章历史 +
PDF (3008K)

摘要

目的 为准确辨识用户的异常用电行为以降低电网的非技术性损失,提出一种基于线性判别分析(LDA)和改进密度峰值聚类(IDPC)算法的异常用电行为辨识模型。 方法 首先从用电数据中构造能反映用户用电行为的特征集;其次使用LDA对提取的特征集进行降维处理;然后使用IDPC算法对降维后的特征集进行聚类分析,将具有不同用电行为特征的用户聚类后再进行异常辨识;最后定义离群异常指数来描述降维后的特征集中用户的离群程度,最终模型输出所有用户用电行为的异常程度排序。针对密度峰值聚类(DPC)算法中截断距离需要人为设定的不足,定义邦费罗尼指数,并将改进的鲸鱼优化算法(IWOA)应用于DPC截断距离参数的优化。 结果 实验结果表明,文章所提出的模型只需检测异常程度较大的少数用户即可稽查出大部分异常用户,且相比其他模型具有更高的召回率与精确率。

Abstract

Purposes In order to accurately identify the abnormal power consumption behavior of power users and reduce the non-technical loss of power grid, an abnormal power consumption behavior identification model based on linear discriminant analysis (LDA) and improved density peak clustering (IDPC) algorithm is proposed. Methods First, a feature set was constructed from the power consumption data to reflect the power consumption behavior of users. Second, LDA was used to reduce the dimension of the extracted feature set. Then, IDPC algorithm was used to cluster the feature set after dimensionality reduction, and the users with different electricity behavior characteristics were clustered before abnormality identification. Finally, the outlier index was defined to describe the degree of user outlier in the feature set after dimensionality reduction, and the final model outputs the order of the degree of abnormality of all users’ electricity behavior. In this paper, in view of the deficiency that the truncated distance in the density peak clustering (DPC) algorithm needs to be set manually, the Bonferroni index was defined, and the improved whale optimization algorithm was applied to the optimization process of DPC truncated distance parameters. Results Experimental results show that the proposed model can detect most abnormal users only by detecting a small number of users with large degree of abnormality, and has higher recall rate and accuracy than those of other models.

Graphical abstract

关键词

数据挖掘 / 异常用电行为 / 特征降维 / 密度峰值聚类 / 鲸鱼优化算法

Key words

data mining / abnormal power consumption behavior / feature dimensionality redu-ction / density peak clustering / whale optimization algorithm

引用本文

引用格式 ▾
郭贺宏,任宇路,姚俊峰,肖春. 基于特征指标降维与改进密度峰值聚类算法的异常用电行为辨识[J]. 太原理工大学学报, 2026, 57(2): 309-320 DOI:10.16355/j.tyut.1007-9432.20240037

登录浏览全文

4963

注册一个新账户 忘记密码

电能的非技术性损失(non-technical loss,NTL)是指在电力系统中由于非技术因素造成的未能计入正常收入的损失1,这些因素与电力供应系统的技术运行和电力传输无关,而是源自于非法行为、计量不准确、欺诈或错误的运营管理等问题。其中窃电行为与计量装置故障是造成NTL的两大主要原因2。异常用电行为辨识是窃电检测、计量装置运行状态评价的重要内容,准确的辨识结果对于NTL的防控尤为重要,直接影响电力公司的经济利益和电力系统的供电质量。传统的异常用电行为辨识工作主要依赖于人工现场筛查,耗费人力且效率低下。近年来,人工智能的迅猛发展与智能电表的大规模普及应用为基于数据驱动的异常用电行为辨识提供了技术支持与数据来源3
有监督学习和无监督学习是基于数据驱动的两种学习方法。其中有监督学习需要有明确的数据标签(正常、异常)来指导模型学习,并根据这些标签进行训练和优化,基于分类与回归的异常检测方法属于典型的有监督学习。基于分类的异常检测方法主要通过大量带标签的数据集来训练分类器的分类精度;基于回归的异常检测方法研究实际用电量与模型预测用电量之间的差值来进行异常判别。无监督学习则是在未标注数据上寻找数据的内在结构和模式,由于训练数据缺乏标签信息,模型必须在没有指导的情况下自行学习数据的结构,典型的无监督学习包括聚类4、局部离群因子5 (local outlier factor,LOF)、孤立森林6等。分类模型先使用有监督学习算法对已标记的训练数据进行训练,然后利用训练好的分类器来对新的未标记数据进行预测,将其归为正常类别或异常类别。常用的异常用电检测分类模型有极限学习机7、支持向量机8、K近邻9和神经网络10等。分类模型非常依赖已知的异常标签,然而在实际场景中,很多异常是未知的且没有在训练数据中出现过,这使得基于分类的模型无法直接适用于未知异常检测。回归模型一般用于负荷预测、电价预测等。在异常检测领域,回归模型的目标是建立一个回归函数,通过对输入的用电量进行拟合来预测未来的用电量,通过比较实际值和预测值之间的差异来确定是否存在异常11。然而,基于回归的方法需要对每个电能表分别建立预测模型并调整超参数,会极大地占用计算资源,模型建立也十分耗时。
在实际的异常检测问题中,异常样本通常较正常样本比例小,导致了数据类别的不平衡性12。这样的不平衡分布会使得分类模型在训练过程中倾向于优化对多数类别的分类,使得少数类别的辨识准确率较低。而回归模型面对海量智能电表时,为每个电表建立预测模型将变得非常耗时,还会面临巨大的计算和存储资源挑战13。因此,本文重点研究不需要训练过程的无监督学习模型。基于聚类的异常辨识方法属于最典型的无监督学习,聚类模型首先对数据进行聚类操作,将数据样本划分为不同的群集,然后检测不属于任何群集或属于小群集的数据点作为异常值。K-means作为一种简单高效的聚类算法,其用于异常检测的效果很大程度上取决于聚类中心的选取。文献[14]通过均匀选择数据紧密区域并避免离群点区域,对K-means聚类算法的初始聚类中心选择过程进行了优化。近几年,基于密度聚类的方法逐渐成为异常检测问题的研究热点,文献[15]采用基于密度的带噪声空间聚类方法(density-based spatial clustering of applications with noise,DBSCAN)对三次指数平滑模型的预测电量与真实电量之间的残差进行聚类,从而检测出有异常的用电量值,实验结果表明其检测率和误报率等评价指标均优于LOF算法和支持向量机算法。然而DBSCAN方法的检测结果对参数取值十分敏感,而且需要确定邻域半径Eps和最小邻居数目minPts双参数,现阶段DBSCAN的参数主要根据人工经验进行选取,缺乏相应的参数选取理论。文献[16]采用LOF算法进行电力用户异常用电行为的挖掘,并采用网格技术提高算法效率,然而LOF算法并不适合检测包含多种用电行为的电力负荷。综上所述,考虑到用电行为的多样性和算法参数选取的便捷性,文章采用密度峰值聚类(density peak clustering,DPC)作为异常辨识模型的核心算法,基于改进鲸鱼优化算法对其参数进行寻优,利用离群异常指数判别数据中的离群点。文章按照特征集构造、特征降维、聚类分析、离群点检测的流程进行异常用电行为的辨识。

1 异常用电行为辨识流程

文章采用基于DPC的无监督学习方法进行异常用电行为辨识,其本质可以看作是高维特征经过降维处理后在低维空间的离群点检测问题17。具体的辨识流程如图1所示。

1) 数据预处理

首先将智能电表采集到的细粒度数据分别按日、按月进行累加,为接下来电力负荷数据的特征提取做好准备工作。

2) 特征工程

根据日、月用电量数据,从统计性指标、波动性指标、趋势性指标和相似性度量指标4个角度出发,构造能反应用户用电行为的特征指标集。为了在低维空间直观地展示用户的用电行为,采用特征降维方法对特征集进行降维处理,并通过评价指标对比了三种特征降维效果的优劣。

3) 参数寻优

根据DPC算法中的局部密度和相对距离定义邦费罗尼指数函数(bonferroni index, BI),并利用改进后的鲸鱼优化算法(whale optimization algorithm,WOA)求解其最大值,从而得到全局最优的截断距离参数。

4) 离群点检测

将降维后的特征作为DPC算法的输入,并引入平均向心距离和向心相对距离来计算数据对象的离群异常指数,输出用户离群度排序,并根据设定的阈值输出异常用户编号。

2 改进鲸鱼优化算法

在用密度峰值聚类算法进行离群点检测之前,需要利用优化算法对其截断距离参数进行寻优,从而避免人工确定参数的主观性。

2.1 鲸鱼优化算法原理

鲸鱼优化算法包含3个阶段:包围猎物,螺旋更新和随机搜索。首先,初始化鲸鱼种群大小N、最大迭代次数Tmax、以及种群中每个鲸鱼个体的位置信息Xi,定义决策系数p为介于[0,1]的随机数。系数向量 AC 计算方式如下:

A=2ar1-ar1r1C=2r2 .

其中,r1r2为介于[0,1]的随机向量;a为收缩包围机制中的线性收敛因子,随着迭代次数的增加从2线性减小到0,可表示为:

a=2×(1-t /Tmax) .

其中:t表示当前迭代次数;Tmax表示最大迭代次数。

1)包围猎物阶段。模拟座头鲸发现猎物并收缩包围的过程,此阶段p<0.5A<1。数学模型表示如下:

D1=CX*(t)-X(t) .
X(t+1)=X*(t)-AD1 .

式中:D1为鲸鱼个体与猎物间的距离;X(t)为鲸鱼个体的位置向量;X*(t)为当前全局最优鲸鱼的位置向量。

2)螺旋更新阶段。通过收缩包围机制和螺旋更新位置机制模拟座头鲸的气泡网攻击行为,此阶段p0.5。数学模型表示如下:

D2=X*(t)-X(t) .
X(t+1)=D2eblcos(2πl)+X*(t) .

式中:D2表示鲸鱼个体到猎物的距离;b是一个用于定义对数螺线形状的常数;l为介于[-1,1]的随机数。

3)随机搜索阶段。鲸鱼种群增加搜索范围,在全局空间探索最优解。在此阶段,p<0.5A1。数学模型表示如下:

Drand=CXrand-X(t) .
X(t+1)=Xrand-ADrand .

式中:Drand表示随机选取的鲸鱼到猎物的距离;Xrand表示从种群中随机选择的个体位置向量。

2.2 改进鲸鱼优化算法

为提升WOA对复杂函数求解寻优的能力,文章提出一种改进的鲸鱼优化算法(improved WOA, IWOA)。

1) 非线性变化收敛因子

公式(2)中的线性收敛因子影响着算法的全局搜索能力与局部开发能力。为此引入一种非线性收敛因子:

a*=2-2ln1+(e-1)tTmax .

2) 自适应概率阈值

为了模拟鲸鱼的气泡网攻击模式,鲸鱼优化算法设置搜索包围机制与螺旋更新位置机制等概率同时进行。即根据决策系数p的取值,算法分别有50%的概率选择式(4)中的模型和式(6)中的模型。然而这种等概率的选择方式会导致算法收敛速度慢且容易陷入局部最优解。为此引入自适应概率阈值代替等概率模型,数学模型表示如下:

p*=1-1α+βαtTmaxα+βtTmaxβ .

其中:αβ为控制参数,α=3β=2

3) 自适应位置权重

WOA算法没有考虑到随着迭代的进行,猎物对鲸鱼位置的更新的影响力存在差异。为此,引入一种自适应位置权重参数,对WOA中鲸鱼位置进行更新并赋予不同的权重,数学模型表示如下:

ω=1α+βαtTmaxα+βtTmaxβ .

其中:α=3β=2ω[0,1]

综上,改进后的WOA数学模型表示如下:

X(t+1)=ωX*(t)-AD1                    A<1,p<p* ,X(t+1)=ωXrand(t)-ADrand             A1,p<p* ,X(t+1)=D2eblcos(2πl)+(1-ω)X*(t)      pp* .

3 异常辨识模型

异常辨识模型包括负荷特征集的构造与维度规约、密度峰值聚类算法及其参数寻优、离群异常指数的定义、模型评价指标等部分。

3.1 特征集构造

负荷特征构造的目的是将复杂的用电行为转化为更易于分析和理解的形式,从而为后续的分析和检测提供基础。文章基于用户的日、月用电量数据构造了统计性指标、波动性指标、趋势性指标和相似性度量指标。

3.1.1 统计性指标

基于日用电量数据构造其均值、标准差、偏度、峰度4种特征指标。

3.1.2 波动性指标

1)每季度日用电量变异系数18,即每季度的日用电量标准差与日用电量均值之比。

2)月用电量率,即月平均用电量与月最大用电量之比。

3)月用电量峰谷差率19,即最大、最小月用电量之差与最大月用电量之比。

3.1.3 趋势性指标

1)月用电量数据的线性拟合斜率k

2)由日用电量数据的零滞后异同移动平均线(zero lag moving average convergence/divergence, ZLMACD)20计算得到的趋势指标。

ZLMACD指标克服了MACD具有滞后性的缺点,能够更及时地捕捉用电量数据的趋势强度和方向,其计算方式如下:

EMA(S,n)i=2n+1Si+1-2n+1EMA(S,n)i-1 .
ZLMA(S,n)=2EMA(S,n)-EMA(EMA(S,n),n) .
ZLDIF(S,(p,q))=ZLMA(S,p)-ZLMA(S,q) .
ZLMACD(S,(p,q,α))=EMA(ZLDIF(S,(p,q)),α) .
Tup=1C1i=1mmaxZLMACD(S,(p,q,α))i,0,Tdown=1C2i=1mminZLMACD(S,(p,q,α))i,0 .

其中:EMA(S,n)=EMA(S,n)i表示时间序列Sn日指数移动平均值序列;ZLMA(S,n)表示时间序列Sn日零滞后移动平均序列,设p<q,则ZLMA(S,p)ZLMA(S,q)分别表示快慢速零滞后移动平均序列;ZLDIF(S,(p,q))为差离值序列;ZLMACD(S,(p,q,α))为零滞后异同移动平均线指标;C1C2分别表示ZLMACD序列中大于零和小于零的数据点数;m表示用电量序列长度;TupTdown分别表示用电量序列的上升趋势指标和下降趋势指标。

3.1.4 相似性度量指标

用户月用电量数据与典型月用电量数据(所有用户月用电量的均值)的皮尔逊相关系数和欧氏距离。

3.2 特征集维度规约

由于构造的特征数量较多且某些特征之间包含重叠信息,具有很强的相关性。为了在低维空间直观地展示用户的用电行为并且提升算法效率,有必要对特征集进行降维处理。常用的降维方法包括主成分分析(principal component analysis, PCA)、因子分析(factor analysis, FA)和线性判别分析(linear discriminant analysis, LDA)。就模型的监督性而言,其中PCA和FA属于无监督学习模型,即不需要数据标签来学习。PCA主要关注数据的方差分布,使得投影后的数据具有最大的方差,由于不需要类别标签,在某些情况下可能无法很好地区分不同类别。FA专注于揭示观测数据背后的潜在结构,它假设数据是由潜在因素和随机误差组成的,其数学模型可以表示为X=AF+ε,其中 X 为原始数据矩阵, A 为因子载荷矩阵,F为公因子, AF为潜在因子,ε为残差矩阵。FA的目标是估计 AF以及ε,使得 X 能够被最好地重建。与PCA和FA不同,LDA是一种有监督学习模型,即需要明确数据的类别信息标签,需要明确指出的是,这里的标签是数据固有的类别标签,而非异常辨识的异常用户标签。LDA可以最大化不同类别之间的间距,同时最小化同一类别内部的差异。就模型可保留新特征的最大维度而言,PCA和FA降维后的新特征维度可以达到原数据的维度,而LDA降维后新特征维度最多为类别标签数减1。

特征值的贡献率(explained variance ratio, EVR)和累积贡献率(cumulative explained variance ratio, CEVR)是用来评估降维后的新特征对原始数据方差解释程度的指标。EVR衡量单个新特征的重要性,而CEVR则衡量多个新特征的综合重要性。一般CEVR达到85%即可较为全面地表达原始信息。文中使用这两个参数来确定模型保留新特征的维度。

3.3 密度峰值聚类算法原理

DPC算法是由Rodriguez等人于2014年提出的一种基于密度的聚类算法21,能够识别任意形状的簇且仅需确定唯一参数。DPC的核心思想基于两点假设:①在数据集中,聚类中心被局部密度较低的数据点所包围;②聚类中心与其他更高局部密度数据点的距离相对较远。基于这两点假设,根据以下几点定义来建立对DPC算法及其离群点检测功能的详细描述。

定义1 局部密度ρiρi表示数据点i在截断距离内包含的其他数据点的个数。其计算方式如下:

ρi=j=1nχdij-dc.

其中,n为数据点总数;χ(x)为指示函数,x<0时,χ(x)=1x0时,χ(x)=0dij表示数据点ij之间的欧氏距离;dc为截断距离,是DPC算法的唯一参数。

定义2 相对距离δiδi表示数据点i与局部密度比它大的数据点之间欧式距离的最小值。其计算方法如下:

δi=minj:ρj>ρidij .

对于整个数据集中ρi最大的点,将其δi设置为与其最远的数据点之间的欧式距离。

定义3 密度峰值点决策指标γiγi表示数据点i的局部密度与相对距离的乘积。其计算方法如下:

γi=ρiδi .

计算出每个数据点的局部密度和相对距离后,可以画出其δ-ρ决策图,密度峰值点具有更大的ρδ,处于决策图的右上角,可以通过决策指标γ的大小来确定密度峰值点(即聚类中心)。

根据上述定义,可以得到经典的DPC算法流程如下:

1)计算数据集中每个样本点和其余样本点的欧式距离矩阵D

2)根据D中的数据人工设置截断距离dc后,由式(18)、(19)求每个样本点的局部密度ρi和相对距离δi

3)画出数据集的δ-ρ决策图,并根据决策指标γi的大小选择聚类中心;

4)其余样本点被划分给最靠近的聚类中心簇;

5)ρ较小且δ较大的样本点可视为离群点。

图2为DPC算法原理图,包含一组二维数据分布图以及对应的δ-ρ决策图。黄蓝数据点分别为两个聚类簇,其中8号数据点和20号数据点分别为蓝色簇和黄色簇的聚类中心,即密度峰值点,其ρδ都很大,分布在决策图的右上角;红色点为离群点,其ρ较小δ较大,分布在决策图的左上方;其余点为正常数据点,分布在决策图的下方,δ较小。

3.4 改进密度峰值聚类算法

针对DPC算法中截断距离dc需要人工设置的不足,引入邦费罗尼指数22来度量决策指标集合γ1,γ2,,γN的分布情况,其中γ1γ2γN,数学表达式如下:

BI=1N-1i=1Nj=1iγj/j=1Nγj-i/Ni/N .

BI的大小主要受前几项密度峰值点的影响。将集合γ1,γ2,,γN中前m项对应的样本数据设置为密度峰值点,i[1,m]表示前i个聚类中心的累积决策指标相对于总体累积决策指标的贡献程度,其值越大,表示聚类中心包含着越多的信息量,聚类效果越好,此时BI的值也会越大。由式(18)~(21)可知,BI为dc的函数,求取BI取值最大时的dc即为最佳截断距离dc_best。其求解过程属于非确定多项式问题,文中采用改进鲸鱼优化算法进行迭代求解。

在离群点检测方面,可以初步将处于决策图左上方的数据点视为离群点。文献[23]根据δ-ρ决策图提出一种DPC算法的异常指数来度量数据点的离群程度,其计算方式如下:

ζi=δiρi+1 .

其中异常指数ζi的设定综合考虑了密度和距离两种因素。ζi越大,认为样本点离群程度越高,对应的电力用户发生异常用电行为的概率越大。然而,用户用电行为的多样性使得样本数据点经过聚类后被划分为几个聚类中心密度大小各异的簇,若在整个数据集上使用式(22)中的ζi来进行离群点检测,则高密度区域的局部离群点易被低密度区域的正常数据点淹没,从而影响离群点的检出率。通过改进ζi中的距离因素,使之更好地适用于检测包含多种不同密度簇的数据集。

定义4 平均向心距离davgjdavgj表示簇Cj中所有数据点与聚类中心距离之和的平均值。其计算方式如下:

davgj=1nxiCjdist(xμ,xi) .

其中:n表示簇Cj中数据点的总数;dist表示求两点间欧式距离的函数;xμ表示所属簇的聚类中心;xi表示簇Cj内的数据点。

定义5 向心相对距离dreljdrelj表示簇Cj内数据点的相对距离δi和平均向心距离davgj的比值。其计算方式如下:

drelj=δidavgj .

drelj放大了离群点在所属聚类簇中的离群特征,使得数据集中离群点的检测不受簇密度差异的影响,比δi更好地刻画了数据点的局部离群特性。

定义6 离群异常指数ζi*ζi*表示数据点向心相对距离drelj与数据点局部密度ρi的比值。其计算方式如下:

ζi*=dreljρi .

一般情况下,对于每一个簇的局部离群点而言,其向心相对距离会远大于正常点的向心相对距离。因此离群异常指数可以很好地描述样本数据的离群程度。

3.5 模型评价指标

异常用电行为辨识本质上是一个类别不平衡的二元分类问题,不平衡数据集使得模型存在高准确率误导问题,因此需要建立更为综合的模型评价体系来评估其性能的优劣。

3.5.1 混淆矩阵

混淆矩阵是评估二元分类模型性能的基础,基于混淆矩阵可以计算出各种评价指标,如召回率、精确率等,从而更全面地理解和分析模型的分类能力。混淆矩阵中包含了二分类问题的所有可能情况,将实际异常与实际正常用户分别设置为正例(Positive)和负例(Negative),如表1所示。

3.5.2 召回率和精确率

1) 召回率Recall

Recall=TPTP+FN×100% .

式中:TP表示模型预测和实际均为异常的用户数量;FN表示模型预测为正常,实际为异常的用户数量。召回率越大,表明模型正确检测出所有正例的能力越强。

2) 精确率Precision

Precision=TPTP+FP×100% .

式中:FP表示模型预测为异常,实际为正常的用户数量。精确率越高,表明模型预测为正例的样本中的误报率越低。

3.5.3 ROC曲线和AUC指标

受试者工作特性曲线(receiver operating characteristic curve, ROC)展示了模型在不同阈值下真正例率(true positive rate, TPR)与假正例率(false positive rate, FPR)之间的关系。ROC曲线的横轴表示FPR,纵轴表示TPR。在二维坐标上,每个阈值对应于ROC曲线上的一个点。模型的预测结果与实际情况不同时,阈值不同,从而影响TPR和FPR的值。

曲线下面积(area under curve, AUC)为一个数值指标,表示ROC曲线下方面积的大小,其范围在[0,1]之间,AUC值越接近1,说明模型在不同阈值下具有更好的能力区分正例和负例,AUC=1对应理想分类器。

4 算例分析

文章使用爱尔兰智能电表数据集进行实验分析,选取了6 400个用户535 d的用电量数据进行实验,采样间隔为30 min。用户数据分别来自5个台区(标记为1—5号)。该数据集用户数量较多,测量周期较长,用电行为多样化,适合用于异常用电行为辨识的研究。

4.1 异常用电模式构造

针对电力用户日用电量数据x=x1,x2,,x48构造了6种异常用电模式,具体如式(28)

f1(xt)=αxt             α=random(0.1,0.8)f2(xt)=ξtxt            ξt=random(0.1,0.8)f3(xt)=γtmean(x)  γt=random(0.1,0.8)f4(xt)=δtxt  δt=0    t[m,n]1     t[1,m][n,48]其中:mrandom[1,16),nrandom[16,48]f5(xt)=max((xt-Δ), 0)f6(xt)=0 .

式中:t表示每日异常时刻;Δ表示统一的削减量;f1()表示每日按固定比例因子减小用电量;f2()表示按随机的比例因子减小用电量,显然f1()f2()的一种特例;f3()表示计算用电量平均值后按随机比例因子减小用电量;f4()表示智能电表在一天某段时间内因故障无法上传量测数据的行为;f5()表示使一天中每一时刻的用电量都降低相同的数值,最小降低到零;f6()表示智能电表全天不上传量测数据的行为,f6()f4()的一种特例。

文章根据各个台区的用户数量进行了异常用户的设定,以保证在每个台区内异常用户的比例大致相同。每个异常用户的异常天数设定为区间[200,400]内的随机值。算例包含200个异常用户,在每个台区中都包含了之前提到的所有异常用电模式。

4.2 特征提取与维度规约

根据用户日、月用电量数据构造的反映用户用电行为的15维特征如表2所示。

由于提取的特征间存在较大的尺度差异,为了使得各个特征对模型辨识结果影响均衡,对提取的特征进行归一化处理,计算公式如下:

Xi=xi-xminxmax-xmin .

式中:xi表示第i个特征归一化之前的数值,Xi表示该特征归一化后的数值;xmaxxmin分别表示该特征的最大、最小值。

特征V5—V8表示全年4季度的用电量波动情况,将其权重系数设为0.25。

对提取的15维特征进行相关性分析,得到的相关性矩阵如图3所示。部分特征之间存在着信息重叠,具有明显的相关性。考虑到异常辨识模型的效率以及算法的可视化,需对特征集进行降维。文章分别采用PCA、FA、LDA三种降维模型对提取的15个特征集进行降维处理,并将得到的新特征按照贡献率大小进行排序。其中LDA模型的标签类别为台区号(标号1—5),故其新特征最多为4个。

表3截取了前8个贡献率较高的新特征。当新特征保留到3维时,PCA与LDA的CEVR分别为91.56%和99.89%,均能很好地表达原特征集的信息,而FA的CEVR仅为64.52%,通常CEVR需要达到85%才能较为全面地表达原始信息,所以FA只保留3维特征时会丢失原特征集的许多信息,不利于异常点的辨识。综合考虑特征的可视化与各个模型的CEVR,文章保留特征贡献率最高的三维特征。

4.3 实验结果分析

4.3.1 降维模型对比

采用降维后前三个贡献率最高的新特征来表示用户的用电行为,可以将所有用户的用电量曲线映射在三维空间中。根据图4中的决策图((d)、(e)、(f))可知,通过改进密度峰值聚类算法聚类后,三种降维模型的三维空间散点图均被分为三类。橙、绿、蓝三种颜色的点表示三类用户中的正常用户,红色点表示构造的异常用户。异常用电行为辨识的核心思想就是根据三维空间中数据点的局部密度和向心相对距离来判断每个用户的异常程度。根据决策图中数据点的异常概率来绘制ROC曲线并计算AUC指标,异常概率Pi 的计算方法如下:

Pi=δiδmaxρmax-ρiρmax .

式中:ρmax表示密度最大的聚类中心点的密度;δmax表示密度最大的聚类中心点的相对距离。异常概率Pi在用户间对比才有意义,其仅用于ROC曲线的绘制以及AUC指标的计算,并不作为判断用户异常程度的依据。图5表示评估三种降维模型的ROC曲线。其中LDA、PCA、FA对应的AUC指标分别为0.936 5、0.889 5、0.871 4。由此可见采用LDA模型将用电量数据映射到三维空间的效果最优。因此选用LDA模型进行异常辨识。

4.3.2 辨识结果分析

文中模型采用IWOA优化截断距离参数的DPC算法对LDA降维后的三维空间数据点进行聚类分析,并根据式(20)计算每个电力用户的离群异常指数ζ*图6为表示用户ζ*分布的帕累托图,黑色曲线为异常指数的累积比率,其中绝大多数用户的ζ*的值分布在[0,0.1],占到所有用户比例的近94%。很明显ζ*符合长尾分布,即异常用户分布在占比很小的长尾部,正常用户分布在占比很大的头部,故所提异常检测模型只需检测异常指数ζ*较大的用户即可稽查出大部分异常用户。长尾分布的拟合公式如下:

f(x)=cx-α-1 .

图6中红色曲线为ζ*分布的拟合曲线,其中参数值为:c=0.399 04α=-2.210 34。设定ζ*的异常辨识阈值为长尾分布的97%分位数,如果ζi*大于阈值,则判定该用户异常;如果ζi*小于阈值,则判定该用户正常。

为了验证模型中各个模块的有效性,对优化算法模块、特征降维模块和离群异常指数做部分消融实验。其中未使用IWOA算法确定截断距离参数的模型,其DPC截断距离取距离矩阵 D 中所有距离由小到大排列的2%位数。消融实验结果如表4所示,本文模型对每一聚类簇进行异常辨识的结果如图7所示。

可以发现,在特征降维方面,LDA在本文的异常辨识中相比PCA和FA有着绝对的优势,这是因为LDA作为一种有监督学习方法考虑了类别信息,在降维的过程中最大化类间差异,同时最小化类内差异,这是LDA模型在本文异常检测模型中表现优异的主要原因。在离群异常指数方面,其选择对模型的检测结果影响很大,实验结果表明所提的离群异常指数相比于文献[23]中的异常指数在离群点检测方面更具优越性,召回率和准确率都得到很大的提升。在DPC截断距离参数选择方面,使用IWOA寻优的参数相比于DPC传统参数设置方法具有更好的检测效果。

4.3.3 优化算法性能比较

为了验证对传统WOA改进的有效性,分别利用传统的WOA和文章提出的IWOA求解式(21)中的BI和对应的最佳截断距离dc_best。其中算法参数:最大迭代次数Tmax= 100,种群规模N=20,求解对比效果如图8所示。

在第2次迭代之后,WOA算法陷入了局部最优解。而本文提出的IWOA算法克服了传统WOA算法易陷入局部最优解的问题,在进行了31次迭代后达到了收敛状态。此时,BI值为3.638 9,截断距离为0.082 6。实验结果表明文章所提的IWOA算法在寻优过程中表现出色,具有更高的稳定性和求解精度。

5 结语

文章提出的异常用电行为辨识模型包括特征提取、特征降维、密度峰值聚类、离群异常指数计算等步骤。首先从用户用电量数据集中提取可以表征用户用电行为的多维特征;然后对比三种特征降维方法的效果;其次采用DPC算法将所有用户降维后的特征依据密度进行聚类,得到代表不同用电行为的多个密度峰值点;最后计算所有数据点的异常指数,并设定阈值判定异常用户。文章的主要贡献总结如下:

1)针对DPC算法中截断距离需要人工设置的不足,根据决策图中数据点的局部密度和相对距离定义邦费罗尼指数函数,并采用改进鲸鱼优化算法求解,以获取最优截断距离参数,使得优化算法具有更高的稳定性和求解精度。

2)针对高密度区域局部离群点容易被低密度区域正常数据淹没的问题,引入平均向心距离和向心相对距离来计算数据点的离群异常指数,更好地描述了局部离群点的离群特性,从而提升模型检出异常用户的性能。

参考文献

[1]

YORUKOGLU SNASIBOV FMUNGAN Met al.The effect of the types of network topologies on nontechnical losses in secondary electricity distribution systems[J].IEEE Transactions on Industry Applications201652(5):3631-3643.

[2]

YIP S CWONG KHEW W Pet al.Detection of energy theft and defective smart meters in smart grids using linear regression[J].International Journal of Electrical Power and Energy Systems201791:230-240.

[3]

朱天怡,艾芊,贺兴,.基于数据驱动的用电行为分析方法及应用综述[J].电网技术202044(9):3497-3507.

[4]

ZHU T YAI QHE Xet al.An overview of data driven electricity consumption behavior analysis method and application[J].Power System Technology202044(9):3497-3507.

[5]

张忠平,李森,刘伟雄,.基于快速密度峰值聚类离群因子的离群点检测算法[J].通信学报202243(10):186-195.

[6]

ZHANG Z PLI SLIU W Xet al.Outlier detection algorithm based on fast density peak clustering outlier factor[J].Journal on Communications202243(10):186-195.

[7]

林之岸,刘晟源,金伟超,.基于改进局部离群因子的低压用户用电隐患检测方法[J].电力系统自动化202246(1):130-138.

[8]

LIN Z ALIU S YJIN W Cet al.Detection method of hidden danger for power utilization of low-voltage users based on local outlier factor-boosting[J].Automation of Electric Power Systems202246(1):130-138.

[9]

李国成,陆俊,王赟,.基于Bagging二次加权集成的孤立森林窃电检测算法[J].电力系统自动化202246(2):92-100.

[10]

LI G CLU JWANG Yet al.Isolated-forest electricity theft detection algorithm based on Bagging secondary weighted ensemble[J].Automation of Electric Power Systems202246(2):92-100.

[11]

LI Y CQIU R XJING S T.Intrusion detection system using Online Sequence Extreme Learning Machine (OS-ELM) in advanced metering infrastructure of smart grid[J].PloS One201813(2):e0192216.

[12]

武玉坤,李伟,倪敏雅,.单类支持向量机融合深度自编码器的异常检测模型[J].计算机科学202249(3):144-151.

[13]

WU Y KLI WNI M Yet al.Anomaly detection model based on one-class support vector machine fused deep auto-encode[J].Computer Science202249(3):144-151.

[14]

ZOU D XXIANG Y JZHOU Tet al.Outlier detection and data filling based on KNN and LOF for power transformer operation data classification[J].Energy Reports20239(S7):9698-9711.

[15]

王炜韬,赵健,王小宇.基于对冲对抗机制与图注意力网络的异常用电检测[J].电力系统自动化202246(22):120-128.

[16]

WANG W TZHAO JWANG X Y.Abnormal electricity consumption detection based on hedge-antagonism mechanism and graph attention network[J].Automation of Electric Power Systems202246(22):120-128.

[17]

BIAN J HWANG LSCHERER Ret al.Abnormal detection of electricity consumption of user based on particle swarm optimization and long short term memory with the attention mechanism[J].IEEE Access20219:47252-47265.

[18]

王建元,张少锋.基于线性判别分析和密度峰值聚类的异常用电模式检测[J].电力系统自动化202246(5):87-98.

[19]

WANG J YZHANG S F.Anomaly detection for power consumption patterns based on linear discriminant analysis and density peak clustering[J].Automation of Electric Power Systems202246(5):87-98.

[20]

TIAN YSEHOVAC LGROLINGER K.Similarity-based chained transfer learning for energy forecasting with big data [J].IEEE Access20197:139895-139908.

[21]

左进,陈泽茂.基于改进K均值聚类的异常检测算法[J].计算机科学201643(8):258-261.

[22]

ZUO JCHEN Z M.Anomaly detection algorithm based on improved K-means clustering[J].Computer Science201643(8):258-261.

[23]

肖勇,郑楷洪,余忠忠,.基于三次指数平滑模型与DBSCAN聚类的电量数据异常检测[J].电网技术202044(3):1099-1104.

[24]

XIAO YZHENG K HYU Z Zet al.Power data anomaly detection based on Holt-winters model and DBSCAN clustering[J].Power System Technology202044(3):1099-1104.

[25]

庄池杰,张斌,胡军,.基于无监督学习的电力用户异常用电模式检测[J].中国电机工程学报201636(2):379-387.

[26]

ZHUANG C JZHANG BHU Jet al.Anomaly detection for power consumption patterns based on unsupervised learning[J].Proceedings of the CSEE201636(2):379-387.

[27]

孙毅,李世豪,崔灿,.基于高斯核函数改进的电力用户用电数据离群点检测方法[J].电网技术201842(5):1595-1606.

[28]

SUN YLI S HCUI Cet al.Improved outlier detection method of power consumer data based on gaussian kernel function[J].Power System Technology201842(5):1595-1606.

[29]

邓明斌,徐志淼,邓志飞,.基于多特征融合的窃电识别算法研究[J].计算机与数字工程201745(12):2398-2401,2414.

[30]

DENG MBXU Z MDENG Z Fet al.Study on stealing recognition model based on multi feature fusion[J].Computer & Digital Engineering201745(12):2398-2401,2414.

[31]

李军徽,张嘉辉,穆钢,.计及负荷峰谷特性的储能调峰日前优化调度策略[J].电力自动化设备202040(7):128-136,140.

[32]

LI J HZHANG J HMU Get al.Day-ahead optimal scheduling strategy of peak regulation for energy storage considering peak and valley characteristics of load[J] Electric Power Automation Equipment202040(7):128-136,140.

[33]

杨安,蒋群,孙钢,.基于金融技术指标的用电数据分析[J].计算机应用202242(3):904-910.

[34]

YANG AJIANG QSUN Get al.Power data analysis based on financial technical indicators[J].Journal of Computer Applications202242(3):904-910.

[35]

RODRIGUEZ ALAIO A.Clustering by fast search and find of density peaks[J].Science2014344(6191):1492-1496.

[36]

狄曙光,刘峰,孙建宇,.基于改进ABC和IDPC-MKELM的短期电力负荷预测[J].智慧电力202250(9):74-81.

[37]

DI S GLIU FSUN J Yet al.Short term power load forecasting based on improved ABC and IDPC-MKELM[J].Smart Power202250(9):74-81.

[38]

ZHENG K DCHEN Q XWANG Yet al.A novel combined data-driven approach for electricity theft detection [J].IEEE Transactions on Industrial Informatics201915(3):1809-1819.

基金资助

国网山西省电力公司科技项目(52051L230003)

AI Summary AI Mindmap
PDF (2939KB)

233

访问

0

被引

详细

导航
相关文章

AI思维导图

/