基于TPE和注意力机制神经网络的风速数据插补

林秋爽 ,  邵鹏 ,  鲍旭明 ,  赵辉

信阳师范大学学报(自然科学版) ›› 2026, Vol. 39 ›› Issue (2) : 264 -270.

PDF (1360KB)
信阳师范大学学报(自然科学版) ›› 2026, Vol. 39 ›› Issue (2) : 264 -270. DOI: 10.3969/j.issn.2097-583X.2026.02.013
应用技术研究

基于TPE和注意力机制神经网络的风速数据插补

作者信息 +

Wind speed data imputation based on TPE and attention mechanism neural network

Author information +
文章历史 +
PDF (1392K)

摘要

针对实际监测中频发的数据缺失问题,须采用高精度插补方法,以保障监测及后续分析的可靠性。为此提出了一种基于树结构帕森估计器(Tree-structured Parzen Estimator, TPE)的双注意力机制循环神经网络模型(TPE Double Attention-Recurrent Neural Network, TDA-RNN),旨在解决连续风速数据缺失的插补问题。通过引入TPE优化算法,自动选择并优化模型的关键超参数。同时,注意力机制能够有效地挖掘缺失数据的特征信息。利用得克萨斯理工大学现场实测的下击暴流风速数据进行数值验证。结果表明,与传统神经网络相比,TDA-RNN模型显著提升了数据插补精度。当多段数据连续损失时,数据插补误差指标的均方根误差(RMSE)、平均绝对误差(MAE)和平均绝对百分比误差(MAPE)分别为0.72、0.64和5.65%,表现出TDA-RNN模型较高的数据插补精度和鲁棒性。

Abstract

To address the frequent issue of missing data in practical monitoring scenarios, high-accuracy imputation methods were required to ensure the reliability of monitoring and subsequent analysis. Therefore, a novel TPE Double Attention-Recurrent Neural Network (TDA-RNN) model was proposed, which integrated the Tree-structured Parzen Estimator (TPE) and attention mechanisms, aiming at imputing continuous missing wind speed data. By introducing the TPE optimization, the key hyperparameters of the model could be automatically optimized and selected. Meanwhile, the attention mechanisms could effectively capture feature information from the missing data. The model was validated using downburst wind speed data collected from field measurements at Texas Tech University. The results showed that, compared to traditional neural networks, the TDA-RNN model significantly improved imputation accuracy. When multiple segments of data were continuously missing, the root mean square error (RMSE), mean absolute error (MAE), and mean absolute percentage error (MAPE) of the data interpolation error index reached 0.72, 0.64 and 5.65%, respectively, demonstrating the high accuracy and robustness of the TDA-RNN model for data imputation.

Graphical abstract

关键词

风速 / 插补 / 注意力机制 / 树结构帕森估计器(TPE) / TPE优化 / 双注意力机制循环神经网络(DA-RNN)

Key words

wind speed / imputation / attention mechanisms / tree-structured parzen estimator(TPE) / TPE optimization / double attention-recurrent neural network (DA-RNN)

引用本文

引用格式 ▾
林秋爽,邵鹏,鲍旭明,赵辉. 基于TPE和注意力机制神经网络的风速数据插补[J]. 信阳师范大学学报(自然科学版), 2026, 39(2): 264-270 DOI:10.3969/j.issn.2097-583X.2026.02.013

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

结构健康监测(SHM)在大型复杂结构中具有广泛的应用前景。传感器技术与机器学习的结合使得当前监测数据和无损检测信息能够有效支持对建筑结构可靠性的定量评估1-3。相比传统的人工定期检测,基于传感器的SHM系统更能够提供连续、客观且数据驱动的结构状态监测。随着工程系统对传感器网络依赖的加深,传感器健康管理的有效性变得愈发重要4

然而,传感器或数据采集/传输系统的故障以及SHM供电问题常导致风速监测数据的缺失,从而影响结构系统可靠性评价的准确性及风险管理决策的有效性5-7。因此,提升风速监测数据的完整性和可用性,通过数据重建恢复缺失数据,成为研究热点8

针对风速数据连续缺失问题,研究者提出了多种基于不完整信号残差信息的重建方法。ZHANG等9通过结构应力实测数据的相关性分析,采用线性回归方法估计缺失数据;林秋爽等10将缺失数据重建转化为在线损伤诊断任务;KULLAA等11基于传感器数据协方差,采用最小均方误差(MMSE)方法预测缺失值;PASPARAKIS等12借鉴压缩采样/传感算法中的信号重建策略,成功恢复了短期连续缺失的SHM风速记录13-14

为解决观测区域内一个或多个测点风速数据完全缺失或无历史监测数据的问题,LIN等15基于测点空间相关性,提出了一种利用Kriging模型的时序空间插补方法,并进一步设计了二次校正策略,以提升风速序列极端值的恢复精度。ZAPATA-SIERRA等16采用小波变换解决风速数据缺失问题。MARTINEZ-LUENGO等17提出一种新的噪声净化和后验缺失数据插补方法。

针对SHM系统中风速数据的连续缺失问题,本文融合树结构帕森估计器(Tree-structured Parzen Estimator, TPE)优化与注意力机制神经网络,提出双注意力机制循环神经网络模型(TPE Double Attention-Recurrent Neural Network, TDA-RNN)数据插补模型。采用2008年6月19日得克萨斯理工大学现场实测的下击暴流风速数据18进行数据插补计算。数值算例验证了所提模型具有较高的插补精度。

1 基于TPE的TDA‑RNN模型搭建

1.1 DA‑RNN模型

传统递归神经网络(RNN)在处理长序列数据时,存在梯度消失或爆炸问题。为解决这个问题,相关学者引入序列到序列模型(Seq2Seq),如图1所示。Seq2Seq模型包括编码和解码两个阶段,各阶段均由RNN组成。

Seq2Seq模型在编码和解码阶段,采用传统注意力机制对权重分配做均等处理,没有考虑各变量的特征贡献度。QIN等19对传统注意力机制做出改进,通过自适应选择输入并根据数据特征赋予权重,解决权重分配不合理的问题。同时,将Seq2Seq与改进的注意力机制相结合,提出了DA-RNN(Double Attention-RNN)模型。该模型的编码器和解码器中改进的注意力机制,分别称为输入注意力机制和时间注意力机制20

给定n个输入驱动序列xk=(x1k,,xtk,,xTk)TRTk=1,,n),并给定目标序列的历史数据(y1,,yT-1)T为时间步长。DA-RNN模型建立目标值y^T与输入的非线性映射关系y^T=F(y1,,yT-1,x1,,xk)。在输入阶段,采用输入注意力机制,根据当前隐藏状态自适应地选择与插补数据最相关的输入作为特征,赋予其更高的权重。具体如图2所示。

根据前一个编码器隐藏状态ht-1和LSTM单元状态st-1,计算注意权值αtk。其中 veRTWeRT×2mUeRT×T是需要学习的参数,

etk=veTtanh(We[ht-1;st-1]+Uexk),
αtk=exp(etk)/i=1nexp(etk)

利用上述注意权值,自适应地提取驱动序列:

x˜t=(αt1xt1,αt2xt2,,αtnxtn)T,

t时刻的隐藏状态更新为:

ht=f1(ht-1,x˜t),

为预测输出,采用LSTM对编码后的输入信息进行解码。解码阶段采用时间注意力机制,通过前一个解码器隐藏状态dt-1和LSTM单元状态st-1',计算t时刻解码器隐藏状态的注意权值βti,并经过解码器计算得到最终输出y^T

lti=vdTtanh(Wd[dt-1;st-1']+Udhi),
βti=exp(lti)/j=1Texp(ltj)

1.2 TPE优化

TPE是一种基于贝叶斯思想的优化算法,核心思想是通过Parzen估计器进行概率密度建模,并指导参数搜索,确定最优解。TPE通过估计概率密度函数预测可能的最优解,在处理高维搜索空间和复杂依赖关系时,较传统贝叶斯优化中的高斯模型性能更加优越。

1.3 TDA‑RNN模型

DA-RNN模型通过人为选择内部超参数来确定模型尺寸。由于人为选择通常依据经验,需要花费大量时间,且模型性能未必达到最佳。为解决此问题,将TPE优化和DA-RNN结合(称为TDA-RNN模型),采用优化算法高效选取模型超参数。

DA-RNN模型的常规超参数包括时间步长T、编码器隐藏维度m和解码器隐藏维度p。TDA-RNN模型扩展了超参数优化范围,新增批大小y、学习率L和训练轮次e。扩展超参数优化范围较大程度地避免了经验取值的局限性,提升了建模效率,实现模型尺寸更加精准和科学地调节。

确定超参数取值后,TPE优化算法计算目标函数值(即数据插补模型结果的均方误差MSE),并建立概率密度函数,根据评估结果最小化MSE收缩超参数搜索空间,自适应调整超参数取值,逐步逼近最优超参数,直至满足收敛判据或达到预设的MSE性能阈值。MSE公式为:

MSE=1Ni=1N(yi-y^i),

式中:yiy^i分别为数据真实值和模型插补值,N为样本数。

优化算法的融入提高了超参数选取效率,而且增强了模型对复杂数据特征的适应与捕捉能力。深度学习模型能够充分利用数据特性进行自适应建模,模型更加科学和可靠。TDA-RNN模型通过建立超参数选取与数据特征的动态适应机制,实现了模型参数优化效率与性能的双重提升,显著提高了数据插补精度。

1.4 TDA‑RNN模型算法流程

图3为TDA-RNN模型的流程图,左侧描述了TPE算法流程,右侧展示了TDA-RNN中数据插补流程。

算法流程具体步骤如下:

第一阶段:初始化

1) 针对TDA-RNN模型的超参数给定搜索范围,并随机设定多组初始值。

2) 将原始数据分为训练集和测试集。利用训练集来训练当前超参数取值下的TDA-RNN模型,并计算目标函数值(即模型的性能指标MSE)。

第二阶段:迭代优化

1) 根据目标函数的分位数阈值划分好集和坏集,构建概率模型,根据概率模型生成候选超参数。

2) 根据候选超参数得到新的TDA-RNN模型,训练模型并计算目标函数值(即模型的性能指标MSE),更新概率模型,根据概率模型生成新的候选超参数。重复迭代计算。

第三阶段:优化终止

模型性能指标MSE收敛,且迭代次数n=nmax,结束循环,获取最优超参数。

第四阶段:性能测试

基于最优超参数构建最终TDA-RNN模型,使用测试集数据评估模型性能。

2 数值算例

用于插补计算的计算机配置为Python 3.6,PyTorch 1.12,NVIDIA GeForce GTX 4060 Laptop GPU,2.20 GHz CPU i9-14900HX,32 GB RAM, Windows 11。

2.1 数据集

采用得克萨斯理工大学现场实测的下击暴流风速数据集,传感器观测点位置如图4所示。各观测点数据采样频率为1 Hz,时长为1800 s。

定义两种案例如下:

案例1为单段连续损失,即观测点P5的风速数据在1408~1457 s损失,如图5所示。采用观测点P1、P2、P3和P4完整的风速数据,插补P5的损失数据。

案例2为多段连续损失,即观测点P8的风速数据在720~800 s和1250~1300 s发生损失,如图6所示。采用观测点P4、P6、P9的完整风速数据,插补P8的损失数据。

以案例1为例,采用1~1407 s的P1—P5的风速数据作为训练集,1408~1457 s的P1—P5的风速数据作为测试集。模型输入为P1—P4的风速数据,输出为P5的风速数据。

2.2 评价指标

采用均方根误差(RMSE)、平均绝对误差(MAE)和平均绝对百分比误差(MAPE)作为数值算例中数据插补精度的评价指标。评价指标的计算公式如下:

RMSE=1Ni=1N(yi- y^i)2,
MAE=1Ni=1N|yi- y^i|,
MAPE=1Ni=1N1Ni=1N|yi- y^i|/yi×100%,

式中:yiy^i分别表示风速数据真实值和模型插补值,N为样本数。

2.3 超参数设置

引入TPE算法进行超参数优化。具体优化的超参数为时间步长T、编码器隐藏维度m、解码器隐藏维度p、批处理大小y、学习率L和训练轮次eT的搜索范围为[2,10];mp的搜索范围为[8,256];y、Le的搜索范围分别为[1,200]、[1×10-4,1×10-3]和[100,500]。TPE优化算法的迭代次数n设置为100。

针对案例1和案例2,采用TPE优化初步确定了两组最优超参数,分别称为参数1和参数2(见表1)。

随后,根据参数1和参数2分别确定两个TDA-RNN模型,依次用于上述两个案例的插补。效果对比见图7图8。由图7图8可以看出,由参数1确定的TDA-RNN模型所获得的插补值与真实值更加吻合。

表2表3分别展示了参数1和参数2确定的模型在两个案例中的数据插补误差指标。

可以看出,相比参数2确定的TDA-RNN模型插补误差指标,参数1确定的TDA-RNN模型插补误差指标RMSE、MAE和MAPE大部分情况下更小。因此得出结论,参数1确定的TDA-RNN模型插补性能更优,有更好的泛化能力。因此,选择参数1作为最终的模型超参数取值。

3 插补结果与分析

3.1 对比模型介绍

为了更加全面地验证TDA-RNN模型的有效性,并更清晰地展示其在数据插补方面的优势,将3种常用的深度学习网络(卷积神经网络(Convolutional Neural Networks,CNN)、RNN和人工神经网络(Artificial Neural Network,ANN)),与本文提出的TDA-RNN模型进行对比分析。通过对比,进一步验证本文提出模型在处理时间序列插补任务时的有效性和优越性,采用第2节中案例1和案例2进行插补性能对比。

3.2 插补结果分析

图9展示了案例1所提出的模型与3个对比模型的插补结果。其中,黑色曲线表示真实值,红色曲线表示TDA-RNN模型的插补值,蓝色曲线表示CNN模型的插补值,绿色曲线表示RNN模型的插补值,紫色曲线表示ANN模型的插补值。可以看出,ANN模型的插补效果最差,RNN和CNN模型的效果次之,TDA-RNN模型的插补结果与真实值最吻合。

图10图11详细对比了案例2中多段数据缺失时4种模型的插补恢复效果。图中清晰地显示红色曲线与黑色曲线最为吻合,说明TDA-RNN模型的插补效果明显优于其他神经网络模型。

插补结果图通过直观对比各模型应对数据缺失任务时的插补表现差异,凸显了TDA-RNN模型的性能优势。为量化评估数据插补效果,这里再次引入2.2节中的评价指标进行误差对比分析。

表4展示了各模型在案例1和案例2中的插补误差指标,其中TDA-RNN模型的插补效果最优,相较于其他3种方法,其各项误差指标均为最小。以复杂数据缺失场景(案例2)为例,TDA-RNN模型相对传统RNN模型的性能优势最为显著, RMSE降低30.77%,MAE降低24.71%,MAPE 降低26.14%。同时,TDA-RNN模型与CNN、ANN模型相比,RMSE分别降低20%和19.1%。提出的模型精度明显优于传统模型。

通过分析证实,TDA-RNN模型通过融合超参数优化机制TPE,有效解决了原模型超参数选择困难的问题,提供了更科学的超参数确定方法。注意力机制与Seq2Seq模型的融合能够在风场时间序列插补中实现更优效果,即通过权重重新分配机制,相邻风速中的重要信息得以更有效提取,从而提升插补精度。数值算例中TDA-RNN效果显著优于CNN、RNN和ANN模型,验证了TPE和注意力机制的引入不仅有效提高了模型构建效率,而且提高了模型的插补恢复性能。

4 结束语

提出了一种新的数据插补模型TDA-RNN,通过将TPE优化和DA-RNN模型融合,提升了数据插补性能。具体而言,该模型充分发挥了TPE高效选取参数的优势,有效地解决了DA-RNN模型在超参数选择与优化上的固有难题,最大程度发挥了DA-RNN模型的优势。这一改进不仅显著提升了模型的运算效率,还大幅度缩短了数据处理所需的时间,为实际应用中的快速响应和高效处理提供了有力支持。

此外,通过采用现场实测的下击暴流风速数据进行验证,发现TDA-RNN模型在应对风场数据中不可避免的连续缺失问题上,展现出卓越的信息恢复能力。该模型强大的特征提取能力在处理连续损失数据时,能够深度挖掘相邻测点信息,有效确保插补数据的精确度和可靠性,对于建筑结构健康监测的分析预测至关重要。TPE优化的融合,增强了数据插补模型在复杂环境下的适应性和鲁棒性。

综上所述,TDA-RNN模型具有高效的超参数优化机制和高精度插补性能,能有效解决连续缺失数据的插补问题,在风场数据处理与分析中展现出较显著的优势。然而TDA-RNN模型对于极端风速和峰值数据的插补性能仍存在提升空间,针对极端风速数据的插补模型优化将是未来研究的重点。

参考文献

[1]

邓岳. 结构健康监测多元数据异常检测的机器学习方法[D]. 哈尔滨: 哈尔滨工业大学, 2021.

[2]

DENG Yue. A machine learning based method for multivariate data anomaly detection in structural health monitoring[D]. Harbin: Harbin Institute of Technology, 2021.

[3]

MA YafeiZHANG JianrenWANG Leiet al. Probabilistic prediction with Bayesian updating for strength degradation of RC bridge beams[J]. Structural Safety201344: 102-109.

[4]

刘小雍, 方华京, 熊中刚, . 基于无迹卡尔曼滤波的LSSVR在线多步时间序列预测[J]. 信阳师范学院学报(自然科学版)201932(2): 320-326.

[5]

LIU XiaoyongFANG HuajingXIONG Zhongganget al. Multi-step-ahead time series prediction based on LSSVR using UKF with sliding-windows[J]. Journal of Xinyang Normal University(Natural Science Edition)201932(2): 320-326.

[6]

雷鹰, 刘丽君, 郑翥鹏. 结构健康监测若干方法与技术研究进展综述[J]. 厦门大学学报(自然科学版)202160(3): 630-640.

[7]

LEI YingLIU LijunZHENG Zhupeng. Review on the developments of some methods and techniques in structural health monitoring[J]. Journal of Xiamen University(Natural Science)202160(3): 630-640.

[8]

刘道华, 冯宸, 赵岩松, . 多尺度特征融合网络的磁共振快速重建方法[J]. 信阳师范学院学报(自然科学版)202336(1): 127-131.

[9]

LIU DaohuaFENG ChenZHAO Yansonget al. A fast MRI reconstruction method based on multi-scale feature fusion network[J]. Journal of Xinyang Normal University(Natural Science Edition)202336(1): 127-131.

[10]

LI ChenzhaoMAHADEVAN SLING Youet al. Dynamic Bayesian network for aircraft wing health monitoring digital twin[J]. AIAA Journal201755(3): 930-941.

[11]

LIU YongqiQIN HuiZHANG Zhendonget al. Probabilistic spatiotemporal wind speed forecasting based on a variational Bayesian deep learning model[J]. Applied Energy2020260: 114259.

[12]

WANG ZhiweiLI AndongZHANG Wenminget al. Long-term missing wind data recovery using free access databases and deep learning for bridge health monitoring[J]. Journal of Wind Engineering and Industrial Aerodynamics2022230: 105201.

[13]

ZHANG ZeyuLUO Yaozhi. Restoring method for missing data of spatial structural stress monitoring based on correlation[J]. Mechanical Systems and Signal Processing201791: 266-277.

[14]

林秋爽, 周欢, 刘锦涛. 未知外部荷载下结构的在线损伤诊断[J]. 信阳师范学院学报(自然科学版)201528(4): 612-615.

[15]

LIN QiushuangZHOU HuanLIU Jintao. On-line damage detection under unknown external loadings[J]. Journal of Xinyang Normal University(Natural Science Edition)201528(4): 612-615.

[16]

KULLAA J. Sensor validation using minimum mean square error estimation[J]. Mechanical Systems and Signal Processing201024(5): 1444-1457.

[17]

PASPARAKIS G DDOS SANTOS K R MKOUGIOUMTZOGLOU I Aet al. Wind data extrapolation and stochastic field statistics estimation via compressive sampling and low rank matrix recovery methods[J]. Mechanical Systems and Signal Processing2022162: 107975.

[18]

BAO YuequanSHI ZuoqiangWANG Xiaoyuet al. Compressive sensing of wireless sensors based on group sparse optimization for structural health monitoring[J]. Structural Health Monitoring201717(4): 823-836.

[19]

WAN HuapingDONG GuansenLUO Yaozhi. Compressive sensing of wind speed data of large-scale spatial structures with dedicated dictionary using time-shift strategy[J]. Mechanical Systems and Signal Processing2021157: 107685.

[20]

LIN QiushuangLI Chunxiang. Kriging-based sequence interpolation and probability distribution correction for Gaussian wind field data reconstruction[J]. Journal of Wind Engineering and Industrial Aerodynamics2020205: 104340.

[21]

ZAPATA-SIERRA A JCAMA-PINTO AMONTOYA F Get al. Wind missing data arrangement using wavelet based techniques for getting maximum likelihood[J]. Energy Conversion and Management2019185: 552-561.

[22]

MARTINEZ-LUENGO MSHAFIEE MKOLIOS A. Data management for structural integrity assessment of offshore wind turbine support structures: Data cleansing and missing data imputation[J]. Ocean Engineering2019173: 867-883.

[23]

ORWIG K DSCHROEDER J L. Near-surface wind characteristics of extreme thunderstorm outflows[J]. Journal of Wind Engineering and Industrial Aerodynamics200795(7): 565-584.

[24]

QIN YaoSONG DongjinCHEN Haifenget al. A dual-stage attention-based recurrent neural network for time series prediction[EB/OL]. (2017-08-14) [2024-12-01].

[25]

BAHDANAU DCHO KBENGIO Y. Neural machine translation by jointly learning to align and translate[EB/OL]. (2016-05-19) [2024-12-01].

基金资助

河南省科技攻关项目(252102240062)

河南省科技攻关项目(242102240036)

信阳师范大学“南湖学者奖励计划”青年项目

AI Summary AI Mindmap
PDF (1360KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/