0 引 言
易燃可燃液体的燃烧爆炸事故屡见不鲜,如煤矿作业中的火灾和爆炸事故,货物生产、储存和运输过程中的燃烧事故和工业事故等
[1‐2]。为了预防和减少火灾、爆炸等事故的发生,并及时做出应对,了解易燃可燃液体的危险特性就变得尤为重要。自燃温度(Auto-Ignition temperature, AIT)
[3-4]是对可燃物质进行定量风险评估的一个重要表征参数。准确了解各种物质的自燃温度值,可以有效防止火灾和爆炸的发生
[2,5]。
现阶段人们对自燃温度的研究仅限于纯化学物质,对混合液体的研究相对滞后
[6‐7]。Suzuki
[8]和Tsai等
[9]将纯物质的自燃温度与分子描述符进行关联构建模型,为研究混合液体的自燃温度提供了新思路。杨守生等
[10]通过自燃点测试仪对一些二元可燃混合液的自燃温度进行了测量。然而,采用实验方法测量自燃温度费时费力,实验结果受到多种外界因素的干扰,故其在适用范围上存在着较大的限制
[6]。随着人工智能技术的不断发展,深度学习成为研究热点
[11]。深度学习被广泛应用于预测、图像处理等多个领域
[12]。将深度学习应用于定量结构-性质关系(Quantitative structure-property relationship,QSPR)的建模研究中
[13],可以替代人工统计学分析提高计算效率。陈锡进等
[14]采用神经网络建模实现对烷烃自燃温度的预测。Safa等
[15]使用人工神经网络优化QSPR预测模型,模型预测结果高于相同条件下多元线性回归(Multivariable linear regression,MLR)模型。何凡等
[7]使用BP神经网络(Back propagation neural network, BPNN)模型预测二元混合液体自燃温度,性能高于已有的多元非线性回归(Multivariable non-linear regression, MNR)模型。
对深度学习技术在二元混合液体自燃温度预测的研究中,大多只考虑分子描述符信息,采用BP神经网络对其进行建模。本文在此基础上扩充部分数据集,将分子结构图与分子描述符相结合,构建了一种混合数据输入的神经网络预测模型。分别使用BP神经网络和一维卷积神经网络(One-dimensional convolutional neural network,1DCNN)对数字数据(分子描述符)进行处理,使用卷积神经网络(Convolutional neural networks,CNN)对图像数据(分子结构图)进行处理。基于QSPR理论,本文分别从预测结果、模型验证、应用域分析和机理解释4个方面对预测模型进行探讨分析,期望为工程上提供一种高效可靠的方法,以更好地预防二元混合液体所引发的火灾和爆炸事故。
1 数据准备
实验中使用的混合液体自燃温度数据一部分来自文献收集
[16‐17],另一部分由山西省防火防爆安全工程技术研究中心实验所得
[2]。以常见的7类(烷类、醇类、醚类、酸类、苯类、酮类和酯类)共23种可燃有机物(正戊烷、正已烷、正庚烷、正辛烷、甲醇、乙醇、正丙醇、正丁醇、正戊醇、异丙醇、仲丁醇、乙二醇单甲醚、乙二醇单乙醚、乙二醇单丁醚、二乙二醇单甲醚、二乙二醇单丁醚、乙酸、丙酸、甲苯、丙酮、乙酸甲酯、乙酸乙酯和乙酸丁酯)为实验对象,测得48组二元混合液体在不同配比下的自燃温度值,共285个。自燃温度数据分别由AIT TA551自燃温度测试仪和HY 5332可燃液体、气体自燃温度测试仪依据ASTM E659-78
[3]测试方法测定。
1.1 分子描述符的计算和筛选
原子类型电拓扑状态指数(Electrotopological state indices for atom type,ETSI)是QSPR建模中最常用的描述符之一
[18]。利用分子描述符计算软件Mordred
[19],分别计算出二元混合液体各组分(23种可燃有机物)的1 826种分子描述符。为确保模型可以拟合
[20],结合本实验所使用的有机物,从1 826种分子描述符中筛选出9种分子描述符,具体情况见
表 1。
1.2 混合分子描述符
对于二元混合液体的研究,需要一种混合分子描述符。然而,在现有的QSPR理论中,缺少一种能准确刻画混合分子描述符的体系。一些学者提出,对二元混合体系中两个组分的ETSI加权求和
[7,19,21],可得混合分子描述符,公式为
式中:(Si )mix为二元混合物的加权ETSI;Si1和Si2为二元混合物中两个组分的ETSI;x1和x2为两个组分的体积分数,且x1+x2=1。本文所提及的分子描述符均为二元混合液体的混合分子描述符。
1.3 数据集
数据集可分为数字数据和图像数据。数字数据是指根据式(1)计算得到的285组混合分子描述符及其对应的自燃温度值。图像数据是指二元混合液体两个组分的三维分子结构图的拼接,共285张,与数字数据一一对应。为确保模型的有效性,实验中训练集和测试集的划分比例为8∶2。
2 模型构建
实验环境为Windows 10系统。编译环境为PyCharm 2021,Python 3.7,TensorFlow 2.3.0,Keras 2.4.3。
2.1 模型框架
首先,定义网络的两个分支分别处理数字数据(经过计算得到的285组混合分子描述符数据)和图像数据。然后,合并两个分支。最后,通过激活线性激活函数(Linear activation)的全连接层(Fully-connected layer)得到混合液体自燃温度预测值。实验中分别使用BPNN和1DCNN对数字数据进行处理,图像数据由卷积神经网络进行处理。其中,BPNN和1DCNN的输入是9种分子描述符(见
表 1),输出是长度为128的一维向量。CNN的输出是长度为4的一维向量,实验中不必在数字数据处理分支和图像数据处理分支中分别做回归任务,将两个分支合并后做回归预测即可。
2.2 数字数据处理分支
1) BPNN模型框架
BPNN网络结构见
图 1(a),由输入层(Input layer层)、2个隐含层(Hidden layer层)和输出层(Output layer层)组成,激活函数为ReLU。隐含层的神经原个数分别为128和256。
2) 1DCNN模型框架
1DCNN网络结构见
图 1(b),由2个卷积层(Conv1D层)、1个展平层(Flatten层)和1个全连接层(Dense层)组成,激活函数为ReLU,两个卷积核的filters个数分别为32和64。
2.3 图像数据处理分支
实验中将二元混合液体两个组分的三维分子结构图进行预处理使其大小相同,然后,进行拼接,经过处理后每次输入的图片数据为(64×64×3)。CNN网络结构见
图 1(c),包括3个卷积层(Conv2D层)、3个最大池化层(Max Pooling层)、1个展平层(Flatten层)和2个全连接层(Dense层,神经元个数为16和4),激活函数为ReLU。
2.4 合并输出
如
图 1(d)所示,实验中将数字数据处理分支的输出向量和图像数据处理分支的输出向量进行合并操作得到长度为132的一维向量,经过两个全连接层(Dense层,神经元个数为4和8,激活函数为ReLU)。最后,通过一个线性激活函数的全连接层,得到混合液体自燃温度的预测值。
3 实验结果讨论
3.1 模型预测结果及分析
实验中使用决定系数(
R2)、平均绝对误差(
MAE)、均方根误差(
RMSE)和平均绝对百分比误差(
MAPE)评估模型拟合能力、稳定性和精确度。实验中两种模型在测试集上的表现见
表2。可知两种模型的
R2大于0.98,
MAE在±30 ℃的范围之内,满足ASTM E659-78的测试标准,表明两个模型有较好的稳定性,且是被承认的
[3]。为了进一步验证本实验两种模型的优越性,将其同文献中的BPNN
[7],MNR
[16]和MLR
[22]模型进行比较,结果见
表 2。
综合
R2,
RMSE,
MAE,
MAPE对比结果,发现实验中两种模型的性能优于文献中的模型。在测试集上,两种模型自燃温度的预测值与真实值对比结果见
图 2。真实值用空心圆表示,预测值用实心圆表示,重合度越高,表明预测值越接近于真实值。从图中发现两个模型的真实值和预测值具有很高的重合度,尽管有小部分没有重合,但是偏差不大,表明两个模型的预测效果良好。
3.2 模型内部验证
模型内部稳健性可通过内部验证、残差分析和
Y随机验证判断
[23]。实验将采用
K折交叉验证法进行内部验证,同时利用残差分析进行校验。
1)
K折交叉验证(
K-fold cross-validation),常用的评估指标为交叉验证复相关系数(
)和均方误差(
MSEK-FCV)。
>0.9,表示模型的性能非常好。若
R2与
的结果相差大于0.3,则表示模型有过拟合的可能
[24]。
两个模型的交叉验证结果见
表 3。他们的5折和10折交叉验证复相关系数均大于0.9,交叉验证复相关系数与
R2的结果相差均小于0.3,表明两种模型的性能较强,没有过拟合的可能。
2) 残差分析以自燃温度的预测结果作为横坐标,以残差值作为纵坐标进行绘制残差图。若残差图中的散点是随机分布的,说明模型无系统误差且具有较高的稳定性。两个模型的残差分析结果见
图 3。两种模型的训练集和测试集残差均随机分布在零基准线的两侧,没有明显的规律,说明两种模型在建模过程中均未产生系统误差,稳定性高。
3.3 模型外部验证
通过测试集样本的预测结果与实验结果之间的交互验证系数
,可以衡量模型的外部预测能力
[25]。
越接近1,表明模型的外部预测能力越好。模型外部预测结果见
表 3,BPNN+CNN和1DCNN+CNN模型的
分别为0.982 6和0.992 5,表明两个模型均具有可靠的外部预测能力,但是BPNN+CNN略逊色于1DCNN+CNN模型。
3.4 模型应用域分析
两种模型的大部分数据点落在模型适用性范围内,只有极个别数据落在了±3标准残差范围外,但是均没有落在标准杠杆值h*右侧,表明两种模型的适用范围广泛,可靠性高,可对大多数二元混合液体自燃温度进行预测。
3.5 消融实验
消融实验结果见
表 3。综合考虑
R2,
,
,
MSE5-FCV,
和
MSE10-FCV的结果,仅处理数字数据的BPNN和1DCNN模型表现逊色于BPNN+CNN和1DCNN+CNN模型,表明BPNN+CNN和1DCNN+CNN模型的拟合效果、外部预测能力和稳定性更优。此外可以发现,不管是CNN+BPNN模型,还是CNN+1DCNN模型,其各项指标均优于仅使用数字数据的模型。由此可知,引入分子结构图后的混合数据可以提高模型性能。
3.6 优化器对模型性能影响分析
实验中分别使用4种优化器来寻求模型的最优解,不同优化器对模型性能的影响见
表 4。发现当使用Adam优化器时,两个模型的各项指标表现最好,说明该优化器有利于提升模型的预测性能。RMSprop(RMSP)和Adamax(Adax)的表现不相上下,但略逊色于Adam。SGD相对最差,其收敛速度较慢且更难调参。
3.7 不同维度分子结构图对模型性能影响分析
为了验证本文使用三维分子结构图的优越性,使用不同维度的分子结构图(二维和三维)进行对照训练,并分析结构图维度对模型稳定性和外部预测能力的影响,结果如
表 5 所示。整体而言,使用三维分子结构图的数据结果均优于使用二维分子结构图,表明采用三维结构图构建的模型更优。
3.8 模型机理
使用SHAP工具包
[26]对BPNN模型的输入特征(
表1)进行全局重要度(贡献度)计算,在不同的测试集上计算5次,对结果取平均值,得到最终的平均贡献度,结果见
图 5。分子描述符SssCH
2、SsCH
3和SsOH的平均贡献度在所有分子描述符中排名前三,在实验数据集中SssCH
2和SsOH常见于烷、醇类有机物,表明该模型对烷、醇类二元混合体系的预测效果最佳。SsCH
3排名第二,但在数据集所有化合物中均有出现,故不作为主要参考数据。SsssCH常见于醇类化合物的同分异构体,其平均贡献度中等偏低,说明模型对含有醇类同分异构体的二元混合体系预测效果一般。分子描述符SdssC、SaasC、SaaCH和SdO平均贡献度较小,其中,SdO和SdssC常见于酸类(包括含酸性官能团的酯类)和酮类,SaaCH和SaasC常见于苯类,说明该模型对含有酸类、酮类和苯类的二元混合体系预测效果相对较差。
4 结 论
本文将分子结构图与分子描述符相结合,建立了一种混合数据输入的神经网络预测模型,对二元混合液体自燃温度进行了研究。
1)扩充部分数据集并引入了一维卷积神经网络。探讨总结了9种分子描述符对二元混合液体自燃温度的贡献度,期望能以更少的分子描述符数据描述更多的性质。
2)两种模型均具有良好的拟合能力、预测能力和稳定性,性能优于BPNN、MNR和MLR模型。
3)现有的工作针对的是二元混合体系,二元以上的多元混合体系还有待开展。纯物质分子描述符的筛选有待进一步研究,同时,混合分子描述符的计算还有很大的提升空间,希望能够找出一种方法,可以更好地反映混合体系内单一组分之间的相互联合作用机制。
4)使用了CNN对图像数据进行处理,之后考虑使用ResNet网络进行对比研究。