变因素下基于多模态融合算法的煤矸识别

夏蕊 ,  王响 ,  李博 ,  王学文

东北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (4) : 95 -102.

PDF (2798KB)
东北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (4) : 95 -102. DOI: 10.12068/j.issn.1005-3026.2026.20249063
机械工程

变因素下基于多模态融合算法的煤矸识别

作者信息 +

Coal Gangue Identification Based on Multimodal Fusion Algorithm Under Variable Factors

Author information +
文章历史 +
PDF (2864K)

摘要

为应对环境因素对煤矸识别任务的影响,本文提出了融合光谱与图像特征的新型网络架构.该架构通过整合双模态信息,挖掘丰富的特征信息,从而解决单一模态在恶劣环境下出现的特征退化问题.为验证模型性能,在实验室条件下构建了多因素数据集和工况数据集,并分别搭建光谱特征提取(1DCNN+CBAM)与图像特征提取(ResViT)网络,其中ResViT网络首次将残差机制与视觉Transformer结合用于煤矸分选任务,能够高效提取模态间的特异性特征.通过设计对比与消融试验确定了各分支搭配的合理性,并在两种数据集下验证了模型的稳定性,准确率最高达到97.92%.由此证明,提出的多模态融合算法是一种高效的分类模型,可为井下煤矸分选提供有力理论支持.

Abstract

To cope with the impact of environmental factors on the coal gangue identification task, a novel network architecture that fused spectral and image features was proposed. The architecture mined rich feature information by integrating the information of two modalities, so as to solve the feature degradation problem of a single modality in harsh environments. In order to verify the model performance, multi-factor dataset and working condition dataset were constructed under laboratory conditions, and spectral feature extraction (1DCNN+CBAM) and image feature extraction (ResViT) networks were built respectively, among which the ResViT network combined the residual mechanism with the visual Transformer for the first time for the task of coal and gangue sorting, which was able to efficiently extract the inter-modality specific features. The reasonableness of each branch collocation was determined by design comparison and ablation test, and the stability of the model was verified under two datasets, with an accuracy rate of up to 97.92%. It is proven that the proposed multimodal fusion algorithm is an efficient classification model, which can provide strong theoretical support for underground coal and gangue sorting.

Graphical abstract

关键词

煤矸识别 / 近红外光谱 / 图像 / 多信息融合 / 多因素影响

Key words

coal gangue identification / near-infrared spectroscopy / image / multi-information fusion / multi-factor effect

引用本文

引用格式 ▾
夏蕊,王响,李博,王学文. 变因素下基于多模态融合算法的煤矸识别[J]. 东北大学学报(自然科学版), 2026, 47(4): 95-102 DOI:10.12068/j.issn.1005-3026.2026.20249063

登录浏览全文

4963

注册一个新账户 忘记密码

在煤炭开采过程中,矸石作为与煤炭共生的废弃物,其处理问题日益凸显.矸石不仅可燃性弱,且在燃烧过程中会释放大量有害物质,对环境造成污染,因此,有效的矸石分离是亟待解决的关键问题.随着人工智能的发展,更为高效的煤矸分选技术应运而生,常用的方法有光谱识别、射线识别和图像识别等1.近红外光谱和图像分析技术因其具有无损、快速等优点而被广泛应用.图像处理技术与深度网络的结合,克服了传统图像手工提取特征的繁琐.Gao等2将CNN与SVM结合,提高了煤矸识别的准确率,且实现了更快的识别速度.Pu等3使用VGG16并结合迁移学习的方法,实现了煤矸石的正确分类,验证集准确率达到了82.5%.光谱技术与卷积网络相结合,运用了卷积网络的强大特征提取能力,克服了传统分析方法无法处理干扰信息的局限性.Xiao等4使用深度置信网络提取光谱数据特征,并基于正则化双层极限学习机,有效预测出了煤的成分信息.Le等5使用卷积神经网络提取光谱特征,并构建了极限学习机算法成功预测出了煤的组分信息.
近年来,有学者将近红外光谱与图像技术融合进行样品的分类研究.Chen等6将近红外光谱与图像技术融合实现梨的疾病检测,结果证明融合模型在疾病检测中有着较好的性能.Song等7联合近红外光谱技术与计算机视觉对茶叶品质进行分级,结果证明卷积网络提取特征信息的方法对融合模型分类效果最好.
在煤矸石实际分选过程中,其表面会被煤粉、水分沾染,且设备光源的不稳定也会影响分类模型的性能.曹现刚等8针对光线不足的情况,提出了一种融合多个条件下的新型图像获取方案,结果表明该方法可以显著提高识别率.Luan等9针对真实采矿环境下光照不足的情况,提出了一种将CNN与SWIN变换器相结合的方法,并验证了该模型的性能.
在井下生产环境中,必定存在多种复杂条件交互作用的情况,此时基于单模态的分类方法可能无法达到理想的效果.本文在深度学习方法的基础上引进光谱和图像信息融合技术,构建双模态信息融合网络,通过消融试验与对比试验,验证各模块搭建的合理性,并将融合模型与单模态模型进行对比,分析融合模型相较于单模态模型的性能优劣.最后针对实际环境可能遇到的影响因素,模拟3种环境因素的混合条件并设计了3因素3水平正交表,探究环境对模型性能的影响.本研究可为多模态融合技术用于煤矸井下分选提供理论基础.

1 材料和方法

1.1 图谱数据采集

为验证模型性能,本文构建了多因素数据集、工况数据集两类具有不同特征的数据源.多因素数据集综合考量多种潜在因素的影响,工况数据集则聚焦于模拟实际工作条件下的数据特征,二者可为模型性能的全面评估提供坚实的数据支撑.试验样本均来自山西省太原市西铭煤矿的焦煤和黑色矸石,尺寸在30~50 mm.光谱仪采集的光谱数据波长在370~1 049 nm,共计特征2 048个;面阵相机采集的图像分辨率为2 048×2 448.数据采集过程中,将煤矸样本随机置于运动状态下的传送带上,传送带有效输送长度为4 m,宽度为0.8 m,运行速度可在0~2 m/s范围内调节.不同数据集对应的煤和矸石样本图像如图1所示.

1) 多因素数据集.构建多因素数据集时,采用正交试验10的方法对不同照度、表面煤粉沾染量以及表面不同水分等情况展开工况模拟.多因素数据集使用光谱与图像样本数各240,并将其按照8∶2的比例划分为训练集和测试集,其中训练集数量为192,测试集数量为48.随后,将训练集部分按照3折交叉验证进行划分训练,训练集数量为128,验证集数量为64.表1为正交试验方案.

为确保试验的严谨性,在模拟多因素条件前,选择质地均匀的煤和矸石颗粒作为测试样本.然后将样品在暗室中存放48 h,以确保每个样品表面足够清洁.在照度模拟试验中,使用可调光源将照度分为2 000,3 000和4 000 lx 3个梯度.在煤粉沾染试验中,洁净和未受污染的煤矸石样本被均匀涂上煤粉,以模拟生产活动中的污染.所使用的煤粉来自使用破碎机粉碎的原煤.同时,在均匀涂抹过程中,将煤粉的质量分别设定为0.05,0.10和0.15 g,并使用电子仪器测量其质量.在表面湿度试验中,设置0.08,0.16 和0.24 mL 3个水梯度,每次加湿试验均通过喷雾对其表面进行均匀加湿,喷洒量使用重量法进行控制.

2) 工况数据集.为探究模型在实际生产中的应用效果,本文模拟实际生产环境制备了工况数据集.该数据集采集光谱与图像样本数各122,并将其按照8∶2的比例划分为训练集和测试集,在训练集基础上进行交叉验证训练,并使用独立测试集对每一轮训练结果进行测试.借助此数据集,能够全方位评估模型在实际生产条件中的稳定性与可靠性.为模拟井下工作环境,采集1 460 lx卤素灯照度下的光谱,并将面阵光源的强度调整为1 000 lx来获取图像,以模拟低照度条件.利用烟雾发生器产生的烟雾,模拟实际生产中的粉尘环境,总烟雾质量浓度保持在0.2~0.5 mg/m3.此外,样品表面均涂抹100 g/L的煤水混合物,模拟降尘系统喷水后与其他粉状杂质混合的效果.

1.2 数据采集系统

光谱仪(Oceanview optics usb 2000+,Ocean Insight)连接光纤探头(1SMA1s-SI0.6-1.5 m,SL)实现数据采集.其配套的Oceanview 2.0.7作为采集显示软件,卤素灯(BBGD 12 V50 W,12 V75 W,12 V100 W MR16)作为光源.使用海康威视配有定焦镜头(MVL-MF0828M-8MP)的工业面阵相机(MV-VA050-12UC)采集图像数据,图像的固有分辨率为2 048×2 448,配备的光源为可调工业面阵光源(JS-LS18032),其中用于测量光照强度的照度计(DL 333204)量程为0~5 000 lx.设备的结构布局如图2所示.

2 融合模型架构

2.1 光谱特征提取

在光谱分析过程中,选择有效的预处理方法可以极大程度减少非目标因素影响,提高数据质量.在本研究中,使用Savitzky-Golay平滑对采集的光谱数据进行预处理,该方法可以在保证样本特性的同时减少干扰11.预处理后进行光谱特征提取操作,其网络结构如图3所示.在神经网络中,全连接层主要被用作整合前面层的输出12,但在该网络中被用作改变数据维度固定输出.此外,为克服CNN在特征提取过程中出现的特征丢失问题13,在网络中加入CBAM(convolutional block attention module)注意力机制模块14,以实现性能的提升.CBAM是结合了通道注意力和空间注意力的注意力模块,其中通道注意力 McRC×1×1能够实现通道选择.空间注意力模块 MsRH×W 能够选择注意区域.计算过程如下:

Mc(F)=σ(MLP(AvgPool(F))+MLP(MaxPool(F)))
Mc(F)=σ(W1(W0(FavgC))+W1(W0(FmaxC))).

式中:σ为Sigmoid函数; W0W1为MLP的权重.

空间注意力的流程:首先将输入特征通过全局和平均池化进行通道压缩,并将结果进行拼接,最后将拼接结果进行卷积和Sigmoid函数处理.计算过程如下:

Ms(F')=σ(f7*7([AvgPool(F');MaxPool(F')]))
Ms(F')=σ(f7*7([(F')avgS;(F')maxS])).

式中,f7*7 表示卷积核大小为7*7的卷积运算.

2.2 图像特征提取

Vision Transformer(ViT)模型在视觉领域具有较大潜力,尤其在大数据集上与经典卷积网络相比有着较强的识别效果15.然而,ViT和CNN在数据处理方面关注度不同,CNN关注数据的局部特征,ViT模型则关注全局信息和上下文特征,对局部特征表现不明显.因此,本文将CNN与ViT相结合完成特征提取,实现网络互补.混合网络结构如图4所示.

在混合网络结构中,将ResNet18残差网络与ViT相结合,既保留了残差网络信息的完整性又结合了ViT的强大特征表示能力16.ResNet是经典的残差网络框架,在本文中将层4作为输出,该层是经过ResNet18所有残差块之后的输出,同时为了适应输出减小参数量使用自适应平均池化层对其尺寸进行缩减.由于ViT模型的输入是一种展平的图像块(patch),每个块都有固定的维度,为了适应输出格式将特征图从形状(bchw)转换为形状(bnc),其中:n是所有patch的数量(n=h×w),b为批次,c为通道数,h为高度,w为宽度.

将输入序列进行线性映射得出ViT所需要的维度,并对输入的数据进行嵌入处理,在序列的最前面添加class token和位置嵌入,位置编码是为了使模型能够理解序列数据之间的相对位置关系,class token作为一个全局表示,用于捕捉和整合目标中的小块信息.最后将patch embedding和class token拼接起来一同输入Transformer编码器中,Transformer编码器模块结构如图5所示.

多头注意力是在自注意力的基础上进行的,其工作流程首先将输入序列X=(x1x2xn )映射到更高的维度上得到ai,之后分别与 WqWkWv 权重矩阵相乘生成对应的qikivi,将所有的qkv结合得到对应的 Q (Query), K (Key)和 V (Value).紧接着通过另一个线性映射将注意力头合并,计算qk的点积并进行缩放处理,最后对结果使用Softmax函数计算v上的注意力权重,得到最终的输出:

Attention=(Q,K,V)=SoftmaxQKTdkV.

式中,dk为键向量维度.

QKV 投影到一个低维度空间,经过h次不同的线性投影操作,形成多个不同的表示(注意力头),接着将每个头独立进行注意力计算:

Headi=Attention(QWiQ,KWiK,VWiV).

式中:WiQRdmodel×dkWiKRdmodel×dkWiVRdmodel×dvdv为值向量维度.

将每个头的计算结果按维度进行拼接,并通过线性变换得到多头注意力输出:

MultiHead(Q,K,V)=Concat(head1,head2,,headh)WO.

式中,WORdmodel×hdv.

2.3 融合网络

融合领域中,特征级融合方法能够提取不同类传感器的信息特征,并将特征信息进行拼接,形成丰富的特征组合,从而减少信息丢失现象17.在特征级融合中,使用2.1节的方法提取光谱特征,以2.2节的方法提取图像的表面特征.将来自不同源的信息通过Concat进行拼接,充分挖掘序列与图像特征18.将拼接后的特征向量传入Dropout层,随机丢弃一些神经元的输出,降低过拟合风险.为了提高分类性能,使用全连接层,使融合向量能够进行线性变换并学习特征之间的关系,最后添加非线性激活函数Softmax将输出转换成概率.

3 结果与讨论

3.1 评价指标

为了评估融合模型的性能,使用准确率(Accuracy)、精确率(Precision)、召回率(Recall)以及F1分数从多个角度了解模型性能,如式(8)~(11)所示.为了直观全面显示模型的性能,引入混淆矩阵,清晰展示每个类被正确或错误分类的数量.

Accuracy=TP+TNTP+TN+FP+FN
Precision=TPTP+FP
Recall=TPTP+FN
F1=2TP2TP+FP+FN.

其中:TP为正确预测为正类别的样本数量;TN为正确预测为负类别的样本数量;FP为错误预测为正类别的样本数量;FN为错误预测为负类别的样本数量.

3.2 模型性能验证

融合模型由图像特征提取网络ResViT与光谱特征提取网络CNN-CBAM组成,在不改变图像特征提取网络的基础上,为验证CNN-CBAM网络在融合后模型中的表现能力,本文将经典神经网络VGG16、DenseNet以及Resnet18网络替换CNN-CBAM分支与ResViT分支完成融合任务19-20].为减少融合后不必要的计算复杂度,在对比试验中不使用过深的网络结构,本着在有限资源的前提下,使用最简单的方法最大程度地完成融合,这也是本文的融合原则.

在对比试验中,将多因素数据集按照6∶4划分为训练集和测试集,得到训练集144个,测试集96个.在训练过程中保证所有网络的参数一致.如图6所示,从图中可以看出CNN-CBAM与ResViT融合后的效果最好,测试集准确率为98.96%,精确率为98.98%,召回率为98.96%,F1分数为98.96%.ResNet网络融合后的模型效果次之,DenseNet网络融合的效果较差.3个经典网络的融合效果没有CNN-CBAM好,但四者数值相差不大,均达到95%以上,可以看出多源信息融合能够很好地完成分类任务.

为了进一步说明本文融合模型的效果,在图7中给出4种模型的混淆矩阵,主对角线上是每个类别的正确预测,可以看出本文融合模型只有1个样本被错误识别,将矸识别成了煤,其次是ResNet网络,DenseNet网络效果最差,证明本文网络模型融合效果较好.

3.3 消融试验

对于图像特征提取分支,本文使用ResNet18与ViT的混合模型完成特征提取任务,为验证ResNet18模块存在的必要性,借助消融试验的方法证明,消去ResNet18模块直接使用ViT模型进行特征提取并完成融合分类,结果如图8a所示.从图中可以看出,消去ResNet模块前后,4个指标均有所降低,尤其是召回率指标,同时也证明了两个网络结合的优势.为了验证融合模型性能,将单双模态进行了比较.如图8b所示,融合模型4种指标均高于单模态模型.准确率、精确率、召回率以及F1分数分别为97.92%,100%,95.83%和97.84%.从图中可以看出,光谱分支的召回率与融合模型的数值一致,而召回率为正确识别的正例数与实际正例总数的比值,其可能原因是光谱分支模型已经捕捉到了正例的关键特征,导致融合模型召回率没有提升.

4 模型在多因素数据集中的性能评估

4.1 参数设置

多因素试验和工况试验均在Python 3.8,环境版本PyTorch 1.9下完成,计算机为Intel Core i5-13500HX 2.50 GHz,配备Nvidia RTX 4050显卡.模型使用了Adam优化器,训练批次为12,正则化参数为0.001,学习率0.000 08.训练过程中采用交叉验证的方法进行训练,测试集独立于训练、验证过程,在训练过程中每次选择2个子集作为训练集,剩下一个子集作为验证集,此过程重复3次,并将每次得到的评估结果用测试集进行测试,最后取3次结果的平均值.

4.2 模型评估

融合模型在9种不同条件下的训练结果如表2所示.结果表明融合模型无论在何种条件因素下均能达到较好的性能,准确率、精确率、召回率以及F1分数均在90%左右,最低值出现在试验的第3组中,准确率、精确率、召回率以及F1分数分别为90.28%,94.44%,86.11%和89.22%.其可能原因是在正交试验设计中第3组实验煤粉沾染量和表面湿度达到了梯度水平的最大值,进而影响模型性能,同时也说明煤粉和水分在煤矸分类任务中会对模型产生影响.

5 模型在工况数据集中的性能评估

为验证融合模型性能,本研究使用准确率、精确率、召回率以及F1分数等4个评价指标对模型进行全方位评估,探讨融合模型在实际工况下的适应性.训练过程中使用3折交叉验证的方法,提高训练结果的准确性,减少随机误差.通过3次训练取其平均值,所得结果如图9所示.从图9可以看出,融合模型在工况数据集中表现良好,准确率、精确率、召回率以及F1分数分别达到了93.33%,94.44%,90.91%,95.24%.对比多因素数据集和工况数据集的指标差异可见,工况数据集中存在的粉尘、低照度环境会对模型产生不利影响,使模型的识别效果变差,同时从侧面可以说明所搭建融合模型相较于单模态模型有较高的稳定性和抗干扰能力.

图10为交叉验证中各独立测试集的混淆矩阵结果,通过对比不同折的混淆矩阵,可以洞察模型在不同数据划分下的稳定性,为后续模型的优化和改进提供依据.

6 结 论

1) 本研究探索模型在不同环境影响下的适应性.采用了交叉验证取平均的方法对结果进行评估.测试集独立于训练过程,其余数据作为交叉验证的总数据集.结果表明,在多因素数据集和工况数据集下,模型均能达到理想的性能,测试集的准确率均在90%以上.

2) 为探究双模态融合网络性能优势,将融合模型与单模态模型进行了比较.数据表明,融合模型在测试集上的准确率达到97.92%,单模态模型的测试集准确率分别为95.83%和94.44%,可以看出,融合模型具有显著优势.为验证ResViT分支搭配的合理性,本文设计了消融试验.结果显示,残差结构的加入使模型性能提高了2%.

参考文献

[1]

郭永存,何磊,刘普壮,. 煤矸双能X射线图像多维度分析识别方法[J]. 煤炭学报202146(1): 300-309.

[2]

Guo Yong-cunHe LeiLiu Pu-zhuanget al. Multi-dimensional analysis and recognition method of coal and gangue dual-energy X-ray images[J]. Coal Journal202146(1): 300-309.

[3]

Gao R XDu Y BWang T F. Research on coal gangue classification recognition method based on the combination of CNN and SVM[J]. Journal of Real-Time Image Processing202320(6): 110.

[4]

Pu Y YApel D BSzmigiel Aet al. Image recognition of coal and coal gangue using a convolutional neural network and transfer learning[J]. Energies201912(9): 1735.

[5]

Xiao DLe B T. Rapid analysis of coal characteristics based on deep learning and visible-infrared spectroscopy[J]. Microchemical Journal2020157: 104880.

[6]

Le B TXiao DMao Yet al. Coal analysis based on visible-infrared spectroscopy and a deep neural network[J]. Infrared Physics & Technology201893: 34-40.

[7]

Chen Y FLiu LRao Yet al. Identifying the “Dangshan” physiological disease of pear woolliness response via feature-level fusion of near-infrared spectroscopy and visual RGB image[J]. Foods202312(6): 1178.

[8]

Song YWang X ZXie H Let al. Quality evaluation of Keemun black tea by fusing data obtained from near-infrared reflectance spectroscopy and computer vision sensors[J]. Spectrochimica Acta Part A: Molecular and Biomolecular Spectroscopy2021252: 119522.

[9]

曹现刚, 郝朋英, 王鹏, . 多因素光照条件下高质量煤矸图像获取方法研究[J]. 煤炭科学技术202351(1): 455-463.

[10]

Cao Xian-gangHao Peng-yingWang Penget al. Research on method of acquiring high quality coal gangue images under multi-factor illumination condition[J]. Coal Science and Technology202351(1): 455-463.

[11]

Luan H XXu HTang Wet al. Coal and gangue classification in actual environment of mines based on deep learning[J]. Measurement2023211: 112651.

[12]

Zhang L LLu Y DKang J Fet al. Selection of optimum composition of alumino borosilicate glasses with excellent dielectric properties according to orthogonal experiment design[J]. Journal of Materials Science: Materials in Electronics201829: 5746-5752.

[13]

Zhou L NZhou L J YWu H Bet al. Estimation of cadmium content in Lactuca sativa L. leaves using visible-near-infrared spectroscopy technology[J]. Agronomy202414(4): 644.

[14]

Jiao J YZhao MLin Jet al. A multivariate encoder information based convolutional neural network for intelligent fault diagnosis of planetary gearboxes[J]. Knowledge-Based Systems2018160: 237-250.

[15]

Peng CZhong LGao L Let al. Implementation of near-infrared spectroscopy and convolutional neural networks for predicting particle size distribution in fluidized bed granulation[J]. International Journal of Pharmaceutics2024655: 124001.

[16]

Hao YZhang C XLi X Yet al. Establishment of online deep learning model for insect-affected pests in “Yali” pears based on visible-near-infrared spectroscopy[J]. Frontiers in Nutrition20229: 1026730.

[17]

徐昊,郭黎,李润泽. 基于紧凑型Vision transformer的细粒度视觉分类[J]. 控制与决策202439(3): 893-900.

[18]

Xu HaoGuo LiLi Run-ze. Fine-grained visual classification based on compact vision transformer[J]. Control and Decision202439(3): 893-900.

[19]

Guo C RLi M XXu J Fet al. Ultrasonic characterization of small defects based on Res-ViT and unsupervised domain adaptation[J]. Ultrasonics2024137: 107194.

[20]

Xu MWang JGu S. Rapid identification of tea quality by E-nose and computer vision combining with a synergetic data fusion strategy[J]. Journal of Food Engineering2019241: 10-17.

[21]

Zhang H CAi G J. An image text sentiment analysis method using bimodal attention mechanism[J]. Journal of Circuits, Systems and Computers202434: 2550036.

[22]

Fayemiwo M AOlowookere T AArekete S Aet al. Modeling a deep transfer learning framework for the classification of COVID-19 radiology dataset[J]. PeerJ Computer Science20217: e614.

基金资助

山西省重点研发计划项目(202502020101022)

山西省回国科教创新资助项目(2025-104)

山西省回国留学人员科研资助项目(2024-049)

AI Summary AI Mindmap
PDF (2798KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/