多模态数据驱动的煤炭价格智能化预测方法与应用

汪莹 ,  张若晗 ,  朱红达 ,  杨洋 ,  祖子帅

中国矿业大学学报 ›› 2026, Vol. 55 ›› Issue (2) : 546 -558.

PDF (2922KB)
中国矿业大学学报 ›› 2026, Vol. 55 ›› Issue (2) : 546 -558. DOI: 10.13247/j.cnki.jcumt.20250295

多模态数据驱动的煤炭价格智能化预测方法与应用

作者信息 +

Intelligent coal price prediction method and application driven by multimodal data

Author information +
文章历史 +
PDF (2991K)

摘要

煤炭作为我国能源结构中的核心组成部分,其价格波动不仅影响上下游产业链发展,也对实现“双碳”目标和维护国家经济稳定具有重要意义.为提高煤炭价格预测的准确性,本文构建了基于Informer的多模态交叉注意力预测模型,选取环渤海5 500 K动力煤价格为预测对象,综合考虑原煤产量、煤炭进口量与关税、地缘政治不确定性因素、煤炭企业库存水平、火力发电总量及居民消费者价格指数等影响因素,构建多模态数据集.数值模态通过线性映射进行处理;文本模态采用RoBERTa编码器提取语义表示;跨模态部分引入交叉注意力机制,实现数值序列与文本信息的特征融合.结果表明:Informer在长时间序列预测中整体优于多种基准模型;相比简单融合,引入跨模态交叉注意力显著提升了预测准确性;模型在噪声文本条件下通过了稳健性检验.本文所构建的基于Informer的多模态交叉注意力预测模型能够为煤炭价格的科学预测提供支撑,对能源市场研究及相关政策制定具有一定的理论意义和实践价值.

Abstract

Coal is a cornerstone of China’s energy structure, and fluctuations in its price not only affect the upstream and downstream of the industrial chain but also bear on achieving the “dual-carbon” goals and safeguarding macroeconomic stability. To improve forecasting accuracy, this study develops an Informer-based multimodal cross-attention forecasting model, using the Bohai-Rim 5 500 K thermal coal price as the prediction target. We build a multimodal dataset that integrates key drivers including raw coal output, coal imports and tariffs, geopolitical uncertainty, coal enterprise inventories, total thermal power generation, and the consumer price index. The numerical modality is processed via linear mapping; the textual modality employs a RoBERTa encoder to extract semantic representations; and a cross-attention mechanism is introduced for cross-modal fusion between numerical sequences and textual information. Empirical results show that Informer performs better than multiple benchmark models on long-horizon forecasting; relative to simple concatenation, introducing cross-modal cross-attention significantly improves predictive accuracy; the model also passes robustness tests under noisy text conditions. The proposed Informer-based multimodal cross-attention model provides methodological support for scientific coal price forecasting and offers theoretical and practical value for energy-market research and related policy formulation.

Graphical abstract

关键词

多模态数据 / 煤炭价格 / Informer / 交叉注意力

Key words

multimodal data / coal price / Informer / cross-attention

引用本文

引用格式 ▾
汪莹,张若晗,朱红达,杨洋,祖子帅. 多模态数据驱动的煤炭价格智能化预测方法与应用[J]. 中国矿业大学学报, 2026, 55(2): 546-558 DOI:10.13247/j.cnki.jcumt.20250295

登录浏览全文

4963

注册一个新账户 忘记密码

煤炭是我国能源结构中重要组成部分,其价格的变化对上下游产业的发展与“双碳”目标下国民经济的稳定增长有重大意义1.煤炭消费在能源消费中占主导地位,2024年我国能源消费总量59.6亿t标准煤,煤炭消费量占能源消费总量比重为53.2%,煤炭消费量较2023年增长1.7%.可以预见煤炭在我国能源结构中在短期内仍将保持主导地位2.作为能源领域重要经济指标,煤炭价格不但实时反映煤炭行业发展状况,也和我国经济发展与社会稳定密切相关36.因此,精确预测煤炭价格对保证我国能源安全和经济健康发展具有重要意义.
本文拟基于多模态数据特征融合以及深度学习组合模型,采用环渤海5 500 K动力煤指数作为煤炭价格参考值,对煤炭价格进行预测.国内外学者在该研究领域已经取得了一定的研究成果,主要包括煤价影响因素识别和预测方法2个方面.煤炭价格影响因素方面,文献[7]选取港口存量、销量、期货价格、生产者价格指数以及原油价格等作为煤炭价格影响,构建了向量自回归模型对煤炭价格进行预测.文献[8]基于原煤产量、动力煤消费量、印尼动力煤指导价、火力发电、钢铁产量、煤炭企业库存、电力行业煤炭消费量、钢铁行业煤炭消费量、化工行业煤炭消费量、建材煤炭消费量工业和其他行业的煤炭消费等影响因素建立了煤炭价格预测模型.文献[9]根据秦皇岛港煤炭库存、内蒙古东胜5 200 K原煤坑口价、美国煤炭期货价格、煤化工指数、中国大宗商品综合指数等煤炭价格影响因素对我国煤炭价格进行了短期预测.
在预测方法方面早期研究的方法多是聚焦于利用价格时间序列等单一特征维度的结构化数据,考虑多种影响因素的计量经济模型进行煤炭价格的预测1013.文献[14]通过差分整合移动平均自回归(ARIMA)模型对中国煤炭消费、价格和投资做了长期的预测,揭示了煤炭市场在未来一段时间内的趋势走向.文献[15]基于偏最小二乘回归(PLSR)方法对煤炭价格指数进行建模预测,提出了一种新的PLSR预测模型,并验证了其在煤炭价格走势预测中的有效性.文献[16]构建了模糊集成向量自回归与误差修正模型(Fuzzy‑IVECM),分析国际能源市场冲击对中国煤炭价格的影响机制,揭示了外部能源市场波动对中国煤价传导效应的复杂性与动态性.尽管传统计量方法在描述和构建煤炭价格模型方面具备一定优势,但其难以捕捉宏观与微观经济背景下多种影响因素之间的耦合机制,通常只能基于已有历史数据进行拟合分析.
随着预测算法的发展,深度学习与人工智能方法能够自动提取复杂的非线性关系,相较于传统统计模型,在处理高维多因素驱动的数据时更具灵活性,逐渐成为预测研究中的重要工具1724.循环神经网络(RNN)由于其能够将信息进行“记忆”,在价格趋势预测领域被广泛应用25.然而在RNN的反向传播过程中,梯度会随着时间步的推移而逐渐消失或爆炸.为解决这类问题,文献[26]在RNN的基础之上创新地提出了LSTM神经网络的概念.通过引入门控机制,有效地应对了RNN中的梯度消失与梯度爆炸的问题.文献[27]提出了一种混合LSTM‑DNN模型,首次将深度学习方法应用于煤炭价格多步预测中.该模型融合LSTM对非线性关系的建模能力与DNN对高维特征表达的能力,实现对未来3,6,9,12个月煤价的精确预测,并验证了多种宏观经济变量和金属价格对煤价的影响.文献[28]构建了WT‑SAE‑LSTM模型用于美国电价预测,通过交叉试验优化小波分解参数,验证了该模型在非线性时间序列预测中的有效性.Transformer是一种基于自注意力机制的深度学习模型,相较于RNN和LSTM,具有长距离依赖捕捉和并行计算的能力,表现出更高的效率和性能.文献[29]将Transformer引入上海原油期货的开、高、低、收(OHLC)价格预测中,并结合结构化损失函数设计,实现了对多粒度价格序列的高精度预测.针对多模态数据,文献[30]构建了基于多层Transformer的交叉注意力网络,通过财经新闻、历史市场数据和技术指标之间的成对处理,预测股票市场价格的涨跌方向.由Transformer改进的Informer模型进一步凭借稀疏注意力机制降低了计算复杂度,通过层间蒸馏大幅减少计算量,从而提升了预测的效率和准确性31.该模型在风电功率、铁路客运量、航班延误等研究领域已有较为广泛的应用3235.
综上所述,现有的深度学习方法主要集中在LSTM的组合算法上,缺乏Informer相关模型在煤炭价格预测问题中的应用.在指标选取方面,现有研究多以统计数据为主,忽略了文本数据对煤炭价格的影响.基于此,本文提出了RoBERTa+Informer模型,综合考虑相关统计数据和新闻文本数据,融合自注意力机制和跨模态交叉注意力机制对煤炭价格进行预测,旨在通过多模态数据融合和模型优化提升预测准确性.本研究的创新主要体现在3点:一是构建煤炭价格的多模态预测框架,将时序数据与新闻文本联合建模,全面反映煤炭价格变化规律;二是引入跨模态交叉注意力机制,实现文本与数值的特征融合,显著提升中长步长预测效果;三是采用适用于长序列的Informer架构,有效捕捉煤炭价格的长期依赖关系与周期性,提高了模型的预测准确性.

1 煤炭价格预测影响因素识别

1.1 供给方面影响因素识别

我国煤炭价格作为能源市场重要的经济指标,很大程度上取决于供需关系.2024年,全国动力煤有效供应量为429 915万t,同比增长2.49%.而动力煤总需求量为419 075万t,同比增长3.29%,因此,煤炭的供需格局近年来呈现出供略大于需的趋势.供给侧主要受原煤产量、煤炭进口量与关税、政治不确定性因素、煤炭企业库存水平、煤炭产能规划与供给政策等因素影响.

原煤产量方面,2024年,我国原煤产量延续增长态势,全年规模以上工业产量达47.6亿t,同比增长1.3%,连续第4年创历史新高.

进口量与关税水平方面,2024年,我国煤炭进口量累计达5.4亿t,较2023年同期增加0.68亿t,同比增长14.4%.从进口煤来源国占比来看,我国煤炭进口主要集中于印尼、俄罗斯、蒙古国和澳大利亚四国,我国从这4个国家进口的煤炭数量占我国煤炭进口总量的92.3%.关税也对煤炭价格有一定影响,但是2022—2023年能源危机期间我国对所有国家煤炭实施阶段性零关税,政策稳定性较高.2024年1月1日起,恢复煤炭进口关税.普通税率为20%;特惠税率为0;协定税率基本为0;最惠国税率中,无烟煤、炼焦煤、褐煤为3%,其他煤为6%.按照自贸协定,来自澳大利亚、印尼的进口煤适用的是协定税率,均为0;来自包括俄罗斯、美国、南非、蒙古国等在内的其他国家的进口煤实行最惠国税率,因此关税水平对我国煤炭价格波动影响有限.

地缘政治引起的不确定因素方面,以俄乌冲突为例,这场冲突短期内对我国煤价的影响呈现“先扬后抑”的双重机理.短期煤价因能源替代效应先呈现阶段性上涨,但受俄罗斯增供、国内保供政策及进口结构调整影响,涨幅有限且回落较快,整体呈现“脉冲式上涨后趋稳”的特征.冲突引发全球能源市场动荡,推动全球煤炭作为替代能源的需求激增.带动我国进口煤价同步上涨,进而传导至国内市场煤价短期走高.

煤炭企业库存水平方面,2024年,全年煤炭供需格局持续宽松,煤炭企业库存水平创历史新高,截至年底重点煤炭企业存煤6 800万t、火电厂存煤2.3亿t,可用天数达28 d.高库存抑制市场煤采购需求,尤其在传统旺季(夏季与冬季)因电厂长协资源充足叠加进口补充,煤价“旺季不旺”特征显著.

产能规划与供给政策方面,国家发改委于2024年4月出台的产能储备制度虽未在2024年完全落地,但常规产能释放与进口关税政策调整(协定税率为0)直接扩大了市场供给,导致全年煤价跌幅普遍超过10%.

1.2 需求方面影响因素识别

从需求侧看,动力煤的消耗主要涵盖火力发电、煤化工以及产业链下游(冶金与建材)3个方面.依据中国能源网2025年1月26日发布的数据如图1所示,2024年电力行业消耗动力煤265 106万t,约占63.26%,与2023年相比增长2.47%.化工行业消耗动力煤28 852万t,约占6.88%,与2023年相比增长15.43%.建材行业消耗动力煤27 008万t,约占6.44%,同比下降7.18%.冶金行业方面消耗动力煤17 234万t,约占4.11%,同比下降2.13%.

上述需求侧因素的需求量以及权重结构的变化都会引起需求关系的动态变化,从而影响煤炭价格未来的走势.

1.3 宏观经济方面影响因素识别

居民消费者价格指数(CPI)是衡量通货膨胀水平和居民生活成本变化的关键指标,本文引入CPI旨在反映我国宏观经济的周期性与增长性特征.从周期性来看,CPI上涨通常表示宏观经济处于扩张阶段,此时企业生产规模扩大,居民收入增加,消费能力提升,这会使得对商品和服务的需求增加,从而导致煤价波动.从增长性来看,如果CPI开始上涨,通常预示着经济增长动力增强,煤炭需求上涨,从而导致煤价波动.

2 多模态数据来源与预处理

根据前文影响因素的分析与识别,这里选取的数据主要包含统计数据与新闻文本数据,这2种数据具有显著的结构化和非结构化特征,本文将基于这2种数据的预处理结果,进行多模态数据特征融合,为后续的煤炭价格预测奠定数据基础.

2.1 基于关键影响因素的统计数据获取及预处理

本文选取了环渤海5 500 K动力煤指数、原煤产量、煤炭进口量、全国煤炭企业库存、火力发电量和居民消费者价格指数这5个核心数据指标对煤炭价格预测.其中煤炭价格、原煤产量、煤炭进口量、全国煤炭企业库存来源于中国煤炭市场网,火力发电量和居民消费者价格指数来源于国家统计局.另外,本文以2017年1月至2025年4月期间的环渤海5 500 K动力煤指数为研究样本,对其走势进行分析预测.对收集到的煤炭价格与供给、需求、市场经济三大类变量整理与分析,其最大值、最小值、中位数、平均数和标准差相关统计指标详见表1.

因为煤炭价格的各影响因素时间频度不一致,存在周度和月度2种频度数据,本文使用Python脚本对数据的频度进行转换,统一转换为周度数据,将2017年1月至2025年4月的原煤产量(月)、煤炭进口量(月)、全国煤炭企业库存(月)、火力发电量(月)每月的总量进行等比例均摊到各个周,其计算公式如下:

yu=i=1ndiDi×Yi

式中:yu为第u周的值;n为该周跨越的月份数;di为该周在第i月的天数;Di为第i月的总天数;Yi为第i月的月度值.

对居民消费者价格指数进行线性插值,转换为周度数据,计算公式如下:

yw=(1-α)Ym+αYm+1

式中:yw为第w周的值;α为该周在该月度区间内的位置;Ym为第m月的值;Ym+1为第m+1月的值.

由于各类数据的量纲不一致,为消除各因素的量纲对权重的影响,训练之前对数据进行归一化处理,具体公式如下:

xij'=xij-xjminxjmax-xjmin

式中:xij'为归一化后的第i个样本在第j个指标上的值;xij为归一化前的原始值;xjminxjmax分别为第j个指标的最小值和最大值.

2.2 基于关键影响因素的新闻文本数据获取及预处理

在分析煤炭价格走势时,新闻标题文本中的语义信息与煤炭价格的影响因素密切相关,能够有效辅助预测.根据前文对煤炭价格影响因素的识别,并参考《“十四五”现代能源体系规划》、《2024—2025年中国煤炭市场年度报告》、IEA《Coal 2024/2025》等文件,确定“产能规划、供给政策、行业发展战略、能源结构调整、煤炭进出口价格、动力煤需求、火电领域、火电消耗量占比、供热领域、建材行业、钢铁行业、化工行业、化工煤炭消费量、宏观经济形势、汇率、国际能源价格、俄乌冲突、黑海航运受阻”18个关键词,作为新闻标题文本数据爬取的依据.本文从中国煤炭市场网、中国煤炭经济网、中国能源网、电力网和今日头条等网站获取了2017年1月1日至2025年4月30日期间的行情信息、市场点评等新闻数据共47 193条(见表2).

为提高文本数据的有效性与可利用性,需对原始数据进行预处理.首先,筛选核心字段,仅保留具有实际分析价值的“新闻标题”和“发布时间”2个属性,剔除与预测关联度较低的其他信息.其次,清洗文本内容,去除无实际意义的字符与图标,并删除常见停用词,以提升语料质量和模型输入的准确性.并通过Python中的Jieba库对语句分词,使用Set函数对分词后词序列进行去重处理.例如对“7月全国发电量增9.6%,火电增12.7%,水电降4.3%”清洗分词后得到的词序列为[“全国”、“发电量”、“增”、“火电”、“水电”、“降”].分词后共获得26 437个不重复词.最后,按照日期对数据进行聚合处理,将同一周的多条新闻标题合并,便于后续统一输入模型进行分析.

3 多模态数据驱动下的组合预测模型

3.1 预测模型与算法逻辑框架

本文的模型架构如图2所示.首先将收集的煤炭价格影响因素统计数据和新闻文本分别进行数值投影和RoBERTa编码处理.随后,将处理后的数据分别输入各自的Informer编码器,利用自注意力机制刻画模态内部规律,并通过交叉注意力机制实现数值与文本之间的信息融合,获得跨模态特征.接着,将数值特征、文本特征与跨模态特征进行融合.最后,融合后的特征输入回归预测头,输出对煤炭价格的预测结果.

3.2 模型输入

本文以煤炭价格及相关因素统计数据与新闻标题为数据源构建训练数据集.用于价格预测的2种模态分别为数值模态和文本模态,针对2种模态,分别构建2条输入分支.通过数值投影处理数值模态数据,对新闻文本采用RoBERTa编码,完成文本嵌入.将处理后的数值数据与句向量输入自注意力与交叉注意力模块,以同时捕捉模态内与模态间关系.

3.2.1 数值模态数据处理

将原始数值进行线性映射,便于与文本模态对齐和后续注意力模块输入,其表达式为

rt=Wzzt+bz

式中:ztRdz为第t周的数值特征,即煤炭价格及其影响因素;R为实数集合;dz为数值模态输入向量的维度;WzRd×dzbzRd为可学习参数;d为线性映射后的维度;rtRdz为投影后的周向量.

在各个时间窗口下加入位置信息,本文采用正余弦位置编码对时间序列中的每个位置进行编码,其表达式如式(5)~(8)所示.

pet(t,i)=sint10 000id,i mod 2=0cost10 000i-1d,i mod 2=1

式中:pet(t,i)表示第t周数据的位置编码,为时间序列中的位置索引值;i[0,d)为位置编码向量中的索引值;i mod 2表示i对2的取余结果,用于区分位置编码向量中的偶数维与奇数维.

Rt=[rt-L+1,,rt]RL×d
Pt=[pet-l+1,...,pet]RL×d
X(0)=Rt+Pt

式中:Rt为窗口内的数值内容表示序列;L为时间窗口;Pt为窗口内的时间位置表示序列;X(0)为融合内容与位置的数值序列,后续作为编码器的输入.

3.2.2 文本模态数据处理

使用RoBERTa编码器对文本数据编码,得到文本数据的表示.

et,j=Poolfθtokens(st,j),j=1,,108
e˜t,j=Wtextet,j+btext

式中:et,j为第t周第j条文本经过RoBERTa编码并经池化得到的原始文本句向量;e˜t,j为对et,j进行线性投影后的文本向量;st,j为第t周第j条标题;fθ为RoBERTa编码器;Pool为句向量汇聚表示;WtextRd×dtextbtextRd将RoBERTa 输出与数值分支对齐到同一维度d.

对同一周内的多条标题做加权,得到周级文本表示,即

αt,j=exp(qWae˜t,j)k=15exp(qWae˜t,k),j=1,,5
e¯t=j=15αt,je˜t,j

式中:αt,j为该周第j条新闻的重要性权重;qRdWaRd×d为周内打分参数;e¯tRdt周汇聚后的文本向量.

对周文本向量在各个时间窗口下加入位置信息:

Et=[e¯t-L+1,,e¯t]+Pt  RL×d

式中:Et即为文本时间序列;Pt的位置编码方式与数值模态数据的编码方式相同,见式(5).这里得到的Et与数值时间序列在长度和维度上对齐,便于后续做跨模态注意力.

3.2.3 各模态编码

2条分支分别送入各自的编码器,得到模态内时序表示,如下式所示.

X=Encodernum(X(0))RL×d
U=Encodertext(Et)RL×d

式中:XU为后续自注意力和“数值与文本交叉注意力”的输入;Encodernum,Encodertext分别为数值模态编码器和文本模态编码器.

3.3 Informer模型

Informer是一种基于Transformer的长序列预测改进模型,主要对Transformer进行了3点优化36.标准自注意力在长度为N的序列上计算复杂度为O(N2),Informer通过概率稀疏自注意力把复杂度降到近似O(NlogN).针对深层堆叠会造成显存冗余,Informer采用注意力蒸馏在时间维做下采样以压缩特征.此外,Informer还使用生成式的一步解码器来提升多步预测的推理效率.模型总体结构见图3.

Transformer中提出的自注意力机制是通过使用查询 Q (Query)、键 K (Key)和值 V (Value)来计算序列中各个元素之间的相关性,公式为

A(Q,K,V)=SoftmaxQKdV

式中:QRLQ×dΚRLK×dVRLK×dLQLKLV分别为查询、键、值的矩阵维度;Softmax为激活函数.

概率稀疏自注意力机制是以概率稀疏化自注意力矩阵,将时间复杂度降低至对数的线性复杂度,其第iQ的注意力系数通过概率p的形式定义为

A(qi,K,V)=jκ(qi,kj)lκ(qi,kl)vj=Ep(kjqi)vj

(17)

式中:令p(qi,kj)=κ(qi,kj)lκ(qi,kl)κ为相似度函数;E为期望;p为条件概率;qi为矩阵Qi行;kjvj分别为矩阵K和矩阵V的第j行.

为了量化查询相邻的稀缺性,使用了KL(Kull‑back‑Leibler)散度计算Q向量的概率分布与均匀分布的熵,其中第i个稀疏性度量的定义式为

M(qi,K)=lnj=1LKeqikjd-1LKj=1LKqikjd.

概率稀疏注意力机制可表示为

A(Q,K,V)=SoftmaxQ¯KdV

式中:Q¯为一个和查询矩阵Q形状大小相同的稀疏矩阵,只包含稀疏度量M(qi,K)下的前m个主要查询向量qim由一个恒定的采样因子c控制,m=clnLQ.

针对长序列存在的输入之间的长范围依赖,通过注意力蒸馏机制在内存有限的情况下将单个层级特征时间维度减半,蒸馏机制是采用一维卷积以及最大池化对时间维度进行下采样,从d层到d+1层计算公式为

Xd+1t=MaxPoolELUConvld[Xdt]AB

式中:[Xdt]AB为多头概率稀疏自注意力机制的关键步骤;Convld为一维卷积操作;ELU为激活函数;MaxPool为最大池化操作.蒸馏操作对每一层数序列长度都逐层减半,减少了计算的内存使用.

Informer采用生成式的一步解码器(Decoder),如图3所示,由遮挡的多头注意力机制和遮挡的多头稀疏注意力机制组成,通过掩码操作遮挡多头注意力,避免了模型的自回归现象.

该Decoder的输入为

XDEt=ConcatXtokent,X0tR(Ltoken+Ly)×dmodel

式中:XDEt为学习输入的序列;Xtokent为已知标签序列;X0t为结果的占位符;Concat表示序列拼接操作.

3.4 多模态信息融合网络架构设计

3.4.1 自注意力模块

自注意力网络用于建模各个模态内关系,本文数值数据与文本数据各使用一个Informer单元,其注意力计算公式见式(17).

在多头注意力机制下,第i个注意力头为

headi=A(QWiQ,KWiK,VWiV)

式中:WiQWiKWiV分别为第i个头的查询投影矩阵、键投影矩阵、值投影矩阵.

随后将所有单头注意力拼接并线性变换得到多头注意力:

MT(Q,K,V)=Concat(head1,,headC)WO

(23)

式中:C为注意力头个数;WO为投影权重矩阵.

分别对数值与文本模态取得单模态表示如下:

fn=MT(Qn,Kn,Vn)ft=MT(Qt,Kt,Vt)

(24)

式中:Qn=XWnQKn=XWnKVn=XWnVQt=UWtQKt=UWtKVt=UWtV.2个自注意力模块输出的fnft将用于后续的价格预测.

3.4.2 交叉注意力模块

为刻画不同模态之间的相互作用,本文构建了跨模态交叉注意力机制37.考虑到数值序列能够直接反映煤炭价格的变化状态与结构性约束,在时序预测中承担对目标变量演化的主要解释作用,本文以数值模态作为查询( Q ),以文本模态作为键( K )与值( V ),在时间对齐的基础上,动态检索、按需提取与当前数值状态相关的文本语义证据,将外部信息注入统一的状态表征中.该设计使注意力权重以数值状态为条件进行自适应分配,实现对关键语义的筛选,并围绕预测目标所依赖的主要信息进行跨模态匹配3839.具体公式为

Ant(Qn,Kt,Vt)=SoftmaxQnKtdVt .

i个头与多头交叉注意力分别为

headi(nt)=An-t(QnWiQn,KtWiKt,VtWiVt).
MTnt=Concat(head1(nt),,headC(nt))WntO .

最后,得到跨模态交互特征:

fnt=MTnt .

3.4.3 模态融合

在融合层中,将自注意力与交叉注意力模块的特征向量进行融合,形成一个融合特征向量.令3类特征集合,即S={fn,ft,fnt},设可学习查询向量gRd,融合权重与融合特征向量为

αo=exp(gWffo)uMexp(gWffu)

式中:αo(0,1)为融合权重,满足oMαo=1o,uM为索引标签,M=n,t,nt为索引集合;WfRd×d为线性投影矩阵;foM中某个特定模态的特征向量;fuM中遍历所有模态的特征向量.

fmerged=oMαofo

式中 fmergedRd为融合特征向量.

3.4.4 结果预测

在融合层得到的融合表征fmerged基础上构建回归头,对价格进行预测,回归头一次性输出未来H周的价格向量.

y^t+1:t+H=Wpfmerged+bp

式中:y^t+1:t+HRH为未来1~H周的价格预测结果;WpRH×d为预测权重矩阵;bpRH为预测偏置向量.

LMSE=1BHb=1Bh=1H(y^t+h(b)-yt+h(b))2

式中:LMSE为损失函数;B为批量大小;H为需要连续预测的步长(周数).

4 试验结果分析

本文将处理后的数据按照7∶1∶2的比例划分训练集、验证集和测试集,输入不同模型进行试验.试验采用的操作系统为Windows11,CPU为IntelCorei7‑13700H,运行内存为32 GB,GPU为NVIDIA GeForce RTX 4060Laptop 8 GB,试验的环境配置为Python 3.6.10,Tensorflow 2.6.2,Keras 2.6.0,pandas 1.1.5.

4.1 预测评价指标

为了清晰直观地对不同模型的预测效能进行比较,本文选取了平均绝对误差(MAE,简写为EMA)和均方根误差(RMSE,简写为ERMS)2种常用评价指标,对各模型的预测结果进行综合评估.指标计算公式如下:

EMA=1ni=1nyi-y^i
ERMS=1ni=1nyi-y^i2

式中:yi为第i条样本的真实观测值;y^i为模型对该样本的预测值;n为测试集中的样本总数.

4.2 消融试验

本文Informer模型的初始参数如表3所示. 在其他参数保持不变的前提下,对多头注意力机制的head数及Batch_size进行调整,以确定煤炭价格预测模型的最优参数.

4.2.1 多头注意力机制的head数对模型预测效果的影响

多头注意力的head数是一个重要超参数,对模型的性能和效率有着显著的影响.接下来对不同的heads进行了一系列的试验,并比较了在不同heads条件下预测模型的预测能力(见表4).根据试验需求,设置了2,4,6,8这4种,固定预测步长为4.由表4可知,预测误差呈“U形”趋势,head数量为4时MAERMSE均最小,head数量超过4时轻微过拟合且训练变慢,故head数量为4时模型预测效果最好.

4.2.2 Batch_size对模型的影响

Batch_size为每轮训练的样本数.过大会导致显存不足、收敛变慢,过小会导致频繁更新参数致使稳定性下降.根据试验需求,设置了不同数量的Batch_size,包括8,16,32,64,固定预测步长为4,模型预测效果的影响见表5.综合对比,Batch_size为32时预测误差最小.Batch_size为32时虽收敛,但泛化略弱、对调参更敏感.不同Batch_size间差异较小,均处于可接受范围.

4.3 模型对比试验

本文构建了基于Informer的多模态交叉注意力预测模型,通过多次对比试验,对所构建的预测模型的性能进行分析和测试,探究本模型能否显著提升煤炭价格预测能力.

4.3.1 数值模态下各模型对比

在数值模态试验中,在本文数值数据集上横向对比了ARIMAX,RNN,LSTM,Transformer与Informer 的预测性能(见表6),以检验Informer在长时间序列建模中的优势.结果显示,Informer模型在各个预测步长相比其他模型误差最低,表明Informer模型对长依赖与季节性更为敏感、拟合更稳健.由图4可知,随着预测步长H增大,各模型误差均小幅上升,但Informer的上升斜率最缓,进一步验证了其在长时序场景下的稳定性.

4.3.2 交叉注意力与简单融合对比

为验证交叉注意力机制的有效性,以简单融合(数值矩阵与文本表示矩阵简单拼接)为基准,在每个预测步长上,采用DM检验,基于逐期损失差并用Newey‑West校正获得各步长的p值(见表7).若p<0.05,则判定交叉注意力显著优于简单融合.

表8为交叉注意力与简单融合的误差对比.由表8可见,交叉注意力在所有预测步长上的MAERMSE均更低,其中在预测步长为4时提升效果最显著.DM检验结果中,在预测步长为2,4,8时均在5%显著性水平下通过,说明交叉注意力相对简单融合的改进具有统计显著性.故认为交叉注意力整体优于简单融合,且在中长步长4,8上的优势更稳健.

图5为交叉注意力与简单融合预测结果.相比简单融合,交叉注意力模型在峰值及拐点的预测偏差相对较小,整体误差呈现一定程度的收敛.

4.3.3 文本编码器对比

为评估文本表示对多模态预测的影响,在参数相同的条件下对比BERT与RoBERTa模型,优化器、学习率、窗口、步长等保持一致(见表9).同时构造“将20%标题随机替换为无关短句”的噪声数据集,用以检验模型的鲁棒性(见表10).

表10可知,RoBERTa在所有预测步长上均优于BERT,在加入20%文本噪声时,RoBERTa的退化幅度ΔMAE为0.1721、ΔRMSE为0.2784,小于BERT的退化幅度.因此,本文采用RoBERTa作为文本编码器,以在多步预测中兼顾准确性与稳健性.

5 结 论

1) 本文从供给、需求与宏观经济3个维度分析煤炭价格的影响因素,以2017—2025年环渤海5 500 K动力煤指数为研究对象,提出一种基于RoBERTa、Informer与交叉注意力模块构成的多模态煤炭价格预测模型.

2)在数值模态下,将ARIMAX,RNN,LSTM,Transformer与Informer进行对比,结果表明Informer在不同预测步长上误差相对较低,证明其更适合捕捉煤炭价格的长期依赖和季节性特征.

3) 在多模态条件下,将交叉注意力与简单融合进行比较并进行DM检验,结果显示交叉注意力在中长步长上的预测效果最为突出,能够更充分地利用新闻文本对煤炭价格波动的解释力.

4) 通过对比BERT与RoBERTa,并在加入20%噪声的文本数据上测试鲁棒性,发现RoBERTa在煤炭市场信息扰动较大的背景下更具稳定性.

5) 本文所构建的煤炭价格预测模型可在供需波动背景下为煤炭企业的采购、库存安排与合同定价提供一定的参考,同时亦可为动力煤现货及衍生品市场参与者的价格研判提供辅助性依据.

参考文献

[1]

燕志鹏,于泽民,顾新莲.我国碳排放价格与煤炭期货价格的传导机制研究[J].经济问题2022(6): 67‑74.

[2]

YAN ZhipengYU ZeminGU Xinlian. Research on conduction mechanism between carbon price and coal future price in China[J]. On Economic Problems2022(6): 67-74.

[3]

国家统计局. 中华人民共和国2024年国民经济和社会发展统计公报[EB/OL]. (2025-02-28) [2025-07-01].

[4]

National Bureau of Statistics of China. Statistical Communiqué of the People’s Republic of China on the 2024 National Economic and Social Development[EB/OL].

[5]

张赟懿,苏 彤,王思泉,.行稳方能致远:中国煤炭市场运行特征与价格政策评估[J].管理世界202541(2): 101-119.

[6]

ZHANG YunyiSU TongWANG Siquanet al. Only by standing up can move forward: Assessing the operation characteristics and pricing policy of China’s coal market[J]. Journal of Management World202541(2): 101-119.

[7]

杜克锐,李旻旸,王思泉,.煤炭价格冲击与新能源业务扩张叠加下的企业融资约束[J].经济研究202459(12):4-20.

[8]

DU KeruiLI MinyangWANG Siquanet al. The impact of coal price shocks and new energy business expansion on corporate financing constraints[J]. Economic Research Journal202459(12): 4-20.

[9]

于 左,史俊荣,罗天羽. 竞争企业间部分所有权、去产能政策与中国煤炭价格畸高[J].经济学(季刊)202424(3): 861-877.

[10]

YU ZuoSHI JunrongLUO Tianyu. Partial ownership of competitive enterprises, de-capacity policy and distortional overcharge on coal in China[J]. China Economic Quarterly202424(3): 861-877.

[11]

刘 畅,王旭冉.中国煤炭价格波动与去产能政策的选择[J].西安交通大学学报(社会科学版)202040(3): 101-108.

[12]

LIU Chang WANG Xuran. Influencing factors of coal price fluctuation in China: Based on SVAR model[J]. Journal of Xi’an Jiaotong University (Social Sciences)202040(3): 101-108.

[13]

GUO X PSHI J XREN D F. Coal price forecasting and structural analysis in China[J]. Discrete Dynamics in Nature and Society20162016(1): 1256168.

[14]

WANG CXU GSUN C Let al. Modeling and forecasting of coal price based on influencing factors and time series[J]. Journal of Cleaner Production2024467: 143030.

[15]

JIN XSONG A YHE M F. Short-term thermal coal price forecasting based on EL-CLSTM model[J]. IEEE Access202412: 147364-147371.

[16]

DING Z HFENG C CLIU Z Het al. Coal price fluctuation mechanism in China based on system dynamics model[J]. Natural Hazards201785(2): 1151-1167.

[17]

YANG S LLIU Q HDUAN Z P. Study on the price elasticity problem of China's coal supply and demand[C]//IEEE. 2012 International Conference on Information Management, Innovation Management and Industrial Engineering. Sanya, 20123: 275-277.

[18]

ZHU S QCHI Y YGAO K Yet al. Analysis of influencing factors of thermal coal price[J]. Energies202215(15): 5652.

[19]

ZHAO Z YZHU JXIA B. Multi-fractal fluctuation features of thermal power coal price in China[J]. Energy2016117: 10-18.

[20]

JIANG S MYANG CGUO J Tet al. ARIMA forecasting of China’s coal consumption, price and investment by 2030[J]. Energy Sources, Part B: Economics, Planning, and Policy201813(3): 190-195.

[21]

ZHANG BMA J H. Coal price index forecast by a new partial least-squares regression[J]. Procedia Engineering201115: 5025-5029.

[22]

SHI R YWANG DZHAO Y Y. The effect of international energy market shocks on coal price of China based on the fuzzy integrated vector auto regressive and error correction model[J]. Journal of Intelligent & Fuzzy Systems202140(4): 8451-8461.

[23]

YU LLAI K KWANG S Yet al. Oil price forecasting with an EMD-based multiscale neural network learning paradigm[C]// International Conference on Computational Science. Springer: Berlin, 2007: 925-932.

[24]

刘硕,何永秀,陶卫君,.遗传BP神经网络的煤价预测与煤价风险规避策略[J].华北电力大学学报200936(6):75-80.

[25]

LIU ShuoHE YongxiuTAO Weijunet al. Coal price forecasting based on GABP neural network and risk resistance strategy[J]. Journal of North China Electric Power University200936(6): 75-80.

[26]

KÖLMEK M ANAVRUZ İ. Forecasting the day-ahead price in electricity balancing and settlement market of Turkey by using artificial neural networks[J]. Turkish Journal of Electrical Engineering and Computer Sciences201523(3): 841-852.

[27]

李朋林,梁露露.基于BP神经网络的煤炭价格影响因素及预测研究[J].数学的实践与认识201545(17): 113-126.

[28]

LI PenglinLIANG Lulu. Research on the influence factors and prediction of coal price based on BP neural network [J]. Mathematics in Practice and Theory201517: 113-126.

[29]

GUPTA NNIGAM S. Crude oil price prediction using artificial neural network[J]. Procedia Computer Science2020170: 642-647.

[30]

余乐安.基于人工智能的预测与决策优化理论和方法研究[J].管理科学202235(1):60-66.

[31]

YU Lean. Forecasting and decision optimization theory and methods based on artificial intelligence[J]. Journal of Management Science202235(1): 60-66.

[32]

李星毅,李仲飞,李其谦,.基于机器学习的资产收益率预测研究综述[J].中国管理科学202533(1): 311-322.

[33]

LI XingyiLI ZhongfeiLI Qiqianet al. A review of research on asset return prediction based on machine learning[J]. Chinese Journal of Management Science202533(1): 311-322.

[34]

毕文杰,扶春娟.基于机器学习的Airbnb房源价格预测及影响因素研究:以北京市为例[J].运筹与管理202231(9): 217-224.

[35]

BI WenjieFU Chunjuan. Price estimation and determinants research of Airbnb with machine learning: Based on data from Beijing[J]. Operations Research and Management Science202231(9): 217-224.

[36]

MANDAL PSRIVASTAVA A KSENJYU Tet al. A new recursive neural network algorithm to forecast electricity price for PJM day-ahead market[J]. International Journal of Energy Research201034(6): 507-522.

[37]

HOCHREITER SSCHMIDHUBER J. Long short-term memory[J]. Neural Computation19979(8): 1735-1780.

[38]

ALAMEER ZFATHALLA ALI Ket al. Multistep-ahead forecasting of coal prices using a hybrid deep learning model[J]. Resources Policy202065: 101588.

[39]

QIAO W BYANG Z. Forecast the electricity price of US using a wavelet transform-based hybrid model[J]. Energy2020193: 116704.

[40]

HUANG W YGAO T XHAO Yet al. Transformer-based forecasting for intraday trading in the Shanghai crude oil market: Analyzing open-high-low-close prices[J]. Energy Economics2023127: 107106.

[41]

FATALIYEV KLIU W. MCASP: multi-modal cross attention network for stock market prediction[C]// Proceedings of the 21st Annual Workshop of the Australasian Language Technology Association. 2023: 67-77.

[42]

ZHOU H YZHANG S HPENG J Qet al. Informer: Beyond efficient transformer for long sequence time-series forecasting[C]// Proceedings of the AAAI Conference on Artificial Intelligence, 202135(12): 11106-11115.

[43]

GONG M JYAN C CXU Wet al. Short-term wind power forecasting model based on temporal convolutional network and Informer[J]. Energy2023283: 129171.

[44]

施进炜,张 程,原冬芸.基于数据修正的概率稀疏自注意短期风电功率预测[J].智慧电力202351(10): 54-61.

[45]

SHI JinweiZHANG ChengYUAN Dongyun. Short-term wind power prediction based on data correction with probabilistic sparse self-attention[J]. Smart Power202351(10): 54-61.

[46]

秦 进,胡 冉,毛成辉,.高速铁路日常客运量的EMD-Informer组合预测方法[J].铁道学报202446(2): 1-11.

[47]

QIN JinHU RanMAO Chenghuiet al. EMD-Informer method for prediction of daily passenger flow of high-speed railways[J]. Journal of the China Railway Society202446(2): 1-11.

[48]

杨新湦,游 超,朱承元.基于Informer模型的航班延误预测[J].科学技术与工程202525(19): 8282-8288.

[49]

YANG XinshengYOU ChaoZHU Chengyuan. Flight delay prediction based on Informer modeling[J]. Science Technology and Engineering202525(19): 8282-8288.

[50]

ZHOU H YLI J XZHANG S Het al. Expanding the prediction capacity in long sequence time-series forecasting[J]. Artificial Intelligence2023318: 103886.

[51]

TSAI Y H HBAI S JLIANG P Pet al. Multimodal transformer for unaligned multimodal language sequences[C]// Proceedings of the 57th conference of the Association for Computational Linguistics. Florence, 2019: 6558.

[52]

TAN HBANSAL M. Lxmert: Learning cross-modality encoder representations from transformers[C]// 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). Hongkong, 2019: 5100-5111.

[53]

LU J SBATAR DPARIKH Det al. Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks[C]//Advances in Neural Information Processing Systems32 (NIPS 2019. Vancouver, 2019: 32.

基金资助

国家社会科学基金项目(22BGL110)

AI Summary AI Mindmap
PDF (2922KB)

260

访问

0

被引

详细

导航
相关文章

AI思维导图

/