基于时序大语言模型的污水处理排放指标预测

陶怡 ,  王飞 ,  马玲娜 ,  歹杰 ,  严栋飞

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 560 -572.

PDF (1389KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 560 -572. DOI: 10.14188/j.1671-8836.2024.0168
面向知识图谱和大模型的工业软件

基于时序大语言模型的污水处理排放指标预测

作者信息 +

Prediction of Wastewater Treatment Emission Indicators Based on Temporal Large Language Model

Author information +
文章历史 +
PDF (1422K)

摘要

污水处理厂作为水资源保护的重要设施,其核心任务之一是监控和预测再生水的排放指标。由于污水排放数据具有高复杂度和场景一致性差等特点,传统的时序预测方法效果有限。为此,提出一种新型工业时序预测模型SSP-GLM(Sewage-oriented Serial data Processing Generative Large Model),该模型通过将时间序列划分为子序列,利用深度卷积神经网络(CNN)提取局部特征,并结合生成式大模型(GLM)进行时序推理,提高了预测准确度。基于西安市两处污水处理厂的真实出水数据进行了实验,采用均方误差(MSE)和平均绝对误差(MAE)作为评估指标。结果表明,SSP-GLM在全量样本和小样本学习场景下均优于GRU、DLinear和Autoformer等基线方法,特别是在小样本条件下,其对复杂时序特征的捕捉能力显著增强。SSP-GLM在不同污水处理厂的数据上展现出良好的泛化能力,为工业污水处理的智能化管理提供了有力的技术支持。

Abstract

As a vital facility for water resource protection, monitoring and predicting the discharge indicators of reclaimed water is one of the core tasks of a wastewater treatment plant. Given the high complexity and poor scene consistency of wastewater discharge data, traditional time-series prediction methods are limited in their effectiveness. To address this, a novel industrial time-series prediction model, the Sewage-oriented Serial data Processing Generative Large Model (SSP-GLM), was proposed. This model segments time-series data into subsequences, extracts local features using deep convolutional neural networks (CNNs), and performs time-series reasoning with a generative large model (GLM), thereby enhancing the prediction accuracy. Experiments were conducted using real effluent data from two wastewater treatment plants in Xi’an, with the mean squared error (MSE) and mean absolute error (MAE) as evaluation metrics. The results show that SSP-GLM outperforms baseline methods, such as GRU, DLinear, and Autoformer, in both full-sample and few-shot learning scenarios. In particular, under few-shot conditions, SSP-GLM demonstrates significantly stronger capabilities in capturing complex temporal features. The model also exhibited good generalization across different wastewater treatment plants, providing robust technical support for the intelligent management of industrial wastewater treatment.

Graphical abstract

关键词

工业软件 / 污水处理指标预测 / 生成式大语言模型 / 时序模式预测

Key words

industrial software / wastewater treatment indicator prediction / generative large language model / time-series pattern prediction

引用本文

引用格式 ▾
陶怡,王飞,马玲娜,歹杰,严栋飞. 基于时序大语言模型的污水处理排放指标预测[J]. 武汉大学学报(理学版), 2025, 71(4): 560-572 DOI:10.14188/j.1671-8836.2024.0168

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

水资源是生命体存续的基石。然而,随着工业化进程的加速、城市规模的扩张以及经济的迅猛发展,我国正面临水污染加剧和水资源短缺的严峻挑战。污水处理,通过净化流程以满足排放标准并促进水资源再利用,已成为应对这些挑战的有效策略[1]。鉴于污水处理系统的非线性与复杂性,传统的人工处理模式效率低下[2],因此我国正积极推动污水处理的智能化转型,污水出厂指标的精准预测已成为该领域研究的热点与前沿[3]

近年来,以时序挖掘为代表的深度学习技术已在污水处理指标预测方面展现出显著优势。其中,门控循环单元(Gated Recurrent Unit, GRU)等时序神经网络,凭借强大的信息捕获与存储能力,有效应对长时间序列数据,缓解了梯度消失/爆炸问题,成为该领域内广泛应用的模型[4-5]。例如,Ni等[6]构建了生物过程模型以预测N2O排放,成功处理了反应过程中的非线性复杂特征。Sun等[7]的研究则指出,时序数据中的噪声可能削弱模型预测精度,提出了一种数据驱动的降噪算法,提升了污水处理指标预测的准确性。

尽管深度学习模型在污水处理指标预测上取得了显著进展,但仍面临挑战。首先,污水指标的特征复杂度极高,其在时间窗口内展现出剧烈的波动性,这使得传统机器学习算法难以精准捕捉其复杂的局部特征。其次,污水指标数据的一致性不足,不同水厂在不同时间段的运营模式各异,由此收集到的数据分布不断漂变,极大地限制了模型方法的适用性和推广。数据的一致性不足已成为污水指标预测算法乃至整个工业时序挖掘算法实际应用的重大障碍。

针对算法模型在特定场景适用性差的问题,迁移学习被视为主流解决方案之一[8-12]。然而迁移学习的有效实施依赖于数据丰富的源问题域以训练基础模型。因此,面对污水处理指标数据一致性差、各细分场景样本量小的问题,探索一种更加适应于小样本学习的新方法显得尤为重要。

生成式人工智能已成为解决小样本学习任务的重要范式之一[13-14]。近年来,基于Transformer模型[15]的文本序列处理技术推动了大语言模型(Large Language Model,LLM)的兴起,以GPT-4[16]为代表的LLM已全面覆盖文本、图像等多模态信息的生成。学术界正积极挖掘LLM在时间序列分析领域的潜力[17],初步尝试将LLM在离散文本挖掘方面的优势应用于时间序列的连续数值处理任务中。

针对污水处理指标预测这一具体问题,鉴于时序数据特征的复杂性,通用的大语言模型难以仅凭文本描述提示精确完成时序推理任务。因此,设计更具针对性的工业时序模型,以更好地适应污水处理领域的特定需求,显得尤为重要。

由此,本文采用子序列分块技术,提出了基于时序大语言模型的污水处理排放指标预测模型,称该模型为SSP-GLM(Sewage-oriented Serial data Processing Generative Large Model)。SSP-GLM首先将连续时间序列分割成多个子序列,利用深度卷积神经网络(Convolutional Neural Network,CNN)深入捕捉时序数据的局部特征与复杂动态语义;随后,针对LLM引擎,通过提示词工程将污水时序数据的上下文信息编码为模型可理解的形式,以激发其强大的时序推理能力;最后,利用深度神经网络融合上述特征,并依托LLM引擎生成预测输出。

为验证SSP-GLM的有效性,本文以西安两处污水处理厂的出水数据记录为对象,进行了深入实验分析。

1  前置理论介绍

1.1 时序数据预测

在污水处理领域,时序数据特指随时间变化的水质参数序列,如pH值、溶解氧、生化需氧量、化学需氧量等,它们直接反映了污水处理过程的动态变化,对于过程监控与控制至关重要。

污水处理场景中,时序预测任务的输入通常是一段基于历史(时间)观测值序列。假设该序列为X,则X={xtt=1,2,,T}。其中,xt表示t时刻污水水质指标的采样观测值,T为观测历史的总采样步长。这里观测指标x可以是单一独立指标,也可以是多个关联指标。时序预测的任务则是利用这段历史采样数据,推测未来H个步长的指标数值,即输出是面向未来时刻的预测值序列Y^={y^T+1,y^T+2,,y^T+H}。其中,y^T+h为第T+h个步长的预测值。

时序数据预测算法过程如下:

数据预处理:污水处理厂监测的数据来自现场传感器,往往具有噪声、缺失等问题,初始质量较低。因此,需要对采样观测值序列x进行预处理,可形式化表示为特征变换函数ffeat(X),其输入原始时序数据X,输出为特征空间中的表示X'=ffeat(X)。特征变化可采用异常值过滤、归一化缩放、数据趋势平滑等方法。

子序列分块:基于滑动窗口的时序数据处理,将每个污水指标的完整时间序列划分为部分重叠的子序列,控制时序数据规模,提升数据处理效率。收集处理后数据的关键统计特征,例如平均值、最大值、最小值、中位数、方差、标准差、整体趋势等。

将预处理后的数据和相关统计特征,送入时序挖掘模型M,对历史数据中的序列关联模式进行拟合学习,进而预测出未来指定步长的指标:

Y^=M(X')

输出序列Y^作为对未来时间段的污水水质指标预测结果,可以获得直观的污水水质处理趋势,对未来异常值进行判断,为污水处理相关工艺调整提供决策支持。

尽管时序预测算法模型已相当成熟,但输入数据的质量仍是制约预测准确性的关键因素。低质量的数据,尤其是包含噪声和异常值的数据,即便使用高性能的通用预测模型,也难以产生可靠的预测结果。污水处理厂的时序数据常因采集设备与环境限制而质量不高,加之数据波动频繁、采样间隔短、整体特征复杂,进一步限制了通用时序预测算法的有效性和性能。

1.2 生成式大语言模型

生成式大语言模型(Generative Large Language Models,GLM)是利用大规模文本数据训练的一类模型,擅长根据输入的上下文生成连贯且符合语义的自然语言文本,其核心在于捕捉文本的位置结构和语义信息,预测后续词汇组合的概率分布,目前广泛应用于机器翻译、文本生成、自动对话等领域。

GLM的关键组成部分是分词器和模型主体。分词器作为预处理模块,负责将自然语言文本转换为模型可处理的离散输入形式,通常是词或子词的序列。这一过程称为分词,旨在对文本进行标准化处理,促进模型的有效理解。模型主体则基于这些输入,生成相应的自然语言输出。两者协同工作,共同实现高质量的文本生成。

从形式化定义角度看,给定输入文本序列w={w1,w2,,wN},其中,NN,wi表示第i个词,分词器将其转换为一系列分词子序列S={s1,s2,,sM}MN,这一过程可以表示为:

S=ftokenizer(T)

模型主体是生成式大语言模型的核心计算部分,负责处理分词后的输入序列并生成对应的输出。模型主体通常使用Transformer架构,由多层注意力机制和前馈神经网络组成,能够高效捕捉输入文本中的长距离依赖关系和上下文信息。Transformer模型的核心组件可以描述为:

1) 输入嵌入转换:将离散的分词子序列S转换为连续的嵌入向量E={e1,e2,,eM},其中ei是子词si的嵌入向量,这一过程可表示为:

E=fembed(S)

2) 多头自注意力计算:通过计算输入序列中元素位置间的依赖关系,捕捉序列中的全局语义信息。自注意力机制通过计算查询(Query)、键(Key)和值(Value)的加权和来实现。对于输入序列中的每个向量ei,注意力权重计算公式为:

Attention(Q,K,V)=softmaxQKTdkV

其中QKV分别表示查询、键和值矩阵,dk是向量的纬度。

3) 前馈神经网络:经过注意力机制处理的嵌入向量会传递到前馈神经网络中,进行非线性变换。前馈神经网络的输出FFN(E)可以表示为:

FFN(E)=ReLU(W1E1+b1)W2+b2

其中,W1,W2b1,b2是神经网络的权重和偏置参数。

4) 输出层:经过多层注意力机制和前馈网络处理后,最终生成的向量会通过线性变换和softmax函数,转化为每个子词的概率分布,预测下一个词的符号。输出表示为:

P(si+1|s1,s2,,si)=softmax(Wohi+bo)

其中,hi是输入序列的隐藏表示,Wobo是输出层的参数。

基于分词器和Transformer模型主体,生成式大语言模型的整体推理流程为:

• 输入自然语言文本T经分词器转化为子词序列S

• 模型主体通过输入嵌入、自注意力机制和前馈网络处理S,生成隐藏表示H

• 输出层根据隐藏表示H预测下一个词或符号的概率分布,生成输出文本;

生成式大语言模型的核心处理逻辑在于,利用分词器作为数据感知工具,将文本数据映射至其语义空间中的向量表示。随后,通过Transformer模型对这些向量进行学习和预测。由于生成式大语言模型本质上是为处理文本序列数据而设计的,它难以直接应用于工业时序指标的数字序列处理。因此,需要进行模态空间的转换,并采用提示词工程技术向模型补充必要的任务背景信息,以克服这一局限性。

2  本文方法

基于上述前置理论,本文提出SSP-GLM(如图1)以初始污水指标时序数据为输入,未来时序数据为输出。具体步骤如下:

1) 实施子序列分块处理,生成高效并行处理的数据块。

2) 采用CNN进行子序列特征提取,作为初步处理环节。

3) 将提取的子序列特征输入至冻结的大模型引擎中,利用其强大的推理预测能力进行处理。

4) 提取当前时序预测任务的情境描述文本,作为提示词输入,以激活大模型的任务推理能力。

5) 根据任务指定的预测步长,输出时序预测结果。

2.1 子序列分块处理

每个输入的指标时间序列X首先被划分为部分重叠的子序列,每个子序列采样长度为P,两个连续子序列间的非重叠采样区间步长为λ,则子序列分块过程将生成Q块的子序列,即Q=(L-P)/λ+2。在分块前,会复制原始输入序列末尾的值,以λ为步长生成填充值,确保子序列划分的完整性。

通过子序列分块策略,模型单次输入的时序数据步长从L缩减至约L/λ,显著降低了后续模型的计算复杂度,并减少了对计算机内存及GPU显存的要求。此外,采用部分重叠的子序列设计,确保了模型能接触到更长的历史时序数据,从而更全面地捕捉时序数据的内在规律模式,有助于提升预测性能。

2.2 卷积特征提取

如前文所述,污水指标时序数据特征复杂,兼具显著随机波动与普遍采集噪声,故需精准提取其核心特征,以保障后续模型学习拥有优质数据。在处理此类时间序列数据时,卷积神经网络(CNN)凭借其局部连接与权重共享特性,能高效捕捉序列中的局部特征及时间模式。本文提出一种基于CNN的时间序列特征提取方法,具体实现步骤如下:

• 输入层:输入序列X¯=(x¯1,x¯2,,x¯L),其中,L表示时间步长,每个x¯t表示t时刻的特征值。

• 卷积层:输入序列通过卷积层进行处理,该层由多个卷积核(或滤波器)组成,每个卷积核k对应的一个权重向量wkRF,其中F表示卷积核的宽度。卷积操作定义为:

zk,t=τ=1Fxt-τ+1wk,τ+bk

其中,zk,t表示第k个特征映射在时间点t的值,bk为偏置项。所有K个卷积核产生的特征映射Z=(z1,t,,zK,t)构成了下一层的输入。

• 激活函数:为了引入非线性,卷积层的输出通过激活函数f进行转换,常用的激活函数为ReLU(Rectified Linear Unit):

z^k,t=max(0,zk,t)

其中,z^k,t表示经过激活函数处理后的特征值。

• 池化层:为了降低特征维度并提取关键信息,卷积层的输出通过池化层进行处理。最大池化操作定义为:

pk,s=maxtSsz^k,t

其中,pk,s表示第k个特征映射在池化窗口Ss内的最大值。

• 全连接层:最后,通过全连接层将提取的特征映射到最终的输出空间。全连接层输出定义为:

y^=σ(WfP+bf)

其中,σ表示激活函数,Wfbf分别表示全连接层的权重矩阵和偏置向量,P为当前采样时间窗口内全部特征向量组成的矩阵。

上述步骤能够有效地从污水时序子序列数据中提取关键特征,过滤噪声干扰,便于进行后续分析和预测任务。

2.3 面向大语言模型的转换输入

获取污水指标子序列的初步特征后,需进一步利用大语言模型引擎进行预测。鉴于现有GLM(如Llama3)已内置通识智能,只需将时序特征向量融入其语义空间,由大模型引擎直接进行预测,同时保持大模型参数冻结,不参与训练迭代过程。

需特别注意的是,子序列特征向量属于时序模态,而LLM引擎原生支持的是文本模态。为实现两种模态的对接,需激活大模型对时间序列的理解和推理能力。参照文献[18]的方法,以LLM分词器的词汇维度为基准,扩展其文本模态空间,并通过前馈神经网络将时序特征映射至该空间,从而获得模态转换后的子序列特征向量x。该向量将作为LLM推理的核心输入,提升预测精度。

x=ftokenizer(x')

2.4 时序提示词激活

大模型引擎在处理污水指标子序列特征时,面临非通用智能识别,需借助额外提示词激活其理解能力[19-20]。借鉴图像等模态的提示词处理策略,本文将污水指标预测任务的相关统计特征和背景信息整合为前缀,以丰富提示词内容,具体包括:

1) 任务背景:阐述污水指标含义及真实工业场景。

2) 任务需求:概述预测任务的输入输出要求。

3) 输入统计特征:介绍训练输入数据的统计特征,如最大值、最小值、均值、标准差等。

图1所示,这些提示词确保大模型引擎全面掌握任务背景、指令及数据模式,全面激活其时序推理能力。

获取完整的提示词后,将其输入大模型分词器,生成对应的语义嵌入向量,作为大模型引擎的另一关键输入。

2.5 基于大语言模型的预测输出

通过2.3和2.4两个步骤,分别获得了时序特征转换向量x和时序提示词向量q,基于深度神经网络fmerge(·)融合后输入大语言模型引擎,再经过神经网络fout(·)处理获得最终的预测输出,即满足时序预测任务要求的指定步长时序数据y^

y^=fout(FLLM(fmerge(x+q)))

基于预测值和真实值,在此对整体SSP-GLM训练的损失函数进行定义:

L=1Hh=1H||Y^h-Yh||F2

其中,Y^h为预测值,Yh为真实值。需指出的是,本文提出的SSP-GLM框架中,大模型引擎参数被冻结,仅其他神经网络参数参与训练迭代,如负责指标子序列特征提取的CNN网络,以及负责特征转换与融合的前馈神经网络等。此策略确保了整体架构的高效训练。

3  实验和结果分析

3.1 数据来源

与西安市水务局合作,对其下辖两处污水处理厂的出水水质指标进行了预测实验。其中,污水处理厂A主要负责生活污水处理,污水处理厂B主要负责生产废水处理;两处污水处理厂均采用A2/O工艺,设计日处理能力为1.0×105 m3,平均日处理量为2.59×104 m3,遵循《城镇污水处理厂污染物排放标准》(GB 18918—2002)中的一级A类标准,支撑西安市周边水体环境改善、水污染治理、水质保护及生态平衡维护。

预测指标包括流量(FLOW/(m³·h))、化学需氧量(COD/(mg·L-1))、氨氮NH3-N含量(mg·L-1)、酸碱度(pH)、总磷(TP/(mg·L-1))及总氮(TN/(mg·L-1))等出水水质指标。其中,流量反映污水处理厂处理能力;化学需氧量反映水体有机物含量;氨氮含量体现水体营养化程度;pH值影响微生物活性与设备安全;总磷与总氮是水体富营养化的主要诱因。这些指标是污水处理工艺效果的核心标尺,利用时序预测算法对水质趋势进行预测,能够提高水质控制的精准度,减少运营成本,增强污水处理过程的稳定性和可靠性。数据均源自两处污水处理厂的实时采集监测系统,通过各项指标对应的传感器每秒采集一条记录并同步存入工业库,每条记录包含时间戳、各污水指标的浓度值以及相关的运营参数(如曝气量等),确保了数据的真实性和代表性。

3.2 数据预处理

实验数据集分别由污水处理厂A和B的FLOW、COD、NH3-N、pH、TN、TP共计6项指标的时间序列数据构成,每项指标收集10 000条有效采样数据,每个污水处理厂共计60 000条时序数据。

在进行时序预测之前,为确保数据质量和模型训练的顺利进行,对原始采样数据进行了以下预处理:

• 数据清洗:去除重复记录、缺失值过多的记录以及明显错误的记录。

• 异常值处理:采用统计方法(如3σ原则)或机器学习算法(如孤立森林)检测并处理异常值,以提高数据的准确性。

• 数据归一化:对污水指标浓度值进行归一化处理,消除不同指标量纲的影响,提高模型的收敛速度和预测精度[21]

• 时序特征提取:根据时间序列数据的特性,提取如滑动窗口平均值、标准差等时序特征,以增强模型对时序数据的捕捉能力。

• 数据划分:将每项水质指标数据按8∶1∶1的比例划分为训练集、验证集与测试集,且对于每项指标而言,训练集、验证集、测试集保持时间的先后顺序,用于模型的训练、验证和评估。

通过上述预处理步骤,得到了一个高质量、适用于时序预测任务的污水指标数据集。数据集的各项统计特征如表1所示。

3.3 对比基线方法

本文实验采用的对比基线方法有GRU[22]、DLinear[23]及Autoformer[24],具体介绍如下:

GRU,作为递归神经网络(RNN)的一种变体,专为处理序列数据设计。多层GRU通过堆叠多个GRU层,显著增强了模型的表达能力,尤其擅长处理时间序列数据,自然地捕捉序列间的依赖关系,即便面对较长的序列也游刃有余。它能够有效地捕捉长期依赖关系,因此在某些序列预测任务中展现出卓越性能。该模型广泛应用于语言建模、机器翻译及时间序列预测等强时间依赖性任务。

DLinear则聚焦于深度神经网络中的线性部分,由多个全连接层构成。其工作原理首先是通过移动平均核和残差(季节性)分量将原始数据输入分解为趋势分量,随后对每个分量应用两层线性层,并将这两组特征相加以获取最终预测。DLinear通过显式处理趋势,显著提升了在数据具有明显趋势时的预测性能。

Autoformer则致力于通过自动化搜索与设计优化Transformer架构。它保留了残差连接与编码器-解码器结构,但创新性地引入了分解预测架构,通过嵌入分解块作为内部算子,逐步将长期趋势信息与预测的隐藏变量有效分离,从而实现了对Transformer架构的革新与优化。

3.4 对比指标

在污水处理领域,均方误差(MSE)和平均绝对误差(MAE)是评估预测模型性能的常用指标,它们用于衡量预测结果与实际观测值之间的误差[17-18]。MSE是预测值与实际观测值之差平方期望值,对异常值较为敏感;MAE是预测值与真实值之差的绝对值的期望值,更为直观。它们的计算公式分别如下:

MSE=1ni=1n(yi-yi^)2
MAE=1ni=1nyi-yi^

其中,yi是真实值,yi^是预测值,n是样本数量。

3.5 对比任务

本文将从污水指标的长序列预测和短序列预测两方面验证SSP-GLM的性能。

长序列预测为基于512个历史采样点数据序列,预测96个未来的采样数值,其定义如下:

Y^96=F(X512)

其中,F(·)是参与任务的时序预测模型,X512是长度为512的指标历史数据序列X512=(x1,x2,,x512)Y^96是长度为96的指标预测数据序列Y^96=(y^1,y^2,,y^96)

短序列预测为基于24个历史采样点数据序列,预测12个未来的采样数值,其定义如下:

Y^24=F(X12)

其中,X24是长度为24的指标历史数据序列X24=(x1,x2,,x24)Y^12是长度为12的指标预测数据序列Y^12=(y^1,y^2,,y^12)

可以看到,长序列预测的输出序列更长,其预测难度比短序列预测更高。

在此基础上,本文对训练集规模进行控制,对每项预测任务分别让训练集的100%和后10%的数据参与训练,构造出全量样本和小样本的实验场景,分析各模型的泛化性。

综上,本文的实验中有4种时序预测模型,每种模型均会参与6项污水指标的预测对比,且每项指标需要进行4组预测:(长序列,100%样本),(长序列,10%样本),(短序列,100%样本),(短序列,10%样本)。

3.6 实验环境

本文使用了GPT2[25-27]作为SSP-GLM的大模型引擎底座,LLAMA[28]和BERT[29]作为替换的两个大模型底座,在4.3小节会详细探讨其预测性能差异。实验环境为CPU:13th Gen Intel(R) Core(TM) i9-13900K,GPU:GeForce RTX 4090(显存:24 GB),操作系统:Windows Server 2016。所有数据处理脚本均使用Python语言编写,基于PyTorch深度学习框架实现。

4  实验结果与评估

4.1 整体方法性能对比

对于污水处理厂A和B的水质数据,首先进行100%全量样本下的整体方法性能对比。

污水处理厂A的结果如表2所示。分析表2数据,可以看到经典GRU方法的各项指标数值最大,预测效果最差;这主要是因为其不擅长处理长序列数据。DLinear方法优于Autoformer,这得益于DLinear方法针对时序关联捕捉设计了专用的双线性回归算法,而Transformer类模型的自注意力机制并不擅长捕捉时序元素的位置关联。SSP-GLM相比DLinear、Autoformer和GRU方法,基于T-MSE指标的最大下降幅度分别为5.96%、16.44%和36.88%,基于T-MAE指标的最大下降幅度分别为4.14%、16.42%、27.97%,这体现了训练数据充足的情况下,SSP-GLM可以更全面地捕捉动态复杂时序特征。此外,各个算法的性能指标差距不大,这说明100%全量训练样本能够很好地支撑算法训练。

污水处理厂B的结果如表2所示。由于污水处理厂B负责处理工业生产废水,相比A负责处理的生活废水,其整体出水指标特征更加复杂,时序预测难度更大,MSE、MAE指标值更高。具体分析表2数据,可以看到经典GRU方法的T-MAE指标在NH3-N和FLOW指标的预测胜过Autoformer,这源于GRU算法对时序元素位置的有效捕捉,即使只是捕捉了较短序列,相比之下Autoformer完全不擅长处理时序位置信息,故预测性能受限;其次,DLinear方法仍然是3个基线对比方法中的最优方法。相比DLinear、Autoformer和GRU方法,SSP-GLM基于T-MSE指标的最大下降幅度分别为1.43%、8.61%和51.92%,基于T-MAE指标的最大下降幅度分别为2.23%、8.73%和51.73%,这与污水处理厂A指标预测性能的表现基本一致。

100%全量样本短序列预测结果见表3。对比表2,污水处理厂A短序列预测因输出序列更短,预测难度相对较低,整体指标值小于长序列预测。由表3可见,4种时序预测方法的性能排名整体保持不变,其中DLinear方法性能有所提升,在部分指标下优于SSP-GLM,这体现了低难度时序预测任务下,充足的训练数据可以确保算法的优秀预测表现。GRU方法相比其他方法的差距更大,推测是因为短序列预测任务的输入与输出序列长度比较大,限制了GRU预测性能。相比DLinear、Autoformer和GRU方法,SSP-GLM基于T-MSE指标的最大下降幅度分别为1.43%、8.61%、51.92%,基于T-MAE指标的最大下降幅度分别为2.23%、8.73%和51.73%;整体而言算法间性能差距相比全量样本长序列预测更小。

与污水处理厂A相比,污水处理厂B整体预测性能表现更差,表明污水处理厂B出水指标的特征复杂性。由表3可见,4种预测方法的整体排名保持不变,但本文提出的SSP-GLM性能相较其他3种方法的领先幅度更加明显。相比DLinear、Autoformer和GRU方法,SSP-GLM基于T-MSE指标的最大下降幅度分别为23.47%、34.92%、55.99%,基于T-MAE指标的最大下降幅度分别为10.51%、21.97%和58.00%,这说明在更加复杂的时序预测任务中,SSP-GLM对动态特征的全面捕捉能够提供更精准的预测结果。

4.2 小样本训练对比

如前文所述,污水处理指标预测面临着场景数据一致性差,模型难以泛化的挑战。为验证本文引入的LLM能够发挥其小样本学习能力[30],本小节遵循文献[31]中的设置,在10%小样本训练数据的条件下对4种时序预测方法进行评估。

在污水处理厂A数据基础上,长序列与短序列的10%小样本学习结果汇总于表4。与表2相比,可以看到长序列训练样本规模缩减后,表4中各模型预测结果受到不同程度影响:Autoformer性能显著下滑,整体表现不及GRU,这进一步印证了Transformer类模型在处理时序位置特征时的局限性;经典GRU方法则出乎意料地成为第二优的算法,仅次于SSP-GLM。对此本文推测主要是10%小样本场景的训练样本规模更小,适合GRU算法发挥其性能优势,而100%全量样本场景下训练样本规模更大,GRU算法缺乏对序列模式的记忆能力,故预测效果不佳。在10%小样本学习条件下,相比DLinear、Autoformer和GRU方法,SSP-GLM基于T-MSE指标的最大下降幅度分别为45.69%、51.47%和39.07%,基于T-MAE指标的最大下降幅度分别为45.67%、51.34%和36.19%,领先优势相比100%全量样本场景更加明显,这体现了本文所提SSP-GLM方法对小样本场景的优秀适用性,而这种优秀性能正源自LLM的高泛化性。

表4中污水处理厂A的短序列预测任务性能表现,可以看到样本规模的减少同样显著影响了模型的预测性能。值得注意的是,GRU性能表现整体排名第三。本文推测,一方面其适合处理小样本下的时序预测,故性能优于Autoformer;另一方面,短序列预测任务的输入序列与输出序列长度比例大,故GRU预测效果不如DLinear与SSP-GLM。相比DLinear、Autoformer和GRU方法,SSP-GLM的短序列T-MSE指标最大下降幅度分别为16.80%、66.81%和64.19%,基于T-MAE指标的最大下降幅度分别为15.45%、56.23%和69.01%,展现出了更大的领先优势,说明对LLM的引入有效解决了污水指标预测的场景数据不一致问题,能实现更具泛化性的预测输出。

在污水处理厂B数据基础上,长序列与短序列的10%小样本学习结果汇总于表5。整体而言,预测性能指标的数值比污水处理厂A更高,整体表现更差;4种方法的性能表现排名与污水处理厂A相似,除了DLinear方法在小样本长序列预测任务中表现最差,本文推测对于时序特征更复杂的污水处理厂B的数据,在进行难度更高的长序列预测时,结构相对简单的DLinear算法难以捕捉时序变化规律,故性能表现受限。与其他三种方法相比,SSP-GLM方法仍然保持了性能领先,验证了LLM的引入确保了整体模型在两个不同污水处理厂数据基础上都保持了良好的预测泛化性。

4.3 模型基座探索

为了进一步探索不同LLM基座的预测效果,本文分别将SSP-GLM的大模型基座替换为GPT2、BERT和LLAMA(3B参数版),将长序列和短序列预测性能指标结果展示于表6

分析长序列预测的结果发现,在100%全量样本条件下:

对于COD、FLOW和TP指标,GPT2的预测结果优于BERT和LLAMA。

而在pH、NH₃-N和TN指标上,LLAMA则展现出更好的预测性能,超越GPT2和BERT。

在10%的小样本预测场景下,对于FLOW指标,BERT、GPT和LLAMA的预测结果一致。

分析短序列预测任务,结果呈现出不同的趋势,在100%全量样本条件下:

对于TN指标,BERT的预测效果最佳,超过GPT2和LLAMA。

而在pH、NH3-N和FLOW指标上,LLAMA的预测结果则优于GPT2和BERT。

进一步观察10%小样本条件,发现GPT2在COD、TP和TN这3个指标上的预测结果优于BERT和LLAMA。

除了预测性能指标值,LLM底座的效率也很重要。本文探究了不同模型底座下SSP-GLM的整体效率分析,包括训练时显存最大占用值(图2)及每个训练周期的平均耗时(图3)。整体而言,性能消耗的关键差异在于序列长短及样本比例;对于同一模型基座,短序列与小样本预测的性能消耗相对较低。因此,SSP-GLM的总体效率受限于所选模型基座(如GPT2、BERT、LLAMA)。

表6表明,GPT2与LLAMA的预测指标优于BERT;图2图3则揭示了LLAMA相较于GPT2的消耗更大。综合考虑预测结果的准确性和性能消耗,本文最终选定GPT2作为SSP-GLM的模型基座。

5  结 语

针对工业污水指标预测中的时序数据挖掘挑战,即局部特征复杂与泛化能力不足,本文提出SSP-GLM大模型,该模型基于子序列分块技术。通过深度融合深度卷积神经网络与生成式大语言模型技术,实现了对污水时序数据的高效处理与精准预测。

尽管本文提出的污水预测大模型SSP-GLM在实验中展现出了良好的预测性能,特别是在10%小样本条件下对时序数据复杂特征的捕捉预测,但仍然有改进的空间。首先,SSP-GLM依赖于已处理的污水处理厂历史数据训练,而在实际应用中,许多污水处理厂可能面临数据稀缺或数据质量不高的问题,可以使用数据插值、生成对抗网络(GANs)等方法生成更多样化的训练数据,或通过数据清洗、异常值检测和处理等方法提高数据质量。其次,本文的模型设计主要针对污水处理指标预测任务,虽然通过情境信息提示词增强了模型的泛化能力,但对其他污水指标时序预测任务的适用性仍有待验证,可以在不同污水处理厂、不同时间段和不同污水指标上的测试,或将情境信息提示词与其他特征进行更深入的融合,以提高模型的泛化能力。再者,SSP-GLM在训练和推理过程中需要较高的计算资源,特别是在实时预测场景中,高计算成本可能导致预测延迟增加,影响污水处理的及时性和效率,可以使用剪枝、量化等方法来减小模型大小和提高计算效率,采用近似计算或增量学习等方法来减少计算量,从而降低预测延迟。最后,模型的可解释性有待提高,目前其内部工作机制仍然是一个“黑箱”,这可能导致对模型预测结果的信任度降低,特别是在涉及公共安全和环境保护等关键领域,可以引入特征重要性分析、模型结构可视化等可视化工具和技术,来揭示模型内部的工作机制和决策过程,同时引入领域知识和专家经验来进一步增强模型的可解释性和可信度。

参考文献

[1]

HAMOOD ALTOWAYTI W ALISHAHIR SOTHMAN Net al. The role of conventional methods and artificial intelligence in the wastewater treatment: A comprehensive review[J]. Processes202210(9): 1832. DOI:10.3390/pr10091832 .

[2]

胡鹤轩, 孙昕远. 人工智能技术在模拟预测和优化污水处理中的应用[J]. 环境污染与防治202345(11): 1587-1590. DOI:10.15985/j.cnki.1001-3865.2023.11.018 .

[3]

HU H XSUN X Y. Application of artificial intelligence technology in simulation,prediction and optimization of wastewater treatment [J]. Environmental Pollution & Control202345(11): 1587-1590. DOI:10.15985/j.cnki.1001-3865.2023.11.018(Ch ).

[4]

WANG Y QWANG H CSONG Y Pet al. Machine learning framework for intelligent aeration control in wastewater treatment plants: Automatic feature engineering based on variation sliding layer[J]. Water Research2023246: 120676. DOI:10.1016/j.watres.2023.120676 .

[5]

WAN K YDU B XWANG J Het al. Deep learning-based intelligent management for sewage treatment plants[J]. Journal of Central South University202229(5): 1537-1552. DOI:10.1007/s11771-022-5036-3 .

[6]

YU YSI X SHU C Het al. A review of recurrent neural networks: LSTM cells and network architectures[J]. Neural Computation201931(7): 1235-1270. DOI:10.1162/neco_a_01199 .

[7]

NI B JYE LLAW Yet al. Mathematical modeling of nitrous oxide (N2O) emissions from full-scale wastewater treatment plants[J]. Environmental Science & Technology201347(14): 7795-7803. DOI:10.1021/es4005398 .

[8]

SUN S CBAO Z YLI R Yet al. Reduction and prediction of N2O emission from an Anoxic/Oxic wastewater treatment plant upon DO control and model simulation[J]. Bioresource Technology2017244: 800-809. DOI:10.1016/j.biortech.2017.08.054 .

[9]

THEODORIS C VXIAO LCHOPRA Aet al. Transfer learning enables predictions in network biology[J]. Nature2023618(7965): 616-624. DOI:10.1038/s41586-023-06139-9 .

[10]

ARDALAN ZSUBBIAN V. Transfer learning approaches for neuroimaging analysis: A scoping review[J]. Frontiers in Artificial Intelligence20225: 780405. DOI:10.3389/frai.2022.780405 .

[11]

PISA IMORELL AVILANOVA Ret al. Transfer learning in wastewater treatment plant control design: From conventional to long short-term memory-based controllers[J]. Sensors202121(18): 6315. DOI:10.3390/s21186315 .

[12]

CHEN J GHAN X BSUN Tet al. Analysis and prediction of battery aging modes based on transfer learning[J]. Applied Energy2024356: 122330. DOI:10.1016/j.apenergy.2023.122330 .

[13]

ZHANG J WLIANG X YZENG L Zet al. Deep transfer learning for groundwater flow in heterogeneous aquifers using a simple analytical model[J]. Journal of Hydrology2023626: 130293. DOI:10.1016/j.jhydrol.2023.130293 .

[14]

MASUKO TTOKUDA KKOBAYASHI Tet al. Voice characteristics conversion for HMM-based speech synthesis system[DB/OL]. [2024-06-25]. DOI: 10.1109/icassp.1997.598807 .

[15]

SOSIAWAN A YNOORAENI RSARI L K. Implementation of using HMM-GA in time series data[J]. Procedia Computer Science2021179: 713-720. DOI:10.1016/j.procs.2021.01.060 .

[16]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[DB/OL].[2023-07-18]. DOI: 10.1007/978-3-031-84300-6_13 .

[17]

ACHIAM JADLER SAGARWAL Set al. GPT-4 technical report[EB/OL]. [2024-02-02]. DOI: 10.2172/973574 .

[18]

JIN MWEN Q SLIANG Y Xet al. Large models for time series and spatio-temporal data: A survey and outlook[EB/OL]. 2023: 2310.10196.

[19]

YANG H C HTSAI Y YCHEN P Y. Voice2Series: Reprogramming acoustic models for time series classification[DB/OL]. [2024-09-10].

[20]

YIN S KFU C YZHAO S Ret al. A survey on multimodal large language models[EB/OL]. 2023: 2306.13549. DOI: 10.1093/nsr/nwae403 .

[21]

TSIMPOUKELLI MMENICK J LCABI Set al. Multimodal few-shot learning with frozen language models[DB/OL].[2024-09-10].

[22]

HUANG LQIN JZHOU Yet al. Normalization techniques in training DNNs: Methodology, analysis and application [DB/OL]. [2024-07-05]. DOI: 10.1109/tpami.2023.3250241 .

[23]

吴婧, 廖明潮. 基于CA-GRU的污水处理厂出水总氮浓度预测研究[J]. 自动化仪表202445(4): 97-100. DOI:10.16086/j.cnki.issn1000-0380.2023040088 .

[24]

WU JLIAO M C. Research on prediction of total nitrogen concentration in wastewater treatment plant effluent based on CA-GRU[J]. Process Automation Instrumentation202445(4): 97-100. DOI:10.16086/j.cnki.issn1000-0380.2023040088(Ch ).

[25]

ZENG A LCHEN M XZHANG Let al. Are transformers effective for time series forecasting?[J]. Proceedings of the AAAI Conference on Artificial Intelligence202337(9): 11121-11128. DOI:10.1609/aaai.v37i9.26317 .

[26]

WU HXU JWANG Jet al. Autoformer: Decomposition transformers with auto-correlation for long-term series forecasting[DB/OL].[2024-07-05].

[27]

GUO Y CDING G GHAN J Get al.Zero-Shot learning with transferred samples[DB/OL]. [2024-07-10]. DOI: 10.1109/tip.2017.2696747 .

[28]

GRAVE EJOULIN AUSUNIER N. Improving neural language models with a continuous cache[EB/OL]. 2016: 1612.04426.

[29]

BUDZIANOWSKI PVULIĆ I. Hello, it’s GPT-2 —How can I help you? Towards the use of pretrained language models for task-oriented dialogue systems[EB/OL]. 2019: 1907.05774. DOI: 10.18653/v1/d19-5602 .

[30]

TOUVRON HLAVRIL TIZACARD Get al. LLaMA: Open and efficient foundation language models[EB/OL]. 2023: 2302.13971.

[31]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding[EB/OL]. 2018: 1810.04805. DOI: 10.18653/v1/n18-2 .

[32]

LIU XMCDUFF DKOVACS Get al. Large language models are few-shot health learners[EB/OL]. 2023: 2305.15525.

[33]

ZHOU TNIU PWANG Xet al. One fits all: Power general time series analysis by pretrained LM[J]. Advances in Neural Information Processing Systems202336: 43322-43355.

基金资助

陕西省重点研发计划(2025CY-YBXM528)

AI Summary AI Mindmap
PDF (1389KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/