基于聚类分析法的太原地区冬季太阳能供暖气象分类研究

刘国禄 ,  雷勇刚

太原理工大学学报 ›› 2026, Vol. 57 ›› Issue (3) : 640 -648.

PDF (3420KB)
太原理工大学学报 ›› 2026, Vol. 57 ›› Issue (3) : 640 -648. DOI: 10.16355/j.tyut.1007-9432.20230209
土木工程

基于聚类分析法的太原地区冬季太阳能供暖气象分类研究

作者信息 +

Meteorological Classification of Solar Heating in Taiyuan Region in Winter Based on Cluster Analysis Method

Author information +
文章历史 +
PDF (3501K)

摘要

目的 为改善北方地区利用太阳能供暖的效果,开展基于聚类分析的气象参数分类研究。 方法 通过分析各类气象参数对太阳能供暖的影响,以环境温度和太阳辐照强度作为聚类指标,选取6个一级指标和1个二级温度序列指标作为聚类指标,采用k-means方法对太原地区冬季(110个气象日)进行聚类分析,通过轮廓系数评估组内、组间不相似度,最终将110个气象日分为14类,针对每个类别选取典型天。 结果 结果表明,当轮廓系数大于0.62时,时间间隔不影响环境温度聚类效果,14个组别内样本温度变化和辐射变化规律相似,组间温度变化和辐射变化差异明显,聚类结果合理,选取每组中与类中心距离最小的气象日作为典型天。

Abstract

Purposes In order to improve the effect of solar heating in northern China, a classification research method of meteorological parameters based on clustering analysis is proposed. Methods By analyzing the influence of various meteorological parameters on solar heating effect, environmental temperature and solar radiation intensity were determined as clustering indices. Six first-level indices and one second-level temperature series index were selected as clustering indices. k-means method was used to cluster and analyze the winter (110 meteorological days) in Taiyuan area, and contour coefficient was used to evaluate the dissimilarity within and between groups. Finally, the 110 meteorological days were divided into 14 categories, and the typical days were selected for each category. Results The results show that, when the contour coefficient is greater than 0.62, the time interval does not affect the clustering effect of ambient temperature. The sample temperature and radiation changes in the 14 groups are similar, the difference between the temperature and radiation changes is obvious, and the clustering results are reasonable. The meteorological day with the smallest distance from the center of each group is selected as the typical day.

Graphical abstract

关键词

k-means聚类 / 轮廓系数 / 典型天

Key words

k-means clustering / silhouette coefficient / typical meteorological day

引用本文

引用格式 ▾
刘国禄,雷勇刚. 基于聚类分析法的太原地区冬季太阳能供暖气象分类研究[J]. 太原理工大学学报, 2026, 57(3): 640-648 DOI:10.16355/j.tyut.1007-9432.20230209

登录浏览全文

4963

注册一个新账户 忘记密码

为降低碳排放,我国北方部分地区以电热水器或燃气热水器取代传统的煤炉供暖,但是直接采用电加热水的方式会造成能源品位上的浪费。合理利用太阳能集热器辅助空气源热泵等高能效比供暖装置进行供暖能有效降低能源消耗,但是太阳能供暖系统的性能、运行模式等与室外环境条件紧密联系,因此对冬季室外气象参数进行分类研究,对提高太阳能资源利用效率意义重大。
Feuermann等1提出利用典型气象日对太阳能供热系统的运行能耗进行预测的方法,与其他方法相比计算速度更快,但是结果准确性与典型气象日的选取有关。刘雨曦2对全年12个月的太阳辐射值取平均值,并选取当月与月太阳辐射平均值最相近的日气象参数作为典型日,计算空气源热泵辅助太阳能热水系统的运行能耗。王伟3通过太阳辐射计量时段和日平均气温将12个月数据分为三类,之后每一类中的气象数据取平均值确定典型日气象数据。文献[2-3]采用多日的气象数据平均值作为典型天,但是这种气象分类方式并不能代表每日的气象变化情况,典型天的选取结果不具有广泛的代表性。
聚类分析方法根据聚类特征之间的相似性对给定样本数据进行分类,被广泛应用到社会科学、生物医学和大气科学等领域中。杨小山等4采用主成分分析法将气象变量整合为两个典型日特征,并通过聚类方法将其分为5类,结果表明,各类天气之间区别明显,每一类天气的特征清晰。Kalkstein等5也通过主成分分析方法对气象变量进行提取后,通过聚类方法对天气类型进行划分。作为聚类指标的气象参数较多,部分气象参数对太阳能热利用影响较小,应对气象参数进行筛选。Cao等6提出基于聚类的中国太阳辐射分区,以日太阳辐照强度、最高温度、最低温度和日照时数作为聚类指标,共确定9个气候分区,通过交叉验证确定建立的辐射分区是可靠且准确的。Walsh等7提出一种基于建筑节能性能的气候分区方法,采用k-means方法对美国东南部95个地区进行分类。结果表明,与当前的建筑气候分区相比,基于建筑节能性能的气候分区方法更适合现有建筑类型。Deng等8提出用k-means和层次聚类方法对中国274个城市气象条件进行分类,将中国气候区划分为5类。结果表明,k-means方法在建筑热设计分区和热负荷模式分析中表现较好。曾乃晖等9采用聚类方法对西昌地区冬季气象参数进行分类,选取日太阳辐射变化和日平均气温作为气象变量,结果表明对太阳辐射强度的聚类效果很好,各类之间差异明显。通过聚类分析方法进行气象分类研究,对太阳辐射强度分类结果较为理想,分类结果具有代表性,但是所选择气象分类指标中温度指标为日平均温度,没有考虑日温度变化趋势,且未对聚类结果的准确性进行检验。
鉴于此,本文对影响太阳能利用的主要气象因素进行分析,选取辐照强度和环境温度时间序列数据作为聚类指标,通过轮廓系数对聚类结果进行判别,确定轮廓系数大于0.62时,可以选用不同时间间隔的环境温度时间序列进行聚类,而不会降低聚类结果的准确性。针对两级聚类指标,利用k-means方法对太原冬季的气象参数进行分类,得到太原地区冬季的典型天。

1 基于聚类分析的气象分类方法

1.1 气象数据采集

本文中气象数据通过气象数据采集设备(图1)测量并记录,采集点位于太原地区一栋四层建筑屋顶,周围20 m处有约2 m高建筑,采集点处无阴影。气象参数为环境温度(℃)、环境湿度(%RH)、露点温度(℃)、气压(hPa),瞬时风向(°)、瞬时风速(m/s)、2 min平均风速(m/s)、10分钟平均风速(m/s)、辐射瞬时值(W/m2)、辐射累计值(MJ/m2)和日照时长(h)。气象数据采集设备采集供暖期气象数据,每五分钟记录一次数据,得到准确的气象数据。表1为气象数据采集设备技术参数。

1.2 聚类指标分析

合理选取评价指标是进行聚类分析的前提,气象数据采集设备采集并记录10类气象要素,如果将全部气象要素都作为聚类指标,那么不仅聚类计算工作量会倍增,还会因为数据干扰过多降低最终聚类效果。Boullier等10根据光伏系统的特性,去除与光伏系统相关性较低的气象参数,利用聚类算法对气象参数进行分类,结果表明分组效果良好。因此,本文通过分析影响太阳能热利用的主要气象因素选择气象聚类指标。文献[11-16]通过实验确定影响太阳能热利用的气象因素主要有太阳辐照强度、环境温度。在本文中太原地区的日间相对湿度在55%~67%之间变化,变化范围较小,相对湿度的影响基本可以忽略不计。因此,本文初步选取太阳辐射和环境温度作为聚类分析指标。此外,在以供暖为主要目的的节能改造中,室内环境温度随环境温度变化有滞后性,不能仅采用平均温度作为聚类指标,应考虑环境温度随时间的变化,因此选取环境温度时间序列数据作为聚类指标。环境温度时间序列数据变化相对稳定,但是环境温度时间序列数据(5 min)的维度太高,聚类算法难以收敛到全局最优,因此需在确保聚类结果不变的情况下,选取时间间隔更大的时间序列数据作为二级指标。

太阳辐射作为最基本的环境要素,直接或间接影响气象因素,且地表接收到的辐照强度受到诸如云层、空气中颗粒物浓度等因素的影响导致每天的太阳辐射变化规律都有所不同,诸如太阳能波峰、波谷和逐时辐射量都有差异,这都会对太阳能热利用造成影响。而每五分钟测得的辐射,在短时间内受到云量等的影响,变化无规律且气象测量时间跨度较大,日出时间不一致,每日的辐射数据时间长度不一致不能直接作为聚类指标,为描述一天中太阳辐射强度的分布规律,考虑日出、日落和以及中间阶段的太阳辐射变化情况,将太阳辐射划分为4个阶段,即日出阶段、上升阶段、峰值阶段和日落阶段。

1.3 气象数据预处理

数据筛查:首先对原始数据进行目视检查和筛选,对出现严重错误的数据进行剔除。对原始数据中记录时间出现平移但数据记录间隔保持5 min不变的数据,通过线性插值估计对应时刻数据,使所有天数保持相同的测量时刻和时间间隔。对原始数据中数据连续缺失不超过15 min的数据通过线性插值来估计,对连续缺失值超过15 min的当日数据进行剔除。此外,总数据缺失超过15%的天数被视为不完整数据,也将被删除,最终确定110天的气象数据作为数据样本。

为确定不同时间间隔的环境温度数据对聚类结果的影响,选取5 min、10 min、15 min、20 min和30 min的环境温度数据作为数据样本。辐照强度数据每5 min记录一次,将5 min内的太阳辐照强度视为恒值,计算逐时太阳辐射强度。以日平均环境温度、环境温度日较差、逐时辐照强度作为分类前的预处理指标,并采用Z-score方法17对其进行归一化处理。

1.4 聚类方法

聚类方法是研究多因素分类问题的统计数学方法。聚类方法根据给定的相似度计算公式计算每两个样本的距离,根据样本的相似度大小进行分类,分组后的组内相似度高,组间相似度低。k-means聚类随机选取k个样本作为聚类中心,通过损失函数最小化将样本集合划分为k个子集。

损失函数定义为样本与其所属类的中心之间的距离的总和,计算公式18为(1):

W(C)=l=1kC(i)=lxi-x¯l2 .

式中,x¯l=(x¯1l,x¯2l,,x¯ml)T是第l个类的均值或中心,xi为第i个样本,C(i)为第i个样本所属子集。

1.4.1 相似度测量

聚类的核心概念是相似度或距离,因为相似度直接影响聚类的结果,所以其选择是聚类的根本问题。具体那种相似度更合适取决于应用问题的样本。本文中对3种不同的距离进行对比分析,选择合适的距离作为相似度衡量标准,见公式(2)—(4)。

欧氏距离(Euclidean distance):

dij=(k=1mxki-xkj2)12 .

曼哈顿距离(Manhattan distance):

dij=k=1mxki-xkj .

夹角余弦距离(Cosine distance):

sij=k=1mxkixkjk=1mxki2k=1mxkj212 .

式中,xi,xjX,xi=(x1i,x2i,,xmi)T,xj=(x1j,x2j,xmj)T

1.4.2 聚类效果判断指标

为了评价不同算法和不同测量距离对天气数据样本的分类效果,本文中采用轮廓系数(SC,Silhouette Coefficient)对分类后的天气样本进行计算。轮廓系数指标通过计算天气数据样本点的组间分离度和数据样本点的组内紧密度来构建轮廓函数,最后计算整体的平均值得到最终指标值。

轮廓系数19的计算公式见(5)—(7):

SC=1ni=1nsi .
si=bi-aimaxai,bi .
ai=ij,xjCidxi,xjCi,bi=min1jk,jilCidxi,xjCi .

式中,ai为簇内不相似度,bi为簇间不相似度,Ci为第i个簇(类)。

1.4.3 相似度测量的对比分析

图2为不同距离下轮廓系数随k值变化图,数据类型为环境温度数据,其中SC值为50次聚类结果的SC值的平均值。从图2中可以明显看到,夹角余弦距离的SC值远低于其余两种距离,且其值在k=3时就已经小于0.5,说明夹角余弦距离的聚类结果很差。而欧氏距离和曼哈顿距离的轮廓系数在k=3和8时,两者非常接近,但是在k∈[4,7]时,欧氏距离的轮廓系数明显高于曼哈顿距离,因此本文中选取欧氏距离作为相似度测量标准。

2 不同时间间隔对环境温度聚类效果的影响分析

k-means算法在对高维数据聚类时容易受到测量误差影响而降低聚类效果,而环境温度时间序列数据(5min)作为天然高维数据,采用k-means算法直接对其进行聚类难以取得理想的结果,现有降维算法只能在有限的范围内对数据进行降维,对时间序列降维效果不能满足要求。在不改变数据样本的前提下,通过增加数据采集的时间间隔来降低时间序列数据维度能有效降低测量误差对聚类结果的影响,提高聚类效果,降低计算时间。图3为不同时间间隔的SC系数随k值变化图。k-means算法初始化时随机选取k个样本作为各类中心,分组后的SC系数也随之变化,为降低不确定性,每个k值都计算50次并对SC系数求平均值。从图3中可以看出,k=3时,不同时间间隔SC系数近似相等;k=4时,不同时间间隔的SC系数差距在小于0.02之间,而随着k值增加,SC系数在不断降低,不同时间间隔的SC系数差距也在增加。在k=7时,SC系数下降到0.5以下,此时聚类效果很不理想,各组之间没有明显边界。选取当k=4时SC系数相差最大的5和10 min作为对比组,分组结果选取SC系数平均值最接近的聚类结果。此时,5 min和10 min的分组结果共有10日不同,为DEC9、DEC10、DEC26、DEC27、JAN12、JAN18、JAN26、JAN29、DEC19和MAR20。对比结果选取的是接近SC系数平均值的分组结果,不能代表最优的聚类结果。

为获得最优的聚类分组结果,选取SC系数最高的聚类结果进行对比。对比k=4时,5 min、15 min、20 min和30 min的最优分组结果。最优分组结果下不同时间间隔的分组结果非常接近,110日的数据中,仅有两日的分组结果存在不同,分别为DEC29和MAR1日。进一步对比当k=5时,不同时间间隔的最优分组结果,此时不同时间间隔的分组结果相同,SC系数分别为0.627 31、0.627 2、0.626 95、0.626 22和0.626 67。随着k值增加,k-means聚类算法计算取得最优聚类结果的计算时间成倍增加,但是不同时间间隔的最优聚类结果的SC系数仍然保持在0.62左右,聚类分组结果基本相同。

上述结果表明,当聚类的SC系数大于0.62时,不同时间间隔并不影响温度聚类分组结果;随着SC系数的减少,不同时间间隔的分组结果出现差异。当SC系数小于0.61时,分组结果出现明显不同,此时不同时间间隔分组差异明显。值得注意的是,因为k-means随机选取聚类中心的特点,随着k值的增加,计算时间成倍增加,获得最优聚类结果的难度不断增加,因此选取时间间隔为20 min、SC系数不小于0.62且k∈[3,6]的聚类结果作为分组结果,既能减少计算时间也能保证聚类的准确性。

3 典型天确定与分析

3.1 气象指标选取

影响太阳能利用的主要气象因素有环境温度和辐照强度,日环境温度变化和辐照强度变化是以5 min为时间间隔的时间序列,直接对高维时间序列进行聚类难以获得理想的效果,需要对数据进行降维处理。在一定区域、一定时间内温度变化相对稳定,不会出现突变,因此可以对时间序列进行聚类,在SC系数大于0.62时,不同时间间隔不影响聚类结果,对结果分析讨论后确定以时间间隔20 min的环境温度时间序列数据作为聚类指标。而辐照强度短时内变化无规律,不适合对辐照强度时间序列直接进行聚类,但是辐照强度在一定时间内变化相对稳定,因此将日辐照强度按时间和变化趋势分为4组作为一级指标,同时考虑每日平均温度和日较差,共选取6个一级指标,以时间间隔为20 min的日环境温度时间序列数据作为二级指标,气象分类指标见表2

3.2 聚类结果分析与典型天的选取

表2中的1级指标进行Z-score标准化计算后聚类,得到5组分类结果。对每组的温度变化序列进一步聚类,得到最终的聚类结果。初始聚类中心从SC系数大于0.62的分组结果中选取,每一类选择随机选择一日数据作为聚类中心,以确保聚类结果的准确性。气象参数最终被分为14小类,图4图5分别为各小类温度分布图和各小类逐时辐射分布图。

对比不同类别的环境温度变化和辐射强度变化趋势,每一类天气的特征清晰,边界明显。第一类、第二类、第六类和第七类的辐照强度峰谷变化接近,但是这四类的环境温度差别较大,四类的平均最高、最低温度分别为(-16,13)、(-18,-8)、(-6,3)和(-8,7),日温差相差较大,这4类分类结果边界明显,分类结果很好;第三类、第八类和第九类的辐照强度变化趋势相近,且在13时出现谷值,但是三者的辐照强度峰值、谷值有所差距,分别为(400,200)、(400,250)和(250,300),且三者的日温度变化趋势不同,第三类昼间温升幅度很小,第八类夜间温度降低缓慢,第九类昼间温度有所波动;第四类和第五类,虽然温度变化规律相似,但是最低温度接近,最高温度不同,且日辐照强度相差较多,组间差异明显;第十类平均最低、最高温度为(0,15),夜间温度缓慢降低。辐照强度平均峰值在650 W/㎡左右,变化趋势为先升高后降低;第十一类平均最低、最高温度为(7.5,9.5),辐照强度变化维持在一个很小的范围内,最高辐照强度在100 W/㎡左右;第十四类平均最低、最高温度为(-3,4),全天温度变化较小,24时温度与0时温度基本持平。最高辐照强度不超过300 W/㎡,且当日的辐照强度变化较为复杂,出现多个峰谷值。

同一类别中的气象参数趋势和数值基本趋于一致。相同类别中的日温度变化和辐照强度变化轮廓曲线相似。如第一类中,虽然最高温度和最低温度有所差距,但是全天的平均温度接近,且辐照强度变化基本相同;第十类中温度变化基本相同,辐照强度变化也基本符合正态分布;第十三类温度变化趋势基本相同,类内3天的温差不超过2℃;第一类、第二类和第八类的辐射变化趋势基本相同,相同时刻的辐照强度相差不超过50 W/㎡。

本文中采用欧氏距离对特征向量进行相似度计算并采用轮廓系数对聚类效果进行评价,选取距离最近的日气象参数作为典型天气象数据,因为组内气象数据平均值会破坏气象数据前后时刻之间的关联性,不适合作为典型天气象数据。但是14个类别中有的组别天数较少,应该选取组内气象数据的平均值作为典型天。因此,对类中样本数量小于3的组别选取平均值作为典型天,大于3的组别选取距中心最近的天作为典型天,典型天选取结果见表3。从平均温度和总辐射量来看,不同组的典型日平均温度和总辐射量相差较大。即使两个典型日中平均温度和总辐射量有一个指标相近,另一个指标也相差很大,说明聚类分组结果合理,典型日的选取是正确的,能够代表组内环境温度和辐射强度的变化趋势。

4 结 语

1)结合利用太阳能辅助供暖的特点,以环境温度和辐照强度为主要因素,提出具体的两级聚类指标,减少相关性较少的气象因素干扰,提高聚类的准确性。

2)基于聚类分析,当轮廓系数大于0.62时,可以选用不同时间间隔的温度时间序列进行聚类,而不会降低聚类结果的准确性。

3)将太原地区冬季的气象参数分为14个类别,各类别组内相似度高,组间差异明显,分类结果准确、合理。

参考文献

[1]

FEUERMANN DGORDON J MZARMI Y A.A typical meteorological day (TMD) approach for predicting the long-term performance of solar energy systems[J].Solar Energy198535(1):63-69.

[2]

刘雨曦.空气源热泵辅助太阳能热水系统在夏热冬冷地区的运行模拟和应用研究[D].重庆:重庆大学,2011.

[3]

王伟.小型空气源热泵辅助太阳能热水装置性能研究[D].西安.西安建筑科技大学,2011.

[4]

杨小山,翁素梅,赵立华.面向城市热环境的典型气象日确定方法[J].环境科学与技术201942(1):231-236.

[5]

YANG X SWENG S MZHAO L H.Determination of typical meteorological day for urban thermal environment[J].Environmental Science & Technology201942(1):231-236.

[6]

KALKSTEIN L STAN GSKINDLOV J A.An evaluation of three clustering procedures for use in synoptic climatological classification[J].Journal of Applied Meteorology198726:717-730.

[7]

CAO QLIU Y,LYU K,et al.Solar radiation zoning and daily global radiation models for regions with only surface meteorological measurements in China[J].Energy Conversion and Management2020225:113447.

[8]

WALSH ACOSTOLA DLABAKI L.C.Performance-based climatic zoning method for building energy efficiency applications using cluster analysis[J].Energy2022255:124477.

[9]

DENG XTAN ZTAN Met al.A clustering-based climatic zoning method for office buildings in China[J].Journal of Building Engineering2021(6):102778.

[10]

曾乃晖.西昌地区空气源热泵辅助太阳能热水系统优化研究[D].成都:西南交通大学,2017.

[11]

BOULLIER PCHAPELLIER M.Weather types:An improved analysis[J].Colloque Meteorologieet Energies Renouvelables1984:632-653.

[12]

KONG X QZHANG DLI Yet al.Thermal performance analysis of a direct-expansion solar-assisted heat pump water heater[J].Energy201136(12):6830-6838.

[13]

KONG X QLI YLIN Let al.Modeling evaluation of a direct-expansion solar-assisted heat pump water heater using R410A[J].International Journal of Refrigeration201776:136-146.

[14]

KONG X QJIANG K LDONG S Det al.Control strategy and experimental analysis of a direct-expansion solar-assisted heat pump water heater with R134a[J].Energy2018145:17-24.

[15]

KONG X QSUN P LDONG Set al.Experimental performance analysis of a direct-expansion solar-assisted heat pump water heater with R134a in summer[J].International Journal of Refrigeration201891:12-19.

[16]

KONG XSUN PLI Yet al.Experimental studies of a variable capacity direct-expansion solar-assisted heat pump water heater in autumn and winter conditions[J].Solar Energy2018170:352-357.

[17]

KONG X QLI J YWANG B Get al.Numerical study of a direct-expansion solar-assisted heat pump water heater under frosting conditions based on experiments[J].Solar Energy2020196:10-21.

[18]

何晓群.21世纪统计学系列教材-多元统计分析[M].北京:中国人民大学出版社,2008.

[19]

李航.统计学习方法[M].北京:清华大学出版社,2012.

[20]

PETER R J S.A graphical aid to the interpretation and validation of cluster analysis[J].Journal of Computational & Applied Mathematics198720:53-65.

基金资助

山西省科技创新人才团队专项(202304051001011)

山西省科技合作交流专项项目(202104041101027)

AI Summary AI Mindmap
PDF (3420KB)

121

访问

0

被引

详细

导航
相关文章

AI思维导图

/