0 引言
在数字化与智能化浪潮推动下,数据已成为现代铁路运维管理的核心资产。截至2025年底,全国铁路营业里程达到16.5万km,每天产生的基础设施检测监测数据体量庞大且类型多样,涵盖轨道几何、接触网、通信信号等多专业多源异构数据
[1]。目前铁路基础设施检测监测数据在采集、传输、处理和应用过程中面临诸多问题,如数据干扰、数据缺失、里程误差、数据异常等,这些问题已对运维决策产生显著影响。
既有研究针对铁路基础设施检测监测数据开展了大量研究,汪鑫等
[2]发现由于GNSS漂移、轮径误差及轮轨滑动,动检车采集的某线路检测数据里程绝对误差最大23.8 m,相对误差最大15.9 m;李再帏等
[3]指出动态检测数据普遍存在异常值、低频趋势和里程漂移3类失真;牛道安等
[4]提出“干扰修正-波形对齐-数据融合”技术链,现场验证表明未经治理的异常数据会显著放大轨道状态评估误差。铁路基础设施检测监测数据不同质量问题的处理和评价重点各不相同,如数据干扰和异常值需借助滤波与智能识别算法,数据缺失依赖插补技术,里程误差则需进行里程校正,分别对应数据完整性、准确性等评价维度。因此,建立科学、系统、可落地的铁路基础设施检测监测数据质量评价体系已成为铁路运维智能化发展的当务之急。
数据质量评价研究始于20世纪90年代,Wang等
[5]提出的全面数据质量管理(Total Data Quality Management,TDQM)理论,首次就数据质量提出了较为完整的知识体系;后续发布的《数据质量 第8部分:信息和数据质量 概念和测量》(ISO 8000-8:2015)
[6]、《信息技术数据质量评价指标》(GB/T 36344—2018)
[7]等标准,进一步统一了数据质量核心术语并建立了通用评价指标体系,被医疗、金融等行业广泛借鉴。然而,铁路基础设施检测监测数据具有多专业耦合、时空强参考、高安全敏感等特性,通用框架难以解释“里程漂移放大评估误差”“跨专业数据冲突”等特有问题,无法直接迁移使用。现行《高速铁路基础设施运用状态检测管理办法》(交运部令2018年第19号)
[8]仅对检测流程作出原则性要求;中国国家铁路集团有限公司工电部发布的《铁路基础设施检测监测数据归集管理办法(暂行)》(工电综技函〔2022〕40号)
[9]明确提出对数据完整性、有效性等方面进行质量评价的具体要求。但目前,铁路基础设施检测监测领域尚未形成体系化的数据质量评价规范。
综上所述,研究聚焦铁路基础设施检测监测数据质量评价理论与实践需求,构建“通用理论-行业借鉴-铁路适配”的分析框架。首先通过界定铁路基础设施检测监测数据的质量评价对象并选取适宜的评价视角,明确“评什么”和“为何评”。其次,纵向梳理评价指标从通用维度到专业构建的演进脉络,解决“用什么评”的问题。最后,横向对比评价方法从统计规则到混合智能的技术迭代,并聚焦其在铁路场景下的适配,解答“怎么评”的问题。通过系统梳理从“通用框架”到“铁路场景深度适配”的演进逻辑,为构建铁路基础设施检测监测数据质量评价体系提供清晰、可追溯的理论依据和发展导向。
1 数据质量评价对象的铁路场景界定与评价视角多元选取
1.1 评价对象的演进与扩展
数据质量评价的对象是构建评价体系的逻辑起点,决定了评价的覆盖范围。其演进历程深刻反映了研究视角从内在数据属性走向外在业务价值的转变,评价粒度持续下沉,与行业场景的结合日益紧密。根据文献梳理,其发展可划分为3个阶段,数据质量评价对象的演进历程如
表1所示。阶段Ⅰ聚焦于数据库内部静态数据值的质量,奠定了准确性、完整性等核心维度的基础。阶段Ⅱ开始应对半结构化、非结构化数据的挑战,扩展至工作表、文本、图像等多模态数据。阶段Ⅲ则跳出了数据本身的范畴,进一步与特定业务实体和流程融合,在不同行业领域形成了针对核心业务实体的精细化、场景化指标维度。
然而,现有研究多聚焦医疗、政务等业务流程清晰的领域,对于铁路基础设施检测监测涵盖工务、电务、供电多专业且数据间存在强时空耦合与物理关联的复杂场景,尚未建立起跨专业的、统一的本体化评价对象体系。
1.2 评价视角的多元化发展
评价视角决定了评价的出发点和价值导向,回答了“为谁评价、为何评价”的核心问题。随着研究的深入,先后形成了4种主流的评价视角,数据质量评价视角的内涵与比较如
表2所示。产品视角将数据视为可衡量的“产品”,奠定了数据质量客观量化的基础。平台视角关注数据归集效率与系统可用性。用户视角将“人”的因素引入评价体系,聚焦用户满意度与需求贴合度。生命周期视角则实现了从静态快照到动态过程评价的飞跃,强调全过程的管控与追溯。
各视角均存在局限:产品视角“见数不见人”;平台视角粒度不足;用户视角主观差异大;生命周期视角虽全面但实施复杂,成本高昂。研究表明,单一视角无法满足铁路复杂场景的需求,需采用多维融合的评价思路。
1.3 铁路基础设施检测监测数据质量评价对象界定与评价视角选取
铁路基础设施检测监测数据涵盖工务、电务、供电三大专业领域,具有多源、异构、强时空关联等复杂特征。工务专业数据主要包括轨道几何、钢轨状态、路基沉降等数据,其特点是空间参考性强、时间序列特征明显;电务专业数据主要包括信号设备状态、通信系统性能等检测监测数据,强调数据的实时性和告警准确性;供电专业数据则以接触网几何参数、绝缘子状态等为主,参数间存在复杂的物理关联性。根据其形态和业务用途,列举3类典型评价对象,铁路基础设施检测监测数据典型评价对象与特征如
表3所示。
在评价视角的选择上,需深入分析各通用视角在铁路基础设施检测监测数据评价应用场景下的局限性及研究启示,通用数据质量评价视角在铁路基础设施检测监测数据质量评价中的局限性与研究方向如
表4所示。应结合不同评价对象特点,根据业务需求动态适配:对于轨距、接触网导高等几何参数类数据需优先整合产品视角(确保参数测量精度)与生命周期视角(管控采集-传输-处理全流程质量),其内在数据精度与全过程管理直接影响线路的安全评估;对于缺陷检测报告等报告文本类数据需重点关联用户视角(满足维修工程师对缺陷描述的理解需求)与产品视角(保证语义准确性),避免因文本歧义导致维修决策偏差;对于缺陷图像、监控视频等图像视频类数据需兼顾平台视角(保障图像存储清晰度)与生命周期视角(追溯图像标注环节质量)。
因此,构建有效的铁路基础设施检测监测数据质量评价体系,应以覆盖全流程的生命周期视角作为基本框架,并针对几何参数、报告文本、图像视频等不同评价对象的具体特征,有机融合产品视角的内在精度要求、平台视角的服务效能以及用户视角的业务价值需求。
2 数据质量评价指标的铁路专业化构建
2.1 通用框架的范式演进
数据质量评价指标是质量评价的核心要素,指标体系的演进是一个从概念开创到标准化、多维化的过程。Wang等
[5]突破“质量即精度”的传统认知,提出了包含固有质量、可访问性、上下文质量和表达质量4个维度15个指标的评价体系,奠定了多维评价的理论基石。我国国家标准《信息技术数据质量评价指标》(GB/T 36344—2018)
[7]在此基础上,构建了涵盖规范性、完整性、一致性、准确性、时效性、可访问性6个一级指标和20个二级指标的层次化框架,为数据质量的量化管理提供了统一、规范的术语和测度方法,成为国内各行业构建数据质量评价体系的重要基准。
准确性、完整性等通用指标在铁路基础设施检测监测领域具有基础适用性,但其定义相对抽象宽泛,难以充分刻画铁路场景下“里程精度”“时空一致性”“多源数据耦合性”等核心质量诉求,直接套用会导致评价结果与业务价值脱节。因此,必须在通用维度的基础上,进行行业化适配并细化指标。
2.2 评价指标的行业化发展
为克服通用框架的局限,各领域纷纷开展数据质量评价指标研究,呈现出维度扩展、粒度细化、价值显化三大趋势,典型行业/领域数据质量评价指标特色对比如
表5所示。
(1)维度扩展与特色化。各行业从自身业务痛点出发,提炼出高度场景化的特色指标。如大数据领域关注价值密度
[29]、冗余性
[44];政府开放数据强调用户满意度、可重用性
[17]与可发现性
[18];金融风控领域则极度重视可审计性、语义规范性
[19];科学数据追求长期保存性、数据影响力等
[25]。
(2)层级细化与过程化。评价粒度从对数据本身的静态属性评价,延伸至对数据全生命周期的过程管控。翟运开等
[16]构建了数据生命周期视角下的医疗健康大数据质量评价指标体系,在数据采集阶段关注准确性、完整性和及时性,在数据预处理和存储阶段关注规范性、安全性和一致性,在数据分析与应用阶段则关注互联互通性、可用性和价值性;虞业泺等
[45]面向卫星装备试验鉴定场景,将合用性、正确性和有效性等指标,进一步细化为数据更新时效性、数据量适当度、阈值合理性、数据可靠性、逻辑一致性、数据表完整率等指标,形成覆盖试验全过程的链条化指标树,实现了由“事后检验”向“过程实时监控”的转变。
(3)价值显化与效用化。评价目标正从“保证质量”向“度量价值”范式迁移。孙俐丽等
[46]在电商数据评价中引入“价值密度”;尤建新等
[47]构建了包含“价值密度”的数据资产评价模型;黄倩倩等
[48]面向数据流通交易场景,进一步提出“可交易指数”“价值实现率”“市场溢价系数”等指标,将数据质量得分折算为预期交易价格和流通潜能,实现了质量到价格的闭环。
评价指标行业化定制的核心在于实现了从“有什么评什么”到“要什么评什么”的转变。其局限在于这些指标高度依赖特定行业语境,难以直接迁移。然而,各行业通过“通用维度+专业特色”的指标体系构建思路,为铁路专用指标构建提供了参考。
2.3 铁路基础设施检测监测数据质量评价指标的构建维度
铁路基础设施检测监测数据具有多源(工务、电务、供电等)、异构(波形、图像、文本、数值)、强时空耦合的典型特征
[4,49],其质量评价需进行定制。当前研究整体仍处于起步阶段,缺乏一个贯穿全生命周期、覆盖多专业、融合多视角的统一评价指标体系,未来应围绕以下4个维度系统构建。
(1)基础通用维度:从分散应用走向标准化基准。当前铁路基础设施检测监测领域的研究对准确性、完整性、一致性等通用指标的应用呈“碎片化”。例如,在完整性方面关注字段缺失率
[4],在准确性方面探讨轨距误差
[50]。然而,这些研究多基于特定算法或模型需求,采用自定义的统计口径、计算方法和阈值(如对数据缺失率的定义或轨距误差容忍度不尽相同),导致评价结果难以跨项目比较,无法形成行业共识。建议超越针对单一数据源或算法的零散评价,构建铁路基础设施检测监测领域的通用维度标准化体系,明确各通用指标在铁路语境下的精确定义,建立统一的、可复现的测量方法与典型阈值范围,为全行业的数据质量对标、管理与提升提供统一的“标尺”。
(2)铁路特性维度:从单专业走向跨专业耦合。现有研究高度集中于轨道几何数据(如里程校正、小波去噪
[4]),对电务通信信号、供电接触网数据等研究较为匮乏,缺乏刻画多专业数据间时空一致性与耦合性的指标,难以反映铁路基础设施作为有机整体的运行状态。因此,未来的研究方向应双向拓展:一方面将工务领域相对成熟的里程精度、波形有效性等指标深化并横向迁移至电务、供电专业;另一方面研发如“跨专业数据冲突率”“多源数据时空对齐误差”等耦合性指标,以支撑基于多源数据融合的综合性状态评估与决策。
(3)全生命周期维度:从技术环节走向全过程管控。现有研究多将数据清洗
[50-51]、传输等视为孤立的技术环节,其质量评价停留在方法有效性层面,尚未将数据从采集、传输、存储到处理的应用全过程纳入系统化的质量评价范畴。未来的研究应借鉴其他行业经验
[11,28-29],构建覆盖“采集-传输-存储-处理”全生命周期的流程质量指标。如定义并量化“数据传输丢包率”“存储数据可用性”“处理任务成功率”等指标,实现对数据全生命周期关键过程质量的监控与评价,变被动“事后检验”为主动“过程管控”。
(4)价值效能维度:从数据质量度量走向运维价值闭环。牛道安等
[4]研究旨在通过大数据分析支撑“资产运维决策”,王保国等
[52]在构建高铁综合维修体系时提出“维修记录闭环管理”,均隐含了对价值效能的追求,但目前未能建立数据质量与最终业务价值(如运维效率提升、安全风险降低、决策准确性改善)之间的量化关联。未来研究应突破“就质量论质量”的局限,让数据质量评价驱动运维决策优化。可借鉴数据交易
[48]等领域思路,探索构建与铁路运维场景紧密相关的价值指标,例如“数据支撑维修决策准确率”“基于高质量数据的预警有效率”等,形成数据质量到业务价值的有效传导,彰显高质量数据的基础性作用。
3 数据质量评价方法的铁路场景化适配
3.1 数据质量评价方法演进
数据处理技术的发展驱动数据质量评价方法不断演进,先后经历了统计描述、专家系统、机器学习与混合智能4个阶段,其核心特点、典型方法与适用场景各异,数据质量评价方法演进对比如
表6所示。
统计描述源于对数据库内数据缺陷的初步度量,开创了数据质量量化评价的先河,核心思想是通过简单的统计量对数据质量的单一维度进行量化评价,但此阶段的质量评价是“事后”评价,难以揭示数据缺陷的内在关联。
随着大型信息系统的普及,基于预定义规则进行质量校验成为核心需求。此阶段以专家系统为代表,通过将领域知识(如行业标准、业务规则)形式化为可计算的规则库,实现了质量评价的自动化和常态化,但其高度依赖预设的专家知识,难以发现规则库未覆盖的、复杂的异常模式,灵活性不足。
大数据时代使得高维、异构数据中的复杂质量问题凸显,基于模式识别的机器学习方法成为研究热点,其核心优势在于能够从数据本身自动学习正常模式,从而识别未知异常。此阶段实现了从“规则驱动”到“数据驱动”的范式转变,在异常检测、关联性分析等方面表现出强大能力。但其多为“黑箱”模型,结果可解释性差,且严重依赖训练数据质量。
为弥补单一方法的局限性,当前研究前沿强调混合智能模型,即融合多种方法优势于一体的综合评价方法,通过协同互补,实现了在大规模复杂数据环境下,兼顾评价效率、结果可靠性和模型可解释性的目标,代表了未来的发展方向。
3.2 铁路基础设施检测监测数据质量评价方法的场景化适配与融合
铁路基础设施检测监测数据质量评价并非“通用方法的简单迁移”,而是以场景为锚点、以业务闭环为目标的系统工程,需适配多源异构数据的融合分析、支撑运维决策的场景化适配、满足全生命周期的动态质量管控,核心在于对通用方法的专业化适配与融合应用。
(1)基础统计方法需与专业算法结合。如许贵阳等
[50]在处理轨道几何波形数据时,基于绝对平均值的单一异常值剔除方法和基于移动窗技术的成片异常值剔除方法,这些方法是统计思想在铁路场景的典型深化。异常值识别逻辑可表述为
式中:为原始轨道几何检测数据序列中的第个采样值;为对应的异常值标记,取值1表示异常,取值0表示正常。
(2)专家系统方法的行业化重构。将行业标准、规程和技术条件转化为可计算的业务规则库,是实现自动化评价的关键。依据《铁路基础设施检测监测数据归集管理办法(暂行)》(工电综技函〔2022〕40号)
[9]等管理规范,设定数据归集时效性、数据文件名和类型规范性等专业规则开展校验。还可构建如“曲线超高地段,水平值须与超高值匹配”的关联规则,基于业务逻辑发现矛盾数据。
(3)机器学习方法的场景化应用,引入领域知识进行引导。采用李再帏等
[3]的异常值诊断方法,由专家标注部分“波形异常”样本,训练分类模型对轨道不平顺原始采样值进行智能判别,大幅提升异常识别的准确率,为数据质量准确性和有效性评价提供支撑。利用Guo等
[51]在接触网几何参数上训练的异常检测模型,适配迁移至不同线路或设备的数据,解决标注样本稀缺问题。
(4)混合智能方法的协同探索。借鉴荀挺等
[21] 在电网领域的实践,构建“规则过滤+模型识别+专家复核”的分层评价体系。第一层用规则引擎进行快速过滤显性缺陷(如完整性、阈值检查);第二层对通过第一层的数据调用机器学习模型识别潜在异常;第三层对模型识别出的疑难案例,推送至专家终端进行最终裁决,并将结果反馈至模型,形成优化闭环。这种协同模式既能保证效率,又能确保评价结果的可靠性,是解决铁路基础设施大规模检测监测数据质量评价的理想路径。
4 结论与展望
4.1 结论
本研究采用框架型综述范式,聚焦铁路基础设施检测监测领域数据质量评价的理论空白与实践需求,在系统梳理通用数据质量理论、典型行业实践及铁路相关研究文献的基础上,围绕评价对象的铁路场景界定与视角选取、评价指标的铁路专业化构建、评价方法的铁路场景化适配三大核心内容,明确了从通用理论到行业借鉴,再到铁路适配的核心逻辑与路径,主要结论如下。
(1)评价对象与视角需实现铁路场景的深度融合。借鉴生命周期视角的全流程管控逻辑和产品视角的客观量化思路,结合铁路基础设施检测监测数据多源异构、强时空耦合、多专业交叉特性,构建以生命周期视角为主线,融合产品视角的数据内在精度、平台视角的系统服务效能与用户视角的业务价值需求的多维协同框架,为铁路基础设施检测监测数据质量评价明确核心范围与逻辑起点。
(2)评价指标需完成从通用维度向铁路专业化指标的拓展。借鉴各行业指标“维度扩展、粒度细化、价值显化”的演进规律,铁路基础设施检测监测数据特有质量评价指标应围绕基础通用、铁路特性、处理流程和价值效能4个维度系统构建,通过补充特有的量化指标、流程管控指标与价值关联指标,实现从数据质量评价到业务价值的闭环反馈,提升评价与铁路基础设施检测监测场景的贴合度。
(3)评价方法应走向混合智能与场景化融合适配。借鉴混合智能方法的协同优势,结合铁路基础设施检测监测数据特征,对通用方法进行专业化改造与场景适配,通过基础统计与专业算法结合、行业规则与专家系统重构、领域知识与机器学习融合,构建多层智能评价体系,以兼顾评价效率、准确性及可解释性,适配铁路基础设施检测监测数据的质量评价需求。
4.2 当前研究的不足
尽管国内外在数据质量评价方面已有较多积累,铁路领域的研究仍处于初步阶段,核心短板集中在数据质量评价的系统性与适配性不足。
(1)缺乏系统性的、能够指导铁路基础设施检测监测数据质量评价实践的理论框架。现有研究多为针对特定数据类型或环节的零散探索,未能整合多专业、全生命周期和多维视角,导致评价实践“碎片化”,难以支撑铁路智能化运维的整体需求。
(2)适用于铁路基础设施检测监测数据的专业化评价指标建设滞后。目前仍以直接套用通用指标为主,缺乏铁路基础设施检测监测数据专业特色量化指标,数据处理流程指标和价值效能指标,导致评价结果无法有效指导数据质量优化与业务价值提升。
(3)数据质量评价方法与铁路基础设施检测监测业务场景融合不足。尽管已有统计分析等方法初步应用,但机器学习及混合智能方法的适配性研究仍较薄弱,领域知识嵌入不够,未能实现“数据-知识-决策”的闭环优化,难以满足铁路智能运维的精准评价需求。
4.3 展望
未来应跳出通用框架的局限,系统构建铁路基础设施检测监测数据专用质量评价体系,重点从以下方面开展深入研究。
(1)构建多视角融合的生命周期评价框架。明确铁路基础设施检测监测数据质量的核心内涵与评价路径,建立覆盖“采集-传输-存储-治理-应用”全流程、融合多专业视角的理论与操作框架,为实现系统化的数据质量评价提供基础支撑。
(2)研发深度场景化与价值化的评价指标。结合工务、电务、供电等专业运维场景,提炼并量化一批专业特色评价指标,如“检测频次覆盖率”“数据归集时效性”“维修响应效率”等,并逐步建立与安全效益、运维成本关联的价值效能指标,形成精准反映铁路基础设施检测监测数据质量的标尺,让数据质量评价直接服务于铁路运维决策优化。
(3)发展领域知识引导的混合智能评价方法。借鉴其他行业方法适配经验,推动行业规则、物理模型、专家经验与机器学习的深度融合,研发可解释、强适应、高精度的智能评价方法,实现通用混合智能方法在铁路场景的有效适配。探索如基于GNN的多源关联异常检测、跨线路迁移学习等技术,构建“实时-周期-专家”三级协同的评价流水线,提升铁路基础设施检测监测数据质量评价的自动化与智能化水平。
(4)推动评价理论成果向标准与系统转化。加强与企业、标准制修订单位的合作,将研究形成的评价框架、指标体系与方法模型,转化为铁路基础设施检测监测数据质量评价指南或规范,并进行验证与推广,通过数据质量评价推动铁路基础设施检测监测数据资产价值释放,为铁路运维效率提升与智能化转型提供坚实支撑。
铁路基础设施检测监测数据质量评价是一项跨数据科学、铁路工程与运维管理的综合性课题。唯有构建一套科学系统、铁路专用的评价体系,才能充分释放铁路基础设施检测监测数据价值,为提升铁路安全水平、运维效率,推进铁路运维智能化转型提供坚实支撑。
中国铁道科学研究院集团有限公司科研项目(2023YJ019)