基于局部低秩分解的缺失标签多标记学习方法

李纪蔚 ,  陈琳琳 ,  何强 ,  王恒友

南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 562 -576.

PDF (1281KB)
南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 562 -576. DOI: 10.13232/j.cnki.jnju.2026.04.005

基于局部低秩分解的缺失标签多标记学习方法

作者信息 +

Local low⁃rank decomposition for multi⁃label learning with missing labels

Author information +
文章历史 +
PDF (1311K)

摘要

多标记学习在文本分类等实际应用中具有广泛的应用价值,但在真实情况下,由于标签的标注成本高、人工疏忽或数据来源复杂而出现不同程度的缺失,而不完整的监督信息会显著降低模型对标签结构的建模能力.针对传统方法普遍依赖整体低秩假设、难以刻画复杂标签关系的不足,提出一种基于局部低秩分解的缺失标签多标记学习方法(Local Low⁃Rank Decomposition for Multi⁃Label Learning with Missing Labels,LLRD⁃MLML),通过构建标签相关子集并进行低秩建模以挖掘标签间的复杂结构关系;同时,引入局部⁃全局联合学习机制,实现了局部模型与统一预测模型的融合,并结合图正则化约束以保持样本间结构一致性,采用交替优化策略求解该模型.在多个公开多标记数据集上的实验结果表明,所提方法在不同的标签缺失比例下均取得了较好的性能与稳定性,验证了局部低秩结构建模在缺失标签场景中的有效性.

Abstract

Multi⁃label learning has found extensive application in practical scenarios such as text classification. However, in real⁃world settings, labels are often partially missing due to high annotation costs, human oversight, or complex data collection processes. Such incomplete supervision significantly impairs a model's ability to capture the underlying label structures. Most existing methods rely on a global low⁃rank assumption to model the label matrix and recover latent label structures. However, this assumption is often inadequate for capturing the complex and diverse relationships among labels. To address this limitation, we propose a Local Low⁃Rank Decomposition method for Multi⁃Label Learning with Missing Labels (LLRD⁃MLML). Our approach constructs label⁃correlated subsets and applies low⁃rank modeling to these subsets to uncover complex structural relationships among labels. Furthermore, we introduce a local⁃global joint learning mechanism that integrates the local models with a unified prediction model. To preserve the structural consistency among samples, a graph regularization constraint is incorporated. The resulting optimization problem is solved using an alternating optimization strategy. Experimental results on multiple public multi⁃label datasets demonstrate that the proposed method achieves superior performance and stability across various label missing ratios, thereby validating the effectiveness of local low⁃rank structure modeling in scenarios with missing labels.

Graphical abstract

关键词

多标记学习 / 缺失标签 / 局部低秩分解 / 局部⁃全局学习 / 图正则化

Key words

multi⁃label learning / missing labels / local low⁃rank decomposition / local⁃global learning / graph regularization

引用本文

引用格式 ▾
李纪蔚,陈琳琳,何强,王恒友. 基于局部低秩分解的缺失标签多标记学习方法[J]. 南京大学学报(自然科学), 2026, 62(04): 562-576 DOI:10.13232/j.cnki.jnju.2026.04.005

登录浏览全文

4963

注册一个新账户 忘记密码

多标记学习(Multi⁃Label Learning,MLL)旨在处理一个样本的同时对应多个语义标签的学习,在图像标注、文本分类、时间序列分析以及生物信息学等领域有广泛的应用1-2.与传统的单标签学习相比,多标记学习不仅需要建立特征空间与标签空间之间的映射关系,还需要刻画标签之间复杂的相关结构,因此,具有更强的表达能力,同时,也面临更大的建模挑战3-4.近年来,大量研究围绕多标记学习展开,通过引入标签依赖建模、结构化正则化以及特征选择机制等方法,不断提升模型性能5-6.早期研究通常将多标记问题转化为多个独立的单标签任务7-8,然而这类方法忽略了标签之间的内在相关性,难以充分利用标签空间蕴含的结构信息.
尽管多标记学习已取得显著进展,大多数现有方法仍假设训练数据拥有完整标签,然而,在真实应用中,由于标注成本高昂、人工疏忽以及自动标注算法的局限,标签缺失或标注不完整的现象普遍存在9-11.标签缺失会导致标签相关结构的估计偏差,进而显著降低模型性能.因此,缺失标签多标记学习(Multi⁃Label Learning with Missing Labels,MLML)逐渐成为研究热点.现有的MLML方法大致可分三类:预处理方法、矩阵补全方法以及同步恢复方法.预处理方法通常通过零填充或近邻插值等启发式策略来补全标签12-13,但往往忽略标签间语义依赖.矩阵补全方法通常假设标签矩阵具有潜在低秩结构,通过矩阵分解或核重建技术来恢复缺失标签14,然而该类方法多侧重全局结构,难以充分利用特征和标签结构信息.相比之下,同步恢复框架将标签补全与分类模型训练统一到同一优化过程中,在实践中表现出更好的鲁棒性与性能15-16.
在现有的同步学习框架中,流形正则化是一种广泛采用的策略,其通常通过在分类器权重矩阵上引入图拉普拉斯约束来隐式建模标签或样本结构17-18.然而,这类方法的标签恢复是间接完成的,即通过约束特征⁃标签映射来影响标签推断过程.当标签共现稀疏或特征噪声较大时,这种间接机制容易导致标签恢复不稳定,并削弱标签语义关系的利用效率.此外,大量矩阵补全方法依赖低秩假设,通过核范数等凸松弛逼近矩阵秩,但核范数对所有奇异值施加了统一惩罚,可能导致对真实秩的估计偏离19-20.尽管Schatten⁃p范数在理论上能够更好地逼近秩函数,但其非凸优化复杂度较高,仅在有限参数条件下存在解析解19.为此,部分研究提出变换Schatten⁃1 (TS1)正则化,以提高秩逼近精度并获得可解析优化形式21-22.然而,潜在标签空间在缺失标签场景下仍可能存在冗余信息,导致类别结构不一致和学习效率的下降23.
另一方面,标签结构建模方面的研究也显示,仅关注全局低秩结构往往不足以刻画复杂标签关系.现实数据中,不同标签之间常呈现局部相关和分组聚簇现象,促使研究者探索结合局部与全局结构的建模方式.例如,基于模糊互信息的标签融合方法通过先验融合成对标签以学习二阶相关性,同时结合低秩约束来提取高阶结构信息,从而实现标签分布学习与缺失标签恢复24-25.此外,也有研究提出直接对标签结构施加图正则化约束,以增强标签关系建模的稳定性,并通过扰动策略来缓解标签稀疏条件下的不稳定问题18.
综上,现有缺失多标记学习方法仍有不足.
其一,传统的基于整体低秩假设的矩阵补全模型通常将标签矩阵视为单一全局低秩结构,在缺失标签场景下容易产生结构偏差,忽略了不同标签子空间之间可能存在的差异性与局部聚簇特征.
其二,大多数方法缺乏对局部标签关联与全局结构信息的协同建模,没有在标签层面实现多粒度结构融合,限制了标签相关性的充分表达与利用.
针对上述不足,本文提出一种基于局部低秩分解的缺失标签多标记学习方法(Local Low⁃Rank Decomposition for Multi⁃Label Learning with Missing Labels,LLRD⁃MLML),通过构建标签级局部子空间并对标签子集进行低秩建模,以刻画局部标签相关结构并挖掘标签间潜在的复杂依赖关系.同时,引入局部⁃全局联合学习机制,实现了局部模型与统一预测模型的融合,并结合图正则化约束来保持样本间结构一致性,提升缺失标签场景下模型的预测能力与鲁棒性.

1 预备知识

在MLML任务中,训练数据往往只包含部分已观测标签,大量标签处于未标注状态,使传统监督学习方法难以有效建模标签依赖关系.为了充分利用标签之间的潜在结构信息,低秩矩阵分解(Low⁃Rank Matrix Factorization)被广泛应用于缺失标签的恢复与多标记预测.该类方法基于一个基本假设:尽管标签空间维度较高,但标签之间通常存在显著相关性,因此标签矩阵可由少量潜在语义因子进行表示,即标签矩阵具有低秩结构.

设训练样本特征矩阵为X n×d,其中,n表示样本数量,d表示特征维度.对应的标签矩阵记为Y1,0,-1n×L,其中,L为标签数量.低秩假设下标签矩阵满足rankYminn,L,意味着高维标签空间可以通过一个低维潜在空间进行重构.因此,标签矩阵通常被建模为两个低维矩阵的乘积,即YVUT,其中,V n×r表示标签潜在表示矩阵,U L×r表示恢复矩阵,r为潜在维度,并满足rminn,L.通过该分解形式,模型能够利用共享潜在因子刻画标签之间的相关结构,从而在缺失标签位置进行合理预测.

然而,在MLML场景中,标签矩阵并非完全观测,因此模型只应在已知标签位置进行监督约束.为此,引入掩码矩阵(Mask Matrix)M

0,1n×L.在此基础上,通过逐元素乘积(Hadamard Product),仅在观测位置计算重构误差,由此构建低秩分解模型的基本损失项:

rec=MY-VUTF2

为了避免模型过拟合并提升学习稳定性,通常需要在潜在矩阵上加入正则约束.综合重构损失与正则项,可得到缺失标签条件下低秩矩阵分解模型的标准优化目标:

minU,VMY-VUTF2+λ1UF2+λ2VF2

2 LLRD⁃MLML算法

针对缺失标签条件下多标记学习中标签结构难以准确建模的问题,本文提出一种基于局部低秩分解思想的缺失多标记学习方法LLRD⁃MLML,从标签局部结构出发,通过对标签子集进行低秩建模,并结合全局融合机制与图结构约束,实现对潜在标签相关性的有效挖掘.为了更直观地展示本文提出的算法的整体建模流程,图1给出了算法的整体框架.

2.1 缺失标签条件下的泛化误差理论分析

设输入空间为X d,其中,d表示特征维度.标签空间为Y*=0,1L,其中,L为标签数量.样本由未知数据分布D独立同分布采样,即x,y~D,其中,xX表示输入特征,y=y1,,yLTY表示真实多标记向量.给定训练集S=xi,yii=1n,其中,n为样本数量.MLML的目的是学习预测函数f: d L,其输出为fx=f1x,,fLxT,其中,fjx表示模型对第j个标签的预测评分.为了衡量预测误差,引入损失函数𝓁fjx,yj,其值描述模型输出与真实标签之间的差异.假设损失函数满足以下性质.

有界性,即存在常数Θ>0使0𝓁·Θ.

损失函数满足c⁃Lipschitz条件,即存在常数c>0,对任意实数ab以及任意标签y都有:

𝓁a,y-𝓁b,yca-b

在统计学习理论中,模型真正希望最小化的是真实风险(Population Risk),定义如下:

Lf=Ex,y~D1Lj=1L𝓁fjx,yj

然而,由于真实数据分布未知,训练阶段只能计算经验风险(Empirical Risk),如下所示:

L^f=1mLi=1mj=1L𝓁fjxi,yij

统计学习理论的核心目标是刻画真实风险与经验风险之间的差距,即泛化误差.经典学习理论26表明,在一定概率意义下,真实风险可以被经验风险、模型复杂度项以及随机波动项所共同上界,即真实风险不超过训练误差与复杂度惩罚之和.其中,复杂度可衡量模型函数类拟合随机噪声的能力,而随机波动项反映有限样本带来的统计不确定性.

在缺失多标记学习场景下,训练数据中不是所有标签都可以被观测.为了描述该现象,引入掩码矩阵M0,1n×L,其中,

Mij=1,     if Yij is observed0,     if Yij is missing 

定义观测索引集合Ω=i,jMij=1,Ω的大小Ω表示实际可利用的监督数量.假设标签以独立概率p被观测,即PMij=1=p,则有ΩpmL,说明缺失标签本质上削减了有效监督规模.在这种情况下,训练过程只能在观测标签上计算损失,因此经验风险变为:

L^Ωf=1Ωi,jΩ𝓁fjxi,yij

定理26 设损失函数满足有界性与c⁃Lipschitz条件,对任意置信参数δ0,1,以至少1-δ的概率,有:

LfL^Ωf+2RΩ𝓁F+3Θlg2/δ2Ω

其中,RΩ𝓁F表示损失复合函数类在观测集合Ω上的Rademacher复杂度.

进一步,利用收缩引理27(Talagrand's Contraction Lemma),有:

RΩ𝓁FcRΩF

可得:

LfL^Ωf+2cRΩF+3Θlg2/δ2Ω

由上述定理可直接观察到,复杂度项与随机波动项均依赖于观测规模Ω.若假设每个标签以概率p被观测,则有ΩpmL,从而泛化误差界中的主要项满足O1pml.相比于完整监督的情形,该上界被放大为1/p倍,说明标签缺失会直接削弱模型的泛化能力.

综上,在标签缺失的场景下,可观测监督数量的减少会直接放大泛化误差上界,降低模型的学习能力.因此,在有限监督信息条件下,充分挖掘数据中潜在的结构信息以弥补监督不足带来的影响,成为提升模型性能的关键.

2.2 局部低秩模型的构建

设训练样本特征矩阵为X n×d,其中,n表示样本数量,d表示特征维度.对应的标签矩阵记为Y1,0,-1n×L,其中,L为标签数量.记Xl nl×d是第l个标签的样本子集,即所有包含该标签的样本的集合,其中,nl表示含有第l个标签的样本的个数.提取这些样本对应的标签向量后可形成第l个标签的标签子集Yl1,0,-1nl×L.通过上述方式,可以将整体标签空间分解为多个与标签相关的局部子空间,从而分析不同标签子集内部的结构性质.

表1展示了多标记学习领域中常用的公开基准数据集以及它们的秩特征.由表可见,大多数数据集的整体标签矩阵秩接近甚至等于标签数,即呈现明显的全局满秩特征.这表明在全局尺度下,标签关系具有较强的复杂性和多样性,标签之间不存在统一的低维线性结构.因此,直接假设整体标签矩阵满足低秩约束往往不合理.

进一步分析局部标签子集时,可以发现,绝大多数标签子集均呈现低秩特性,满秩子集数量极少.说明虽然整体标签空间结构复杂,但在局部语义相关样本构成的子空间中,标签之间仍然存在显著的相关性与冗余信息,即标签关系在局部尺度上具有更强的结构规律性.

基于以上观察,本文认为传统的全局低秩假设难以准确刻画真实多标记数据的结构特征,而从标签子集出发进行局部低秩分解建模更符合实际数据分布规律.因此,本文提出针对单个标签子集的低秩分解模型:

minUl,Vl,WlMlYl-VlUlF2+λ1XlWl-VlF2+λ2UlF2+λ3VlF2+λ4WlF2

其中,Ml为第l个标签的掩码矩阵,Vl nl×r表示第l个标签子集的标签潜在表示矩阵,Ul r×L表示第l个标签子集的标签恢复矩阵,Wl是第l个标签对应的局部特征映射矩阵.

为了保证局部低秩分解的稳定性与结构可学习性,进一步限定标签子集的选取规则,即每个标签子集包含的样本数量需满足nlL.

式(3)中的第一项表示局部标签子矩阵的低秩分解重构误差,该项仅在已观测标签位置上计算,避免缺失标签对模型学习造成干扰.第二项建立特征空间与低秩潜在标签空间之间的联系,约束特征经过线性映射后得到的表示应尽可能接近低秩标签潜在表示矩阵Vl.第三、第四和第五项为正则化约束项,分别控制低秩表示的复杂度、抑制潜在空间基矩阵的过拟合风险以及限制模型参数规模,以提高模型的稳定性与泛化能力.参数λ1,λ2,λ3λ4为权衡系数,用于平衡各目标项在整体优化过程中的相对重要性.

2.3 局部低秩模型的全局联合建模

2.2中,每个标签对应一个独立的局部子模型,通过学习局部特征映射矩阵Wl来刻画特征空间到标签潜在表示空间的映射关系.然而,多标记学习最终需要构建统一的预测模型,因此,本节进一步学习全局特征映射矩阵W.其中,Wl描述第l个标签的局部结构信息,W通过对所有局部映射进行联合约束学习得到.为此,引入局部⁃全局一致性约束,使全局模型在保持整体性的同时,融合各标签的局部低秩结构,实现由局部建模到全局预测的统一学习,如式(4)所示:

1Ll=1LW-WlUlF2

其中,WlUl可视为第l个标签子空间中由局部低秩结构学习得到的特征⁃标签映射.通过最小化W-WlUlF2,全局映射矩阵W被约束为同时接近多个局部子模型所学习到的结构信息,从而将不同标签子空间中的局部低秩关系融合到统一预测模型中.该约束并非简单地对局部模型进行平均,而是通过一致性正则化的方式,降低单一局部模型或原始缺失标签带来的结构偏差,使全局模型在保持整体预测能力的同时,吸收局部标签相关信息,进而提高缺失标签场景下模型的稳定性与泛化能力.

但值得注意的是,不同标签在特征空间中的可学习性存在显著差异.部分标签与特征之间具有较强的关联,其潜在结构更容易被学习;另一些标签可能由于样本稀疏或噪声干扰,表现出较弱的可学习性.如果在融合过程中对所有标签赋予相同权重,会导致低质量局部模型对全局映射产生负面影响,进而降低整体性能.

为了反映不同标签在特征空间中的可学习性差异,引入基于特征可学习性的标签信度度量ωl.用于衡量第l个标签与输入特征之间的整体相关程度,并作为局部⁃全局融合过程中的权重系数,使特征可学习性较强的标签在模型学习中发挥更重要的作用.

其定义如下:

ωl=1dk=1dPkl

其中,相关性Pkl通过皮尔逊相关系数计算:

Pkl=corrXk,Yl=iSlXik-X¯klYil-Y¯liSlXik-X¯kl2iSlYil-Y¯l2

其中,Sl=iyil0表示第l个标签已观测样本的索引集合,相关性计算仅基于已知标签样本,避免缺失标注带来的偏差.进一步,X¯kl=1nliSlXikY¯l=1nliSlYil分别表示对应样本集合上的特征均值与标签均值.

2.4 图正则化约束

尽管局部低秩建模能够挖掘标签内部结构信息,但该过程主要关注标签空间的结构一致性,没有显式地利用样本在特征空间中的几何关系.为了进一步提升模型的稳定性与泛化能力,引入图正则化约束,通过样本间的结构一致性对预测结果进行辅助约束,即两个高度相关的实例的预测标签也应具有相似的表示.图正则化项的定义如下:

12i,j=1nrijXωi-Xωj22=12i,j=1nrijXωi-XωjTXωi-Xωj=12i,j=1nrijXωi22+Xωj22-2Xωi-Xωj=trXWDrWTXT-trXWRWTXT=trXWLrWTXT

其中,Dr=diagd1,d2,,dn是一个对角矩阵,Lr =Dr -R是图拉普拉斯矩阵.R=rijn×n是通过RBF核计算的样本相似性矩阵,如下所示:

rij=exp-xi-xj222σ2,    xjNi or xiNj0,                                               otherwise     di=j=1nrij

其中,参数σ为RBF核函数的尺度参数,用于控制样本相似性随欧氏距离变化的衰减速度.

在引入图正则化项后,本文提出的整体优化目标函数为:

minUl,Vl,Wl,Wl=1LMlYl-VlUlF2+λ1XlWl-VlF2+λ2UlF2+λ3VlF2+λ4WlF2+l=1LwlW-WlUlF2+λ5trXWLrWTXT

2.5 算法优化及预测

由于整体目标函数包含多个相互耦合的变量,难以直接联合优化,本文采用交替最小化(Alternating Minimization)策略进行求解.在每次迭代中,优化过程可分为两部分.

(1)针对每个标签分别更新局部变量Ul,Vl

Wl.

(2)在固定局部变量后更新全局特征映射矩阵W.

具体的优化过程有四个步骤.

(1)更新Ul.固定Vl,WlW,涉及Ul的子问题为:

JUl=MlYl-VlUlF2+λ2UlF2+wlW-WlUlF2

其梯度为:

UlJ=-2VlTMlYl-VlUl+2λ2Ul-2wlWlTW-WlUl

采用梯度下降法进行更新:

UlUl-ηUUlJ

(2)更新Vl.固定Ul,WlW,涉及Vl的子问题为:

JVl=MlYl-VlUlF2+λ1XlWl-VlF2+λ3VlF2

其梯度为:

VlJ=-2MlYl-VlUlUlT+2λ1Vl-XlWl+2λ3Vl

采用梯度下降法进行更新:

VlVl-ηVVlJ

(3)更新Wl.固定Ul,VlW,涉及Wl的子问题为:

JWl=λ1XlWl-VlF2+λ4WlF2+wlW-WlUlF2

Wl求导并令其导数为0,可以整理成Sylvester方程形式:

λ1XlTXl+λ4IdWl+wlWlUlUlT=λ1XlTVl+wlWUlT

该方程可通过标准数值方法(本文使用MATLAB中的Sylvester函数)来高效求解.

(4)更新W.固定Ul,VlWl,涉及W的子问题为:

JW=l=1LwlW-WlUlF2+λ5trXWLrWTXT

记:

Al=WlUl,Ω=l=1Lwl,S=l=1LwlAl

其梯度为:

WJ=2ΩW-S+2λ5XTXWLr

采用梯度下降法进行更新:

Wt+1=Wt-ηWWJW=Wt=Wt-2ηWΩWt-S+λ5XTXWtLr

最终可得到全局特征映射矩阵W.对于任意测试样本x* 1×d,首先计算其在所有标签上的预测评分向量:

fx*=x*W

其中,fx*=f1x*,f2x*,,fLx*

 1×L,flx*表示样本x* 的第l个标签的预测值.进一步,根据预测评分得到最终的标签预测结果:

y^l*=1,       flx*τ-1,    flx*<τ

其中,τ为判别阈值.实验中采用τ=0作为默认阈值,即当预测评分大于等于0时,认为样本具有对应标签;否则认为样本不具有该标签.由此可得测试样本的预测标签向量ŷ*=ŷ1*,ŷ2*,,ŷL*.

算法的具体流程如下所示.

算法 LLRD⁃MLML

输入:样本特征矩阵X n×d,缺失标签矩阵Y

1,0,-1n×L,掩码矩阵M0,1n×L,潜在维度r,正则化参数λ1,λ2,λ3,λ4,λ5,RBF核参数σ,学习率η,最大迭代次数T.

输出:全局特征映射矩阵W,预测标签矩阵Ŷ.

1.初始化全局特征映射矩阵W

2.根据RBF核函数计算样本相似性矩阵R

3.计算度矩阵Dr 并构造图拉普拉斯矩阵Lr=Dr-R;

4.for l=1,2,,L do

5. 根据第l个标签构造样本索引集合Sl=iyil =1;

6. 根据Sl提取第l个标签对应的局部特征子矩阵Xl、标签子矩阵Yl和掩码矩阵Ml

7. 初始化局部变量Ul,VlWl;

8. 根据式(6)计算第l个标签与各特征之间的Pearson相关系数Pkl;

9. 根据式(5)计算标签信度权重ωl;

10.end for

11.for t=1,2,,T do

12. for l=1,2,,L do

13. 固定Vl,WlW,根据式(11)更新Ul;

14. 固定Ul,WlW,根据式(14)更新Vl;

15. 固定Ul,VlW,求解式(16)更新Wl;

16. end for

17. 固定所有局部变量Ul,VlWl,根据式(19)更新W;

18. 判断目标函数是否收敛;

19.end for

20.对于测试样本x*,根据式(20)计算预测评分向量fx*;

21.根据式(21)得到最终预测标签ŷl*;

22.输出全局特征映射矩阵W和预测标签矩阵Ŷ.

3 实验及结果分析

3.1 实验准备

为了全面评估本文提出的方法的有效性,在10个公开的多标记数据集上进行实验.各数据集的实例数、特征维数、标签数量以及标签矩阵的秩结构统计信息如表1所示.通过在不同规模和不同标签结构的数据集上进行测试,可以更客观地评估模型在复杂多标记学习场景中的泛化能力与稳定性.

对性能的评估,采用多标记学习领域中常用的六种评价指标28,包括Hamming Loss (HL),Ranking Loss (RL),One Error (OE),Area under Curve (AUC),Average Precision (AP)以及Coverage (COV).

这些指标分别从标签级预测准确性、排序质量以及整体检索能力等多个角度对模型性能进行综合评价.

为了验证本文提出的方法的有效性,选取2SML,RMFL,DM2L,LRNML和ALSRML五种具有代表性的缺失多标记学习方法进行对比.所有算法的参数均按原文建议进行选择.

具体如下.

(1) 2SML29.模型参数λ1,λ2λ3的搜索范围为10-4,,101,参数α=0.6,β=1-α.

(2) RMFL30.模型参数λ1λ2的搜索范围为10-5,,105,λ31,2中选取,λ4的搜索范围为4-7,,42.

(3) DM2L31.选择其非线性版本.模型参数λd10-5,,105中搜索,σ0.5,1,1.5,2中选取.

(4) LRNML32.参数λ1,λ3λ4的搜索范围为10-10,,1010,参数λ2的搜索范围为0.05,

0.1,,0.5.

(5) ALSRML33.参数λ1,λ2λ310-4,,

103搜索,λ固定为1,k设为5.

(6)本文提出的LLRD⁃MLML算法.参数λ1,λ2,λ3λ4的搜索范围为10-3,,103,参数λ5的搜索范围为10-6,,100,并设置r=0.5L,其中,L表示数据集标签的数量.

3.2 实验结果及分析

通过在10个公开多标记数据集上的对比实验,系统评估提出的LLRD⁃MLML方法在缺失标签场景下的有效性与稳定性.实验结果如表2~5所示,表中黑体字表示性能最优.篇幅限制,仅展示OEAPCOV三个评价指标的实验结果,HLRLAUC在不同参数设置下的变化规律与展示的指标基本一致.

可以看出,LLRD⁃MLML在10个公开多标记数据集上的六项评价指标(HLOERLAPAUCCOV)及综合表现均优于或接近当前的主流方法.根据各指标的平均排名统计,LLRD⁃MLML的多数评价指标的平均排名都是最优,其中,RLAP以及COV等关键排序与检索类指标的优势尤为明显,表明该方法能够更准确地学习标签相关结构并稳定地提升多标签排序质量.此外,在不同的标签缺失比例条件下,LLRD⁃MLML性能下降的幅度相对较小,整体趋势更平稳,说明该方法在缺失标签场景下具有较强的鲁棒性与泛化能力.

表5展示了在不同标签缺失比例下,各方法在六项评价指标上的平均排名结果.由表可见,LLRD⁃MLML在所有缺失率下均取得最低的综合平均排名,分别达到1.60,1.78和1.63,显著优于其他对比方法,说明该方法在不同评价指标之间具有一致且稳定的整体优势.

与对比方法相比,部分基于全局低秩或流形结构的模型在某些数据集上可以取得局部最优结果,但其性能随着数据复杂度或标签缺失程度的增加往往出现明显波动.LLRD⁃MLML在多数数据集上能够持续地保持较优排名,说明局部低秩分解策略能更好地刻画现实多标记数据中存在的局部子空间结构,缓解传统整体低秩假设带来的表达限制.同时,从标准差的结果可以观察到,LLRD⁃MLML在不同缺失率下均有较稳定的表现,进一步验证了模型在结构学习与标签恢复过程中的稳定性与可靠性.

综上,实验结果充分说明提出的LLRD⁃MLML方法在预测精度、排序质量以及缺失标签鲁棒性方面的整体优势.

3.3 统计假设检验

采用Friedman统计检验34来判断六种算法之间的性能差异是否具有统计显著性.标签缺失率为60%的Friedman统计检验结果如表6所示.由表可见,所有指标的Friedman统计量均超过显著性水平0.05下的临界值2.42,因此拒绝零假设,说明各算法之间的性能差异具有统计显著性.

采用Nemenyi后续检验34进一步分析这些差异,结果如图2所示.由图可见,LLRD⁃MLML的所有评价指标均位于最优排名区域,并在多数情况下与部分对比方法形成显著差异.具体地,HLRLAP以及COV指标,LLRD⁃MLML的平均排名明显优于RMFL和LRNML,显示出较强的整体优势.其OE与AUC指标,LLRD⁃MLML同样保持领先或接近领先,表明该方法在不同类型评价指标下具有一致且稳定的性能表现.

3.4 参数敏感性分析

为了进一步分析模型性能对关键超参数的敏感性,对LLRD⁃MLML中的主要正则化参数进行实验研究.图3展示了不同参数取值下HLOERLAUCAPCOV的变化趋势,实验在Business数据集上进行,并设置标签缺失率为0.6.

从整体结果看,当参数位于合理区间时,各评价指标变化较为平稳,说明LLRD⁃MLML对参数扰动具有较好的鲁棒性.其中,参数λ3λ4在较宽范围内均能保持稳定性能,仅在极端取值时出现明显的性能下降,表明模型对该类正则化项的依赖程度适中.相比之下,λ1,λ2λ5 对模型性能的影响更显著,当参数过大时,HLOERLCOV指标明显恶化,同时AP出现下降趋势,说明过强的约束会抑制模型对潜在标签结构的学习能力.

3.5 收敛性分析

为了验证LLRD⁃MLML的优化稳定性与收敛特性,对在不同数据集上的目标函数进行收敛实验.图4给出了Business和Health数据集上的目标函数随迭代次数变化的曲线.

由图可见,目标函数值在初始阶段快速下降,说明模型能够在早期迭代中迅速捕获主要的结构信息并实现有效优化.随着迭代次数增加,目标函数逐渐趋于平稳并在较少迭代次数内达到稳定状态,表明提出的优化策略有良好的收敛性能.

4 结论

本文针对缺失标签多标记学习中传统整体低秩假设难以刻画复杂标签结构的问题,提出了一种基于局部低秩分解的缺失标签多标记学习方法(LLRD⁃MLML).该方法对构建的标签级局部子空间进行低秩建模,并结合局部⁃全局联合学习与图正则化约束,实现了对潜在标签结构的有效挖掘与稳定预测.实验结果表明,提出方法在不同缺失标签场景下均表现出较好的性能与鲁棒性.

未来将探索更灵活的局部结构建模策略以及非线性表示学习框架,以提升模型的表达能力与应用范围.

参考文献

[1]

Dai J HWang Z YHuang W Y. Novel multi⁃label feature selection via label enhancement and relative maximal discernibility pairs. International Journal of Machine Learning and Cybernetics202415(8):3237-3253.

[2]

Jing XWu Z AZhang Let al. Electrical fault diagnosis from text data:A supervised sentence embedding combined with imbalanced classification. IEEE Transactions on Industrial Electronics202471(3):3064-3073.

[3]

Alves R TDelgado M RFreitas A A. Multi⁃label hierarchical classification of protein functions with artificial immune systems∥Advances in Bioinfor⁃matics and Computational Biology.Berlin,Germany:Springer,2008:1-12.

[4]

Zhu YKwok J TZhou Z H. Multi⁃label learning with global and local label correlation. IEEE Transactions on Knowledge and Data Engineering201830(6):1081-1094.

[5]

Qian W BHuang J TXu F Ket al. A survey on multi⁃label feature selection from perspectives of label fusion. Information Fusion2023,100:101948.

[6]

Xu S PShang LShen F Ret al. Incomplete label distribution learning via label correlation decomposition.Information Fusion2025,113:102600.

[7]

Zhang M LZhou Z H. ML⁃KNN:A lazy learning approach to multi⁃label learning. Pattern Recog⁃nition200740(7):2038-2048.

[8]

Xu S PYang X BYu H Let al. Multi⁃label learning with label⁃specific feature reduction. Knowledge⁃Based Systems2016,104:52-61.

[9]

Cheng Z WTan Z H. Multi⁃label learning for label⁃specific features using correlation information with missing label. Expert Systems with Applications2025,269:126491.

[10]

Khan HWang X ZLiu H. Handling missing data through deep convolutional neural network. Information Sciences2022,595:278-293.

[11]

Tan A HJi X WLiang J Yet al. Weak multi⁃label learning with missing labels via instance granular discrimination. Information Sciences2022,594:200-216.

[12]

Qiu Y NZhou G XZeng J Het al. Imbalanced low⁃rank tensor completion via latent matrix factorization. Neural Networks2022,155:369-382.

[13]

Wu B YLyu S WGhanem Bet al. ML⁃MG:Multi⁃label learning with missing labels using a mixed graph∥Proceedings of the IEEE International Conference on Computer Vision. Santiago,Chile:IEEE,2015:4157-4165, DOI:10.1109/ICCV. 2015.473 ..

[14]

Giménez⁃Febrer PPagès⁃Zamora AGiannakis G B. Matrix completion and extrapolation via kernel regression. IEEE Transactions on Signal Processing201967(19):5004-5017.

[15]

He Z FYang MGao Yet al. Joint multi⁃label classification and label correlations with missing labels and feature selection. Knowledge⁃Based Systems2019,163:145-158.

[16]

Zhao F PGuo Y H. Semi⁃supervised multi⁃label learning with incomplete labels∥Proceedings of the 24th International Conference on Artificial Intelligence. Menlo Park,CA,USA:AAAI Press,2015:4062-4068.

[17]

Guo CWang X ZHuang C Qet al. Multi⁃label feature selection via exploring reliable instance similarities. Knowledge⁃Based Systems2025,322:113700.

[18]

Kumar SRastogi R. Low rank label subspace transformation for multi⁃label learning with missing labels. Information Sciences2022,596:53-72.

[19]

Nie F PHuang HDing C. Low⁃rank matrix recovery via efficient Schatten p⁃norm minimization∥Proceedings of the AAAI Conference on Artificial Intelligence.Menlo Park,CA,USA:AAAI Press,2012:655-661.

[20]

Recht BFazel MParrilo P A. Guaranteed mini⁃mum⁃rank solutions of linear matrix equations via nuclear norm minimization. SIAM Review201052(3):471-501.

[21]

Wang ZHu DLuo X Het al. Performance guarantees of transformed Schatten⁃1 regularization for exact low⁃rank matrix recovery. International Journal of Machine Learning and Cybernetics202112(12):3379-3395.

[22]

Zhang SYin P HXin J. Transformed Schatten⁃1 iterative thresholding algorithms for low rank matrix completion. Communications in Mathematical Sciences201715(3):839-862.

[23]

Li Y HHu LGao W F. Label correlations variation for robust multi⁃label feature selection. Information Sciences2022,609:1075-1097.

[24]

Wang YWang C ZDeng T Qet al. Multi⁃label feature selection via nonlinear mapping and manifold regularization. Information Sciences2025,704:121965.

[25]

Huang RWu Z J. Multi⁃label feature selection via manifold regularization and dependence maximization. Pattern Recognition2021,120:108149.

[26]

Bartlett P LMendelson S. Rademacher and gaussian complexities:Risk bounds and structural results. Journal of Machine Learning Research2003,3:463-482.

[27]

Mohri MRostamizadeh ATalwalkar A. Foundations of machine learning. The 2nd Edition. Cambridge,USA:MIT Press,2018.

[28]

Yang YChen H MMi Yet al. Multi⁃label feature selection based on stable label relevance and label⁃specific features. Information Sciences2023,648:119525.

[29]

Qian KMin X YCheng Y Set al. Weight matrix sharing for multi⁃label learning. Pattern Recognition2023,136:109156.

[30]

Feng LHuang JShu S Let al. Regularized matrix factorization for multilabel learning with missing labels. IEEE Transactions on Cybernetics202252(5):3710-3721.

[31]

Ma Z CChen S C. Expand globally,shrink locally:Discriminant multi⁃label learning with missing labels. Pattern Recognition2021,111:107675.

[32]

Wang C ZWang YDeng T Qet al. Low⁃rank multilabel learning based on nonlinear mapping. IEEE Transactions on Artificial Intelligence20245(6):2693-2707.

[33]

Qin ZChen H MYin T Yet al. Adaptive label secondary reconstruction for missing multi⁃label learning. Knowledge⁃Based Systems2024,299:112019.

[34]

Deng Z XLi T RDeng D Yet al. Feature selection for label distribution learning using dual⁃similarity based neighborhood fuzzy entropy. Information Sciences2022,615:385-404.

基金资助

国家自然科学基金(12301581)

国家自然科学基金(62573036)

北京市自然科学基金(4252033)

AI Summary AI Mindmap
PDF (1281KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/