层次拓扑增强的多模态推荐方法

许钊菁 ,  王海荣 ,  易之航 ,  王静

山西大学学报(自然科学版) ›› 2026, Vol. 49 ›› Issue (04) : 557 -570.

PDF (2317KB)
山西大学学报(自然科学版) ›› 2026, Vol. 49 ›› Issue (04) : 557 -570. DOI: 10.13451/j.sxu.ns.2025111
第19届全国知识图谱与语义计算大会(CCKS2025)论文选登

层次拓扑增强的多模态推荐方法

作者信息 +

Hierarchical Topology-enhanced Multi-modal Recommendation Method

Author information +
文章历史 +
PDF (2372K)

摘要

针对推荐系统存在的多模态信息利用不充分和交互数据噪声问题,本文从交互去噪的角度出发,提出层次拓扑增强的多模态推荐方法。该方法通过层次锚点拓扑结构嵌入,按节点活跃度分层采样锚点并建模全局关联性,解决过度平滑和长距离依赖捕捉问题,基于自监督学习设计可学习的生成器来生成用户的多模态偏好与去噪交互图,进行用户偏好和交互图的双向协同更新,设计“图结构-模态”一致性约束有效抑制交互噪声。在三个真实数据集上实验,将其结果与13个基线模型对比,本文方法在Recall@20和NDCG@20指标上分别平均提升了2.37%和3.27%。

Abstract

Recommendation systems often suffer from insufficient utilization of multi-modal information and noisy interaction data. To address these issues, this paper proposes a hierarchical topology-enhanced multi-modal recommendation method from an interaction denoising perspective. The method employs hierarchical anchor topology embedding, which performs stratified anchor sampling based on node activity levels to model global relationships, thereby mitigating over-smoothing and capturing long-range dependencies. Based on self-supervised learning, a learnable generator is designed to produce user multi-modal preferences and denoised interaction graphs, enabling bidirectional collaborative updating between user preferences and interaction graphs. A "graph-structure-modality" consistency constraint is incorporated to effectively suppress interaction noise. Experiments conducted on three real-world datasets demonstrate that the proposed method achieves average improvements of 2.37% and 3.27% on Recall@20 and NDCG@20 metrics, respectively, compared with 13 baseline models.

Graphical abstract

关键词

自监督学习 / 图神经网络 / 交互去噪

Key words

self-supervised learning / graph neural networks / interaction denoising

引用本文

引用格式 ▾
许钊菁,王海荣,易之航,王静. 层次拓扑增强的多模态推荐方法[J]. 山西大学学报(自然科学版), 2026, 49(04): 557-570 DOI:10.13451/j.sxu.ns.2025111

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

推荐系统作为信息过载问题的核心解决方案,其研究始终围绕精准捕捉用户潜在偏好与复杂交互关系展开1。从早期基于协同过滤的浅层模型到融合多模态信息与图结构的深度框架,研究范式经历了多次重要革新。

以协同过滤2为代表的传统推荐系统,通过用户-项目交互矩阵的低秩近似实现推荐3。这类方法假设用户与项目特征可通过线性组合建模,如基于矩阵分解的贝叶斯个性化排序(Matrix Factorization with Bayesian Personalized Ranking,MF-BPR)模型4借助贝叶斯个性化排序优化矩阵分解过程,在数据稀疏场景中展现出一定有效性。然而,此类方法仅能利用低阶交互信息,无法对用户-项目交互网络的高阶连通性进行建模,难以刻画用户的复杂行为模式。

随着图神经网络(Graph Neural Network, GNN)5在图结构建模中的兴起,推荐系统迎来了突破性进展,如神经图协同过滤(Neural Graph Collaborative Filtering,NGCF)6等通过消息传递机制聚合邻域特征的推荐模型。这类方法能够有效地捕获交互图中的高阶协同信号7,但其过度平滑问题8使节点特征在深层传播中逐渐趋于同质化,同时误点击、虚假交互则会误导模型学习,降低推荐精度。

针对该问题,自监督学习(Self-Supervised Learning, SSL)9的引入成为新方向。自监督学习通过数据增强和构建对比学习样本或对比学习视图,迫使相似用户或项目的嵌入在特征空间中彼此靠近,从而增强表征的鲁棒性。但这类方法仍受限于静态图结构和拓扑特征的局限性,固定交互图难以动态适应噪声干扰10。对于现有方法普遍存在视图生成与语义脱节、单模态信息瓶颈等问题,引入多模态数据作为协同信息的重要补充也被认为是可行的解决方案。

现实世界中的项目通常蕴含丰富的多模态信息(如视觉图像、文本描述、音频)。这些信息为理解项目语义和用户兴趣提供了宝贵的补充线索11。有效融合多模态信息,不仅能缓解数据稀疏性问题,更能揭示用户深层次的偏好,提升推荐的准确性和可解释性。但尽管多模态推荐系统借助文本、图像等辅助信息的整合,让推荐的语义丰富度得到了显著提升。在挖掘多模态数据中的有效信息时,怎样融合不同模态下的特征表示并规避噪声干扰,仍是现有研究中存在的明显局限问题。此外,当前的相关方法还存在模态信息利用不够充分、图结构与模态交互关系割裂的问题,制约了模型性能与推广能力。

为了解决上述问题,本文提出了一种层次拓扑增强的多模态推荐方法(Hierarchical Topology-Enhanced Multi-Modal Recommendation Method, HEMMR)。该方法通过层次锚点拓扑机制生成全局感知的节点表示以增强节点特征,改善过度平滑和长距离依赖捕捉困难问题。利用自编码器和多头注意力机制设计可学习的生成器,进行增强交互图和用户多模态偏好特征的生成。通过在两者间构造双向反馈通道,设计“图结构-模态”一致性约束和对比学习任务,能够有效抑制交互噪声。

1 相关工作

1.1 图神经网络在推荐系统中的应用

随着图神经网络的发展,推荐系统逐渐借助图结构来建模用户与项目的高阶关系,以缓解数据稀疏与冷启动等问题。轻量级图卷积网络(Light Graph Convolution Network,LightGCN)12通过简化的图卷积去除非线性变换,仅保留邻居特征聚合,大幅提升了协同信号的建模效率与准确性。

在此基础上,研究者逐渐将图神经网络扩展至多模态推荐场景,以更好地利用来自视觉、文本、语音等模态的辅助信息。多模态图卷积网络(Multimodal Graph Convolution Network,MGCN)13模型通过构建各模态下的用户-项目二部图,模拟用户对不同模态的关注,引导信息传播。面向多模态推荐的隐结构挖掘方案(Latent Structure Mining Scheme for Multimodal Recommendation,LATREC)14通过模态感知结构学习层替代传统交互图,构建项目-项目关系图,从而捕捉多模态信息间的潜在关联。与此同时,注意力机制也被引入多模态推荐系统,可以在邻居信息聚合时分配权重,更加精细地刻画不同交互重要性。轻量级图 Transformer模型(Light Graph Transformer Model,LightGT)15则采用轻量化图Transformer,将注意力机制引入用户-项目建模中,更好地捕捉全局依赖。对于多模态信息在传播中的噪声问题,多视图图卷积网络(Multi-View Graph Convolutional Network,MVGCN)16通过多视图卷积架构,在各模态子图上执行独立的轻量图卷积以捕捉模态专属交互模式,并基于用户偏好调整模态特征的融合来缓解噪声污染和偏好不完整的问题。

然而,上述方法往往依赖较深的传播层数来覆盖高阶关系,容易导致过度平滑问题。同时,在多模态场景下,噪声信息在传播过程中可能被放大,削弱模型的鲁棒性。基于现有推荐方法在捕捉高阶关系的工作,本文设计层次锚点拓扑增强机制建模全局关联性,帮助去噪交互图生成器捕获全局结构信息,缓解过度平滑问题,使节点表征保持多样性与区分性。

1.2 自监督学习在推荐系统中的应用

自监督学习近年来在推荐系统中被广泛应用,其核心思路是通过数据的内在结构生成增强视图,并借助特定优化任务缓解数据稀疏性17-18。在单模态场景下,主要基于交互图展开。自监督图学习(Self-supervised Graph Learning,SGL)19创新性地采用节点丢弃、边丢弃和随机游走来构造对比视图,构造对比视图并引入自监督对比损失,从而提升嵌入表示的鲁棒性与区分性。与之不同,简易图对比学习方法(Simple Graph Contrastive Learning,SimGCL)20不再依赖传统的图结构增强策略,而是在嵌入空间中注入均匀噪声来构建对比视图,以增强特征鲁棒性。图Transformer(Graph Transformer,GFormer)21则借鉴变分自编码器的思想,通过掩码和重建部分用户-项目交互信息,从而学习到更鲁棒的用户和物品表示。

在多模态推荐场景下,自监督学习方法聚焦于提升多模态特征的鲁棒性,核心思路是缓解模态内部特征噪声和模态融合过程中可能引入的信息偏差。多模态图对比学习(Multi-Modal Graph Contrastive Learning,MMGCL)22将自监督学习应用于微视频推荐,提出模态边缘丢弃、模态遮蔽和扰乱负样本模态等数据增强技术,确保各模态在推荐过程中充分发挥作用。自举多模态模型(Bootstrapped Multi-modal Model,BM3)23通过引入潜在嵌入随机丢弃结合自监督对比损失,降低对负采样及额外图增强的依赖与开销。自监督学习引导的多媒体推荐(Self-supervised Learning-guided Multimedia Recommendation,SLMRec)24则设计了基于多模态特征噪声扰动与多模态模式挖掘的自监督任务,并与推荐目标联合优化,以增强多模态推荐的鲁棒性与表达能力。多模态自监督学习(Multi-Modal Self-Supervised Learning,MMSSL)25通过模态感知对抗扰动与跨模态对比学习,有效捕捉不同模态下用户偏好的内在关联性。面向多模态推荐的局部与全局图学习(Local and Global Graph Learning for Multimodal Recommendation,LGMRec)26是一种基于局部和全局超图学习的多模态推荐系统,旨在同时建模用户的局部和全局兴趣,以提高推荐的准确性和鲁棒性。主图学习(Principal Graph Learning,PGL)27通过全局感知和局部感知子图从用户-项目交互图中提取主要子图,然后在主要子图上采用消息传递,以实现更精准的个性化推荐。

这些方法有效提升了多模态特征的鲁棒性,但其关注点主要局限于建模用户对模态信息的偏好和模态内部特征中的噪声控制,而对交互数据中固有的噪声考虑不足。基于上述自监督学习在多模态特征去噪和建模多模态偏好方面的应用,本文采用自编码器和多头注意力机制结合对比学习构建可学习的生成器,并探索多模态偏好能否提升多模态推荐模型在交互噪声下的鲁棒性。

2 方法模型

2.1 模型描述

层次拓扑增强的多模态推荐方法通过层次锚点拓扑结构增强用户、项目节点特征,设计可学习的生成器,用于联合建模用户的多模态偏好与去噪交互关系,利用对比学习任务进行自监督协同训练,构建“图结构-模态”一致性约束来抑制交互噪声。整体框架如图1所示。HEMMR主要由3个部分构成:

1)层次锚点拓扑嵌入。依据交互频度选择不同层次的锚点,分别增强用户、项目的节点特征并建模全局关联性;

2)多模态偏好辅助去噪交互图生成。通过多头注意力机制观测用户的潜在交互兴趣,为交互图中的边生成交互权重,该权重将用于构建去噪交互图生成器,同时通过多模态偏好协同进一步辅助去噪交互图的生成;

3)去噪交互图引导多模态偏好生成。借助生成的去噪交互图指导多模态偏好生成器,采用注意力机制生成用户多模态偏好并反向影响去噪交互图的生成,设计“图结构-模态”一致性约束,抑制交互噪声。

2.2 预备知识和符号定义

多模态推荐系统通过学习用户与项目的特征表示,预测用户对未交互项目的交互概率。为便于文中形式化描述,在表1列举文中所用到的主要符号及表示的含义。其中,多模态推荐任务各部分的相关定义如下。

定义1 多模态推荐。输入用户-项目交互图G、用户嵌入Eu、项目嵌入Ei和多模态特征Fm,预测用户u对项目i的交互概率y^ui

定义2 交互图。对于用户集合U和项目集合I存在交互矩阵YRNu×Ni。若用户u与项目i交互,则yui=1,否则yui=0。用户与项目的交互形成图G=V,E,其中节点集V=UI,边集E=yuiyui=1表示节点的交互。

定义3 多模态特征。项目的多模态特征由Fm=f1m,f2m,,fim,,fNim表示,fim表示经特征提取后项目i的第m种模态特征。

2.3 层次锚点拓扑结构

本文通过层次锚点拓扑嵌入显式建模节点与全局结构关联性以增强节点特征,为去噪交互图生成器提供结构感知的节点表示,解决传统图神经网络难以捕获长距离依赖及过度平滑的问题。

2.3.1 层次锚点选择

具体而言,将用户节点集合U和项目节点集合I分别按节点度降序排列28,依据度分布划分为三个活跃度层次,划分规则如图2所示。高活跃度层包含度值最高的前20%节点,主导交互图的信息传播与连通性;中活跃度层涵盖了度值处于中间40%的节点,涵盖普通用户与常规项目,构成交互结构的主体29;低活跃度层则由度值较低的后40%节点组成,对应低频交互用户和长尾项目,用于丰富交互的多样性30。锚节点采样遵循6∶3∶1的比例从划分好的活跃度层次中随机采样锚节点VAV,这种比例设置是基于对不同活跃度节点在交互图拓扑中的重要性和代表性的考量(在3.5章节进行论述)。其中为了保证用户和项目在全局拓扑表征中的作用,避免单侧信息主导拓扑学习,用户锚点和项目锚点的总数各占50%。

需要说明的是,若仅依赖初始交互频度进行静态划分,难以反映用户-项目交互的动态变化。为此,在迭代优化过程中,模型会基于最新的交互分布重新划分节点活跃度层次,并动态选择锚点节点,以保持用户与项目在全局拓扑表征中的均衡贡献。

2.3.2 层次锚点拓扑传播

基于选定的层次锚点,通过计算从节点vg到节点va必须遍历的最小边数,来描述节点vg与锚点va之间的距离dg,a,通过最短路径算法将衡量节点间在拓扑结构上的远近程度。拓扑权重ωg,a由距离信息转化得到,如公式(1)所示:

ωg,a=11+exp(dg,a)

当节点与锚点的距离过大或没有连接时拓扑权重ωg,a趋近于0,这表明当前节点与锚点间没有必要关联,不具备依据该锚点增强当前节点的必要性。为了增强用户、项目的节点特征,解决长距离依赖捕捉问题,层次锚点拓扑结构将依据相关权重来聚合节点嵌入,如公式(2)所示:

e¯gl=(vaVA)Wlωg,ae¯g(l-1)e¯a(l-1) / VA

其中W(l)Rd×2d是第l传播层的权重矩阵,用于对节点特征进行线性变换;e¯g(l-1),e¯a(l-1)Rd分别表示节点vg和锚点va在第l-1层的特征表示。通过将节点自身特征与锚点特征进行融合,可以为下文的去噪交互图生成器捕获全局结构的关联性。

2.4 多模态偏好辅助去噪交互图生成

为了抑制在挖掘用户潜在兴趣偏好过程中原始交互视图引入的噪声信息,设计了一种与多模态信息协同的去噪交互图生成器来学习用户偏好,并利用自监督学习策略抑制交互噪声。

2.4.1 用户-项目协同权重生成

本文采用多头注意力机制学习用户的真实交互偏好。为区分用户和项目所处不同的语义空间,分别定义不同的可学习矩阵Quh,Wih,VihRdH,将增强后的用户特征作为查询张量,增强后的项目特征作为键张量和值张量,如公式(3)公式(6)所示:

Auih=(Quhe¯u)T(Wihe¯i)/d/H
A¯uih=softmaxAuih
ZuH=h=1HA¯uihVih e¯i+e¯u
ZiH=h=1HA¯uihVih e¯u+e¯i

其中ZuHZiH表示由多头注意力机制增强后的用户、项目嵌入表示集合。基于以上设计,模型可以学习到节点间的关联强度。将A¯uih融合来表示结构偏好权重αuih,该权重将作为协同权重α¯ui的一部分影响交互图的去噪,该过程如公式(7)公式(9)所示:

α¯uih=h=1HA¯uih/H
αuih=α¯uih/(vi,vu)Eα¯uih
α¯ui=αuih+ψαuim,存在模态偏好特征αuih,不存在模态偏好特 ,

其中αuim为多模态偏好权重,ψ为多模态偏好权重的影响系数。

2.4.2 去噪交互图生成器

为了提升模型抑制交互噪声的能力,设计去噪交互图生成器,通过协同权重指导自动编码器实现交互图的自我强化。具体而言,模型运用协同权重分别对交互图G中高、低协同权重的边进行遮蔽形成噪声交互图GV和增强交互图GE。在此基础上,通过自动编码器进行交互重建。以GV为例,其生成方法如公式(10)公式(11)所示:

αuiV=softmax1α¯ui+ε
GV=random(V,αuiVE)

其中αuiV表示图GV的边采样概率,ε为避免零分母而添加的小值。为了指导自动编码器通过自监督学习机制从噪声图中恢复高协同权重的交互,模型使用噪声图进行层次锚点拓扑嵌入操作,得到用户和项目的噪声嵌入特征eu'ei',同时构建损失函数MPR进行训练,使得噪声交互得分更低,如公式(12)所示:

MPR =(vu,vi)GVe'uTei'

为了增强模型对噪声的鲁棒性、减少信息冗余,避免已有研究中随机扰动视图对结构语义信息的破坏,本文采取基于自监督学习策略的图对比学习方法来过滤交互噪声。通过仅保留低协同权重交互生成对比交互图GC,拉近同一用户或项目在增强交互图GE中的表示特征与全局表征之间的距离,同时推远其在对比交互图中GC的噪声交互表征。基于该优化过程,定义如公式(13)所示的最小化目标:

CLG=logvVexpcos(evE,evC)/τ

其中evEevC分别表示节点v在增强交互图和对比交互图中的高阶嵌入。去噪交互图生成器的最终损失如公式(14)所示:

DG=MPR+λ0CLG

其中λ0为图结构对比学习损失权重。基于上述设计,由协同权重指导的自动编码器可以通过自监督学习实现交互图增强,从而抑制噪声对特征学习的影响。

2.5 增强交互图引导模态偏好生成

针对交互噪声与多模态信息利用不充分的问题,本文强化多模态信息在交互噪声分辨中的作用。通过建模用户跨模态偏好并将多模态信息融入噪声处理,挖掘用户与项目的深层特征关联,提升推荐系统在噪声环境中的鲁棒性与语义表征能力。

2.5.1 模态偏好生成器

为在挖掘项目多模态语义并建立用户跨模态偏好的同时规避交互噪声,模型基于增强交互图设计自注意力模块生成用户模态偏好特征。具体来说,模型将项目的多模态特征Fm映射至增强交互图GE上,采用LightGCN进行消息传播得到增强视图下的用户嵌入表示e¯u。以音频模态为例,利用自注意力机制捕捉当前用户嵌入与项目在音频模态下的交互信息,如公式(15)公式(17)所示:

Q=WQe¯u,K=WKe¯u
p¯uA=softmax((QKT)/d)WVfiA
puA=leakyrelu(WA'p¯uA+bA')

其中WQ,WK,WVRd×d均为可学习的模型参数,WA'Rd×dbA'Rd分别为投影矩阵、偏置向量,fiA为项目的音频特征。类似地,可以得到用户多模态偏好特征puApuTpuV

为了进一步提升用户多模态偏好特征的表征能力,缓解输入多模态语义信息带来的噪声问题,本文采用跨模态对比学习策略,将已交互项目的模态信息视为正样本对puA,fi+A,将未交互项目的模态信息视为负样本对puA,fi-A,通过损失函数MCL进行优化,如公式(18)所示:

MCL=-u,iVlogexpsimpuA,fi+A/τii+,i-expsimpuA,fiA/τ

2.5.2 模态偏好权重生成

本文通过生成各个模态下的偏好权重来完成去噪交互图生成器与多模态偏好生成器之间的双向协同更新。采用余弦相似度计算多模态下节点间的语义关联,通过平均求和得到模态偏好权重αuim。以音频模态为例,如公式(19)公式(20)所示:

αuiA=s(puA,fiA)=puAfiApuAfiA
αuim=M(A,V,T)αuiM/M

这样的设计确保被保留下来的交互关系包含了所有模态的协同信息,能够更全面地刻画用户对项目的真实偏好。同时,设计了“图结构-模态”一致性约束,抑制模态噪声对图结构的污染,实现图结构与模态的语义对齐,如公式(21)所示:

GM=(u,i)Eαuim-αuih2

2.6 模型优化与训练

对于用户u和项目i,将增强特征表示ZH基于增强交互图GE进行传播,得到增强的高阶嵌入E^。本文通过等权重平均融合高阶嵌入和各个模态下的用户偏好及项目多模态特征得到最终用户嵌入e˜u和项目嵌入e˜i,如公式(22)公式(23)所示:

E^=L-GCNL(ZH,GE)
e˜u=e^u+βmpum,e˜i=e^i+βmfim

交互评分的计算如公式(24)所示。采用贝叶斯个性化排序(Bayesian Personalized Ranking, BPR)损失进行训练,如公式(25)所示:

y^ui=e˜uTe˜i
BPR=-(u,i+,i-)Olnσ(y^ui+-y^ui-)

其中σ是sigmoid函数,O为训练集,i+i-分别表示与用户u交互过和未交互过的项目,y^ui+y^ui-为对应预测分数。模型通过优化手段高效建模用户-项目交互关系,并整合2.4节与2.5节提出的三种自监督学习损失函数,构建联合优化的总体损失函数,如公式(26)所示,以进一步挖掘图结构与节点关联信息,提升模型表征能力。

=BPR+DG+λ1MCL+λ2GM+λ3ΘF2 ,

其中λ1λ2λ3是各优化任务的权重。Θ表示模型的参数及其正则化项。

3 实验及分析

为了验证HEMMR的有效性,本文针对如下问题进行了实验。

问题1:与经典的协同过滤推荐模型和最新的多模态推荐模型基线相比,HEMMR性能如何。

问题2:各模块的工作对HEMMR的性能有什么影响。

问题3:超参数对HEMMR模型的性能有何影响。取何值时模型性能达到最优。

问题4:层次锚点拓扑结构中锚点采样比例是否具备泛化能力,采用动态的可学习采样比例是否更好。

问题5:模态和图结构双向协同去噪和自监督学习训练算法是否帮助HEMMR模型提高了在噪声环境下的鲁棒性。

问题6:通过层次锚点拓扑结构是否能有效解决过度平滑和捕捉长距离依赖困难的问题。

3.1 实验设置

为验证文中提出的HEMMR的性能,本文基于3个公开的多模态推荐数据集TikTok、Baby和Sports开展实验,数据集的统计信息见表2

实验时选择PyTorch为机器学习的框架,在PyCharm 2021,Intel®CoreIntel(R) Core(TM)i7-8700K CPU@3.70 GHz,Python 3.7,Win10 64位操作系统的实验环境下进行对比实验。在实验中,节点嵌入维度d确定为64,Batch-size设定为1024。采用Adam优化算法,设定初始学习率为0.001。选取Recall@20、NDCG@20作为评价指标,通过三次重复实验取其平均值,以确保数据可靠性与结论稳健性。

3.2 对比实验

针对问题1,本文将HEMMR与多类基线模型对比,包括传统推荐模型(MF-BPR4),自监督学习模型(SGL19、SimGCL20、GFormer21),图神经网络推荐模型(LightGCN12、NGCF6),多模态推荐系统(MGCN16、LATTICE14、BM323、LGMRec26、MMGCL22、PGL27、SLMRec24)。表3实验结果显示,HEMMR在3个数据集的Recall@20、NDCG@20指标上均优于所有基线模型。

相较于传统推荐方法MF-BPR,图神经网络模型NGCF和LightGCN凭借高阶协同表征进行推荐在推荐性能上实现了突破。其中LightGCN因架构精简更具优势,但在长距离依赖捕捉问题上表现不足。自监督模型中,SGL和SimGCL等模型均在图神经网络中整合了对比学习范式。实验数据表明,而SGL的随机视图生成方法因忽略语义关联,导致性能受限。GFormer因自监督学习任务与真实交互存在一定的语义偏差,所以在稀疏场景表现较弱。

相比上述模型,多模态推荐方法在基准模型中展现出系统性优势。图神经网络多模态方法MGCN通过融合模态与图结构展现优势,验证了多模态信息的关键价值。引入对比学习的模型LATTICE、BM3、MMGCL通过自监督任务增强模态表征,推动性能提升。SLMRec借助多模态信息辅助模型感知用户偏好,通过特征丢弃、特征掩蔽等操作生成单个项目的多个视图,但未对原始交互图结构进行去噪,这不利于挖掘用户和项目间关系。PGL通过挖掘和利用主要的局部结构来增强用户偏好,实现性能提升。LGMRec同时对局部和全局信息建模,分别利用局部图和全局超图捕获局部拓扑关系和全局依赖,又进一步提升模型性能。

实验结果表明简单的对比学习范式和基于协同信息直接建模用户偏好的推荐模型未能充分释放多模态潜力。而本文的HEMMR通过层次锚点拓扑结构解决长距离依赖捕捉问题,并通过多头注意力机制充分利用多模态特征参与交互去噪,同时利用“图结构-模态”一致性约束及对比学习抑制噪声,增强特征表示能力。其基于多模态偏好的交互图去噪机制与自监督协同训练策略,能有效区分真实交互与噪声、语义关联与模态噪声,最终实现性能突破。

与此同时,为了验证HEMMR的训练效率,本文在TikTok和Sports数据集上与SGL、SLMRec、BM3、LGMRec等四种代表性模型进行了收敛速度对比实验,结果如图3所示。HEMMR的优势主要来自三方面:其层次锚点拓扑结构增强了节点的全局结构感知,加快了长距离依赖的学习;可学习生成器协同建模多模态偏好和去噪交互图,有效降低了初期噪声干扰;图结构-模态一致性约束实现了信息双向对齐,进一步提升了优化效率。相比之下,SGL依赖随机视图增强,缺乏结构引导,优化过程缓慢;SLMRec和BM3分别采用静态图或随机扰动生成对比视图,难以早期捕捉真实偏好;LGMRec虽结合局部和全局信息建模,但其采用超图神经网络捕获更复杂的关系,这使得传播路径长、冗余信息多,导致训练过程收敛较慢。

3.3 消融实验

针对问题2,本文设计了5种变体模型开展消融实验,从层次锚点拓扑嵌入、多模态偏好辅助交互图去噪、去噪交互图引导多模态偏好生成及“图结构-模态”一致性四个维度进行分析,具体变体模型包括:

1)w/o HAS(Hierarchical Anchor Selection):以随机锚点代替层次锚点选择。

2)w/o HAT(Hierarchical Anchor Topology):移除层次锚点拓扑嵌入结构。

3)w/o GMC(Graph-modal Consistency):删除“图结构-模态”一致性损失。

4)w/o GG(Graph-guided):使用原交互结构代替去噪交互图引导模态偏好生成。

5)w/o MG(Modality-guided):取消多模态偏好辅助去噪交互图生成器。

消融实验结果如表4所示。w/o HAS在保留拓扑结构的基础上随机选用锚点,不考虑节点的活跃度对拓扑结构的影响,使得HEMMR不能准确捕获流行度偏差对节点拓扑的影响,从而无法解决长距离依赖捕捉问题。而w/o HAT禁用拓扑结构的表现较差是由于变体模型无法捕获全局节点的分布情况,这导致去噪交互图生成器缺乏对全局协同关系的感知,让模型只能依赖稀疏的局部邻居判断交互噪声,因此性能下降。

w/o GG不使用去噪后的交互图生成用户模态偏好,实验结果说明仅依靠原始交互无法规避噪声交互的影响,因此难以挖掘用户的真实模态偏好。而w/o MG未使用多模态信息进行交互噪声的判别,将导致去噪交互图生成器无法考虑多模态特征中的协同信号,致使性能下降。值得注意的是,w/o MG变体在TikTok数据集上有大幅下降。这是因为该数据集模态信息较多,运用多模态信息能更好地捕获用户的真实偏好,从而完成对交互关系的去噪,提升算法性能。

w/o GMC不采用“图结构-模态”一致性约束,这使得HEMMR在面临结构偏好权重与模态偏好权重呈相反态势时无法准确判别交互噪声。由于Sports数据集数据较稀疏,这一问题表现得尤为显著。

3.4 参数敏感性分析

针对问题3,本节对HEMMR的4个关键超参数进行讨论:图结构对比学习损失权重λ0,模态间对比学习损失权重λ1,“图结构-模态”一致性约束损失函数权重λ2和模态偏好权重在协同权重中的占比超参数ψ。通过网格搜索方法在三个数据集上寻找最优值。

图4可得对比学习任务对模型性能存在显著影响。值得注意的是,Baby数据集对高对比权重更为敏感。这是因为其项目空间远小于用户空间,这种节点数量的不匹配将导致稀疏交互带来的噪声影响进一步放大,因此需放大对比学习任务的影响以增强表征。

参数λ1影响如图5所示。TikTok作为短视频推荐场景,模态信息质量较高,过大的λ1值会导致模态一致性升高从而抹除特定模态信息对用户偏好的影响。相反,Baby和Sports作为经典的电商推荐场景,海量的交互项目会导致用户的历史记录稀疏度较高,因此模型需要较大的λ1值来增强跨模态一致性,抵消多模态噪声带来的影响。

λ2ψ在三个数据集上的具体影响如图6图7所示。实验结果与前文分析一致,在电商场景下模态语义可能有较大差异,需要更高的“图结构-模态”一致性约束λ2来抑制噪声,而模态偏好权重在协同权重中的占比ψ则可能因多模态信息对交互影响较小而取较低值。TikTok数据集则因模态信息丰富且差异性较大,实验结果表明强约束会抑制有效的模态分歧信息。

3.5 锚点采样比例泛化能力研究

针对问题4,为验证层次锚点拓扑结构中锚点采样比例的合理性与泛化能力,实验对比了动态可学习采样比例及三种静态比例(3∶4∶3、2∶4∶4、8∶1∶1)在TikTok和Sports数据集上的推荐性能。结果显示如表5所示,原设定6∶3∶1在Recall@20和NDCG@20指标上均取得最优表现。

动态可学习采样比例实验是通过在算法引入一个三维可学习参数向量来表示各层次节点的选择比例,同时通过Softmax函数约束,确保选择比例的有效性。在训练过程中,损失函数的梯度会更新参数向量,该参数向量通过反向传播机制进行端到端优化。然而该学习驱动的动态采样比例在Recall@20和NDCG@20上未能超越静态设置的6∶3∶1比例。这样的实验结果是由于在模型HEMMR中,动态采样机制易在训练中因高频锚点提供的信号更快产生性能提升而向高频采样偏移,破坏全局建模能力,且增加训练复杂度。

观察其他的锚点采样比例实验可以发现过多引入低频锚点可能导致噪声干扰和连通性下降,而高频锚点比例过高则会引发过度平滑问题。HEMMR设计6∶3∶1的采样比例在高活跃度、中活跃度与低活跃度节点间构建了良好的结构平衡,能够同时捕捉高频主干传播路径与低频长尾节点的多样性特征,使得模型能够捕获全局结构的关联性。

3.6 噪声的鲁棒性研究

针对问题5,为评估HEMMR对交互噪声的鲁棒性,本文以Baby数据集为基础,通过注入10%~50%的随机噪声交互观察模型性能的衰减情况。选择SGL和LGMRec作为对比的基线模型,实验结果如图8所示。

结果表明,HEMMR在高噪声场景下的衰减率显著低于基线模型。其中,SGL的实验结果显示传统的随机扰动构造增强视图的方式会导致难以区分噪声边与真实交互。而LGMRec虽依赖模态特征构造了局部与全局视图的对比学习,但忽视了图结构固有的噪声问题。这导致在噪声增加时,其图结构被污染。所以进行模态传播过程时会再次引入噪声,导致性能下降较快。HEMMR利用多模态信息来辅助生成去噪交互图,通过多头注意力机制,模型能够从多模态信息中提取用户真实偏好,从而更新交互权重。凭借模态和图结构双向协同去噪和自监督学习训练算法,HEMMR在噪声环境下凸显价值。

3.7 特征分布研究

针对问题6,为评估HEMMR的特征表示能力设计了如图9所示的可视化实验。实验选择基线模型LGMRec作为对比,在Sports数据集上随机采样1 000个项目并使用t-SNE绘制2D特征分布的散点图。图底部的高斯核密度估计显示了节点嵌入在单位超球面S1上的密度分布。从图中可以看出,LGMRec的特征分布呈现较为明显的聚类簇,这是由于堆叠多层图卷积和超图卷积引起的过度平滑问题会使得节点表征趋于相似,因此聚集在一起。体现在密度图上为部分方向上存在波峰分布,反映出节点表征在空间中聚集在少数特定方向上,因此模型未能学习到多样化的项目特征。

相较之下,HEMMR通过层次锚点拓扑结构增强用户与项目节点特征,有效捕捉不同层次的特征信息,从而帮助模型学习全局关联性,其特征在坐标平面内分布更为均匀。此外,密度曲线相对平缓,各轴值区间密度分布均匀,表明模型缓解了GCN带来的过度平滑问题,并进一步验证其充分利用长距离依赖信息来提升推荐质量的优势。

4 结论

本文针对推荐系统中多模态信息利用不足与交互数据噪声干扰的问题,提出了一种层次拓扑增强的多模态推荐方法,并在多个真实数据集上进行了系统实验。通过层次化锚点选择,模型能够更全面地捕捉用户与项目在不同活跃度下的全局拓扑特征,使节点表征保持多样性与区分性。本文设计的生成器能够同时重建用户多模态偏好与去噪交互图,并借助“图结构-模态”一致性约束实现双向协同更新。实验结果显示,引入该机制能有效缓解随机噪声和复杂交互带来的性能衰减,尤其在噪声水平较高的场景中优势更为突出。

尽管本文提出的方法在准确性与鲁棒性上均取得了良好表现,但仍存在改进空间。多项损失函数的加权组合可能在更复杂场景下引发梯度冲突与收敛不一致,未来可结合动态权重学习与多任务优化框架进一步提升训练稳定性。

参考文献

[1]

Kumar C, Chowdary C R, Meena A K. Recent Trends in Recommender Systems: A Survey[J]. Int J Multimed Inf Retr, 2024, 13(4): 41. DOI: 10.1007/s13735-024-00349-1 .

[2]

Ullah F, Zhang B F, Zou G B, et al. Large-scale Distributive Matrix Collaborative Filtering for Recommender System[C]//Proceedings of the 2020 International Conference on Computing, Networks and Internet of Things. New York: ACM, 2020: 55-59.. DOI: 10.1145/3398329.3398360 .

[3]

Hasan M, Nalagandla R. An Ensemble Weighted User-based Collaborative Filtering Recommender System[C]//2024 2nd International Conference on Artificial Intelligence, Blockchain, and Internet of Things (AIBThings). New York: IEEE, 2024: 1-6. DOI: 10.1109/AIBThings63359.2024.10863411 .

[4]

Rendle S, Freudenthaler C, Gantner Z, et al. BPR: Bayesian Personalized Ranking from Implicit Feedback[C]//Proceedings of the Twenty-Fifth Conference on Uncertainty in Artificial Intelligence. Arlington, Virginia, USA: AUAI Press, 2009: 452-461. DOI: 10.5555/1795114.1795167 .

[5]

Jiang B, Zhang Z Y, Lin D D, et al. Semi-supervised Learning with Graph Learning-convolutional Networks[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE, 2019: 11305-11312. DOI: 10.1109/CVPR.2019.01157 .

[6]

Wang X, He X N, Wang M, et al. Neural Graph Collaborative Filtering[C]//Proceedings of the 42nd International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2019: 165-174.. DOI: 10.1145/3331184.3331267 .

[7]

Zhou X, Lin D H, Liu Y, et al. Layer-refined Graph Convolutional Networks for Recommendation[C]//2023 IEEE 39th International Conference on Data Engineering (ICDE). New York: IEEE, 2023: 1247-1259. DOI: 10.1109/ICDE55515.2023.00100 .

[8]

Zhou P, Cui Y C, Cao H. A Power Method to Alleviate Over-smoothing for Recommendation[C]//Proceedings of the 33rd ACM International Conference on Information and Knowledge Management. New York: ACM, 2024: 3484-3493.. DOI: 10.1145/3627673.3679553 .

[9]

Yu J L, Yin H Z, Xia X, et al. Self-supervised Learning for Recommender Systems: a Survey[J]. IEEE Trans Knowl Data Eng, 2024, 36(1): 335-355. DOI: 10.1109/TKDE.2023.3282907 .

[10]

Zheng Y P, Yi L, Wei Z W. A Survey of Dynamic Graph Neural Networks[J]. Front Comput Sci, 2024, 19(6): 196323. DOI: 10.1007/s11704-024-3853-2 .

[11]

Liu Q D, Hu J X, Xiao Y T, et al. Multimodal Recommender Systems: A Survey[J]. ACM Comput Surv, 2025, 57(2): 1-17. DOI: 10.1145/3695461 .

[12]

He X N, Deng K, Wang X, et al. LightGCN: Simplifying and Powering Graph Convolution Network for Recommendation[C]//Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2020: 639-648.. DOI: 10.1145/3397271.3401063 .

[13]

Wei Y W, Wang X, Nie L Q, et al. MMGCN: Multi-modal Graph Convolution Network for Personalized Recommendation of Micro-video[C]//Proceedings of the 27th ACM International Conference on Multimedia. New York: ACM, 2019: 1437-1445.. DOI: 10.1145/3343031.3351034 .

[14]

Zhang J H, Zhu Y Q, Liu Q, et al. Mining Latent Structures for Multimedia Recommendation[C]//Proceedings of the 29th ACM International Conference on Multimedia. New York: ACM, 2021: 3872-3880. DOI: 10.1145/3474085.3475259 .

[15]

Wei Y W, Liu W Q, Liu F, et al. LightGT: A Light Graph Transformer for Multimedia Recommendation[C]//Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2023: 1508-1517.. DOI: 10.1145/3539618.3591716 .

[16]

Yu P H, Tan Z Y, Lu G M, et al. Multi-view Graph Convolutional Network for Multimedia Recommendation[C]//Proceedings of the 31st ACM International Conference on Multimedia. New York: ACM, 2023: 6576-6585. DOI: 10.1145/3581783.3613915 .

[17]

Ren X B, Xia L H, Yang Y H, et al. SSLRec: A Self-supervised Learning Framework for Recommendation[C]//Proceedings of the 17th ACM International Conference on Web Search and Data Mining. New York: ACM, 2024: 567-575. DOI: 10.1145/3616855.3635814 .

[18]

Gheewala S, Xu S X, Yeom S. In-depth Survey: Deep Learning in Recommender Systems: Exploring Prediction and Ranking Models, Datasets, Feature Analysis, and Emerging Trends[J]. Neural Comput Appl, 2025, 37(17): 10875-10947. DOI: 10.1007/s00521-024-10866-z .

[19]

Wu J C, Wang X, Feng F L, et al. Self-supervised Graph Learning for Recommendation[C]//Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2021: 726-735. DOI: 10.1145/3404835.3462862 .

[20]

Yu J L, Yin H Z, Xia X, et al. Are Graph Augmentations Necessary?: Simple Graph Contrastive Learning for Recommendation[C]//Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2022: 1294-1303.. DOI: 10.1145/3477495.3531937 .

[21]

Li C L, Xia L H, Ren X B, et al. Graph Transformer for Recommendation[C]//Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2023: 1680-1689.. DOI: 10.1145/3539618.3591723 .

[22]

Yi Z X, Wang X, Ounis I, et al. Multi-modal Graph Contrastive Learning for Micro-video Recommendation[C]//Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2022: 1807-1811.. DOI: 10.1145/3477495.3532027 .

[23]

Zhou X, Zhou H Y, Liu Y, et al. Bootstrap Latent Representations for Multi-modal Recommendation[C]//Proceedings of the ACM Web Conference 2023. New York: ACM, 2023: 845-854.. DOI: 10.1145/3543507.3583251 .

[24]

Tao Z L, Liu X H, Xia Y W, et al. Self-supervised Learning for Multimedia Recommendation[J]. IEEE Trans Multimed, 2022, 25: 5107-5116. DOI: 10.1109/TMM.2022.3187556 .

[25]

Wei W, Huang C, Xia L H, et al. Multi-modal Self-supervised Learning for Recommendation[C]//Proceedings of the ACM Web Conference 2023. New York: ACM, 2023: 790-800.. DOI: 10.1145/3543507.3583206 .

[26]

Guo Z Q, Li J J, Li G H, et al. LGMRec: Local and Global Graph Learning for Multimodal Recommendation[J]. Proc AAAI Conf Artif Intell, 2024, 38(8): 8454-8462. DOI: 10.1609/aaai.v38i8.28688 .

[27]

Yu P H, Tan Z Y, Lu G M, et al. Mind Individual Information! Principal Graph Learning for Multimedia Recommendation[J]. Proc AAAI Conf Artif Intell, 2025, 39(12): 13096-13105. DOI: 10.1609/aaai.v39i12.33429 .

[28]

Vaez Barenji S, Parajuli S, Ekstrand M D. User and Recommender Behavior over Time: Contextualizing Activity Effectiveness Diversity and Fairness in Book Recommendation[C]//Adjunct Proceedings of the 33rd ACM Conference on User Modeling, Adaptation and Personalization. New York: ACM, 2025: 280-287.. DOI: 10.1145/3708319.3733710 .

[29]

Chen J W, Dong H D, Wang X, et al. Bias and Debias in Recommender System: A Survey and Future Directions[J]. ACM Trans Inf Syst, 2023, 41(3): 1-39. DOI: 10.1145/3564284 .

[30]

Lin Z H, Tian C X, Hou Y P, et al. Improving Graph Collaborative Filtering with Neighborhood-enriched Contrastive Learning[C]//Proceedings of the ACM Web Conference 2022. New York: ACM, 2022: 2320-2329.. DOI: 10.1145/3485447.3512104 .

基金资助

北方民族大学研究生教育质量提升项目(YJZT202424)

中国气象局旱区特色农业气象灾害监测预警与风险管理重点实验室宁夏气象防灾减灾重点实验室开放研究项目(CAMF-202502)

北方民族大学研究生创新项目(CYX25221)

AI Summary AI Mindmap
PDF (2317KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/