一种改善推荐模型长尾性能的框架

严非凡 ,  黄勃 ,  张昊 ,  王晨明 ,  曾国辉 ,  史志才 ,  尹玲

武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (6) : 532 -538.

PDF (1032KB)
武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (6) : 532 -538. DOI: 10.14188/j.1671-8836.2021.1011
推荐系统专辑

一种改善推荐模型长尾性能的框架

作者信息 +

A Framework for Improving the Long-Tail Performance of Recommendation Model

Author information +
文章历史 +
PDF (1056K)

摘要

为提高推荐模型对于长尾项目的推荐性能,提出一种可集成在基础推荐模型中的通用框架DAST。该框架通过设计特征变换模块来对齐源域(曝光项目)与目标域(未曝光项目)的特征分布,引入了伪标签的概念,用基于数据结构关系的分类器对目标域伪标签进行校验,通过校验后的伪标签进行自训练来进一步改善长尾性能。在Movielens-1M和DIGINETICA数据集上对集成DAST框架前后的基线模型进行了对比,实验结果表明,集成了DAST框架后,各推荐模型的长尾性能均得到显著的提升,证明了此框架的通用性与有效性。

Abstract

In order to improve the recommendation performance of the recommendation model for long-tail items, a general framework DAST (domain adaptation and self-training) which can be integrated into the basic recommendation model is proposed. The framework uses the designed feature transformation module to homogenize the feature distribution of source domain (exposed items) and target domain (unexposed items), introduces the concept of pseudo label, uses the classifier based on data structure relationship to verify the pseudo label of target domain, and further improves the long⁃tail performance by self-training the verified pseudo label. The baseline models before and after integrating DAST framework are compared on Movielens-1M and DIGINETICA datasets. The experimental results show that the long-tail performance of each recommended model has been significantly improved after integrating DAST framework, which proves the universality and effectiveness of this framework.

Graphical abstract

关键词

长尾性能 / 特征变换 / 自训练

Key words

long-tail performance / feature transformation / self-training

引用本文

引用格式 ▾
严非凡,黄勃,张昊,王晨明,曾国辉,史志才,尹玲. 一种改善推荐模型长尾性能的框架[J]. 武汉大学学报(理学版), 2021, 67(6): 532-538 DOI:10.14188/j.1671-8836.2021.1011

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

互联网时代,信息过载问题愈来愈严重。推荐系统是解决信息过载问题的有效手段,广泛应用于电子商务、视频等各个领域,已逐渐成为了各个互联网平台的基础配置。近年来也涌现了许多有关推荐算法的研究,其中,基于深度学习的推荐算法比传统算法有着更好的推荐效果。基于深度学习的推荐算法需要通过有标签数据来进行训练,通常的做法1~3是只将用户对于曝光项目的反馈作为训练数据,不将未曝光项目纳入模型训练过程,而进行推荐任务时模型却应用在了全体项目(曝光项目与未曝光项目的集合)上。这会导致在推荐任务中,推荐模型对已经曝光的项目过拟合。由于曝光项目中大部分都是热门项目,未曝光项目中大部分是长尾项目,若是仅使用用户对于曝光项目的反馈进行训练,会导致以下严重问题:长尾项目与热门项目有着不一致的特征分布即领域偏移,推荐模型会偏向热门项目4,而忽略原本更为适合用户的长尾项目,尤其是新加入项目空间的项目,致使推荐模型具有长尾性,推荐多样不佳,继而形成“马太效应”5,引发“信息茧房”6问题。

现有的方法一般通过数据补全7、逆倾向得分8、引入辅助信息9等来解决推荐模型长尾性、推荐多样性不佳的问题。数据补全目前多采用启发式方法,如直接对缺失值填充,但这会导致最后的结果严重依赖于填充数据的准确度;逆倾向得分的方法以倾向得分的无偏估计量为优化目标,效果取决于对倾向得分预测的准确性,且倾向得分在复杂场景中很难被准确估计,因此基于倾向得分的方法在实际应用中较难实现,而且在用户或物品倾斜的情况下还会出现高方差;引入辅助信息的方法往往只能在特定的领域之间使用,通用性较差,无法很好地推广。域自适应技术以及无监督自训练可以充分挖掘现有数据来获得未曝光项目的特征表示,可操作性与通用性好。因此,本文通过融合域自适应技术以及无监督自训练,设计了一个改善推荐模型长尾性能的通用框架DAST(domain adaptation and self-training)。该框架将曝光项目视为源域,未曝光项目视为目标域。域自适应技术主要通过最大平均差异10或对抗训练11等方法来对齐源域与目标域的特征分布,从而改善推荐模型的长尾性能。本文提出了一种基于特征变换的方法来进行特征分布的对齐并推导出了具体的特征变换公式,同时引入了伪标签的概念,并设计了基于数据结构关系的分类器来对伪标签进行校验,利用未曝光项目高置信度的伪标签进行自训练,以提升模型的类别识别能力。

综上所述,本文的主要贡献如下:

1) 设计了一个通用的DAST框架,显著改善了推荐模型的长尾性能,增强了推荐结果的多样性。

2) 利用各向同性的原则,提出了通过特征变换来对齐特征域与目标域的方法并对特征变换公式进行了推导。

3) 引入了自训练的过程,提升了推荐模型中特征提取器部分对长尾项目的表示能力,减少了在特征域对齐过程中负迁移情况的发生。

4) 利用数据的结构关系,设计了一个简单高效的分类器来对未曝光项目的伪标签进行校验。

1  DAST框架

本节首先介绍本文所用的基本符号,对基线模型的原理进行描述,然后从特征分布对齐、基于数据结构关系的分类器、自训练三个方面详细阐述了DAST框架,DAST框架的整体结构如图1所示。

1.1 基本符号

本文采用了与大多数域自适应技术相同的设置,用Ds表示源域(曝光项目),用Dt表示目标域(未曝光项目),D= DsDt表示整个项目空间。对于源域和目标域,用户都用U来表示。用户对于项目的反馈用O={u,d,y}来表示,其中,u表示一个具体的用户,d表示一个具体的项目,y表示ud隐式反馈。对于每一个u,用Dus={(djs,yjs)}j=1n表示其对应的有反馈的项目,用Dut={(djt)}j=1n表示从未曝光项目中随机选取的项目。推荐模型的目的是从D中检索出与u最匹配的项目集合D̂u,并将排名靠前的项目推荐给用户。

1.2 基线模型原理

基线推荐模型主要包括用户端和项目端,模型的核心任务是通过特征提取器fufd将用户u和项目d表示成用户特征向量vu1*L以及项目特征向量vd1*L,即vu=fu(u),vd=fd(d)。当得到用户的特征表示和项目的特征表示后,再利用得分函数fs来计算用户与之间的相关性,即SCu,d=fs(vu,vd)。在训练阶段,基线推荐模型使用Ls损失函数来进行训练,具体的Ls表达式将在实验部分介绍。在应用时,基线推荐模型将相关性得分最高的top⁃N作为匹配结果返回。

为了改善推荐模型的长尾性能,将本文提出的DAST框架集成在基线推荐模型的项目端,使长尾项目可以获得与热门项目相对一致的特征表示,并提升项目端特征提取器对于未曝光项目的适应度,从而在推荐模型应用时,提高长尾项目被推荐的可能性。

1.3 特征分布对齐

当曝光项目与未曝光项目分布一致时,曝光项目的特征向量与未曝光项目的特征向量在各个特征维度上应当是各向同性的12。基于这一原则,本文在模型训练时,通过特征变换操作来对齐源域与目标域的特征分布,如图2所示。特征变换操作的根本目的在于使未曝光项目间接参与排序模型的训练。源域特征向量与目标域特征向量组成的特征向量矩阵是特征变换的基础,因此特征变换后的源域特征表示是受到目标域影响后的结果。

特征变换遵从的原则是使特征向量各向同性,而标准正态分布是各向同性的,因此需要将特征提取器得到的源域特征向量vds与目标域特征向量vdt组成的特征向量矩阵转换为标准正态分布。为了实现这一点,需求解下式中的μW

xi=(xi-μ)W

其中,xi是项目特征向量,μ为项目特征向量的均值,W是一个转换矩阵。首先,将各特征向量的均值变换为0,假设向量集合为{xi}i=1N,令

μ=1Ni=1Nxi

则可实现各特征向量均值为0的目的。接着是求解矩阵W,使得经过变换后的向量协方差矩阵为单位阵。将原始数据的协方差矩阵记为

Σ=1Ni=1(xi-μ)T(xi-μ)

则变换后数据的协方差矩阵为

Σ̂=WTΣW

因为变换后的协方差矩阵为单位阵,因此,可建立方程

WTΣW=I

Σ=(WT)-1W-1=(W-1)TW-1

由于协方差矩阵Σ是一个正定对称矩阵,而正定对称矩阵有如下奇异值分解(SVD)形式

Σ=UAUT

其中, A 是一个对角矩阵,并且对角线元素全部为正,因此可求得

W-1=UA

至此完成μW的求解。

1.4 基于数据结构关系的分类器

本文提出的分类器不是通过学习样本间的距离来进行分类,而是利用目标域数据的域内结构关系来实现分类。目标域项目可以通过此分类器获得较为准确的类别概率,从而对自训练过程的伪标签进行校验,提高伪标签的可靠性。

c1,,C表示类别标签,Mcj为类别概率矩阵,表示目标域项目xjt属于各个类别c的概率,分类器也是通过求解Mcj来间接求得样本类别。hc为源域各类别的中心,Dcj为距离矩阵,表示目标域各样本到源域各类别中心的距离。分类器的成本表达式、距离矩阵、类别中心的计算公式如下所示

ϑ=jntcCDcjMcj
Dcj=xjt-hc2
hc=1|Ds(c)|jnsXjs(yjs=c)

其中,()是一个指示函数,如果条件为真,则计算结果为1,否则为0。对于一个样本来说,其属于各个类别的概率应在[0,1],且其概率之和应等于1。对于每个类别来说,其应至少有一个样本,且理想状态下,每个类别的概率之和应该是大于1的。因此,可得出以下两个约束条件

cCMcj=1,j{1,,nt}
jntMcj1,c{1,,C}

最终,可以建立一个线性规划问题,并通过求解此线性规划问题来得到Mcj

min ϑ=jntcCDcjMcj
s.t.0Mcj1cCMcj=1,j{1,,nt}jntMcj1,c{1,,C}

求解出Mcj后,由softmax函数给出目标域样本xjt的类别,Mcj的类别概率用于伪标签的校验。

yjt=arg maxrMrjcCMcj,r{1,,C}

1.5 自训练

未曝光项目缺少用于模型训练的用户反馈数据是推荐模型具有长尾性的原因之一13。因此,本文考虑利用原始推荐模型直接给未曝光项目打上伪标签,使未曝光项目也有相应的反馈。因为原始推荐模型训练时使用的是曝光项目,所以直接利用推荐模型预测得到的伪标签与真实标签相比有较大偏差,所以无法直接用于模型监督训练。因此,本文通过设置采样阈值以及联合分类器校验来提高伪标签的可靠性,然后再通过自训练的方式来利用这些伪标签。

首先用公式Scu,d=fs(vu,vd)计算出用户特征表示与未曝光项目特征表示的相关性得分,并将其转换到0,1。这个分数可以作为目标项目是此用户正样本的概率,即用户会点击这个项目的概率。上文提到的基于数据结构关系的分类器也可以生成未曝光项目的正负样本的概率,因此两者可以相互校验,设置p1p2两个阈值,当Scu,d=fs(vu,vd)计算的目标样本的伪标签类别概率与分类器计算的伪标签类别概率同时小于p1或同时大于p2时,才将其采样进行自训练。具体来说,自训练是一个熵最小化的过程,如图3所示。通过自训练,可以做到低密度的类间分离14。自训练中的熵形式化表达如(15)式。

Lp=-j=1nδ[(Scu,djt<p1)(Mc,djt<p1)]|[(Scu,djt>p2)(Mc,djt>p2)]Scu,djtlogScu,djtj=1nδ[(Scu,djt<p1)(Mc,djt<p1)]|[(Scu,djt>p2)(Mc,djt>p2)]

其中,δ(a|b)是一个指示函数,若满足ab其中一个条件,则δ(a|b)的值为1,否则为0。

2  实验部分

2.1 数据集与数据预处理

为了评估本文提出的DAST框架的性能,实验选用了MovieLens-1M、DIGINETICA两个公开数据集作为基准数据集。

MovieLens-1M:该数据集包括6 000名用户对4 000部电影的100万条评分数据。由于本实验需要的是隐式反馈数据而非评分数据,因此本文通过设置阈值的方式对数据集的形式进行转换,将评分大于3的样本视为正样本即用户会点击此曝光样本,将其标签打为1,其余作为负样本,标签打为0。将未与用户产生过交互的项目作为未曝光样本,在每个训练时期,随机添加10个类似于曝光过电影的未曝光电影。将项目的交互数量排在数据集前20%的项目作为热门项目,排在后70%的项目作为长尾项目。本次实验使用的特征是用户id、年龄、性别、用户职业、用户行为以及电影id、发行年份、电影流派等。此数据集按照811的比例将数据随机分为训练集、验证集和测试集。

DIGINETICA:该数据集包括每位用户分别对10个推荐项目的点击反馈、用户的性别、年龄、发出的关键字以及项目的id、类别id、标题等。采用与MovieLens-1M相同的策略来为DIGINETICA分配未曝光项目,并按照811的比例来随机划分数据集。

2.2 基线选取与DAST框架的集成

为了验证本文提出的DAST框架的有效性与通用性,选取了NeuralMF15、RALM5、BST16三个模型参与了实验。这些模型主要包括特征特征提取器、评分函数和损失函数等部分。这三个模型的基本特征提取器是多层感知机,实验中会将本文提出的DAST框架集成到这三个特征提取器中。为更加充分地验证DAST框架,分别在MovieLens-1M和DIGINETICA中应用不同的得分函数。MovieLens-1M的得分函数

Scu,d=fs(vu,vd)=sigmoid(bd+vuvdT)

DIGINETICA的得分函数

Scu,d=fs(vu,vd)=vuvdTvuvd

其中,bd是项目d的偏置项,vu,vd分别是特征提取器fufd从用户u和项目d中提取出的特征向量。实验中会将点击行为作为项目反馈,从而将问题变成点击(click-through-rate,CTR)预测问题。因此,实验中的基本损失函数采用逐点交叉熵,定义如下

Ls=-1ni=1n(yu,dilogScu,di)+(1-yu,di)log(1-Scu,di)

其中,yq,di是项目di的标签,表示用户u是否点击了项目din表示推荐给用户u的项目数量。然而,Ls仅考虑了被推荐项目,而忽略了未曝光推荐项目。所以在实验中,会在基本损失函数的基础上增加DAST框架的一个正则项Lp来实现自训练。因此,集成了DAST框架后的损失函数Lall

Lall=Ls+λ1Lp

2.3 参数设置与评估指标选取

本实验利用Pytorch实现,选择Adam优化器进行训练。实验时,λ1设置为0.7。置信阈值p1设置为0.2,p2设置为0.8。每个训练时期分配10个目标域的项目。实验完成后,利用Recall、NDCG、MAP三个评估指标来对实验结果进行比较和分析,其计算公式分别如下

Recall=TPTP+FP
NDCG=DCGpIDCGp
DCGp=i=1p2reli-1log(i+1)
IDCGp=i=1REL2reli-1log(i+1)
MAP=i=1kAPik
AP=i=1n-1(ri+1-ri)Pinter(ri+1)

其中,TP表示将正样本预测为正样本,FP表示将负样本预测为正样本。reli表示i这个位置上的相关度,REL表示按照最优方式对结果进行排序后的集合,ri表示按升序排列的精确度插值段第一个插值处对应的Recall值。

2.4 实验性能分析

2.4.1 对比试验

表1展示了基线模型以及集成了DAST框架后的模型在MovieLens-1M与DIGINETICA数据集上的结果。通过表1可以发现,两个测试集中各个算法在长尾项目空间中的表现远落后于在热门项目空间中的表现,这说明热门项目与长尾项目的特征分布是不一致的即领域偏移情况是客观存在的。对比集成了DAST框架前后各基线模型的表现可以看出,虽然不同数据集上各模型整体表现有差异(MovieLens-1M上表现更好),但是对比基线模型,集成了DAST框架的推荐模型的长尾性能均得到了显著的改善,验证了本文提出的DAST框架的有效性和通用性。在长尾性能得到改善的同时,各模型在热门项目上的评估指标也有所提升。其原因在于自训练的过程增强了模型的类别识别能力,同时也让特征提取器得到了更加充分的训练,“见识”到了更多的样本。

表2展示了基线模型以及集成了DAST框架后的基线模型在全体测试集中的表现。从表2可以看出在MovieLens-1M和DIGINETICA数据集中,各基线模型集成了域自适应框架后,三项指标都各有提升。以上数据表明DAST框架可以显著提高基线模型的整体效果,在提高模型长尾性能的过程中,并未牺牲模型的其他性能。

2.4.2 消融实验

为了进一步验证DAST框架各组成部分的有效性,本文在长尾项目上进行了消融实验。消融实验选取了NeuMF模型作为基本模型,NDCG@20作为评估指标。DAST/T表示从DAST框架去除分布对齐的操作,DAST/C表示从DAST框架去除分类器,DAST/S表示从DAST框架中去除自训练过程。表3展示了消融实验的结果。从表3中可以看出对齐目标域和源域的特征分布以及自训练过程对于提高模型在长尾项目中的表现都很重要。同时也发现了在自训练的过程中引入分类器进行校验,增强了自训练的效果,改善了模型的长尾性能。综上所述,DAST框架中的各部分都是必要的,去除其中任一部分后得到的结果都是次优的。

3  结 语

针对推荐模型对长尾项目推荐效果不佳的问题,提出了一种改善推荐模型长尾性能的框架DAST.该框架的重点在于对齐源域与目标域的特征分布以及引入伪标签进行自训练。在MovieLens-1M和DIGINETICA数据集上的实验结果表明,DAST框架可以有效改善推荐模型长尾性能。今后考虑通过更加细粒度的操作来对齐源域与目标域的特征分布,进一步完善DAST框架。

参考文献

[1]

GUO H FTANG R MYE Y Met al. DeepFM: A factorization-machine based neural network for CTR prediction [C]//Proceedings of the 26th International Joint Conference on Artificial Intelligence. California: International Joint Conferences on Artificial Intelligence Organization, 2017: 1725-1731. DOI:10.24963/ijcai.2017/239 .

[2]

XIAO JYE HHE X Net al. Attentional factorization machines: Learning the weight of feature interactions via attention networks [C]//Proceedings of the 26th International Joint Conference on Artificial Intelligence. California: International Joint Conferences on Artificial Intelligence Organization, 2017: 3119-3125. DOI:10.24963/ijcai.2017/435 .

[3]

ZHOU G RSONG C RZHU X Qet al. Deep Interest Network for Click-Through Rate Prediction [EB/OL].[2021-08-02]. https://www.researchgate.net/publication/317732664_Deep_Interest_Network_for_Click-Through_Rate_Prediction. DOI: 10.1145/3219819.3219823 .

[4]

KRISHNAN ASHARMA ASANKAR Aet al. An adversarial approach to improve long-tail performance in neural collaborative filtering [C]//Proceedings of the 27th ACM International Conference on Information and Knowledge Management. New York: ACM, 2018: 1491-1494. DOI:10.1145/3269206.3269264 .

[5]

LIU Y DGE K KZHANG Xet al. Real-time attention based look-alike model for recommender system[C]//Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. New York: ACM, 2019: 2765-2773. DOI:10.1145/3292500.3330707 .

[6]

任秋菊, 赵昕, 韩毅. 用户视角下信息茧房的成因分析[J]. 图书情报工作202165(1): 120-127. DOI:10.13266/j.issn.0252-3116.2021.01.017 .

[7]

REN Q JZHAO XHAN Y. Analysis on the causes of the information cocoons under user perspectives [J]. Library and Information Service202165(1): 120-127. DOI:10.13266/j.issn.0252-3116.2021.01.017(Ch ).

[8]

HERNÁNDEZ-LOBATO J MHOULSBY NGHAHRAMANI Z. Probabilistic matrix factorization with non-random missing data [C]// Proceedings of the 31st International Conference on International Conference on Machine Learning. Cambridge: MIT Press, 2014:1512-1520.

[9]

YANG L QCUI YXUAN Yet al. Unbiased offline recommender evaluation for missing-not-at-random implicit feedback [C]//Proceedings of the 12th ACM Conference on Recommender Systems. New York: ACM, 2018: 279-287. DOI:10.1145/3240323.3240355 .

[10]

CHEN GCHEN X NFENG F Let al. Cross-domain recommendation without sharing user-relevant data [C]// International World Wide Web Conferences. New York: Association for Computing Machinery,2019:491-502. DOI:10.1145/3308558.3313538 .

[11]

TZENG EHOFFMAN JZHANG Net al. Deep domain Confusion: Maximizing for Domain Invariance [EB/OL]. [2014-10-10]. https://arxiv.org/pdf/1412.3474.pdf.

[12]

GALLEGO A JCALVO-ZARAGOZA JFISHER R B. Incremental unsupervised domain-adversarial training of neural networks [J]. IEEE Transactions on Neural Networks and Learning Systems202132(11): 4864-4878. DOI:10.1109/tnnls.2020.3025954 .

[13]

XU H RKOEHN P. Cross-Lingual BERT Contextual Embedding Space Mapping with Isotropic and Isometric Conditions [EB/OL].[2021-08-20].

[14]

CHEN Z HXIAO RLI C Let al. ESAM: discriminative domain adaptation with non-displayed items to improve long-tail performance [C]//Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2020: 579-588. DOI:10.1145/3397271.3401043 .

[15]

GRANDVALET YBENGIO Y. Semi-Supervised Learning by Entropy Minimization [EB/OL].[2021-06-05].http://citeseerx.ist.psu.edu/viewdoc/download;jsessionid=00FC235E66B758FA25D363F3B1065EFE?doi=10.1.1.105.2851&rep=rep 1& type=pdf . DOI: 10.17487/rfc3778 .

[16]

HE X NLIAO L ZZHANG H Wet al. Neural collaborative filtering [C]//Proceedings of the 26th International Conference on World Wide Web. Perth: International World Wide Web Conferences Steering Committee,2017:173-182. DOI: 10.1145/3038912.3052569 .

[17]

CHEN Q WZHAO HLI Wet al. Behavior sequence transformer for e-commerce recommendation in Alibaba [C]// Proceedings of the 1st International Workshop on Deep Learning Practice for High⁃Dimensional Sparse Data. New York: Association for Computing Machinery,2019:1-4. DOI: 10.1145/3326937.3341261 .

基金资助

国家自然科学基金青年基金(61802251)

科技创新2030⁃“新一代人工智能”重大项目(2020AAA0109300)

AI Summary AI Mindmap
PDF (1032KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/