基于时间感知与协同挖掘的下一购物篮推荐方法

周洋涛 ,  褚华 ,  杨文勇 ,  杨雨函 ,  卫彪彪

武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (6) : 525 -531.

PDF (1632KB)
武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (6) : 525 -531. DOI: 10.14188/j.1671-8836.2021.1003
推荐系统专辑

基于时间感知与协同挖掘的下一购物篮推荐方法

作者信息 +

Next-Basket Recommendation Based on Time Perception and Collaborative Mining

Author information +
文章历史 +
PDF (1671K)

摘要

下一购物篮推荐是电商平台上最重要的任务之一,旨在挖掘用户的购物习惯及其兴趣进化的特征。现有的下一购物篮推荐方法存在以下不足:一是仅基于购物篮先后位置建模无法捕捉购物篮时间间隔的差异性;二是基于RNN(recurrent neural network)的方法无法捕获个性化商品频率信息并缺乏可解释性。上述不足限制了电商推荐的准确率且无法提供给用户直观的推荐理由。因此,提出了一种基于时间感知和协同挖掘的下一购物篮推荐方法。该方法对购物篮时间进行建模,将购物篮划分为表征用户短期兴趣的多个组别,并采用层次时间衰退实现用户兴趣进化挖掘;同时对用户表达进行最近邻聚类,基于协同过滤思想增加可解释性。实验表明,该方法能有效建模用户的兴趣进化并提供可解释性,在多种评价指标上优于主流方法。

Abstract

The next-basket recommendation is one of the most important tasks on the e-commerce platform, which aims to explore the characteristics of users’ shopping habits and the evolution of their interests. The existing basket methods have the following shortcomings. First, only modeling based on the sequential position of baskets cannot capture the difference of basket time interval; Second, the RNN(recurrent neural network) based methods cannot capture the personalized item frequency information and lack interpretability. The above shortcomings limit the accuracy of e-commerce recommendation and cannot provide users with intuitive reasons for recommendation. Therefore, a next-basket recommendation method based on time perception and collaborative mining was proposed. In this method, the baskets were divided into multiple groups representing users’ short-term interests by modeling the basket time directly, and a hierarchical time decay was used to realize user interest evolutionary mining. At the same time, the nearest neighbor clustering of user expression was carried out to increase the interpretability based on the idea of collaborative filtering. Experiments proved that the proposed method can effectively model the evolution of users’ interest and provide interpretability, and is superior to the mainstream methods in a variety of evaluation metrics.

Graphical abstract

关键词

下一购物篮推荐 / 协同过滤 / 时间感知 / 可解释性

Key words

next-basket recommendation / collaborative filtering / time-perception / interpretability

引用本文

引用格式 ▾
周洋涛,褚华,杨文勇,杨雨函,卫彪彪. 基于时间感知与协同挖掘的下一购物篮推荐方法[J]. 武汉大学学报(理学版), 2021, 67(6): 525-531 DOI:10.14188/j.1671-8836.2021.1003

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着电子商务的高速发展,用户偏好预测与商品推荐已经成为电商平台的重要任务,现有的电商推荐主要侧重于下一商品推荐1~3。有研究表明,用户此前购物篮中的商品与下一个购物篮中的商品会有较强的关联性。在电商领域中,下一购物篮推荐(next-basket recommendation,NBR)旨在根据用户的历史购买记录(通常是交易序列)预测用户下一时刻的购买行为,给用户推荐下次购物篮中可能想购买的一些商品,这种推荐方法近年来受到了广泛关注。不同于基于序列化模型的下一商品推荐,NBR旨在从用户大量的历史购物篮数据中挖掘用户的购物习惯及其兴趣进化的特征,不仅要对同一购物篮内的物品关系进行有效建模,还需考虑用户购买行为之间的序列关系4。精准的下一购物篮推荐不仅可以帮助商家分析销售趋势、增加销售利润和流量,还可帮助用户快速地找到符合自己购物习惯和兴趣偏好的商品5。然而,由于用户的兴趣偏好会随着时间进行动态变化,这种兴趣进化过程体现在用户的全部购物篮交易序列中,仅基于最近邻接购物篮进行局部序列化建模或基于所有交互行为进行通用兴趣建模的方法均无法准确地建模用户的兴趣进化过程并捕获用户的当前兴趣。

目前,下一购物篮推荐方法主要可分为基于马尔可夫链和基于循环神经网络(recurrent neural network,RNN)两类。基于马尔可夫链的方法主要是挖掘最近的一个或几个购物篮中商品的局部序列化依赖关系。文献[6]基于每个用户的邻接购物篮对构造转移立方体,因子分解转移立方体以预测后续购物篮上的商品购买概率;文献[7]提出一种双层结构的马尔可夫链模型,第一层用非线性聚合的方式对邻接购物篮中的商品向量进行聚合,以获得邻接购物篮的整体表达向量,第二层通过非线性聚合用户向量和邻接购物篮向量以融合用户的通用兴趣和一阶的购物篮序列特征;文献[8]学习所有数据上的长期通用偏好,同时在一阶马尔可夫链模型中集成兴趣遗忘、近邻用户信任关联以及商品相似度,以建模用户的短期兴趣偏好。基于马尔可夫链的模型假设上一个购物篮购买的商品会影响用户在下一个时刻的购买行为,能有效建模购物篮序列中存在的依赖关系,但是上述方法仅基于上一个购物篮或最近几个购物篮建模低阶的序列化特征,无法挖掘全部购物篮序列中存在的用户兴趣进化。

由于RNN的方法具备对长序列数据进行高阶序列化依赖建模的能力,能弥补基于马尔可夫链方法的短板,实现对完整购物篮序列的建模,近年来在购物篮推荐中受到广泛关注。文献[4]首次采用RNN模型对用户的历史购物篮进行建模,挖掘用户购物篮序列中蕴含的全局序列特征以及用户的通用兴趣特征;文献[9]利用双层注意力机制分别建模商品自身以及商品属性的特征,然后采用长短期记忆网络(long short-term memory network, LSTM)挖掘用户购物篮序列中随时间变化的序列特征以编码用户向量;文献[10]采用自适应注意力机制分别建模完整购物篮序列中蕴含的长期偏好以及最近购物篮中蕴含的短期偏好,使用LSTM网络实现对用户的长短期兴趣挖掘;文献[11]采用多头自注意力机制捕捉购物篮中不同商品的关系并融合商品属性信息,然后使用具有注意力机制的RNN模型建模购物篮序列信息;文献[12]提出将用户的历史购物篮根据给定的目标商品划分为相关的积极子购物篮和无关的消极子购物篮,然后采用基于门控循环单元(gated recurrent unit,GRU)的上下文编码器实现对序列特征的挖掘。基于RNN的方法虽然能够弥补马尔可夫链模型的短板,建模完整购物篮序列中用户的兴趣进化过程,但是RNN由于很难通过学习向量加法以捕获购物篮序列中存在的个性化商品频率信息(personalized item frequency information,PIF),且模型存在难以收敛和优化的问题13。除此之外,基于RNN的深度学习模型通过复杂的神经网络求解具体的应用问题,其建模过程是一个“黑匣子”,无法提供给用户直观合理的推荐理由,缺乏可解释性。文献[13]提出了一种TIFUKNN(temporal-item-frequency-based user-KNN)模型,该模型采用层次时间衰退与最近邻聚类的方法能有效建模完整购物篮序列中的兴趣进化过程并捕获两种PIF,可有效弥补现有的基于RNN方法的不足。

然而,TIFUKNN与现有的基于RNN的方法一样,皆只建模购物篮序列的先后位置关系,未考虑直接对购物篮交易时间进行探索,无法捕获购物篮之间时间间隔的差异性,限制了兴趣进化建模的准确性。因此,本文提出了一种基于时间感知和协同挖掘的下一购物篮推荐方法(time perception and collaborative mining for next-basket recommendation,TPCM)。TPCM中的基于时间感知建模模块直接面向购物篮交易时间建模,基于不同购物篮交易的时间间隔采用Kmeans聚类,自动划分表征用户各个时间阶段短期兴趣的购物篮组别,能够精准地捕获不同购物篮时期用户兴趣的差异。受文献[13]启发,TPCM引入了层次时间衰退实现对用户兴趣进化建模,同时对用户表达采用最近邻聚类方法,基于协同过滤思想增加模型可解释性。

1  TPCM方法

1.1 问题定义

在下一购物篮推荐场景中,存在大量的用户、商品以及用户的历史购物篮交易行为。本文用U表示用户集合,V表示商品集合,UV分别表示用户总数和商品总数。对于每个用户uU,本文将用户在同一天时间内购买的商品集合记为一个购物篮,用户u的完整购物篮序列表示为Bu={bu1,,but,,bum},其中but表示用户u所有购物篮序列中按时间先后顺序排序的第t个购物篮,m表示该用户的购物篮序列长度为m。下一购物篮推荐的任务在于对用户的历史购物篮序列Bu进行建模,预测目标用户u的下一个购物篮bum+1

1.2 提出的方法

本节将对TPCM方法进行详细的介绍,其框架如图1所示。TPCM方法包括三个模块,分别为基于时间感知聚类、层次时间衰退建模以及近邻用户分类。首先直接基于时间感知进行聚类,根据购物篮时间间隔实现用户购物篮的自动分组;其次采用层次结构和时间衰退权重参数实现对购物篮向量和聚类组别向量的时间衰退建模,挖掘用户的兴趣进化;最后,根据用户进化兴趣的表达向量进行最近邻用户分类,基于具有相似偏好的最近邻用户实现下一购物篮推荐。

1.2.1 基于时间感知聚类

由于用户的兴趣会随着时间动态偏移,在较短的连续时间内用户的兴趣偏好变化较小,在较长的时间阶段内用户的兴趣偏好变化较大13,则仅基于购物篮序列的顺序位置建模无法精准地捕获用户的短期兴趣。除此之外,文献[1415]指出用户的兴趣偏好以及物品的序列化关联关系是时间依赖的,购物篮交易时间的间隔信息可以特征化一个用户的购物篮习惯。因此,本文提出基于时间感知聚类,直接计算购物篮之间的交易时间间隔,基于获得的时间间隔实现较短连续时间内用户购物篮的自动聚类。TPCM方法的基于时间感知聚类与TIFUKNN的平均分组建模原理对比如图2所示,TIFUKNN模型采用平均分组的方式可能导致将时间间隔较大的商品购物篮错误划分在一个组别中,如购物篮1中的短袖和短裤表征着用户对季节性衣服的需求,而购物篮2中的手机和耳机则表现了用户对电子产品的兴趣。基于时间感知聚类能够根据购物篮交易的时间间隔实现自动分组,将购物篮交易时间间隔较大的购物篮1和购物篮2划分到两个不同的组别中,更加精准地捕获不同时间阶段用户的短期兴趣。

基于时间感知聚类采用Kmeans聚类方法将时间间隔较小的购物篮自动划分在相同的组别中,每个组别的购物篮数量不一定相等。最终将用户u对应的m个购物篮聚类成n个组别(nm),用户un个购物篮组别表示为groupu={groupu,1,groupu,2,,groupu,n}groupu,i表示用户u的第i个组别,组别划分计算如下

groupu=Kmeans(Bu)

其中,Bu表示用户u的完整购物篮序列,Kmeans()表示进行Kmeans聚类操作。

1.2.2 层次时间衰退建模

由于用户的完整购物篮序列中蕴含用户的兴趣进化特征,一般距离当前时间越近的已购买商品对用户兴趣的预测做更多的贡献,为了既捕获短期兴趣的进化又捕获长期兴趣的进化,本文借鉴TIFUKNN模型,采用双层时间衰退结构,给距离当前时间越接近的购物篮以及购物篮组别分配以更高的权重,给距离当前时间越久远的分配更低的权重,以此对用户的兴趣进化过程建模。如图3所示,层次时间衰退建模包括组内衰退和组间衰退两个部分,组内衰退主要实现对用户短期兴趣的进化建模,组间衰退主要实现对用户长期兴趣的进化建模。

组内衰退:在基于时间感知聚类的基础上,本文对每个用户对应的购物篮组别groupu,i进行组内的时间衰退建模。对于每个用户u的聚类结果groupu中每个组别groupu,i内的所有购物篮向量vbujbujgroupu,i)按照购物篮的交易时间进行排序;然后,将每个组别排序后的购物篮序列中第j个购物篮向量buj乘以一个组内时间衰退权重,交易时间越久远则衰退权重越小,即衰退程度越大;最后,对每个组别中所有购物篮向量进行平均池化,以获得该组别的组向量vgroupu,i,计算如下

vgroupu,i=vbuj  rbgroupu,i-j

其中,groupu,i表示组别groupu,i中购物篮的数量。rb是组内的时间衰退因子,取值范围为[0,1]。

组间衰退:根据组内时间衰退建模后获得的组别向量,对每个用户对应的购物篮组别进行组间的时间衰退建模。对于每个用户u的所有购物篮组别向量,首先,将每个用户的第i个组别向量vgroupu,i乘以一个组间时间衰退权重,交易时间越久远则衰退权重越小,以模拟用户的兴趣进化过程;然后,对所有组别向量进行平均池化操作,以获得用户的长期兴趣进化特征vfeature,计算如下

vfeature=i=1nvgroupu,irgn-i

其中,n表示聚类分组的组数,rg是跨组的时间衰退因子,取值范围为0,1

1.2.3 基于近邻协同预测

由于具有相似偏好兴趣的用户可能会购买相同的商品,基于协同过滤的推荐方法能为推荐系统提供一定的可解释性。因此,针对现有的主流下一购物篮推荐方法缺乏直观的可解释性的缺陷,本文在层次时间衰退的基础上采用基于用户的协同过滤推荐方法,将具有相似长期兴趣进化特征的用户进行聚合,如图4所示,以捕获协同用户的偏好特征,提高模型的可解释性。

在层次时间衰退建模的基础上,针对获得的每个用户的长期兴趣进化特征,首先,采用欧氏距离计算不同用户之间的相似度,距离越小则意味着相似度越大,相似度的计算如下

simility(ui,uj)=distance(vuifeature,vujfeature)

其中,distance(vuifeature,vujfeature)表示用户ui和用户uj的欧氏距离计算。

其次,将获得的用户相似度进行降序排序,取相似度最大的k个用户作为目标用户的最近邻用户群UneighborU;然后,将获得的所有最近邻用户群体的长期兴趣特征用下式进行平均池化

vcollaborative=1UneighboruiUneighborvuifeature

以获得目标用户的协同偏好特征vcollaborative,赋予模型可解释性,Uneighbor表示目标用户的近邻用户数(为k)。

最终,采用线性组合的方式将目标用户的长期兴趣进化特征以及协同偏好特征进行融合,获得最终的用户表达向量p,实现下一购物篮的推荐预测。p如下式所示

p=αvfeature+(1-α)vcollaborative

其中,α是长期偏好特征与协同偏好特征的平衡因子。

2  实验与分析

由于本文提出的TPCM是对TIFUKNN13的改进,在文献[13]中,已有充足的实验证明了TIFUKNN模型优于现有的主流下一购物篮推荐模型。因此,本文只需要证明TPCM性能优于TIFUKNN,即可得证TPCM优于现有的下一购物篮推荐模型。

2.1 实验设置

2.1.1 数据集

为了证明TPCM优于TIFUKNN,本文采用文献[13]中选取的实验数据进行对比,由于TPCM直接面向时间戳信息进行建模,而文献[13]的实验数据集中仅有TaFeng数据集存在购物篮交易时间戳的数据,因此,本文选取TaFeng数据集作为实验数据集。在进行实验之前,对实验数据集采取与文献[13]一致的数据预处理方式。本文删除了TaFeng数据集中购物篮数小于3的用户,并删除了被交互数小于5的最不频繁商品,预处理后的数据集统计数据如表1所示。本文将目标用户的最后一个购物篮作为测试集,除了最后一个购物篮之外的所有购物篮序列作为训练集,本文的实验为使用目标用户过去的购物篮序列以预测该用户最后的一个购物篮集合。

2.1.2 评估指标

为了与文献[13]实验形成对照,本文同样使用召回率Recall和归一化折损累计增益NDCG来评估本文提出的方法。

Recall:表示一个用户感兴趣的商品被正确推荐的概率,定义为推荐购物篮中用户感兴趣的商品与用户真实购买的所有商品的比率。对于用户u,其召回率计算如下

Recallu=NtpRu

其中,Ntp表示用户感兴趣的商品被正确推荐的商品数量,Ru表示测试集中用户u购买的商品数量。最后进行求和平均以获得整个模型的Recall指标评估。

NDCG:是一种基于排名的度量指标,它考虑了商品在购物篮集合中的顺序。本文根据top-s的排序购物篮集合计算每个购物篮的NDCG值,对于用户u,NDCG的计算如下

NDCGu,p=DCGpIDCGp=i=1prelilog2(i+1)i=1RELprelilog2(i+1)

其中,p表示下一购物篮推荐的集合大小为p个商品,DCGp表示p个商品集合推荐的折损累计增益,IDCGp表示理想情况下的最大DCGp值。RELp表示测试集上用户后续购物篮中真实购买的p个商品。reli表示在i这个顺序位置上的相关度,如果预测的商品所在的顺序为测试集购物篮中真实的商品顺序,则reli赋值为1,否则赋值为0,以评估系统推荐的下一购物篮集合中商品顺序的准确性。

最后进行求和平均以获得整个模型的NDCG指标评估。

2.1.3 参数设置

为了在测试集上取得TPCM的最佳性能,对参数空间进行连续搜索。从值集[100,300,500,700,900,1 100,1 300]中搜索最近邻用户群体的数目k,组内时间衰退因子rb和跨组时间衰退因子rg[0.1,0.2,0.3,0.4,0.5,0.6,0.7,0.8,0.9,1.0]中确定,长期偏好特征与协同偏好特征的平衡因子α[0.0,0.1,0.2,0.3,0.4,0.5,0.6,0.7,0.9,1.0]中搜索确定。对所有参数进行组合搜索,取最优实验指标对应的参数作为TPCM的最佳参数。最终TPCM的最佳参数设置为:k=300,rb=1.0,rg=0.1,α =0.2。

2.2 实验分析

为了验证TPCM优于TIFUKNN,本文分别选取购物篮大小为10和20进行评估指标的计算,在TaFeng数据集上的比较结果如表2所示。

表2中的实验结果可看出,在FaFeng数据集上,TPCM的4个评估指标都优于TIFUKNN,说明了本文提出的基于时间感知聚类能准确地捕获用户历史购物行为中各个阶段的短期兴趣,有助于提高后续长期兴趣进化建模的准确性。

结合参数搜索结果可知,针对基于时间感知聚类后的购物篮分组,组内时间衰退因子为1.0,再次验证了基于时间感知聚类的有效性。经过基于时间感知聚类后获得的购物篮分组即可准确地表达用户在不同短时间内的兴趣偏好,无需再进行组内的时间衰退建模,后续可直接省略掉这一计算过程,提高TPCM下一购物篮推荐的计算效率。

3  结 语

本文针对现有的下一购物篮推荐方法存在的不足,提出了一种基于时间感知和协同序列挖掘的下一购物篮推荐方法——TPCM。TPCM设计了基于时间聚类模块,直接面向购物篮交易时间建模,经实验证明,能有效建模用户在不同时间的短期兴趣。其次,引入的层次时间衰退建模能有效模拟与建模用户动态的长期兴趣进化过程。同时,基于最近邻协同特征挖掘能赋予模型合理的推荐解释,弥补了现有的下一购物篮推荐方法缺乏直观的可解释性的弊端。

除了上述的研究工作,本文认为TPCM仍存在很多提升空间。在特征向量操作方面,本文采用的平均池化方式,可以考虑替换成最大池化等其他非线性聚合操作;在融合商品特征方面,本文提出的方法仅基于用户的交互行为特征,缺乏对商品受欢迎程度等特征的融入,可考虑补充商品类别编码以及商品购买频率计算等商品属性特征建模方法。

参考文献

[1]

ZHOU G RZHU X QSONG C Ret al. Deep interest network for click-through rate prediction[C]//Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. New York: ACM, 2018: 1059-1068. DOI:10.1145/3219819.3219823 .

[2]

ZHOU G RMOU NFAN Yet al. Deep interest evolution network for click-through rate prediction[J]. Proceedings of the AAAI Conference on Artificial Intelligence201933: 5941-5948. DOI:10.1609/aaai.v33i01.33015941 .

[3]

CEN Y KZHANG J WZOU Xet al. Controllable multi-interest framework for recommendation[C]//Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. New York: ACM, 2020: 2942-2951. DOI:10.1145/3394486.3403344 .

[4]

YU FLIU QWU Set al. A dynamic recurrent model for next basket recommendation[C]//Proceedings of the 39th International ACM SIGIR conference on Research and Development in Information Retrieval. New York: ACM, 2016: 729-732. DOI:10.1145/2911451.2914683 .

[5]

WANG PCHEN J SNIU S Z. CFSH: Factorizing sequential and historical purchase data for basket recommendation[J]. PLOS one201813(10): e0203191. DOI: 10.1371/journal.pone.0203191 .

[6]

RENDLE SFREUDENTHALER CSCHMIDT-THIEME L. Factorizing personalized Markov chains for next-basket recommendation[C]//Proceedings of the 19th international conference on World Wide Web. New York: ACM, 2010: 811-820. DOI:10.1145/1772690.1772773 .

[7]

WANG P FGUO J FLAN Y Yet al. Learning hierarchical representation model for NextBasket recommendation[C]//Proceedings of the 38th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2015: 403-412. DOI:10.1145/2766462.2767694 .

[8]

ZHU J HMA X XYUE C Bet al. Interest-forgetting Markov model for next-basket recommendation[C]//Communications in Computer and Information Science. Berlin: Springer-Verlag, 2019: 20-31. DOI:10.1007/978-981-15-0118-0_2 .

[9]

BAI TNIE J YZHAO W Xet al. An attribute-aware neural attentive model for next basket recommendation[C]//The 41st International ACM SIGIR Conference on Research & Development in Information Retrieval. New York: ACM, 2018: 1201-1204. DOI:10.1145/3209978.3210129 .

[10]

CHE B BZHAO P PFANG J Het al. Inter-basket and intra-basket adaptive attention network for next basket recommendation[J]. IEEE Access20197: 80644-80650. DOI:10.1109/ACCESS.2019.2922985 .

[11]

倪维健, 郭浩宇, 刘彤, . 基于多头自注意力神经网络的购物篮推荐方法[J]. 数据分析与知识发现20204(Z1):68-77.

[12]

NI W JGUO H YLIU Tet al. Online product recommendation based on multi-head self-attention neural networks[J]. Data Analysis and Knowledge Discovery20204(Z1):68-77 (Ch).

[13]

QIN Y QWANG P FLI C L. The world is binary: Contrastive learning for denoising next basket recommendation[C]//Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2021: 859-868. DOI:10.1145/3404835.3462836 .

[14]

HU H JHE X NGAO J Yet al. Modeling personalized item frequency information for next-basket recommendation[C]//Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2020: 1071-1080. DOI:10.1145/3397271.3401066 .

[15]

WANG P FZHANG Y FNIU S Zet al. Modeling temporal dynamics of users’ purchase behaviors for next basket prediction[J]. Journal of Computer Science and Technology201934(6): 1230-1240. DOI:10.1007/s11390-019-1972-2 .

[16]

LENG Y FYU LXIONG Jet al. Recurrent convolution basket map for diversity next-basket recommendation[C]//Database Systems for Advanced Applications. Cham:Springer-Verlag,2020: 638-653. DOI:10.1007/978-3-030-59419-0_39 .

基金资助

西安电子科技大学计算机科学与技术学院新教师创新基金项目(XJS210307)

西安电子科技大学计算机科学与技术学院研究生创新基金项目(YJS2103)

AI Summary AI Mindmap
PDF (1632KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/