基于微博的COVID⁃19热点话题分析

黄勃 ,  陈欢 ,  方志军 ,  王明胜 ,  刘文竹

武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (5) : 425 -432.

PDF (1913KB)
武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (5) : 425 -432. DOI: 10.14188/j.1671-8836.2020.0045
COVID-19专栏

基于微博的COVID⁃19热点话题分析

作者信息 +

Analysis of COVID⁃19 Hot Topics Based on Weibo

Author information +
文章历史 +
PDF (1958K)

摘要

新型冠状病毒肺炎(corona virus disease 2019,COVID-19)的快速暴发引发了广泛的社会关注,给网络舆情分析带来了极大的挑战。针对这个问题,本文使用网络爬虫技术对官方媒体发布的关于COVID-19的评论信息进行数据收集,对收集到的评论信息按时间顺序进行排列,首先使用TF-IDF对文本的关键特征词进行提取,其次利用OLDA(online latent Dirichlet allocation)模型依照时间顺序进行主题词演化分析,构建评论集词向量模型,最后使用K-means对主题进行聚类,并对聚类结果通过词性标注进行分析。实验表明,本文的方法可以获得随时间变化的评论信息,能够检测到需要关注的信息。

Abstract

The rapid outbreak of COVID-19 has aroused a wide range of social concerns, which has brought great challenges to the analysis of online public opinions. To solve this problem, this paper uses the web crawler technology to collect the data of the information comments on COVID-19 published by the official media, and arranges the collected comments in chronological order. First, TF-IDF is used to extract the key feature words of the text, then OLDA model is used to analyze the evolution of the subject words in chronological order, and then a vector model of comment set words is constructed.Then K-means is used to cluster the topics, and the clustering results are analyzed by part of speech tagging. Experiments show that this method can get the information in the comments changing with time, and can detect the information that needs to be concerned.

Graphical abstract

关键词

新型冠状病毒肺炎 / 舆情分析 / OLDA / TF⁃IDF / K⁃means / word2vec

Key words

COVID-19(corona virus disease 2019) / public opinion analysis / OLDA(online latent Dirichlet allocation) / TF-IDF / K-means / word2vec

引用本文

引用格式 ▾
黄勃,陈欢,方志军,王明胜,刘文竹. 基于微博的COVID⁃19热点话题分析[J]. 武汉大学学报(理学版), 2020, 66(5): 425-432 DOI:10.14188/j.1671-8836.2020.0045

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着我国互联网的快速发展,自媒体、微博、微信公众号等新媒体技术逐渐走向成熟,网民可以通过多种渠道在网络上就现实生活中某些热点、焦点问题发表相关言论和观点1~3。这种言论和观点如果有较强的影响力、倾向性,就会形成网络舆情,而微博作为一种可以实时发表观点、看法的工具,受到诸多网民的青睐,因此它成为舆情分析重要的研究对象。

关于微博舆情的研究工作,周义棋等4以巴黎圣母院大火的微博舆情为例,从热度变化、地域分布、情感变化方面进行了舆情分析;陈兴蜀等5利用SnowNLP情感分析模型和K-means文本聚类方法对疫情期间的部分微博博文和评论数据在时间维度和空间维度进行了分析;李泉等6以文本聚类和情感分析技术为基础,对当前群租房微博舆情变化进行了分析。

2020年初暴发的新型冠状病毒肺炎(corona virus disease 2019,COVID-19),由于其传染性强,引起了社会的广泛关注,产生了巨大的社会影响。大量的网民在微博上发表了对COVID-19及其造成影响的看法。人民日报的微博数据显示,相比2019年同期,2020年2月9日0时至2月11日24时,日均发博量增加21.5倍;平均点赞数增加6.4倍;平均评论数增加1.1倍。

在COVID-19疫情期间,微博舆情复杂多变,目前对此研究并不多。本文以从评论文本中发现网民关注点为目的进行研究,通过编写爬虫脚本对“央视新闻”“人民日报”“人民网”“中国新闻网”等官方博主的微博评论进行采集,使用OLDA(online latent Dirichlet allocation)模型评论数据集的主题检测,利用K-means算法对OLDA输出的主题词分布进行聚类,并引入评论数和点赞数来评价热点聚类簇。由于建模后的主题簇中含有大量的主题词,为提升对事件的发现能力,引入词性标注的方法对主题词进行了词性分析。

1  模型描述

研究框架如图1所示,主要分为三个部分,分别是数据采集层、数据预处理层和舆情分析层。其中数据采集层主要使用爬虫脚本获取主流媒体账号发布信息下的热门评论,然后以csv格式存储在本地。数据预处理层包含数据清洗、jieba分词、去停用词、TF-IDF(term frequency-inverse document frequency)提取关键词。舆情分析层一方面将预处理后的结果输入到word2vec模型7进行训练,另一方面对预处理后的数据按照时间顺序划分时间片,输入到OLDA模型,将从OLDA模型输出的主题词利用词向量表示、聚类,发现热点聚类簇,并对热点簇中的主题使用词性标注的方式进行分析。

1.1 TF-IDF特征词提取

微博的评论相对较短,而且大量重复。如果直接使用OLDA模型进行建模,不容易发现文本中内容的变化,如“加油”一词,在收集到的数据中就有20 227个,占评论总数的12.5%。有的词出现的频率很高,但是作用却没那么大;有的词出现的频率很低,却表达了重要的信息。TF-IDF(词频-逆文本频率)的提出正是为了解决这一问题8。其中:TF表示词频,为该词出现的频率除以该文章中总的词数目;IDF表示的是一个词在所有文本中出现的频率,倘若一个词在所有的文本中都出现,则说明该词不是那么重要9;如果一个词在较少的文本中出现,则说明该词比较重要。TF-IDF计算公式如下

TFIDF=tfi,jidfi
tfi,j=ni,jj
idfi=log2Ddfi+1

其中,ni,j表示词语i在文档j中的频率;j表示文档j中词的总数;D表示语料集中文档的总数;dfi表示语料集中包含词语i的文档总数,其中idfi的计算过程中分母加1是为了防止违反运算法则的情况出现。

1.2 OLDA

网络上的文本信息随着事件的发酵逐渐变多,这给文本处理工作带来了新的挑战。文本的增多使计算量增加,却不能检测到文本中事件主体随着时间的变化趋势10。为了解决这个问题,本文采用OLDA模型,引入文本的时间信息到LDA模型。OLDA模型与LDA模型的最大不同是加入了时间维度信息。将文本按照时间顺序进行排序,划分为若干个时间片,OLDA模型用来处理该时间片内的信息。这样既减轻了模型处理数据的计算量又提高了模型对事件主体检测的灵敏度11~13

由于同一事件在时间上不会发生很大的改变,因此在用OLDA模型处理数据的过程中,先验参数继承了上一个时间片模型的参数。主题的先验参数保存在Bkt中,Bkt表示主题kδ个时间片上的演化矩阵,δ为历史时间片的长度7。时间片t主题k的先验参数表达式如下

βkt=Bkt-1ωδ

其中,ωδ为不同时间片上的权重,权重是用来衡量不同时间片对当前时间片的影响程度。

1.3  K-means热点话题聚类分析

将OLDA获得的当前时间窗口的主题词,删除概率较小的主题词,使用词向量对主题词进行表示14,如主题k=[w1,w2,w3,,wh],主题向量x=w1+w2+w3++whhK-means是一种无监督聚类算法,该算法输入的是无标签的数据集,输出的是l个簇C,C=C1,C2,,ClK-means聚类算法的损失函数为15

E=i=1lxCix-μi2

其中μi为簇Ci的中心点

μi=1CixCix

将主题使用词向量进行表示,K-means通过随机选择l个主题作为簇的中心,计算每个主题和各个簇中心主题的距离,将样本点划入距离最近的簇中心主题,根据已经划分的簇,重新计算簇中心主题的位置。通过增加迭代次数来提高主题聚类的准确率16~18

1.4 聚类簇中热点簇评价

为了使聚类后的结果能够代表大多数网民的观点,本文选择聚类簇内的主题个数、评论数、点赞数作为热点主题评价参数12。其中评论数和点赞数会随着时间而不断变化,因此热点簇的评价公式为

S'=(1-δ-μ)C'(o)i=1lCi(o)+δC'(y)i=1lCi(y)+μC'(z)K

其中,μδ为权重因子,K为OLDA模型主题个数,C'(o)为当前聚类簇的评论数,C'(y)为当前聚类簇的点赞数,C'(z)为当前聚类簇包含的主题数目,Ci(o)为编号为i的聚类簇中的评论数,Ci(y)为编号为i的聚类簇中的点赞数。

1.5 基于词性标注的舆情分析

OLDA模型可以得到在各个时间片评论集的主题词的概率分布,但无法直观地检测到需要关注的信息。因此本文提出使用词性标注对得到的主题词进行分析。在COVID-19的评论信息中,包含了丰富的地域信息以及网民的建议和情感态度。利用OLDA模型得到的主题词形式如下(0,0.017*“山东”+0.012*“必胜”+0.005*“找到”+0.005*“重视”+0.004*“凶手”+0.003*“自作孽”+0.003*“重灾区”+0.003*“睡醒”+0.002*“热干面”+0.002*“湛江”),其中第一项0为主题编号,0.017为主题词山东出现的概率,该主题由10个主题词构成。经过jieba得到词性标注:[山东/ns,必胜/vi,找到/v,重视/v,凶手/n,自作孽/nz,重灾区/n,睡醒/vi,热干面/nf,湛江/ns],其中ns表示地名,nz表示其他专有名词,nf表示食品名。经过词性标注,对该时间片内的同一词性的词进行统计分析,可以更加准确地把握舆情发展的焦点。

2  实 验

2.1 实验数据分析

通过编写爬虫脚本收集“央视新闻”“人民日报”“人民网”“中国新闻网”4个官方媒体(以下简称“官方媒体”)从2020年2月9日0:00时到2月11日24:00时发布微博下的热门评论共162 024条。每天的0:00~<6:00分为一个时间片,其余时间每隔3个小时为一个时间片(结束整点数据并入下一时间片),得到评论的数随时间的变化过程如图2所示。可以看到每天热门评论最少的时间为0:00~<6:00,热门评论数最多的在12:00~<24:00,因此官方媒体可以在网民活跃的热点时间段进行信息发布,提升发布信息的有效性。

2.2  K-means主题聚类分析

为了分析聚类效果,选取2020年2月9日上述4个官方媒体发布的微博共337条进行分析。其中各个时间片发布的微博数目所占比例如图3所示。从图3可以看到在6:00时到18:00时发布的微博数占微博总数的75%,而时间占比为37.5%。根据对收集到的数据进行统计分析发现,微博内容中主要为公众关心的问题如各地的捐款捐物情况,开学时间,各地关于防控问题的发布,还有一些其他的事件,具体如表1所示。

μ=0.2δ=0.2K-means聚类簇数l为4。OLDA主题数K为30。对主题进行聚类分析,得到各个时间片对主题词进行筛选后的结果,表2列出了其中的一部分。从表2可以看到,大多数主题词是关于疫情发展的,但在不同的时间片还有其他的主题词,如在0:00~<6:00,有关于元宵晚会的描述;在6:00~<9:00,有关于新生儿“小汤圆”健康平安的描述;在9:00~<12:00,有关于复工的描述等。实验表明了模型可以检测到除了疫情发展变化过程之外的一些特殊事件发生的情况。

2.3 基于词性标注的主题词演化分析

通过对热点主题簇的主题词的收集,绘制出词云如图4所示,可以看到词云中有大量的地名、形容词、非地名名词、动词等信息。本文通过引入词性标注对2020年2月9日到2月11日的主题词进行分类,从时间维度上对主题词演化过程进行对比分析。

2.3.1 主题词中地理位置词演化分析

与以往的微博评论相比,评论中包含了大量的地理位置名词,地理位置词在三天的演化过程如表3所示。

地理位置词在每天的不同时间段出现的数量不同,在时间片0:00~<9:00,主题词中地理位置的词较少,而在时间片9:00~<12:00包含的主题词较多,这与每天疫情发布的地点相关,且疫情包含了除武汉外其他需要关注的地区。随着微博中疫情信息发布,评论中的地理名词逐渐增加,如2020年2月9日,评论中包含有“温州”“浙江”“信阳”等地理名词。在地理名词演化表中,“西藏”“江西”“温州”连续多日出现,显示此地疫情信息更受关注,被官方媒体多次播报,在评论中多次出现。此外,国外地理名词“马赛”在11日上下午连续出现,与官方媒体微博“马赛10年不败”有关。地理位置名词具有表达清晰、指向明确的特性,在舆情治理的过程中需要特别重视。

2.3.2 主题词中非地理名词演化分析

主题词中的名词表现了事件变化的主体,反映了网民关注的焦点。对主题词中2020年2月9日到2月11日评论的热点时间段的名词进行统计,如表4所示。

表4中大多数名词依然与疫情相关,如“疫情”“传人”“病毒”“口罩”生命”“后遗症”“重灾区”“双黄连”等,显示出官方媒体的疫情播报信息受到广泛重视并引起热烈讨论。此外,由于2020年2月8日重症新冠孕妇诞下婴儿“小汤圆”并被官方媒体播报,因此在9日~11日连续多次出现“宝宝”“汤圆”“孩子”等名词。其他事件如“女医疗队员剪掉长发”“肯德基店员感染”“征用学生宿舍乱扔东西”等,在主题词“长发”“肯德基”“宿舍”中得到体现。以上事件在官方媒体发布的微博中评论较多,显示出本方法对网民关注的热点信息具有良好的追踪性。

2.3.3 主题词中形容词演化分析

评论中的形容词表达了网民的情感态度,准确把握网民的情感态度对于维护社会稳定具有重要的意义。形容词演化过程如表5所示。

在疫情发展的过程中,官方媒体积极发布正能量信息,宣传英雄模范事迹,追踪热点信息,因此形容词多为正面形容词,如“坚强”“辛苦”“平安”“最美”等,显示出官方媒体发布的微博对于弘扬社会正气,塑造平稳、健康的社会风气起到积极作用,引起网民共鸣。但是表5中同样存在负面形容词,如“愚昧”“恐怖”等,分别对应官方媒体发布的“隐瞒病情患者去世”“新冠肺炎后遗症”等事件,显示出网民对于瞒报疫情的愤慨以及对新冠后遗症的恐惧。

2.3.4 主题词中动词演化分析

动词的演化显示出网民当前关注行为,准确把握网民行为热点有助于快速做出针对性反应。2020年2月9日到11日的动词主题词整理如表6所示。

评论中的动词主要与疫情、生活、政府三大类相关。其中疫情类主要有“控制”“死亡”“新增”“感染”“治愈”“医护”“出院”“战胜”“凯旋”“祈祷”“封闭”等,贯穿三日,显示官方媒体疫情信息发布及时、准确,能够引导网民对于疫情现状保持较高关注,并向积极方向引导网民情绪。

生活类动词主要有“高考”“毕业”“歧视”“旅游”等,显示除疫情消息外,网民同样关注疫情对生活的影响,尤其是对2020年的高考和应届毕业生的毕业、就业问题。

政府类动词主要有“造谣”“违法必究”“执法必严”“排查”“管理”“判刑”“撤职”等,显示官方媒体发布的与执法相关微博同样受到网民热切关注。从主题动词来看,疫情期间网民希望政府部门严格执法,对影响社会稳定及疫情防控的造谣、隐瞒病情、官员不作为等行为严加惩治。

2.4 建议

根据本文的统计分析,COVID-19暴发期间,官方媒体的微博及评论内容具有一定的特点,依据这些特点,本文给出了相应的建议。

建议1:合理安排信息发布。根据图2的热门评论数随时间的变化曲线可以看到,微博的评论数随时间展现出周期性变化,表明了大多数网民的作息规律。官方媒体可以根据评论数的周期性变化合理安排相关信息的发布,引导舆情的发展方向。

建议2:关注评论中与微博主题不一致信息。根据2.3.2的名词演化及官方博主发布的微博数据对比可知,存在网民发布的评论与该条微博的主题信息不一致情况。在疫情暴发过程中,个别地方政府采用了不恰当的措施,违反了大多数民众的情感意愿。因此网民寄希望于在官方媒体下发表自己的观点看法以行使监督的权利。这些的评论往往是一些亟待解决的问题,需要引起官方媒体重视

建议3:做好与相关部门的沟通反馈。根据2.3节的主题词演化分析可知,官方媒体内容及评论焦点随时间不断变化,评论中也有对地方政府政策的不满以及对热点事件的负面情绪,官方媒体应当主动向相关部门反馈舆论情况,督促相关部门做出回应,积极引导舆论正向发展。

建议4:追踪报道热点事件。针对引起大量网民关注的热点事件,官方媒体发布的信息往往会获得更大的曝光率,获得更好的传播效果。因此官方媒体对热点事件持续追踪报道可以尽快平复网民情绪,促进事件平息。

3  结 语

为了能够获得COVID-19暴发过程中焦点的变化过程,本文通过编写爬虫脚本对几位官方媒体的微博评论进行采集,在OLDA模型的基础上,使用K-means聚类算法对词向量模型表示后的主题进行聚类,发现评论中热点主题簇的变化情况。

本文通过建立模型对COVID-19暴发过程中收集到的微博评论数据进行分析,发现在疫情暴发的过程中大多数网民有着积极向上的态度,相信国家和政府的管控能力,这与相关部门在抗疫过程中,积极高效的工作密不可分。但相关部门仍需要及时发布疫情相关信息、合理规划信息发布时间、把握网民关注的焦点,从而保证网络舆情环境的健康和稳定。从模型上来看,本文的模型也存在着一些不足,例如OLDA模型建模的结果是一组词,而这些词在疫情发展的过程中具有一定的通用性,无法确定是关于哪个事件网民的态度。因此下一步的研究方向是关于如何准确具体的检测出新的事件的发生。

参考文献

[1]

马松岳,许鑫.基于评论情感分析的用户在线评价研究——以豆瓣网电影为例[J].图书情报工作2016(10):95-102.

[2]

MA S YXU X. Study on user online evaluation based on sentiment analysis of comments: Taking douban.com movie as an example [J]. Library and Information Service2016(10):95-102 (Ch).

[3]

赖胜强,唐雪梅.舆情事件中网民评论的社会影响研究[J].情报杂志202039(2):103-107+115.

[4]

LAI S QTANG X M. On social influence of online comments in public opinion events [J]. Journal of Intelligence202039(2):103-107+115 (Ch).

[5]

李晚莲,高光涵.突发事件网络舆情研究进展与趋势分析[J].重庆邮电大学学报(社会科学版)201931(5):60-68.

[6]

LI W LGAO G H. An analysis of the research progress and trends of emergency network public opinion [J]. Journal of Chongqing University of Posts and Telecommunications (Social Science Edition)201931(5):60-68 (Ch).

[7]

周义棋,田向亮,钟茂华.基于微博网络爬虫的巴黎圣母院大火舆情分析[J].武汉理工大学学报(信息与管理工程版)201941(5):461-466.

[8]

ZHOU Y QTIAN X LZHONG M H. The network public opinion analysis of notre-dame fire based on Weibo and web crawler[J]. Journal of Wuhan University of Technology(Information & Management Engineering)201941(5):461-466 (Ch).

[9]

陈兴蜀,常天祐,王海舟,.基于微博数据的“新冠肺炎疫情”舆情演化时空分析[J].四川大学学报(自然科学版)202057(2):409-416.

[10]

CHEN X SCHANG T YWANG H Zet al. Spatial and temporal analysis on public opinion evolution of epidemic situation about novel coronavirus pneumonia based on micro-blog data [J]. Journal of Sichuan University(Natural Science Edition)202057(2):409-416 (Ch).

[11]

李泉,李萌,成洪权,.基于文本聚类与情感分析的群租房微博舆情量化研究[J].图书情报研究201912(1):82-89+105.

[12]

LI QLI MCHENG H Qet al. Public opinions of group leasing in chinese social media: A research based on text cluster and sentiment analysis [J]. Library and Information Studies201912(1):82-89+105 (Ch).

[13]

张克君,史泰猛,李伟男,.基于统计语言模型改进的Word2Vec优化策略研究[J].中文信息学报201933(7):11-19.

[14]

ZHANG K JSHI T MLI W Net al. Word2Vec optimization strategy based on an improved statistical language model [J]. Journal of Chinese Information Processing201933(7):11-19 (Ch).

[15]

刘家益,李鲡瑶,张智雄,.关键词和被引次数对科技论文自动摘要效果影响研究[J].情报学报201736(11):1165-1174.

[16]

LIU J YLI L YZHANG Z Xet al. The influence of key words and cited times on scientific papers automatic summarization [J]. Journal of the China Society for Scientific and Technical Information201736(11):1165-1174 (Ch).

[17]

赵京胜,朱巧明,周国栋,.自动关键词抽取研究综述[J].软件学报201728(9):2431-2449.

[18]

ZHAO J SZHU Q MZHOU G Det al. Review of research in automatic keyword extraction [J].Journal of Software201728(9):2431-2449 (Ch).

[19]

余本功,张卫春,王龙飞.基于改进的OLDA模型话题检测及演化分析[J].情报杂志201736(2):102-107.

[20]

YU B GZHANG W CWANG L F. Topic detection and evolution analysis based on improced OLDA model [J]. Journal of Intelligence201736(2):102-107 (Ch).

[21]

林丽丽,马秀峰.基于LDA模型的国内图书情报学研究主题发现及演化分析[J].情报科学201937(12):87-92.

[22]

LIN L LMA X F. The theme discovery and evolution analysis of domestic library and information science research base on LDA [J]. Information Science201937(12):87-92 (Ch).

[23]

陈兴蜀,高悦,江浩,.基于OLDA的热点话题演化跟踪模型[J].华南理工大学学报(自然科学版)201644(5):130-136.

[24]

CHEN X SGAO YJIANG Het al. OLDA-based model for hot topic evolution and tracking [J]. Journal of South China University of Technology(Natural Science Edition)201644(5):130-136 (Ch).

[25]

裴可锋,陈永洲,马静.基于OLDA的可变在线主题演化模型[J].情报科学201735(5):63-68.

[26]

PEI K FCHEN Y ZMA J. Variable online theme evolution model based on OLDA[J]. Information Science201735(5):63-68 (Ch).

[27]

张佩瑶,刘东苏.基于词向量的话题焦点识别方法[J].情报科学201937(7):61-64+71.

[28]

ZHANG P YLIU D S.Topic focus recognition method based on word2vec[J]. Information Science201937(7):61-64+71 (Ch).

[29]

魏杰.基于K-means聚类算法改进算法的研究[J].信息通信2018(5):14-15.

[30]

WEI J. Research on improved K-means clustering algorithm [J]. Information & Communications2018(5):14-15 (Ch).

[31]

钟熙,孙祥娥.基于Kmeans++聚类的朴素贝叶斯集成方法研究[J].计算机科学201946(S1):439-441+451.

[32]

ZHONG XSUN X E. Research on naive bayes ensemble method based on Kmeans++ clustering [J]. Computer Science201946(S1):439-441+451 (Ch).

[33]

刘江华.一种基于kmeans聚类算法和LDA主题模型的文本检索方法及有效性验证[J].情报科学201735(2):16-21+26.

[34]

LIU J H. A text retrieval method based on kmeans clustering algorithm and LDA topic model and its effectiveness [J]. Information Science201735(2):16-21+26 (Ch).

[35]

喻影,陈珂,寿黎但,.基于关键词和关键句抽取的用户评论情感分析[J].计算机科学201946(10):19-26.

[36]

YU YCHEN KSHOU L Det al. Sentiment analysis of user comments based on extraction of key words and key sentences [J]. Computer Science201946(10):19-26 (Ch).

基金资助

国家自然科学基金青年基金(61603242)

国家自然科学基金青年基金(61802251)

江西省经济犯罪侦查与防控技术协同创新中心开放基金资助课题(JXJZXTCX-030)

AI Summary AI Mindmap
PDF (1913KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/