基于图文双向引导注意力的新闻图集描述生成方法

张炫 ,  刘茂福 ,  邱晨 ,  胡慧君

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 223 -232.

PDF (3192KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 223 -232. DOI: 10.14188/j.1671-8836.2022.0174

基于图文双向引导注意力的新闻图集描述生成方法

作者信息 +

A News Image Set Captioning Method Based on Image and Text Bidirectional Guidance Attention

Author information +
文章历史 +
PDF (3268K)

摘要

在传统的图像描述生成任务中,已有方法对图像的描述仅仅停留在浅层,并缺乏真实世界知识的指导,难以挖掘出对象在特定背景下的逻辑语义关系。新闻文本的引入为图像描述带来了新的可能,同时对模型的学习能力有了更高要求;此外,新闻图集中往往存在多幅图像,且相互之间联系紧密,导致现有单图描述生成方法不适用于新闻图集描述生成。针对上述问题,本文提出了一种基于图文双向引导注意力(image and text bidirectional guidance attention,ITBGA)的新闻图集描述方法,以图集作为研究对象,并辅以对应的新闻文本作为背景知识,基于ITBGA分别实现粗、细两个粒度的跨模态信息交互,并通过指针网络辅助命名实体词生成。在本文构建的新闻图集数据集上进行了实验验证,结果表明ITBGA能有效提升描述文本的质量,在关键的CIDEr指标上达到了最优。

Abstract

In the traditional image captioning task, each method only describes the image in a shallow level. Due to the lack of real world knowledge, it is often difficult to mine the logical semantic relationship of objects in a specific context. The introduction of news text brings new possibilities for image captioning, but at the same time, it requires higher learning ability of models; In addition, there are often multiple images in news data, and they are closely related to each other, which makes the existing single image captioning methods not suitable for news image set captioning task. To solve the above problems, this paper proposes a news image set captioning method based on image and text bidirectional guidance attention, i.e., ITBGA, which takes the image set as the research object and the corresponding news text as the background knowledge. Based on ITBGA, it realizes the cross modal information interaction at coarse and fine granularity respectively, and uses the pointer network to assist the generation of named entity words. The experimental results on the news image set constructed in this paper show that ITBGA can improve the quality of the description text, and the method achieves optimal performance on CIDEr indicator.

Graphical abstract

关键词

图像描述 / 图文双向引导注意力 / 图集 / 新闻文本

Key words

image captioning / ITBGA(image and text bidirectional guidance attention) / image set / news text

引用本文

引用格式 ▾
张炫,刘茂福,邱晨,胡慧君. 基于图文双向引导注意力的新闻图集描述生成方法[J]. 武汉大学学报(理学版), 2023, 69(2): 223-232 DOI:10.14188/j.1671-8836.2022.0174

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

图像描述生成(image captioning)是为一幅图像生成文本描述,在日常生活中具有很大的实用价值,比如辅助盲人阅读、为图片自动生成配文等[1]。现有图像描述生成模型主要基于编解码框架[2],如经典的NIC(neural image caption)[3]。在此基础上,研究者针对注意力机制[4]进行改进和创新[5~7],然而大多数注意力方法只关注视觉特征,忽略了生成文本本身的特性。刘茂福等[8]提出一种双注意力机制同时关注视觉连贯性和上下文信息,显著地提升了图像描述的生成效果。此外,也有学者从文本句法关系的角度,基于依存句法进行可解释性图像描述生成研究,提高了描述生成的质量[9]。由此可见,对于图像描述生成而言,充分理解并利用视觉和文本信息至关重要,针对注意力机制进行改进和创新则是提升模型性能的一种有效手段,但现有注意力机制难以完成复杂图文信息的交互。

图像描述生成任务最终需要达到的目标是:生成的描述能完全表达出各视觉对象在特定背景下的相互逻辑语义关系[10]。但现有方法生成的描述文本倾向于描述通用对象,缺乏与现实情境的关联。Zhao等[11]引入外部信息进行图像描述,生成的描述文本在具备流畅性的同时,包含了更丰富的实体信息。Ramisa等[12]、Tran等[13]基于新闻数据进行图像描述研究,以新闻文本作为辅助信息,所生成描述文本的质量及其与现实情境的关联性均有所提升,但忽略了新闻数据多图的特性。

与其他文体相比,新闻文章中往往包含重要的命名实体词,因此,针对新闻图像的描述需要关注命名实体词的生成。Lu等[14]提出了一种基于模板的方法,从辅助数据中检索命名实体;Biten等[15]首先生成含有特殊代词的描述模版,再结合多种命名实体词插入方式生成最终的描述文本;Liu等[16]利用指针网络[17]生成命名实体词。上述方法在不同程度上提高了模型生成命名实体词的准确性。此外,新闻中往往包含多幅图像,且图像与图像之间存在结构化信息[18]。但现有新闻图像描述任务只针对单图,并不将图集看作整体,破坏了其完整性;并且内容相似的图像其单独的描述往往相似甚至完全相同,分开描述会造成冗余。因此,将图集作为整体进行描述更为合理。近年来,不乏一些针对图集的摘要研究[19~22],但并未涉及文字描述,仅通过从图集中选择更小的子集进行概括。Abdu[23]提出了一种对图集进行文本描述的方法,实现了图像描述生成由单图向图集的延伸,但目前仍然缺乏带有外部文本信息的图集描述生成研究。

针对新闻图集展开研究是一种新的尝试,同时也面临着新的挑战:1) 新闻图集包含了新闻文本信息、图像间结构化信息、图像内容信息,而由于任务差异,现有图像描述生成方法中的图文交互机制无法实现三者间的信息交互。2) 缺乏可用数据集。经典的图像描述生成数据集Flickr30k[24]、MS-COCO[25]仅提供单幅图像与对应通用描述性文本的数据对,无外部信息;新闻图像描述数据集Good News[15]、Visual News[16]虽然提供了外部信息,但一条新闻中的多幅图像被分成多条数据,并不针对图集进行描述。

针对上述分析,本文以国内新闻图集网站作为数据源,构建了新闻图集描述数据集,其中每条数据包含多幅图像和一段背景文本,对应一条人工书写的描述文本。在此基础上,本文提出了新闻图集描述生成方法(news image set captioning,NISC),利用背景信息为图集生成解释性的长描述文本。在该方法中引入了图文双向引导注意力(image and text bidirectional guidance attention,ITBGA),针对新闻图集的特性,设计了两种不同的形态:粗粒度图文双向引导注意力(coarse-grained image text bidirectional guidance attention,CITBGA)和细粒度图文双向引导注意力(fine-grained image text bidirectional guidance attention,FITBGA),结合外部文本进行双向引导关注,既对图像和图像内容进行选择,也对文本信息进行选择,使得模型能够充分利用图文信息,并有效筛选出关键信息;同时将得到的注意力权重用于指针网络,引导命名实体生成。

1  本文的方法

本文提出的基于ITBGA的新闻图集描述方法NISC整体架构如图1所示。该方法基于编解码框架,在编码层分别对图文信息进行特征向量表示,再通过CITBGA和FITBGA进行图文交互;解码层通过FITBGA实现图文上下文和上一时刻生成文本的相互引导,得到当前时刻生成文本的词概率分布,结合指针网络确定最终生成文本。

1.1 图文特征向量表示

对于包含了M幅图像的图集V,本文利用预训练模型ResNet152[26]分别提取V的粗粒度视觉特征和细粒度视觉特征,表示为VC=v1,v2,,vM,其中viRdv表示图集中的第i个图像的粗粒度视觉特征,特征向量的维度为dvVF=v1F,v2F,,vMFviF=b1,b2,,bN,其中viFRN×dv表示图集中第i个图像的细粒度视觉特征,N是一幅图像内图像区域的数量,bjRdv表示图像内第j个区域的细粒度视觉特征,特征向量的维度为dv

对于新闻文本部分,本文使用百度LAC工具[27]提取命名实体,利用预训练模型BERT[28]得到整体文本特征T,表示为T=t1,t2,,tL,其中L是文本的长度,tiRdt表示第i个词的文本特征,特征向量的维度为dt;对于命名实体,本文先通过word2vec词袋模型[29]获得第i个词的编码向量wiRdt和位置编码向量piRdt,二者维度均为dt,再通过(1)式得到最终的命名实体特征表示E=e1,e2,,eK,其中K表示命名实体的个数。

ei=wi+pi

1.2 CITBGA

为了更好地适应新闻图集的特性,本文提出CITBGA模块实现图集的粗粒度视觉特征信息和背景文本特征信息的交互,并更新图集整体视觉特征向量表示。CITBGA模块结构如图2所示。

CITBGA的主要组成部分是多头注意上的注意力结构(multi-head attention on attention)[16],以下简称MHAoA,涉及三组输入向量:QKV。本模块首先对特征向量进行简单处理变换,再利用两个MHAoA结构(第1个,以视觉特征作为查询Q,文本特征作为 KV,得到TV;第2个,以文本特征作为查询Q,视觉特征作为 KV,得到VT),进行交叉注意力交互,得到最终的特征表示。具体运算过程如下:

T'=selfAttT
TV=MHAoAT',VC;T',VC;T'
VT=MHAoAVC,TV,TV

其中selfAtt表示自注意力层,T'是文本特征 T 自注意力后的结果,;表示向量拼接操作。

1.3 FITBGA

为了进一步关注细粒度信息,本文提出FITBGA以实现更细致的图文信息交互。FITBGA模块分别作用于编码层(enc-FITBGA)和解码层(dec-FITBGA),两部分输入输出略有不同。

1.3.1 enc-FITBGA

enc-FITBGA模块结构如图3,计算过程如下:

T¯=AvgpoolTV
AT=MHAttT¯,VT,VT
v=vchoice ATF
Tv=MHAoATV,v,v
Tv'=LayerNormT'+Tv
Tenc=LayerNormTv'+FFNTv'

其中,Avgpool表示对TV进行平均池化,得到文本的整体特征表示;AT是以T¯为查询,以VT为键值,经过多头注意力(以下简称MHAtt)得到的权重矩阵;choice代表图像选择操作,确定关注度最高的图像,特征向量表示为v;LayerNorm表示对输入进行归一化操作;FFN表示两层前馈网络(feed-forward network),并以RELU作为全连接操作后的激活函数;Tenc为enc-FITBGA模块最终输出的文本特征表示。

后续重复上述过程,利用CITBGA和enc-FITBGA模块完成命名实体特征E与视觉特征VT的交互,最终输出整体视觉特征Venc,命名实体特征Eenc

1.3.2 dec-FITBGA

此模块主要完成生成文本、图像特征、文本特征三者间的信息交互。首先,将标签文本通过嵌入层表示为X=x0,x1,,xn,其中n表示标签文本长度,xiRdt表示第i个词的文本特征,特征向量的维度为dt。再通过带有掩码的MHAoA层,使t时刻的文本xt对自身t时刻之前的文本进行查询,保留关键信息,得到关注后的向量:

xta=MHAoAmaskedxt,X,X

解码阶段的FITBGA模块交互重点在于利用编码阶段得到的图文上下文信息,根据xta对下一个生成文本进行解码预测,其模块结构如图4所示。

dec-FITBGA与enc-FITBGA的主要部分结构一致,不同之处在于:为了在交互解码过程中充分利用视觉特征和文本特征,额外引入MHAoA模块完成文本特征对文本生成过程的引导,并将结果汇总进行归一化处理,其运算过程中产生的注意力权重将被保留用于下一过程。具体计算过程如下:

Ax=MHAttxta,Venc,Venc
v'=vchoice AxF
xtv=MHAoAxta,v',v'
attT,xtT=MHAoAxta,Tenc,Tenc
attE,xtE=MHAoAxta,Eenc,Eenc
xt'=LayerNormxtT+xtE+xtv+xta
xt*=LayerNormxt'+FFNxt'

其中Ax是以xta作为查询,以Venc作为键值,经过多头注意力得到的权重矩阵;v'是基于Ax选择出的关注度最高的图像特征表示;attTattE分别表示xta与背景文本、命名实体经过MHAoA模块交互后产生的两种不同的注意力权重矩阵。为了获得更丰富的权重信息,使用视觉特征v'作为查询与Tenc进行多头注意力交互,得到权重分布:

attTv=MHAttv',Tenc,Tenc

dec-FITBGA模块的输出xt*将经过softmax变换为概率分布Pxt用于词生成。

Pxt=softmaxxt*

1.4 指针网络与词生成

对带有背景知识的对象进行文本描述时,本文利用指针网络实现了直接生成和取词生成相结合的模式。

首先,对attTvattTattE进行直接平均得到attTv¯attT¯attE¯,并通过(21)式和(22)式分别得到背景文本词和命名实体词在生成过程中的权重分布aTaE,其中aT包含了细粒度图文交互的信息。

aT=softmaxattTv¯+attT¯
aE=attE¯

接着将aTaE映射到生成词表上,得到在词表上的权重分布PTPE,将其分别作为背景文本词和命名实体词的生成概率分布。

PT=faT
PE=faE

其中,f表示映射过程。对dec-FITBGA模块的解码向量xt*xtTxtExtv进行计算得到概率值pq,分别代表从背景文本中选词生成的概率和从命名实体列表中选词生成的概率。计算过程如下:

p=σWpxt*;xtT;xtv
q=σWqxt*;xtE;xtv

其中,WpWq是可学习的参数,σ是sigmoid函数。预测文本的最终概率分布为Pxt*,其计算过程如下:

Pxt*=pPT+qPE+1-p-qPxt

最后,使用交叉熵计算模型训练过程的损失,损失函数具体定义为:

Loss=-t=1nP*logPxt*

其中,P*表示真实标签的概率分布。

2  实 验

2.1 数据集和评价指标

2.1.1 数据集

本文从新京报图说(https://www.bjnews.com.cn)、新浪新闻图集(http://slide.news.sina.com.cn)和中国新闻图片网(http://www.cnsphoto.com)采集新闻图集数据共10 000条,在增加了基本限制条件后,利用代码完成初步清洗,再进行人工标注,使用的数据标注工具如图5所示。

标注界面完整展示了数据内容,最上方为新闻标题;界面左半部分对图集进行了展示,可通过滚动查看不同图像,并可通过点选右侧“有效”或“无效”按钮来决定当前图像是否保留;界面右半部分展示了新闻文章,并可进行人工编辑;最下方为描述文本框,需要针对数据完成人工描述的标注工作。

最终构建的新闻图集数据集共包含7 994篇社会新闻,全部为中文,新闻文章平均长度为130.36个字符,图集描述文本平均长度为42.67个字符。整个数据集中包含41 679幅图像,平均每条新闻包含5.21幅图像。实验数据按照8:1:1的比例随机划分为训练集、验证集和测试集。

一条完整的数据格式如例1所示。

例1

{

"id": "r8Hmq5TSUBPCQ6ZWe0Gu",

"title": "“北京湿地日”海淀放飞9只野生动物",

"article": "9月19日是第九个“北京湿地日”,今年的主题为“强化湿地保护修复,促进人与自然和谐共生”。海淀区湿地和野生动植物保护管理中心在翠湖湿地公园开展主题宣传活动,并现场放飞救助的野生动物,包括6只鸳鸯(国家Ⅱ级)、2只红角鸮(国家Ⅱ级)和1只绿头鸭。长期以来,海淀区始终坚持绿色发展理念,强化湿地保护与修复,推动生物多样性保护,打造绿色生态环境。目前,海淀区湿地总面积达1 420.65公顷,以永久性河流、库塘等开敞水面为主。",

"images_list": [

"r8Hmq5TSUBPCQ6ZWe0Gu_0.jpg",

"r8Hmq5TSUBPCQ6ZWe0Gu_1.jpg",

"r8Hmq5TSUBPCQ6ZWe0Gu_2.jpg",

"r8Hmq5TSUBPCQ6ZWe0Gu_3.jpg",

"r8Hmq5TSUBPCQ6ZWe0Gu_4.jpg"

],

"filepath": "resized",

"caption": "“北京湿地日”,游客观看湿地保护修复宣传展板,参加湿地知识问答,海淀区湿地和野生动植物保护管理中心工作人员放飞救助的鸳鸯、红角鸮、绿头鸭。"

}

其中,"id"字段保存了每条数据的唯一标识字符串,"images_list"字段保存了图集中所有图像的文件名,其对应图像文件统一保存在"filepath"字段中的"resized"文件夹下。本文的研究目标即结合新闻标题(title)、正文内容(article)对图集生成对应描述文本(caption)。

2.1.2 评价指标

本文采用4种常见的评价指标对不同方法描述生成的效果进行验证及对比,分别为BLEU[30],ROUGE-L[31],METEOR[32],CIDEr[33]。BLEU是基于词重叠率的评估指标,通过计算生成文本和参考文本中共同的n-gram得到两者的相似度,衡量的是描述的精确度。ROUGE-L则更偏向于从召回率的角度计算生成文本与参考文本之间的相似性,通过计算生成文本与参考文本的最长公共子序列(the longest common subsequence,LCS)的长度来计算文本的相似性。METEOR则同时基于精确率和召回率,使用加权的F值作为评估指标,并且考虑同义词匹配。CIDEr利用TF-IDF(term frequency⁃inverse document frequency)对不同n-gram赋予不同的权重,即经常出现的词组具有更低的权重,不常出现的词组权重更高,这一点很符合命名实体词的特性。

2.2 实验设置

实验环境为Linux 64位,硬件环境为Intel(R) Xeon(R) CPU E5-2660 v4 @ 2.00 GHz。

为了统一输入格式,首先对数据进行预处理,将图像尺寸处理成256×256大小;对新闻文本内容进行清洗,除去空白字符、特殊字符等;使用LAC提取新闻文本中的命名实体,形成命名实体列表。模型训练阶段,批处理大小设置为16,最大迭代周期为50。使用预处理模型BERT对文本进行编码,ResNet152模型对图像进行特征提取。训练过程中冻结BERT模型的参数,只对ResNet152模型进行微调,初始化学习率设置为5e-4。模型的初始化学习率设置为5e-5,根据具体训练情况进行更新。

由于目前没有针对图集的新闻描述研究,现有方法并不完全符合数据的输入形式,因此,本文选择已有新闻单图描述方法,在不改变其原有交互结构的基础上进行修改以满足图集的输入,作为实验的对比方法。具体介绍如下。

GN-WAC(word2vec+avg+cintx):原型是由Biten等[15]提出的一种基于模板的方法,描述过程分为两个步骤:生成模板,插入命名实体。生成模型整体以show attend and tell[5]作为基础结构。对文章的编码以句子为单位,先通过word2vec方式获得词向量,再对词向量求平均值得到句子的向量表示。图文特征之间仅拼接,不进行额外交互。生成句子模板后,第二步使用context insertion方式,对具有余弦相似性的文章句子进行排序,实现命名实体插入。

GN-WWA(word2vec+wavg+attin):与GN-WAC的整体结构相同,不同之处在于其对句子向量的表示源于对词向量的加权平均,并且在第二步使用attention method方式,根据句子级别的注意力权重进行命名实体插入。

VN(BERT):原型是由Liu等[16]提出的一种以Transformer作为基础结构的方法,额外提取命名实体作为辅助信息,利用视觉选择层关注图文交互,通过指针网络选词生成。本文使用BERT提取文章编码。

NISC:本文提出的基线方法,在VN的基础上除去了视觉选择层,仅保留指针网络。

NISC-C:在基线方法的基础上,使用CITBGA结构进行粗粒度图文交互。

NISC-encF:在基线方法的基础上,使用enc- FITBGA结构在编码阶段进行细粒度图文交互。

NISC-decF:在基线方法的基础上,使用dec-FITBGA结构在解码阶段进行细粒度图文交互。

NISC-decF-pointer:在NISC-decF的基础上,将dec-FITBGA解码过程中的细粒度图文交互注意力权重用于指针网络选词生成。

NISC*:本文的完整方法,同时使用CITBGA、enc-FITBGA和dec-FITBGA结构,并且将最终的注意力权重用于指针网络。

2.3 实验结果定量分析

将以上方法在新闻图集数据集上进行实验,各评价指标如表1所示。从表1中的实验结果可以看出:

VN和NISC在CIDEr指标上远超GN-WAC和GN-WWA。初步分析是因为GN先生成句子模板再插入命名实体的二步生成方式存在错误累积的风险,实体插入的准确性严重依赖生成句子模板的质量。而VN和NISC一步生成的方式避免了错误累积,并且指针网络的结构使其能够从训练过程中自动学习权重,在捕捉关键信息时表现更出色。

VN在各项指标上均优于NISC,说明了视觉选择层的有效性。而除NISC之外,使用了ITBGA结构的NISC方法在CIDEr指标上的表现均优于VN;并且NISC-C、NISC-decF-pointer、NISC*在BLEU、METEOR、ROUGE-L上的得分也都高于VN。这说明ITBGA结构的不同形态、不同组合对关键信息的抓取能力都要更优于VN的视觉选择层,但细粒度的ITBGA(即FITBGA)在单独使用时(NISC-encF和NISC-decF的各评价指标),描述效果有待提升。

NISC-C各项评价指标优于NISC,并且在BLEU和METEOR指标上达到了最优,其ROUGE-L指标在以Transformer为基础的方法中也是最高的。这充分说明了CITBGA结构的有效性。综合来看,图集的粗粒度信息能够引导模型生成描述,这与人类从宏观信息进行概括描述的行为方式一致。

NISC-encF,NISC-decF在CIDEr指标上优于NISC,说明FITBGA结构(enc和dec阶段)对于关键信息的抓取有一定帮助,并且这种有效性在编码阶段更为明显(NISC-encF的CIDEr比NISC-decF的CIDEr值更高)。由此可见图集的细粒度信息有助于捕获命名实体。

NISC-decF-pointer各项指标优于NISC-decF,说明FITBGA结构的注意力权重对于指针网络选词生成有正向影响。正确使用细粒度信息也能在一定程度上帮助整体句子生成。

NISC*各项指标均优于NISC,BLUE、METEOR、ROUGE-L值仅次于NISC-C,且CIDEr达到了最高值,说明CITBGA和FITBGA联合使用的有效性。在4个评价指标中,由于CIDEr的评估逻辑更贴合人类判断两个句子是否相似的原理:新闻中特殊的专有名词,往往出现频率很低,对于描述内容却十分重要,人们会更注意这些特殊的单词;并且,对于当前研究任务,BLEU、ROUGE-L和METEOR指标各有其不适之处:BLEU、ROUGE-L在评分时对不同性质的词没有本质上的区分,例如缺少一个停用词与缺少一个命名实体词造成的影响是相同的,而事实上背景信息中的命名实体具有更重要的意义。而METEOR对于同义词的考量也很难作用于命名实体词上。因此,CIDEr在一定程度上更适合用于新闻图集描述生成任务中评估描述文本的质量。

2.4 实验结果定性分析

为了更直观地评估方法的描述生成效果,本文选取GN-WAC、VN、NISC*在具体样本上进行了实例分析,如表2所示。

从整体情况来看,NISC*的命名实体词生成准确性最高,VN其次,GN-WAC最差。例如,表2中的图集(a)中“故宫”只有NISC*描述成功;图集(b)中“丹宸永固——紫禁城建成六百年”只有NISC*描述完整,VN有细微的符号错误,GN-WAC只描述出了“故宫紫禁城”;图集(c)中NISC*和VN描述的“江苏连云港市赣榆区”最接近标准答案,而GN-WAC的“江苏连云港连云港市”描述粗略,且有语法错误;图集(d)中NISC*和VN都成功描述出了“湖北省宜昌市秭归县县直机关幼儿园”,而GN-WAC只描述出了“湖北秭归湖北秭归”,且存在语法错误。这说明图文双向引导注意力本身能提高模型捕获关键信息的能力,并且学习到的权重能提升指针网络的选词效果。对于GN-WAC在生成命名实体词时产生的语法错误,初步分析是由于其在第一步生成句子模板时有所偏差,如图集(d)中,“湖北省宜昌市秭归县县直机关幼儿园”拆分成实体类别模板应该为“LOC ORG”,而如果模型生成的是“LOC LOC”,那么在第二步填充实体名词时,第二个“LOC”倾向于填入相同的地点词,导致重复描述。进一步说明分步的描述生成方式有错误累积的风险。

从描述细节来看,NISC*对图集中的细节内容有更强的捕获能力。表2中的图集(a)中,NISC*从图像内容中识别出了“栏杆旁”“一位女士”,VN也描述出了“栏杆”,GN-WAC则描述了错误内容;图集(c)中,对于标准答案中涉及到的“登记信息”“核酸检测”“准备工具”“排队等待”这四个主要内容,NISC*描述出了三个(“排队等待”“核酸检测”“登记信息”),VN描述出了两个(“登记信息”“核酸检测”),而GN-WAC只描述出了一个(“核酸检测”);图集(d)中,NISC*完整描述出了“叠衣裤”和“展示叠好的衣裤”这两个内容,而VN得到了错误的描述,GN-WAC则无法进行描述。这说明图文双向引导注意力具有基于文本的图像内容捕获能力,进一步证明了其有效性。

但同时,从描述结果上看,NISC*和VN都存在标点符号滥用的问题;GN-WAC的标点符号都比较完整,但存在重复描述及描述内容不足的问题。值得一提的是,GN-WAC的这一生成偏好恰好能解释其在ROUGE-L指标上偏高的结果,如表2图集(c)中,GN-WAC以两种不同的句子重复描述了“核酸检测”这一内容,其中第二句恰好与标准答案中的句子达到了完全一致;而NISC*和VN虽然描述了更多内容,但是无论从语序还是用词上都与标准答案不太一致,因此尽管内容更丰满,但ROUGE-L评价指标不高。

3  结 语

本文提出了一种新闻图集描述方法,基于ITBGA机制,以图集作为描述对象,结合背景文本信息,通过对两种粒度形态的ITBGA(CITBGA和FITBGA)进行组合运用,充分利用图集的粗、细粒度信息进行图文交互,生成具有更丰富的内容和更高层次逻辑语义关系的长描述文本。通过在本文构建的新闻图集数据集上进行实验,表明CITBGA进行粗粒度图文交互可以有效提升图集描述的生成效果;CITBGA和FITBGA均可提升模型生成命名实体词的准确性,且当二者联合运用时具有更显著的提升效果。未来计划扩充、完善数据集,并尝试解决方法在生成描述时标点符号滥用的问题。

参考文献

[1]

马倩霞, 李频捷, 宋靖雁, . 图像描述问题发展趋势及应用[J]. 无人系统技术20203(6): 25-35. DOI: 10.19942/j.issn.2096-5915.2020.06.003 .

[2]

MA Q XLI P JSONG J Yet al. The development trends and applications of image caption[J]. Unmanned Systems Technology20203(6): 25-35. DOI: 10.19942/j.issn.2096-5915.2020.06.003(Ch ).

[3]

CHO KVAN MERRIENBOER BGULCEHRE Cet al. Learning phrase representations using RNN encoder-decoder for statistical machine translation[EB/OL]. [2022-05-14]. DOI: 10.3115/v1/d14-1179 .

[4]

VINYALS OTOSHEV ABENGIO Set al. Show and tell: A neural image caption generator[C]//2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2015: 3156-3164. DOI: 10.1109/CVPR.2015.7298935 .

[5]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[C]//Proceedings of the 31st International Conference on Neural Information Processing Systems. New York: ACM, 2017: 6000-6010. DOI: 10.5555/3295222.3295349 .

[6]

XU KBA J LKIROS Ret al. Show, attend and tell: Neural image caption generation with visual attention[C]//Proceedings of the 32nd International Conference on International Conference on Machine Learning - Volume 37. New York: ACM, 2015: 2048-2057. DOI: 10.5555/3045118.3045336 .

[7]

ANDERSON PHE X DBUEHLER Cet al. Bottom-up and top-down attention for image captioning and visual question answering[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 6077-6086. DOI: 10.1109/CVPR.2018.00636 .

[8]

LI NCHEN Z. Image Cationing with Visual-Semantic LSTM[C]//Proceedings of the 27th International Joint Conference on Artificial Intelligence. Stockholm: AAAI Press, 2018: 793-799. DOI: 10.24963/ijcai.2018/110 .

[9]

刘茂福, 施琦, 聂礼强. 基于视觉关联与上下文双注意力的图像描述生成方法[J]. 软件学报202233(9): 3210-3222. DOI: 10.13328/j.cnki.jos.006623 .

[10]

LIU M FSHI QNIE L Q. Image captioning based on visual relevance and context dual attention[J]. Journal of Software202233(9): 3210-3222. DOI: 10.13328/j.cnki.jos.006623(Ch ).

[11]

刘茂福, 毕健旗, 周冰颖, . 基于依存句法的可解释图像描述生成[J/OL]. 计算机研究与发展2022: 1-12. (2022-10-27).

[12]

LIU M FBI J QZHOU B Yet al. Interpretable image caption generation based on dependency syntax[J/OL]. Journal of Computer Research and Development2022: 1-12. (2022-10-27).

[13]

石义乐, 杨文忠, 杜慧祥, . 基于深度学习的图像描述综述[J]. 电子学报202149(10): 2048-2060. DOI: 10.12263/DZXB.20200669 .

[14]

SHI Y LYANG W ZDU H Xet al. Overview of image captions based on deep learning[J]. Acta Electronica Sinica202149(10): 2048-2060. DOI: 10.12263/DZXB.20200669(Ch ).

[15]

ZHAO S QSHARMA PLEVINBOIM Tet al. Informative image captioning with external sources of information[EB/OL]. 2019arXiv: 1906.08876. DOI: 10.18653/v1/p19-1650 .

[16]

RAMISA AYAN FMORENO-NOGUER Fet al. BreakingNews: Article annotation by image and text processing[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201840(5): 1072-1085. DOI: 10.1109/TPAMI.2017.2721945 .

[17]

TRAN AMATHEWS AXIE L X. Transform and tell: Entity-aware news image captioning[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 13032-13042. DOI: 10.1109/CVPR42600.2020.01305 .

[18]

LU DWHITEHEAD SHUANG L Fet al. Entity-aware image caption generation[EB/OL]. 2018arXiv: 1804.07889. DOI: 10.18653/v1/d18-1435 .

[19]

BITEN A FGOMEZ LRUSIÑOL Met al. Good news, everyone! context driven entity-aware captioning for news images[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 12458-12467. DOI: 10.1109/CVPR.2019.01275 .

[20]

LIU F XWANG Y HWANG T Let al. Visual news: Benchmark and challenges in news image captioning[EB/OL]. 2020arXiv: 2010.03743. DOI: 10.18653/v1/2021.emnlp-main.542 .

[21]

SEE A, LIU P JMANNING C D. Get to the point: Summarization with pointer-generator networks[EB/OL]. 2017arXiv: 1704.04368. DOI: 10.18653/v1/p17-1099 .

[22]

WANG H XKAWAHARA YWENG C Qet al. Representative selection with structured sparsity[J]. Pattern Recognition201763: 268-278. DOI: 10.1016/j.patcog.2016.10.014 .

[23]

SIMON ISNAVELY NSEITZ S M. Scene summarization for online image collections[C]//2007 IEEE 11th International Conference on Computer Vision. New York: IEEE Press, 2007: 1-8. DOI: 10.1109/ICCV.2007.4408863 .

[24]

YANG C LSHEN J LPENG J Yet al. Image collection summarization via dictionary learning for sparse representation[J]. Pattern Recognition201346(3): 948-961. DOI: 10.1016/j.patcog.2012.07.011 .

[25]

TSCHIATSCHEK SIYER RWEI H Cet al. Learning mixtures of submodular functions for image collection summarization[C]//Proceedings of the 27th International Conference on Neural Information Processing Systems - Volume 1. New York: ACM, 2014: 1413-1421.

[26]

SINGLA ATSCHIATSCHEK SKRAUSE A. Noisy submodular maximization via adaptive sampling with applications to crowdsourced image collection summarization[C]//Proceedings of the Thirtieth AAAI Conference on Artificial Intelligence. New York: ACM, 2016: 2037-2043. DOI: 10.5555/3016100.3016183 .

[27]

ABDU JYOTHI A. Generating Natural Language Summary for Image Sets[D]. Burnaby: Simon Fraser University, 2018.

[28]

PLUMMER B AWANG L WCERVANTES C Met al. Flickr30k entities: collecting region-to-phrase correspondences for richer image-to-sentence models[C]//2015 IEEE International Conference on Computer Vision (ICCV). New York: IEEE Press, 2016: 2641-2649. DOI: 10.1109/ICCV.2015.303 .

[29]

CHEN X LFANG HLIN T Yet al. Microsoft COCO captions: Data collection and evaluation server[EB/OL]. 2015arXiv: 1504.00325.

[30]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2016: 770-778. DOI: 10.1109/CVPR.2016.90 .

[31]

JIAO Z YSUN S QSUN K. Chinese lexical analysis with deep Bi-GRU-CRF network[EB/OL]. 2018arXiv: 1807.01882.

[32]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding[EB/OL]. 2018arXiv: 1810.04805. DOI: 10.48550/arXiv.1810.04805 .

[33]

MIKOLOV TCHEN KCORRADO Get al. Efficient estimation of word representations in vector space[EB/OL]. 2013arXiv: 1301.3781.

[34]

PAPINENI KROUKOS SWARD Tet al. BLEU: A method for automatic evaluation of machine translation[C]//Proceedings of the 40th Annual Meeting on Association for Computational Linguistics. New York: ACM, 2002: 311-318. DOI: 10.3115/1073083.1073135 .

[35]

LIN C Y. ROUGE: A package for automatic evaluation of summaries[DB/OL].[2022-08-06]. DOI: 10.3115/1218955.1219032 .

[36]

BANERJEE SLAVIE A. METEOR: An automatic metric for MT evaluation with improved correlation with human judgments[C]//Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization. Stroudsburg: Association for Computational Linguistics, 2005: 65-72.

[37]

VEDANTAM RLAWRENCE ZITNICK CPARIKH D. CIDEr: Consensus-based image description evaluation[C]//2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2015: 4566-4575. DOI: 10.1109/CVPR.2015.7299087 .

基金资助

国家自然科学基金(62271359)

AI Summary AI Mindmap
PDF (3192KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/