0 引 言
随着自然语言处理以及大数据技术的兴起,出现了图像标题生成(image captioning)的研究热潮。图像标题生成的主要目的是将一幅图像翻译成一段对该幅图像进行描述的文本,完成从图像到文本的多模态转换。这一过程对机器而言非常具有挑战性,它要求机器在理解图像内容的同时还能用自然语言表达图像语义乃至语义关系。
图像标题生成有很多潜在的应用场景
[1],比如用户在拍得一张照片后,利用图像标题生成可以为其匹配合适的文本,方便以后检索或省去用户手动配文,能够从幻灯片中的图片读懂演讲者所讲的内容;此外,它还可以帮助视觉障碍者去理解图像内容。同图像标题生成类似的还有视频标题生成,输入一段视频,输出对视频的描述文本,图像标题生成的研究同样可以促进视频标题生成研究的进步。
1 研究现状
图像标题生成的研究需要大量图文数据作为支撑,图文数据是由图像和图像描述组成的数据。目前,已有图像标题生成的图文数据集主要是英文的,如MSCOCO
[2]、Flickr8k
[3]、Flickr30k
[4]、SBU
[5]、IAPR-TC12
[6]、PASCAL
[7]、Visual Genome
[8]和Multi30K
[9];也有德文和日文数据集,如IAPR-TC12和Multi30K有德文版,STAIR Caption
[10]为日文数据集;中文数据集有AIC
[11](AI challenger)以及由Flickr8k翻译成中文的Flickr8k-CN
[12]。各数据集的信息如
表1[13]所示,样例如
图1所示。
从
图1可看出,数据集的构建方式大多为图像和图像描述,以一张图像对应5句图像描述为主。这些描述由不同的标注人员给出,5个句子通常有较高的相似度。其中MSCOCO、PASCAL、Visual Genome包含了对图像区域的标注,可用来做目标检测任务。
图1(a)中的图像共有5条信息,描述了这个男人的耳朵、眼镜、帽子以及基本动作。这些都是该图像的浅层信息,而该图像在真实生活场景中,可能有着更深刻信息,如这个男人的身份,正在进行的任务,参与的活动,现场的时间、环境等。这些隐含的事件、语义信息和意境能更好地帮助人们理解图像。
为了描述图文隐含的事件、语义信息,本文定义了六元组,并以六元组为对象构建了图文数据集。该六元组包括图像、文本、事件文本、事件图、图像关键要素和文本关键要素。
2 图文数据采集
2.1 总体流程
中文图文数据采集的整个流程分为三个步骤,分别为获取数据、筛选数据、标注数据。每个步骤分别再细分为三个步骤(如
图2)。
2.2 图文数据获取与筛选
网易的图片新闻和网易悦图图文数据的质量较高,本文选择了网易图片新闻中事件信息丰富、数据量较大的“实事速递”和“看客”栏目图文数据以及网易悦图中事件相对较丰富的“财经”和“旅游”栏目的图文数据作为来源数据;依据类别,利用爬虫技术获取图文数据。
如
图3(a)所示,该图文只是相关图册中的一对,上方的“美国中情局新任‘女掌门’哈斯佩尔宣誓就职”是图册标题,右侧的“美国 中情局 特朗普”是图册的标签,标签正下方是一段对该图册的概述。一般情况下,一个图册为一个完整的事件,也有一些图册中的图像不同但是图像描述却不变,还有一部分图册只有前几张图像是有描述的,图册的后面几张是诸如“来源:XXX”“现场图”等字样。目前共获取类似图册19 519个,图文对总数203 620对,平均每个图册约10对图文。
获取图册数据之后,以网页的形式制作了筛选工具,然后将所有的图文数据都显示到该网页筛选工具上,在浏览图文数据的同时也可以对某个数据进行修改调整、分类或者选择弃用。两名标注员在该网站上通过对前8万对图文逐个浏览,选择出了1万对描述相对较合适的数据,同时对图像进行分类。对过长的图像描述进行人为缩减,使描述内容与该幅图像精准匹配。筛选一遍后,合适的图文样本如
图3(a)所示,这类样本文字对图像的描述恰当且没有过多与图像无关的文字;不合适的、被筛选掉的样本如
图3(b)所示,它的描述文本过短且对理解图像无帮助。
3 图文数据集标注
3.1 图文关键要素
图文关键要素为图文中实体以及实体动作,从图文要素是否对应来看,有图文对齐、图有文无、文有图无三类,分别表示图像和文本有表达相同的实体或动作、文本表达的实体或动作在图像中没有出现、图像表达的实体或动作在文本中没有出现。从图像标题生成的角度,完全对齐的图文是有用的,如
图4(a)所示,该图像内容与描述“道路上的汽车旁站着一个左手拿着卡片右手拿着烟的女人”的完全一致;从理解文本描述的角度,图有文无是有用的,如
图4(b)所示,该图像内容为一个院子,地上由砖块构成,屋顶由瓦片搭成,里面种了很多的花草树木,绿意盎然,而该图像描述却没有提及这些表面现象,用到了“传统文化”“共同记忆”“芳香馥郁”“历史气息”来解读,这样的图像促进了对文本的理解;从理解图片的角度,文有图无也是有用的,如
图4(c)所示,该图像内容只是一些黑色和白色的包裹,看不出是什么,而该图像描述为“利用学童书包藏匿走私燕窝入境”,因此可以发现图像中黑色和白色的包裹为香港走私燕窝,这样的文本描述促进了对图像的理解。
为了提高图像标题生成的准确性,需要对图文数据的关键要素进行人工标注。以
图4(a)为例,选择图文对中共有的要素“汽车”“女人”“左手拿着卡片”“右手拿着烟”进行标注,标注后的图文对及标注文本如
图5所示。对图像描述中的标注对象用“[]”进行选择,对图像中的标注对象用矩形框进行选择。标注完成后生成XML格式的标注文本,该XML文本中有每个标注对象在原图像中的坐标信息以及原始图像的路径和像素大小。
3.2 事件语义标注规范
一个事件包括各种语义角色,主要分为主体语义角色和客体语义角色、时空语义角色和附加语义角色。主体语义角色包括施事(A),致事(Cau)和主事(Th)。“施事”为自主性动作或行为的发出者,“致事”为某种致使事件发生的引起因素,“主事”强调事物的独立性,一般为性质、状态或变化性事件的主体。客体语义角色包括受事(P)、与事(D)、结果(R)、系事(Re)。“受事”是因施事的行为而受到影响的人或事物,“与事”是动作行为的非主动参与者,“结果”指由施事的动作或行为造成的结果,“系事”指在事件结构中跟主事相对应的语义角色。时空语义角色包括时间(T)、地点(L)、源点(So)、终点(Des)。“时间”为事件发生的时间,“地点”为事件发生的处所,“源点”指事件所表示的动作行为开始的地点,“终点”指事件所表示的动作行为结束的地点。附加语义角色包括工具(I)、方式(M)、材料(Ma)、原因(Rn)、范围(Ra)。“工具”指事件所涉及的器具,“方式”指事件所采取的方式、方法及途径等,“材料”指事件所涉及的材料,“原因”指导致事件发生的原因,“范围”指事件等涉及的数量、频率、幅度等事项。这些语义角色组成的层次结构如
图6所示。
一段文本描述中往往包含多个事件,本文选择了以下七种类型事件的逻辑语义关系。
1) 并列关系(COR)。主要为两个具有相同句法功能的事件,互相连接且没有主次之分,如例1中的“同时”前后的两个事件“等待”与“吃”。
例1:“一位K653次旅客在列车上等待发车,同时吃起自带的晚饭。”
2) 递进关系(ADD)。主要指句子中的后一部分(或后一个字句)比前一部分(或前一个子句)的意思更进一层,一般由轻到重,由小到大,由浅到深,由易到难。如例2中“而且”前后两个事件“掌握”与“搭建”。
例2:“小吴学习编程的能力很强,短短一年的时间,不仅熟练掌握了编程语言,而且还能够搭建属于自己的网站。”
3) 选择关系(ALT)。主要指复句中的分句有两种或两种以上的情况,要求选择其中的一种,如例3中“等出租车”与“用滴滴打车”是需要选择的事件。
例3:“自从滴滴打车爆出负面新闻后,小霖下班宁可多花点时间等出租车也不愿意再用滴滴打车软件。”
4) 转折关系(VER)。主要是指第一个事件表达一层意思,而第二个事件则表达与前一事件相反、相对或部分相反的意思,如例4中“但”前后的事件“保释”与“牢狱之灾”。
例4:“小吴虽然目前已被保释,但仍有面对牢狱之灾的可能。”
5) 时序关系(TEM)。主要指在篇章中出现的两个形式上相邻的事件之间可能恰好具有时间上的先后顺序,如例5中由时间副词引导的三个“检查”事件。
例5:“旅客乘坐动车需要先检查身份证和车票才能进站,接着检查行李物品以及随身物品,上车后还需要再检查一次车票。”
6) 条件关系(CON)。主要指分句之间具有条件与结果的关系,第一个事件是真实或假设条件事件,而第二个事件则表达了在前一条件事件下的结果事件,如例6中的事件“露出”与“变成”。
例6:“寒冷的气温让你无法在室外停留很长时间,走在路上的人只要露出头发的话,即刻就变成雪白。”
7) 因果关系(CAS)。主要指句子中有原因则有结果。事件间的因果关系一般原因事件在先,结果事件在后,即先因后果,但原因事件和结果事件必须同时具有必然的联系,即二者的关系属于引起和被引起的关系,如例7中的“因而”前后的事件。
例7:“实验室新增了一台高性能设备,因而大家的科研激情大大提高。”
3.3 图文标注工具
选用精灵标注助手工具对图文进行标注。该工具除了支持图片标注外,还支持视频标注以及文本标注,且跨平台、多语言,兼容不同操作系统,可免费使用。
在对图像描述的事件语义标注中,基于制定的事件语义标注规范,完成相应的事件标注,其中事件语义角色的标注界面如
图7(a)所示。XML具有良好的可读性且便于信息的检索,因此选用XML格式对标注文本进行存储,存储格式如
图7(b)所示。
在对事件的标注中,标注工具可以将图像描述切分成一个或者多个句子,然后再利用谓词将句子切分成一个或者多个事件。这样切分的每一个事件都属于原子事件
[14],原子事件具有原子性、语义性和事实性的特点。原子事件的语义性是指原子事件是一个语义单位,介于词和句子之间,比词组意义完整,通过事件语义分析与计算,可以透彻研究其所在句子的意义,进而研究所在图像描述的意义。在进行数据标注时,主要围绕着原子事件进行,共分为以下三步:
1) 利用标注工具将图像描述拆分成一个或者多个句子,再将句子根据谓词拆分成一个或者多个原子事件;
2) 对每个原子事件进行语义角色标注;
3) 对原子事件之间进行事件语义关系标注。
3.4 标注过程
在图文关键要素和事件语义标注规范基础上,采用标注工具,对图文数据完成关键要素和事件语义的标注。下面以
图8为例介绍标注过程。
首先对图文关键要素进行以下三步标注:
1) 选择图像和图像描述中都有的实体及实体动作进行文字标注,如“何毅”“女友”“机器人”“求婚”“拒绝”。标注后的图像描述为:“2018年1月14日,北京,世贸天阶,互联网公司的程序员[何毅]用[机器人]向恋爱三年的[女友][求婚]。但让何毅没想到的是,在现场女友当众[拒绝]了他的求婚,并说让他去和机器人过日子。”
2) 根据已标注的图像描述进行图像标注,标注后的图像如
图9(a)所示。
3) 将标注后的图像生成标注文本。该文本包含图像路径、图像的像素大小以及各标注关键要素的坐标信息,标注文本内容如
图9(b)所示。
接着对原始的图像描述进行事件标注,在事件标注工具中,将图像描述分为如下三步进行标注:
1) 确认原子事件。首先将图像描述以句号拆分成两个句子,分别对句子1和句子2根据谓词进行事件拆分。句子1只能算一个事件即事件1,句子2可以拆分成3个事件,事件2:“但让何毅没想到的是”,事件3:“在现场女友当众拒绝了他的求婚”,事件4:“并说让他去和机器人过日子”。
2) 对每个原子事件进行语义角色标注。事件1:“[2018年1月14日 T],[北京,世贸天阶 L],互联网公司的程序员[何毅 A]用[机器人 I]向恋爱三年的[女友 P][求婚 EP]。”,事件2:“但让[何毅 A][没 neg][想到 EP]的是”,事件3:“[在现场 L][女友 A]当众[拒绝 EP]了[他的求婚 P]”,事件4:“并说让[他 A]去和[机器人 D][过日子 EP]”。以上标注中,事件角色的简写意思可参考前面对事件语义角色的介绍,其中“EP”和“neg”分别指事件谓词和否定逻辑算子。
3) 对原子事件之间进行事件语义关系标注。事件1与事件2根据“但”这个词可以判断它们为转折关系;从事件2与事件3中可看出后一事件是对前一事件的解释,故可判断为递进关系;事件3和事件4中由关键词“拒绝了”,“并说”可以判断出为递进关系。因此在事件标注工具中将事件1和事件2进行关联并标注为转折关系,将事件2和事件3进行关联并标注为递进关系,将事件3和事件4进行关联并标注为递进关系。
3.5 标注一致性控制
图文数据集的构建有4名标注员参加,在标注前进行统一规范讲解。由于不同人对同一事物的理解不同,标注结果难免有差异,为了尽量减少标注结果的差异,按照以下方式进行一致性控制:
1) 将未标注的图文分成4份,每人标注1份;
2) 将标注结果随机转至另一名标注人员进行复标,同时记录标注结果不同的图文数据;
3) 将4份图文数据合并后打乱顺序,再分为两份,每份交给两名标注人员同时讨论复标。
采用以上标注方法,可以保证每个图文数据均被标注3次,同时至少被不同的两名人员标注,且该情况下会在步骤3)双人标注结果比较中再次得到统一,由此可以使有差异的图文数据尽量降到最低。
4 图文数据集分析
4.1 标注结果分析
对标注好的事件语义角色与事件语义关系构建事件图。
图8的图像描述经过事件标注后,构建的事件图如
图10。事件图清晰有序地反映了图像描述中各个事件所包含的事件语义角色,以及事件之间的相互关系,有助于对事件语义的分析及以后利用图遍历、关键路径等算法进行语义计算分析。
事件图构建完成后,
图8所示图文完整标注的结果是一个六元组。关键要素的标注能促进图像描述中重要信息的生成;事件的标注能使生成的图像描述更加结构化,逻辑更加清晰,语义更加丰富。
4.2 数据统计
本文对采集并筛选后的图文数据做了类别数量和图像描述的平均文字长度统计,统计结果如
表2。
4.3 标注数据统计
在完整标注200个六元组对象后,本文对这些标注数据进行了一些基本的统计分析,如
表3和
表4。分析
表3可以发现,本文建立的图文数据集中平均每个图像描述由2.3个句子组成,涉及到3.58个事件,平均每个图文对有4.17个标注区域;由
表4可知图文数据集中的各个事件语义角色的出现次数。
从以上的统计数据看,本文建立的数据集中各个事件语义角色都有且分布适中,图文对应区域数量相对句子长度表现适中,图文对数据质量较高。
5 结 语
以六元组描述图像,并建立了相应的图文数据集,对筛选和标注后的图文数据进行了统计和分析。今后的工作可从如下几个方面进行拓展:1) 在数量上对本文建立的图文数据集进行扩充;2) 增加对事件语义的计算,进一步深化对图像描述的标注;3) 将已有整个图册的图文信息联系在一起,形成具有上下文关系的图文数据。
国家社科基金重大研究计划(11&ZD189)
湖北省教育厅人文社会科学研究项目(17Y018)