基于Transformer和生成对抗网络的藏文生成图像方法

黄安 ,  华却才让null ,  环科尤 ,  张瑞 ,  杨启辉

高原科学研究 ›› 2025, Vol. 9 ›› Issue (2) : 113 -121.

PDF (1042KB)
高原科学研究 ›› 2025, Vol. 9 ›› Issue (2) : 113 -121. DOI: 10.16249/j.cnki.2096-4617.2025.02.012
高原交通与信息处理

基于Transformer和生成对抗网络的藏文生成图像方法

作者信息 +

A Text-to-Image Synthesis Method for the Tibetan Language Based on Transformer and Generative Adversarial Network

Author information +
文章历史 +
PDF (1066K)

摘要

针对藏文生成图像领域资源稀缺以及生成的图像语义一致性低和细节模糊等问题,提出了一种基于Transformer和生成对抗网络的藏文生成图像方法。该方法利用Transformer架构训练不同粒度文本编码器以提取藏文特征,之后将文本特征与随机采样得到的噪声经过仿射变化进行特征融合,并输入卷积层生成图像。经实验,在自建的CUB-BO数据集上,IS值和FID值分别达到了5.22和14.43,展现出较高的藏文生成图像能力。此外,对比实验发现,采用音节切分策略处理藏文文本相较于子词切分生成的图像在细节清晰度和语义一致性上表现更为出色。

Abstract

In response to the scarcity of resources and the challenges related to low quality in the Tibetan text-to-image field, a Tibetan Text-to-Image Generation Method Based on Transformer and Generative Adversarial Networks is proposed in this paper. The method uses the Transformer architecture to train text encoders with different granularity to extract Tibetan text features. After affine transformation, these text features are then fused with noise obtained from random sampling, and convolutional layers are used to generate images. Experimental results show that, on the CUB-BO dataset constructed in this paper, the Inception Score (IS) and Fréchet Inception Distance (FID) values reach 5.22 and 14.43, respectively, indicating a high capability of generating images from Tibetan text. In addition, it was found that images generated from Tibetan text processed using syllable segmentation performed better in terms of detail clarity and semantic consistency compared to those created using sub-word segmentation.

Graphical abstract

关键词

藏文生成图像 / 生成对抗网络(GAN) / 音节切分

Key words

Tibetan text-to-image generation / Generative Adversarial Networks(GAN) / syllable segmentation

引用本文

引用格式 ▾
黄安,华却才让null,环科尤,张瑞,杨启辉. 基于Transformer和生成对抗网络的藏文生成图像方法[J]. 高原科学研究, 2025, 9(2): 113-121 DOI:10.16249/j.cnki.2096-4617.2025.02.012

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

文本生成图像是一项重要的跨模态生成任务,其核心目标是将自然语言描述转换为视觉图像。这一目标不仅要求模型理解文本的语义内容,还需要将这些语义信息准确地映射到视觉领域,生成与文本描述相匹配的图像。近年来,随着深度学习技术的发展,尤其是生成对抗网络[1](Generative Adversarial Networks, GAN)领域的突破,推动了文本生成图像技术的显著进展。

早期研究中,如GAN-INT-CLS模型[2],虽然其能够生成与文本相关的图像,但图像的分辨率较低,细节表现不足,且存在语义不一致的问题。此外,生成的图像往往缺乏真实感和多样性,难以满足实际应用的需求。为了解决上述问题,研究者通过堆叠网络架构和引入注意力机制等,提出了一系列基于GAN的延伸模型。Zhang等[3]提出的StackGAN模型通过堆叠多个生成对抗网络,分阶段生成从低分辨率到高分辨率的图像,显著提高了图像的质量和细节;StackGAN++模型[4]通过联合训练和交替训练策略,生成更加逼真的图像;Xu等[5]提出的AttnGAN模型在堆叠网络架构的同时引入了注意力机制,通过关注文本描述中的关键词,生成与文本描述更加一致的图像细节。

然而,堆叠网络架构的复杂性导致了模型训练成本的增加,并且由后一层网络生成的图像质量在很大程度上依赖于前一层网络的输出。鉴于此,研究者开始探索单层GAN模型,如,Tao等[6]提出的DF-GAN模型采用单层文本到图像的主干网络,直接合成高分辨率图像,同时提出了一种新的目标感知鉴别器和文本图像融合模块,在不引入额外网络的情况下增强了文本和图像的语义一致性,提高了生成图像的真实感和多样性;Ye等[7]提出的RAT-GAN模型在DF-GAN模型的基础上引入了递归神经网络(Recurrent Neural Network, RNN)[8]处理输入的文本,这种递归结构使得模型能够更好地捕捉和理解文本中的上下文信息,从而生成与文本描述更加匹配的图像。

文本生成图像技术在处理英文和汉文等文字方面已取得显著进展,然而对于藏文等少数民族文字的处理仍待深入研究。藏文在文字结构、书写规则以及语义表达等方面与英文、汉文等文字存在显著差异,对文本生成图像模型的文本理解与图像生成能力带来了更大的挑战。此外,藏文生成图像数据集相对匮乏,数据资源的不足严重制约了模型的训练与优化,进而影响图像生成效果。同时,现有主流文本生成图像模型多基于英汉文等文字设计,在技术架构与算法实现上缺乏对少数民族文字的特殊性考虑,导致模型在处理藏文时面临技术适配性问题。为了推动藏文生成图像技术的发展,本文在DF-GAN模型基础上提出了基于Transformer[9]和生成对抗网络的藏文生成图像方法(A Text-to-Image Synthesis Method for the Tibetan Language Based on Transformer and Generative Adversarial Networks, TT-GAN)。本文的主要创新点如下:

(1) 通过机器翻译和人工校对的方式构建了藏文生成图像数据集CUB-BO。

(2) 在文本编码器中将原有的双向长短时记忆网络(Bi-directional Long Short-Term Memory, BiLSTM)[10]替换为Transformer。借助Transformer自注意力机制以更好地处理藏文文本中的长距离依赖关系。

(3) 对比分析了音节切分与子词切分两种不同的文本处理策略对藏文生成图像质量的影响。

为了评估TT-GAN的性能,本文使用初始分数(Inception Score, IS)[11]和Fréchet初始距离(Fréchet Inception Distance, FID)[12]两种评价指标对生成的图像质量进行评估。实验结果表明,相比现有方法,TT-GAN生成的图像在ISFID两个指标上均取得了显著提升。

1 藏文数据预处理

1.1 音节切分

藏文文法体系中,音节字是藏文词的基本构成单位。藏文音节字之间通常由特定的分隔符号“་”来区分,而在句子的最后一个音节之后则附加楔形符号“ ”。因此,在进行音节字级文本切分时,主要依据音节分隔标记和句末楔形符号来进行切分。然而,实际书写中这些分隔符有时会被省略,导致两个音节紧密连接,形成所谓的“紧缩词”。紧缩词的存在使得音节切分方法呈现出复杂性,具体可归纳为以下3种策略[13]

(1) 基于音节分隔标记和句末楔形标记的传统切分方法,直接依据这些明确的标记进行文本的划分。

(2) 采用计算模型或算法来识别黏着结构或紧缩格,以实现自动化切分。实际操作中,通过综合藏文的格助词连接规则、结构特征以及上下文信息,开发出一种融合正则表达式和支持向量机(Support Vector Machine, SVM)的混合式藏文音节切分算法进行切分[14]

(3) 通过还原紧缩格的方式来进行切分。

1.2 子词切分

子词切分是将一个单词或词语切分为若干个连续的片段,这些片段被称为子词。子词切分被广泛应用于GPT[15]、BERT[16]等大语言模型的分词器中,它能够有效平衡词汇表大小和词汇覆盖范围之间的关系,为模型处理文本数据提供更灵活的单位。目前,在藏文自然语言处理领域,广泛采用字节对编码(Byte Pair Encoding, BPE)[17]算法进行子词切分,例如在Tibetan-Llama2[18]、CINO[19]、T-Transformer-XL[20]等模型中,该算法构建的分词器展现出高效的藏文编解码能力。BPE算法将词切分成单个字符,并统计相邻符号对的频率,这些符号对包括初始字符和已经合并而形成的子词。接着,BPE算法将出现频率最高的符号对合并为一个新的子词,然后重复这一过程,直至达到预设的词表大小。

1.3 本文使用的分词方法

为了深入分析不同预处理方法对藏文生成图像质量的影响,本文对比分析了音节切分和子词切分两种策略。在音节切分方面,采用了基于藏文文法的直接切分方法。这种方法的优势在于其简单性,但面对紧缩词时可能存在局限性。在子词切分方面,鉴于本文所使用的数据集数据量较少,为了实现子词切分,使用了CINO模型中被训练的分词器,该分词器使用Sentence Piece[21]工具中的BPE算法进行训练,其中的藏文词典长度为16 000。两种不同文本预处理方法的处理结果示例如表1所示。

2 网络模型

TT-GAN网络架构依次由预训练的文本编码器、生成网络和判别网络组成。文本编码器使用6层Transformer的编码器层提取文本特征;生成网络中设计了6层特征融合模块,将文本特征和图像特征进行融合,生成符合文本语义的图像;判别网络中采用单向输出(One-Way Output)[6]机制来评估图像的真实性以及图像与文本语义的一致性。整体结构如图1所示。

图1所示,生成网络接收两个输入:从正态分布中随机采样得到的噪声向量和经文本编码器处理得到的文本特征向量。首先,随机采样得到的噪声经过全连接层重塑到特定的形状,然后经过6个特征融合模块层和文本特征进行融合生成图像特征,生成的图像特征再经过卷积生成图像。判别网络将使图像通过6个下采样层生成图像特征,然后将生成的图像特征和文本特征拼接到一起通过卷积层来进一步计算对抗损失。

2.1 文本编码器

文本编码器基于Transformer模型的编码器层构建,结构如图2所示。在文本预处理阶段,文本被细分为音节单元,构建成音节序列,并在序列的起始位置嵌入[cls]位置标记。音节序列在经过词嵌入层的转换后,进一步融合位置编码,以精确捕捉每个音节的相对位置信息。接着,这些包含音节和位置信息的输入被送入6个连续的编码器层,经过深入的学习,最终产生代表整个句子和每个音节的特征向量。

文本编码器的训练采用深度注意多模态相似模型(Deep Attentional Multimodal Similarity Model,DAMSM)[5]。DAMSM通过文本编码器和图像编码器将文本和图像映射到一个共同的语义空间,利用注意力机制计算文本与图像的相似性,并通过结合全局和局部损失进行优化,从而学习文本和图像之间的细粒度匹配关系。文本经过文本编码器处理,所有音节位置的输出为音节特征矩阵eRn×256,其中eii=1n)表示第i个音节的特征向量,n为音节的个数,256是指音节特征矩阵的维数。[cls]位置的输出为全局句子向量,记为e¯R256。图像编码器是基于Inception-V3[22]构建的。输入的图像经尺寸调整(reshape)至299×299后,由Inception-V3网络的Mixed_6e层得到图像局部特征矩阵fR768×289,其中,768是特征矩阵的维数,289是图像子区域的数量;由Inception-V3网络的最后一个平均池化层得到图像全局特征向量f¯R2 048。为了使图像和文本映射到一个共同的语义空间,将图像局部特征矩阵fR768×289和全局特征向量f¯R2 048分别输入到一个感知机层,得到f˙R256×289f˙¯R256

2.2 特征融合模块

特征融合模块由两个条件融合模块组成,每个条件融合模块中有两个仿射块。特征融合模块及内部结构如图3所示。其中,图3(A)为特征融合模块结构,输入的特征向量经过上采样层后再经过两个条件融合模块与文本特征进行融合,融合后的特征向量与上采样后的特征向量通过残差连接方式合并。条件融合模块的结构如图3(B)所示,该模块由仿射块、激活函数、卷积层组成,在每个仿射块之后添加激活函数引入非线性。图3(C)为仿射块的整体设计思路,文本特征通过多层感知机(MLP)处理后,输出用于调整图像特征的缩放参数α和位移参数β,公式如下:

α=MLP1s 
β=MLP2s 

式中,s为文本特征向量,MLP为多层感知机。

得到的缩放参数α和位移参数β需对图像特征的每一通道进行运算。具体公式如下:

zi=zi×αi+βi

式中,zi为图像特征第i个通道上的信息,αiβi分别为图像特征第i个通道的缩放参数和位移参数。

2.3 损失函数

模型的损失函数由两部分组成:生成网络损失和判别网络损失。对于生成网络损失而言,其目标是使生成的图像让判别网络无法区分其真实性,即诱导判别网络将其误判为真实样本。具体公式如下:

LG=-ExpgDx,s 

式中,x为生成的图像,pg为生成数据分布,s为图像的文本描述,D()为判别网络。

判别网络将文本和图像拼接到一起进行一次判别,其判别主要涉及真实的图像和匹配的文本、生成的图像和匹配的文本、真实的图像和不匹配的文本等三个方面。同时使用匹配感知梯度惩罚(Matching-Aware Gradient Penalty, MA-GP)[6]来增强生成图像和文本的语义一致性。判别网络的损失函数为:

LD=-Ex^pdmin 0,-1+Dx^,s-12ExPgmin 0,-1-Dx,s-12Ex^pdmin 0,-1-Dx^,s^+kEx^pd[(x^D(x^,s)+sD(x^,s))P]

式中,x^为真实的图像,pd为真实数据分布,x为生成的图像,pg为生成的数据分布,s为图像的文本描述,s^为图像不匹配的文本描述,kp为平衡系数。

3 实验设计与结果分析

3.1 数据集

本文选用公开的CUB[23]数据集,并通过机器翻译结合人工校对方式对文本内容进行了藏文翻译得到了CUB-BO。CUB-BO数据集包含200种不同鸟类的图像,共计11 788对文本图像。每张图像都附有10句详细的文本描述,这些文本针对鸟类的大小和各个部位的颜色进行描述。数据集被划分为训练集和测试集,其中训练集包含8 855张图像,测试集包含2 933张图像。数据集中的部分内容展示如表2所示。

3.2 实验设置

本文使用Adam[24]作为优化器,优化参数β1=0.0β2=0.9。生成网络的学习率为0.0001,判别网络的学习率为0.0004,批量大小为24,训练轮次为1 300轮。

3.3 评价指标

本文采用了两个广泛认可的评价指标,即初始分数(Inception Score, IS) 和 Fréchet初始距离(Fréchet Inception Distance, FID)来量化实验结果。IS计算并生成图像预测标签的边缘分布和条件分布之间的KL散度(Kullback-Leibler Divergence, KL),该标签是基于预训练的Inception网络[22]对生成图像进行分类得到的。一个高的IS值表明生成的图像具有高质量和良好的多样性,IS的计算公式如下:

IS=exp ExpgDKLpy|x||py

式中,x为生成的图像,pg为所生成的数据分布,y为图像的标签,py为边缘分布,py|x为条件分布。

FID是一个衡量所生成的图像与真实图像之间相似度的指标。它通过计算真实图像和生成图像在特征空间中的距离来进行评估。FID基于预训练的Inception网络对生成的图像和真实图像提取特征,并计算两组图像特征的均值和协方差矩阵之间的差异。FID值越低,表明生成的图像与真实图像在特征空间的统计特性(如均值和协方差)上越接近,生成图像的质量越高。FID的计算公式如下:

FID=μx-μx^2+TrΣx+Σx^-2ΣxΣx^12 

式中, μx为生成图像的特征均值,μx^为真实图像的特征均值,Tr为矩阵的迹,Σx Σx^为生成图像和真实图像特征的协方差。

3.4 实验结果

本文采用两种藏文预处理策略来处理文本,为了探究不同预处理策略对所生成的图像质量影响,以及为验证引入Transformer作为文本编码器的有效性共设计了4组实验,分别为“BiLSTM-Syllable”“BiLSTM-Subword”“Transformer-Syllable”“Transformer-Subword”。4组实验的FIDIS值如表3所示。

3.4.1 文本编码器对比

表3可知,采用音节切分时FID值均低于子词切分,表明音节切分生成的图像与真实图像更相近。然而,在“BiLSTM-Syllable”与“BiLSTM -Subword”的对比实验中发现,后者的IS值和FID值均高于前者,这说明使用BiLSTM作为文本编码器时采用子词切分处理文本生成的图像质量高于采用音节切分处理文本的方法,但在语义准确性上低于采用音节切分处理文本的方法。出现这种现象的原因可能是测试集中存在未在训练集中出现的新词(未登录词)。实验结果还表明,采用“Transformer-Syllable”方法在图像生成任务中能更好地保持语义一致性并生成高质量的图像。这主要得益于两方面的优势:一方面音节切分减少了未登录词出现的可能性;另一方面Transformer架构的自注意力机制能够更有效地捕捉长距离依赖关系,从而在生成图像时更准确地反映文本的深层语义信息。此外,本文还将所提出的方法与其他语言文本生成图像模型在CUB数据集上的结果进行了比较,结果如表4所示。

表4中的CUB数据集文本描述为英文,CUB-BO数据集文本描述为藏文,但ISFID均在图像层面进行比较,因此具有一定的参考意义。表中数据可知,TT-GAN与基线DF-GAN模型相比IS值提高了9.20%,FID值降低了2.56%。TT-GAN取得的ISFID结果均优于其他主流模型。

3.4.2 子词切分和音节切分对比

为了更好地分析不同藏文预处理策略对生成图像质量的影响,本文使用“Transformer-Syllable”和“Transformer-Subword”两种方法生成了100张图像进行人工评价,生成的部分图像示例如图4所示。

通过对比图4中的图像,可以明显观察到,采用子词切分方法生成的图像在细节表现上存在一定的不足,例如鸟的嘴部和爪子的清晰度相较于音节切分方法生成的图像有所降低。使用音节切分方法生成的图像在语义上更符合文本。在例句“བྱ་འདི་ནི་རྫ་མདོག་ཡིན་ལ་སེར་མདོག་གི་ཁྲ་ཐིག་ཡོད།མཆུ་ཏོ་ཧ་ཅང་ཐུང་།”(这只鸟是棕色的,有黄色的斑点,嘴很短。)中,文本描述了这只鸟具有黄色斑点的特征,使用音节切分方法生成的图像准确地反映出这些细节,呈现出黄色斑点,然而采用子词切分方法的图像则未能保留这些关键信息,导致生成的图像在语义上与原文本有所偏差。进一步分析发现,造成这种现象的原因是子词切分将描述黄色斑点的语句切分得过细,使得一些重要的语义信息被分散或丢失(图5)。

结 语

本文在DF-GAN模型的基础上,引入Transformer架构作为文本编码器,提出了一种针对藏文的文本生成图像模型TT-GAN。为了验证其有效性,在自建的CUB-BO数据集上对比分析了音节切分和子词切分两种不同的文本预处理策略对生成图像的影响。实验结果表明,采用音节切分方法生成的图像在质量和语义一致性上表现更为出色。此外,还将TT-GAN与其他主流模型进行对比,结果也表明其在藏文文本生成图像任务中展现了更优的性能。由于所使用的数据集规模较小,在未来研究中将扩大数据集规模,并尝试使用更优秀的方法如自回归模型和扩散模型,以进一步优化藏文生成图像方法。

参考文献

[1]

Goodfellow I, Pouget-Abadie J, Mirza M, et al. Generative adversarial networks[J]. Communications of the ACM, 2020, 63(11): 139-144

[2]

Reed S, Akata Z, Yan X, et al. Generative adversarial text to image synthesis[C]. International Conference on Machine Learning. PMLR, 2016: 1060-1069.

[3]

Zhang H, Xu T, Li H, et al. Stackgan: Text to photo-realistic image synthesis with stacked generative adversarial networks[C]. Proceedings of the IEEE International Conference on Computer Vision, 2017: 5907-5915.

[4]

Zhang H, Xu T, Li H, et al. Stackgan++: Realistic image synthesis with stacked generative adversarial networks[J]. 2018 IEEE Transactions on Pattern Analysis and Machine Intelligence, 2018, 41(8): 1947-1962.

[5]

Xu T, Zhang P, Huang Q, et al. Attngan: Fine-grained text to image generation with attentional generative adversarial networks[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018: 1316-1324.

[6]

Tao M, Tang H, Wu F, et al. Df-gan: A simple and effective baseline for text-to-image synthesis[C]. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022: 16515-16525.

[7]

Ye S, Wang H, Tan M, et al. Recurrent affine transformation for text-to-image synthesis[J]. IEEE Transactions on Multimedia, 2023, 26(000): 462-473.

[8]

Medsker L R, Jain L. Recurrent neural networks[J]. Design and Applications, 2001, 5(64-67): 2.

[9]

Vaswani A. Attention is all you need[J]. Advances in Neural Information Processing Systems, 2017, 30: 5998-6008.

[10]

Schuster M, Paliwal K K. Bidirectional recurrent neural networks[J]. IEEE Transactions on Signal Processing, 1997, 45(11): 2673-2681.

[11]

Salimans T, Goodfellow I, Zaremba W, et al. Improved techniques for training GANs[C]. Proceedings of the 30th International Conference on Neural Information Processing Systems. Barcelona: Curran Associates Inc, 2016: 2234-2242.

[12]

Heusel M, Ramsauer H, Unterthiner T, et al. GANs trained by a two time-scale update rule converge to a local nash equilibrium[C]. Proceedings of the 31st International Conference on Neural Information Processing Systems. Long Beach: Curran Associates Inc, 2017: 6629-6640.

[13]

华却才让,白颖,周子琦,. 基于藏文音节的图像标题自动生成方法研究 [J].高原科学研究, 2024, 8 (3): 102-109.

[14]

才让当知,华却才让,却措卓玛,.基于混合模式的藏文音节切分[J].内蒙古师范大学学报(自然科学版),2019,48(5):406-412.

[15]

Radford A, Wu J, Child R, et al. Language models are unsupervised multitask learners[J]. OpenAI Blog, 2019, 1(8): 9.

[16]

Devlin J, Chang M W, Lee K, et al. Bert: Pre-training of deep bidirectional transformers for language understanding[C]. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), 2019: 4171-4186.

[17]

Sennrich R, Haddow B, Birch A. Neural machine translation of rare words with subword units[C]. Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2016: 1715-1725.

[18]

杨毛加,柔特,才智杰,.基于参数高效微调的藏文大模型研究[J].中文信息学报,2024,38(12):106-115.

[19]

Yang Z, Xu Z, Cui Y, et al. CINO: A Chinese minority pre-trained language model[C]. Proceedings of the 29th International Conference on Computational Linguistics. Gyeongju, Republic of Korea: International Committee on Computational Linguistics, 2022: 3937-3949.

[20]

贾星星,陆玉,杨龙飞,.T-Transformer-XL和T-XLNet:两个藏语预训练模型[J].西安邮电大学学报,2024,29(4):93-99.

[21]

Kudo T, Richardson J. SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing[C]. Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing: System Demonstrations,2018: 66-71.

[22]

Szegedy C, Vanhoucke V, Ioffe S, et al. Rethinking the inception architecture for computer vision[C]. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016: 2818-2826.

[23]

WAH C, BRANSON S, WELINDER P, et al. The Caltech-UCSD Birds-200-2011 dataset[EB/OL].(2022-08-12)[202405-26].

[24]

Kingma D P, Ba J. Adam: a method for stochastic optimization[EB/OL].(2014-12-22)[2023-03-18].

[25]

Liao W, Hu K, Yang M Y, et al. Text to image generation with semantic-spatial aware gan[C]. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2022:18187-18196.

基金资助

国家自然科学基金项目(62166034)

藏语智能信息处理及应用国家重点实验室项目(2020-ZJ-Y05)

AI Summary AI Mindmap
PDF (1042KB)

12

访问

0

被引

详细

导航
相关文章

AI思维导图

/