融合扩散文本的图像描述算法

刘仲民, 王学臻, 胡文瑾

兰州大学学报(自然科学版) ›› 2025, Vol. 61 ›› Issue (1) : 8 -16.

兰州大学学报(自然科学版) ›› 2025, Vol. 61 ›› Issue (1) : 8 -16. DOI: 10.13885/j.issn.0455-2059.2025.01.002

融合扩散文本的图像描述算法

    刘仲民, 王学臻, 胡文瑾
作者信息 +

Author information +
文章历史 +

摘要

针对图像描述任务中特征信息利用不充分、背景信息易被忽略、生成语句的可控性存在欠缺等问题,使用特征融合模块和基于Transformer编/解码器的文本解码增强网络,提出一种融合扩散文本的图像描述算法.输入图像由Vision Transformer骨干网络提取细粒度信息,并在解码器中将原始的BERT网络结构替换为新型的DeBERTa网络结构,提升了Transformer模型的解码效果.文本扩散方法对图像描述语句的生成过程进行监督,减少描述语句的无序化.用强化学习方式对模型进行微调,优化最终描述语句生成结果.将提出算法在MS-COCO数据集中进行定量评估和线上对比测试.结果表明,模型在BLEU-1、 BLEU-4、 METEOR、 ROUGE-L、 CIDEr、 SPICE数据集上的性能分别提高2.1%、3.1%、 1.7%、 2%、 3.2%、 2.6%,且模型的微调过程更加稳定,对图像的语义表述更加准确有序.

关键词

图像描述 / 特征融合 / Transformer模型 / 扩散模型 / 强化学习

Key words

引用本文

引用格式 ▾
刘仲民, 王学臻, 胡文瑾. 融合扩散文本的图像描述算法[J]. 兰州大学学报(自然科学版), 2025, 61(1): 8-16 DOI:10.13885/j.issn.0455-2059.2025.01.002

登录浏览全文

4963

注册一个新账户 忘记密码

参考文献

基金资助

国家自然科学基金项目(62061042); 甘肃省工业过程先进控制重点实验室开发基金项目(2022KX10)

AI Summary AI Mindmap

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/