基于文本引导的轻量异构编码多模态图像融合

王传云, 周明奇, 孙冬冬, 王田, 高骞, 李照奎

工程科学学报 ›› 2026, Vol. 48 ›› Issue (2) : 346 -359.

工程科学学报 ›› 2026, Vol. 48 ›› Issue (2) : 346 -359. DOI: 10.13374/j.issn2095-9389.2025.06.17.002

基于文本引导的轻量异构编码多模态图像融合

    王传云, 周明奇, 孙冬冬, 王田, 高骞, 李照奎
作者信息 +

Author information +
文章历史 +

摘要

针对资源受限的无人机平台对红外与可见光图像的融合效率与感知性能需求,本文提出一种基于文本引导的轻量异构编码多模态图像融合网络.该网络设计了一种面向红外与可见光图像信息表达功能互补的轻量化双分支异构编码,红外图像编码分支强调热目标与边缘响应,可见光图像编码分支侧重于纹理与细节信息建模,从而有效避免同构编码器带来的特征冗余与性能瓶颈.同时,引入轻量级跨模态特征融合模块,增强多模信息之间的互补性与融合表达能力.进一步,通过预训练视觉语言模型结合语义文本特征对融合过程进行引导与调控,提升融合图像的语义一致性与环境适应性.在三个公开多模态图像数据集TNO、LLVIP与M3FD上,本文方法与九种代表性图像融合算法进行了系统对比实验与综合评估,结果显示本文网络在互信息、结构相似性等多个主流评价指标上均表现优越,融合图像在细节清晰度、边缘结构一致性与目标可辨性方面优于现有方法.同时,消融实验表明所提出模型的推理时间相较基线方法减少约50%,且在不显著牺牲性能的前提下实现了更高的效率.除定量评估外,本文还开展了基于文本指令的定性实验,结果显示模型可根据不同语义指令灵活调整红外与可见光特征融合策略,适应低光、过曝、低对比、噪声等多种任务场景.在保证语义一致性的同时,有效增强了热源感知、结构清晰度与抗干扰能力,展现出传统无引导方法难以实现的语义可控性与内容适应性.

关键词

多模态图像融合 / 双分支异构编码 / 文本引导 / 轻量化网络 / 注意力机制

Key words

引用本文

引用格式 ▾
王传云, 周明奇, 孙冬冬, 王田, 高骞, 李照奎. 基于文本引导的轻量异构编码多模态图像融合[J]. 工程科学学报, 2026, 48(2): 346-359 DOI:10.13374/j.issn2095-9389.2025.06.17.002

登录浏览全文

4963

注册一个新账户 忘记密码

参考文献

基金资助

国家自然科学基金资助项目(61703287,92467108); 辽宁省自然科学基金资助项目(2024-MS-137); 北京市科技新星计划资助项目(20220484106,20230484451); 辽宁省应用基础研究资助项目(2023JH2/101300204)

AI Summary AI Mindmap

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/