胸部X光片是临床最常用的影像检查之一。医生在解读时,往往需要从大面积的正常区域中捕捉到细小而复杂的异常特征,这些局部特征对于识别潜在的胸腔异常至关重要
[1],但学习如何辨别这些局部特征对神经网络来说是一项挑战。近年来,掩码图像建模(MIM)方法
[2, 3]在局部表征学习上显示出很大潜力,它通过重建被遮盖的图像区域来学习医学图像的语义。然而,把MIM直接应用在医学影像上仍存在明显不足。
首先,现有MIM大多采用随机掩码,这在自然图像上可能无碍,但在胸片中却容易掩盖掉关键病灶,破坏临床相关特征。其次,胸片中的病灶大小差异很大,从弥漫性阴影到局部结节不一而足
[4, 5],而现有方法缺乏多尺度的监督机制,难以同时覆盖这些不同层次的异常。结果就是,其设计未能充分考虑临床视觉先验,因而限制了其在医学影像中的适用性,模型虽然学到了一些语义表示,但对诊断最重要的信息往往捕捉不够。
为弥补上述不足,本研究提出了一种新的方法——视觉先验引导的掩码图像重建框架 (VP-MIM), 将临床视觉先验引入MIM框架中以适配胸部X光片分析。本研究将临床视觉先验定义为影像特征的语义、位置、大小与形状4个属性,并期望MIM在图像建模过程中能够感知并利用这些属性。本方法核心在于结合专家放射科医生的眼动数据以及多尺度重建策略。具体来说,VP-MIM设计了一种注意力引导的掩码策略:对临床重要区域和非重要区域进行差异化处理,优先对不重要区域进行掩码,而保留关键诊断特征。同时,针对胸腔异常大小差异带来的挑战,本研究提出了语义感知的多尺度模块——金字塔注意力重建模块,实现跨尺度的有效监督。该模块结合眼动注意力,动态调整模型的关注点,使其更好地契合图像中病灶的颗粒度与尺度。上述两个模块协同作用,有效提升了语义建模与特征学习能力。
1 资料和方法
本节介绍VP-MIM,这是一种具备语义感知和多尺度敏感能力的新型MIM方法。本研究将详细说明其两个主要部分:注意力控制的掩码策略(第1.3节)和金字塔注意力重建模块(第1.4节)。
1.1 眼动追踪数据
眼动数据是一种语义丰富的认知信号,与目标框和分割蒙版等其他标注方式相比,放射科医生的眼动数据更容易采集,也更具可解释性
[6],因此越来越多的研究
[7]尝试将其用于表达医学图像上特定区域的语义信息。早期的一项研究
[8]提出了一个直接的思路:他们开发了一种多任务方法,可以同时进行胸片诊断和眼动热力图预测。类似地,Wang等
[6]将注视热力图作为膝关节X光分类的辅助监督,引导网络更关注人类长时间注视的区域。除了作为监督信号外,还有研究探索了将眼动数据作为网络输入的可能性。Alsharid等
[9]为超声视频训练了一个注视预测器,并将其融入图像描述模型,从而提升了描述的准确性。此外,还有研究把眼动数据视为一种有价值的指导信息。Zhao等
[10]利用眼动数据构建医学对比学习中的正样本对,而Kong等
[11]则用其来减少误报,从而改进检测性能。
图1基于REFLACX数据集
[12]分别从定性和定量的角度展示了病变和非病变区域的眼动密度。说明眼动注意力能够作为临床重要区域的语义指示器,并且在不同尺度下都表现出了与病灶区域高度一致的分布特性。综合来看,这些研究表明放射科医生的眼动数据是极具潜力的语义指示器。
1.2 总体框架
VP-MIM遵循典型的MIM流程:掩码、编码和重建,在掩码和重建阶段进行了改进(
图2)。
给定一批胸片
,其中
,VP-MIM旨在使视觉模型
[13]学习到高质量且医学影像特有的表征。本研究利用放射科医生的眼动数据作为有效的语义指引,并引入对应的眼动热力图
,其中
与
尺寸一致。
由于MIM在单个样本上进行操作(不涉及样本间交互),为了简化说明,本研究记单幅输入图像为
,其眼动热力图为
。VP-MIM首先通过医生的视觉注意力数据控制的掩码的生成,在减少冗余的同时保留关键临床特征;得到的掩码图像
输入到视觉骨干网络ViT模型(默认为ViT-B/16)中。在每一层
产生特征向量
。其中p是图像块的数量(例如大小为224×224的图像在ViT-B/16中会被预处理为一组14×14的图像块),额外的 +1是由于ViT中一个预定义的全局特征向量
[13]。
基于实验(2.1节),本研究选择
用于重建,覆盖从低层到高层的不同表征。金字塔注意力重建模块在预设尺度下解码方向梯度直方图特征(HOG)
[14]。HOG能够有效捕捉医学图像中的边缘与纹理信息
[15-17]。同时,本研究利用重新校准的眼动热力图对每个被掩码图像块的重建损失进行加权,使模型在训练中更关注临床显著区域,从而提升诊断准确性。
1.3 注意力控制掩码
传统MIM方法一般随机掩码图像块,这一过程实际上等价于从均匀分布采样。相比之下,本研究的注意力控制掩码方法先进行重要性判别,区分“临床重要区域”和“非重要区域”,而后采用双峰控制采样
[18,19]来获得掩码数量。
重要性判别:本研究根据热力图
来识别临床显著区域。采用OTSU阈值法
[20]将热力图分为前景(重要区域)和背景(非重要区域),得到二值掩码
。接着,把图像划分为
个不重叠图像块,若某个图像块中超过50%的像素属于前景,就将其标记为显著图像块
:
其中 为每个图像块的像素数。于是可得重要图像块的总数为,非重要图像块的总数为。
双峰控制采样:本研究的掩码策略设定两个比例:全局掩码率 (总掩码比例,得到 个被掩码的图像块),以及临床掩码率(针对重要图像块的掩码比例,得到 个在训练时不可见的重要图像块)。于是非重要区域的掩码数量为
最终,本研究从临床重要区域随机选取 个图像块,从非重要区域随机选取 个图像块形成掩码 ,掩码图像为:
其中表示逐元素相乘, 表示将图像划分为不重叠图像块的操作。
1.4 金字塔注意力重建
在重建阶段,VP-MIM采用金字塔注意力重建策略,以有效捕捉并重建多尺度HOG特征。
金字塔策略:与直接像素重建相比,本研究选择HOG特征,因为它能更好地捕捉局部纹理并减少医学影像中的冗余
[17]。如
图2(2)所示,选定的ViT层嵌入
分别输入到不同尺度的自适应重建模块
,其中
为缩放系数。每个AttnRecon模块由一个轻量Transformer层、一个缩放层和一个MLP组成,缩放层根据
进行上采样(转置卷积)或下采样(平均池化)。浅层特征往往保留更多低级纹理信息,因此对应更大的
,而高层特征更抽象,则缩小为
以增强高层语义学习能力。这种缩放方式不仅可以提升跨层特征提取能力,也有利于降低过拟合。
自适应重建:经过MLP后,嵌入被转化为输出特征,形状为 ,其中 是HOG描述子的超参数。这样就能在多尺度下重建HOG特征,使模型对不同大小的纹理更敏感。
为了在重建和掩码阶段保持一致性并增强语义感知,本研究在损失函数中引入眼动热力图 。具体做法是,将 与掩码 相乘并做平均池化操作:
得到,再转变为形状的向量。为了减少眼动数据噪声,本研究在损失计算前对其进行重新校准:
其中为温度系数,表示每个图像块的注意力权重。这样可以强化模型对显著区域的关注,并抑制噪声干扰。
最终,模块的重建损失定义为预测与目标HOG特征之间的加权平方误差:
其中和分别表示预测的HOG特征与真实的HOG特征。总的重建损失为
通过这种金字塔注意力重建策略,VP-MIM能够有效捕捉多尺度纹理特征,并突出临床显著区域,从而显著提升表征学习的质量。
1.5 数据集与实现细节
作为一种预训练方法,VP-MIM在预训练数据集上进行训练,并在下游数据集上进行评估。借鉴已有研究
[3, 10],本研究首先通过线性评估实验设置来比较不同MIM方法的预训练质量,随后在全量微调的实验设置下衡量VP-MIM在多标签疾病诊断任务中的性能。
预训练数据集:本研究采用两个预训练数据集:REFLACX
[12]与MIMIC-CXR
[21]。其中,REFLACX包含2616张胸部X光片,包含 5 位放射科医生的3032 次对胸部X光片的眼动追踪记录,即一张X光片可能会被多个医生检查过,本工作目前将同一张X光片上的多个眼动热力图做取平均处理。数据使用 EyeLink 1000 Plus设备采集,采样率为 1000 Hz,该数据集在受控阅片环境下进行,并获得 MIT COUHES (protocol number: 1810643434) 的伦理批准及参与者知情同意。本数据集主要用于第2.1节以及第2.2节。相比之下,MIMIC-CXR是一个包含377,100张胸部X光片的大规模数据集,因此被用于第2.3节,以验证VP-MIM在数据规模扩充时的表现。
下游数据集:本研究在两个下游数据集上评估预训练质量,包括RSNA Pneumonia(RSNA)
[22]、NIH Chest X-ray 14(CXR-14)
[23]。RSNA Pneumonia包含约29,700张正位胸片,标注了肺炎的存在情况。本研究将其随机划分为训练集、验证集和测试集,
比例为70%:15%:15%。该数据集为二分类任务;而CXR-14则是更具挑战性的多标签分类任务。其中包含112,120张胸片,涵盖14种胸部疾病,数据划分比例为70%:10%:20%。
实现细节:所有预训练实验均在单卡NVIDIA Tesla V100S(32GB显存)上完成,批量大小设为128,学习率 (learning rate, ) 设为3×10-3。在REFLACX数据集上训练400个epoch,而在MIMIC-CXR数据集上仅训练100个epoch,以平衡大规模数据带来的计算开销。下游的线性评估和全量微调实验在单卡NVIDIA RTX 4090 GPU上进行,批量大小为32, 设置为1×10-3,训练50个epoch。全局掩码率 与临床掩码率 在所有预训练实验中分别固定为0.75与0.5。金字塔注意力重建模块中的温度系数 设为0.1。除特别说明外,本研究默认采用ViT-B/16作为视觉骨干。所有下游评估实验均重复3次,并报告其均值及标准差。
2 结果
在本节中,本研究首先将VP-MIM与多种现有的MIM方法进行比较以验证其性能优越性。接着,本研究通过全面的消融实验验证模(型设计的合理性,并初步探索胸部X光片的合适掩码策略。最后,本研究通过全量微调实验进一步研究VP-MIM在大规模数据集上的扩展潜力及在实际场景中的扩展性。
2.1 与现有方法的对比
表1 给出了VP-MIM在两个下游数据集上的定量性能比较。对比方法同时包括非语义感知和语义感知的MIM模型,以保证全面性。具体而言,非语义感知方法在掩码阶段不区分图像块的重要性,采用随机或均匀的掩码策略,不考虑图像内容的语义权重;相对地,语义感知方法则在掩码过程中引入语义或先验信息,通过关注结构或语义上更重要的区域来提升模型的特征学习效果。本研究还在不同规模(1%、10%和100%)的下游训练数据上进行了评估,以进一步验证MIM方法在小样本情境下的有效性。需要指出的是,Xue等
[24]同时提出了MaskAlign及其语义感知版本Attentive MaskAlign(AttnMA),因此可以作为良好的对照组。主要发现总结如下:
整体性能优于其他方法: VP-MIM在所有数据集上均取得了当前最优的性能,优于语义感知与非语义感知的方法。在仅涉及单一疾病的RSNA数据集上,优势相对较小;但在涉及多疾病的CXR-14上,优势更加显著。具体来说,在将100%的RSNA数据集作为训练数据的条件下,VP-MIM的AUC达到86.83(0.01),而性能最低的MAE为84.64(0.01)。在CXR-14上,VP-MIM的表现也有明显提升,mAUC从68.33(0.34)提高到72.82(0.02)。这一结果与同样强调多尺度特征的DeepMIM
[25]方法的观察一致,进一步表明在胸片的掩码建模中,多尺度策略是必要的。
可学习注意力的局限性: 当前许多研究倾向于采用可学习的Grad-CAM
[29]或自注意力图来反映图像语义,而不是像本研究这样直接使用放射科医生的视觉注视数据。这些研究所提出的方法一般被称为语义感知的方法。然而,这类方法在胸片任务中并不总是有效。与自然图像不同,胸片诊断更依赖放射科医生的专业知识和经验,而非简单依靠像素值的显著性。在
表1 中,AttnMA基于ViT自注意力图进行掩码,但可以发现,在RSNA和CXR-14数据集上AttnMA的表现反而更差。此外,对比语义感知与非语义感知方法,可以发现MaskFeat
[26]与dMAE
[27]这两种代表性的非语义感知方法优于HPM
[28]这一语义感知的MIM方法。这说明,要在胸片上有效利用语义感知信息,需要专门设计针对医学影像特点的策略,而非完全以数据驱动的形式让网络自主学习注意力。
2.2 消融实验
该部分实验在与2.1相同的数据集REFLACX上进行预训练,仅修改所要控制的变量与超参数, 学习率、迭代次数等实验细节与1.5节中的设定保持一致。
金字塔结构配置的消融实验:
图3展示了金字塔注意力重建在缩放系数设置上的影响。具体来说,在
图3 中,本研究固定特征层为 {2,4,10,12},调整其对应缩放系数
。结果表明,对浅层特征进行上采样的预处理操作能充分利用其丰富信息,性能得到提升;同时将最后一层特征下采样至
也带来小幅改进,说明此操作有助于提升高层语义表征,进而有利于下游分类任务。在
图4中,本研究固定缩放因子为{4,2,1,0.5},初始时仅使用最后一层特
征 {12,12,12,12},然后逐步引入浅层与深层特征。当加入第8层时性能显著下降,推测这与神经网络的“脆弱共适应”
[30]现象有关,即神经网络有时需要连续多层而非某一特定层的神经元来共同协作学习一种特征,未来将进一步探讨。
关键模块的消融实验:
表2 展示了VP-MIM各个模块对整体性能的贡献。第一行在MAE中引入注意力控制掩码,使得其在CXR-14上的mAUC提升为68.97(0.16)。将像素替换为HOG特征并引入金字塔重建策略后,性能显著提升。进一步结合自适应重建后,性能再次小幅提高,最终在CXR-14上分别达到72.82(0.02)。这些结果验证了各个模块在整体性能中的作用。
图5展示了预训练后 ViT-B/16 的自注意力可视化结果,用以评估不同模块对表征学习质量的影响。从图中可以看出,仅引入眼动信息时,模型的注意力仍较为分散,未能充分聚焦于关键的解剖区域。而当逐步加入由 HOG、Pyramid 与 Attentive 三部分组成的金字塔注意力重建模块后,模型的注意力显著集中于胸部X光片中的肺部与心脏区域,能够学习到更清晰的结构轮廓。这一结果说明,多尺度自适应策略在医学影像掩码预训练中对于提升模型的语义感知能力和结构表征质量具有重要作用。
临床掩码率的消融实验:本研究在保持全局掩码率
不变的情况下,评估不同临床掩码比例
对框架性能的影响(
图6)。方法的性能随
从10%到90%的变化呈现显著差异。结果表明,当
时,VP-MIM可达到最佳性能。若
超过0.5,性能显著下降;而
低于0.5时,虽然性能也发生了退化,但其下降趋势更为平缓。这一发现凸显了在胸片MIM学习中合理保留临床区域的重要性。
2.3 跨中心的数据规模扩展实验
本节评估VP-MIM的可扩展性,并与传统MIM方法MAE进行对比。本研究从MIMIC-CXR数据集中随机选取部分样本上对VP-MIM进行预训练,并不断提高样本的数量,全量微调的评估结果(
图7)。由于MIMIC-CXR缺乏放射科医生眼动数据,该部分实验在REFLACX数据集上训练来一个眼动预测网络。该预测网络采用U-Net作为主体架构,对于输入的任意胸部X光片都可预测其对应的眼动热力图。这一眼动预测网络使得VP-MIM得以在大规模数据的胸部X光上进行预训练,而无需进行大规模眼动数据采集。
实验结果显示,VP-MIM在所有数据量下均优于MAE,且随着数据量增加,两者性能差距进一步拉大。这表明VP-MIM在大规模数据上具有更强的扩展能力。值得注意的是,引入伪眼动数据不仅提升了性能,还证明了VP-MIM在仅有少量眼动标注时,依然能够有效适配更大规模的数据。这种特性凸显了VP-MIM在基础模型时代作为一种预训练方法的潜力。
3 讨论
本研究提出的VP-MIM,一种专为胸部X光片设计的创新性MIM方法,融合临床视觉先验,包含注意力引导的掩码与金字塔注意力重建两大模块;通过注意力引导的掩码策略,探索在胸片分析中如何合理实施掩码,即临床显著区域应在保留关键信息和避免过度暴露之间取得平衡;在多个公开数据集上验证了方法的有效性,结果表明VP-MIM不仅能有效提升胸片诊断性能,还具有良好的扩展性和临床应用潜力。本研究在保留关键诊断特征的同时,有效捕捉多尺度的临床显著区域。该设计弥补了传统 MIM 在语义感知与多尺度建模方面的不足,同时揭示了临床先验知识在自监督学习中的普适价值。
从实验结果来看,VP-MIM在多个下游数据集上均取得了领先于现有方法
[24,28]的性能。在仅有有限下游训练样本的情况下,VP-MIM依然表现出稳定的优势,说明其学到的表征更符合临床语义规律。跨中心的规模扩展实验也有效说明了本方法所利用的医生视觉先验具有在不同数据中心和不同数据来源间的可迁移性与泛化能力。上述结果为后续在临床先验建模和自监督学习结合方向上的研究提供了有益参考。在推理部署方面,由于本研究提出的VP-MIM是一种预训练策略,并未改变模型的结构与推理流程,因此其计算效率与硬件需求与标准ViT-B/16模型一致。ViT-B/16采用16×16像素的图像块分割、224×224的输入分辨率,在NVIDIA RTX 3090等主流GPU上推理时,每张影像的平均耗时仅约12-15 毫秒,计算需求与同规模的卷积神经网络模型相当。因此,本研究的预训练策略不会在临床部署中带来额外的计算负担或硬件限制。围绕利用眼动来引导AI模型这一话题,近年的综述与工作给出了与本文相佐证的结果。一方面,放射学领域的眼动AI综述
[7, 31]指出:眼动数据既能提升样本效率,又能改善可解释性,在标注稀缺时尤其有价值;这与本研究在低比例下游数据时仍能保持优势的结果相吻合。另一方面,面向胸片的眼动有监督方法(如WACV 2024 的 GazeGNN
[32])与的眼动引导ViT
[33, 34]在实证上均显示:引入专家眼动可降低误检并改善病变可定位性,提示在训练信号层面保留临床关键区域具有普适意义。本研究的掩码对比实验表明
这一类中等强度的“保留—遮蔽”更稳健,亦与这些工作强调的“不过度掩盖关键区域”结论方向一致。
关于以人类眼动替代/补充可学习注意力的必要性与局限边界。多篇近期研究
[35, 36]指出,直接用自注意力图或 Grad-CAM 近似“语义显著性”在医学影像上并不总是可靠,尤其对小体积、低对比病灶易失灵;这些工作系统地分析了感受野、梯度稳定性等对 Grad-CAM 解释质量的影响,并在跨模态评测中提示其不稳定性。在本研究的对比实验中,基于可学习自注意力的掩码在RSNA、NIH-CXR14上未能稳定优于语义无关掩码,这与上述分析一致:模型高响应区域并非等同于临床显著区域,胸片等弱对比影像更依赖专家先验来校准训练信号。在多尺度与层级监督方面,本研究的金字塔注意力重建与“浅层上采样、末层适度下采样”的设置,与近期对MIM“深层监督/多尺度”路线的结论是相容的。近期 MIM 研究已经提出了多种新的探索。Xiang等
[37]在 AAAI 2025 提出的 Wavelet-Driven MIM 将小波分解的频域与空间域信息引入重建目标,展示了多尺度监督不仅可以在空间上展开,也能通过频率域实现层次化。在医学影像任务中,Liu等
[38]的研究则通过边界重建来强调结构感知,体现出边界层级也是一种有意义的尺度信号。这些工作共同表明,多尺度监督设计正在成为 MIM 的重要发展方向。本研究提出的金字塔注意力重建模块(不同层对应不同尺度 HOG 重建,并结合注视加权)可以被视为这一趋势在胸片任务中的特化实现。未来如果能进一步引入频域信号、边界感知目标以及可学习的层尺度调度机制,VP-MIM 在表征质量和临床应用价值上有望取得更大提升。在可扩展性与伪眼动数据方面,本研究在缺乏大规模真实眼动标注的MIMIC-CXR上,采用基于REFLACX训练的预测模型生成伪眼动热力图作为替代信号。实验结果显示,随着预训练数据量增加,VP-MIM与传统MAE的性能差距显著扩大,提示“轻量眼动先验&大规模无标注影像”的组合路径是可行的。这一发现与Lanfredi等
[12]构建的带有眼动与报告的胸片数据库相呼应,这类资源为眼动先验在更大规模任务中的迁移提供了坚实基础。同时,Sultana等
[39]则进一步探索了将眼动数据与放射科医生报告联合引入视觉-语言模型,在多模态层面增强对胸片表征的学习。这些证据共同表明,即便眼动数据有限,也可以通过伪眼动或与其他模态结合的方式,在大规模训练中持续提供增益。
然而,本研究也注意到伪眼动的局限性。Pershin等
[40]指出,医生在不同病灶上的注视模式存在显著差异;因此,若伪眼动模型训练数据缺乏多样病种覆盖,可能会在特定异常类别上引入系统性偏差。此外,跨中心的预训练也需要考虑域移问题。Cho等
[41]提出的CheSS模型表明,基于自监督对比学习的胸片预训练在跨数据集时具备一定泛化性,而Shurrab等
[42]则展示了通过结合EHR等多模态信息,可以进一步改善跨域表示。这提示未来在利用伪眼动扩展时,需要同步引入域自适应和多模态增强策略,以降低跨机构、跨人群训练时的偏差与噪声影响。
未来研究可以从以下方向展开:其一,探索融合更多类型的临床先验信息,例如电子病历、检查指征及其他多模态临床数据,以丰富模型的语义基础
[42];其二,发展更加灵活的动态掩码策略,可学习的更加有自适应性的掩码策略可以提升模型在不同任务和疾病类型下的适应性
[43];其三,在跨中心和跨设备的数据上进一步验证模型稳定性,结合领域自适应方法提升泛化能力。在多模态医学数据融合方面,Yang等
[44]通过对影像与基因组学特征间的关系进行掩码与恢复,实现了跨模态语义关系的自监督学习。Dai等
[45]则在 SaSaMIM中引入解剖语义感知掩码,在非增强腹部CT中实现了基于合成语义指导的肿瘤分割。这些研究共同体现了医学影像MIM从“随机遮挡”向“结构化、任务导向、跨模态学习”的演进趋势。在掩码策略方面,研究者开始从随机掩码转向语义驱动与动态掩码机制,以提升模型对关键区域的关注度。Xie等
[46]提出利用放射报告中的语义信息指导掩码生成,通过“知识驱动掩码”与“句子驱动掩码”策略,使模型在训练过程中能够重点学习与病灶相关的区域。此外,Wang等
[47]提出将掩码建模扩展到频域,利用低频与高频特征的互补性提升了医学影像分割任务中的全局与局部特征表征。Xing等
[48]进一步针对3D医学影像提出区域级与patch级的混合掩码机制,显著提高了三维影像的预训练效率与跨模态迁移能力。然而,上述工作往往仍需要大量的文本或多模态影像数据来进行掩码策略的学习或仅关注医学图像分割这一任务,仍未能很好地利用医学在诊断时的宝贵的先验知识,而这是本工作的路线所强调的。
综上,VP-MIM的实验结果为临床先验知识在医学影像掩码建模中的应用提供了参考。其在大规模数据上的可扩展性进一步凸显了其潜力,具备成为医学基础模型构建工具的潜力。本研究相信本研究为临床先验知识与掩码建模的结合提供了新的思路,其理论深度与鲁棒性仍有待进一步研究验证。
国家自然科学基金(U22A20350)