基于临床视觉先验引导的掩码图像建模可提升胸部X光诊断性能

王璟儿 ,  张煜

南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (04) : 946 -955.

PDF (1553KB)
南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (04) : 946 -955. DOI: 10.12122/j.issn.1673-4254.2026.04.23

基于临床视觉先验引导的掩码图像建模可提升胸部X光诊断性能

作者信息 +

Visual prior-guided masked image modeling enhances chest X-ray diagnostic efficacy

Author information +
文章历史 +
PDF (1589K)

摘要

目的 构建一种融合临床视觉先验的掩码图像建模框架,以提升胸部X光片的语义理解与诊断性能。 方法 提出视觉先验引导的掩码图像重建框架(VP-MIM)。该方法利用放射科医生的眼动数据在掩码阶段区分诊断相关与无关区域,并据此实施注意力引导的掩码策略;同时构建金字塔注意力重建模块,在重建阶段引入多尺度监督,并结合语义感知的眼动热力图以优化特征学习。 结果 在RSNA Pneumonia与ChestXray-14两个公开数据集上,VP-MIM的预训练质量在线性评估这一实验设置中展现出显著优势。在仅2616个预训练样本下,于RSNA Pneumonia单标签分类中获得AUC=86.83,在ChestXray-14多标签分类中达到平均AUC(mAUC)=72.82。在全量微调实验设置中,随着预训练数据规模的扩大,VP-MIM在ChestXray-14上取得mAUC=85.49的性能,验证了其良好的可扩展性和其在实际诊断任务中的优秀性能。 结论 VP-MIM有效缓解了医学影像中MIM方法的语义损失与多尺度不足问题,提升了胸片诊断性能,并可以在数据规模扩展中保持稳定增益。

Abstract

Objective To develop a masked image modeling framework that integrates clinical visual priors to enhance semantic understanding and diagnostic performance on chest X-ray images. Methods A novel framework VP-MIM was constructed by incorporating clinical visual priors into the MIM process. Eye-tracking data from radiologists were used to distinguish diagnostically relevant from irrelevant regions during the masking phase, enabling a controlled masking strategy. In the reconstruction phase, a pyramid attentive reconstruction module was developed to introduce multi-scale supervision, which was further refined by semantic-aware recalibrated gaze heatmaps to optimize feature learning. Results Experiments conducted on the RSNA Pneumonia and ChestXray-14 public datasets showed that under linear evaluation with only 2616 pre-training samples, VP-MIM achieved an AUC of 86.83 on the RSNA Pneumonia single-label classification task and a mean AUC (mAUC) of 72.82 on the ChestXray-14 multi-label classification task. In full fine-tuning experiments, VP-MIM showed strong scalability when the amount of pre-training data increased, reaching an mAUC of 85.49 on ChestXray-14, which verified good scalability and excellent performance of this model in practical diagnostic tasks. Conclusion VP-MIM alleviates the limitations of semantic loss and insufficient multi-scale modeling in medical imaging MIM to result in improved diagnostic performance of chest X-ray.

Graphical abstract

关键词

掩码图像建模 / 胸部X光 / 人类视觉注意力 / 计算机辅助诊断

Key words

masked image modeling / chest X-ray / human visual attention / computer-aided diagnosis

引用本文

引用格式 ▾
王璟儿,张煜. 基于临床视觉先验引导的掩码图像建模可提升胸部X光诊断性能[J]. 南方医科大学学报, 2026, 46(04): 946-955 DOI:10.12122/j.issn.1673-4254.2026.04.23

登录浏览全文

4963

注册一个新账户 忘记密码

胸部X光片是临床最常用的影像检查之一。医生在解读时,往往需要从大面积的正常区域中捕捉到细小而复杂的异常特征,这些局部特征对于识别潜在的胸腔异常至关重要1,但学习如何辨别这些局部特征对神经网络来说是一项挑战。近年来,掩码图像建模(MIM)方法23在局部表征学习上显示出很大潜力,它通过重建被遮盖的图像区域来学习医学图像的语义。然而,把MIM直接应用在医学影像上仍存在明显不足。
首先,现有MIM大多采用随机掩码,这在自然图像上可能无碍,但在胸片中却容易掩盖掉关键病灶,破坏临床相关特征。其次,胸片中的病灶大小差异很大,从弥漫性阴影到局部结节不一而足45,而现有方法缺乏多尺度的监督机制,难以同时覆盖这些不同层次的异常。结果就是,其设计未能充分考虑临床视觉先验,因而限制了其在医学影像中的适用性,模型虽然学到了一些语义表示,但对诊断最重要的信息往往捕捉不够。
为弥补上述不足,本研究提出了一种新的方法——视觉先验引导的掩码图像重建框架 (VP-MIM), 将临床视觉先验引入MIM框架中以适配胸部X光片分析。本研究将临床视觉先验定义为影像特征的语义、位置、大小与形状4个属性,并期望MIM在图像建模过程中能够感知并利用这些属性。本方法核心在于结合专家放射科医生的眼动数据以及多尺度重建策略。具体来说,VP-MIM设计了一种注意力引导的掩码策略:对临床重要区域和非重要区域进行差异化处理,优先对不重要区域进行掩码,而保留关键诊断特征。同时,针对胸腔异常大小差异带来的挑战,本研究提出了语义感知的多尺度模块——金字塔注意力重建模块,实现跨尺度的有效监督。该模块结合眼动注意力,动态调整模型的关注点,使其更好地契合图像中病灶的颗粒度与尺度。上述两个模块协同作用,有效提升了语义建模与特征学习能力。

1 资料和方法

本节介绍VP-MIM,这是一种具备语义感知和多尺度敏感能力的新型MIM方法。本研究将详细说明其两个主要部分:注意力控制的掩码策略(第1.3节)和金字塔注意力重建模块(第1.4节)。

1.1 眼动追踪数据

眼动数据是一种语义丰富的认知信号,与目标框和分割蒙版等其他标注方式相比,放射科医生的眼动数据更容易采集,也更具可解释性6,因此越来越多的研究7尝试将其用于表达医学图像上特定区域的语义信息。早期的一项研究8提出了一个直接的思路:他们开发了一种多任务方法,可以同时进行胸片诊断和眼动热力图预测。类似地,Wang等6将注视热力图作为膝关节X光分类的辅助监督,引导网络更关注人类长时间注视的区域。除了作为监督信号外,还有研究探索了将眼动数据作为网络输入的可能性。Alsharid等9为超声视频训练了一个注视预测器,并将其融入图像描述模型,从而提升了描述的准确性。此外,还有研究把眼动数据视为一种有价值的指导信息。Zhao等10利用眼动数据构建医学对比学习中的正样本对,而Kong等11则用其来减少误报,从而改进检测性能。图1基于REFLACX数据集12分别从定性和定量的角度展示了病变和非病变区域的眼动密度。说明眼动注意力能够作为临床重要区域的语义指示器,并且在不同尺度下都表现出了与病灶区域高度一致的分布特性。综合来看,这些研究表明放射科医生的眼动数据是极具潜力的语义指示器。

1.2 总体框架

VP-MIM遵循典型的MIM流程:掩码、编码和重建,在掩码和重建阶段进行了改进(图2)。

给定一批胸片{xi}i=1N,其中xiH×W,VP-MIM旨在使视觉模型13学习到高质量且医学影像特有的表征。本研究利用放射科医生的眼动数据作为有效的语义指引,并引入对应的眼动热力图 {gi}i=1N,其中giH×Wxi尺寸一致。

由于MIM在单个样本上进行操作(不涉及样本间交互),为了简化说明,本研究记单幅输入图像为 x,其眼动热力图为 g。VP-MIM首先通过医生的视觉注意力数据控制的掩码的生成,在减少冗余的同时保留关键临床特征;得到的掩码图像x̃ 输入到视觉骨干网络ViT模型(默认为ViT-B/16)中。在每一层l{1,,L}产生特征向量zlRp+1×d。其中p是图像块的数量(例如大小为224×224的图像在ViT-B/16中会被预处理为一组14×14的图像块),额外的 +1是由于ViT中一个预定义的全局特征向量13

基于实验(2.1节),本研究选择{z2,z4,z10,z12}用于重建,覆盖从低层到高层的不同表征。金字塔注意力重建模块在预设尺度下解码方向梯度直方图特征(HOG)14。HOG能够有效捕捉医学图像中的边缘与纹理信息15-17。同时,本研究利用重新校准的眼动热力图对每个被掩码图像块的重建损失进行加权,使模型在训练中更关注临床显著区域,从而提升诊断准确性。

1.3 注意力控制掩码

传统MIM方法一般随机掩码图像块,这一过程实际上等价于从均匀分布采样。相比之下,本研究的注意力控制掩码方法先进行重要性判别,区分“临床重要区域”和“非重要区域”,而后采用双峰控制采样1819来获得掩码数量。

重要性判别:本研究根据热力图 gRH×W来识别临床显著区域。采用OTSU阈值法20将热力图分为前景(重要区域)和背景(非重要区域),得到二值掩码B{0,1}H×W。接着,把图像划分为 p 个不重叠图像块,若某个图像块中超过50%的像素属于前景,就将其标记为显著图像块Sk

Sk=1,  if  (i,j)patch(k)Bi,j>0.5*np,0,  otherwise

其中 np 为每个图像块的像素数。于是可得重要图像块的总数为ps=k=1pSk,非重要图像块的总数为pn=p-ps

双峰控制采样:本研究的掩码策略设定两个比例:全局掩码率 r(总掩码比例,得到 mg=rp 个被掩码的图像块),以及临床掩码率rc(针对重要图像块的掩码比例,得到 ms=rcps 个在训练时不可见的重要图像块)。于是非重要区域的掩码数量为 mn=mg-ms=rp-rcps.

最终,本研究从临床重要区域随机选取 ms 个图像块,从非重要区域随机选取 mn 个图像块形成掩码 Mg,掩码图像为:

x̃=patchifyxMg,

其中表示逐元素相乘,patchify 表示将图像划分为不重叠图像块的操作。

1.4 金字塔注意力重建

在重建阶段,VP-MIM采用金字塔注意力重建策略,以有效捕捉并重建多尺度HOG特征。

金字塔策略:与直接像素重建相比,本研究选择HOG特征,因为它能更好地捕捉局部纹理并减少医学影像中的冗余17。如图2(2)所示,选定的ViT层嵌入 {z2,z4,z10,z12} 分别输入到不同尺度的自适应重建模块s×AttnRecon,其中 s{4, 2, 1, 0.5}为缩放系数。每个AttnRecon模块由一个轻量Transformer层、一个缩放层和一个MLP组成,缩放层根据 s 进行上采样(转置卷积)或下采样(平均池化)。浅层特征往往保留更多低级纹理信息,因此对应更大的 s,而高层特征更抽象,则缩小为 s=0.5 以增强高层语义学习能力。这种缩放方式不仅可以提升跨层特征提取能力,也有利于降低过拟合。

自适应重建:经过MLP后,嵌入被转化为输出特征,形状为 p×s2,nbins,其中 nbins 是HOG描述子的超参数。这样就能在多尺度下重建HOG特征,使模型对不同大小的纹理更敏感。

为了在重建和掩码阶段保持一致性并增强语义感知,本研究在损失函数中引入眼动热力图 g。具体做法是,将 g 与掩码 Mg 相乘并做平均池化操作:

gs'=AvgPoolgMg,

得到gs'Rps×ps,再转变为ps2,1形状的向量。为了减少眼动数据噪声,本研究在损失计算前对其进行重新校准:

Ws=softmaxgs',τ+Mg,

其中τ为温度系数,Ws表示每个图像块的注意力权重。这样可以强化模型对显著区域的关注,并抑制噪声干扰。

最终,s×AttnRecon 模块的重建损失定义为预测与目标HOG特征之间的加权平方误差:

s=WsMgH^s-Hs2WsMg,

其中H^sHs分别表示预测的HOG特征与真实的HOG特征。总的重建损失为

          recon=s{4, 2, 1, 0.5}s.

通过这种金字塔注意力重建策略,VP-MIM能够有效捕捉多尺度纹理特征,并突出临床显著区域,从而显著提升表征学习的质量。

1.5 数据集与实现细节

作为一种预训练方法,VP-MIM在预训练数据集上进行训练,并在下游数据集上进行评估。借鉴已有研究310,本研究首先通过线性评估实验设置来比较不同MIM方法的预训练质量,随后在全量微调的实验设置下衡量VP-MIM在多标签疾病诊断任务中的性能。

预训练数据集:本研究采用两个预训练数据集:REFLACX12与MIMIC-CXR21。其中,REFLACX包含2616张胸部X光片,包含 5 位放射科医生的3032 次对胸部X光片的眼动追踪记录,即一张X光片可能会被多个医生检查过,本工作目前将同一张X光片上的多个眼动热力图做取平均处理。数据使用 EyeLink 1000 Plus设备采集,采样率为 1000 Hz,该数据集在受控阅片环境下进行,并获得 MIT COUHES (protocol number: 1810643434) 的伦理批准及参与者知情同意。本数据集主要用于第2.1节以及第2.2节。相比之下,MIMIC-CXR是一个包含377,100张胸部X光片的大规模数据集,因此被用于第2.3节,以验证VP-MIM在数据规模扩充时的表现。

下游数据集:本研究在两个下游数据集上评估预训练质量,包括RSNA Pneumonia(RSNA)22、NIH Chest X-ray 14(CXR-14)23。RSNA Pneumonia包含约29,700张正位胸片,标注了肺炎的存在情况。本研究将其随机划分为训练集、验证集和测试集,

比例为70%:15%:15%。该数据集为二分类任务;而CXR-14则是更具挑战性的多标签分类任务。其中包含112,120张胸片,涵盖14种胸部疾病,数据划分比例为70%:10%:20%。

实现细节:所有预训练实验均在单卡NVIDIA Tesla V100S(32GB显存)上完成,批量大小设为128,学习率 (learning rate, lr) 设为3×10-3。在REFLACX数据集上训练400个epoch,而在MIMIC-CXR数据集上仅训练100个epoch,以平衡大规模数据带来的计算开销。下游的线性评估和全量微调实验在单卡NVIDIA RTX 4090 GPU上进行,批量大小为32,lr 设置为1×10-3,训练50个epoch。全局掩码率 r 与临床掩码率 rc 在所有预训练实验中分别固定为0.75与0.5。金字塔注意力重建模块中的温度系数 τ 设为0.1。除特别说明外,本研究默认采用ViT-B/16作为视觉骨干。所有下游评估实验均重复3次,并报告其均值及标准差。

2 结果

在本节中,本研究首先将VP-MIM与多种现有的MIM方法进行比较以验证其性能优越性。接着,本研究通过全面的消融实验验证模(型设计的合理性,并初步探索胸部X光片的合适掩码策略。最后,本研究通过全量微调实验进一步研究VP-MIM在大规模数据集上的扩展潜力及在实际场景中的扩展性。

2.1 与现有方法的对比

表1 给出了VP-MIM在两个下游数据集上的定量性能比较。对比方法同时包括非语义感知和语义感知的MIM模型,以保证全面性。具体而言,非语义感知方法在掩码阶段不区分图像块的重要性,采用随机或均匀的掩码策略,不考虑图像内容的语义权重;相对地,语义感知方法则在掩码过程中引入语义或先验信息,通过关注结构或语义上更重要的区域来提升模型的特征学习效果。本研究还在不同规模(1%、10%和100%)的下游训练数据上进行了评估,以进一步验证MIM方法在小样本情境下的有效性。需要指出的是,Xue等24同时提出了MaskAlign及其语义感知版本Attentive MaskAlign(AttnMA),因此可以作为良好的对照组。主要发现总结如下:

整体性能优于其他方法: VP-MIM在所有数据集上均取得了当前最优的性能,优于语义感知与非语义感知的方法。在仅涉及单一疾病的RSNA数据集上,优势相对较小;但在涉及多疾病的CXR-14上,优势更加显著。具体来说,在将100%的RSNA数据集作为训练数据的条件下,VP-MIM的AUC达到86.83(0.01),而性能最低的MAE为84.64(0.01)。在CXR-14上,VP-MIM的表现也有明显提升,mAUC从68.33(0.34)提高到72.82(0.02)。这一结果与同样强调多尺度特征的DeepMIM25方法的观察一致,进一步表明在胸片的掩码建模中,多尺度策略是必要的。

可学习注意力的局限性: 当前许多研究倾向于采用可学习的Grad-CAM29或自注意力图来反映图像语义,而不是像本研究这样直接使用放射科医生的视觉注视数据。这些研究所提出的方法一般被称为语义感知的方法。然而,这类方法在胸片任务中并不总是有效。与自然图像不同,胸片诊断更依赖放射科医生的专业知识和经验,而非简单依靠像素值的显著性。在表1 中,AttnMA基于ViT自注意力图进行掩码,但可以发现,在RSNA和CXR-14数据集上AttnMA的表现反而更差。此外,对比语义感知与非语义感知方法,可以发现MaskFeat26与dMAE27这两种代表性的非语义感知方法优于HPM28这一语义感知的MIM方法。这说明,要在胸片上有效利用语义感知信息,需要专门设计针对医学影像特点的策略,而非完全以数据驱动的形式让网络自主学习注意力。

2.2 消融实验

该部分实验在与2.1相同的数据集REFLACX上进行预训练,仅修改所要控制的变量与超参数, 学习率、迭代次数等实验细节与1.5节中的设定保持一致。

金字塔结构配置的消融实验:图3展示了金字塔注意力重建在缩放系数设置上的影响。具体来说,在图3 中,本研究固定特征层为 {2,4,10,12},调整其对应缩放系数 s。结果表明,对浅层特征进行上采样的预处理操作能充分利用其丰富信息,性能得到提升;同时将最后一层特征下采样至 s=0.5 也带来小幅改进,说明此操作有助于提升高层语义表征,进而有利于下游分类任务。在图4中,本研究固定缩放因子为{4,2,1,0.5},初始时仅使用最后一层特

征 {12,12,12,12},然后逐步引入浅层与深层特征。当加入第8层时性能显著下降,推测这与神经网络的“脆弱共适应”30现象有关,即神经网络有时需要连续多层而非某一特定层的神经元来共同协作学习一种特征,未来将进一步探讨。

关键模块的消融实验:表2 展示了VP-MIM各个模块对整体性能的贡献。第一行在MAE中引入注意力控制掩码,使得其在CXR-14上的mAUC提升为68.97(0.16)。将像素替换为HOG特征并引入金字塔重建策略后,性能显著提升。进一步结合自适应重建后,性能再次小幅提高,最终在CXR-14上分别达到72.82(0.02)。这些结果验证了各个模块在整体性能中的作用。图5展示了预训练后 ViT-B/16 的自注意力可视化结果,用以评估不同模块对表征学习质量的影响。从图中可以看出,仅引入眼动信息时,模型的注意力仍较为分散,未能充分聚焦于关键的解剖区域。而当逐步加入由 HOG、Pyramid 与 Attentive 三部分组成的金字塔注意力重建模块后,模型的注意力显著集中于胸部X光片中的肺部与心脏区域,能够学习到更清晰的结构轮廓。这一结果说明,多尺度自适应策略在医学影像掩码预训练中对于提升模型的语义感知能力和结构表征质量具有重要作用。

临床掩码率的消融实验:本研究在保持全局掩码率 r=0.75 不变的情况下,评估不同临床掩码比例 rc 对框架性能的影响(图6)。方法的性能随 rc 从10%到90%的变化呈现显著差异。结果表明,当 rc=0.5 时,VP-MIM可达到最佳性能。若 rc 超过0.5,性能显著下降;而 rc 低于0.5时,虽然性能也发生了退化,但其下降趋势更为平缓。这一发现凸显了在胸片MIM学习中合理保留临床区域的重要性。

2.3 跨中心的数据规模扩展实验

本节评估VP-MIM的可扩展性,并与传统MIM方法MAE进行对比。本研究从MIMIC-CXR数据集中随机选取部分样本上对VP-MIM进行预训练,并不断提高样本的数量,全量微调的评估结果(图7)。由于MIMIC-CXR缺乏放射科医生眼动数据,该部分实验在REFLACX数据集上训练来一个眼动预测网络。该预测网络采用U-Net作为主体架构,对于输入的任意胸部X光片都可预测其对应的眼动热力图。这一眼动预测网络使得VP-MIM得以在大规模数据的胸部X光上进行预训练,而无需进行大规模眼动数据采集。

实验结果显示,VP-MIM在所有数据量下均优于MAE,且随着数据量增加,两者性能差距进一步拉大。这表明VP-MIM在大规模数据上具有更强的扩展能力。值得注意的是,引入伪眼动数据不仅提升了性能,还证明了VP-MIM在仅有少量眼动标注时,依然能够有效适配更大规模的数据。这种特性凸显了VP-MIM在基础模型时代作为一种预训练方法的潜力。

3 讨论

本研究提出的VP-MIM,一种专为胸部X光片设计的创新性MIM方法,融合临床视觉先验,包含注意力引导的掩码与金字塔注意力重建两大模块;通过注意力引导的掩码策略,探索在胸片分析中如何合理实施掩码,即临床显著区域应在保留关键信息和避免过度暴露之间取得平衡;在多个公开数据集上验证了方法的有效性,结果表明VP-MIM不仅能有效提升胸片诊断性能,还具有良好的扩展性和临床应用潜力。本研究在保留关键诊断特征的同时,有效捕捉多尺度的临床显著区域。该设计弥补了传统 MIM 在语义感知与多尺度建模方面的不足,同时揭示了临床先验知识在自监督学习中的普适价值。

从实验结果来看,VP-MIM在多个下游数据集上均取得了领先于现有方法2428的性能。在仅有有限下游训练样本的情况下,VP-MIM依然表现出稳定的优势,说明其学到的表征更符合临床语义规律。跨中心的规模扩展实验也有效说明了本方法所利用的医生视觉先验具有在不同数据中心和不同数据来源间的可迁移性与泛化能力。上述结果为后续在临床先验建模和自监督学习结合方向上的研究提供了有益参考。在推理部署方面,由于本研究提出的VP-MIM是一种预训练策略,并未改变模型的结构与推理流程,因此其计算效率与硬件需求与标准ViT-B/16模型一致。ViT-B/16采用16×16像素的图像块分割、224×224的输入分辨率,在NVIDIA RTX 3090等主流GPU上推理时,每张影像的平均耗时仅约12-15 毫秒,计算需求与同规模的卷积神经网络模型相当。因此,本研究的预训练策略不会在临床部署中带来额外的计算负担或硬件限制。围绕利用眼动来引导AI模型这一话题,近年的综述与工作给出了与本文相佐证的结果。一方面,放射学领域的眼动AI综述731指出:眼动数据既能提升样本效率,又能改善可解释性,在标注稀缺时尤其有价值;这与本研究在低比例下游数据时仍能保持优势的结果相吻合。另一方面,面向胸片的眼动有监督方法(如WACV 2024 的 GazeGNN32)与的眼动引导ViT3334在实证上均显示:引入专家眼动可降低误检并改善病变可定位性,提示在训练信号层面保留临床关键区域具有普适意义。本研究的掩码对比实验表明 rc=0.5这一类中等强度的“保留—遮蔽”更稳健,亦与这些工作强调的“不过度掩盖关键区域”结论方向一致。

关于以人类眼动替代/补充可学习注意力的必要性与局限边界。多篇近期研究3536指出,直接用自注意力图或 Grad-CAM 近似“语义显著性”在医学影像上并不总是可靠,尤其对小体积、低对比病灶易失灵;这些工作系统地分析了感受野、梯度稳定性等对 Grad-CAM 解释质量的影响,并在跨模态评测中提示其不稳定性。在本研究的对比实验中,基于可学习自注意力的掩码在RSNA、NIH-CXR14上未能稳定优于语义无关掩码,这与上述分析一致:模型高响应区域并非等同于临床显著区域,胸片等弱对比影像更依赖专家先验来校准训练信号。在多尺度与层级监督方面,本研究的金字塔注意力重建与“浅层上采样、末层适度下采样”的设置,与近期对MIM“深层监督/多尺度”路线的结论是相容的。近期 MIM 研究已经提出了多种新的探索。Xiang等37在 AAAI 2025 提出的 Wavelet-Driven MIM 将小波分解的频域与空间域信息引入重建目标,展示了多尺度监督不仅可以在空间上展开,也能通过频率域实现层次化。在医学影像任务中,Liu等38的研究则通过边界重建来强调结构感知,体现出边界层级也是一种有意义的尺度信号。这些工作共同表明,多尺度监督设计正在成为 MIM 的重要发展方向。本研究提出的金字塔注意力重建模块(不同层对应不同尺度 HOG 重建,并结合注视加权)可以被视为这一趋势在胸片任务中的特化实现。未来如果能进一步引入频域信号、边界感知目标以及可学习的层尺度调度机制,VP-MIM 在表征质量和临床应用价值上有望取得更大提升。在可扩展性与伪眼动数据方面,本研究在缺乏大规模真实眼动标注的MIMIC-CXR上,采用基于REFLACX训练的预测模型生成伪眼动热力图作为替代信号。实验结果显示,随着预训练数据量增加,VP-MIM与传统MAE的性能差距显著扩大,提示“轻量眼动先验&大规模无标注影像”的组合路径是可行的。这一发现与Lanfredi等12构建的带有眼动与报告的胸片数据库相呼应,这类资源为眼动先验在更大规模任务中的迁移提供了坚实基础。同时,Sultana等39则进一步探索了将眼动数据与放射科医生报告联合引入视觉-语言模型,在多模态层面增强对胸片表征的学习。这些证据共同表明,即便眼动数据有限,也可以通过伪眼动或与其他模态结合的方式,在大规模训练中持续提供增益。

然而,本研究也注意到伪眼动的局限性。Pershin等40指出,医生在不同病灶上的注视模式存在显著差异;因此,若伪眼动模型训练数据缺乏多样病种覆盖,可能会在特定异常类别上引入系统性偏差。此外,跨中心的预训练也需要考虑域移问题。Cho等41提出的CheSS模型表明,基于自监督对比学习的胸片预训练在跨数据集时具备一定泛化性,而Shurrab等42则展示了通过结合EHR等多模态信息,可以进一步改善跨域表示。这提示未来在利用伪眼动扩展时,需要同步引入域自适应和多模态增强策略,以降低跨机构、跨人群训练时的偏差与噪声影响。

未来研究可以从以下方向展开:其一,探索融合更多类型的临床先验信息,例如电子病历、检查指征及其他多模态临床数据,以丰富模型的语义基础42;其二,发展更加灵活的动态掩码策略,可学习的更加有自适应性的掩码策略可以提升模型在不同任务和疾病类型下的适应性43;其三,在跨中心和跨设备的数据上进一步验证模型稳定性,结合领域自适应方法提升泛化能力。在多模态医学数据融合方面,Yang等44通过对影像与基因组学特征间的关系进行掩码与恢复,实现了跨模态语义关系的自监督学习。Dai等45则在 SaSaMIM中引入解剖语义感知掩码,在非增强腹部CT中实现了基于合成语义指导的肿瘤分割。这些研究共同体现了医学影像MIM从“随机遮挡”向“结构化、任务导向、跨模态学习”的演进趋势。在掩码策略方面,研究者开始从随机掩码转向语义驱动与动态掩码机制,以提升模型对关键区域的关注度。Xie等46提出利用放射报告中的语义信息指导掩码生成,通过“知识驱动掩码”与“句子驱动掩码”策略,使模型在训练过程中能够重点学习与病灶相关的区域。此外,Wang等47提出将掩码建模扩展到频域,利用低频与高频特征的互补性提升了医学影像分割任务中的全局与局部特征表征。Xing等48进一步针对3D医学影像提出区域级与patch级的混合掩码机制,显著提高了三维影像的预训练效率与跨模态迁移能力。然而,上述工作往往仍需要大量的文本或多模态影像数据来进行掩码策略的学习或仅关注医学图像分割这一任务,仍未能很好地利用医学在诊断时的宝贵的先验知识,而这是本工作的路线所强调的。

综上,VP-MIM的实验结果为临床先验知识在医学影像掩码建模中的应用提供了参考。其在大规模数据上的可扩展性进一步凸显了其潜力,具备成为医学基础模型构建工具的潜力。本研究相信本研究为临床先验知识与掩码建模的结合提供了新的思路,其理论深度与鲁棒性仍有待进一步研究验证。

参考文献

[1]

Bansal T, Beese R. Interpreting a chest X-ray[J]. Br J Hosp Med, 2019, 80(5): C75-9. doi:10.12968/hmed.2019.80.5.c75

[2]

Bao H, Dong L, Piao S, et al. BEiT: BERT pre-training of image transformers[C/OL]//The Tenth International Conference on Learning Representations (ICLR). 2022. Available from:

[3]

He KM, Chen XL, Xie SN, et al. Masked autoencoders are scalable vision learners[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). June 18-24, 2022, New Orleans, LA, USA. IEEE, 2022: 16000-09. doi:10.1109/cvpr52688.2022.01553

[4]

Huang SC, Shen LY, Lungren MP, et al. GLoRIA: a multimodal global-local representation learning framework for label-efficient medical image recognition[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). October 10-17, 2021, Montreal, QC, Canada. IEEE, 2022: 3922-31. doi:10.1109/iccv48922.2021.00391

[5]

Li JX, Wang YQ, Wang S, et al. Multiscale attention guided network for COVID-19 diagnosis using chest X-ray images[J]. IEEE J Biomed Health Inform, 2021, 25(5): 1336-46. doi:10.1109/jbhi.2021.3058293

[6]

Wang S, Ouyang X, Liu TM, et al. Follow my eye: using gaze to supervise computer-aided diagnosis[J]. IEEE Trans Med Imag, 2022, 41(7): 1688-98. doi:10.1109/tmi.2022.3146973

[7]

Ibragimov B, Mello-Thoms C. The use of machine learning in eye tracking studies in medical imaging: a review[J]. IEEE J Biomed Health Inform, 2024, 28(6): 3597-612. doi:10.1109/jbhi.2024.3371893

[8]

Karargyris A, Kashyap S, Lourentzou I, et al. Creation and validation of a chest X-ray dataset with eye-tracking and report dictation for AI development[J]. Sci Data, 2021, 8(1): 92. doi:10.1038/s41597-021-00863-5

[9]

Alsharid M, Cai YF, Sharma H, et al. Gaze-assisted automatic captioning of fetal ultrasound videos using three-way multi-modal deep neural networks[J]. Med Image Anal, 2022, 82: 102630. doi:10.1016/j.media.2022.102630

[10]

Zhao ZH, Wang S, Wang Q, et al. Mining gaze for contrastive learning toward computer-assisted diagnosis[J]. Proc AAAI Conf Artif Intell, 2024, 38(7): 7543-51. doi:10.1609/aaai.v38i7.28586

[11]

Kong Y, Wang S, Cai JD, et al. Gaze-DETR: using expert gaze to reduce false positives in vulvovaginal candidiasis screening[C]//Medical Image Computing and Computer Assisted Intervention- MICCAI 2024. Cham: Springer, 2024: 133-43. doi:10.1007/978-3-031-72083-3_13

[12]

Bigolin Lanfredi R, Zhang MY, Auffermann WF, et al. REFLACX, a dataset of reports and eye-tracking data for localization of abnormalities in chest x-rays[J]. Sci Data, 2022, 9(1): 350. doi:10.1038/s41597-022-01441-z

[13]

Dosovitskiy A, Beyer L, Kolesnikov A, et al. An image is worth 16×16 words: transformers for image recognition at scale[C/OL]//The Ninth International Conference on Learning Representations (ICLR). 2021. Available from:

[14]

Dalal N, Triggs B. Histograms of oriented gradients for human detection[C]//2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR'05). June 20-25, 2005, San Diego, CA, USA. IEEE, 2005: 886-93. doi:10.1109/cvpr.2005.4

[15]

Chen SH, Qin J, Ji X, et al. Automatic scoring of multiple semantic attributes with multi-task feature leverage: a study on pulmonary nodules in CT images[J]. IEEE Trans Med Imag, 2017, 36(3): 802-14. doi:10.1109/tmi.2016.2629462

[16]

Shin HC, Roth HR, Gao MC, et al. Deep convolutional neural networks for computer-aided detection: CNN architectures, dataset characteristics and transfer learning[J]. IEEE Trans Med Imag, 2016, 35(5): 1285-98. doi:10.1109/tmi.2016.2528162

[17]

Ghalati MK, Nunes A, Ferreira H, et al. Texture analysis and its applications in biomedical imaging: a survey[J]. IEEE Rev Biomed Eng, 2022, 15: 222-46. doi:10.1109/rbme.2021.3115703

[18]

Li CY, Wang XY, Eberl S, et al. Supervised variational model with statistical inference and its application in medical image segmentation[J]. IEEE Trans Biomed Eng, 2015, 62(1): 196-207. doi:10.1109/tbme.2014.2344660

[19]

Huang XW, Zhang YL, Meng L, et al. Identification of ultrasonic echolucent carotid plaques using discrete Fréchet distance between bimodal gamma distributions[J]. IEEE Trans Biomed Eng, 2018, 65(5): 949-55. doi:10.1109/tbme.2017.2676129

[20]

Otsu N. A threshold selection method from gray-level histograms[J]. IEEE Trans Syst Man Cybern, 1979, 9(1): 62-6. doi:10.1109/tsmc.1979.4310076

[21]

Johnson AEW, Pollard TJ, Berkowitz SJ, et al. MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports[J]. Sci Data, 2019, 6(1): 317. doi:10.1038/s41597-019-0322-0

[22]

Shih G, Wu CC, Halabi SS, et al. Augmenting the national institutes of health chest radiograph dataset with expert annotations of possible pneumonia[J]. Radiol Artif Intell, 2019, 1(1): e180041. doi:10.1148/ryai.2019180041

[23]

Wang XS, Peng YF, Lu L, et al. ChestX-ray: hospital-scale chest X-ray database and benchmarks on weakly supervised classification and localization of common Thorax diseases[M]//Deep Learning and Convolutional Neural Networks for Medical Imaging and Clinical Informatics. Cham: Springer International Publishing, 2019: 369-92. doi:10.1007/978-3-030-13969-8_18

[24]

Xue HW, Gao P, Li HY, et al. Stare at what you see: masked image modeling without reconstruction[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). June 17-24, 2023, Vancouver, BC, Canada. IEEE, 2023: 22732-41. doi:10.1109/cvpr52729.2023.02177

[25]

Ren SC, Wei FY, Zhang SAZ, et al. DeepMIM: deep supervision for masked image modeling[C]//2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). February 26 - March 6, 2025, Tucson, AZ, USA. IEEE, 2025: 879-88. doi:10.1109/wacv61041.2025.00095

[26]

Wei C, Fan HQ, Xie SN, et al. Masked feature prediction for self-supervised visual pre-training[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). June 18-24, 2022, New Orleans, LA, USA. IEEE, 2022: 14648-58. doi:10.1109/cvpr52688.2022.01426

[27]

Wu QL, Ye H, Gu Y, et al. Denoising masked autoencoders help robust classification[C/OL]//The Eleventh International Conference on Learning Representations(ICLR). May 1-5, 2023, Kigali, Rwanda. Available from:

[28]

Wang HC, Song KY, Fan JS, et al. Hard patches mining for masked image modeling[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). June 17-24, 2023, Vancouver, BC, Canada. IEEE, 2023: 10375-85. doi:10.1109/cvpr52729.2023.01000

[29]

Selvaraju RR, Cogswell M, Das A, et al. Grad-CAM: visual explanations from deep networks via gradient-based localization[J]. Int J Comput Vis, 2020, 128(2): 336-59. doi:10.1007/s11263-019-01228-7

[30]

Yosinski J, Clune J, Bengio Y, et al. How transferable are features in deep neural networks[C]//The Twenty-Eighth Annual Conference on Neural Information Processing Systems(NeurIPS). December 8-13, 2014, Montreal, QC, Canda. IEEE 2014, 27: 3320-28.

[31]

Duan JX, Zhang MW, Song MH, et al. Eye tracking-enhanced deep learning for medical image analysis: a systematic review on data efficiency, interpretability, and multimodal integration[J]. Bioengineering, 2025, 12(9): 954. doi:10.3390/bioengineering12090954

[32]

Wang B, Pan HY, Aboah A, et al. GazeGNN: a gaze-guided graph neural network for chest X-ray classification[C]//2024 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). January 3-8, 2024, Waikoloa, HI, USA. IEEE, 2024: 2183-92. doi:10.1109/wacv57701.2024.00219

[33]

Ma C, Zhao L, Chen YZ, et al. Eye-gaze-guided vision transformer for rectifying shortcut learning[J]. IEEE Trans Med Imag, 2023, 42(11): 3384-94. doi:10.1109/tmi.2023.3287572

[34]

Chen ZH, Liu Z, Song YJ. Gaze-guided vision transformer for chest X-ray image classification[J]. Biomed Signal Process Control, 2026, 111: 108298. doi:10.1016/j.bspc.2025.108298

[35]

Suara S, Jha A, Sinha P, et al. Is grad-CAM explainable in Medical images? [C]//Computer Vision and Image Processing. Cham: Springer, 2024: 124-35. doi:10.1007/978-3-031-58181-6_11

[36]

Santos R, Pedrosa J, Mendonça AM, et al. Grad-CAM: The impact of large receptive fields and other caveats[J]. Comput Vis Image Underst, 2025, 258: 104383. doi:10.1016/j.cviu.2025.104383

[37]

Xiang WZ, Liu C, Yu HY, et al. Wavelet-driven masked image modeling: a path to efficient visual representation[J]. Proc AAAI Conf Artif Intell, 2025, 39(8): 8611-9. doi:10.1609/aaai.v39i8.32930

[38]

Liu C, Cheng YZ, Tamura S. Masked image modeling-based boundary reconstruction for 3D medical image segmentation[J]. Comput Biol Med, 2023, 166: 107526. doi:10.1016/j.compbiomed.2023.107526

[39]

Sultana J, Qin RW, Yin ZZ. Seeing through expert's eyes: leveraging radiologist eye gaze and speech report with graph neural networks for chest X-ray image classification[C]//Computer Vision-ACCV 2024. Singapore: Springer, 2025: 142-58. doi:10.1007/978-981-96-0901-7_9

[40]

Pershin I, Mustafaev T, Ibragimova D, et al. Changes in radiologists' gaze patterns against lung X-rays with different abnormalities: a randomized experiment[J]. J Digit Imaging, 2023, 36(3): 767-75. doi:10.1007/s10278-022-00760-2

[41]

Cho K, Kim KD, Nam Y, et al. CheSS: chest X-ray pre-trained model via self-supervised contrastive learning[J]. J Digit Imaging, 2023, 36(3): 902-10. doi:10.1007/s10278-023-00782-4

[42]

Shurrab S, Guerra-Manzanares A, Shamout FE. Multimodal masked Siamese network improves chest X-ray representation learning[J]. Sci Rep, 2024, 14: 22516. doi:10.1038/s41598-024-74043-x

[43]

Kong LJ, Ma MQ, Chen GY, et al. Understanding masked autoencoders via hierarchical latent variable models[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). June 17-24, 2023, Vancouver, BC, Canada. IEEE, 2023: 7918-28. doi:10.1109/cvpr52729.2023.00765

[44]

Yang QS, Li WY, Li BP, et al. MRM: masked relation modeling for medical image pre-training with genetics[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV). October 1-6, 2023, Paris, France. IEEE, 2024: 21395-405. doi:10.1109/iccv51070.2023.01961

[45]

Dai PY, Ou YF, Yang YQ, et al. SaSaMIM: synthetic anatomical semantics-aware masked image modeling for colon tumor segmentation in non-contrast abdominal computed tomography[C]//Medical Image Computing and Computer Assisted Intervention- MICCAI 2024. Cham: Springer, 2024: 567-78. doi:10.1007/978-3-031-72120-5_53

[46]

Xie YT, Gu L, Harada T, et al. MedIM: boost medical image representation via radiology report-guided masking[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2023. Cham: Springer, 2023: 13-23. doi:10.1007/978-3-031-43907-0_2

[47]

Wang WX, Wang J, Chen C, et al. FreMIM: Fourier transform meets masked image modeling for medical image segmentation[C]//2024 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). January 3-8, 2024, Waikoloa, HI, USA. IEEE, 2024: 7845-55. doi:10.1109/wacv57701.2024.00768

[48]

Xing ZH, Zhu L, Yu LQ, et al. Hybrid masked image modeling for 3D medical image segmentation[J]. IEEE J Biomed Health Inform, 2024, 28(4): 2115-25. doi:10.1109/jbhi.2024.3360239

基金资助

国家自然科学基金(U22A20350)

RIGHTS & PERMISSIONS

版权所有©《南方医科大学学报》编辑部2021

AI Summary AI Mindmap
PDF (1553KB)

2

访问

0

被引

详细

导航
相关文章

AI思维导图

/