近年来,人工智能(artificial intelligence, AI)技术在医学领域的快速发展为临床诊疗带来了前所未有的变革。尤其在皮肤病学这一高度依赖视觉特征的学科中,机器学习(machine learning, ML)作为AI的核心技术之一,正日益被应用于解决健康领域的诸多问题,其中包括在临床决策支持中的应用
[1]。在临床决策闭环中,ML扮演着关键角色,通过处理和分析数据,辅助医生进行更准确、高效的诊断和治疗决策确定。本文系统综述了ML在皮肤病临床决策支持中的应用,涵盖了从影像识别与多模态鉴别诊断、个性化治疗推荐与疗效预测,到疾病预后评估与长期管理的应用场景。同时剖析了当前面临的数据质量、算法泛化、临床验证整合以及伦理监管等核心挑战。
1 机器学习在临床决策闭环中的应用
1.1 基于影像的病灶识别与分类
在皮肤病学领域,基于影像的病灶识别与分类是ML辅助临床决策的重要切入点。ML模型能够分析皮肤病变的影像数据(如皮肤镜、临床照片等),自动识别病灶的存在与边界,并对其进行初步分类(例如区分良性痣、脂溢性角化病与恶性黑色素瘤等)
[2]。例如,卷积神经网络(convolutional neural network, CNN)已成为皮肤影像分析的核心技术,Ba等
[3]研究显示,CNN单独识别10种皮肤肿瘤的准确性达78.45%,Kappa值为0.73;在辅助18名皮肤科医生时,医生诊断准确性从62.78%提升至76.60%,敏感性从83.21%提升至89.56%,特异性从80.92%提升至87.90%,且经验较少的医生获益更大。Winkler等
[4]开展的前瞻性研究显示,在228例色素性皮损的临床实践中,皮肤科医生联合CNN辅助诊断时,诊断准确性从74.1%提升至86.4%,敏感性从84.2%提升至100.0%,特异性从72.1%提升至83.7%,同时良性痣的不必要切除率降低19.2%。这种自动化分析有助于提高筛查效率,减少人为误差,并为医生提供初步的参考意见,是临床决策闭环中信息输入和初步处理的关键环节。研究显示,AI算法通过分析皮肤镜图像,其分类色素性皮肤病变的准确性优于皮肤科医生和肿瘤科医生使用的传统视觉诊断方法
[5]。该技术尤其适用于基层与社区医疗场景,可辅助非专科医师完成初步筛查,从而加速恶性皮肤病变(如黑色素瘤)的早期识别
[6]。多项对照研究证实,ML模型能显著提升皮肤病诊断准确性。Groh等
[7]开展的一项涵盖46种皮肤病的大规模远程皮肤病学模拟研究显示,皮肤科医生与全科医生的诊断准确率分别为38%与19%,且对深肤色图像的诊断准确率较浅肤色图像低4%。引入ML的决策支持后,皮肤科医生与全科医生的诊断准确率均提升33%以上。Barata等
[8]进一步采用ML模型整合人类偏好,在皮肤癌诊断中使皮肤科医生的正确诊断率提升12.0%(95%CI:8.8%~15.1%),最优管理决策率从57.4%提升至65.3%(95%CI:61.7%~68.9%)。Cai等
[9]开展的一项针对炎症性皮肤病的系统评价与Meta分析显示,基于图像的AI算法在疾病严重程度评估中表现出较高的诊断准确性,总体敏感性达80.5%(95%CI: 76.2%~84.2%),特异性达96.2%(95%CI: 94.9%~97.2%),且在特应性皮炎(atopic dermatitis, AD)(敏感性91.8%)和痤疮(敏感性80.7%)等病种中表现尤为突出。Liu等
[10]开展的一项关于蕈样肉芽肿早期诊断的多模态AI研究显示,AI辅助诊断显著提升了不同年资皮肤科医生的诊断水平,其中初级医师的准确率提升最为显著(+14.48%),中级和高级医师分别提升7.99%和6.21%,印证了该技术在提升基层诊断能力方面的独特优势。
1.2 多模态数据融合与鉴别诊断
传统的ML应用在健康领域往往侧重于单一模态的数据分析
[1]。然而,为了提升预测的准确性并更好地模拟临床专家在鉴别诊断时综合考量多种信息的决策过程,生物医学ML领域正致力于融合不同来源的数据
[1]。在皮肤病临床决策中,多模态数据融合技术通过整合不同类型的数据源,显著增强皮肤病决策支持系统的准确性和鲁棒性。该技术将影像数据(如皮肤镜、病理切片图像等)与患者的人口统计学信息、病史、实验室检查结果、基因数据甚至患者报告的症状等多模态信息结合起来。通过ML算法对这些异构数据进行有效融合与分析,可以构建更全面、更接近临床实际的鉴别诊断模型,显著提升对复杂皮肤病诊断的准确性和可靠性,从而为后续的治疗决策提供更坚实的依据。多模态融合策略在皮肤病诊断中展现出显著优势。针对皮肤癌的多标签分类任务,Tang等
[11]提出的FusionM4Net算法采用两阶段架构:第一阶段在特征层面融合临床图像与皮肤镜图像的表征,并在决策层实现信息整合;第二阶段进一步融合多标签预测信息与患者元数据,从而在标签不平衡数据集上实现稳健且优异的分类性能。在炎症性皮肤病诊断中,Wang等
[12]构建的基于空间对齐多模态对比学习框架通过联合分析皮肤镜与临床图像(基于北京协和医院炎症性皮肤疾病数据集训练),显著提升了20位皮肤科医师的诊断准确率(从0.775提高至0.890)。这些多模态方法在公开数据集(如7-point criteria evaluation数据库)的验证中,较单模态方法均显著提高了平均受试者工作特征曲线下面积(area under the curve, AUC)
[13],证实了多模态融合在提升诊断准确性方面的普适价值。
2 机器学习在治疗决策优化中的应用
2.1 个性化治疗方案推荐
ML通过整合多模态数据(如基因组学、临床特征和影像学等)为患者推荐最优治疗方案。在银屑病领域,基于丹麦全国登记数据的ML模型已成功用于预测个体患者对特定生物制剂的最佳治疗反应,显著减少传统“试错”策略的局限性
[14]。类似地,ML模型通过整合多模态数据,显著提升了炎症性皮肤病的治疗反应预测精度。Wu等
[15]利用LASSO、Logistic回归和随机森林算法,从转录组数据中筛选出
IL7R、
KRT16、
CCL2等候选基因,构建了AD诊断及疗效评估模型,其LASSO(REC)模型在验证队列中AUC达0.876。Liu等
[16]进一步综述了ML在AD中的应用,指出整合临床特征与生物标志物数据可实现治疗效果的量化预测。代谢组学分析揭示了炎症性皮肤病患者存在特异性代谢物(如糖类、脂质、氨基酸)改变
[17],ML通过识别这些代谢重编程特征,为开发靶向疗法提供了新思路。在肿瘤治疗中,基于药敏数据的ML平台(如CAN-Scan)利用患者来源原代细胞系筛选预测性生物标志物,指导精准用药选择
[18]。对于抑郁症患者,结合电子健康记录的ML模型可预测电休克疗法或氯胺酮的个体化治疗优势
[19]。强化学习(reinforcement learning, RL)作为ML分支,进一步通过序列决策优化技术,利用患者数据动态调整皮肤病的治疗路径
[20]。
2.2 治疗反应与副作用预测
ML模型在预测治疗反应和副作用方面展现出显著潜力。在类风湿关节炎(rheumatoid arthritis, RA)中,研究者利用基线全血转录组数据构建ML分类器,可提前预测患者对抗肿瘤坏死因子抑制剂(tumor necrosis factor inhibitor, TNFi)的治疗响应
[21]。针对AD,基于甲基化分析的ML模型通过量化差异甲基化位点、甲基化数量性状位点等特征,结合决策曲线分析验证其预测治疗反应的临床效用
[22]。在肝癌治疗领域,整合影像组学与临床特征的ML模型能通过治疗前影像预测患者对阿替利珠单抗联合贝伐珠单抗的生存获益和治疗反应
[23]。此外,ML技术已应用于优化抗生素使用策略,例如通过患者诊断特征和临床数据建立个性化治疗规则,精准识别最可能受益于阿奇霉素的腹泻患儿
[24]。值得注意的是,个体化治疗响应预测仍面临方法学挑战
[25],且需通过严格的临床验证(如AUC评估分类准确性、R值评估回归性能等)以确保模型可靠性
[21-22]。
3 机器学习在预后评估与长期管理中的角色
ML技术通过整合多源临床数据与患者报告信息,显著提升了皮肤病预后评估的精准性,并为长期疾病管理提供动态决策支持。
在皮肤癌领域,ML模型通过分析病理影像、基因组学及临床特征,实现对疾病进展和复发风险的精准量化(
图1)。
例如,针对默克尔细胞癌(Merkel cell carcinoma, MCC)开发的 DeepMerkel 模型整合了肿瘤组织学特征与分子标志物,其预测性能显著优于传统分期系统,可识别高危复发患者并指导强化随访策略
[26]。类似地,基于心肌纤维化影像特征的无监督ML算法被证实可优化二尖瓣脱垂患者的心血管事件风险评估,该方法为皮肤肿瘤的多模态预后建模提供了跨学科参考
[27]。在黑色素瘤预后预测中,时间事件ML模型利用电子健康记录中的30项临床病理因素(如肿瘤厚度、溃疡状态),实现了对复发时间与类型的动态评估,模型经外部验证具备临床泛化能力
[28]。此外,表面增强拉曼光谱(surface-enhanced raman scattering, SERS)结合ML特征选择技术,通过量化心脏生物标志物,实现了急性心肌梗死的早期诊断与预后分层,该技术框架可迁移至皮肤肿瘤生物标志物分析
[29]。
患者报告结局(patient reported outcomes, PROs)的ML分析正成为慢性皮肤病长期管理的核心工具。在AD研究中,梯度提升决策树模型揭示了130项临床因素与湿疹面积和严重程度指数(eczema area and severity index, EASI)的关联规律,证实基线期患者导向湿疹测量(patient oriented eczema measurement POEM)评分与次年疾病发作频率显著相关
[30]。基于强化学习的预测模型进一步将AD发作严重度与皮肤病生活质量指数(dermatology quality of life index, DLQI)、儿童皮肤病生活质量指数(children's dermatology life quality index, CDLQI)等指标动态关联,优化了个体化干预时机选择
[31]。针对孟加拉国人群的湿疹评估项目证实,ML可自动化处理多语言版本的DLQI、CDLQI量表数据,消除主观评估偏差,并为跨种族表型研究提供标准化分析框架
[32]。
4 临床转化面临的挑战与瓶颈
尽管ML在皮肤病临床决策支持中展现出巨大潜力,其实际临床转化仍面临多重挑战与瓶颈,主要涵盖数据与算法、临床验证整合及伦理监管这3大层面。
4.1 数据与算法层面的挑战
数据质量与多样性不足是核心障碍。用于训练皮肤病AI算法的数据集普遍存在特征描述不充分的问题,尤其是肤色多样性和疾病覆盖范围的局限性。公开数据集虽被广泛引用,但常缺乏对人口统计学特征(如年龄、性别、种族)和图像采集条件的详细说明,导致潜在偏差
[33-34]。例如,现有算法在深色皮肤图像上的诊断准确率显著低于浅色皮肤(差异达4%),且对训练数据中未包含的罕见疾病识别能力严重下降
[35-36]。此外,数据标注依赖皮肤科医生,而医生自身对深色皮肤和罕见病的诊断准确率较低,进一步加剧了数据偏差
[35, 37]。算法层面,ML模型在真实临床场景中的泛化能力存在显著局限。Young等
[38]针对皮肤病变诊断的“压力测试”显示,输入数据的简单变换(如旋转)可导致6.5%~22%的假阳性/阴性预测,且模型对未训练疾病类别缺乏识别能力。Adlung等
[39]的系统性综述证实,模型在不同机构或设备采集的数据上性能波动显著(如敏感性从90.2%降至67.7%)。这些算法脆弱性可能引发临床安全风险,包括误诊、过度治疗及决策者对技术的过度依赖
[38-39]。
4.2 临床验证与整合障碍
临床证据缺口阻碍实际应用。当前皮肤病AI研究存在明显的临床证据缺口。多数研究聚焦于算法与医生的诊断准确性对比(人
vs. 计算机),而缺乏前瞻性临床试验验证人机协作模式(人
vs. 人+计算机)的临床效益。Vasey等
[40]对37项研究的系统性综述显示,仅12%的ML辅助临床决策支持系统研究进行了前瞻性验证,且在代表性临床环境中,80%的研究未发现人机协作模式显著改善医生诊断性能。Krakowski等
[41]的Meta分析进一步指出,尽管AI辅助可将皮肤癌诊断的敏感性从74.8%(95%CI:68.6%~80.1%)提升至81.1%(95%CI: 74.4%~86.5%),但纳入的10项研究中仅4项为前瞻性临床研究,且多数在实验环境中进行,难以反映真实临床决策场景。这种研究设计的局限性导致AI工具在实际临床应用中的效果尚存不确定性,亟需开展大规模、多中心、前瞻性的随机对照试验,以充分评估人机协作模式对患者结局的实际影响。技术整合亦存在困难:现有系统多针对单一模态数据设计,难以适配临床专家依赖的多模态决策流程(如结合影像、病史和实验室数据)。Warner等
[42]指出,多模态ML在表示、融合、对齐、转换和协同学习这5个层面均面临独特挑战,尤其是在生物医学领域,不同模态数据的异质性(如图像的像素空间与实验室数据的向量空间)增加了整合难度。Liu等
[43]在伤口修复领域的综述中强调,当前AI应用缺乏标准化数据收集指南,各医疗机构基于自身需求开发的数据采集方法差异显著,进一步阻碍了多模态数据的有效整合与模型泛化。此外,算法缺乏透明度(“黑箱”特性)显著降低临床医生对人工智能系统的信任度。Chanda等
[44]通过一项纳入116名皮肤科医生的三阶段读片研究证实,提供领域特异性解释的可解释人工智能(explainable artificial intelligence, XAI)系统能显著增强医生对AI决策的信心和诊断确定性,相比之下,传统“黑箱”AI支持未能提升医生信任。同时,现有AI系统与医院电子病历系统的兼容性不足,严重制约了其在工作流中的无缝整合。Dovigi等
[45]指出,AI技术与现有医疗基础设施的互操作性缺陷以及临床工作流程适配性不足是制约皮肤科AI临床应用的关键障碍。Coorey等
[46]在心血管数字孪生领域的综述中也强调,数据融合、系统互操作性及临床决策工具的人机协作整合,是精准医学范式下AI技术转化面临的核心挑战。
4.3 伦理与监管考量
伦理风险与标准缺失构成关键瓶颈。数据隐私和安全问题突出,尤其在使用患者图像构建公共数据集时,存在隐私泄露风险
[47-48]。监管框架尚未成熟,缺乏统一的开发与评估标准以确保算法可靠性、公平性和安全性
[49-50]。远程皮肤病学应用中,AI工具的监管真空可能放大医疗差异,且患者对AI使用的知情同意机制尚未规范
[47-48]。此外,AI辅助诊断的责任归属模糊,误诊导致的过度治疗或延误治疗均需明确权责界定
[48]。
5 未来展望与发展方向
5.1 推动高质量数据生态建设
构建高质量、多样化且无偏倚的数据集是提升ML模型泛化能力与临床实用性的基石。现有研究表明,用于训练皮肤病诊断AI算法的数据集普遍存在描述不足的问题,且存在潜在偏倚来源,其中深色皮肤及罕见疾病图像的代表性严重不足
[48]。这直接导致现有最先进的皮肤病AI模型在深色皮肤及罕见疾病上的表现存在显著局限。为解决肤色多样性问题,研究者创建了公开、经专家整理且病理学确认的多样化皮肤病图像数据集,但结果显示,即使在该数据集上,模型性能仍有待提升,且标注数据的皮肤科医生在深色皮肤图像上的诊断准确性亦较低
[7, 33]。公开数据集因其更易获取和用于基准测试,对新模型的开发和评估贡献更大,但其特征描述(如肤色分布、图像来源、疾病谱)往往稀疏,且缺乏对潜在偏倚的评估。因此,未来亟需:①系统性收集与标注:大规模收集涵盖广泛肤色类型(需使用可靠工具如Fitzpatrick Skin Type、Monk Skin Tone和Pantone SkinTone Guide进行标准化评估
[51])、不同疾病谱(包括高发与罕见病)、多地域来源的皮肤病图像及关联临床数据(如患者元数据、病理结果、治疗反应、长期预后);②标准化与透明度:强制要求数据集在发布时提供详尽的元数据描述,包括人口统计学特征(年龄、性别、种族/肤色)、图像采集条件、疾病分布、标注方法及潜在局限性评估,以增强数据集的透明度、可重复性和偏倚识别能力
[33, 48];③构建动态数据平台:推动建立类似DataDerm的纵向专科疾病登记库,持续收集真实世界诊疗数据,为模型训练、验证与迭代更新提供源源不断的高质量数据流
[52]。高质量数据生态的建设是确保AI算法公平性、可靠性和最终临床有效性的前提。
5.2 开发以临床需求为导向的可靠系统
未来的ML系统必须紧扣真实临床场景的核心需求进行设计与验证,确保其可靠性、可解释性,并最终改善患者结局。研究证实,将人类偏好(如对误诊后果的权衡)嵌入模型设计(例如采用非均匀奖励的RL),可显著提升诊断准确率并优化管理决策,效果优于传统监督学习
[8, 53]。在皮肤癌的诊断中,AI辅助决策支持已将皮肤科医师诊断正确率提高12.0%,最优管理决策率从57.4%升至65.3%
[8]。然而,模型可靠性不能仅看单一指标(如AUC),更需在临床现场接受严格考验:①对训练集未覆盖疾病图像的识别能力;②不同来源图像(临床照片
vs. 网络图片)的稳定性;③数据分布偏移下的鲁棒性
[38, 54]。同时,XAI是建立临床信任的关键。提供领域特异性解释的XAI系统可显著增强皮肤科医生对AI决策的信心
[44, 55]。因此,开发符合临床推理逻辑、可阐明决策依据的模型至关重要,例如结合原型网络与决策树的分层原型决策树(hierarchical prototype decision tree, HPDT),可优先减少严重误分类并辅助临床决策
[56]。此外,系统设计必须无缝嵌入临床工作流。实时评估皮肤照片质量并指导患者重拍的AI工具,已证实可显著提升远程医疗图像质量
[51, 53]。最后,模型部署并非终点。ML算法对环境敏感,性能可能随时间衰减。因此,须建立持续监控与更新机制,定期利用新数据重新评估和优化模型,确保长期有效性与安全性
[57-58]。只有以解决实际临床痛点(提高诊断效率、优化治疗方案、预测复发风险、改善患者管理)为目标,并经过真实世界严格验证的可靠、可解释且可持续维护的系统,才能推动ML在皮肤病临床决策中发挥实质作用。
总体而言,ML辅助临床决策在皮肤病学领域展现出巨大潜力,但其临床转化与广泛应用仍面临关键挑战。未来研究需聚焦于构建更完善的数据生态与开发真正满足临床需求的可靠系统。
山东省数智医疗科创菁英计划重点项目(sdkldto20260006)