黑色素瘤是一种具有高度侵袭性的恶性肿瘤,其全球发病率呈持续上升趋势。与西方人群黑色素瘤亚型以皮肤型为主不同,中国黑色素瘤患者呈现独特的流行病学特征,即以肢端型为主要亚型。目前,中国黑色素瘤总体发病率相对较低,但年增长率高达3%~5%。更为严峻的是,肢端型黑色素瘤侵袭性更强、预后更差,导致中国黑色素瘤IV期患者的5年生存率仅为4.6%,显著低于西方国家22.5%的平均水平
[1-4]。这种显著的疾病谱系和生存结局差异,迫切需要基于本土人群的高质量数据资源分析,以支撑针对性的病因学与诊疗转化研究。
多模态数据的深度整合是突破黑色素瘤精准诊疗瓶颈的关键。然而,现有的数据资源在支持中国人群特异性研究方面仍存在显著的局限性:一方面,美国国家癌症数据库(the National Cancer Database,NCDB)和监测、流行病学和最终结果(the Surveillance,Epidemiology,and End Results,SEER)等国际主流数据库样本量巨大,但缺乏针对肢端型等亚洲人群黑色素瘤高发亚型的特异性字段,且主要局限于结构化临床数据,难以支撑基于影像组学或病理组学的深度数据挖掘
[5];另一方面,国内现有的专病数据库多侧重于临床流行病学特征的描述,缺乏对原始医学影像数据及数字病理全切片的系统性留存与关联,导致临床表型与多模态数据之间存在严重的“数据断层”
[6-7]。此外,现有的前瞻性队列研究受限于单中心样本量不足及数据模态完整性欠佳,难以满足开发高精度人工智能(artificial intelligence,AI)预测模型对数据规模与多样性的需求。
为应对上述挑战,本研究构建了中国首个黑色素瘤多模态专病队列。该队列依托区域性诊疗中心,系统整合了临床诊疗记录、放射影像(CT/MRI)、数字病理、分子检测及长期随访结局等多源异构数据,创新性地采用自动化抽取-转换-加载(extract-transform-load,ETL)流程与AI技术相结合的混合架构,实现了对非结构化临床文本与影像数据的高效提取与标准化治理。本队列的建立旨在填补针对中国人群特征的高质量多模态数据空白,为解析肢端型黑色素瘤的预后机制、挖掘新型生物标志物及开发AI辅助临床决策系统提供标准化的数据平台。
1 对象与方法
1.1 伦理声明与安全
本研究严格遵循《赫尔辛基宣言》原则,研究方案已获得中南大学湘雅医院伦理委员会批准(审批号:202504037)。为确保研究参与者隐私与数据安全,本研究建立了涵盖数据采集、存储、传输及使用的全生命周期安全管理体系。在数据入库前,删除姓名、身份证号等直接个人身份信息,并采用通用唯一识别码(universally unique identifier,UUID)作为患者的唯一索引进行替代。在数据存储与传输环节,统一采用国密SM4分组密码算法对敏感字段进行高强度加密
[8],并执行“每日增量备份+每周全量备份”策略,确保数据的机密性与可恢复性。数据访问设置基于角色的三级权限管理(数据管理员、项目研究员、外部访问者),所有访问请求需通过线上申请系统提交,经伦理委员会与数据管理委员会双重审批后方可授权。部署全链路日志审计系统,对数据的查询、下载、修改等操作进行实时记录与留痕。系统内置异常行为监测模块,对批量下载、非工作时间访问等潜在风险行为触发实时告警。此外,针对未来的多中心协作需求,确立了以联邦学习为核心的技术路线,遵循“数据不动模型动”的原则,在“原始数据不出域”的前提下实现联合建模,最大程度地保障数据主权与隐私安全。
1.2 对象
本研究所有数据来源于中南大学湘雅医院,队列纳入了2016年4月1日至2024年9月30日在该院就诊并经病理学检查确诊为黑色素瘤的患者。纳入标准:1)经病理组织学首次确诊为黑色素瘤;2)对本研究内容知情同意。排除标准:1)关键临床信息或模态数据严重缺失;2)同时患有其他恶性肿瘤;3)未成年(纳入时年龄<18岁);4)妊娠期或哺乳期女性。截至2024年9月30日,队列共纳入符合纳入与排除标准的黑色素瘤患者1 036例。
1.3 方法
1.3.1 标准化数据集制订
为保证数据的结构化、标准化和可操作性,本研究制订了标准化数据集。通过剖析SEER癌症统计数据库的构建模式
[9-10],并参考国内外行业标准
[11-13],最终构建了一个包含16个核心模块、308个结构化数据元的标准化数据采集体系(
表1)。该体系涵盖人口学、临床诊疗、影像学、病理学、分子检测及随访等维度,并针对黑色素瘤专科特征,设置了Breslow厚度、溃疡状态、
B-Raf原癌基因丝氨酸/苏氨酸蛋白激酶V600E突变(
B-Raf proto-oncogene serine/threonine kinase,
BRAFV600E )基因及干细胞生长因子受体(stem cell growth factor receptor,
c-KIT)基因突变等特异性数据元。数据元的定义、值域及逻辑规则均遵循相关国际与国内标准。
1.3.2 数据采集与治理
本研究实施“ETL+AI”的混合数据治理策略,旨在实现多源异构数据的自动化采集、深度结构化与标准化质量控制。具体流程包括3个关键环节: 1)结构化数据自动集成。搭建自动化ETL管道
[14],系统会定期从医院信息系统(hospital information system,HIS)、实验室信息系统(laboratory information system,LIS)等业务端自动抓取临床诊疗数据;通过预设的规则引擎对原始数据进行清洗(如剔除重复记录、逻辑错误修正)与标准化处理,统一国际疾病分类(international classification of diseases,ICD)编码、药物通用名及计量单位,并利用唯一患者主索引(enterprise master patient index,EMPI)实现跨系统的多源数据关联与融合;处理后的标准化数据被实时存入专病队列数据库。2)非结构化特征智能提取。针对病理报告、影像报告、手术记录等非结构化文本,应用基于Transformer架构的自然语言处理(natural language processing,NLP)模型实施关键实体抽取。经人工抽样验证,该模型对Breslow厚度、溃疡状态、基因突变位点等核心字段的提取准确率均>90%。针对超声、CT、MRI等原始医学影像数据,利用深度卷积神经网络进行图像标准化处理、病灶感兴趣区(region of interest,ROI)的初步分割及影像组学特征提取,为后续构建多模态融合模型奠定基础。3)数据质量控制与缺失值处理。建立“临床-工程”双重校验机制
[15],临床医师负责审核数据的医学逻辑性(如TNM分期与病理描述的一致性),数据工程师负责校验数据的完整性与规范性(如字段类型、值域范围)。针对数据缺失问题,采取分层处理策略:在原始数据库层面,保留“缺失(Null)”状态以确保记录的真实性;在构建分析模型时,仅针对特定任务采用多重插补法生成完整训练集,以最大限度地控制信息偏倚。
1.3.3 随访方案
专病队列旨在通过随访来动态监测患者的长期临床结局,内容涵盖主要研究终点和次要研究终点。1)主要研究终点。主要研究终点为总生存期(overall survival,OS)和无进展生存期(progression free survival,PFS)。OS定义为从首次病理确诊日期至任何原因导致的死亡日期的时间跨度。对于随访终点截止时仍存活的患者,生存时间计算至末次有效随访日期。PFS定义为从首次病理确诊日期至首次记录的疾病进展(根据影像学或临床证据判断)、局部或区域复发、远处转移或任何原因导致的死亡的时间跨度。未发生上述事件的患者,PFS计算至末次有效随访日期。2)次要研究终点。严格依据实体瘤疗效评价标准1.1版(the Response Evaluation Criteria in Solid Tumors version 1.1,RECIST 1.1)进行实体瘤疗效评估,分为完全缓解(complete response,CR)、部分缓解(partial response,PR)、疾病稳定(stable disease,SD)和疾病进展(progressive disease,PD)。复发与转移主要通过定期的影像学检查(如CT、MRI、超声)和临床体格检查进行监测。治疗相关不良反应则依据美国国家癌症研究所常见不良事件评价标准5.0版(the Common Terminology Criteria for Adverse Events version 5.0,CTCAE 5.0)进行记录和分级,涵盖血液学毒性、肝肾功能损伤、免疫相关不良反应等。采用卡诺夫斯基功能状态(the Karnofsky performance status,KPS)评分和美国东部肿瘤协作组(the Eastern Cooperative Oncology Group,ECOG)体力状况评分来动态评估和量化患者在治疗过程中的功能状态与生活自理能力。3)随访频率与随访有效标准。随访形式采取主动随访模式,包括门诊复查、电话联系、微信沟通及智能随访系统等方式。患者术后或初始治疗后,随访频率为每3~6个月1次,进入稳定期后延长至每年1次。随访有效定义为:至少具备1次有效随访记录,并记录明确的结局状态(如死亡或疾病进展)或末次随访时间。
1.4 统计学处理
采用SPSS 26.0软件进行统计分析。基线资料采用描述性统计学分析,符合正态分布的计量资料以均数±标准差表示,非正态分布的计量资料(如Breslow厚度)以中位数(第1四分位数,第3四分位数)表示;分类变量(计数资料)以频数(百分比)表示。
2 结 果
2.1 队列构建流程
本研究采用系统化、标准化的筛选与入组流程(
图1)构建湘雅黑色素瘤多模态专病队列,依托中南大学湘雅医院病理系统,初筛获得潜在黑色素瘤病例2 812例。严格遵循预设的纳入与排除标准,经“临床-病理”联合审核,剔除重复记录及核心资料缺失者,最终纳入符合分析条件的黑色素瘤患者共计1 036例。针对入组病例,研究团队成功部署了包含16个核心模块的标准化数据集采集方案。通过实施“ETL+AI”混合治理策略,系统有效地实现了多源异构数据的集成:结构化临床数据通过ETL管道实现了自动化清洗与归一化;非结构化病理与影像文本则经由NLP模型完成了高精度的信息提取。所有入库数据均通过了“临床-工程”双重校验。为保障队列的时效性,本研究建立了多渠道动态随访机制,通过整合门诊复查、通信联络及智能随访小程序,实现对患者生存状态(OS/PFS)、复发/转移模式及体力状况(KPS/ECOG)的持续追踪。
2.2 多模态数据的规模和构成
基于入组队列,本研究成功构建了大规模多模态黑色素瘤专病数据集,目前数据库总数据量已达20.5 TB。多模态数据资源概览(
图2)显示:1)影像学与病理组学数据。本队列实现了“像素级”原始数据的深度留存,整合了数字病理全切片图像(whole slide images,WSI)共计8 536张,其中包括851例患者的苏木精-伊红(hematoxylin and eosin,HE)染色切片及550例患者的免疫组织化学(immunohistochemistry,IHC)染色切片;组建了包含CT、MRI及超声的丰富放射影像库,存储符合医学数字成像与通信(digital imaging and communications in medicine,DICOM)标准的原始影像数据共计5 084例次;收录了治疗前后的临床大体照片及皮肤镜图像共计7 020张。2)临床文本与分子数据。利用NLP技术从病理、手术及出院记录中提取非结构化信息,累计整合数据点超过35万个,实现了对患者临床特征的高颗粒度描述。此外,聚焦黑色素瘤关键驱动基因,系统整合了包括
BRAFV600E 、
c-KIT等在内的基因突变检测结果。 3)随访数据。截至2024年9月30日,队列中已有372例患者完成了符合定义的系统性随访(即拥有至少1次有效随访记录且有明确结局状态)。随访数据完整覆盖了OS、PFS、复发/转移模式及治疗应答情况。
2.3 全队列人群的基线临床特征
本研究最终纳入符合标准的黑色素瘤患者共1 036例,其人口统计学与临床病理基线特征(
表2)表现为:1)全队列中,男514例(49.614%),女522例(50.386%),性别比例接近1꞉1,分布较为均衡;患者年龄为(60.2±13.7)岁,≥60岁患者549例(52.992%),比例最高。2)在898例具有明确临床分型的患者中,肢端型黑色素瘤606例(67.483%),为主要亚型,具有鲜明的中国人群特征。3)在拥有完整Breslow厚度数据的678例患者中,Breslow厚度中位数值为3.25 mm,提示初诊时肿瘤负荷较重。4)在612例具有明确Clark分级数据的患者中,Clark分级IV患者277例(45.261%),为主要分级。5)在880例具有明确临床TNM(clinical TNM,cTNM)分期数据的患者中,II期患者329例(37.386%),比例最高。6)驱动基因检测结果显示,
BRAFV600E 突变检出率为21.786%(61/280),
c-KIT突变检出率为9.459%(7/74)。7)在治疗模式上,全队列有217例(20.946%)患者接受免疫治疗,59例(5.695%)患者接受靶向治疗。
2.4 随访人群中复发/转移及死亡队列的基线特征
在完成系统随访的372例患者中,共记录死亡事件129例(34.677%),复发/转移事件86例(23.118%);死亡队列随访时间最短3个月,最长77个月,中位随访时间21个月;复发/转移队列随访时间最短2个月,最长83个月,中位随访时间15个月。死亡队列和复发/转移队列的人口统计学与临床病理基线特征(
表3)表现为:死亡队列人群年龄为(63.86±13.26)岁,复发/转移队列人群年龄为(60.11±13.41)岁;2个队列临床亚型均以肢端型为主,死亡队列中肢端型比例为76.744%,复发/转移队列中肢端型比例为80.233%;死亡队列Breslow厚度中位数值为4.00 mm,略高于复发/转移队列的3.75 mm;2个队列Clark分级均以IV级为主,cTNM分期以晚期(III~IV期)为主;死亡队列中
BRAFV600E 突变检出率为16.071%(9/56),复发/转移队列
BRAFV600E 突变检出率为12.195%(5/41);死亡队列有51例(39.535%)患者接受免疫治疗,复发/转移队列有27例(31.395%)患者接受免疫治疗。
3 讨 论
本研究系统阐述了国内首个聚焦中国人群、以肢端型黑色素瘤为主要亚型的多模态专病队列的构建流程与初步基线特征,实现了中国黑色素瘤人群多源异构临床数据的系统化与标准化整合。相较于肿瘤与癌症基因组图谱(The Cancer Genome Atlas,TCGA)、SEER等国际数据库以皮肤型黑色素瘤 (>90%)为主的特征表现,本队列黑色素瘤肢端型比例高达67.483%,客观反映了亚洲人群的疾病谱特征,有效填补了全球肢端型黑色素瘤的数据缺口,为中国患者的临床实践提供了更具针对性的参考依据。在国内,以北京大学肿瘤医院为代表的顶尖中心已建立了大规模临床基因组学队列,为揭示中国人群肢端型及黏膜型黑色素瘤的驱动基因突变谱做出重要贡献
[17],但现有队列多侧重“临床预后+基因测序”的关联分析,缺乏对临床图像、原始影像数据及病理全切片的系统性留存,本队列系统整合的多模态数据则与国内现有队列形成优势互补。此外,针对真实世界医疗数据非结构化程度高的问题,本队列应用“ETL+AI”混合治理模式,利用基于Transformer的NLP技术,实现了对病理报告等非结构化特征的高效提取与标准化
[18-19],为后续的数据挖掘奠定坚实基础。
基于已整合的标准化多模态数据资源,本课题组未来将重点聚焦于3个关键方向:1)构建基于多组学协同的深度学习预后模型。针对肢端型黑色素瘤异质性高的特点,利用深度学习算法对病理WSI的微环境特征和放射影像的影像组学特征进行高维提取,并结合基因突变谱与临床病理参数进行多模态融合,旨在开发新型综合预后评分系统,以更精准地识别复发/转移高风险人群。2)开展免疫治疗应答的预测标志物研究。依托队列中详尽的治疗方案记录信息与RECIST疗效评估数据,重点探索多模态数据特征与免疫检查点抑制剂疗效及耐药性的关联。通过构建预测模型,能够早期预测治疗应答及严重不良反应的复合生物标志物,为完善个体化的精准用药策略提供客观依据。3)生成高质量的真实世界证据。随着随访时间的延长和数据的持续积累,依托队列开展长周期的真实世界研究,重点比较不同治疗模式在中国肢端型黑色素瘤患者中的长期生存获益,推动数据资源向临床诊疗规范的有效转化。
本队列仍存在一定的局限性:1)单中心选择性偏倚。中南大学湘雅医院虽为区域性黑色素瘤诊疗中心,但队列人群的外部泛化能力仍需更广泛的多中心研究进行验证。2)随访数据的完整性与时效性。目前随访数据的中位时间有待进一步延长,以便获得更可靠的长期生存数据。面对上述挑战,本队列将从2个主要方向深入发展:1)推动多中心协作,明确数据共享政策。遵循“数据不动模型动”的原则,在严格保护患者隐私和符合伦理规范的前提下,制订分层级的数据共享策略。对于高度敏感数据,主要通过联邦学习技术支持外部协作;对于经深度脱敏的衍生数据(如特征向量、组学数据)与分析代码,计划在未来通过可信数据平台向合规的研究者开放,并明确申请流程与使用规范。本课题团队已初步与国内多家三级甲等医院展开协作,探索联合训练模型以丰富样本多样性的具体模式,旨在解决单中心数据偏倚问题,进一步验证模型的泛化能力
[20]。2)持续扩充队列规模与数据深度。未来将结合单细胞测序、空间转录组等新兴组学技术,构建“多组学+多模态”的整合型数据资源,以持续推动更深层次的转化研究
[21-22]。
综上所述,本研究构建了聚焦中国人群特征的黑色素瘤(以肢端型为主)多模态专病队列,通过“ETL+AI”混合治理模式实现了多源异构数据的深度整合与标准化,有效填补了全球针对亚洲高发黑色素瘤亚型在像素级多模态数据资源上的空白,为开展真实世界研究、挖掘新型预后生物标志物及开发AI辅助诊疗模型提供了重要数据,对推动中国黑色素瘤精准诊疗体系的建立具有重要的转化意义。
芙蓉实验室科技攻关项目(2024PT5110┫。This work was supported by the Grant from the Scientific Research Program of Furong Laboratory)
芙蓉实验室科技攻关项目(China ┣2024PT5110)