面向黑色素瘤研究的多模态专病队列:构建、治理与初步报告

谢东城 ,  袁勇翔 ,  赵爽 ,  郑巍 ,  鲁慧 ,  黄凯

中南大学学报(医学版) ›› 2025, Vol. 50 ›› Issue (11) : 1979 -1989.

PDF (1728KB)
中南大学学报(医学版) ›› 2025, Vol. 50 ›› Issue (11) : 1979 -1989. DOI: 10.11817/j.issn.1672-7347.2025.250590
皮肤肿瘤及免疫相关性皮肤疾病

面向黑色素瘤研究的多模态专病队列:构建、治理与初步报告

作者信息 +

A multimodal disease-specific cohort for melanoma research: Construction, governance, and preliminary report

Author information +
文章历史 +
PDF (1769K)

摘要

目的 中国人群肢端型黑色素瘤高发且预后不良,目前尚缺乏多模态高质量研究数据。本研究旨在构建具有中国人群代表性的多模态专病队列,为解析疾病特征及预后机制提供数据基础。 方法 采用单中心前瞻性研究设计,连续纳入中南大学湘雅医院2016年4月至2024年9月经病理学检查确诊的黑色素瘤患者为研究对象,排除未成年人、妊娠期及哺乳期女性。基于国际标准构建包含16个核心模块的标准化数据集。数据治理采用自动化抽取-转换-加载(extract-transform-load,ETL)流程与人工智能(artificial intelligence,AI)相结合的混合架构,利用基于Transformer的自然语言处理(natural language processing,NLP)模型提取病理文本特征等,并结合深度学习模型处理医学影像等像素级数据。采用临床与工程双重校验机制保证数据质量,随访结局评估遵循实体瘤疗效评价标准1.1版和常见不良事件评价标准5.0版。 结果 多模态专病队列共纳入1 036例黑色素瘤患者,男514例(49.614%),女522例(50.386%),年龄为(60.2±13.7)岁。在898例具有明确临床分型的患者中,肢端型黑色素瘤606例(67.483%),为主要亚型。在拥有完整Breslow厚度数据的678例患者中,Breslow厚度中位数值为3.25 mm。在612例具有明确Clark分级数据的患者中,Clark分级IV患者277例(45.261%),为主要分级。在880例具有明确临床TNM(clinical TNM,cTNM)分期数据的患者中,II期患者329例(37.386%),比例最高。驱动基因检测结果显示,B-Raf原癌基因丝氨酸/苏氨酸蛋白激酶V600E突变(B-Raf proto-oncogene serine/threonine kinase,BRAFV600E )检出率为21.786%(61/280),干细胞生长因子受体(stem cell growth factor receptor,c-KIT)突变检出率为9.459%(7/74)。在治疗模式上,全队列有217例(20.946%)患者接受免疫治疗,59例(5.695%)患者接受靶向治疗。在完成系统随访的372例患者中,共记录死亡事件129例(34.677%),复发/转移事件86例(23.118%);肢端型、Clark分级IV及cTNM分期III~IV患者为死亡、复发/转移的主要群体。队列整合了8 536张数字病理全切片图像(whole slide images,WSI)及5 084例次符合医学数字成像与通信(digital imaging and communications in medicine,DICOM)标准的原始影像数据等深层多模态数据,结构化数据点超 35万个,数据库总数据量达20.5 TB。 结论 该多模态专病队列整合了中国人群特异的临床、影像、病理和分子信息等数据资源,为开展真实世界研究、挖掘预后生物标志物,以及开发AI辅助诊疗模型提供了重要的数据基础。

Abstract

Objective Given the high incidence, poor prognosis, and scarcity of high-quality multimodal research data for acral melanoma in the Chinese population, this study aims to build a representative multimodal disease-specific cohort to provide a high-quality data foundation for characterizing disease features and exploring mechanisms of prognosis. Methods This single-center prospective cohort was constructed by consecutively enrolling melanoma patients with pathological confirmation at Xiangya Hospital of Central South University between April 2016 and September 2024, while excluding minors and pregnant or lactating women. A standardized dataset comprising 16 internationally aligned core modules was built following global ontologies and clinical data standards. Data governance integrated a hybrid automated extract-transform-load (ETL) and artificial intelligence (AI)-assisted architecture. Pathology narratives were processed using Transformer-based natural language processing (NLP) models to extract textual and morphologic features, while raw imaging data were handled with deep learning pipelines for pixel-level modeling. Data quality was ensured through dual clinical-engineering validation, and outcomes were adjudicated using RECIST 1.1 and CTCAE v5.0 criteria. Results The cohort included 1 036 melanoma patients, consisting of 514 males (49.614%) and 522 females (50.386%), with a mean age of (60.2±13.7) years. Among 898 patients with a known clinical subtype, 606 (67.483%) were acral melanoma, the dominant subtype. In 678 patients with complete Breslow thickness data, the median Breslow thickness was 3.25 mm. Of 612 patients with recorded Clark levels, 277 (45.261%) were Clark level IV, the most frequent category. Among 880 patients with available clinical TNM (cTNM) staging, 329 (37.386%) were stage II, representing the largest proportion; Driver mutation profiling showed BRAFV600E positivity of 21.786% (61/280) and c-KIT mutation rate of 9.459% (7/74). Regarding treatment patterns, 217 patients (20.946%) received immunotherapy and 59 (5.695%) received targeted therapy. In 372 patients with complete systematic follow-up, there were 129 deaths (34.677%) and 86 recurrence/metastasis events (23.118%). Acral subtype, Clark level IV, and stage III-IV cTNM patients represented the major at-risk groups for death and recurrence/metastasis. The cohort integrated 8 536 digital pathology whole-slide images (WSI), 5 084 raw imaging data complying with Digital Imaging and Communications in Medicine (DICOM) imaging encounters, over 350 000 structured clinical-molecular data points, and a total data volume of 20.5 TB. Conclusion This melanoma-specific multimodal cohort captures population-specific clinical, imaging, digital pathology, and molecular features for the Chinese population. It establishes a scalable, governed real-world research resource to enable comparative-effectiveness studies, prognostic biomarker discovery, and future development of AI-assisted diagnostic and prognostic models.

Graphical abstract

关键词

黑色素瘤 / 多模态专病队列 / 数据治理 / 真实世界研究 / 人工智能

Key words

melanoma / multimodal disease-specific cohort / data governance / real-world research / artificial intelligence

引用本文

引用格式 ▾
谢东城,袁勇翔,赵爽,郑巍,鲁慧,黄凯. 面向黑色素瘤研究的多模态专病队列:构建、治理与初步报告[J]. 中南大学学报(医学版), 2025, 50(11): 1979-1989 DOI:10.11817/j.issn.1672-7347.2025.250590

登录浏览全文

4963

注册一个新账户 忘记密码

黑色素瘤是一种具有高度侵袭性的恶性肿瘤,其全球发病率呈持续上升趋势。与西方人群黑色素瘤亚型以皮肤型为主不同,中国黑色素瘤患者呈现独特的流行病学特征,即以肢端型为主要亚型。目前,中国黑色素瘤总体发病率相对较低,但年增长率高达3%~5%。更为严峻的是,肢端型黑色素瘤侵袭性更强、预后更差,导致中国黑色素瘤IV期患者的5年生存率仅为4.6%,显著低于西方国家22.5%的平均水平[1-4]。这种显著的疾病谱系和生存结局差异,迫切需要基于本土人群的高质量数据资源分析,以支撑针对性的病因学与诊疗转化研究。
多模态数据的深度整合是突破黑色素瘤精准诊疗瓶颈的关键。然而,现有的数据资源在支持中国人群特异性研究方面仍存在显著的局限性:一方面,美国国家癌症数据库(the National Cancer Database,NCDB)和监测、流行病学和最终结果(the Surveillance,Epidemiology,and End Results,SEER)等国际主流数据库样本量巨大,但缺乏针对肢端型等亚洲人群黑色素瘤高发亚型的特异性字段,且主要局限于结构化临床数据,难以支撑基于影像组学或病理组学的深度数据挖掘[5];另一方面,国内现有的专病数据库多侧重于临床流行病学特征的描述,缺乏对原始医学影像数据及数字病理全切片的系统性留存与关联,导致临床表型与多模态数据之间存在严重的“数据断层”[6-7]。此外,现有的前瞻性队列研究受限于单中心样本量不足及数据模态完整性欠佳,难以满足开发高精度人工智能(artificial intelligence,AI)预测模型对数据规模与多样性的需求。
为应对上述挑战,本研究构建了中国首个黑色素瘤多模态专病队列。该队列依托区域性诊疗中心,系统整合了临床诊疗记录、放射影像(CT/MRI)、数字病理、分子检测及长期随访结局等多源异构数据,创新性地采用自动化抽取-转换-加载(extract-transform-load,ETL)流程与AI技术相结合的混合架构,实现了对非结构化临床文本与影像数据的高效提取与标准化治理。本队列的建立旨在填补针对中国人群特征的高质量多模态数据空白,为解析肢端型黑色素瘤的预后机制、挖掘新型生物标志物及开发AI辅助临床决策系统提供标准化的数据平台。

1 对象与方法

1.1 伦理声明与安全

本研究严格遵循《赫尔辛基宣言》原则,研究方案已获得中南大学湘雅医院伦理委员会批准(审批号:202504037)。为确保研究参与者隐私与数据安全,本研究建立了涵盖数据采集、存储、传输及使用的全生命周期安全管理体系。在数据入库前,删除姓名、身份证号等直接个人身份信息,并采用通用唯一识别码(universally unique identifier,UUID)作为患者的唯一索引进行替代。在数据存储与传输环节,统一采用国密SM4分组密码算法对敏感字段进行高强度加密[8],并执行“每日增量备份+每周全量备份”策略,确保数据的机密性与可恢复性。数据访问设置基于角色的三级权限管理(数据管理员、项目研究员、外部访问者),所有访问请求需通过线上申请系统提交,经伦理委员会与数据管理委员会双重审批后方可授权。部署全链路日志审计系统,对数据的查询、下载、修改等操作进行实时记录与留痕。系统内置异常行为监测模块,对批量下载、非工作时间访问等潜在风险行为触发实时告警。此外,针对未来的多中心协作需求,确立了以联邦学习为核心的技术路线,遵循“数据不动模型动”的原则,在“原始数据不出域”的前提下实现联合建模,最大程度地保障数据主权与隐私安全。

1.2 对象

本研究所有数据来源于中南大学湘雅医院,队列纳入了2016年4月1日至2024年9月30日在该院就诊并经病理学检查确诊为黑色素瘤的患者。纳入标准:1)经病理组织学首次确诊为黑色素瘤;2)对本研究内容知情同意。排除标准:1)关键临床信息或模态数据严重缺失;2)同时患有其他恶性肿瘤;3)未成年(纳入时年龄<18岁);4)妊娠期或哺乳期女性。截至2024年9月30日,队列共纳入符合纳入与排除标准的黑色素瘤患者1 036例。

1.3 方法

1.3.1 标准化数据集制订

为保证数据的结构化、标准化和可操作性,本研究制订了标准化数据集。通过剖析SEER癌症统计数据库的构建模式[9-10],并参考国内外行业标准[11-13],最终构建了一个包含16个核心模块、308个结构化数据元的标准化数据采集体系(表1)。该体系涵盖人口学、临床诊疗、影像学、病理学、分子检测及随访等维度,并针对黑色素瘤专科特征,设置了Breslow厚度、溃疡状态、B-Raf原癌基因丝氨酸/苏氨酸蛋白激酶V600E突变(B-Raf proto-oncogene serine/threonine kinase,BRAFV600E )基因及干细胞生长因子受体(stem cell growth factor receptor,c-KIT)基因突变等特异性数据元。数据元的定义、值域及逻辑规则均遵循相关国际与国内标准。

1.3.2 数据采集与治理

本研究实施“ETL+AI”的混合数据治理策略,旨在实现多源异构数据的自动化采集、深度结构化与标准化质量控制。具体流程包括3个关键环节: 1)结构化数据自动集成。搭建自动化ETL管道[14],系统会定期从医院信息系统(hospital information system,HIS)、实验室信息系统(laboratory information system,LIS)等业务端自动抓取临床诊疗数据;通过预设的规则引擎对原始数据进行清洗(如剔除重复记录、逻辑错误修正)与标准化处理,统一国际疾病分类(international classification of diseases,ICD)编码、药物通用名及计量单位,并利用唯一患者主索引(enterprise master patient index,EMPI)实现跨系统的多源数据关联与融合;处理后的标准化数据被实时存入专病队列数据库。2)非结构化特征智能提取。针对病理报告、影像报告、手术记录等非结构化文本,应用基于Transformer架构的自然语言处理(natural language processing,NLP)模型实施关键实体抽取。经人工抽样验证,该模型对Breslow厚度、溃疡状态、基因突变位点等核心字段的提取准确率均>90%。针对超声、CT、MRI等原始医学影像数据,利用深度卷积神经网络进行图像标准化处理、病灶感兴趣区(region of interest,ROI)的初步分割及影像组学特征提取,为后续构建多模态融合模型奠定基础。3)数据质量控制与缺失值处理。建立“临床-工程”双重校验机制[15],临床医师负责审核数据的医学逻辑性(如TNM分期与病理描述的一致性),数据工程师负责校验数据的完整性与规范性(如字段类型、值域范围)。针对数据缺失问题,采取分层处理策略:在原始数据库层面,保留“缺失(Null)”状态以确保记录的真实性;在构建分析模型时,仅针对特定任务采用多重插补法生成完整训练集,以最大限度地控制信息偏倚。

1.3.3 随访方案

专病队列旨在通过随访来动态监测患者的长期临床结局,内容涵盖主要研究终点和次要研究终点。1)主要研究终点。主要研究终点为总生存期(overall survival,OS)和无进展生存期(progression free survival,PFS)。OS定义为从首次病理确诊日期至任何原因导致的死亡日期的时间跨度。对于随访终点截止时仍存活的患者,生存时间计算至末次有效随访日期。PFS定义为从首次病理确诊日期至首次记录的疾病进展(根据影像学或临床证据判断)、局部或区域复发、远处转移或任何原因导致的死亡的时间跨度。未发生上述事件的患者,PFS计算至末次有效随访日期。2)次要研究终点。严格依据实体瘤疗效评价标准1.1版(the Response Evaluation Criteria in Solid Tumors version 1.1,RECIST 1.1)进行实体瘤疗效评估,分为完全缓解(complete response,CR)、部分缓解(partial response,PR)、疾病稳定(stable disease,SD)和疾病进展(progressive disease,PD)。复发与转移主要通过定期的影像学检查(如CT、MRI、超声)和临床体格检查进行监测。治疗相关不良反应则依据美国国家癌症研究所常见不良事件评价标准5.0版(the Common Terminology Criteria for Adverse Events version 5.0,CTCAE 5.0)进行记录和分级,涵盖血液学毒性、肝肾功能损伤、免疫相关不良反应等。采用卡诺夫斯基功能状态(the Karnofsky performance status,KPS)评分和美国东部肿瘤协作组(the Eastern Cooperative Oncology Group,ECOG)体力状况评分来动态评估和量化患者在治疗过程中的功能状态与生活自理能力。3)随访频率与随访有效标准。随访形式采取主动随访模式,包括门诊复查、电话联系、微信沟通及智能随访系统等方式。患者术后或初始治疗后,随访频率为每3~6个月1次,进入稳定期后延长至每年1次。随访有效定义为:至少具备1次有效随访记录,并记录明确的结局状态(如死亡或疾病进展)或末次随访时间。

1.4 统计学处理

采用SPSS 26.0软件进行统计分析。基线资料采用描述性统计学分析,符合正态分布的计量资料以均数±标准差表示,非正态分布的计量资料(如Breslow厚度)以中位数(第1四分位数,第3四分位数)表示;分类变量(计数资料)以频数(百分比)表示。

2 结 果

2.1 队列构建流程

本研究采用系统化、标准化的筛选与入组流程(图1)构建湘雅黑色素瘤多模态专病队列,依托中南大学湘雅医院病理系统,初筛获得潜在黑色素瘤病例2 812例。严格遵循预设的纳入与排除标准,经“临床-病理”联合审核,剔除重复记录及核心资料缺失者,最终纳入符合分析条件的黑色素瘤患者共计1 036例。针对入组病例,研究团队成功部署了包含16个核心模块的标准化数据集采集方案。通过实施“ETL+AI”混合治理策略,系统有效地实现了多源异构数据的集成:结构化临床数据通过ETL管道实现了自动化清洗与归一化;非结构化病理与影像文本则经由NLP模型完成了高精度的信息提取。所有入库数据均通过了“临床-工程”双重校验。为保障队列的时效性,本研究建立了多渠道动态随访机制,通过整合门诊复查、通信联络及智能随访小程序,实现对患者生存状态(OS/PFS)、复发/转移模式及体力状况(KPS/ECOG)的持续追踪。

2.2 多模态数据的规模和构成

基于入组队列,本研究成功构建了大规模多模态黑色素瘤专病数据集,目前数据库总数据量已达20.5 TB。多模态数据资源概览(图2)显示:1)影像学与病理组学数据。本队列实现了“像素级”原始数据的深度留存,整合了数字病理全切片图像(whole slide images,WSI)共计8 536张,其中包括851例患者的苏木精-伊红(hematoxylin and eosin,HE)染色切片及550例患者的免疫组织化学(immunohistochemistry,IHC)染色切片;组建了包含CT、MRI及超声的丰富放射影像库,存储符合医学数字成像与通信(digital imaging and communications in medicine,DICOM)标准的原始影像数据共计5 084例次;收录了治疗前后的临床大体照片及皮肤镜图像共计7 020张。2)临床文本与分子数据。利用NLP技术从病理、手术及出院记录中提取非结构化信息,累计整合数据点超过35万个,实现了对患者临床特征的高颗粒度描述。此外,聚焦黑色素瘤关键驱动基因,系统整合了包括BRAFV600Ec-KIT等在内的基因突变检测结果。 3)随访数据。截至2024年9月30日,队列中已有372例患者完成了符合定义的系统性随访(即拥有至少1次有效随访记录且有明确结局状态)。随访数据完整覆盖了OS、PFS、复发/转移模式及治疗应答情况。

2.3 全队列人群的基线临床特征

本研究最终纳入符合标准的黑色素瘤患者共1 036例,其人口统计学与临床病理基线特征(表2)表现为:1)全队列中,男514例(49.614%),女522例(50.386%),性别比例接近1꞉1,分布较为均衡;患者年龄为(60.2±13.7)岁,≥60岁患者549例(52.992%),比例最高。2)在898例具有明确临床分型的患者中,肢端型黑色素瘤606例(67.483%),为主要亚型,具有鲜明的中国人群特征。3)在拥有完整Breslow厚度数据的678例患者中,Breslow厚度中位数值为3.25 mm,提示初诊时肿瘤负荷较重。4)在612例具有明确Clark分级数据的患者中,Clark分级IV患者277例(45.261%),为主要分级。5)在880例具有明确临床TNM(clinical TNM,cTNM)分期数据的患者中,II期患者329例(37.386%),比例最高。6)驱动基因检测结果显示,BRAFV600E 突变检出率为21.786%(61/280),c-KIT突变检出率为9.459%(7/74)。7)在治疗模式上,全队列有217例(20.946%)患者接受免疫治疗,59例(5.695%)患者接受靶向治疗。

2.4 随访人群中复发/转移及死亡队列的基线特征

在完成系统随访的372例患者中,共记录死亡事件129例(34.677%),复发/转移事件86例(23.118%);死亡队列随访时间最短3个月,最长77个月,中位随访时间21个月;复发/转移队列随访时间最短2个月,最长83个月,中位随访时间15个月。死亡队列和复发/转移队列的人口统计学与临床病理基线特征(表3)表现为:死亡队列人群年龄为(63.86±13.26)岁,复发/转移队列人群年龄为(60.11±13.41)岁;2个队列临床亚型均以肢端型为主,死亡队列中肢端型比例为76.744%,复发/转移队列中肢端型比例为80.233%;死亡队列Breslow厚度中位数值为4.00 mm,略高于复发/转移队列的3.75 mm;2个队列Clark分级均以IV级为主,cTNM分期以晚期(III~IV期)为主;死亡队列中BRAFV600E 突变检出率为16.071%(9/56),复发/转移队列BRAFV600E 突变检出率为12.195%(5/41);死亡队列有51例(39.535%)患者接受免疫治疗,复发/转移队列有27例(31.395%)患者接受免疫治疗。

3 讨 论

本研究系统阐述了国内首个聚焦中国人群、以肢端型黑色素瘤为主要亚型的多模态专病队列的构建流程与初步基线特征,实现了中国黑色素瘤人群多源异构临床数据的系统化与标准化整合。相较于肿瘤与癌症基因组图谱(The Cancer Genome Atlas,TCGA)、SEER等国际数据库以皮肤型黑色素瘤 (>90%)为主的特征表现,本队列黑色素瘤肢端型比例高达67.483%,客观反映了亚洲人群的疾病谱特征,有效填补了全球肢端型黑色素瘤的数据缺口,为中国患者的临床实践提供了更具针对性的参考依据。在国内,以北京大学肿瘤医院为代表的顶尖中心已建立了大规模临床基因组学队列,为揭示中国人群肢端型及黏膜型黑色素瘤的驱动基因突变谱做出重要贡献[17],但现有队列多侧重“临床预后+基因测序”的关联分析,缺乏对临床图像、原始影像数据及病理全切片的系统性留存,本队列系统整合的多模态数据则与国内现有队列形成优势互补。此外,针对真实世界医疗数据非结构化程度高的问题,本队列应用“ETL+AI”混合治理模式,利用基于Transformer的NLP技术,实现了对病理报告等非结构化特征的高效提取与标准化[18-19],为后续的数据挖掘奠定坚实基础。

基于已整合的标准化多模态数据资源,本课题组未来将重点聚焦于3个关键方向:1)构建基于多组学协同的深度学习预后模型。针对肢端型黑色素瘤异质性高的特点,利用深度学习算法对病理WSI的微环境特征和放射影像的影像组学特征进行高维提取,并结合基因突变谱与临床病理参数进行多模态融合,旨在开发新型综合预后评分系统,以更精准地识别复发/转移高风险人群。2)开展免疫治疗应答的预测标志物研究。依托队列中详尽的治疗方案记录信息与RECIST疗效评估数据,重点探索多模态数据特征与免疫检查点抑制剂疗效及耐药性的关联。通过构建预测模型,能够早期预测治疗应答及严重不良反应的复合生物标志物,为完善个体化的精准用药策略提供客观依据。3)生成高质量的真实世界证据。随着随访时间的延长和数据的持续积累,依托队列开展长周期的真实世界研究,重点比较不同治疗模式在中国肢端型黑色素瘤患者中的长期生存获益,推动数据资源向临床诊疗规范的有效转化。

本队列仍存在一定的局限性:1)单中心选择性偏倚。中南大学湘雅医院虽为区域性黑色素瘤诊疗中心,但队列人群的外部泛化能力仍需更广泛的多中心研究进行验证。2)随访数据的完整性与时效性。目前随访数据的中位时间有待进一步延长,以便获得更可靠的长期生存数据。面对上述挑战,本队列将从2个主要方向深入发展:1)推动多中心协作,明确数据共享政策。遵循“数据不动模型动”的原则,在严格保护患者隐私和符合伦理规范的前提下,制订分层级的数据共享策略。对于高度敏感数据,主要通过联邦学习技术支持外部协作;对于经深度脱敏的衍生数据(如特征向量、组学数据)与分析代码,计划在未来通过可信数据平台向合规的研究者开放,并明确申请流程与使用规范。本课题团队已初步与国内多家三级甲等医院展开协作,探索联合训练模型以丰富样本多样性的具体模式,旨在解决单中心数据偏倚问题,进一步验证模型的泛化能力[20]。2)持续扩充队列规模与数据深度。未来将结合单细胞测序、空间转录组等新兴组学技术,构建“多组学+多模态”的整合型数据资源,以持续推动更深层次的转化研究[21-22]

综上所述,本研究构建了聚焦中国人群特征的黑色素瘤(以肢端型为主)多模态专病队列,通过“ETL+AI”混合治理模式实现了多源异构数据的深度整合与标准化,有效填补了全球针对亚洲高发黑色素瘤亚型在像素级多模态数据资源上的空白,为开展真实世界研究、挖掘新型预后生物标志物及开发AI辅助诊疗模型提供了重要数据,对推动中国黑色素瘤精准诊疗体系的建立具有重要的转化意义。

参考文献

[1]

Wu Y, Wang Y, Wang L, et al. Burden of melanoma in China, 1990-2017: findings from the 2017 global burden of disease study[J]. Int J Cancer, 2020, 147(3): 692-701.

[2]

Sun Y, Shen Y, Liu Q, et al. Global trends in melanoma burden: a comprehensive analysis from the Global Burden of Disease Study, 1990-2021[J]. J Am Acad Dermatol, 2025, 92(1): 100-107.

[3]

Zheng YJ, Ho C, Lazar A, et al. Poor melanoma outcomes and survival in Asian American and Pacific Islander patients[J]. J Am Acad Dermatol, 2021, 84(6): 1725-1727.

[4]

Chi Z, Li S, Sheng X, et al. Clinical presentation, histology, and prognoses of malignant melanoma in ethnic Chinese: a study of 522 consecutive cases[J]. BMC Cancer, 2011, 11: 85.

[5]

Merkow RP, Rademaker AW, Bilimoria KY. Practical guide to surgical data sets: national cancer database (NCDB)[J]. JAMA Surg, 2018, 153(9): 850-851.

[6]

张艺敏, 吴一丹, 叶祺, . 加强专病数据库质控提升乳腺癌诊疗科研转化价值研究[J]. 中国数字医学, 2024, 19(1): 76-82.

[7]

ZHANG Yimin, WU Yidan, YE Qi, et al. Strengthening quality control of disease-specific databases to enhance the translational value of breast cancer diagnosis, treatment, and research[J]. China Digital Medicine, 2024, 19(1): 76-82.

[8]

陈嘉旖, 陶蓉. 基于临床大数据的肺癌专病数据库建设[J]. 中国数字医学, 2021, 16(11): 39-42.

[9]

CHEN Jiayi, TAO Rong. Construction of a lung cancer disease-specific database based on clinical big data[J]. China Digital Medicine, 2021, 16(11): 39-42.

[10]

国家市场监督管理总局, 国家标准化管理委员会. 信息安全技术健康医疗数据安全指南: GB/T 39725-2020 [S]. 北京: 中国标准出版社, 2020.

[11]

State Administration for Market Regulation, Standardization Administration of China. Information Security Technology-Guide for Health Data Security: GB/T 39725-2020 [S]. Beijing: Standards Press of China, 2020.

[12]

Liang W, He J, Shen Y, et al. Impact of examined lymph node count on precise staging and long-term survival of resected non-small-cell lung cancer: a population study of the US SEER database and a Chinese multi-institutional registry[J]. J Clin Oncol, 2017, 35(11): 1162-1170.

[13]

Wu WT, Li YJ, Feng AZ, et al. Data mining in clinical big data: the frequently used databases, steps, and methodological models[J]. Mil Med Res, 2021, 8(1): 44.

[14]

Swetter SM, Johnson D, Albertini MR, et al. NCCN guidelines® insights: melanoma: cutaneous, version 2.2024[J]. J Natl Compr Canc Netw, 2024, 22(5): 290-298.

[15]

Amaral T, Ottaviano M, Arance A, et al. Cutaneous melanoma: ESMO Clinical Practice Guideline for diagnosis, treatment and follow-up[J]. Ann Oncol, 2025, 36(1): 10-30.

[16]

Amin MB, Greene FL, Edge SB, et al. The eighth edition AJCC cancer staging manual: continuing to build a bridge from a population-based to a more “personalized” approach to cancer staging[J]. CA Cancer J Clin, 2017, 67(2): 93-99.

[17]

Prasser F, Spengler H, Bild R, et al. Privacy-enhancing ETL-processes for biomedical data[J]. Int J Med Inform, 2019, 126: 72-81.

[18]

赵前前, 李嘉琛, 梁立荣. 基于电子病历的呼吸专病医疗大数据综合应用平台数据质控体系构建及应用[J]. 医学信息学杂志, 2022, 43(7): 55-60.

[19]

ZHAO Qianqian, LI Jiachen, LIANG Lirong. Construction and application of a data quality control system for a comprehensive application platform of respiratory disease-specific medical big data based on electronic medical records[J]. Journal of Medical Informatics, 2022, 43(7): 55-60.

[20]

Zhao S, Luo Z, Wang Y, et al. Expert consensus on big data collection of skin and appendage disease phenotypes in Chinese[J]. Phenomics, 2024, 4(3): 269-292.

[21]

Yan X, Sheng X, Chi Z, et al. Randomized phase II study of bevacizumab in combination with carboplatin plus paclitaxel in patients with previously untreated advanced mucosal melanoma[J]. J Clin Oncol, 2021, 39(8): 881-889.

[22]

Paganelli A, Spadafora M, Navarrete-Dechent C, et al. Natural language processing in dermatology: a systematic literature review and state of the art[J]. J Eur Acad Dermatol Venereol, 2024, 38(12): 2225-2234.

[23]

Dahl S, Gsted MB, Sagi T, et al. Performance of natural language processing for information extraction from electronic health records within cancer: systematic review[J/OL]. JMIR Med Inform, 2025, 13: e68707[2025-08-10].

[24]

章俊. 医学场景下联邦学习应用及其隐私保护探究[J]. 医学信息学杂志, 2024, 45(9): 91-95.

[25]

ZHANG Jun. Research on the application of federated learning in medical scenarios and its privacy protection[J]. Journal of Medical Informatics, 2024, 45(9): 91-95.

[26]

吴欢, 车贺宾, 王万玲, . 基于循证医学和电子病历数据的通用医学知识图谱构建[J]. 医学信息学杂志, 2025, 46(2): 22-28.

[27]

WU Huan, CHE Hebin, WANG Wanling, et al. Construction of a general medical knowledge graph based on evidence-based medicine and electronic medical record data[J]. Journal of Medical Informatics, 2025, 46(2): 22-28.

[28]

薛彦斌, 齐季瑛, 张子政, . 上海糖尿病临床专病大数据库建设与真实世界研究[J]. 上海交通大学学报(医学版), 2023, 43(9): 1145-1152.

[29]

XUE Yanbin, QI Jiying, ZHANG Zizheng, et al. Construction of the Shanghai clinical diabetes disease-specific big database and real-world research[J]. Journal of Shanghai Jiao Tong University. Medical Science, 2023, 43(9): 1145-1152.

基金资助

芙蓉实验室科技攻关项目(2024PT5110┫。This work was supported by the Grant from the Scientific Research Program of Furong Laboratory)

芙蓉实验室科技攻关项目(China ┣2024PT5110)

RIGHTS & PERMISSIONS

开放获取(Open access):本文遵循知识共享许可协议,允许第三方用户按照署名-非商业性使用-禁止演绎4.0(CC BY-NC-ND 4.0)的方式,在任何媒介以任何形式复制、传播本作品(https://creativecommons.org/licenses/by-nc-nd/4.0/)。

AI Summary AI Mindmap
PDF (1728KB)

327

访问

0

被引

详细

导航
相关文章

AI思维导图

/