随着全球人口老龄化的加剧,衰老已成为影响个体健康和社会发展的重要因素。衰老不仅是多种慢性疾病的主要风险因素之一
[1-2],也是导致个体各系统功能下降的根本原因
[3-4]。解决老龄化及其相关问题的关键在于量化衰老
[5]。因此,如何准确评估衰老进程并预测其相关健康风险,已成为衰老领域的核心问题。实足年龄(chronological age,CA)是指按出生日期计算的年龄
[6],作为传统上衡量个体衰老的指标,虽然简便易得,但是相同CA个体的疾病易感性和死亡风险存在显著差异,CA无法全面反映个体的衰老过程和健康状况
[7-8]。由于衰老是一个复杂的多因素过程,选择反映功能或状态的多系统临床生物标志物,并应用适当的算法来开发复合衰老指标是合理的方法
[5]。生物学年龄(biological age,BA)作为一种由反映遗传、营养及行为等维度的衰老生物标志物所推导的量化指标,逐渐成为衰老研究中的核心工具,其本质是对个体系统性衰老程度的客观度量,BA增长是个体衰老的表现
[4,6]。该指标是基于机体分子、细胞、组织和器官水平上的生理生化改变与发育状态构建,因此相较于CA,BA能更精准客观地反映个体生物学衰老状态
[5,9]。
近年来,各项研究基于不同类型的生物学数据构建BA预测模型
[10-11],并广泛应用于人群进行衰老评估
[12-13]。LEVINE等
[7]利用美国国家健康与营 养 检 查 调 查(National Health and Nutrition Examination Survey,NHANES)数据库中9 926人的9种生物标志物及CA基于Gompertz死亡率模型首次建立了表型年龄(phenotypic age,PA)模型。随后,研究者
[14]对NHANES数据库中11 432人进一步研究证实:PA能显著预测全因死亡率和疾病特异性死亡率,在不同年龄、种族、健康状况及健康行为的人群中的预测效果均保持稳健。尽管PA模型具有重要的应用价值,但目前研究仍较少关注模型在大规模筛查中的卫生经济学成本。PA模型所需的9种生物标志物虽然均为常规指标,但在资源匮乏地区或临床大规模筛查中仍面临一定的检测成本与操作复杂性等问题。减少检测项目、降低成本仍是亟待解决的实际需求。目前国内外关于在保证预测精度前提下,如何用更少的指标构建PA模型的研究尚不充分。本研究对原始PA模型的9种生物标志物进行数学组合,构建每种组合的PA模型并从中筛选出优质组合,同时开发PA动态评估交互式网站,旨在支持在资源有限的情景下仍能有效开展衰老量化研究。
1 资料与方法
1.1 数据来源
本研究使用的数据来自美国NHANES 数 据 库,收 集 NHANES Ⅲ(1988-1994年)和NHANES Ⅳ(1999-2018年)中研究对象的CA及9种生物标志物的测定结果。这9种生物标志物涉及6类病理生理系统或功能指标,包括肝脏功能指标白蛋白(albumin,ALB)、碱性磷酸酶(alkaline phosphatase,ALP),肾脏功能指标肌酐(creatinine,Cr),代谢功能指标血清葡萄糖(glucose,Glu),炎症功能指标C反应蛋白(C-reactive protein,CRP),免疫功能指标白细胞计数(white blood cell count,WBC)和淋巴细胞百分比(lymphocyte percent,LYM%),红细胞指标平均红细胞体积(mean cell volume,MCV)和红细胞分布宽度(red cell distribution width,RDW)。对数据集进行如下处理:①剔除性别特异性大于5个标准差的极端值
[15];②对CRP进行自然对数转换;③对检测方法变更的生物标志物,进行跨年份校正
[15]。 最终NHANES Ⅲ纳入18 825人,NHANES Ⅳ纳入55 081人。NHANES获得了美国国家卫生统计中心(National Center for Health Statistics,NCHS)研究伦理审查委员会的批准,所有参与者在参与调查前均签署了知情同意书。
1.2 PA计算公式PA=141.502 25+
①
②
式①中,代表个体在未来120个月内的累积死亡概率。式②中,xb代表拟合模型中生物标志物的线性组合,γ是通过数据拟合得到的模型参数。
1.3 基于多种生物标志物不同组合的PA模型构建和筛选
通过穷举法数学组合生成从包含2种生物标志物到包含9种生物标志物(到)的组合,共502种。在NHANES Ⅲ数据集中对9种生物标志物的子集重新训练PA模型,得到相应的模型参数,包括线性组合中的截距项和对应生物标志物的系数。然后在NHANES Ⅳ数据集中,应用训练完成的模型计算PA及PA加速。PA加速为PA与CA进行线性回归后所得的残差。采用Pearson相关分析评估各组合PA和全指标组合模型PA的相关性,用组内相关系数(intraclass correlation coefficient,ICC)评估一致性。计算各组合模型与全指标组合模型的相关系数,以及能够显示拟合效果的均方根误差(root mean square error,RMSE)与平均绝对误差(mean absolute error,MAE)。采用R软件4.4.2中的“BioAge”包
[15]训练PA模型并计算PA。
C29
C99
1.4 影响因素分析
在NHANES Ⅳ数据集中,以PA加速为因变量,以性别、教育水平、种族、体质量指数(body mass index,BMI)、吸烟、饮酒、咖啡因摄入水平和CA为自变量,构建加权线性回归模型。在具有PA加速数据的37 204名参与者中,排除BMI数据异常者以及上述自变量缺失者,最终纳入25 725人进行统计分析。双侧检验水平α=0.05。
1.5 平台建设
基于HTML、CSS和JavaScript技术,使用HBuilder软件建立PA动态评估的交互式网站,采用响应式设计适配多终端访问。网站整合了502种生物标志物组合的PA计算模型,设计简洁的前端界面,允许用户灵活勾选可用生物标志物,系统实时调用相应计算模型,即刻输出个体的PA。
2 结 果
2.1 数据基本情况
NHANES Ⅲ数据集中CA为(49.49±20.00)岁,NHANES Ⅳ数据集中CA为(49.92±18.44)岁,9种生物标志物的测量值见
表1。
2.2 多种生物标志物不同组合模型的拟合结果
基于2~9种生物标志物的数学组合,共构建了502种PA模型。将各组合PA与全指标组合模型PA平均绝对误差小于3岁的组合定义为优质组合
[16-17],共筛选出324种优质组合。这些优质组合中频次从高到低排名前5位的生物标志物是:RDW、Glu、ALB、WBC和CR。324种优质组合中,总共有142种组合的相关系数和ICC大于0.990 0,前10位PA模型拟合结果见
表2。
2.3 PA加速的影响因素分析
构建的加权线性回归模型结果(
表3)显示:性别、教育水平、种族、BMI和吸烟与PA加速有关联。性别与PA加速呈显著负相关关系,女性的PA加速比男性低0.85年。教育水平同样呈现显著负相关关系,拥有高中以上学历的个体PA加速水平明显更低。其中,本科及以上学历者比高中以下学历者PA加速水平低1.14年。在种族层面,其他西班牙裔比墨西哥裔美国人的PA加速水平高0.84年。BMI与PA加速水平呈显著正相关,与BMI正常者比较,超重与肥胖者的PA加速水平分别高出0.48年和2.45年。另外,吸烟者的PA加速水平高于非吸烟者1.09年。
2.4 平台建设
PA动态评估交互式网站平台网址为:
https://zzu-zaz.github.io/PAage/。该平台包含502种生物标志物组合,用户可以自主组合指标,实时生成个体的PA,完成个体衰老状态评估。
3 讨 论
LEVINE等
[7]基于机体免疫与炎症、肝肾功能和新陈代谢等临床生物标志物构建的PA能够反映个体在相同CA下的死亡与疾病风险。LIU等
[14]也证实PA作为一种新型衰老测量指标在不同亚群中均具有适用性。PA为早期识别衰老相关高风险个体及有效评估抗衰老干预措施提供了新途径,在临床与公共卫生领域具有应用价值。然而如何用更少量的指标反映衰老状况,从而减轻衰老研究中的卫生经济学负担,也是值得考虑的问题。
本研究利用NHANES的大样本人群数据,首次构建了基于临床生物标志物不同组合的多种PA模型,结果显示:共有142种组合模型的PA与全指标组合模型PA的平均绝对误差小于3岁且相关系数及组内相关系数大于0.990 0,提示上述模型均可作为全指标组合模型的有效替代,从而减轻经济负担。在筛选出的324种优质组合中,RDW和WBC这2个指标出现频次较高,这与免疫衰老理论相一致。免疫衰老是指免疫系统在衰老进程中会发生显著改变,这是一种影响自然免疫和获得性免疫的多因素现象
[18]。免疫衰老和年龄相关性疾病之间存在相互作用,促进年龄相关性疾病的发展,特别是在老年人常见慢性疾病的发生发展中起关键作用
[18-19]。此外,RDW与ALB的比值作为一种新型炎症标志物
[20],已被证实与一般人群的全因死亡及特定死因风险升高相关
[21]。KENNEDY等
[22]提出的“炎症衰老”概念也与此呼应。炎症与衰老及慢性疾病之间的关联正日益受到重视,炎症对于年龄相关性疾病的病因和进展至关重要,常表现为多种疾病共存,最终可能导致器官功能衰竭和死亡
[18,23]。另外,Glu的高频出现也印证了代谢失调在衰老过程中的重要作用
[24-25]。本研究结果提示:未来在衰老生物标志物的筛选和模型构建中需重点纳入上述关键指标,并优化其权重配置。
本研究的优势在于首次构建了从包含2种生物标志物到包含9种生物标志物的多个PA模型,发现多种精简组合均能有效预测PA,为不同资源条件下的研究与应用提供了选择。这使得研究者或临床医生可以根据可获得的标志物类型和数量,灵活选择最合适的模型,极大地降低了PA的应用门槛。上述标志物多为常规临床检验项目,成本低廉、可及性高,使得在基层医疗机构、大规模体检筛查或流行病学调查中推广PA成为可能。此外,合适的PA模型也适用于部分生物标志物缺失的历史数据集,并能据此实现有效的衰老量化。
本研究也存在一些局限性。首先,BA的评估目前尚无公认的金标准。本研究建立的精简组合模型与全指标组合模型对PA的预测结果具有高度一致性(ICC>0.990 0),但是实际预测效能仍需通过外部验证或交叉验证等方法进一步证实。其次,本模型基于美国人群健康数据开发,未来在中国人群中需要进一步验证。第三,尽管基于多种临床生物标志物组合的PA模型有一定应用价值,但对不同健康状态人群的适用性有待验证。
综上所述,本研究成功构建了基于多种临床生物标志物不同组合的PA模型,并开发了配套的交互式网站平台,为个体衰老评估提供了有效工具。
国家自然科学基金项目(82273707)
广东省深圳市科技局科技计划项目(202208183000115)
深圳大学医学部有组织科研行动计划项目(SZU2024YZZKY001)