基因组是生物体全部遗传物质的总和,能够调控生物体的生长和发育。基因组学是遗传学学科的一个分支,主要是在生物体的全基因组层面研究基因的结构和功能、基因表达调控、调控元件鉴定和不同物种之间基因组进化关系
[1]。不同于传统遗传学只针对单个基因的研究,基因组学能够高通量地对全基因组范围内的基因或调控元件进行系统研究。基因组学是现代生物学的重要基石,它推动了生命科学向数据驱动、精准预测的现代化科学体系转型。同时,基因组学正在经历快速迭代和技术革新,助力多学科交叉融合与产业升级,在生物育种、临床医学、生物技术等多个核心领域发挥越来越重要的作用。
随着高通量测序与基因组组装技术的快速迭代,基因组数据在数量与质量上均有所提升
[2]。基因组碱基序列规模大、结构复杂,多数植物基因组还具备高重复、高杂合、多倍体等特点
[3],传统方法无法高效处理海量数据,难以挖掘深层生物学关系。怎样高效解析这类海量复杂数据、挖掘其生物学内涵,是基因组学当下待突破的核心科学问题。随着机器学习的发展,人工智能(Artificial intelligence,AI)凭借强大的数据分析与识别能力,逐步渗透到基因组学研究的方方面面
[4]。目前生物学领域常用的AI技术包括传统机器学习、深度学习、强化学习、大语言模型及生成式模型等
[5],不同技术手段适用场景不同,各有优劣。例如,深度学习模型可以自动识别序列中的进化保守区、突变规律与关键功能域
[6-7];Nucleotide Transformer等模型可以在海量无标签的序列上完成预训练,融合多组学数据提升性能,在启动子预测、转录因子结合位点识别、甲基化分析、变异效应预测的精度与效率上领先
[8]。AI工具的持续迭代,为基因组学提供了全新研究范式,其能精准捕捉到传统方法难以识别到的序列特征与生物学规律。
文献计量学是以文献体系和文献计量特征为研究对象,运用数学和统计学等计量方法,研究文献情报的数量关系、分布结构、演进规律及定量管理,进而探讨科学技术的结构特征和发展规律的一门交叉学科。近年来,基因组学与人工智能融合持续深化,研究成果数量快速增长,质量也越来越高,但鲜有基于文献计量学对该领域的系统梳理与可视化分析的研究,难以把握这一交叉领域的整体布局、核心方向与未来趋势。因此,本研究拟以中国知网(CNKI)和Web of Science(WOS)数据库为数据来源,运用CiteSpace
[9]软件,从人工智能驱动下的基因组学领域的国内外研究现状、被引特征、研究热点与趋势及农业相关基因组的应用方面展开分析,旨在揭示人工智能驱动下的基因组学研究领域的研究现状与热点分析,以期为后续研究提供参考。
1 材料与方法
1.1 数据来源
数据来源于CNKI和WOS数据库,检索时间均为2015年1月1日—2025年12月31日。CNKI数据库检索公式为:主题=“机器学习+深度学习+大语言模型+人工智能+神经网络” AND 主题=“基因+转座子+启动子+增强子+TF+转录+RNA+DNA+基因组” NOT 主题=“临床+影像”,文献类型为综述和研究论文,排除学位论文,以“Refworks”格式导出;WOS数据库检索公式为:TS=‘machine learning’ or ‘deep learning’ or ‘large language models’ or ‘artificial intelligence’ or ‘neural networks’ AND TS=‘gene’ or ‘transposon’ or ‘promoter’ or ‘enhancer’ or ‘TF’ or ‘transcription’ or ‘RNA’ or ‘DNA’ or ‘genome’ NOT TS=‘clinical’ and ‘imaging’,文献类型为“Article”和“Review”,以纯文本格式导出。对检索所得文献进行手动筛选,去除与研究内容不相关的文献,CNKI数据库和WOS数据库分别共得到文献162篇和6 444篇。
1.2 研究方法
使用Excel作为辅助分析软件,绘制年发文量图和国家发文量图。利用CiteSpace 6.3.R1软件对导出的文献数据进行格式转换,然后分别以国家、机构、作者、被引期刊和关键词为节点类型进行可视化分析,对被引文献和关键词进行突现分析。
2 结果与分析
2.1 国内外研究现状
2.1.1 年发文量和国家发文量
CNKI和WOS数据库人工智能驱动下的基因组学领域的年发文量如
图1(a)所示。2015—2025年该研究领域文献总计6 606篇(含中国台湾地区),因部分数据的缺失,CNKI数据库中实际纳入年份统计的文献为148篇,其中WOS数据库文献占比为97.8%,反映了该研究领域的研究成果主要集中于国际学术平台。在发文趋势方面,WOS数据库从2018年开始快速增长,年发文量达220篇;CNKI数据库从2022年开始有所增长,年发文量达14篇。将WOS数据库发文量排名前10的国家按发文量从高到低排序,结果如
图1(b)所示。中国学者的发文量居首位,更倾向于将研究结果发布到国际平台上,从侧面反映了中文期刊的影响力较弱。
对WOS数据库中文献进行国家间合作分析,结果如
图2所示。该合作网络包含114个国家节点、893个合作曲线,网络密度为0.138 6。其中发文量最多的国家为中国(2 996篇)和美国(1 804篇),合计占总发文量的74.5%,是主要发文国家。作为重要节点的国家有美国、印度、德国、英国和沙特阿拉伯,这些国家与其他国家的作者之间合作紧密。多数国家从2020年开始大量发文,并且不同国家之间在早期便有合作研究。中国虽然发文量最多,占总文献的46.5%,但中心度仅为0.01,与其他国家相比较低,这反映了我国以自主研究为主,较少与其他国家开展合作研究。在发文量排名前10的国家中,沙特阿拉伯的中心度最高(0.13),其次是美国、印度、德国和英国(均为0.11)。
2.1.2 机构间合作关系
对CNKI和WOS数据库中的文献进行机构合作共现分析,结果如
图3所示。CNKI数据库收录的中文文献共得到139个机构节点、72条合作曲线,网络密度为0.007 5(
图3(a))。WOS数据库共得到289个机构节点、1 619条合作曲线,网络密度为0.038 9(
图3(b))。CNKI数据库的机构合作网络呈现松散的结构,多为高校内部机构的合作,并且发文机构较多集中于计算机学院,说明该类研究存在较高的专业门槛,使得生物学学者较难独自完成,体现了人工智能驱动下的基因组学研究领域较强的学科交叉性。未来应该进一步促进学科交叉发展,开发适合生物学研究的AI工具,降低专业门槛。WOS数据库呈现紧密的结构,各机构之间合作紧密。从机构发文量来看,发文量突破190篇的机构为中国科学院(270篇)和加州大学(198篇),排名第三的中国电子科技大学发文量为160篇,其他机构发文量均<160篇。关键节点为中国科学院和上海交通大学,其与其他机构合作较为紧密。
2.1.3 作者间合作关系
对CNKI和WOS数据库的合作者进行可视化分析,结果如
图4所示。CNKI数据中共得到193个作者节点和197条合作曲线,网络密度为0.010 6(
图4(a)),整体呈现疏松的网状结构,多数作者为独立研究或小范围协作。而WOS数据库共得到287个作者节点和353条合作曲线,网络密度为0.008 6(
图4(b)),呈现较为紧密的网络结构,作者间的合作频率高于CNKI数据库,但也存在小的作者合作网络和零散作者,这表明国际上人工智能驱动下的基因组学研究领域大体上以协作为主。WOS数据库中核心作者为电子科技大学的邹权教授、西北农林科技大学的李富义教授、沙特阿卜杜拉国王科技大学的高欣教授和中南大学的郭菲教授。邹权教授的主要研究方向包括RNA修饰位点的预测
[10]、DNA修饰位点与功能元件的预测
[11]、蛋白质功能与相互作用的预测
[12]、非编码RNA的功能与关联分析
[13]、单细胞测序数据分析
[14]、基因编辑系统的预测
[15]。李富义教授的主要研究方向包括RNA修饰位点的预测
[16]、DNA功能元件的预测
[17]、蛋白质功能与相互作用预测
[18]、mRNA亚细胞定位预测
[19]、单细胞测序数据分析
[20]。高欣教授的主要研究方向包括人工智能基础理论、大语言模型与深度学习方法、生物序列分析、蛋白质结构与功能预测、生物分子网络分析以及人工智能驱动的生物医学研究。郭菲教授的研究方向包括人工智能算法助力生物分子序列、结构与功能发现,及智能计算驱动的生物合成及精准医疗。
2.2 被引分析
2.2.1 被引期刊分析
对WOS数据库的文献进行期刊被引分析,共得到296个期刊节点和1 189条被引曲线,网络密度为0.027 2(
图5)。该网络存在2个明显的网状区域以及其他零散节点,且不存在核心节点,这表明人工智能驱动下的基因组学研究领域未形成核心期刊。基于被引频次排序,排名前10的期刊如
表1所示。被引次数破4 000次的期刊有
Bioinformatics(5 211次)、
Nucleic Acids Research(4 830次)和
Nature(4 105次),其他期刊的被引次数为2 900~3 400次,且差距较小。上述10个期刊主要分布于综合类期刊、传统生物学类期刊以及生物信息学类期刊,这与该研究领域的交叉学科属性有关。其中中心度最高的期刊为
Bioinformatics (0.10),该期刊的文章较多地被其他期刊的文献所引用,这与该期刊文献的研究奠定了相关基础分析流程和发表了基础模型有关。
2.2.2 被引文献分析
对WOS数据库进行被引文献突现分析,16篇文献的突现强度超30,结果如
表2所示。多数文献发布时间为2015—2017年,突现持续4~5年。其中3篇文献的突现强度明显高于其他文献,突现强度最高的文献为2015年Alipanahi等
[21]在
Nature Biotechnology上发布“Predicting the sequence specificities of DNA- and RNA-binding proteins by deep learning”,该文献展示了深度学习技术可以从核苷酸序列数据中确定序列的特异性,证明了其优于其他算法,奠定了深度学习驱动生物序列分析的方法论基础。第二篇为Zhou等
[6]于2015年发表在
Nature Methods上的“Predicting effects of noncoding variants with deep learning-based sequence model”,该文献提出了用于从大规模的染色质数据中预测SNP对染色质影响的算法,奠定了机器学习对SNP分析的基础。第三篇为LeCun等
[22]发表在
Nature上的“Deep learning”,该文献提出了深度学习的概念,是深度学习领域的奠基之作。突现文献的研究内容中还包含TensorFlow
[23]AI开发框架和Pse-in-One
[24]生物信息学工具。TensorFlow是开源的机器学习框架,常被用于处理海量的基因组数据,Pse-in-One可以用于序列的特征提取、蛋白质结构和功能分析、序列预测建模等。此外,还包含了AlphaFold 2代的研究论文“Highly accurate protein structure prediction with AlphaFold”
[25],其突现时间为2023—2025年,目前保持了持续突现。总体而言,突现度高的文献主要集中在提出新方法或新框架上,尤其是将深度学习引入生物序列分析的开创性工作和对整个领域产生深远影响的通用架构与工具,而AlphaFold 2代的持续突现说明方法的突破对领域进展具有长期引导作用。因此,方法创新是人工智能驱动下的基因组学研究领域发展的核心驱动力。
16篇突现文献的作者共129位,但其中并未包括作者合作网络中的核心作者,说明合作网络中的核心作者与突现文献作者之间并不重合,揭示了“人工智能驱动下的基因组学”这一交叉学科的内在知识演进规律。突现文献的作者开发了引发领域变革的底层算法,他们主要是顶尖学者或联系紧密的核心团队,虽然发文量较少,但单篇的影响力和创新性极大。而合作网络的核心作者是应用开拓者,他们通过广泛的跨学科合作,将这些算法引入并解决具体的生物学问题。总体而言,人工智能驱动下的基因组学研究的核心驱动力首先来自颠覆性算法的突破,而其持续地扩展应用则依赖于跨学科的合作网络。
2.3 研究热点及趋势
2.3.1 关键词聚类
对CNKI和WOS数据库的文献进行关键词共现和聚类分析,结果如
图6所示。关键词聚类分析是将关联性大的关键词合并为一个聚类,不同聚类间会有重叠,即部分关键词同时出现在不同聚类之内
[26]。本研究使用默认聚类算法对数似然比(LLR),取默认参数。聚类编号从0开始,编号越小表明其包含的关键词越多,也意味着其影响力越大。两数据库聚类后得到的Modularity
Q值分别为0.931 1和0.649 5,该数值代表聚类质量,>0.3代表聚类结果是显著的,>0.5代表聚类是合理的
[27]。CNKI数据库的文献共得到146个关键词节点和180条联系曲线,密度值为0.017 0共形成6个聚类,聚类主题包括机器学习(#0)、深度学习(#1)、人工智能(#2)、特征提取(#3)、基因(#4)、标签传播(#5),关键节点为深度学习、机器学习、人工智能。WOS数据库共得到263个关键词节点和2 200个联系曲线,密度值为0.063 9,形成6个核心聚类,分别为machine learning(机器学习)(#0)、genome(基因组)(#1)、feature selection(特征选择)(#2)、deep learning(深度学习)(#3)、spatial transcriptomics(空间转录组学)(#4)、genomic prediction(基因组预测)(#5),无核心节点。两数据库的聚类结果存在明显交集,机器学习、深度学习、基因为跨数据库的核心聚类主题,表明国内外在该领域核心研究方向上的共识。
统计CNKI和WOS数据库中文献的关键词,出现频次排名前10的关键词如
表3所示。CNKI数据库中中心度>0.1的关键词有机器学习、深度学习、人工智能,其中机器学习中心度最高为0.52。WOS数据库中中心度最高的关键词为deep learning。CNKI数据库中的新兴关键词,如特征选择、特征融合、对比学习,说明国内平台逐步关注一些新的研究方向。
2.3.2 关键词突现
由于CNKI数据库的关键词数据不足以得出有价值的关键词突现,故本次分析只针对WOS数据库的数据,分析结果如
表4所示。从算法来看,突现强度最高的算法关键词为support vector machine(支持向量机),突现时间从2015年持续到2020年。该时间段还存在其他突现的机器学习方法——random forest(随机森林),其突现时间结束于2019年。随机森林是传统机器学习算法,其具有高准确率、抗过拟合、可处理大规模高维数据等优点。随着基因组学研究的不断深入,生物数据的复杂性持续提升,传统机器学习算法与早期人工神经网络难以高效处理此类复杂数据,其突现在2019—2020年逐步消退。在此背景下,graph neural network(图神经网络)
[28]于2023年开始突现,突现效应持续至2025年,成为接替前述算法的新一代算法,该算法诞生的初衷是为了处理传统算法无法较好应对复杂的生物数据类型,其出现标志着人工智能驱动下的基因组学研究领域机器学习算法实现了重要升级与迭代。另外web server(网络服务器)的突现说明研究者关注的重点还有平台化。但近几年新出现的AI技术(如Transformer)还未突现,说明其在基因组学领域研究还未形成研究热点,尚处于扩散期。
从关注的生物学问题分析,前期主要集中在序列识别、分类和预测上,逐步细化到DNA/RNA修饰位点与模式识别。人工智能驱动下的基因组学研究领域的研究热点由传统的机器学习驱动的序列分类向深度学习与图神经网络驱动的多组学整合、多模态与可解释性转移,未来的关键增长点可能集中于生物网络建模、跨组学融合、可解释的模型方面。得益于大语言模型与生成式模型在大规模数据表征学习、上下文建模以及生成与迁移能力方面的优势,它们有望在多组学整合、序列优化、基因回路与生物系统设计等方向发挥重要的作用。
2.4 人工智能在农业相关基因组上的应用
对各数据库中农业相关文献进行分类统计,CNKI数据库中有26篇农业相关文献,多数发表时间为2024—2025年,WOS数据库中此类文献共189篇。取各子类数量前10的类别结果如
表5所示。CNKI数据库中动物类里以猪为主要研究对象的文献最多,数量达到6篇,其中研究猪繁殖相关的文献最多,数量为3篇
[29-31]。WOS数据库中猪类的文献数量少于CNKI数据库,这可能与国情相关,我国是全球最大的生猪养殖和消费国,有强烈的产业需求,这让部分学者的研究重心置于猪上。水产类文献CNKI数据库也高于WOS数据库,这与猪类文献数量多的原因类似,我国多年水产养殖产量居全球第一。WOS数据库中植物种类的研究高于CNKI数据库,两者的稀有研究物种并未出现交叉。
2个数据库中筛选出的文献的研究路径大体可分为2类:1)开发模型或者框架用于解决现实需要。可能的原因有先前未有相关模型,或者现有模型预测效果不理想等。2)使用同一组数据训练并比较多种机器学习方法,探究哪种机器学习方法可以更好地预测相关数据。具体到应用场景,可分为4类:1)基因特征识别与功能注释。利用机器学习模型解析基因组序列、识别关键元件和预测基因的功能以及表型的关联。2)表型与育种能力预测。使用多组学数据,通过机器学习模型预测复杂性状,优化育种方案。3)病害与抗性研究。识别病原体相关基因与抗性位点,通过机器学习模型分析作物与病原菌的互作数据,预测非生物胁迫响应基因;4)处理与优化基因组数据。解决多倍体物种SNP识别难题,预测表观遗传修饰。典型案例有毛建丰等
[32]利用XGBoost模型来预测杨树的等位基因特异性表达(ASE),通过解析基因组序列和表观遗传特征,识别其中影响ASE的基因组特征,揭示这些特征与基因表达调控的关系,该文献将机器学习应用于ASE预测,展现了机器学习解决复杂生物学问题的潜力。可以看出,将AI赋能的基因组学应用于农业可以突破传统技术的局限,提升效率与精度,同时能够降低人工成本。尤其在精准育种方面,可以显著缩短育种周期,降低筛选成本。但目前AI应用于农业研究的文献占比仅为3.3%,这可能与数据量少、跨学科人才短缺和资源投入不足有关,同时也意味着该领域有较大的增长空间和研究机会。
3 讨 论
3.1 数据局限
由于目前在CNKI数据库检索得到的文献数量偏少,其样本规模明显低于WOS数据库,上述CNKI数据库相关的分析结果中统计学的结果可靠性偏低,但仍可以用于反映中文文献研究的整体情况和发展趋势。后续研究可扩展数据来源,以提高国内文献分析结果的可靠性。
3.2 未来研究方向
未来人工智能驱动下的基因组学领域研究可从多维度开展深化探索,尤其需聚焦农业领域的技术应用,具体方向如下:
研究合作和学科交叉层面,我国需加强国际合作深度与广度,主动与其他国家的研究机构展开合作、交流,提升我国在人工智能驱动下的基因组学研究领域的国际影响力和中心度。应打破计算机科学与生物科学之间的学科壁垒,推动两者的融合,鼓励高校及科研院所组建跨学科的研究团队,研发更贴合生物学需要的、操作门槛更低的AI工具。吸引更多研究者投身到该研究领域的研究中,持续产出有价值的研究结果,并提升中文期刊在该研究领域的影响力。
技术创新层面,需要持续追踪算法的创新与应用,挖掘新兴算法在基因组学研究中的潜力,提升处理和识别数据的效率和精度。加强人工智能驱动下的基因组学研究领域的基础研究和理论创新。生成式模型的技术突破表明,从基因组分析转变到基因组设计方向,生物序列的可控化设计已然成为新的研究方向。Evo等生成式模型已实现CRISPR指导序列、功能基因序列的模拟复制与人工设计
[33],未来有望实现基于特定表型构建完整且具备生物学功能的基因组,或基于基因型精准预测表型的算法体系。
农业领域应用层面,需要紧密围绕实际农业需要,推动AI技术在农业基因组学研究中的应用与产业落地。在生物育种研究中,应开发精准预测抗病抗逆等农业生产关键性状的模型,加速农作物与畜禽优良品种的培育进程。针对目前人工智能驱动的基因组学在农业领域的应用相对较少的问题,首先应该搭建国家级甚至国际级的作物多组学公共数据库,解决作物高维小样本、数据噪声大的核心问题;其次针对作物更为复杂的遗传规律,开发适配特定作物的人工智能算法或模型,如Qian等
[34]开发了OneGenomeRice基因组基础模型专门应用于水稻基因组学研究。同时加强人工智能和农业学科交叉人才的培养,大力支持涉农高校在生物信息和作物遗传育种学科方面的建设,实现AI技术从实验室走向田间应用。
4 结 论
本研究以CNKI和WOS数据库2015—2025年收录的关于AI驱动基因组学研究领域的相关文献为研究对象,使用CiteSpace软件,运用文献计量学方法,对该领域国内外研究现状、被引特征、研究热点与趋势以及在农业领域的应用方面展开系统分析,主要得出以下结论:
1)国内外近10年总计发文6 606篇,其中WOS数据库的文献占比为97.8%。从2018年起,WOS数据库年发文量快速增长,而CNKI数据库则在2022年才有所增长。虽然CNKI数据库发文量少,但中国是主要的发文国之一,说明国内学者更倾向于将研究结果发布在国际期刊上,从侧面反映了中文期刊的影响力不足。美国是另一个主要发文国,其发文量占比为28.0%。中国的中心度仅为0.01,远低于美国、英国等国家,表明我国在该领域以自主研究为主,较少与其他国家开展合作。机构层面,CNKI数据库的发文机构合作网络呈现松散的结构,且多为高校内学院之间合作,主要集中于计算机学院,说明目前研究力量仍以计算机相关学科为主导,生物学领域参与度有待进一步提高;WOS数据库的主要发文机构为中国科学院与加州大学,两者发文量均>190篇。作者层面,WOS数据库的作者之间合作更为紧密。
2)被引分析层面,人工智能驱动下的基因组学研究领域被引期刊的所属领域分布广泛,有综合类、传统生物学类及生物信息学类等领域,未形成核心期刊。被引频次前3的期刊分别是Bioinformatics、Nucleic Acids Research和Nature,Bioinformatics的网络中心度最高,表明其刊发的研究具有基础性和支撑性。被引文献方面,2015—2017年发表的多篇文献奠定了该研究领域的基础,包括提出深度学习架构的文献,以及TensorFlow等开发工具。
3)研究热点和趋势层面,关键词聚类结果显示,CNKI和WOS数据库的聚类结果存在交集,机器学习、深度学习、基因是两者的交叉研究方向,体现出国内外学者在人工智能驱动下的基因组学研究领域的研究方向上存在共识。国内外研究热点从早期的单一序列,逐步扩展到多维度分析、多组学整合,机器学习算法从传统机器学习向深度学习、图神经网络演变。
4)农业应用层面,CNKI数据库相关文献表明人工智能驱动下的基因组学研究领域的研究明显受到国家需求的影响,我国侧重于猪和水产养殖方向。该研究领域的研究路径可分为开发模型和测试方法2种,应用可分为基因特征识别与功能注释、表型与育种值预测、病害与抗性研究等方面。尽管目前农业相关文献仅占该研究领域的3.3%,但AI可以突破传统技术的限制,并在精准育种及缩短育种周期等方面有巨大的应用潜力。
中央引导地方科技发展资金项目(264Z2905G)
河北省省属高校基本科研业务费项目(KY2024039)
河北省自然科学基金创新研究群体项目(C2020204111)