矿产预测大模型

师路易 ,  左仁广

地球科学 ›› 2026, Vol. 51 ›› Issue (03) : 832 -848.

PDF (1855KB)
地球科学 ›› 2026, Vol. 51 ›› Issue (03) : 832 -848. DOI: 10.3799/dqkx.2025.190

矿产预测大模型

作者信息 +

Foundation Model for Mineral Prospectivity Mapping

Author information +
文章历史 +
PDF (1898K)

摘要

大数据人工智能驱动的矿产预测已成为矿产勘查的重要方向,但现有方法普遍存在泛化能力弱、迁移性差、可解释性不足等问题,难以实现跨区域应用.以“预训练‒微调”为核心范式的大模型在自然语言处理、计算机视觉等领域展现出卓越的跨任务迁移能力和强泛化性,为突破上述瓶颈提供了可行路径.研发矿产预测大模型,对创新找矿范式、提升勘查效率具有重要探索价值,是智能矿产预测发展的新方向.本文聚焦大语言模型、视觉大模型及多模态大模型的技术特性,系统梳理了大模型的发展历程与构建流程.在此基础上,剖析了现有矿产预测大模型的技术路径与局限,探讨了面向矿产预测语言、视觉和多模态大模型的构建思路,分析了构建矿产预测大模型面临的挑战,为进一步研发矿产预测大模型提供参考.

Abstract

Mineral prospectivity mapping (MPM) driven by big data and artificial intelligence (AI) represents a cutting-edge approach in mineral exploration. However, exisiting methods are typically constrained by the inability to achieve stable cross-regional applications due to the limited generalization ability, poor transferability, and insufficient interpretability. Foundation models, based on the “pretrain and fine-tune” paradigm, have demonstrated excellent cross-task transfer and strong generalization ability in the fields such as natural language processing and computer vision, offering a promising path to overcome the aforementioned bottlenecks. The development of foundation models for MPM has significant potential to revolutionize traditional models and improve exploration efficiency, representing a new research direction for intelligent MPM. This study systematically reviews the development and construction processes of foundation models, focusing on the state-of-the-art technical characteristics of large language models, visual foundation models, and multimodal foundation models. This study also summarizes the limitations of existing foundation models for MPM, and explores the construction process of MPM foundation models from a perspective of language-based, visual-based and multimodal-based foundation models, and discusses the challenges of developing MPM foundation models, providing a reference for development of MPM foundation models.

Graphical abstract

关键词

矿产预测 / 大数据 / 人工智能 / 大模型.

Key words

mineral prospectivity mapping / big data / artificial intelligence / foundation model

引用本文

引用格式 ▾
师路易,左仁广. 矿产预测大模型[J]. 地球科学, 2026, 51(03): 832-848 DOI:10.3799/dqkx.2025.190

登录浏览全文

4963

注册一个新账户 忘记密码

矿产预测的核心目标是评估研究区矿床的空间分布、类型、规模与质量,为矿产勘查决策提供科学依据(Taylor and Steven, 1983Agterberg, 1989Carranza, 2009).找矿数据具有多源异构、多维、非线性、多尺度等特点(Zuo, 2020),人工智能算法凭借其强大的非线性特征提取与模式识别能力,已被广泛应用于识别和提取这些数据中的矿化空间模式及非线性关联(Zuo and Carranza, 2011Zuo et al., 2023).根据找矿数据输入的形式,这些方法可分为基于像素(如随机森林)(Zhang et al., 2016Wang and Zuo, 2022Yin et al., 2022)、基于图像(如卷积神经网络,Convolutional Neural Network, CNN)(Li et al., 2021Yang et al., 2023Yang and Zuo, 2024)及基于拓扑图(如图神经网络)(Zuo and Xu, 2023Shi et al., 2024Xu and Zuo, 2024)三大类.然而,仅依赖数据驱动的模型普遍存在泛化能力弱、可移植性差、可解释性不足等问题.研究学者通过耦合地质知识辅助模型学习成矿规律,在一定程度上缓解了这些难题(Zuo et al., 2023Xu and Zuo, 2024Yang and Zuo, 2024; 左仁广等, 2024; 左仁广, 2025).但这些模型通常只能在同一研究区完成训练与预测,难以迁移至未经训练的区域(Shi and Zuo, 2025),这一不足制约了人工智能算法在矿产预测领域的推广应用.
基础模型通过在大规模数据集上进行预训练,学习通用表示,并使用少量数据进行微调适配下游任务(Bommasani et al., 2022Awais et al., 2025).当基础模型的参数规模达到一定程度时,也被称为大模型(本文统称为大模型).根据输入数据形式,大模型分为大语言模型(Radford and Narasimhan, 2018Devlin et al., 2019Lewis et al., 2019Brown et al., 2020Bommasani et al., 2022Touvron et al., 2023)、视觉大模型(Dosovitskiy et al., 2020He et al., 2021Liu et al., 2021bBao et al., 2022)和多模态大模型(Radford et al., 2021Rombach et al., 2021Kirillov et al., 2023),被广泛应用于对话系统(Achiam et al., 2023Bai et al., 2023Liu et al., 2024aGong et al., 2025)、图片生成(Rombach et al., 2021Gong et al., 2025)、视频生成(Liu et al., 2024cGong et al., 2025)等多样化任务.大模型强大的泛化能力与下游任务适配性使其成为各领域的最新技术范式.在地球科学领域,也涌现出了多个适配地学场景的大模型,如地球物理大模型(Liu and Ma, 2024Guo et al., 2025Sheng et al., 2025a,2025b)、遥感大模型(Hu et al., 2023Guo et al., 2024Hong et al., 2024Liu et al., 2024b)、地理信息系统大模型(Zhang et al., 2023bZhang et al., 2024b)及地质大语言模型(Lin et al., 2023Deng et al., 2024; 之江实验室, 2025)等.
在矿产预测领域,现有人工智能算法泛化能力不足已成为制约其发展的关键瓶颈(左仁广,2025),而大模型的出现为突破这一瓶颈带来了转机.找矿大数据包含空间数据与文本数据,大语言模型具备强大的语义特征提取与推理能力,视觉大模型则擅长空间信息提取,二者相结合可以构建具有地质专业适配性和较强推理能力的矿产预测大模型.当前,已有三项代表性研究探索了这一方向:其一为矿产智能体(MineAgent)(Yu et al., 2024),该模型以通用大模型为骨干,通过Agent系统引导大模型完成控矿构造的自动提取;其二为矿产预测空间大模型(Geospatial Foundation Models for Mineral Prospectivity Mapping, GFM4MPM; Daruna et al., 2024),是典型的视觉大模型,该模型基于北美及澳大利亚的地质和地球物理数据从零构建,并利用铅锌矿床数据进行有监督微调以圈定找矿靶区;其三为地球化学异常识别大模型(Foundation Model for Geochemical Anomaly Identification, FM4GAI;Shi and Zuo,2026),同样是视觉大模型,它基于区域地球化学数据从零构建,分别利用迁移学习和小样本学习的方式进行有监督微调,在不同找矿场景下识别矿致地球化学异常.然而,MineAgent未采用专业找矿数据进行微调,导致其预测精度有限;GFM4MPM采用One⁃Hot编码处理文本数据造成了语义和上下文信息丢失,且存在输入特征固化难以适配其他研究区等问题;FM4GAI通过提取单一地球化学特征图的空间特征进行地球化学异常识别,不受研究区位置及其他条件的限制,能够被应用到不同研究区.
本文总结了语言大模型、视觉大模型和多模态大模型的研究现状,梳理了大模型构建的技术路线,探讨了矿产预测大模型的架构设计,讨论了矿产预测语言大模型、视觉大模型及多模态大模型构建过程中所面临的挑战,旨在为开发兼具跨区域泛化能力与专业地质适配性的矿产预测大模型提供参考.

1 大模型概述

大模型是指具有大量参数的深度神经网络模型(Bommasani et al., 2022Awais et al., 2025),其思想源于机器学习中的迁移学习,将从源域中学习到的知识迁移到目标域中进行应用,旨在减少模型对目标域标注数据的依赖(Krizhevsky et al., 2012).该思想最早在深度信念网络中应用(Hinton et al., 2006).深度信念网络由多层受限玻尔兹曼机(Restricted Boltzmann Machine,RBM)组成,通过逐层预训练RBM,学习数据的层次化特征后,使用标注数据对整个网络进行优化,从而适配具体任务(Hinton and Salakhutdinov, 2006).大模型通常需要从大规模数据集上进行预训练以获得较强的泛化能力,随后在下游任务数据集上微调后可以展现出较好的性能(Devlin et al., 2019He et al., 2021).大模型根据其输入数据形式,通常分为大语言模型、视觉大模型和多模态大模型(Bommasani et al., 2022).

1.1 大语言模型

自然语言处理领域的核心问题是如何将自然语言表征为计算机能理解的数值特征,并将该特征应用于各种自然语言任务,如对话系统、翻译任务、命名实体识别等(Nadkarni et al., 2011Chowdhary, 2020).传统的One⁃Hot编码表征方式将每个输入词投影为相互正交的高维稀疏向量,导致词与词之间彼此独立,无法高效地表达词语间的语义关系.为解决该问题,研究学者通过预训练将词语映射到蕴含语义和上下文关系的向量空间,如Word2Vec(Mikolov et al., 2013)、GloVe(Pennington et al., 2014)等.该领域早期使用的模型为浅层的机器学习或循环神经网络及其变体(Collobert et al., 2011Mikolov et al., 2013Sutskever et al., 2014Tang et al., 2015),这些模型往往计算效率低、全局语义捕捉能力不足、可拓展性差(Vaswani et al., 2017).Transformer模型架构(图1)具有较强的长距离依赖的建模能力,使模型可以理解更复杂的语言结构和语义关联(Vaswani et al., 2017),其较强的可拓展性、通用性和灵活性,推动大语言模型迈入“预训练‒微调”范式(Zhao et al., 2023)(图2).

预训练任务决定了模型从自然语言中学习文本语义信息的方式,如BERT(Devlin et al., 2019)和GPT(Radford and Narasimhan, 2018Brown et al., 2020).BERT采用掩码语言建模(Masked Language Model,MLM)(图3a)和下一个句子预测(Next Sentence Prediction,NSP)(图3b)学习文本中的语义信息,通过添加任务特定的输出层,可将预训练的模型参数(即语义理解能力)迁移到下游任务,如文本分类、问答系统、命名实体识别、自然语言推理等任务.GPT使用自回归语言建模(Causal Language Modeling, CLM)学习语言生成规律(图3c),采用提示词工程来引导模型生成目标输出,或通过基于人类反馈的强化学习提升模型输出结果的质量(Ouyang et al., 2022),最终训练所得模型被应用于文本生成、对话系统、代码生成等下游任务(Achiam et al., 2023).BERT和GPT分别代表了重构式和生成式大语言模型,从理解和生成两个方向创新了自然语言处理的方法,成为大语言模型构建的基础(Zhou et al., 2023).在应用时,这些模型通过挂载知识库和检索增强缓解生成式大语言模型的幻觉现象(Lewis et al., 2019Liang et al., 2025).同时,采用思维链、自我验证和迭代推理技术增强大语言模型的推理能力,优化其在需要复杂逻辑的任务中的应用(Wei et al., 2022).大语言模型在性能提升的同时,其参数量也越来越庞大,需要消耗的计算资源也越来越多.可以通过参数共享、知识蒸馏、混合精度训练和混合专家模型(Mixture of Expert)来提升模型的计算效率,降低其运营成本(Jacobs et al., 1991Fedus et al., 2022).如今,大语言模型正从单一模态迈向多模态,从特定任务的大语言模型迈向更全能、更高效的通用大语言模型(Yin et al., 2024).

1.2 视觉大模型

计算机视觉领域的核心问题在于如何从图像或视频中提取并理解视觉信息,使计算机能够感知和解析视觉内容,并解决图像识别、目标检测、三维重建等视觉任务(Voulodimos et al., 2018Szeliski, 2022).早期依赖特征工程的浅层机器学习模型计算效率低且难以应对复杂场景(Viola and Jones, 2001Lowe, 2004Dalal and Triggs, 2005Lazebnik et al., 2006Krizhevsky et al., 2012).CNN(LeCun et al., 1989,1998Krizhevsky et al., 2012)的兴起及ImageNet等大规模数据集(Deng et al., 2009)的发布共同推动了视觉模型“预训练‒微调”范式的发展.VGG(Simonyan and Zisserman, 2014)、ResNet(He et al., 2016)等架构在大规模数据集上进行预训练后,迁移至小规模数据集上已取得良好的效果.然而CNN仍需克服全局建模能力弱、灵活性差、计算复杂度高等局限性(Azulay and Weiss, 2019).2020年,Google团队提出了视觉Transformer(Visual Transformer, ViT)(Dosovitskiy et al., 2020),将图片划分为像素块后进一步展平为序列数据,借助Transformer架构的长距离建模能力,高效完成图像分类任务(图4).

ViT的出现,使该领域模型的架构从CNN转向了Transformer(Dosovitskiy et al., 2020Liu et al., 2021b).同时,ViT采用无监督预训练任务如掩码自编码器(Masked AutoEncoder,MAE)(He et al., 2021)和扩散模型(Diffusion Models, DM)(Ho et al., 2020Rombach et al., 2021)(图5)增强模型的视觉特征提取能力.两种预训练任务分别代表了视觉特征提取和生成两种类型的视觉大模型.在预训练视觉大模型的基础上,添加对应任务的分类器,进行有监督微调后可使模型完成图像分类、目标检测、视频理解、图像生成等视觉任务(Kirillov et al., 2023Zhang et al., 2024a).

1.3 多模态大模型

多模态数据是指由多种异质信息源(如文本、图像、音频、视频或传感器数据等)构成的组合表征形式,每种模态的数据在系统中承担特定功能,从不同的角度反映目标任务的特征.多模态融合的核心在于打破单一信息形式的局限,通过整合多模态信息,实现对场景或任务更全面、准确的理解(Baltrušaitis et al., 2019).多模态大模型是一种能够处理、理解和生成多种模态信息的人工智能模型(Bommasani et al., 2022).在各种模态的信息中,自然语言作为一种复杂度高的数据,蕴含的内容不仅包括表层的词汇语义和句法结构,更涉及深层的语用意图、文化语境以及动态的语境依赖关系(Brown et al., 2020Chowdhary, 2020).图像不具备自然语言的复杂性,仅使用图像训练的视觉大模型往往缺乏较强的推理能力(Radford et al., 2021).因此,可借助大语言模型提升视觉大模型的推理能力和零样本学习能力,如Constrastive Language⁃ Image Pre⁃training(CLIP)(Radford et al., 2021Achiam et al., 2023Liu et al., 2024c; Gong et al., 2025).CLIP通过对比学习的方式,使图像与文本描述的潜在特征相关联(图6),借助大语言模型的推理能力实现对图像的零样本分类.在此基础上,将嵌入的视觉特征与文本特征同时输入到预训练的大语言模型,实现大语言模型对视觉数据的理解.这类以大语言模型为骨干,通过多模态编码器和生成器扩增其能力边界的模型被称为多模态大语言模型(Yin et al., 2024)(图7).

目前,多模态大语言模型有两种构建方式,其一是统一嵌入解码器方法:借助多模态编码器和投影层,将多模态数据的特征投影至与文本特征相似的特征空间,经过拼接后输入到统一的解码器(大语言模型)中,实现多模态特征融合(Gemma Team, 2025);其二是跨模态注意力架构方法:该方式将输入多模态编码器和投影层的多模态特征以交叉注意力的方式嵌入到大语言模型的多头注意力机制中,并与文本特征进行交叉注意力计算,实现多模态特征融合(Grattafiori et al., 2024).在上述过程中需使用CLIP预训练任务将多模态特征进行对齐,随后可针对该多模态大语言模型的功能来选择合适的预训练任务,如多模态图像生成(基于DM的预训练任务),图文对话(基于CLM的预训练任务)等.

1.4 大模型构建

大模型的构建流程通常包括数据准备、模型预训练、模型微调和模型部署应用四个核心环节.这些环节相互关联,构成了从原始数据到可部署模型的完整技术链条.

(1)数据准备.数据集是大模型知识体系的基石,其质量决定了模型的性能.数据集的选择需遵循任务适配性原则:(a)面向通用知识库构建时,优先选用维基百科、Common Crawl等语义丰富且经过初步清理的文本数据;(b)针对代码生成任务,通常采用GitHub公开代码库、CodeSearchNet等专业代码数据库;(c)针对图文对话任务,应构建带有图像的文本对话数据集(Schuhmann et al., 2022).随后对数据进行预处理,如对文本进行数据清理、数据增强、分词和编码;对图像数据进行图像归一化、尺寸标准化和通道转换等(Dosovitskiy et al., 2020).

(2)模型预训练.预训练任务的设计直接影响了模型的能力边界,其核心在于通过任务‒目标对齐原则,将预训练任务与模型的应用目标进行匹配.预训练的目标是使模型从大规模的数据集中学习通用技能,如MLM和MAE通过掩码重构使模型分别学习文本和图像中的语义信息和分布规律,提升模型的理解能力(Devlin et al., 2019; He et al., 2021);CLM和DM根据不同的生成形式分别对真实文本或图像进行建模,拟合其分布规律,提升模型的生成能力(Radford and Narasimhan, 2018Rombach et al., 2021);CLIP利用对比损失,将多模态数据的特征空间进行对齐,提升模型多模态感知能力(Radford et al., 2021).

(3)模型微调.微调阶段旨在使预训练模型适应下游任务.参数高效微调方式主要包括:(a)基于附加参数的方法:在预训练模型的基础上插入小规模的可训练参数,在微调时冻结预训练模型的参数,仅优化插入的小规模参数,如适配器微调(Houlsby et al., 2019)、前缀微调(Li and Liang, 2021Liu et al., 2021a)等;(b)基于参数选择的方法:在微调时选择性地调整预训练模型中的部分参数如偏置项、注意力权重等(Zaken et al., 2021);(c)低秩适配方法:引入新的低秩矩阵并与预训练模型的权重矩阵相乘来代替原始的权重矩阵,微调时冻结原始权重矩阵,通过更新低秩矩阵的方式来节约算力,如LoRA(Hu et al., 2022)、AdaLoRA(Zhang et al., 2023a)等.

(4)模型部署应用.在实际使用中,大模型的部署需要考虑如何稳定运行和快速响应.通常会把模型封装成标准的服务接口,方便其他系统调用,并通过负载均衡和自动调整计算资源的方式,来应对不同时间的访问压力,保证系统稳定运行(Dong and Xie, 2024).为了让模型响应更快、并行处理更多请求,可以采用一些优化技术,比如将多个请求合并成批次一起处理,或把常用的计算结果暂时保存起来,避免重复运算,从而提高处理速度、降低延迟(Poddar et al., 2022).同时,还需要建立一套监控系统,持续观察模型的准确度、响应时间以及对服务器资源的占用情况,及时发现问题并进行优化.对于那些数据不断更新的应用场景,还可以让模型在运行过程中逐步学习新数据,不断调整自身参数,从而保持预测能力的稳定和有效(Feng et al., 2023).此外,可通过知识蒸馏 (Hinton et al., 2015)的方式将大模型知识迁移到小模型,或通过量化(Jacob et al., 2018)、剪枝(Han et al., 2015)等模型压缩技术降低计算复杂度.

2 矿产预测大模型

找矿大数据具有显著的多模态特征,涵盖地质(地层、构造、岩浆岩、矿床等)、地球化学、地球物理、遥感等空间数据,以及学术文献、地质报告等非结构化文本数据(左仁广, 2021; 左仁广等, 2021).尽管大量研究利用空间数据分析技术识别矿化模式并开展矿产预测,但现有方法仍存在局限性.一方面,模型训练高度依赖研究区的成矿动力学背景和成矿特征,输入数据的顺序与局部特征的独特性导致模型泛化能力不足,在迁移到成矿地质背景差异较大的区域时模型性能大幅下降(Shi and Zuo, 2025).另一方面,文本数据(如文献、报告)常被作为静态先验知识或结果解释工具(Yang and Zuo, 2024Xu et al., 2025aZuo et al., 2025),未能与空间数据实现动态融合,成矿规律与空间模式间的隐含非线性关联难以被充分挖掘.尽管已有研究尝试将文本转化为知识图谱以发现成矿规律、学习成矿特征(Wang et al., 2022Yan et al., 2023Qiu et al., 2023Yan et al., 2024),但仍存在跨区域适配性差、多模态数据协同建模不足、依赖专家经验等问题.这些瓶颈促使研究者转向大模型技术的研究(Zhang et al., 2023b),通过跨区域泛化、多模态深度融合及知识增强等创新路径,为矿产预测提供更智能、更高效的解决方案.

2.1 矿产预测大模型研究现状

当前矿产预测领域涌现出两类大模型技术路径,分别是使用Agent系统调整多模态大模型输出的矿产智能体(MineAgent)(Yu et al., 2024)以及使用地质数据和地球物理数据构建的矿产预测空间大模型(GFM4MPM)(Daruna et al., 2024).此外在地球化学异常识别领域,笔者团队提出了地球化学异常识别大模型(FM4GAI)(Shi and Zuo,2026).

MineAgent基于指令微调策略,通过Agent系统与现有多模态大模型交互,如GPT⁃4(Achiam et al., 2023)、Qwen(Bai et al., 2023)等,引导其完成控矿构造提取和成矿概率计算的全流程任务(图8).该方法无需训练大模型,仅通过预设指令流程生成预测结果,降低了计算资源消耗.然而,由于该模型未基于找矿大数据训练,对控矿构造的识别精度有限,且成矿概率输出缺乏地质知识约束,导致预测结果在复杂地质条件下具有较高的不确定性.

GFM4MPM(Daruna et al., 2024)以北美及澳大利亚地区的地质、地球物理数据为训练集,从零构建专用于矿产预测的视觉大模型(图9).该模型通过ViT处理空间数据(Dosovitskiy et al., 2020),结合掩码重构任务进行预训练(He et al., 2021),并以铅锌矿床空间分布为标签进行有监督微调(图9).尽管GFM4MPM在北美、澳大利亚取得了优于传统方法的预测效果,但依然存在一些局限性.其一是将文本型地质数据转换为One⁃Hot编码,丢失了语义关联性.其二是输入特征固化(仅依赖特定地质、地球物理数据),难以迁移到其他成矿地质背景差异较大的研究区.

FM4GAI(Shi and Zuo, 2026)同样是从零训练的视觉大模型(图10),以39种区域勘查地球化学数据为预训练数据集,采用掩码重构作为预训练任务,学习地球化学数据的空间特征,分别使用迁移学习和小样本学习对模型进行有监督微调.FM4GAI将每个地球化学特征拉伸为仅包括单一特征的地球化学图,避免因输入特征固化而弱化模型的适用性.

表1所示,MineAgent以低资源消耗为优势,但依赖现有模型的通用能力,缺乏找矿专业知识引导.GFM4MPM通过专项训练实现高精度预测,却受限于特征固化,缺乏泛化能力和零样本学习能力.两者均在泛化能力与专业适配性之间存在权衡,亟须融合知识驱动与数据驱动的混合架构以突破现有瓶颈.FM4GAI与GFM4MPM类似,通过专项训练实现高精度预测,由于前者空间特征提取的基本单元是单个地球化学特征图,使其能够应用于各种研究区,适用性强,但同样缺乏零样本学习能力.

2.2 矿产预测大模型构建

矿产预测主要涉及文本数据与空间数据.依据数据形式,矿产预测大模型可划分为语言大模型、视觉大模型、多模态大模型三类.

2.2.1 矿产预测语言大模型

找矿文本大数据是矿产预测语言大模型的核心输入,涵盖与矿产勘查相关的文本信息,主要包括学术文献与地质报告.这类数据的核心价值在于其蕴含对现有矿床成因的归纳分析和成矿特征的描述,但其非结构化特性为模型训练带来挑战(Zhou et al., 2021; Ma, 2022).矿产预测语言大模型是聚焦于找矿文本大数据处理与成矿知识挖掘的专用大模型,其核心功能是从非结构化文本中提取、整合与成矿相关的规律知识(Fu et al., 2025).

矿产预测语言大模型的具体构建过程如下:

(1)数据准备.收集高质量的找矿文本数据集,如从国内外期刊上收集找矿相关论文、从专业渠道获取找矿相关的地质报告等.若要从零开始构建该语言大模型,则需要收集1.4节中所提到的通用文本语料,来丰富模型的预训练数据集,使其能覆盖各领域的基本知识,增强模型的泛化能力.可以利用现有大语言模型对数据集进行高效预处理,如数据清洗、数据增强以及构建对话数据集等.为使模型能充分理解找矿文本,应在现有词表的基础上建立专业术语词表.

(2)模型预训练.预训练时,可首先选择MLM和NSP对模型进行预训练,增强模型的文本理解能力.在此基础上,选择CLM任务来训练模型的文本生成能力(图3).

(3)模型微调.使用1.4节中提到的基于人类反馈的强化学习方法来优化预训练模型的输出,使其更合理.此外使用高质量的找矿文本及其构建的对话数据集再次对参数进行微调,增加其对专业知识的理解.为减少微调时所消耗的计算资源,使用参数高效微调方法对模型参数进行调整.

(4)模型部署应用.除1.4节中提到的部署手段以外,可预先使用提示词工程来引导模型对找矿文本进行批量处理,如批量文献解析与知识总结、自动构建知识图谱等(图11).同时,为减少模型出现幻觉,编造虚假信息,可选择检索增强生成(Lewis et al., 2019)和知识增强生成(Liang et al., 2025)等手段挂载地质知识库或知识图谱,使模型能够根据知识库中的内容对用户进行更准确地反馈.

尽管使用专业找矿文本预训练的语言大模型相较于其他通用大模型(如GPT、Qwen等)对找矿文本数据的适配性较高,但是从零开始训练模型会导致训练成本高昂(Bommasani et al., 2022).此外,仅将找矿文本作为训练数据,导致其知识来源过于单一,模型泛化能力不足.因此,在构建垂直语言大模型时,常选择开源的通用大模型,如Qwen(Bai et al., 2023)、LLaMA(Touvron et al., 2023)、DeepSeek(Liu et al., 2024a)等作为基底,对其已有的语言理解和生成能力加以利用(图11),不仅能够减少对找矿文本数据量的依赖,同时能够减少模型训练成本.

2.2.2 矿产预测视觉大模型

找矿空间大数据包括地质、地球化学、地球物理及遥感等数据,这些数据蕴含丰富的空间信息(Zuo, 2020).综合多源空间数据的矿化信息,可减少单一找矿数据的不确定性,提高找矿成效.但由于不同数据类型的矿化信息特征各异,且研究区数据种类与数量差异显著,导致单一模型难以适配所有场景.因此,矿产预测视觉大模型的设计需强调可扩展性.一种可行的方案是采用混合专家系统架构(Jacobs et al., 1991),为每种空间数据设置独立子模型,专注提取单一来源的矿化信息(图12).

矿产预测视觉大模型的具体构建过程如下:

(1)数据准备.找矿空间大数据呈现出多源特性,不同来源的数据具有不同的格式.需要根据各类空间数据的特点对其进行表征和归一化,如地球化学数据可被表征为图像或者拓扑图(Xu et al., 2025b).在应对缺失的空间数据时,应进行缺失值处理,然后对空间数据分别进行预处理并嵌入.

(2)模型预训练.在预训练任务选择上,优先采用能充分提取找矿空间特征的任务.MAE通过将输入数据进行掩码并预测缺失区域,使模型从已知信息中挖掘缺失区域特征,提升模型对视觉信息的理解能力.针对矿产预测视觉大模型的混合专家系统架构,第一阶段由各子模型独立使用MAE进行预训练,使各子模型能够理解各自领域的数据.在第二阶段的预训练中,使用同一位置的各类找矿空间大数据同时进行MAE预训练,即对某一来源的全部数据进行掩码并使用其他来源的空间数据对其进行重构,使矿产预测视觉大模型能理解多源找矿空间大数据.

(3)模型微调.冻结预训练模型参数,添加可训练的任务适配器,使用已知矿床标注的找矿空间数据集进行有监督微调,将高维找矿特征转换为成矿概率,来适配相应的任务.

(4)模型部署应用.除1.4节中提到的方式外,还可以为每一种空间数据的输入设置独立的接口以及微调方法,保证其在应用时的便利.

尽管“无监督预训练+有监督微调”的策略能利用有限的标注数据实现小样本训练,但其仅依赖数据驱动的特性存在一定的局限性.一方面,少量矿床(点)微调往往难以支持无标注区域的矿床发现.另一方面,缺乏成矿知识约束的模型可能产生与地质事实不一致的预测结果,且结果往往难以解释.

2.2.3 矿产预测多模态大模型

多模态大语言模型为矿产预测大模型提供了一个可行路径,矿产预测多模态大模型以具有推理能力的矿产预测语言大模型为骨干,借助矿产预测视觉大模型的空间信息感知能力,使其能从未训练区域中自动提取多源找矿信息并圈定成矿远景区和找矿靶区.

矿产预测多模态大模型的具体构建过程如下:

(1)数据准备.构建如下预训练数据集:(a)对齐数据集:构建找矿语料‒空间数据对(图13a),对齐文本数据和空间数据的特征空间;(b)对话数据集:使用现有大语言模型来构建对话数据集(图13b),增强模型的图文对话能力;(c)空间数据生成数据集:结合对话数据集,将某一个空间数据作为输出目标来构建该数据集(图13c).同时构建矿产预测微调数据集(图14),可根据现有科技论文文献作为基础,使用现有大语言模型进行优化获得;成矿远景图和找矿靶区图可采用深度学习模型获取,汇总后构建该微调数据集,使模型具备空间决策能力.

(2)模型预训练.该模型可在上文提到的矿产预测语言大模型和矿产预测视觉大模型的基础上进行构建(图15),并额外添加成矿远景图和找矿靶区图生成器进行空间决策.模型的预训练任务包括三种:(a)找矿文本‒空间对齐任务:使用CLIP任务对齐找矿文本和空间数据的特征空间;(b)找矿文本生成任务:使用CLM任务,让模型从输入找矿数据中挖掘并生成对应文本描述;(c)空间数据生成任务:根据提供的找矿信息,输出对应空间数据,训练模型生成找矿空间数据的能力,使矿产预测大模型具有初步空间决策能力.

(3)模型微调.使用找矿文本‒空间微调数据集(图14),对图15中虚线内的浅层神经网络进行微调.同时使用基于人类反馈的强化学习来提升该模型文本输出的合理性.

(4)模型部署应用:除1.4节中提到的方式外,可为每一种空间数据的输入设置独立的接口以及微调方法.可预先使用提示词工程来引导模型对找矿文本批量处理,如批量文献解析与知识总结、自动构建地质知识图谱等(图11).同时,为减少模型出现幻觉,编造虚假信息,可选择检索增强生成(Lewis et al., 2019)和知识增强生成(Liang et al., 2025)等手段挂载知识库或知识图谱,使模型能够根据知识库中的内容对用户进行准确地反馈.

最终目标是构建一个以对话系统为核心的矿产预测多模态大模型,能够根据用户输入的文献资料或找矿空间数据,发现成矿知识并圈定找矿远景区或找矿靶区.该模型不仅具备跨区域泛化能力,还能通过语言交互实现知识驱动的智能矿产预测.

3 矿产预测大模型构建的挑战与建议

矿产预测大模型已逐渐成为突破传统人工智能方法局限的重要研究方向,其核心优势在于能够融合文本与空间等多模态数据,可提升跨区域泛化能力和地质任务适配性. 然而,从MineAgent到GFM4MPM和FM4GAI等探索性实践来看,现有研究在数据集、特征表示、模型架构等方面仍存在如下挑战:

(1)数据集.高质量、结构化的找矿大数据集获取难度大,且预处理流程复杂.本文所提出的矿产预测大模型需依赖多源找矿数据(包括文献文本、地质、地球化学、地球物理、遥感数据等).在预训练任务中,需大量优质的文本‒空间数据对,而此类数据需耗费大量人力进行收集、清洗、标注,并依赖专家知识构建,显著增加了数据准备成本.由于大模型的知识来源依赖训练数据,数据获取的局限性直接制约了模型性能.为缓解文本数据预处理阶段的人力消耗,可借助现有大语言模型,如Qwen、DeepSeek、GPT等作为工具,经提示词工程后对文本语料批量进行清洗、标注等预处理.

(2)找矿大数据表征.找矿大数据具有多源、异构、多维度、多时空分辨率、缺失值多等特征,如何高效表征这些数据作为大模型的输入是构建大模型的一个挑战.一个可用的解决方案是构建找矿知识图谱来表征找矿大数据,将找矿大数据的多源特征作为属性并使用边来表示其异构特性.

(3)预训练任务设计.现有预训练任务难以适配矿化特征提取需求.直接借鉴自然语言处理与计算机视觉领域的掩码重构、生成式扩散模型等任务,可能因找矿数据的特殊性(如地质异质性、多模态耦合)导致效果不佳.因此,需开发针对找矿场景的定制化预训练任务(如基于地质规律的多模态对齐任务),以提升模型对矿化特征的识别能力.

(4)模型框架设计.传统方法难以高效处理找矿大数据的特征高维性与结构复杂性,亟须将现有的通用多模态大模型发展至矿产预测领域.从零开始训练大模型的计算开销巨大,因此需要利用现有通用大模型为基座,并引入矿产预测视觉大模型,为通用大模型提供多模态找矿数据感知能力.该方式可大幅缩短训练时间,从而推动矿产预测大模型的实际应用.

4 结论与展望

随着大模型在自然语言处理与计算机视觉领域的突破性进展,其强大的泛化能力与多任务适配性引发了学术界与工业界的广泛关注.矿产预测大模型作为语言‒空间多模态融合的典型应用,通过整合文献文本中的成矿知识与找矿空间数据中的矿化特征,创新出从“数据驱动”到“数据驱动+知识引导”的新型找矿范式.具体而言,该模型具备“成矿知识挖掘与成矿规律提取”和“空间预测与找矿远景区或找矿靶区生成”两大核心优势.然而,矿产预测大模型的实际应用在数据层面、方法层面等仍面临多重挑战.

矿产预测大模型的未来研究方向需聚焦以下六个方面:(1)构建大规模找矿数据集:系统收集准确、种类丰富的大规模找矿文本‒空间数据集,为矿产预测大模型构建提供坚实的数据支撑;(2)探索找矿空间数据表征形式:创新多源空间数据表征方法,完整保留其中蕴含的找矿信息;(3)定制化模型架构设计:针对性设计适配多源找矿数据的模型架构,实现模型对找矿信息的充分提取;(4)定制化预训练任务设计:开发基于地质规律的多模态对齐任务,增强模型对地质数据异质性的适应能力;(5)知识增强框架构建:通过地质知识库与大模型的深度融合(如检索增强生成),实现从“数据驱动”到“数据驱动+知识引导”的范式转变;(6)动态更新机制探索:引入流数据处理框架与增量学习策略,赋予模型实时响应新数据的能力,提升预测的时效性与区域适配性.

参考文献

[1]

Achiam, J., Adler, S., Agarwal, S., et al., 2023. GPT⁃4 Technical Report. arXiv, 2303.08774. http://arxiv.org/abs/2303.08774

[2]

Agterberg, F. P., 1989. Computer Programs for Mineral Exploration. Science, 245(4913): 76-81. https://doi.org/10.1126/science.245.4913.76

[3]

Awais, M., Naseer, M., Khan, S., et al., 2025. Foundation Models Defining a New Era in Vision: A Survey and Outlook. IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(4): 2245-2264. https://doi.org/10.1109/TPAMI.2024.3506283

[4]

Azulay, A., Weiss, Y., 2019. Why Do Deep Convolutional Networks Generalize so Poorly to Small Image Transformations? Journal of Machine Learning Research, 20(184): 1-25.

[5]

Bai, J., Bai, S., Chu, Y., et al., 2023. Qwen Technical Report. arXiv, 2309.16609. http://arxiv.org/abs/2309.16609

[6]

Baltrušaitis, T., Ahuja, C., Morency, L. P., 2019. Multimodal Machine Learning: A Survey and Taxonomy. IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(2): 423-443. https://doi.org/10.1109/TPAMI.2018.2798607

[7]

Bao, H., Dong, L., Piao, S., et al., 2022. BEiT: BERT Pre⁃Training of Image Transformers. arXiv, 2106.08254. http://arxiv.org/abs/2106.08254

[8]

Bommasani, R., Hudson, D. A., Adeli, E., et al., 2022. On the Opportunities and Risks of Foundation Models. arXiv, 2108.07258. http://arxiv.org/abs/2108.07258

[9]

Brown, T. B., Mann, B., Ryder, N., et al., 2020. Language Models are Few⁃Shot Learners. arXiv, 2005.14165. https://doi.org/10.48550/arXiv.2005.14165

[10]

Carranza, E. J. M., 2009. Geochemical Anomaly and Mineral Prospectivity Mapping in GIS. Economic Geology, 104(6): 890-890. https://doi.org/10.2113/gsecongeo.104.6.890

[11]

Chowdhary, K. R., 2020. Natural Language Processing. In: Chowdhary, K. R., ed., Fundamentals of Artificial Intelligence. Springer, New Delhi, 603-649. https://doi.org/10.1007/978⁃81⁃322⁃3972⁃7_19

[12]

Collobert, R., Weston, J., Bottou, L., et al., 2011. Natural Language Processing (Almost) from Scratch. Journal of Machine Learning Research, 12(7): 2493-2537.

[13]

Dalal, N., Triggs, B., 2005. Histograms of Oriented Gradients for Human Detection. IEEE Computer Society Conference on Computer Vision and Pattern Recognition(CVPR'05), San Diego. https://doi.org/10.1109/CVPR.2005.177

[14]

Daruna, A., Zadorozhnyy, V., Lukoczki, G., et al., 2024. GFM4MPM: Towards Geospatial Foundation Models for Mineral Prospectivity Mapping. The 32nd ACM International Conference on Advances in Geographic Information Systems, Atlanta, 565-568. https://doi.org/10.1145/3678717.3691268

[15]

Deng, C., Zhang, T. H., He, Z. M., et al., 2024. K2: A Foundation Language Model for Geoscience Knowledge Understanding and Utilization. The 17th ACM International Conference on Web Search and Data Mining, New York. https://doi.org/10.1145/3616855.3635772

[16]

Deng, J., Dong, W., Socher, R., et al., 2009. ImageNet: A Large⁃Scale Hierarchical Image Database. 2009 IEEE Conference on Computer Vision and Pattern Recognition, Miami. https://doi.org/10.1109/CVPR.2009.5206848

[17]

Devlin, J., Chang, M. W., Lee, K., et al., 2019. BERT: Pre⁃Training of Deep Bidirectional Transformers for Language Understanding. The 2019 Conference of the North American Chapter of the Association for Computational Linguistics, Minneapolis. https://doi.org/10.18653/v1/N19⁃1423

[18]

Dong, H., Xie, S., 2024. Large Language Models (LLMs): Deployment, Tokenomics and Sustainability. arXiv, 2405.17147. https://doi.org/10.48550/arXiv.2405.17147

[19]

Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al., 2020. An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. arXiv, 2010.11929. http://arxiv.org/abs/2010.11929

[20]

Fedus, W., Zoph, B., Shazeer, N., 2022. Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research, 23(120): 1-39.

[21]

Feng, X. S., Liu, S. C., Chen, H. T., et al., 2023. Continual Trajectory Prediction with Uncertainty⁃Aware Generative Memory Replay. 2023 IEEE International Conference on Data Mining (ICDM), Shanghai. https://doi.org/10.1109/ICDM58522.2023.00116

[22]

Fu, Y., Wang, M. G., Wang, C. B., et al., 2025. GeoMinLM: A Large Language Model in Geology and Mineral Survey in Yunnan Province. Ore Geology Reviews, 182: 106638. https://doi.org/10.1016/j.oregeorev.2025.106638

[23]

Gemma Team, 2025. Gemma 3 Technical Report. arXiv, 2503.19786. https://doi.org/10.48550/ARXIV.2503.19786

[24]

Gong, L., Hou, X., Li, F., et al., 2025. Seedream 2.0: A Native Chinese⁃English Bilingual Image Generation Foundation Model. arXiv, 2503.07703. http://arxiv.org/abs/2503.07703

[25]

Grattafiori, A., Dubey, A., Jauhri, A., et al., 2024. The Llama 3 Herd of Models. arXiv, 2407.21783. https://doi.org/10.48550/ARXIV.2407.21783

[26]

Guo, X., Lao, J., Dang, B., et al., 2024. SkySense: A Multi⁃Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery. arXiv, 2312.10115. http://arxiv.org/abs/2312.10115

[27]

Guo, Z. X., Wu, X. M., Liang, L. M., et al., 2025. Cross⁃Domain Foundation Model Adaptation: Pioneering Computer Vision Models for Geophysical Data Analysis. Journal of Geophysical Research: Machine Learning and Computation, 2(1): e2025JH000601. https://doi.org/10.1029/2025JH000601

[28]

Han, S., Pool, J., Tran, J., et al., 2015. Learning Both Weights and Connections for Efficient Neural Network. arXiv, 1506.02626. https://doi.org/10.48550/arXiv.1506.02626

[29]

He, K. M., Zhang, X. Y., Ren, S. Q., et al., 2016. Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas. https://doi.org/10.1109/CVPR.2016.90

[30]

He, K., Chen, X., Xie, S., et al., 2021. Masked Autoencoders are Scalable Vision Learners. arXiv, 2111.06377. http://arxiv.org/abs/2111.06377

[31]

Hinton, G. E., Osindero, S., Teh, Y. W., 2006. A Fast Learning Algorithm for Deep Belief Nets. Neural Computation, 18(7): 1527-1554. https://doi.org/10.1162/neco.2006.18.7.1527

[32]

Hinton, G. E., Salakhutdinov, R. R., 2006. Reducing the Dimensionality of Data with Neural Networks. Science, 313(5786): 504-507. https://doi.org/10.1126/science.1127647

[33]

Hinton, G., Vinyals, O., Dean, J., 2015. Distilling the Knowledge in a Neural Network. arXiv, 1503.02531. https://doi.org/10.48550/arXiv.1503.02531

[34]

Ho, J., Jain, A., Abbeel, P., 2020. Denoising Diffusion Probabilistic Models. arXiv, 2006.11239. https://arxiv.org/abs/2006.11239

[35]

Hong, D. F., Zhang, B., Li, X. Y., et al., 2024. SpectralGPT: Spectral Remote Sensing Foundation Model. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(8): 5227-5244. https://doi.org/10.1109/TPAMI.2024.3362475

[36]

Houlsby, N., Giurgiu, A., Jastrzebski, S., et al., 2019. Parameter⁃Efficient Transfer Learning for NLP. arXiv, 1902.00751. https://doi.org/10.48550/ARXIV.1902.00751

[37]

Hu, E. J., Shen, Y., Wallis, P., et al., 2022. Lora: Low⁃rank Adaptation of Large Language Models. arXiv, 2106.09685 https://doi.org/10.48550/arXiv.2106.09685

[38]

Hu, Y., Yuan, J., Wen, C., et al., 2023. RSGPT: A Remote Sensing Vision Language Model and Benchmark. arXiv, 2307.15266. http://arxiv.org/abs/2307.15266

[39]

Jacob, B., Kligys, S., Chen, B., et al., 2018. Quantization and Training of Neural Networks for Efficient Integer⁃Arithmetic⁃Only Inference. 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, Salt Lake City. https://doi.org/10.1109/CVPR.2018.00286

[40]

Jacobs, R. A., Jordan, M. I., Nowlan, S. J., et al., 1991. Adaptive Mixtures of Local Experts. Neural Computation, 3(1): 79-87. https://doi.org/10.1162/neco.1991.3.1.79

[41]

Kirillov, A., Mintun, E., Ravi, N., et al., 2023. Segment Anything. arXiv, 2304.02643. http://arxiv.org/abs/2304.02643

[42]

Krizhevsky, A., Sutskever, I., Hinton, G. E., 2012. Imagenet Classification with Deep Convolutional Neural Networks. Advances in Neural Information Processing Systems, New York.

[43]

Lazebnik, S., Schmid, C., Ponce, J., 2006. Beyond Bags of Features: Spatial Pyramid Matching for Recognizing Natural Scene Categories. 2006 IEEE Computer Society Conference on Computer Vision and Pattern Recognition(CVPR'06), New York. https://doi.org/10.1109/CVPR.2006.68

[44]

LeCun, Y., Boser, B., Denker, J. S., et al., 1989. Backpropagation Applied to Handwritten Zip Code Recognition. Neural Computation, 1(4): 541-551.

[45]

LeCun, Y., Bottou, L., Bengio, Y., et al., 1998. Gradient⁃Based Learning Applied to Document Recognition. Proceedings of the IEEE, 86(11): 2278-2324. https://doi.org/10.1109/5.726791

[46]

Lewis, M., Liu, Y., Goyal, N., et al., 2019. BART: Denoising Sequence⁃to⁃Sequence Pre⁃Training for Natural Language Generation, Translation, and Comprehension. arXiv, 1910.13461. http://arxiv.org/abs/1910.13461

[47]

Li, T., Zuo, R. G., Xiong, Y. H., et al., 2021. Random⁃Drop Data Augmentation of Deep Convolutional Neural Network for Mineral Prospectivity Mapping. Natural Resources Research, 30(1): 27-38. https://doi.org/10.1007/s11053⁃020⁃09742⁃z

[48]

Li, X. L., Liang, P., 2021. Prefix⁃Tuning: Optimizing Continuous Prompts for Generation. arXiv, 2101.00190. https://doi.org/10.48550/ARXIV.2101.00190

[49]

Liang, L., Bo, Z. P., Gui, Z. K., et al., 2025. KAG: Boosting LLMs in Professional Domains via Knowledge Augmented Generation. The ACM on Web Conference 2025, Sydney. https://doi.org/10.1145/3701716.3715240

[50]

Lin, Z., Deng, C., Zhou, L., et al., 2023. Geogalactica: A Scientific Large Language Model in Geoscience. arXiv, 2401.00434. http://arxiv.org/abs/2401.00434

[51]

Liu, A., Feng, B., Xue, B., et al., 2024a. Deepseek⁃V3 Technical Report. arXiv, 2412.19437. http://arxiv.org/abs/2412.19437

[52]

Liu, F., Chen, D. L., Guan, Z., et al., 2024b. RemoteCLIP: A Vision Language Foundation Model for Remote Sensing. IEEE Transactions on Geoscience and Remote Sensing, 62: 5622216. https://doi.org/10.1109/TGRS.2024.3390838

[53]

Liu, Q., Ma, J., 2024. Foundation Models for Geophysics: Review and Perspective. arXiv, 2406.03163. https://doi.org/10.48550/arXiv.2406.03163

[54]

Liu, X., Ji, K., Fu, Y., et al., 2021a. P⁃Tuning V2: Prompt Tuning Can be Comparable to Fine⁃Tuning Universally across Scales and Tasks. arXiv, 2110.07602. http://arxiv.org/abs/2110.07602

[55]

Liu, Y., Zhang, K., Li, Y., et al., 2024c. Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models. arXiv,2402.17177. http://arxiv.org/abs/2402.17177

[56]

Liu, Z., Lin, Y. T., Cao, Y., et al., 2021b. Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows. 2021 IEEE/CVF International Conference on Computer Vision (ICCV), Montreal. https://doi.org/10.1109/ICCV48922.2021.00986

[57]

Lowe, D. G., 2004. Distinctive Image Features from Scale⁃Invariant Keypoints. International Journal of Computer Vision, 60(2): 91-110. https://doi.org/10.1023/B:VISI.0000029664.99615.94

[58]

Ma, X. G., 2022. Knowledge Graph Construction and Application in Geosciences: A Review. Computers & Geosciences, 161: 105082. https://doi.org/10.1016/j.cageo.2022.105082

[59]

Mikolov, T., Chen, K., Corrado, G., et al., 2013. Efficient Estimation of Word Representations in Vector Space. arXiv, 1301.3781. http://arxiv.org/abs/1301.3781

[60]

Nadkarni, P. M., Ohno⁃Machado, L., Chapman, W. W., 2011. Natural Language Processing: An Introduction. Journal of the American Medical Informatics Association, 18(5): 544-551. https://doi.org/10.1136/amiajnl⁃2011⁃000464

[61]

Ouyang, L., Wu, J., Jiang, X., et al., 2022. Training Language Models to Follow Instructions with Human Feedback. arXiv, 2203.02155. http://arxiv.org/abs/2203.02155

[62]

Pennington, J., Socher, R., Manning, C., 2014. Glove: Global Vectors for Word Representation. The 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), Doha. https://doi.org/10.3115/v1/d14⁃1162

[63]

Poddar, L., Szarvas, G., Wang, C., et al., 2022. Deploying a Retrieval based Response Model for Task Oriented Dialogues. arXiv, 2210.14379. https://arxiv.org/abs/2210.14379.

[64]

Qiu, Q. J., Wang, B., Ma, K., et al., 2023. A Practical Approach to Constructing a Geological Knowledge Graph: A Case Study of Mineral Exploration Data. Journal of Earth Science, 34(5): 1374-1389. https://doi.org/10.1007/s12583⁃023⁃1809⁃3

[65]

Radford, A., Kim, J. W., Hallacy, C., et al., 2021. Learning Transferable Visual Models From Natural Language Supervision. arXiv, 2103.00020. http://arxiv.org/abs/2103.00020

[66]

Radford, A., Narasimhan, K., 2018. Improving Language Understanding by Generative Pre⁃Training. OpenAI Technical Report. https://cdn.openai.com/research⁃covers/language⁃unsupervised/language_understanding_paper.pdf

[67]

Rombach, R., Blattmann, A., Lorenz, D., et al., 2021. High⁃Resolution Image Synthesis with Latent Diffusion Models. arXiv, 2112.10752. https://doi.org/10.48550/arXiv.2112.10752

[68]

Schuhmann, C., Beaumont, R., Vencu, R., et al., 2022. Laion⁃5b: An Open Large⁃Scale Dataset for Training Next Generation Image⁃Text Models. Advances in Neural Information Processing Systems, New Orleans.

[69]

Sheng, H. L., Wu, X. M., Si, X., et al., 2025b. Seismic Foundation Model: A Next Generation Deep⁃Learning Model in Geophysics. Geophysics, 90(2): IM59-IM79. https://doi.org/10.1190/geo2024⁃0262.1

[70]

Sheng, H., Wu, X., Gao, H., et al., 2025a. On the Workflow, Opportunities and Challenges of Developing Foundation Model in Geophysics. arXiv, 2504.17384. https://doi.org/10.48550/ARXIV.2504.17384

[71]

Shi, L. Y., Xu, Y., Zuo, R. G., 2024. A Heterogeneous Graph Construction Method for Mineral Prospectivity Mapping. Natural Resources Research, 33(4): 1365-1376. https://doi.org/10.1007/s11053⁃024⁃10344⁃2

[72]

Shi, L. Y., Zuo, R. G., 2025. Geological Knowledge⁃Embedding Transfer⁃Learning Architecture for Geochemical Anomaly Identification. Mathematical Geosciences, 57(5): 821-844. https://doi.org/10.1007/s11004⁃025⁃10190⁃9

[73]

Shi, L. Y., Zuo, R. G., 2026. A Foundation Model for Geochemical Anomaly Identification. Natural Resources Research, Online. https://doi.org/10.1007/s11053⁃026⁃10664⁃5

[74]

Simonyan, K., Zisserman, A., 2014. Very Deep Convolutional Networks for Large⁃Scale Image Recognition. arXiv, 1409.1556. https://doi.org/10.48550/arXiv.1409.1556

[75]

Sutskever, I., Vinyals, O., Le, Q. V., 2014. Sequence to Sequence Learning with Neural Networks. Advances in Neural Information Processing Systems, Montréal.

[76]

Szeliski, R., 2022. Computer Vision: Algorithms and Applications. Springer. https://doi.org/10.1007/978⁃3⁃030⁃34372⁃9

[77]

Tang, D., Qin, B., Feng, X., et al., 2015. Effective LSTMs for Target⁃Dependent Sentiment Classification. arXiv, 1512.01100. https://doi.org/10.48550/arXiv.1512.01100

[78]

Taylor, R. B., Steven, T. A., 1983. Definition of Mineral Resource Potential. Economic Geology, 78(6): 1268-1270. https://doi.org/10.2113/gsecongeo.78.6.1268

[79]

Touvron, H., Lavril, T., Izacard, G., et al., 2023. LLaMA: Open and Efficient Foundation Language Models. arXiv, 2302.13971. http://arxiv.org/abs/2302.13971

[80]

Vaswani, A., Shazeer, N., Parmar, N., et al., 2017. Attention is All you Need. Advances in Neural Information Processing Systems, Long Beach.

[81]

Viola, P., Jones, M., 2001. Rapid Object Detection Using a Boosted Cascade of Simple Features. The 2001 IEEE Computer Society Conference on Computer Vision and Pattern Recognition. CVPR 2001. Kauai. https://doi.org/10.1109/CVPR.2001.990517

[82]

Voulodimos, A., Doulamis, N., Doulamis, A., et al., 2018. Deep Learning for Computer Vision: A Brief Review. Computational Intelligence and Neuroscience, 2018: 7068349. https://doi.org/10.1155/2018/7068349

[83]

Wang, B., Wu, L., Xie, Z., et al., 2022. Understanding Geological Reports Based on Knowledge Graphs Using a Deep Learning Approach. Computers & Geosciences, 168: 105229. https://doi.org/10.1016/j.cageo.2022.105229

[84]

Wang, Z. Y., Zuo, R. G., 2022. Mineral Prospectivity Mapping Using a Joint Singularity⁃Based Weighting Method and Long Short⁃Term Memory Network. Computers & Geosciences, 158: 104974. https://doi.org/10.1016/j.cageo.2021.104974

[85]

Wei, J., Wang, X., Schuurmans, D., et al., 2022. Chain⁃of⁃Thought Prompting Elicits Reasoning in Large Language Models. The 36th International Conference on Neural Information Processing Systems, New Orleans.

[86]

Xu, Y., Zuo, R. G., 2024. An Interpretable Graph Attention Network for Mineral Prospectivity Mapping. Mathematical Geosciences, 56(2): 169-190. https://doi.org/10.1007/s11004⁃023⁃10076⁃8

[87]

Xu, Y., Zuo, R. G., Bai, Y., 2025a. Geological Knowledge⁃Guided Dual⁃Branch Deep Learning Model for Identification of Geochemical Anomalies Related to Mineralization. Journal of Geophysical Research: Machine Learning and Computation, 2(1): e2024JH000468. https://doi.org/10.1029/2024JH000468

[88]

Xu, Y., Zuo, R. G., Chen, Z. Y., et al., 2025b. Recent Advances and Future Research Directions in Deep Learning as Applied to Geochemical Mapping. Earth⁃Science Reviews, 270: 105209. https://doi.org/10.1016/j.earscirev.2025.105209

[89]

Yan, Q., Xue, L. F., Li, Y. S., et al., 2023. Mineral Prospectivity Mapping Integrated with Geological Map Knowledge Graph and Geochemical Data: A Case Study of Gold Deposits at Raofeng Area, Shaanxi Province. Ore Geology Reviews, 161: 105651. https://doi.org/10.1016/j.oregeorev.2023.105651

[90]

Yan, Q., Zhao, J., Xue, L. F., et al., 2024. Mineral Prospectivity Mapping Based on Spatial Feature Classification with Geological Map Knowledge Graph Embedding: Case Study of Gold Ore Prediction at Wulonggou, Qinghai Province (Western China). Natural Resources Research, 33(6): 2385-2406. https://doi.org/10.1007/s11053⁃024⁃10386⁃6

[91]

Yang, F. F., Wang, Z. Y., Zuo, R. G., et al., 2023. Quantification of Uncertainty Associated with Evidence Layers in Mineral Prospectivity Mapping Using Direct Sampling and Convolutional Neural Network. Natural Resources Research, 32(1): 79-98. https://doi.org/10.1007/s11053⁃022⁃10144⁃6

[92]

Yang, F. F., Zuo, R. G., 2024. Geologically Constrained Convolutional Neural Network for Mineral Prospectivity Mapping. Mathematical Geosciences, 56(8): 1605-1628. https://doi.org/10.1007/s11004⁃024⁃10141⁃w

[93]

Yin, B. J., Zuo, R. G., Xiong, Y. H., 2022. Mineral Prospectivity Mapping via Gated Recurrent Unit Model. Natural Resources Research, 31(4): 2065-2079. https://doi.org/10.1007/s11053⁃021⁃09979⁃2

[94]

Yin, S. K., Fu, C. Y., Zhao, S. R., et al., 2024. A Survey on Multimodal Large Language Models. National Science Review, 11(12): nwae403. https://doi.org/10.1093/nsr/nwae403

[95]

Yu, B., Shen, T., Na, H., et al., 2024. MineAgent: Towards Remote⁃Sensing Mineral Exploration with Multimodal Large Language Models. arXiv, 2412.17339. https://doi.org/10.48550/arXiv.2412.17339

[96]

Zaken, E. B., Ravfogel, S., and Goldberg, Y., 2021. BitFit: Simple Parameter⁃Efficient Fine⁃Tuning for Transformer⁃Based Masked Language⁃Models. arXiv, 2106.10199. https://doi.org/10.48550/ARXIV.2106.10199

[97]

Zhang, J. Y., Huang, J. X., Jin, S., et al., 2024a. Vision⁃Language Models for Vision Tasks: A Survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(8): 5625-5644. https://doi.org/10.1109/TPAMI.2024.3369699

[98]

Zhang, Q., Chen, M., Bukharin, A., et al., 2023a. AdaLoRA: Adaptive Budget Allocation for Parameter⁃Efficient Fine⁃Tuning. arXiv, 2303.10512. https://doi.org/10.48550/ARXIV.2303.10512

[99]

Zhang, Y. F., Wang, Z. Y., He, Z. T., et al., 2024b. BB⁃GeoGPT: A Framework for Learning a Large Language Model for Geographic Information Science. Information Processing & Management, 61(5): 103808. https://doi.org/10.1016/j.ipm.2024.103808

[100]

Zhang, Y., Wei, C., Wu, S., et al., 2023b. GeoGPT: Understanding and Processing Geospatial Tasks Through an Autonomous GPT. arXiv, 2307.07930. https://doi.org/10.48550/arXiv.2307.07930

[101]

Zhang, Z. J., Zuo, R. G., Xiong, Y. H., 2016. A Comparative Study of Fuzzy Weights of Evidence and Random Forests for Mapping Mineral Prospectivity for Skarn⁃Type Fe Deposits in the Southwestern Fujian Metallogenic Belt, China. Science China Earth Sciences, 59(3): 556-572. https://doi.org/10.1007/s11430⁃015⁃5178⁃3

[102]

Zhao, W. X., Zhou, K., Li, J., et al., 2023. A Survey of Large Language Models. arXiv, 2303.18223. http://arxiv.org/abs/2303.18223

[103]

Zhejiang Lab, 2025. GeoGPT: A Non⁃Profit Research Project for Earth Science Exploration (in Chinese). https://geogpt.zero2x.org.cn/cn

[104]

Zhou, C. H., Wang, H., Wang, C. S., et al., 2021. Geoscience Knowledge Graph in the Big Data Era. Science China Earth Sciences, 64(7): 1105-1114. https://doi.org/10.1007/s11430⁃020⁃9750⁃4

[105]

Zhou, C., Li, Q., Li, C., et al., 2023. A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT. arXiv, 2302.09419. http://arxiv.org/abs/2302.09419

[106]

Zuo, R. G., 2016. A Nonlinear Controlling Function of Geological Features on Magmatic⁃Hydrothermal Mineralization. Scientific Reports, 6: 27127. https://doi.org/10.1038/srep27127

[107]

Zuo, R. G., 2020. Geodata Science⁃Based Mineral Prospectivity Mapping: A Review. Natural Resources Research, 29(6): 3415-3424. https://doi.org/10.1007/s11053⁃ 020⁃09700⁃9

[108]

Zuo, R. G., 2021. Data Science⁃Based Theory and Method of Quantitative Prediction of Mineral Resources. Earth Science Frontiers, 28(3): 49-55 (in Chinese with English abstract).

[109]

Zuo, R. G., 2025. Key Technology for Intelligent Mineral Prospectivity Mapping: Challenges and Solutions. Scientia Sinica (Terrae), 55(9): 3104-3119 (in Chinese with English abstract).

[110]

Zuo, R. G., Carranza, E. J. M., 2011. Support Vector Machine: A Tool for Mapping Mineral Prospectivity. Computers & Geosciences, 37(12): 1967-1975. https://doi.org/10.1016/j.cageo.2010.09.014

[111]

Zuo, R. G., Cheng, Q., Xu, Y., et al., 2024. Explainable Artificial Intelligence Models for Mineral Prospectivity Mapping. Scientia Sinica (Terrae), 54(9): 2917-2928 (in Chinese with English abstract).

[112]

Zuo, R. G., Peng, Y., Li, T., et al., 2021. Challenges of Geological Prospecting Big Data Mining and Integration Using Deep Learning Algorithms. Earth Science, 46(1): 350-358 (in Chinese with English abstract).

[113]

Zuo, R. G., Xiong, Y. H., Wang, Z. Y., et al., 2023. A New Generation of Artificial Intelligence Algorithms for Mineral Prospectivity Mapping. Natural Resources Research, 32(5): 1859-1869. https://doi.org/10.1007/s11053⁃023⁃10237⁃w

[114]

Zuo, R. G., Xu, Y., 2023. Graph Deep Learning Model for Mapping Mineral Prospectivity. Mathematical Geosciences, 55(1): 1-21. https://doi.org/10.1007/s11004⁃022⁃10015⁃z

[115]

Zuo, R. G., Yang, F. F., Cheng, Q. M., et al., 2025. A Novel Data⁃Knowledge Dual⁃Driven Model Coupling Artificial Intelligence with a Mineral Systems Approach for Mineral Prospectivity Mapping. Geology, 53(3): 284-288. https://doi.org/10.1130/g52970.1

基金资助

国家自然科学基金项目(42530801)

国家自然科学基金项目(42425208)

AI Summary AI Mindmap
PDF (1855KB)

3206

访问

0

被引

详细

导航
相关文章

AI思维导图

/