基于BERT和BiGRU的数字产业岗位实体识别与人才画像

杨彦武 ,  翟盼雨 ,  金颖

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 667 -679.

PDF (3560KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 667 -679. DOI: 10.14188/j.1671-8836.2024.0038
智能分析技术

基于BERT和BiGRU的数字产业岗位实体识别与人才画像

作者信息 +

Entity Recognition and Talent Profiles in Digital Industry Job Based on BERT and BiGRU

Author information +
文章历史 +
PDF (3644K)

摘要

构建了一个面向数字产业的实体识别与人才画像(BERT-BiGRU-Attention-CRF)模型。该模型融合了BERT和BiGRU两种表征学习方法,根据句子的上下文语义进行文本表达,并采用多头注意力加强关键语义信息,然后利用条件随机场(CRF)方法对文本进行分类,识别岗位的人才需求。抓取国内三大主流网站上数字产业相关岗位的最新招聘信息进行分析,结果表明,BERT-BiGRU-Attention-CRF模型在Precision、Recall和F1指标上的表现均显著优于基线模型。根据岗位与需求之间的关系,采用BERT-BiGRU-Attention-CRF模型构建数字产业人才知识图谱与岗位人才画像,通过分析数字产业人才知识图谱中各岗位所连接的节点得到不同岗位对人才需求的共同与差异之处。

Abstract

We propose an entity recognition and talent profile model (BERT-BiGRU-Attention-CRF) to identify talent requirements for different jobs in the digital industry. This model combines the two representation learning methods (i.e., BERT and BiGRU) to represents textual contents according to contextual semantics in sentences, uses a multi-head attention mechanism to strengthen the key semantic information, and then employs conditional random field (CRF) to classify texts to identify talent requirements. Moreover, we conduct empirical research by collecting the latest recruitment information about jobs in the digital industry from three major recruiting websites. Experimental results indicate that BERT-BiGRU-Attention-CRF significantly outperforms baseline models in terms of Precision, Recall, and F1 metrics. Based on the relationships between jobs and requirements, we construct knowledge graph and job-specific talent profiles for the digital industry using the proposed model, and reveal similarities and differences between talent requirements for various jobs by analyzing job-related nodes in the knowledge graph.

Graphical abstract

关键词

数字产业 / 实体识别 / 人才画像 / BERT-BiGRU-Attention-CRF / 数字人才

Key words

digital industry / entity recognition / talent profiles / BERT-BiGRU-Attention-CRF / digital talent

引用本文

引用格式 ▾
杨彦武,翟盼雨,金颖. 基于BERT和BiGRU的数字产业岗位实体识别与人才画像[J]. 武汉大学学报(理学版), 2025, 71(5): 667-679 DOI:10.14188/j.1671-8836.2024.0038

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

数字产业是我国的战略性新兴产业,对经济增长、民生改善与现代化发展有着深远的影响。截至2023年,全国3 072所高校中,已有757所高校开设了数据科学与大数据技术专业,220所高校开设了大数据管理与应用专业,旨在培养数字产业创新与发展所需要的数字人才。构建、分析与挖掘数字产业人才知识图谱与相关岗位人才画像对数字人才的培养和就业具有重要的指导作用,有利于优化数字产业相关专业的课程体系与人才培养路径设置,实现以社会需求为导向的数字人才培养机制,而且有利于数字产业结构调整和数字人才梯队的可持续发展,为我国数字产业的优化和升级提供基本理论依据与方法支撑。

数字产业岗位人才画像指的是,基于一系列岗位任职要求的真实数据,抽取出岗位人才所应具备的多维度、高度精炼的关键特征和能力标准,包括能够被直接观察到的显性特征(如学历、专业等)和无法被直接观察到的隐性特征(如特质、价值观等)。

现有的人才画像研究可分为定性研究和定量研究方法。定性研究方法如专家评价法[1]、扎根理论[2]未对人才画像细节与特征进行准确描述,过于依赖研究者的主观性解读,缺乏客观理论依据和真实数据支撑。定量研究主要包括描述性统计分析方法[3]和文本挖掘方法[4]。描述性统计分析方法[5-6]对学历、专业等要素进行统计描述,揭示岗位人才的群体特征。该方法仅限于对收集到的数据进行百分比或均值与方差等简单统计,刻画结果局限于结构化数据,难以从文本中挖掘出态度、价值观等深层特征。在很多情况下,所使用的数据不能反映实际的人才需求情况,不利于结果的分析与推断。基于文本挖掘的研究大多采用LDA(Latent Dirichlet Allocation)主题模型提取特征主题词[7-10],但数字产业岗位的描述涉及高度专业化的术语,LDA主题模型较难处理复杂语境中的深层语义信息,无法精确捕捉岗位和技能之间的依存关系。

近年来,部分研究尝试利用自然语言处理模型识别文本中的实体并对实体之间的关系进行分类,采用预训练语言模型BERT训练中文词向量,并结合BiLSTM或IDCNN(Iterated Dilated Convolutional Neural Networks)[11-13]模型学习文本上下文信息。文献[14]通过知识图谱呈现人才画像,并通过共现矩阵抽取不同岗位所需的胜任力;类似地,文献[15]借鉴冰山模型刻画出数据类岗位所需的胜任力指标,并利用BERT-BiLSTM-CRF模型获得招聘信息中实体间的关系,构建数据类岗位的知识图谱。这些模型在一定程度上改进了实体识别的精度,但仍然难以挖掘招聘文本中深层次的语义信息并无法聚焦文本中的关键语义,同时,对于识别出的岗位人才需求缺乏可解释的刻画方法,使得其结果不易于推广应用。

本研究收集了海量招聘数据并对多源异构数据进行关联,构建了一个实体识别与人才画像模型(BERT-BiGRU-Attention-CRF)分析数字产业相关岗位及其人才需求,然后根据岗位与需求之间的关系构建数字人才知识图谱和岗位人才画像。该模型结合了BERT的深层语义表征能力和BiGRU在处理文本数据上的优势,利用注意力机制突出句子中的关键语义信息,并采用CRF进行文本分类,能够更准确地进行文本表征从而识别出岗位及其人才需求。

本文有以下贡献:1) 将BiGRU和Attention引入人才画像的实体识别,采用BiGRU学习长距离的上下文依赖关系,利用Attention机制突出文本中的关键语义信息,既优化了模型结构、减少了参数量,又提高了模型的识别准确率;2) 应用本文所构建的模型从知识、技能、特质、态度与价值观四个维度构建数字产业人才知识图谱与相关岗位人才画像,分析了不同岗位之间人才画像的异同点以及技能之间和岗位之间的关系。为数字产业相关专业的人才培养、学生就业、技能提升和职业发展提供了现实支撑和有效建议。

1  命名实体识别

实体识别是构建人才知识图谱的关键技术,有效地识别出招聘文本中的关键实体以及实体之间的关系,从而可以准确、全面地揭示岗位人才需求。

命名实体识别从自然语言文本中识别出具有特定意义的实体并将其分类到事先定义的类别,然后将实体映射到知识图谱中对应的结点。目前针对命名实体识别的研究主要包括基于规则和词典的方法及基于机器学习的方法。基于规则和词典的方法将需要识别的实体构建成一个词典,根据预先设定的规则在文本中进行匹配[16-18]。这些规则可以基于语法、上下文、词性等特征进行定义。如果文本中的词满足规则,则被标记为实体。此类方法虽然简单易懂,但由于词典和规则需要频繁更新而受到限制,缺乏良好的适应性,难以处理新出现的实体类型或者用于复杂的场景。基于机器学习的方法包括基于特征的方法和深度学习方法[19]。基于特征的方法在人工选择特征的基础上从训练语料中归纳学习,然后应用于新的实体识别任务,常见的方法包括最大熵马尔科夫模型(MEMMs)、决策树和支持向量机(SVM)等。这类方法的特征选择和提取比较灵活,但需要掌握该领域的专业知识和人工提取特征。深度学习技术能处理大量自然语言文本并充分利用上下文信息提高实体识别的准确性。深度学习将命名实体识别看作序列标注问题,能够从原始数据中自动学习有用的特征。循环神经网络(RNN)在命名实体识别中得到了广泛研究,其中双向长短时记忆网络(BiLSTM)利用前向和后向的上下文信息有效地处理复杂的句子结构,提高了识别准确率[20-21]。文献[22]将BiLSTM-CRF模型应用于序列标注任务,其中BiLSTM被用来提取上下文特征,而CRF对序列中的标签进行全局约束。同样,文献[23]和文献[24]利用BiLSTM对每个单词的上下文信息进行建模,并利用CRF输出实体识别的结果。这些研究尝试利用自然语言处理模型识别文本中的实体并对实体之间的关系进行分类,即采用预训练语言模型BERT训练中文词向量,并结合BiLSTM或IDCNN[11-13]模型学习文本上下文信息,在一定程度上改进了实体识别的精度,但在刻画人才画像时往往不能充分挖掘招聘信息中的非结构化文本,存在以下不足:1) 无法有效地捕捉长距离的上下文依赖关系,难以挖掘深层次的语义关系;2) 需要大量的模型参数,计算成本较高,训练时间较长;3) 在实体识别过程中无法对文本中的核心语义进行区分,难以聚焦其中的关键信息。4)对于识别出的岗位人才需求,这些研究没有给出可解释的刻画方法,使得人才画像的结果不易于推广应用。

针对问题1)和2),本文采用BiGRU学习长距离的上下文依赖关系,其优势在于比以往的BiLSTM的模型结构更简单、参数量更少,能够更加高效快速地学习文本的语义信息[25-26];针对问题3)本文加入了注意力机制,通过学习文本中词向量的权重,突出文本中的关键语义信息,以更准确的方式描述和呈现人才需求[13];针对问题4),本文利用知识图谱刻画岗位与人才需求之间的关系,以更加清晰的方式刻画各岗位的人才需求,通过比较知识图谱中各岗位人才画像的异同和技能之间的关联,将本文人才画像的研究结果推广到高校人才培养、学生个人职业规划以及企业的人才选拔中。

2  本文模型

BERT-BiGRU-Attention-CRF模型框架如图1所示,主要包括文本输入层、词嵌入层、句子编码层、注意力层、文本分类层和知识图谱层。

1) 文本输入层:将招聘信息中的非结构化数据作为模型的输入,并对原始数据进行去重、规范和统一、固定句子长度等预处理,将原始数据整理为可输入模型的格式。

2) 词嵌入层:利用预训练自然语言模型BERT[27]得到非结构化数据中每个词的嵌入表征。传统的自然语言处理模型大多数是从左往右单向处理文本,即句子中的每个词只受到它之前的词的影响,而这种框架限制了句子级别的文本的表征。BERT模型是一个基于双向Transformer编码器[28]的预训练语言表征模型,旨在通过在所有层中联合调节词的双向语义预训练未标记文本的深层双向表征。BERT受掩码语言模型[29]的启发,从输入中随机屏蔽一些词的标记,缓解了传统自然语言模型中单向处理文本的限制。在使用BERT进行自然语言表征时,只需将语料序列输入模型,无需提前训练模型,BERT会在微调阶段根据下游任务标签自动提取语言序列中的词表征。

3) 句子编码层:在BERT进行词嵌入表征的基础上,利用BiGRU提取句子中词的上下文信息。BiGRU在句子层次上分别从前向和后向读取句子,基于句子中词之间的依赖性提取词的上下文特征、语义特征和语法特征[30]。BiGRU是由前向的门控循环单元和后向的门控循环单元组成,能够同时利用前向门控循环单元和后向门控循环单元从句子的前向和后向表征词向量,捕捉文本中的长距离依赖关系。重置门和更新门的设计使得BiGRU能够自适应地控制信息的流动,相比BiLSTM使用较少的参数而可以达到相近似的模型表现,同时能够减少过拟合的风险,保持较高的计算效率[25-2629]

4) 注意力层:利用多头注意力(Multi-head Self-Attention)[2831]衡量句子中的词的重要性来加强句子中的关键语义信息。多头注意力是Transformer的核心组件,通过将多个注意力头并行执行注意力计算,结合多头输出来获得句子中词的更全面的上下文表征。多头注意力将权重分配给BiGRU层的每个输出,词的权重越大,表明语义越重要,这也意味着关键语义集中在这里,从而影响文本中实体的最终识别结果。通过为文本中的词组分配不同的注意力权重,动态地强调岗位描述中的关键技能、经验和特质等要求,可绘制出更加精准的人才画像[13]

图2所示,对于文本“数据平台开发工程师需要本科以上学历,熟悉前后端开发,有良好学习能力”,本文利用BiGRU从文本的两个方向学习“数据平台开发工程师”与“本科以上学历”“前后端开发”和“良好学习能力”之间深层次的上下文依赖关系,利用多头注意力机制对句子的每个词向量都赋予不同的重要性,可充分获取句子中的关键语义信息。

5) 文本分类层:利用CRF识别实体中词的最佳标注顺序形成实体。BiGRU能够提取长距离的文本信息,但不能较好地识别相邻标签之间序列信息,而CRF能够根据标签之间的依存关系预测最优的标签序列。为了使得预测结果更加准确,本研究利用交叉熵作为损失函数,通过预测标签接近真实标签的概率训练模型。

6) 知识图谱层:基于识别的实体以及实体之间的关系形成一系列(岗位,关系,人才需求)三元组并进行存储[32]。依据这些三元组构建数字产业人才知识图谱与相关岗位人才画像,全面地展示数字产业相关岗位人才所需的知识(K)、技能(J)、特质(T)和态度与价值观(V)。

3  数据收集与实验

3.1 数据获取和数据处理

本研究抓取数字产业相关企事业单位在网上发布的招聘信息,并对原始数据进行清洗和编码,以便于输入模型进行实体识别与构建人才画像,具体步骤阐述如下。

1) 数据收集:抓取目前国内主流的三大招聘网站(Boss直聘、前程无忧和58同城)上的招聘信息作为原始数据。首先,选择需要提取的字段,包括职位名称、职位描述等,分析网站的导航结构和搜索参数,构建能够访问目标职位列表的URL;其次,编写Python爬虫代码,在每个招聘网站上抓取《大数据产业人才岗位能力要求》(https://www.miitec.cn/home/index/detail?id=2676)所列举的数字产业相关的10个方向(包括数据预处理、数据标注、数据分析、产品开发、项目实施与运维、平台建设、数据安全、数据管理、运营与应用、咨询服务)涉及的31个具体岗位招聘信息,共计15 980条。每条招聘信息包含结构化数据(如岗位名称、工作地点、薪资等)和非结构化文本数据(如岗位的任职要求);最后,把相同岗位的招聘信息进行合并与汇总。

2) 数据预处理:对抓取到的数据进行清洗处理。首先,通过去重处理,确保每条招聘信息的唯一性。其次,删除公司简介和公司福利等一些无关信息,提取样本中的任职要求、岗位要求等人才需求信息。接下来,对抓取到的样本进行规范化和统一,包括英文单词的大小写统一、特定词组一致、数字格式一致等。比如,将“岗位需求”“任职要求”和“任职资格”等不同表述方式统一为“任职要求”。然后,将招聘信息中的文本分割成单独的句子,以便于模型进行后续的特征提取。最后,根据数据集的特点和模型的要求确定每句话的最大长度。这个长度应能覆盖大部分句子的长度,避免过长的句子带来不必要的计算负担。同时,对长度超过最大长度的句子进行截断处理,对长度不足的句子进行固定字填充。

3) 人工编码:人工编码的主要工作为数据标注。本研究提取10%的样本,按照人才画像的四个维度(知识、技能、特质、态度与价值观)对相关实体进行标注,标注标准如表1所示。使用BIOSE标注方法,B表示实体的开始,I表示实体内部,O表示非实体,S表示单个实体,E表示实体的结尾。每条样本均经过两位工作人员标注,如果标注存在差异则进行商议和重新标注。

3.2 参数设置

将标注好的样本数据按照8∶2划分为训练集和测试集,用于模型学习。在以下实验中,为了进行公平比较,本文所构建的模型和基线模型均使用Adam作为优化器,批量大小设置为15。为了获得稳定的结果,对于每个模型进行三次实验,每次实验包括5个epoch;三次实验结果求平均值作为模型的最终结果。为了获得本研究所构建的实体识别与人才画像模型(BERT-BiGRU-Attention-CRF)的最优表现,使用网格搜索方法来确定模型的超参:在区间[0.000 1,0.000 5,0.001 0,0.001 5,0.002,0.002 5,0.003 0]中搜索学习率,最优学习率确定为0.000 1;在区间[16,32,64,128]中搜索BERT模型的词嵌入维度,得到64作为最优词嵌入维度;在区间[32,64,128,256]内搜索BiGRU的嵌入维度,得到256作为最优维度。

3.3 与其他模型比较

采用精确率(Precision)、召回率(Recall)和F1分数值(F1)作为评估标准[33]。精确率(Precision)是指在所有被模型判断为正样本的样本中真实正样本的比例,计算公式如下:

Precision=TPTP+FP

其中,TP(True Positive)是真实正样本被正确分类为正样本的数量,FP(False Positive)是负样本被错误分类为正样本的数量。

召回率(Recall)是指在所有真实正样本中被模型正确判断为正样本的比例,计算公式如下:

Recall=TPTP+FN

其中,FN(False Negative)是真实正样本被错误分类为负样本的数量。

F1值是一种精确率和召回率的调和均值指标,用于衡量评估模型的综合表现。F1值可以避免仅使用精确率或召回率作为单一评估指标时的弊端,对处理不平衡数据集的任务尤其有效,计算公式如下:

F1=2×Precision×RecallPrecision+Recall

精确率、召回率和F1值的取值范围均为[0,1],值越大表示模型的预测效果越好。

本文采用常见的实体识别模型作为基线,分别是BERT-CRF[22]、BERT-IDCNN-CRF[34]、BERT-BiLSTM-CRF[11]表2为本文所构建的BERT-BiGRU-Attention-CRF模型与基线模型的实验比较结果。

表2可以看出,BERT-BiGRU-Attention-CRF模型的精确率和F1值均高于所有基线方法。这表明BERT-BiGRU-Attention-CRF模型能更准确地识别数字产业相关岗位的人才需求。通过对比BERT-IDCNN-CRF[34]和BERT-BiLSTM-CRF[11]模型的实验表现,可以发现,IDCNN学习文本上下文信息的能力不及BiLSTM和BiGRU。

本文数据集覆盖了Boss直聘、前程无忧和58同城上数字产业相关的31个工作岗位。实证表明,无论是面对不同平台的招聘信息表述风格的多样性,还是对于不同岗位的专业术语和需求特点迥异,本文模型均能有效地识别实体并构建人才画像。这表明,BERT-BiGRU-Attention-CRF模型具有较强的适应性和泛化能力。因此,本研究的结果不仅具有较高的可信度,而且对于实际应用场景具有广泛的适用性,能够为数字人才需求的精准识别提供有力的技术支持。

3.4 消融研究

对BERT-BiGRU-Attention-CRF模型进行消融实验,验证BiGRU和Attention层的有效性,结果见表3

通过对比表3中的BERT-BiGRU-Attention-CRF与BERT-Attention-CRF模型,可以发现,利用预训练的BERT模型在学习招聘信息中词向量表达的同时,还需要用BiGRU学习文本的上下文信息;通过对比BERT-BiGRU-Attention-CRF与BERT-BiGRU-CRF模型的实验表现,可以看出,注意力机制对于充分地识别岗位描述中的语义信息并突出关键语义信息起到了重要的作用。通过比较表2表3,BERT-BiGRU-CRF模型比BERT-BiLSTM-CRF在三个指标上的表现更好,说明BiGRU在使用更少模型参数的同时,能够在实体识别任务中更好地捕捉句子中各个词之间的上下文依赖关系。

表2表3中记录了BERT-BiGRU-Attention-CRF和基线模型训练过程中所需要的参数数量和时间。可以发现,BERT-BiGRU-CRF比BERT-BiLSTM-CRF需要更少的参数和时间。这说明BiGRU比BiLSTM的结构更简单,能够利用更少的参数高效地学习句子中的长距离上下文依赖关系。同时,通过对比BERT-BiGRU-Attention-CRF与BERT-BiLSTM-CRF,可以看出,两个模型的参数量和训练时间比较接近。这说明BERT-BiGRU-Attention-CRF在不增加模型复杂度的同时,能够达到比BERT-BiLSTM-CRF更好的实体识别效果。综上,本研究所构建的BERT-BiGRU-Attention-CRF模型中的BiGRU和Attention层能够更好地学习招聘文本的上下文和语义信息。

4  数字产业人才知识图谱

本节采用BERT-BiGRU-Attention-CRF模型对第三节所抓取的招聘信息进行分析与挖掘,识别出每个岗位关于知识、技能、特质、态度与价值观等方面的需求,构建数字产业人才知识图谱,刻画相关岗位人才画像,并分析岗位之间的关系和技能之间的关系。

4.1 数字产业相关岗位人才画像

结合岗位及其招聘文本中识别出的数字人才需求,形成一系列对应的三元组,比如,(大数据咨询师,技能,Java)表示大数据咨询师需要掌握Java编程技能。通过整合这些三元组,可以构建数字产业人才知识图谱并刻画相关岗位人才画像。数字产业人才知识图谱包含了相关岗位名称及其所需要的知识(如本科学历、计算机专业、统计学知识等)、技能(如Java、Python、数据治理等)、特质(如数据敏感、沟通能力、逻辑思维能力等)以及态度与价值观(如责任感、团队协作等)。

为了深入挖掘各岗位的人才画像,本研究统计每个岗位所招聘人才应具备的前20项知识、技能、特质和态度与价值观等方面的需求。经过统计发现,在所需要的知识方面,1) 31个岗位中22个岗位(如大数据咨询师、数据平台运维工程师和数据平台架构师等)需要的前三个知识为本科及以上学历、计算机相关专业和工作经验;2) 数据分析工程师对统计学专业知识要求较高,而数据算法工程师对数学专业知识要求较高,数据平台架构师则较倾向于软件工程专业知识;3) 相较于以上岗位,标注质检工程师和标注采集工程师对学历的要求相对较低,专科及以上学历的人才即可满足其任职要求。

在所需要的技能方面,1) 运维相关的岗位(如数据平台运维工程师、数据安全运维工程师、数据运维工程师)比较注重运维能力、运用Linux系统和系统维护的能力;2) 数据平台架构师、数据安全架构工程师和数据产品架构工程师均要求应聘者能熟练掌握Java编程语言,能够进行架构设计;3) 数据平台架构师还需要有坚实的Python基础,数据安全架构工程师需要有过硬的开发能力,而数据产品架构工程师需要有较强的数据分析能力;4) 标注类相关的岗位(如标注采集工程师、标注质检工程师、标注管理工程师和数据标注工程师)需要应聘者熟练使用标注工具,具备一定的数据分析能力,而对Python和Java等编程语言则没有较高的要求;5) 大数据咨询师要求应聘者熟悉Hadoop、Spark等分布式计算技术和Java编程语言;6) 数据平台开发工程师要求应聘者熟练掌握Java编程语言,并对平台开发和MySQL数据库体系结构和工作原理有一定的认识;7)数据实施工程师应熟悉项目实施的流程、SQL Server和Oracle数据库的安装、调试和维护;8) 数据安全评估工程师应具备对产品开展数据安全评估的技能,对数据库和Python编程语言有一定的了解;9) 数据存储工程师应熟练掌握Java编程语言,了解数据存储、数据管理和数据处理的基本原理,同时要具备数据仓库的设计、管理和开发的基本能力;10) 数据可视化工程师应具备前端开发和数据可视化的技能,熟练运用HTML和JavaScript构建高性能的Web应用程序;11) 数据分析工程师应具备数据分析的能力、熟练使用Python编程语言和MySQL数据库管理系统。

在所要求的特质方面,1) 31个岗位中17个岗位需要(排前三)的人才特质包括沟通能力、学习能力和逻辑思维能力,其中良好的沟通能力和逻辑思维能力有助于工作中与同事的交流以及与客户的合作,学习能力有助于自身职业技能的改进和提升;2) 数据运维工程师、数据安全评估工程师和数据平台运维工程师除了注重沟通能力和学习能力之外,还注重协调能力;3) 数据安全架构工程师、大数据培训师和大数据解决方案工程师在注重学习能力之外,还注重沟通能力和表达能力,便于把自身的想法传递给别人;4) 标注管理工程师、数据管理工程师和大数据产品经理在注重沟通能力和逻辑思维能力的同时,注重协调能力;5) 数据实施工程师需要现场实施和调试工作,能够应对出差;6) 社群管理师和标注质检工程师在具备沟通能力和学习能力的同时,应分别具有较强的执行能力和抗压能力。

所有的岗位均需要团队协作、责任感、积极和主动的态度与价值观;同时,大部分岗位还需要应聘人才具有较强的服务意识。

4.2 数字产业相关岗位之间的关系

本节基于数字产业知识图谱探讨相关岗位之间的关系(如图3所示),分析不同岗位之间的相似性和差异。首先,根据每个岗位所需的技能,将每个岗位表示为固定长度的one-hot向量。由于技能的类别较多,造成岗位向量表达较为稀疏,本研究利用奇异值分解算法(SVD)对岗位向量表示进行降维,得到每个岗位的稠密化表达。然后,采用余弦相似度计算岗位之间相似性,构建相似度矩阵。图3中的节点代表不同的岗位,边的权重表示相连的两个岗位之间的相似度。

通过图3可以进一步分析不同岗位之间的关系,从而识别具有较高相似度和重叠技能的岗位集合。比如,数据分析方向的四个岗位“数据算法工程师”“数据挖掘工程师”“数据分析工程师”和“数据可视化工程师”之间存在密切的关系,其中数据算法工程师专注于开发和优化数据分析算法,数据挖掘工程师利用算法挖掘数据中的潜在价值和趋势,数据分析工程师负责数据统计分析、深度挖掘分析与业务预测,数据可视化工程师则负责将数据结果以可视化的形式呈现给各个利益相关者。这四个岗位都涉及对大量数据进行分析和处理,要求应聘人才具备相似的数据分析和处理技能:熟悉常用的数据分析工具和编程语言如Python和R,了解数据结构和算法,并能够进行数据清洗和数据可视化。这四个岗位间相互协作,共同完成复杂的数据分析和挖掘的任务,从而帮助企业更好地挖掘和利用数据。

4.3 数字产业相关技能之间的关系

本节基于数字产业知识图谱探讨相关岗位所需技能之间的关系,如图4所示。数字产业相关技能关系知识图谱的构建方法和4.2节数字产业相关岗位关系知识图谱的构建方法类似,在此不进行赘述。图4中的节点代表不同的技能,边的权重表示相连的两个技能之间的相似度。在此基础上,通过计算各个技能的程度中心度和居间中心度可以衡量数字产业相关岗位所需各项技能的重要性。技能的程度中心度表示一项技能与其他技能直接连接的边的数量,即点度。程度中心度最高的三项技能依次是“数据分析”“Python”和“Java”,表明这三项技能在知识图谱网络中与其他技能有较多的直接联系,是其他技能的基础。技能的居间中心度刻画了各技能在数字产业人才的能力结构中充当技术中介的作用。居间中心度最高的三项技能依次是“数据分析”“产品测试”和“项目”,表明这三项技能扮演着重要的桥梁角色,能够促进不同技能之间的传递与协作。比如,“数据分析”节点在连接“Python”和“Java”的最短路径上,说明这两项技能都服务于数据分析能力。

进一步,基于技能之间的关系,利用谱聚类方法对数字产业相关技能关系知识图谱进行聚类,并计算不同聚类类别数所对应的Calinski-Harabaz值(CH),CH值越大,代表类之间的方差越大,类内方差越小,聚类效果较好。表4是不同聚类类别数所对应的聚类效果。从表4中可知,当把技能分为六类时,聚类效果最好。

数字产业相关技能关系知识图谱聚类结果如图4表5所示。可以看出,第一类技能主要与数据处理相关,涉及“大数据开发”“数据分析”“数据存储”“数据管理”和“数据治理”等技能,具备这些技能的人才可以应聘与此相对应的岗位(如数据开发工程师、数据分析工程师和数据存储工程师等)。第二类技能主要与数据标注相关,涉及掌握基本的办公软件和数据标注工具,擅长数据标注的人才可以应聘相对应的岗位(如标注采集工程师、标注质检工程师和标注管理工程师等)。第三类技能主要与产品相关,主要涉及“产品开发”“产品规划”和“产品设计”等技能,对产品感兴趣的人才可以应聘相对应的岗位(如大数据产品经理、数据产品架构工程师和大数据解决方案工程师等)。第四类技能主要与前端开发相关,需要掌握HTML等网页制作工具和可视化软件,擅长前端开发和网页制作的人才可以应聘相对应的岗位(如数据可视化工程师和数据应用工程师等)。第五类技能主要与算法相关,需要有“数据挖掘”“机器学习”和“算法开发”等技能,算法基础较好的人才可以应聘相对应的岗位(如数据挖掘工程师和数据算法工程师等)。第六类主要与运维相关,相对应的岗位包括数据运维工程师和数据平台运维工程师等。

通过以上分析,可以得到如下结论。第一,数字产业中多数岗位需要本科及以上学历、计算机相关专业和工作经验;标注类岗位对学历的要求相对较低一些,专科及以上学历的人才即可任职。第二,在岗位所需要的技能中,Java、Python和数据库作为共同的技能基础;不同的岗位还需要特定的技能,比如,数据平台架构师需要具备架构设计的能力,数据可视化工程师需要具备前端开发和数据可视化的技能。第三,在岗位所需要的特质中,各岗位都要求良好的沟通能力、学习能力、逻辑思维和表达能力;同时,一些岗位需要有较强的抗压能力,能接受长期的出差和赴外实施项目。第四,在岗位所需要的态度和价值观中,所有岗位都要求能够主动积极参与工作,开展团队协作,有较强的责任感。第五,“数据分析”“Python”和“Java”是数字产业相关岗位需要掌握的基础技能;同时,“MySQL”和“数据仓库”等数据库管理能力在数字产业所需人才的知识结构中具有重要作用;另外,“数据分析”“产品测试”和“项目”是促进不同技能之间的传递和协作的桥梁。第六,数字产业相关岗位所需要的技能可以划分为六类,包括数据处理、数据标注、产品、前端开发、算法和运维。

4.4 建议

本研究的相关成果可以对高校人才培养、学生个人职业规划以及企业的人才选拔提供有效的建议。在数字产业相关专业人才培养过程中,数字产业人才画像有助于准确地把握行业需求,调整课程设置和教学内容,从而确保毕业生在竞争激烈的就业市场中具备优势。首先,学校应将Java和Python作为优先级高的必修课程,并以数据分析、MySQL和数据可视化等作为选修内容,注重学生的个性化培养,使得不同就业意向的学生可以选修不同的课程。其次,还应开设相应的职业生涯规划课程,由学校老师和企业相关人员共同负责课程开展,为学生提供就业指导和就业培训,提前让学生了解岗位的具体要求和工作职责,引导学生及早开展职业生涯规划。再者,学校应注重培养学生的沟通能力和表达能力,进行分组练习,定期举办职场模拟训练;同时,注重培养学生的团结协作意识,在课内和课内鼓励学生完成团队任务和团队竞赛;最后,学校应注重校企合作,给学生提供更多的参与项目和实习机会,获得真实的实践经验和工作经验,有利于增强学生对岗位的认识,增加学生的就业优势,从而提升高校学生的就业率和就业满意度。

对于企业来讲,能够根据数字产业人才画像和知识图谱,合理制定招聘策略和人才队伍建设方案。首先,企业可以根据各岗位人才画像中所显示的知识、技能、特质、态度与价值观,结合人工智能技术快速筛选简历,在面试环节中重点关注人才画像中的关键因素,从而提高招聘效率,降低招聘成本。其次,企业能够根据岗位之间的关系和技能之间的关系,识别具有高相似度和重叠技能的岗位集合,促进跨岗位的紧密协作与资源共享,帮助企业制定共同技能培训课程和个性化培训计划,从而合理制定员工的晋升路径,确保员工在职业生涯中有明确的发展方向和成长机会,为企业的长远发展培养一支高素质、稳定的人才队伍。

5  结 语

本文建立了一个面向数字产业的实体识别与人才画像模型(BERT-BiGRU-Attention-CRF),从四个维度(知识、技能、特质以及态度与价值观)刻画数字人才画像。该模型融合了BERT和BiGRU两种表征学习方法,根据句子的上下文语义进行文本表达,并利用多头注意力加强句子中的关键语义信息,然后利用CRF方法对文本进行分类,从而识别岗位的人才需求。抓取了国内三个主流招聘网站上的数字产业相关岗位的最新招聘信息,识别各岗位在四个维度上的具体需求。本研究根据识别出的岗位人才需求,构建数字产业人才知识图谱与相关岗位人才画像,深入挖掘各岗位人才画像的共性与差异,以及各项技能的重要性和影响力。

本研究侧重于应用人工智能技术和自然语言方法来识别数字产业相关岗位招聘文本中的人才需求、岗位之间的异同和技能之间的联系。在未来的研究中,将探索优化与改进本文所构建的实体识别和人才画像模型,以更好地从岗位描述中分析数字产业相关岗位人才需求中的复杂语义与关联;同时,将考虑利用生成式大模型进行数据清洗和预处理,生成高质量的自动标注的标签,减少人工标注的成本;利用大模型实时生成行业和岗位需求分析报告,从而增加数字产业人才画像的数据源,构建更加全面和精准的数字人才画像。另外,将基于本文构建的数字产业人才画像和所收集的招聘数据,构建数字产业人才需求预测模型,进一步识别和预测数字产业人才画像中各要素的重要性变化趋势,以及各岗位的人才需求量的变化,精准地预测未来数字产业的发展方向。

参考文献

[1]

高扬, 池雪花, 章成志, . 杰出人才精准画像构建研究——以智能制造领域为例[J]. 图书馆论坛201939(6): 90-97. DOI: 10.3969/j.issn.1002-1167.2019.06.011 .

[2]

GAO YCHI X HZHANG C Zet al. Precise user profile for domain-special talents: A case study of intelligent manufacturing[J]. Library Tribune201939(6): 90-97. DOI: 10.3969/j.issn.1002-1167.2019.06.011(Ch ).

[3]

茹宁, 苏靖雅. 人工智能人才画像与培养路径探析[J]. 天津市教科院学报202133(2):5-11. DOI:10.3969/j.issn.1671-2277.2021.02.001 .

[4]

RU NSU J Y. Analysis of talent training path based on artificial intelligence talent portrait[J]. Journal of Tianjin Academy of Educational Science202133(2):5-11. DOI:10.3969/j.issn.1671-2277.2021.02.001(Ch ).

[5]

李勇, 陈晓婷, 黄格. 基于招聘数据的人工智能人才画像与培养对策[J]. 重庆高教研究20219(5): 55-68. DOI: 10.15998/j.cnki.issn1673-8012.2021.05.006 .

[6]

LI YCHEN X THUANG G. Talent profiles of artificial intelligence and its training countermeasures based on recruitment data[J]. Chongqing Higher Education Research20219(5): 55-68. DOI: 10.15998/j.cnki.issn1673-8012.2021.05.006(Ch ).

[7]

徐昊.基于网络招聘的信息管理类岗位需求分析及其对人才培养的启示[D]. 昆明:云南大学,2021.DOI:10.27456/d.cnki.gyndu.2021.000382 .

[8]

XU H. Demand analysis of information management posts based on online recruitment and its enlightenment on talent training [D]. Kunming :Yunnan University, 2021. DOI: 10.27456/d.cnki.gyndu.2021.000382(Ch ).

[9]

SAPUTRA AWANG GZHANG J Zet al. The framework of talent analytics using big data[J]. The TQM Journal202234(1): 178-198. DOI: 10.1108/tqm-03-2021-0089 .

[10]

宋培彦, 龙晨翔, 李怡然, . 基于冰山模型的科研人员学术专长识别方法研究[J]. 数据分析与知识发现20237(6): 50-60. DOI: 10.11925/infotech.2096-3467.2022.0542 .

[11]

SONG P YLONG C XLI Y Ret al. Identifying academic expertise of researchers based on iceberg model[J]. Data Analysis and Knowledge Discovery20237(6): 50-60. DOI: 10.11925/infotech.2096-3467.2022.0542 (Ch ).

[12]

张俊峰. 国内网站招聘岗位需求特征挖掘及其应用研究[D]. 蚌埠: 安徽财经大学, 2017.

[13]

ZHANG J F. Research on demand characteristics mining and application of domestic website recruitment[D]. Bengbu: Anhui University of Finance and Economics, 2017 (Ch).

[14]

陈明红, 张倩琳, 韩静. 信息管理与信息系统专业人才招聘需求分析及培养启示[J]. 图书馆学研究2021(20): 9-20. DOI: 10.15941/j.cnki.issn1001-0424.2021.20.004 .

[15]

CHEN M HZHANG Q LHAN J. Recruitment demand analysis and training inspirations of information management and information system professionals[J]. Research on Library Science2021(20): 9-20. DOI: 10.15941/j.cnki.issn1001-0424.2021.20.004(Ch ).

[16]

杨静. 基于文本挖掘的网络招聘信息分析[D]. 济南: 山东师范大学, 2019.

[17]

YANG J. Analysis of online recruitment information based on text mining[D]. Jinan: Shandong Normal University, 2019 (Ch).

[18]

朱爱璐. 基于文本挖掘的数据分析岗位人才需求分析[D]. 南昌: 江西财经大学, 2020. DOI: 10.27175/d.cnki.gjxcu.2020.001524 .

[19]

ZHU A L. A Study on the recruitment market of data analysis based on text mining [D]. Nanchang: Jiangxi University of Finance and Economics, 2020. DOI: 10.27175/d.cnki.gjxcu.2020.001524(Ch ).

[20]

LIU Y FWEI S QHUANG H Jet al. Naming entity recognition of citrus pests and diseases based on the BERT-BiLSTM-CRF model[J]. Expert Systems with Applications2023234: 121103. DOI: 10.1016/j.eswa.2023.121103 .

[21]

WANG Z HHUANG MLI C Xet al. Intelligent recognition of key earthquake emergency Chinese information based on the optimized BERT-BiLSTM-CRF algorithm[J]. Applied Sciences202313(5): 3024. DOI: 10.3390/app13053024 .

[22]

SHI Y NKIMURA M. BERT-based models with attention mechanism and lambda layer for biomedical named entity recognition[C]//Proceedings of the 2024 16th International Conference on Machine Learning and Computing. New York: ACM, 2024: 536-544. DOI: 10.1145/3651671.3651709 .

[23]

王一博. 基于知识图谱的计算机领域胜任力研究与应用[D]. 长春: 吉林大学, 2020. DOI: 10.27162/d.cnki.gjlin.2020.003054 .

[24]

WANG Y B. Research and application of competency in computer field based on knowledge graph [D]. Changchun: Jilin University, 2020. DOI: 10.27162/d.cnki.gjlin.2020.003054(Ch ).

[25]

张欣欣. 基于胜任力模型的数据类岗位知识图谱构建研究与应用[D]. 长春: 吉林大学, 2022. DOI: 10.27162/d.cnki.gjlin.2022.002029 .

[26]

ZHANG X X. Research and application of data post knowledge graph construction based on competency model [D]. Changchun: Jilin University, 2022. DOI: 10.27162/d.cnki.gjlin.2022.002029(Ch ).

[27]

王宁, 葛瑞芳, 苑春法, . 中文金融新闻中公司名的识别[J]. 中文信息学报200216(2): 1-6. DOI: 10.3969/j.issn.1003-0077.2002.02.001 .

[28]

WANG NGE R FYUAN C Fet al. Company name identification in Chinese financial domain[J]. Journal of Chinese Information Processing200216(2): 1-6. DOI: 10.3969/j.issn.1003-0077.2002.02.001(Ch ).

[29]

HANISCH DFUNDEL KMEVISSEN H Tet al. ProMiner: Rule-based protein and gene entity recognition[J]. BMC Bioinformatics20056(S1): S14. DOI: 10.1186/1471-2105-6-S1-S14 .

[30]

黄诗琳, 郑小林, 陈德人. 针对产品命名实体识别的半监督学习方法[J]. 北京邮电大学学报201336(2): 20-23. DOI: 10.13190/jbupt.201302.20.huangshl .

[31]

HUANG S LZHENG X LCHEN D R. A semi-supervised learning method for product named entity recognition[J]. Journal of Beijing University of Posts and Telecommunications201336(2): 20-23. DOI: 10.13190/jbupt.201302.20.huangshl(Ch ).

[32]

LI JSUN A XHAN J Let al. A survey on deep learning for named entity recognition[J]. IEEE Transactions on Knowledge and Data Engineering202234(1): 50-70. DOI: 10.1109/TKDE.2020.2981314 .

[33]

YADAV VBETHARD S. A survey on recent advances in named entity recognition from deep learning models [C]// Proceedings of the 27th International Conference on Computational Linguistics.Stroundsbug:Association for Computational Linguistics,2018:2145-2158. DOI: 10.18653/v1/s18-2021 .

[34]

李小龙, 孙水发, 唐庭龙, . 基于超声检查报告的乳腺癌诊断知识图谱构建[J]. 武汉大学学报(理学版)202369(1): 69-78. DOI: 10.14188/j.1671-8836.2022.0005 .

[35]

LI X LSUN S FTANG T Let al. Construction of knowledge graph for breast cancer diagnosis based on ultrasound examination reports[J]. Journal of Wuhan University (Natural Science Edition)202369(1): 69-78. DOI: 10.14188/j.1671-8836.2022.0005(Ch ).

[36]

HUANG Z HXU WYU K. Bidirectional LSTM-CRF models for sequence tagging[EB/OL]. 2015arXiv: 1508.01991. DOI: 10.48550/arXiv.1508.01991 .

[37]

MA X ZHOVY E. End-to-end sequence labeling via bi-directional LSTM-CNNs-CRF[C]//Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2016: 1064-1074. DOI: 10.18653/v1/p16-1101 .

[38]

DONG C HZHANG J JZONG C Qet al. Character-based LSTM-CRF with radical-level features for Chinese named entity recognition[C]//Natural Language Understanding and Intelligent Application. Cham: Springer International Publishing, 2016, 239-250. DOI:10.1007/978-3-319-50496-4_20 .

[39]

CHO KVAN MERRIENBOER BGULCEHRE Cet al. Learning phrase representations using RNN encoder-decoder for statistical machine translation[C]//Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). Stroudsburg: Association for Computational Linguistics, 2014: 1724-1734. DOI: 10.3115/v1/d14-1179 .

[40]

CHUNG JGÜLÇEHRE ÇCHO K Het al. Empirical evaluation of gated recurrent neural networks on sequence modeling[EB/OL]. [2024-02-03]. DOI: 10.1007/978-3-030-89929-5_3 .

[41]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding [EB/OL]. [2024-05-06]. DOI: 10.18653/v1/n18-2 .

[42]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[EB/OL].[2024-05-06]. DOI: 10.1007/978-3-031-84300-6_13 .

[43]

CAHUANTZI RCHEN X YGÜTTEL S. A comparison of LSTM and GRU networks for learning symbolic sequences[C]//Lecture Notes in Networks and Systems. Cham: Springer Nature Switzerland, 2023: 771-785. DOI: 10.1007/978-3-031-37963-5_53 .

[44]

LIU JYANG Y HLV S Qet al. Attention-based BiGRU-CNN for Chinese question classification[J]. Journal of Ambient Intelligence and Humanized Computing2019: 1-12. DOI: 10.1007/s12652-019-01344-9 .

[45]

ZHAI P YYANG Y WZHANG C J. Causality-based CTR prediction using graph neural networks[J]. Information Processing & Management202360(1): 103137. DOI: 10.1016/j.ipm.2022.103137 .

[46]

翟社平, 柏晓夏, 张宇航, . 融合依存分析和图注意网络的三元组抽取[J]. 计算机工程与应用202359(12): 148-156. DOI: 10.3778/j.issn.1002-8331.2203-0578 .

[47]

ZHAI S PBAI X XZHANG Y Het al. Triple extraction of combining dependency analysis and graph attention network[J]. Computer Engineering and Applications202359(12): 148-156. DOI: 10.3778/j.issn.1002-8331.2203-0578(Ch ).

[48]

YANG Y WZHAI P Y. Click-through rate prediction in online advertising: A literature review[J]. Information Processing & Management202259(2): 102853. DOI: 10.1016/j.ipm.2021.102853 .

[49]

CAI X CSUN E HLEI J L. Research on application of named entity recognition of electronic medical records based on BERT-IDCNN-CRF model[C]//2022 The 6th International Conference on Graphics and Signal Processing (ICGSP). New York: ACM, 2022: 80-85. DOI: 10.1145/3561518.3561531 .

基金资助

国家自然科学基金面上项目(72171093)

湖北省高等学校省级教学研究项目(2022248)

AI Summary AI Mindmap
PDF (3560KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/