基于改进PositionRank算法的高校教师自我评价关键词提取方法

齐晓亮 ,  陈海鹏 ,  石泽男 ,  王守佳

吉林大学学报(工学版) ›› 2025, Vol. 55 ›› Issue (08) : 2753 -2760.

PDF (1338KB)
吉林大学学报(工学版) ›› 2025, Vol. 55 ›› Issue (08) : 2753 -2760. DOI: 10.13229/j.cnki.jdxbgxb.20250273
计算机科学与技术

基于改进PositionRank算法的高校教师自我评价关键词提取方法

作者信息 +

Keyword extraction method for university faculty self-evaluations based on the improved PositionRank algorithm

Author information +
文章历史 +
PDF (1369K)

摘要

针对教师自我评价存在评价过程主观性较强、工作效率低下以及精准度不高等问题,本文提出了基于改进PositionRank算法的高校教师自我评价关键词提取方法。首先,对教师自我评价数据进行采集和清洗,去除冗余与异常数据以提高数据质量;其次,采用基于图的关键词抽取算法生成高质量标签数据;最后,通过改进后的PositionRank算法自适应学习词组间的注意力权重,实现关键词的精准提取。实验结果表明:该方法能高效识别教师评价中的关键内容,显著提高关键词提取的准确性,同时具备较强的评价一致性,有助于揭示教师的核心优势与改进方向,为完善高校教师评价体系提供了有力的技术支撑。

Abstract

The evaluation reform of university faculty is an important component of educational evaluation reform and a crucial guarantee for stimulating the intrinsic motivation of university faculty. Self-evaluation by faculty is a key aspect of the comprehensive evaluation system for university faculty. Currently, self-evaluation largely relies on manual statistics and analysis, which presents issues such as strong subjectivity in the evaluation process, low work efficiency, and poor accuracy. Therefore, this paper proposes a method for extracting keywords from university faculty self-evaluation based on an improved PositionRank algorithm. First, faculty self-evaluation data is collected and cleaned to remove redundant and anomalous data, improving data quality. Second, a graph-based keyword extraction algorithm is used to generate high-quality label data. Finally, the improved PositionRank algorithm is employed to adaptively learn the attention weights between phrases, achieving accurate keyword extraction. Experimental results show that this method efficiently identifies key content in faculty evaluations, significantly improving the accuracy of keyword extraction while demonstrating strong evaluation consistency. It helps reveal the core strengths and areas for improvement of faculty and provides strong technical support for improving the university faculty evaluation system.

Graphical abstract

关键词

高校教师自我评价 / 关键词提取 / 自适应学习 / 注意力权重

Key words

self-evaluation of university faculty / keyword extraction / adaptive learning / attention weight

引用本文

引用格式 ▾
齐晓亮,陈海鹏,石泽男,王守佳. 基于改进PositionRank算法的高校教师自我评价关键词提取方法[J]. 吉林大学学报(工学版), 2025, 55(08): 2753-2760 DOI:10.13229/j.cnki.jdxbgxb.20250273

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

高校教师评价在高等教育体系中占据至关重要的位置,它不仅是提升教学质量、促进教育改革的有效手段,也是教师职业发展、高校管理和社会评价的关键环节1。目前,随着人工智能技术的快速发展,高校教师评价方式正日益趋于科学化与多元化。然而,目前大部分高校对教师的评价结果仍然依赖于人工进行数据统计和分析,导致了评价主观性强、统计效率低、分析精准度不足等问题2。因此,如何借助自动化关键词提取技术,快速且准确地从大量非结构化数据中识别出关键词信息,已经成为关键词提取任务的主要研究方向3。该技术可以有效提高教师评价体系的智能化水平,并为高校教师的发展提供多元化的数据支持4

关键词能全面总结教师自我评价文档中的核心内容,可以使管理部门快速且高效地完成文档的查验工作5。此外,关键词还可以被视为文档的索引,以此来提高文档的检索效率,并为高校教师绩效考核和薪酬调整等提供参考,对教师的职业发展和教学质量改善具有积极的影响。因此,精准提取文档中的关键词对优化教师评价体系具有十分重要的意义。

在关键词提取任务中,以往的工作主要从有监督方法和无监督方法两个方向展开研究6。有监督方法通常需要大量数据来训练模型,以判断某个词语是否属于关键词。相比于有监督方法,无监督方法则不需要依赖由人工给出的关键词标签,具有较高的自动化程度。因此,无监督方法在实际的应用中具有更高的应用价值。

术语频率-逆文档频率7作为一种常见的无监督关键词提取方法,它通过计算词汇的重要性分数来筛选关键词。然而,该方法主要依赖词频,未能充分考虑单词间的语义联系,可能影响关键词提取的准确性。此外,基于图的排序方法(PageRank8、TextRank9、TopicRank10和PositionRank11)被广泛应用。这类方法通过构建单词图,并依据节点之间的关系进行排序,以挖掘潜在的关键词。然而,传统的随机游走方法未能充分结合文档的主题信息,可能导致一定程度的偏差。因此,Topic PageRank12和Single Topic PageRank13在TopicRank方法的基础上进行了优化,增加了主题相关性评分,以调整节点间的连接权重。然而,这种优化方式依赖于文档主题划分的准确性,若主题划分存在误差,则可能影响关键词提取的稳定性。同时,ExpandRank14在TextRank方法的基础上引入了邻近文档的语义信息,以增强目标文档关键词提取的鲁棒性。然而,该方法在实际应用中需要依赖额外的相似文档构建过程,增加了系统复杂度,并对外部文档质量提出了较高要求。此外,EmbedRank15结合词嵌入技术,通过将候选短语映射到高维语义空间,并计算其与文档语义表示的相似度来进行关键词排序。该方法能捕捉更丰富的上下文信息,相较于传统的词频方法,在语义理解方面具有一定优势。然而,其性能受限于所采用的词嵌入模型,并依赖训练语料的质量,在不同应用场景下表现出较大的泛化差异。为了独立于外部语料实现关键词提取,YAKE!16通过词频等语言特征联合构建词语的权重评分机制,实现了对单文档内部统计特征的充分挖掘。然而,该方法对上下文语义关系的建模仍较为粗糙,难以有效处理复杂语义关联下的关键词识别问题。

综上所述,为提升高校教师自我评价的准确性和实际应用价值,本文提出了一种基于改进PositionRank算法的关键词提取方法。该方法不仅提高了关键词短语提取的精度,还能帮助教师更全面地梳理自身优势与改进方向,为职业发展提供有益参考。此外,该方法在高校人事管理中具有广阔的应用前景,可为教师绩效分析、评价体系优化和资源配置等提供智能化支持,助力高校教师评价向科学化方向发展。

1 数据采集与预处理

1.1 高校教师自我评价数据的采集与构成

本文从高校人事系统中采集了2023年和2024年范围内的6 000条教师自我评价数据。采集到的数据主要由编号、个人总结和考核等级3个字段构成。这些数据不仅能够帮助模型分析每位教师的自我评价和发展需求,还能为高校优化现有的教师评价体系提供准确的依据,以确保教师评价的客观性和科学性。

1.2 数据清洗

本文的数据清洗流程如图1所示,根据字数大小对扫描到的教师评价数据进行条件筛选,清除了数据中重复和格式错误的部分,减少数据噪声,进而提高后续对于关键词标签数据和关键词提取结果的准确性17

1.3 生成关键词标签数据

在清洗后的高校教师自我评价数据基础上,本文采用基于图的关键词抽取与文档摘要排序算法TextRank,从教师自我评价文本中提取核心关键词,并生成相应的标签数据18。随后,由具备领域背景的研究人员对初步的提取结果进行人工审核与适当修正,从而生成高质量的关键词标签数据。该策略兼顾效率与准确性,不仅节省了大量人工标注成本,而且确保了生成标签的语义合理性与代表性。精准提取关键词标签对本文的研究具有重要价值。一方面,这些标签为关键词提取方法的评估提供了标准化参照,使不同算法的性能对比更加客观。另一方面,高质量的标签数据有助于衡量模型在实际应用中的表现,从而进一步优化算法,提高关键词提取的准确性与稳定性。标签数据的生成步骤如下:

(1)文本预处理与图结构构建。首先,对教师自我评价文本进行分词处理,生成由词汇组成的列表。在此基础上,构建无向图G=(V,E),其中V为图的节点集合,每个节点对应一个词汇,而E表示节点之间的边集合,反映词汇之间的关联。边的建立依赖于词汇的共现关系,即当两个词在一定的上下文窗口内共同出现时,它们之间被视为存在关联,并在图中添加一条边。

(2)共现关系与边的构建。在构建图结构时,采用固定大小的滑动窗口(例如窗口大小为k),在窗口范围内同时出现的词汇对(x,y)被视为具有相关性的节点,并在图中建立相应的边。边的权重由词汇的共现频率决定,即该词汇对在整篇文章中共同出现的次数,具体计算公式如下:

w(x,y)=N[xNyN]

式中:N为滑动窗口的内容集合,[xNyN]用于描述逻辑条件。当词汇xy共同出现在某个滑动窗口N内时,该条件的值为1;如果xy未在相同窗口中出现,则该条件的值为0。

(3)关键词得分计算与排序。在构建图结构后,依据节点之间的连接关系评估各节点的重要性。每个节点的得分不仅由自身的权重决定,还受到其邻居节点得分及相应连接关系的影响。公式如下:

R(u)=1-λM+λv𝒩(u)R(v)d(v)

式中:R(u)𝒩(u)分别为节点u的排名分数和邻居节点所构成的集合;d(v)M分别为节点v的邻居节点数量和图中总共包含的节点数量;λ则为用于控制信息传播平滑度的跳跃因子。

在计算出图中所有节点的排名分数之后,本文按照降序的规则对得到的排名分数进行排序,并选择排名分数较高的节点作为该文本的关键词标签。

综上所述,为保证教师自我评价数据关键词标签提取的准确性和稳定性,本文选择TextRank算法作为关键词提取模型,通过上述3个步骤来挖掘每个文本中词语间的关联程度,并输出指定数量的关键词标签数据。经过人工检查和校正,本文认为,所使用的算法能有效生成教师自我评价文本中的关键词标签数据,为后续的算法改进与性能对比分析提供了数据支撑。

2 基于改进PositionRank的关键词提取算法

由于词汇的所在位置和上下文语义信息被广泛用于评估其在文本中的重要程度,同时传统的PositionRank算法又过于依赖构建共现矩阵来学习多个词汇之间的关系,难以有效表达词汇间长距离的语义依赖和语义的层次结构。为此,本文提出了一种改进的PositionRank算法,结合注意力机制对词汇间的语义依赖关系建模,引入基于位置的初始权重分配,并在图构建和得分计算过程中引入全局上下文信息,以更加精准地理解高校教师自我评价文本中的核心内容,避免信息丢失或偏差问题。本文算法旨在帮助教师更加清晰地认知自身的教学和科研优势,并进一步推动基于数据分析的教师评价体系建设。算法的整体结构如图2所示,算法的具体实现步骤如下:

(1)设教师自我评价文本T={w1,w2,,wn}n个词汇组成,将其划分为m个子序列,记为T1,T2,,Tm。子序列Ti中包含连续的ni个词,即n1+n2++nm=n,每个子序列的公式如下:

Ti={wk|k[bi,bi+ni-1]}

式中:bi为子序列Ti的起始位置;bi+ni-1为子序列Ti的结束位置。

(2)对于子序列Ti,首先对每个词汇w进行处理,然后使用词嵌入方法,将其映射为对应的向量表示。同时,为每个词汇添加反映词汇在序列中位置信息的位置编码19,公式如下:

x(w)=e(w)+r(w)

式中:e(w)r(w)x(w)分别为词汇w的词嵌入向量、位置编码向量和输入子序列中的嵌入向量。

(3)假设所有输入序列中的词嵌入向量表示为X={x1,x2,,xn},其中xi为第i个词的嵌入向量(词嵌入和位置编码向量的组合)。为计算词与词之间的相关性,将每个输入词x通过线性变换分别映射为查询向量Q、键向量K和值向量V,公式如下所示:

Q=W1x,K=W2x,V=W3x

式中:W1W2W3分别为查询、键和值的线性变换矩阵,是可学习的参数矩阵。

(4)计算输入序列的注意力矩阵以表示序列中各词汇之间的依赖关系20。随后,通过对所有子序列的注意力矩阵进行平均融合,得到整个文本的全局注意力矩阵A,具体公式如下:

A=1mi=1ml=1LATi,lAu,vTi,l=Softmax(QuTi(KvTi)/dk)

式中:L为编码器的层数;QuKv分别为词wuwv的查询向量和键向量;dk为键向量的维度;Softmax()为Softmax激活函数。

(5)从注意力矩阵中提取有效的词汇对,同时计算其注意力值作为词汇对之间的权重21,用于构建词汇图中的边权重,具体公式如下:

w(wu,wv)=i=1ml=1LAu,vTi,lδ(wu,wv)

式中:δ()为指示函数,当词wuwv出现在同一个子序列中时取值为1,否则取值为0。

(6)计算每个词汇初始化概率向量p(w)和权重向量s(w)22。概率向量用于根据词汇在文本中的位置分配初始值,位置越靠前的词概率越大。权重向量则表示每个词的初始权重,假设所有词的权重均匀分布,公式如下:

p(w)=1i+1,s(w)=1n

式中:i为词汇w在文本中首次出现的位置(从0开始计数);n为文本中总词汇数。

(7)对每个词汇的得分进行迭代更新,直至得分收敛,公式如下:

st+1(w)=(1-λ)p(w)+λw'TW(w,w')st(w')

式中:st(w)为第t次迭代时词汇w的得分;W式(7)提取词汇对的注意力权重矩阵;λ为控制随机跳转概率的阻尼系数。

(8)对所有词汇按照得分排序,公式如下:

R=sort({(w,s(w))|wT})

式中:R为按得分降序排序后的词汇集合及其对应得分;s(w)为词汇w的最终得分。

(9)从排序结果中筛选出得分超过阈值的词汇,公式如下:

S={(w,s(w))R|s(w)>τ}R[:nk]

式中:R[:nk]R中排名前nk的词汇;τ为关键词得分的阈值;nk为设定的关键词数量下限。

本文算法能识别教师自我评价中的细粒度语义,弥补传统方法仅依赖词频或位置的局限性,从而精准提取反映教学与科研贡献的关键词。需要说明的是,本文所基于的PositionRank算法采用的是FullMode实现方式,即在完整文本构建图结构,并使用词语首次出现位置初始化节点权重。经过优化后本文方法在关键词提取的精度与稳定性有所提升,同时在复杂数据处理中能够捕捉到更具代表性的信息,为后续分析与决策提供可靠支持。

3 实验结果与分析

为验证本文方法的有效性,将本文方法与文献[7]方法、文献[11-13]方法和文献[15]方法进行了对比。其中,文献[7]方法通过基于词频和逆文档频率来构建关键词权重;文献[11]方法在TextRank方法的基础上引入词位置信息,提升了重要词语的排序表现;文献[12-13]方法通过将候选词聚类为主题并对主题进行排序,从而提取主题相关的关键词;文献[15]方法利用词嵌入向量表示,将候选词与文本语义表示之间的相似度作为排序依据。本文认为,所提供的实验结果不仅能够为改进的方法在高校教师自我评价中的适用性提供实证支持,同时也可以为优化教师评价体系提供参考。

3.1 评价指标

本文选择F1@K作为评价指标以验证本文方法的性能。F1@K能够衡量方法在前K个结果上的表现,计算原理如下:

F1@K=2Precision@KRecall@KPrecision@K+Recall@K

式中:Precision@KRecall@K分别为前K个预测结果的精度和召回率,计算公式如下所示:

Precision@K=C@KKRecall@K=C@KN

式中:C@K为前K个预测中正确预测的关键词数量;N为关键词标签数据的总数量。

3.2 高校教师自我评价数据实验结果对比与分析

选择经过清洗后的高校教师自我评价数据,对比本文方法、文献[7]方法、文献[11-13]方法和文献[15]方法的关键词提取结果,如表1所示。本文方法在所有的评价指标设置上均取得了较好的性能,与文献[12]方法相比,本文方法在4种评价指标设置上的结果分别提高了1.17%、0.19%、0.85%和0.66%,明显优于传统方法。这表明,采用更加细致的语义理解和上下文关系捕捉技术,能有效提高教师自我评价中关键词的提取效果。不仅能准确反映教师的核心评价内容,还能更好地分析教师在教学和科研中的贡献与特长。此外,本文方法设计了针对长文本的分段处理,避免了由于文本长度超过方法输入限制导致的截断问题,确保方法运行的稳定性。

3.3 泛化性实验结果对比与分析

泛化性是指方法在未知数据或不同领域的表现能力,即测试方法是否能在其他数据上有效运行。在泛化性实验验证中,仍然采用与3.2节中相同的评价指标,并在现有公开的新浪新闻中文数据集上进行测试。新浪新闻中文数据集由来自教育、体育、娱乐等8个领域的新闻报道构成,不同领域的新闻具有特定的词汇、表达方式和语义特征,能够有效验证本文方法是否具备跨领域的泛化性与适应性,测试结果如图3所示,可知,本文方法在所有的评价指标设置上均取得了较好的效果。与文献[11]方法相比,本文方法在4种评价指标设置上的结果分别提高了0.56%、1.54%、2.58%和3.59%,说明本文方法考虑了词语上下文语义和位置动态变化的有效性,有效建模词语间的长距离依赖是本文方法取得较好效果的主要原因。此外,通过验证本文方法在不同领域的适用性,进一步证明了本文方法具有较强的泛化能力,对于教师自我评价关键词的提取方法同样能适应不同内容和语境,从而提升了关键词提取的准确性与鲁棒性。

3.4 高校主要学部教师自我评价数据实验结果对比与分析

不同学科领域的教师在教学内容、研究方向等方面存在较大差异,统一的数据处理方式可能难以充分体现这些特征。因此,为了更准确地评估本文方法在不同学科领域的适用性,本节对部分学部的数据进行分析,以验证本文方法在不同学科背景下的有效性。为此,本文选取了高校教师自我评价数据中的5个学部:人文学部、社会科学学部、理学部、工学部和信息科学学部,数据量分别为1 182、912、956、765、670条,占总数据集的74.75%。此外,由于各学部的教师在自我评价时可能关注不同的标准、侧重点及语言表达方式,这种差异可能导致模型在某些学部的关键词或主题提取结果较为分散。因此,本节采用F1@15作为评价指标,以更全面地衡量预测结果的有效性,使不同学科领域的对比更具代表性。测试结果如表2所示。

表2可见,本文方法在各学部的实验均取得了良好效果。相比文献[11]方法,本文方法在各学部的结果分别提升了2.13%、0.87%、2.68%、1.4%和0.06%。进一步分析实验结果可以发现,本文方法在提取人文学部、理学部和工学部的教师自我评价关键词方面表现更为突出。其中,理学部教师自我评价关键词的准确率相对较高,这可能与理学科评估标准较为客观,主要关注科研成果和实验研究等量化指标有关。

总体而言,本文方法在不同学部的实验表现及其对高校教师评价体系的潜在改进作用,进一步证明了其在高校教师管理中的应用价值,尤其在提升评价的准确性、公平性以及数据驱动决策方面具有重要意义。

3.5 消融实验

为了评估滑动窗口大小对高校教师自我评价关键词提取效果的影响,通过调整滑动窗口大小的取值,探讨其对模型性能的影响。采用高校教师自我评价数据进行测试,测试结果如表3所示,可知,当滑动窗口大小由1增加到6时,F1@K的平均值由26.37%增加到30.04%;当滑动窗口大小由6增加到10时,F1@K的平均值逐渐降低至27.38%,说明不同的滑动窗口大小对本文方法的准确性产生了一定的影响。当窗口过小时(1或2),窗口内的局部上下文信息不足,本文方法难以捕捉完整的语义关系,导致性能较差。当窗口过大时(8或10),引入了过多的噪声导致方法的性能下降,特别是在高优先级关键词提取(F1@1F1@3)中表现不佳。当窗口大小被设置为6时,本文方法能在局部和全局语义信息之间取得平衡,取得最佳的性能。通过优化滑动窗口大小和窗口内词语的关联性,本文方法能有效提升教师自我评价关键词的提取精度,尤其在大规模数据集上,进一步增强了模型的泛化能力与稳定性,对教师自我评价数据的分析与应用具有重要意义。因此,除非特别说明,本文所有实验均在滑动窗口大小设置为6的条件下进行。

4 结束语

针对目前高校教师自我评价主要依赖人工统计与分析,存在评价过程主观性较强、工作效率低下以及精准度低等问题,本文提出了一种基于改进PositionRank算法的高校教师自我评价关键词提取方法。该方法首先采集高校教师自我评价数据,并采用数据清洗技术去除冗余与异常数据,以确保数据质量;随后,采用基于图的关键词抽取算法生成高校教师自我评价标签数据;最后,通过改进的PositionRank算法自适应学习词组间的注意力权重,实现精准的关键词提取。实验结果表明:本文方法有效提升了教师自我评价数据的自动化分析能力,实现了从人工提取到智能化提取的转变。在采集的高校教师自我评价数据集上,本文方法表现出较高的关键词提取准确性,并在公开的新浪新闻中文数据集上展现出较强的泛化能力。未来,本文方法可与自然语言生成技术相结合,实现教师自我评价年度报告自动化生成、教师总结评价理解分析等智能化功能,为高校构建数据驱动的智能化教师评价体系提供技术支持,助力高校在教师绩效评估、职业发展规划等方面实现更加科学的决策管理。

参考文献

[1]

胡瑞, 李彩云. 高校教师评价改革的“破”与“立”——基于新公共服务理论的分析框架[J]. 现代教育管理, 2024 (8): 99-107.

[2]

Hu Rui, Li Cai-yun. The "breaking" and "establishing" of teachers' evaluation reform in universities—analysis framework based on new public service theory[J]. Modern Education Management, 202, (8): 99-107.

[3]

黄春晨, 鲁长风, 田友谊. 人工智能赋能高等教育的政策嬗变与展望——基于“主题-工具-评价”的三维分析框架[J]. 高教探索, 2025(1): 48-59.

[4]

Huang Chun-chen, Lu Chang-feng, Tian You-yi. Policy transformation and future prospects of artificial intelligence empowering higher education[J]. Higher Education Exploration, 2025 (1): 48-59.

[5]

常耀成, 张宇翔, 王红, . 特征驱动的关键词提取算法综述[J]. 软件学报, 2018, 29(7): 2046-2070.

[6]

Chang Yao-cheng, Zhang Yu-xiang, Wang Hong, et al. Features oriented survey of state-of-the-art keyphrase extraction algorithms[J]. Journal of Software, 2018, 29(7): 2046-2070.

[7]

刘静, 徐学, 蔺跟荣. 现代信息技术赋能高校教师评价改革的实施路径探析[J]. 黑龙江高教研究, 2024, 42(9): 149-153.

[8]

Liu Jing, Xu Xue, Lin Gen-rong. Implementation approaches of modern information technology empowering the teacher evaluation reformin higher education institutions[J]. Heilongjiang Researches on Higher Education, 2024, 42(9): 149-153.

[9]

胡少虎, 张颖怡, 章成志. 关键词提取研究综述[J]. 数据分析与知识发现, 2021, 5(3): 45-59.

[10]

Hu Shao-hu, Zhang Ying-yi, Zhang Cheng-zhi. Review of keyword extraction studies[J]. Data Analysis and Kno- wledge Discovery, 2021, 5(3): 45-59.

[11]

于强, 林民, 李艳玲. 基于深度学习的关键词生成研究综述[J]. 计算机工程与应用, 2022, 58(14): 27-39.

[12]

Yu Qiang, Lin Min, Li Yan-ling. Review of keyphrase generation based on deep learning[J]. Computer Engineering and Applications, 2022, 58(14): 27-39.

[13]

Salton G, Wong A, Yang C S. A vector space model for automatic indexing[J]. Communications of the ACM, 1975, 18(11): 613-620.

[14]

Page L, Brin S, Motwani R, et al. The PageRank citation ranking: bringing order to the web[C]∥The Web Conference,Technical Report, Toronto,Canada,1999:161-172.

[15]

Mihalcea R, Tarau P. Textrank: Bringing order into text[C]∥Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing, Barcelona, Spain, 2004: 404-411.

[16]

Bougouin A, Boudin F, Daille B. Topicrank: graph-based topic ranking for keyphrase extraction[C]∥International Joint Conference on Natural Language Processing,Nagoya, Japan, 2013: 543-551.

[17]

Florescu C, Caragea C. Positionrank: an unsupervised approach to keyphrase extraction from scholarly documents[C]∥Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (volume 1: long papers), Vancouver, Canada,2017: 1105-1115.

[18]

Liu Z, Huang W, Zheng Y, et al. Automatic keyphrase extraction via topic decomposition[C]∥Proceedings of the 2010 Conference on Empirical Methods in Natural Language Processing, Cambridge, USA,2010: 366-376.

[19]

Sterckx L, Demeester T, Deleu J, et al. Topical word importance for fast keyphrase extraction[C]∥ Proceedings of the 24th International Conference on World Wide Web,Florence, Italy, 2015: 121-122.

[20]

Wan X, Xiao J. Single document keyphrase extraction using neighborhood knowledge[C]∥Proceedings of the AAAI Conference on Artificial Intelligence,San Diego, USA, 2008, 8: 855-860.

[21]

Bennani-Smires K, Musat C, Hossmann A, et al. Simple unsupervised keyphrase extraction using sentence embeddings[J/OL].[2025-02-26].arXiv preprint arXiv:

[22]

Campos R, Mangaravite V, Pasquali A, et al. Yake! collection-independent automatic keyword extractor[C]∥Proceedings of the European Conference on Information Retrieval, Grenoble, France, 2018: 806-810.

[23]

李渊本. 正则函数在统计机关人事信息数据清洗中的应用[J]. 统计与咨询, 2024(6): 36-38.

[24]

Li Yuan-ben. Application of regular expressions in data cleaning of statistical agency human resource information[J]. Statistics and Consultation, 2024(6): 36-38.

[25]

周宁,石雯茜,朱昭昭. 基于粗糙数据推理的TextRank关键词提取算法[J]. 中文信息学报, 2020, 34(9): 44-52.

[26]

Zhou Ning, Shi Wen-qian, Zhu Zhao-zhao. TextRank keyword extraction algorithm based on rough data-deduction[J]. Journal of Chinese Information Pro- cessing, 2020, 34(9): 44-52.

[27]

丁晓阳,王兰成. 网络论坛文本特征词权重计算优化方法研究[J]. 情报理论与实践, 2021, 44(5): 187-192.

[28]

Ding Xiao-yang, Wang Lan-cheng. Research on opti- mized calculation method for weight of terms in BBS text[J]. Information Studies: Theory & Application, 2021, 44(5): 187-192.

[29]

祖弦,谢飞. 一种基于全局和局部特征表示的关键词抽取算法[J]. 云南大学学报:自然科学版, 2023, 45(4): 825-836.

[30]

Zu Xian, Xie Fei. A keyphrase extraction algorithm based on global and local feature representation[J]. Journal of Yunnan University(Natural Sciences Edition), 2023, 45(4): 825-836.

[31]

焦宇超, 阎刚. 基于BERT与要素提取的相似案例匹配[J]. 智能计算机与应用, 2025, 15(1): 130-135.

[32]

Jiao Yu-chao, Yan Gang. Similar case matching based on BERT and feature extraction[J]. Intelligent Computer and Applications, 2025, 15(1): 130-135.

[33]

袁家政, 须德, 鲍泓. 基于结构与文本关键词相关度的XML网页分类研究[J]. 计算机研究与发展, 2006,43 (8): 1361-1367.

[34]

Yuan Jia-zheng, Xu De, Bao Hong. An efficient XML documents classification method based on structure and keywords frequency[J]. Journal of Computer Research and Development, 2006, 43(8): 1361-1367.

基金资助

国家自然科学基金面上项目(62276112)

AI Summary AI Mindmap
PDF (1338KB)

519

访问

0

被引

详细

导航
相关文章

AI思维导图

/