基于知识增强大语言模型的小学科学测试题生成方法

刘明 ,  吴忠明 ,  王家壹 ,  李向前 ,  廖剑 ,  刘礼

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 702 -711.

PDF (1317KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 702 -711. DOI: 10.14188/j.1671-8836.2025.0054
生成式人工智能应用

基于知识增强大语言模型的小学科学测试题生成方法

作者信息 +

Knowledge-Augmented Large Language Model for Primary School Science Test Question Generation

Author information +
文章历史 +
PDF (1348K)

摘要

智能测试题生成是科学教育数字化转型的重要环节,其核心目标是利用人工智能技术基于教材内容和知识点自动生成高质量测试题。当前研究表明大语言模型在智能测试题生成方面具有较好的效果,但依然需要应对专业知识不足的挑战。为此,提出一种知识图谱引导大语言模型生成科学测试题方法,以提升大语言模型对科学概念及其相互关系的理解能力,从而优化测试题生成质量。本研究首先在科学教育专家指导下,基于小学科学教材构建结构化知识点库和细粒度学科知识图谱;其次,依据教育用户选择的知识点,在知识图谱库中检索最相关的子图;最后,将知识图谱子图、知识点及学段信息以提示语的方式注入大语言模型,以生成多项选择题、填空题和简答题。实验评估表明,基于图结构的1-hop知识图谱的注入大语言模型,生成试题的接受度为95.4%,在学科适应性、试题多样性和质量控制方面均优于已有的方法(接受度为87.0%),但在题目难度控制上仍有待提升。

Abstract

Automated test question generation is a key component of the digital transformation in science education, aiming to leverage AI to automatically generate high-quality test questions based on textbooks and knowledge points. Current research shows that large language models (LLMs) are effective for this task, but they still need to overcome the challenge of lacking professional knowledge. To address this, this study proposes a method that uses a knowledge graph to guide LLMs in generating science questions to improve the model’s understanding of scientific concepts and their interrelations, thereby optimizing question generation quality. Specifically, we construct a structured knowledge base and fine-grained subject knowledge graph under expert guidance, retrieve relevant subgraphs based on selected knowledge points, and integrate them into the model via prompt engineering. Experimental evaluations show that injecting a graph-based 1-hop knowledge graph into a large language model yields an acceptance rate of 95.4% for generated test questions, outperforming existing methods (87.0%) in subject adaptability, question diversity, and quality control—though control over question difficulty remains to be improved..

Graphical abstract

关键词

知识增强 / 大语言模型 / 知识图谱 / 小学科学教育 / 问题生成

Key words

knowledge augmentation / large language model / knowledge graph / primary science education / question generation

引用本文

引用格式 ▾
刘明,吴忠明,王家壹,李向前,廖剑,刘礼. 基于知识增强大语言模型的小学科学测试题生成方法[J]. 武汉大学学报(理学版), 2025, 71(5): 702-711 DOI:10.14188/j.1671-8836.2025.0054

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

中共中央、国务院印发的《教育强国建设规划纲要(2024—2035年)》(https://www.gov.cn/gongbao/2025/issue_11846/202502/content_7002799.html)明确指出,要以开发新型数字教育资源、探索数字赋能大规模因材施教途径来支撑国家教育数字化战略。同时,教育部办公厅印发的《中小学科学教育工作指南》(https://www.gov.cn/zhengce/zhengceku/zhengceku/202501/content_7000414.htm)指出,要用数字化赋能科学教育,全面提升考试命题、作业设计能力。测试题是考试命题和作业设计核心,因此,智能测试题生成是科学教育数字化转型的重要环节。智能测试题生成,旨在利用人工智能技术,基于给定的教材内容和知识点,自动生成测试题[1]。传统人工创建测试题的方案生成高度依赖教师个人经验[2],耗费大量时间和精力,难以精准把握学生不同认知层次的需求,因此,传统人工创建测试题的方案难以适应未来数字化战略下的学生培养与教育评价需求。

大语言模型(Large Language Model,LLM)的出现,为智能测试题生成带来了新的机遇。基于LLM的智能测试题生成方法主要以用户输入或检索增强方法获取知识点,将知识点以提示语的方式注入LLM,并结合一定的条件约束,生成大规模测试题[3]。例如,陈欣等[3]将单个知识点添加到提示语中,并利用ERNIE-4.0-Turbo模型生成了多选题和应用题两种测试题。Scaria等[4]将单个知识点注入提示语,输入LLM,规模化生成了符合不同布鲁姆认知分类的简答题。Molina等[5]将一个从教学专题幻灯片中抽取的知识以提示语的方式注入GPT-3.5等LLM,生成情境相关的问题。来雨轩等[1]实现了以提示语的形式,将单个知识点与知识点相关的上下文注入LLM中,生成单个问题。可以发现,相较于传统基于深度学习的方法,基于LLM的智能测试题生成方法因基座模型的上下文理解能力[6],一定程度上增强表达类人化与认知深度,同时能够通过预训练知识库减少对领域标注数据的依赖。然而,现有基于LLM的测试题生成方法存在较多不足:1) 均是仅基于单个知识点生成问题,对LLM科学知识的结构化程度低,导致大语言模型难以捕捉目标知识点之间的深层次关联(例如,递进、因果等),影响题目科学语义连贯性、准确性;2) 生成题目类型比较单一,大部分为简答题,导致题目多样性与规模化生成能力不足;3) 生成题目无法对学生学段、题目难度等认知条件进行适应性匹配,生成的题目要么过难,要么过易,难以应用于一线教学场景。

为了提升大型语言模型在小学科学测试题生成任务中的表现,本文提出了一种融合知识图谱(Knowledge Graph,KG)的知识增强方法。该方法首先在科学教育专家指导下基于科学教材原文构建结构化知识点库和细粒度的学科知识图谱,其次根据教育用户在结构化知识点库中选择的知识点,在学科知识图谱库中检索最相关的知识图谱子图,最后通过提示语的方式将知识图谱子图、知识点和学段注入LLM,结合学段适应性、难度控制等约束条件,进而生成多样化的小学科学测试题。该方法增强了大语言模型对科学概念及其相互关系的理解,生成更高质量的测试题。本文的主要贡献如下:

1) 针对现有GraphRAG[7]与KnowGPT[8]等主要依赖三元组注入或随机跳数子图的问题生成方法,系统评估了不同知识图谱表征形式及不同跳数注入条件对LLM结构化学科知识理解与测试题生成效果的影响,优化了LLM在科学教育任务中的应用性能。

2) 在已有单知识点与上下文提示的LLM问题生成方法基础上[3],提出融合细粒度知识图谱的知识增强机制,强化LLM对知识点间递进、因果等逻辑关系的理解,同时引入学段适应性与难度控制等认知约束条件,显著提升生成试题的多样性与质量。

3) 区别于传统依赖公开问答数据集进行测试题生成的方法[9],基于真实的教育科学版小学科学教材构建生成语料,并通过8名科学教育专家的接受度评价验证生成试题的学科适应性与应用价值,克服了通用数据库方法在教育场景下的适应性局限。

1  相关工作

1.1 智能测试题生成

智能测试题生成(Question Generation)技术经历了从基于规则的模板填充和传统机器学习方法向以LLMs为核心驱动的整体规划的演进。基于LLM的问题生成方法依托其强大的语义理解与逻辑推理能力,能够从给定的上下文中自动生成高相关性、高质量的测试题,以满足个性化学习和大规模评估的需求。目前,提示语工程(Prompt Engineering)是主流的LLM测试题生成方法,即通过在提示语中嵌入文本内容与约束条件,引导LLM生成符合要求的测试题。Biancini等[10]在提示语中指定了基于所提供文本来生成多项选择题的格式以及选项唯一、时间明确等约束条件,分别输入GPT-3.5、Llama 2和Mistral中,每个模型各生成7道有关高中历史的多项选择题,最后组织21名教育工作者从问题与源文本的一致性、表述清晰度、干扰项选择、合理性、学习效用等方面对问题进行评价,结果表明GPT-3.5在各评价指标上表现最优。Li等[9]提出的PFQS(Planning First, Question Second)方法通过在提示语中指定预测、因果关系、情感等文本属性,以及问题答案来源于单个还是多个句子、显式还是隐式,实现了对生成问题的内容与难度控制;再结合包含关键信息的计划和FairytaleQA数据集中提供的文本内容,输入LLM中生成10 580道问题及答案,与数据集中原有问答对进行相似度比较后发现此方法取得了最优性能。陈欣等[3]针对中文教育场景设计了基于LLM的试题自动生成路径GQR,其结合检索增强生成(Retrieval-Augmented Generation,RAG)与结构化知识点,在提示语中指定了科目、检索文档结果、知识点、题型等,共生成以信息检索、数据结构等为主题的432道选择题和115道应用题,从准确性、模板黏性、完善性、试题质量、道德性五个方面判断试题是否合格,结果显示总合格率为86.47%。

综上,基于LLM的测试题生成方法具备高泛化能力和强适应性,能够根据不同情境生成多样化试题,并在语义理解、逻辑推理方面表现优越。但问题质量依赖于提示语的约束条件,还存在类型单一、忽视知识点间的深层结构关系等问题,同时在科学教育中还未大量使用。本文拟将知识图谱作为提示语中的上下文内容,加以学段、认知层次等约束条件,生成多种类型的小学科学测试题并评估其接受度。

1.2 知识图谱的不同表征形式对LLM推理能力的影响

知识图谱作为结构化语义知识的载体,能有效减轻LLM的幻觉现象,弥补其在逻辑推理、专业领域知识和信息时效性方面的不足。与传统检索增强生成方法相比,图检索增强生成(Graph Retrieval-Augmented Generation,GraphRAG)通过多视角图索引和细粒度可控的检索机制,将图结构转化为三元组、自然语言描述等多种形式,不仅减少了输入文本长度,而且降低了输入文本的长度,也使得LLM能更好地捕捉上下文中的关系逻辑[7]

研究表明,知识图谱的表征形式会直接影响LLM的推理准确率与可解释性。Shu等[11]将知识图谱信息转化为自然语言短句,并借助链式思维(Chain-of-Thought)提示与指令微调,使Flan-T5、Llama2和Gemma在多跳推理中获得显著性能提升,优于传统的嵌入式方法。这种自然语言方式便于模型理解,却可能在跨领域问题或复杂推理场景下出现模糊或歧义。为进一步利用知识图谱的结构化特性,KnowGPT框架[8]基于深度强化学习或启发式子图两种策略从知识图谱中提取最相关信息,并将其表征为三元组、语句或图描述等三种形式,引入多臂老虎机模型,将其建模为一个组合动作空间的决策问题,旨在动态评估并选择策略与表示形式的最佳组合,从而优化提示生成过程,并驱动GPT-3.5实现高质量问答输出。该框架在三个问答数据集上进行评估,平均准确率比GPT-3.5高出23.7%,比GPT-4高出2.9%;同时,三种形式的对比结果发现,基于三元组构造的提示语适用于简单问题,基于语句构造的提示语在多跳问题中表现最优,而基于图描述构造的提示语在涉及全局推理的复杂问题上取得最佳效果。Wu等[12]则引入JSON和Python代码两种更具可控性的表示形式:JSON能以字典或列表更清晰地呈现实体与关系;Python代码通过自定义类或函数组织多跳推理过程,在Wikidata的多跳推理实验中表现最优,特别是在三跳以上的复杂推理任务中具备更高灵活性。然而,JSON在少样本提示情况下的表现较弱,自然语言表示也有语义模糊的风险,凸显了在不同任务背景下选择合适表示方式的必要性。

综合来看,三元组和自然语言在简单或较少推理步骤的任务中更高效;图描述和编程语言形式则在多跳乃至全局推理中展现出更强的可控性与准确度,揭示了不同知识图谱表示方式对LLM推理能力的差异与适用场景。然而研究主要围绕知识图谱的不同表征方式对LLM推理能力的影响展开,多集中于开放域问答和通用推理任务,尚未针对小学科学测试题生成这一特定场景进行探索。科学测试题对知识的精准性要求更高,既需确保概念的准确表达,又需保证推理链条的严密性,这对知识的结构化表示和逻辑推理能力提出了更高要求。因此,本文拟采用三元组、自然语言和图结构三种知识图谱表征方式,构建针对小学科学教育的测试题生成方法,比较不同表征方式对测试题生成质量影响,以期提升LLM生成测试题的质量,并探索更适用于科学教育场景的知识增强策略。

2  本文方法

传统知识增强LLM在试题生成过程中,常难以精准聚焦于特定知识点,导致生成的试题在难度控制和表述质量方面存在不足。为解决这一问题,本研究提出了一种基于知识增强LLM的测试题生成方法,主要应用于小学科学教育场景,旨在提高试题的针对性和质量。该方法引入多个相关知识点,并以知识图谱的形式注入LLM,以增强LLM对试题生成意图的理解和适配性,期望提升生成试题的知识点覆盖度、表达清晰度及难度可控性,从而更好地服务于小学科学教育的测试题自动生成需求。本方法的核心流程如图1所示,主要包括以下步骤:1) 构建结构化的知识点;2) 基于LLM构建细粒度学科知识图谱;3) 利用知识图谱检索相关知识点;4) 设计试题生成提示语模板。

2.1 构建结构化的知识点

知识点是教学活动中传递教学信息的基本单元,教材作为学科知识表征的载体,其中涵盖的知识点存在多种逻辑关系。因此,如果能将科学教材的知识按照知识点形式进行表征,那么就能让科学知识点间的逻辑和层次更加清晰和系统化[13],让师生对教材知识体系形成更加清晰的认知[14],也能够增强知识图谱检索与LLM的生成效果。一方面,我们随机在三到五年级科学教材中选取了3个单元(月球、消化系统、食物链)的教材原文,并在2名科学教育专家指导下,按学生需要掌握的内容按照知识点的形式进行组织,形成结构化的知识点条目数据。另一方面,教育用户根据需求,选择知识点条目p,进而在后续步骤开展知识图谱检索。

2.2 基于LLM构建细粒度学科知识图谱

相较于传统预训练的方法[15],基于LLM提示语工程的知识图谱生成方法能够更加高效地从大规模文本中提取实体及其语义关系,进而构建知识图谱[16-17]。因此,为了生成知识增强LLM所需要的知识图谱,使用基于LLM的知识图谱生成方法,从科学教育教材文本中抽取实体、属性及其关系。结构化知识点与学科知识图谱库的区别主要在于:前者知识点划分层级较浅,注重对学科知识的抽象归纳;后者的知识点划分层级更深,注重对学科知识的高细粒度表示。

首先,为构建学科知识语料库,在教育科学出版社出版的小学科学教材中,提取出三到五年级教材中的部分章节的教材原文,构建基本的学科知识语料库。其次,为初步提取学科知识中的结构化知识,使用DeepSeek R1 671B大语言模型,将学科知识以提示语的方式注入,通过实现句子层级的分析,逐一提取出“主语—谓语—宾语”的结构,初步形成知识三元组。例如,在句子“牛顿发现了地心引力”中,会初步得到(牛顿,发现,地心引力)。最后,为整理和优化知识图谱,采用人机协同的优化方法,一方面,本文采用了斯坦福大学Mo等[17]基于KGGen框架中提出的知识图谱实体与关系聚类方法,让LLM自动化进行实体、关系聚类和无效信息删减,以便减少冗余关系、增强逻辑清晰度与信息密度,具体提示语与示例如表1所示;另一方面,在科学教育专家的指导下,对构建形成的知识三元组中实体和关系表达进行优化,以保障知识图谱中科学事实与原理的准确性。最终,面向小学科学教材三至五年级中“月亮”“消化系统”和“食物链和食物网”三个章节,提取了103个实体、46个关系和99个三元组,关系类型包含定义分类、组成构成、功能作用、过程机制、特点现象、数值变化、因果关系、依赖包含、影响调节、用途、周期发展11类,构建了有效表征三个章节科学知识的知识图谱结构。

2.3 利用知识图谱检索相关知识点

基于内容标准的命题技术观认为,试题的创建需要与知识体系相统一[18],这表明,高质量的科学测试题的生成需要保障LLM具有知识体系相对完整的、稳定的知识库。部分LLM虽然在其训练语料中涵盖与科学知识相关的内容,但对科学知识结构化理解缺失导致其无法保证在传统问答环节中能够输出与科学知识最相关的测试题。而检索增强生成是一类高效的解决方案。首先,将学科知识图谱通过Cypher语言存储到Neo4j数据库中,形成了细粒度的学科知识图谱库。其次,使用PageRank算法实现关键学科知识节点排序与匹配,结果返回与教育用户选择的知识点最相关的知识图谱子图(s)。最后,检索到的最相关的知识图谱子图即可作为LLM知识增强的核心元素,将其作为提示语的一部分注入提示语模板中。

2.4 设计测试题生成提示语模板

提示语是指为获得LLM预期反馈,设计LLM执行任务的指令文本[19]。在优质的提示语辅助下,LLM的生成效果有可能优于指令微调的效果[6]。在提示语工程领域,已出现众多优秀结构化提示语设计框架,例如,LangGPT[20]和Co-STAR等[19]。LangGPT提示语框架主要包含角色设定、任务描述、上下文、格式要求、示例、约束条件等组成部分。基于LangGPT提示语框架,在参考已有教育提示语的基础上,经过多轮实验,最终设计了以学段、知识点和知识图谱三个输入参数以及包含题型、难度控制约束的提示语模板T,其公式为:

T=template(p, g, s)

提示语模板的具体内容如下:

- 角色:科学教育专家(10年经验),擅长基于知识图谱设计分层科学题。

- 输入需求:1.学段 {g},2.知识点 {p},3.知识图谱 {s}(含教材原文/实体/关系)

- 约束:

1. 生成三类题型:选择题、填空题、简答题;

2. 必须包含:题目,答案(选择题含选项),科学解析,对应知识图谱路径;

3. 难度控制:符合{g}年级学生认知水平;通过图谱路径复杂度调节难度;避免可猜测选项

- 格式规范:Python字典嵌套列表(含‘选择题’,‘填空题’,‘简答题’三个键)

核心能力:

- 图谱实体关系验证科学性

- 多关系扩展题目多样性

- 结构化知识理解能力

初始化响应:

“您好!我将根据您提供的学段和知识图谱,生成符合认知层级的科学复习题。请提供知识图谱{g}、知识点{p}、学段{s}开始生成。”

- 输入:

<学段{g}>:

<知识点{p}>:

<知识图谱{s}>:

最后,将上述提示语输入到DeepSeek R1 671B中,待其返回Python格式的嵌套列表后,再利用Numpy工具将其格式化输出为CSV表格,即可生成科学测试题。

3  实 验

为了验证该方法的有效性,本文比较了该方法对不同大语言模型生成测试题性能影响、不同知识图谱注入数量对该方法性能的影响以及不同知识图谱表征形式对该方法效果的影响。

3.1 实验设置

本文基于教育科学出版社版本的小学科学课教材,在三、四、五年级课本中随机抽取了月球、消化系统和食物链食物网三个知识点及其对应的教材文本,利用基于LLM的知识图谱生成方法,构建了三元组[21]、自然语言[11]、图结构[8]三种表征形式的知识图谱,表2呈现了以三元组和自然语言表征形式的知识图谱部分实例。随后,将以上述知识图谱为基础,利用知识增强LLM的测试题生成方法,生成小学科学测试题库,包含选择题、填空题和简答题三种题型。

为了比较不同知识增强LLM生成问题质量的差异,将知识点以提示语的方式(0-hop)注入DeepSeek R1 671B(DS)、Qwen2.5-Max(QW)、GPT-4o(GPT)、ChatGLM4(GLM)4个大语言模型中。为了比较不同知识图谱表征形式对知识增强LLM生成问题质量的差异,将三元组、自然语言和图结构的表征形式以提示语的方式注入DeepSeek R1 671B中。表3展示了按以上步骤生成的小学科学测试题的具体分布,总共包含1 080道题目,每道题都包含题干、选项(仅选择题)、答案和解析内容。此外,比较了1-hop和2-hop的知识图谱对知识增强LLM生成问题质量的差异。

3.2 评价指标

本文采用接受度(Acceptability)判断科学测试题的生成质量。在问题生成领域,接受度是指生成问题被人类评估者在特定应用中判定为适当、相关和有用的程度[22]。在本文中,接受度是指LLM生成的测试题可以应用于小学生科学知识学习或复习的程度,主要从题干、选项、答案、题干、解析等方面进行判断,判断要素包含科学正确性(科学事实或原理阐述正确性)、相关性(题目与主题是否相关)、语法规范性(语言阐述的规范性)、清晰度(题目表示清晰度)、难度控制过易(题目是否太简单)、难度控制过难(题目是否超过对应学生理解范围)、冗余性(题目是否冗余)、伦理性(题目是否包含偏见等伦理问题)等。本文中接受度的计算公式如下:

A=TPTN+TP×100% 

其中,TP代表被判定为接受的题目样本数,TN代表被判定为不接受的题目样本数。由此,8名科学与技术教育领域专家被招募到研究中,他们被轮流随机划分为12组,每组2人,每组对同一组测试题逐一进行接受或不接受评价。在不接受的题目中,专家需要注明不接受的原因。经过2轮评价后,所有评价数据的Cohen’s Kappa值均达到0.750以上,表明评价结果的一致性良好[23]。随后,经由1名科学教育专家对评价结果进行最终判断,形成了1 080道小学科学测试题接受度数据集。

3.3 实验结果与分析

表4展现了知识点注入不同时,LLM生成科学测试题的接受度,结果表明DeepSeek R1 671B模型接受度最佳,达到了87.0%,而ChatGLM模型的接受度最低,仅为44.4%。这一结论与Zhou等[24]的相似。通过对四类LLM生成题目不接受原因进行进一步比较分析发现,DeepSeek R1 671B模型在科学知识表达准确性、题目难度控制上具有显著优势。这主要是因为:一方面,由于DeepSeek R1 671B模型具有更大规模参数,进而能够带来更加丰富的科学知识存储和更加复杂的模式识别能力,同时其强大的推理能力确保生成的问题能够更加符合科学逻辑,因此知识点注入策略在DeepSeek R1 671B上能更好地内化和表达科学内容,从而避免了概念模糊或错误的情况;另一方面,与其他模型相比,DeepSeek R1 671B的深度思考策略保证了其在保持信息完整性的前提下,主动实施词汇简化策略[24]。因此,在后续实验中,将以该模型为基座,进行不同知识图谱表征下的问题生成效果对比。

将DeepSeek R1 671B模型在三元组、自然语言和图结构3类知识图谱表征条件下生成测试题的接受度进行对比,对比结果见表5。实验结果表明:1) 在相同表征条件下,1-hop知识图谱注入的接受度效果最优;2) 在图结构表征下生成测试题接受度最优,最高达到95.4%。

实验结果表明,知识图谱的路径长度显著影响语言模型的推理与生成效果。在1-hop知识图谱注入设置下,模型只需处理直接的实体与关系结构,因而能更高效、准确地整合知识信息;而在2-hop注入情形中,随着推理路径的增长和中间节点的引入,模型面临更大的推理挑战,容易出现信息衰减、语义不明确或推理偏差,最终导致生成试题的质量下降,接受度降低。

以上结果与现有研究相一致。Shu等[11]在研究知识图谱增强的大语言模型(KG-LLM)时发现,多跳推理任务比单跳任务更具挑战性,因为随着推理路径的增加,模型需要在更长的链条中保持信息的准确性和一致性。Saxena等[25]进一步强调,多跳推理依赖模型对知识之间连接关系的理解以及上下文信息的持续保持能力。这表明,注入知识的深度会影响大语言模型推理的准确性。为探究知识图谱跳数对小学科学测试题生成的具体影响,本文对三元组条件下专家不接受测试题的原因开展统计分析,发现1-hop知识图谱注入条件下,测试题语言表述更加清晰、科学事实或原理阐述正确率更高。在1-hop任务中,模型仅需激活单一事实单元,因此检索的信息与训练语料中的知识高度一致,错误率较低。而在2-hop任务中,模型需在隐式知识空间中整合两个科学概念,这一过程容易导致事实片段在语言层面的拼接不当,进而引发语义模糊或逻辑不连贯的问题。例如,在题目“为研究月球远离现象,科学家需要测量地月距离的______变化”中,“变化”一词显得过于模糊,若不明确指代增减变化还是速率变化,考生可能会误解为地月距离的绝对变化,这与答案中的“每年3.8厘米”并不完全契合;另外,在逻辑连贯性上,考生需要知道地月距离是指月球每年远离地球的速率,而这一信息并未在题干中明确给出,这种隐含的知识要求实际上和2-hop任务类似,模型需要跨越两个知识点(“月球远离现象”和“测量变化”)形成一个完整的推理链。

本研究通过对比DeepSeek R1 671B模型在三元组、自然语言和图结构三类知识图谱表征条件下的测试题生成效果,发现图结构表征在1-hop任务下的生成接受度最高,达到95.4%,相较三元组和自然语言表征形式提升了约5.18%和1.06%。该结果清晰地表明,利用节点(科学概念)-边(逻辑关系)所构成的图结构组织和表达知识,可以更有效地帮助模型进行多维度的逻辑关联和推理,从而获得更加符合认知规律的问题表述与测试题设计。这一结论与Zhang等[8]在图结构的知识图谱引入对LLM推理能力的增益方面的发现相契合,进一步验证了图结构表征在科学测试题生成一类的复杂推理任务中的潜在价值。这得益于图结构的拓扑表达优势:1) 通过节点(科学概念)-边(逻辑关系)的拓扑映射,精准实现知识层次的立体化表征;2) 支持LLM对多维度知识关联检索,有效串联分散知识点;3) 提供可解释的关系推理链条,增强生成内容的逻辑连贯性。这些特性使模型能够精准解析复杂知识关联,从而在多跳推理任务中产生更符合认知规律的问题表述。对图结构表征下提示语中注入1-hop知识图谱生成的测试题中不接受题目及其原因进行进一步统计,并与单知识点注入的结果进行对比,结果如图2所示。

根据图2可知,在引入图结构和1-hop知识图谱的情况下,LLM在题目难度控制方面得到了有效提升,主要得益于以下两点:1) 图结构的拓扑表达优势结合LLM对低维结构化知识的理解能力,使其能够更深入地掌握科学知识;2) 提示语中添加了题目难度控制的约束,进一步增强了LLM在题目生成难度上的调控能力。然而,尽管LLM在科学正确性和清晰度方面的控制能力有所下降,但仍然处于可接受的误差范围内。此外,在引入图结构和1-hop知识图谱的情况下,测试题被拒绝的主要原因集中在难度过高。以下是一道相关测试题:

题干:提出利用月相变化改进农历日历的方法。

答案:通过长期观测月相周期,精确调整闰月设置,使农历与季节更同步。

解析:需综合“月相变化→包含→各月相”与农历制定规则进行创新应用。

该题目作为面向三年级学生的简答题,存在显著的设计失当问题。其要求三年级学生基于月相变化提出农历改进方案,涉及阴阳历协调等初中阶段的历法知识(如默冬周期与回归年差异),远超课标要求的月相识别能力。同时,题目要求“长期观测”等操作,而小学三年级阶段的学生难以在现实条件下完成这样的任务,缺乏足够的认知支持,容易造成理解上的断层。

4  结 语

本文提出了一种基于知识增强LLM的小学科学测试题生成方法,解决了传统基于单知识点注入LLM的测试题生成方法在生成试题质量、难度控制上的局限性。该方法利用图表征的知识图谱作为结构化信息,以提示语的方式注入LLM中,增强了LLM对外部科学知识的理解、对分散科学知识点的关联,有效保障了生成测试题的科学准确性、语言表达连贯性与学生认知层级匹配性。实验结果表明,基于图结构的1-hop知识图谱的注入LLM,生成试题的接受度为95.4%,在学科适应性、试题多样性和质量控制方面均优于已有的方法(接受度为87.0%),但在题目难度控制上仍有待提升。研究聚焦于知识增强LLM的小学科学测试题生成方法输出的1 080道小学科学测试题及8名一线科学教育专家对其质量评价。知识图谱在研究中主要作为生成测试题的辅助工具,虽然三个章节的样本量与知识点覆盖范围相对有限,但其在测试题生成与评价方面具有较好的参考价值,未来的研究可考虑扩大样本范围和模态表征,构建涵盖知识点覆盖更全面和学习资源多样化的多模态知识图谱,深入探讨知识点的可检索子图大小、知识图谱的覆盖率等,结合图学习、思维链蒸馏微调、强化学习等方法,从而增强结果的广泛适用性和普遍性、持续提升LLM生成测试题的稳定性。

参考文献

[1]

来雨轩, 王艺丹, 王立. 基于大语言模型与检索增强的学科试题生成方法[J]. 中文信息学报202438(12): 148-158.

[2]

LAI Y XWANG Y DWANG L.Exam question generation based on large language models and retrieval-augmentation techniques[J]. Journal of Chinese Information Processing202438(12): 148-158 (Ch).

[3]

BAİDOO-ANU DOWUSU ANSAH L. Education in the era of generative artificial intelligence (AI): Understanding the potential benefits of ChatGPT in promoting teaching and learning[J]. Journal of AI20237(1): 52-62. DOI: 10.61969/jai.1337500 .

[4]

陈欣, 李蜜如, 周悦琦, . 基于大语言模型的试题自动生成路径研究[J]. 中国考试2024(12): 39-48. DOI: 10.19360/j.cnki.11-3303/g4.2024.12.005 .

[5]

CHEN XLI M RZHOU Y Qet al. Research on the approach to automatic test item generation based on large language models[J]. Journal of China Examinations2024(12): 39-48. DOI: 10.19360/j.cnki.11-3303/g4.2024.12.005(Ch ).

[6]

SCARIA NDHARANI CHENNA SSUBRAMANI D. Automated educational question generation at different bloom’s skill levels using large language models: Strategies and evaluation[C]//Artificial Intelligence in Education. Cham: Springer Nature, 2024: 165-179. DOI: 10.1007/978-3-031-64299-9_12 .

[7]

MOLINA L IŠVÁBENSKÝ VMINEMATSU Tet al. Comparison of large language models for generating contextually relevant questions[C]//Technology Enhanced Learning for Inclusive and Equitable Quality Education. Cham: Springer Nature, 2024: 137-143. DOI: 10.1007/978-3-031-72312-4_18 .

[8]

刘明, 吴忠明, 廖剑, . 大语言模型的教育应用:原理、现状与挑战——从轻量级BERT到对话式ChatGPT[J]. 现代教育技术202333(8): 19-28. DOI: 10.3969/j.issn.1009-8097.2023.08.003 .

[9]

LIU MWU Z MLIAO Jet al. Educational applications of large language models:Principles, status and challenges—From light-weighted BERT to conversational ChatGPT[J]. Modern Educational Technology202333(8): 19-28. DOI: 10.3969/j.issn.1009-8097.2023.08.003(Ch ).

[10]

EDGE DTRINH HCHENG Net al. From local to global: A GraphRAG approach to query-focused summarization[EB/OL].[2024-12-30].

[11]

ZHANG Q GDONG J NCHEN Het al. KnowGPT: Knowledge graph based prompting for large language models[EB/OL]. [2024-12-30]. DOI: 10.52202/079017-0196 .

[12]

LI K ZZHANG Y. Planning first, question second: An LLM-guided method for controllable question generation[C]//Findings of the Association for Computational Linguistics 2024. Stroudsburg: Association for Computational Linguistics, 2024: 4715-4729. DOI: 10.18653/v1/2024.findings-acl.280 .

[13]

BIANCINI GFERRATO ALIMONGELLI C. Multiple-choice question generation using large language models: Methodology and educator insights[EB/OL]. [2025-01-12]. DOI: 10.1145/3631700.3665233 .

[14]

SHU DCHEN T LJIN M Yet al. Knowledge graph large language model (KG-LLM) for link prediction[EB/OL]. [2025-01-12].

[15]

WU XTSIOUTSIOULIKLIS K. Thinking with knowledge graphs: Enhancing LLM reasoning through structured data[EB/OL]. [2024-12-30].

[16]

陈静远, 胡丽雅, 吴飞. ChatGPT/生成式人工智能促进以知识点为核心的教学模式变革研究[J]. 华东师范大学学报(教育科学版)202341(7): 177-186. DOI:10.16382/j.cnki.1000-5560.2023.07.016 .

[17]

CHEN J YHU L YWU F. Investigation into the transformation of knowledge-centered pedagogy with ChatGPT/Generative AI[J]. Journal of East China Normal University(Educational Sciences)202341(7): 177-186. DOI:10.16382/j.cnki.1000-5560.2023.07.016(Ch ).

[18]

范佳荣, 钟绍春. 学科知识图谱研究: 由知识学习走向思维发展[J]. 电化教育研究202243(1): 32-38. DOI: 10.13811/j.cnki.eer.2022.01.004 .

[19]

FAN J RZHONG S C. Research on subject knowledge mapping: From knowledge learning to thinking development[J]. e‒Education Research202243(1): 32-38. DOI: 10.13811/j.cnki.eer.2022.01.004(Ch ).

[20]

杨玉基, 许斌, 胡家威, . 一种准确而高效的领域知识图谱构建方法[J]. 软件学报201829(10): 2931-2947. DOI: 10.13328/j.cnki.jos.005552 .

[21]

YANG Y JXU BHU J Wet al. Accurate and efficient method for constructing domain knowledge graph[J]. Journal of Software201829(10): 2931-2947. DOI: 10.13328/j.cnki.jos.005552(Ch ).

[22]

BAI X FHE SLI Yet al. Construction of a knowledge graph for framework material enabled by large language models and its application[J]. NPJ Computational Materials202511: 51. DOI: 10.1038/s41524-025-01540-6 .

[23]

MO BYU KKAZDAN Jet al. KGGen: Extracting knowledge graphs from plain text with language models[EB/OL]. [2024-12-30].

[24]

雷新勇. 基于标准的考试命题技术(一)[J]. 考试研究20117(1): 36-46.

[25]

LEI X Y. Standard-based item construction(1)[J]. Examinations Research20117(1): 36-46 (Ch).

[26]

赵晓伟, 祝智庭, 沈书生. 教育提示语工程: 构建数智时代的认识论新话语[J]. 中国远程教育2023(11): 22-31. DOI: 10.13541/j.cnki.chinade.2023.11.003 .

[27]

ZHAO X WZHU Z TSHEN S S. Educational prompt engineering: Constructing a new epistemological discourse in the era of digital intelligence[J]. Chinese Journal of Distance Education2023(11): 22-31. DOI: 10.13541/j.cnki.chinade.2023.11.003(Ch ).

[28]

WANG MLIU YLIANG Xet al. LangGPT: Rethinking structured reusable prompt design framework for LLMs from the programming language [EB/OL]. [2025-01-12]. DOI: 10.48550/arXiv.2402.16929 .

[29]

PAN S RLUO L HWANG Y Fet al. Unifying large language models and knowledge graphs: A roadmap[J]. IEEE Transactions on Knowledge and Data Engineering202436(7): 3580-3599. DOI: 10.1109/TKDE.2024.3352100 .

[30]

FARABY S ALADIWIJAYA AROMADHONY A. Review on neural question generation for education purposes[J]. International Journal of Artificial Intelligence in Education202434(3): 1008-1045. DOI: 10.1007/s40593-023-00374-x .

[31]

COHEN J. A coefficient of agreement for nominal scales[J]. Educational and Psychological Measurement196020(1): 37-46. DOI: 10.1177/001316446002000104 .

[32]

ZHOU MPAN YZHANG Y Yet al. Evaluating AI-generated patient education materials for spinal surgeries: Comparative analysis of readability and DISCERN quality across ChatGPT and deepseek models[J]. International Journal of Medical Informatics2025198: 105871. DOI: 10.1016/j.ijmedinf.2025.105871 .

[33]

SAXENA ATRIPATHI ATALUKDAR P. Improving multi-hop question answering over knowledge graphs using knowledge base embeddings[C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2020: 4498-4507. DOI: 10.18653/v1/2020.acl-main.412 .

基金资助

国家自然科学基金面上项目(62477039)

重庆市教育委员会科学技术研究计划重点项目(KJZD-K202400208)

AI Summary AI Mindmap
PDF (1317KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/