基于查询扩展和强化学习的大语言模型个性化答疑方法

张士伟, 周嘉诚, 洪亮, 沈明轩, 熊福成, 杜烨

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 690 -701.

PDF (892KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 690 -701. DOI: 10.14188/j.1671-8836.2024.0213
生成式人工智能应用

基于查询扩展和强化学习的大语言模型个性化答疑方法

    张士伟1, 周嘉诚1, 洪亮1, 2, 沈明轩1, 熊福成3, 杜烨4
作者信息 +

Personalized Question-Answering Method Using Large Language Models Based on Query Expansion and Reinforcement Learning

    Shiwei ZHANG1, Jiacheng ZHOU1, Liang HONG1, 2, Mingxuan SHEN1, Fucheng XIONG3, Ye DU4
Author information +
文章历史 +
PDF (912K)

摘要

近年来,大语言模型凭借海量的参数化知识和强大的自然语言处理能力,为个性化答疑提供了新的技术手段。然而现有方法仍面临若干问题,包括无法深度挖掘学生个性化需求、生成回答的针对性不足,以及缺少可靠背景知识导致的回答准确性受限。为此,本文提出一种基于查询扩展和强化学习的大语言模型个性化答疑方法。首先,根据教学图谱对原始提问进行扩展,融入学生和课程的个性化信息;其次,设计基于学生背景识别任务的强化学习算法,通过反馈机制引导模型更好地对齐学生特点;最后,结合检索增强生成框架从教学知识库中动态提取参考资料,进一步提升回答的准确性和可靠性。在MOOCCubeX数据集的实验表明,相较于基线方法中最好的对比方法,本文方法在知识背景、学习风格、学习进度和兴趣导向等个性化维度匹配度上分别提高了0.210、0.156、0.222和0.168,回答准确率提升0.086 1。

Abstract

In recent years, large language models have demonstrated great potential for personalized question answering, leveraging their vast parametric knowledge and powerful natural language processing capabilities. However, existing approaches still face several limitations, including insufficient exploitation of student- and course-specific information, limited answer relevance, and constrained response accuracy due to the lack of reliable background knowledge. To address these challenges, this paper proposes a personalized question-answering method for LLMs based on query expansion and reinforcement learning. Specifically, original queries are expanded using a pedagogical knowledge graph to incorporate personalized information related to students and courses; a reinforcement learning algorithm based on a student background identification task is designed to guide the model in aligning more closely with student characteristics via a feedback mechanism; and a retrieval-augmented generation framework is employed to dynamically extract supporting materials from a teaching knowledge base, thereby enhancing the accuracy and reliability of responses. Experimental results on the MOOCCubeX dataset show that, compared with the best method among the baseline methods, the proposed method improves the matching degree across four personalization dimensions—knowledge background, learning style, learning progress, and interest orientation—by 0.210, 0.156, 0.222, and 0.168, respectively, and increases answer accuracy by 0.086 1.

Graphical abstract

引用本文

引用格式 ▾
张士伟, 周嘉诚, 洪亮, 沈明轩, 熊福成, 杜烨. 基于查询扩展和强化学习的大语言模型个性化答疑方法[J]. 武汉大学学报(理学版), 2025, 71(5): 690-701 DOI:10.14188/j.1671-8836.2024.0213

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

答疑是教学过程中的重要环节,能够促进学生对知识的深入理解,并激发其学习积极性和主动性。然而随着高等教育普及化与在线教育规模化发展,答疑资源短缺问题日益凸显,因而迫切需要引入人工智能技术以提升教学答疑的效率。作为人工智能领域的最新成果之一,大语言模型(Large Language Model, LLM)凭借海量的参数化知识与强大的自然语言理解和生成能力,在教学答疑等场景中展现出巨大的应用潜力,有望实现“师师有助教,生生有学伴”这一愿景[1-2]

目前大语言模型在教学答疑场景的落地仍面临个性化适配不足和回答可靠性不佳等核心挑战。一方面,现有方法未充分考虑学生在知识背景、学习风格、学习进度和兴趣导向等维度的差异,导致回答针对性不足,难以适配不同学生群体的学习需求;另一方面,大语言模型在回答训练数据范围之外的问题时可能会出现“幻觉”(hallucination)现象[3-4],进一步误导学生的认知和理解。针对上述挑战,本文提出一种基于查询扩展和强化学习的大语言模型个性化答疑方法。首先,利用教学图谱对学生的原始提问进行动态扩展,从而融入多维度个性化信息。然后,借助强化学习提高大语言模型生成个性化回答的能力。最终,基于外部教学知识库为大语言模型动态提供参考资料,从而实现个性准确的教学答疑。

本文的主要贡献包括:

1) 针对现有个性化答疑方法无法充分挖掘深层次个性化信息的问题,提出一种基于图谱检索的查询扩展算法,挖掘出学生深层次的个性化偏好,为大语言模型生成个性化回答奠定基础。

2) 针对大语言模型个性化生成能力不足的问题,提出基于大语言模型反馈的强化学习方法,通过引入学生背景识别任务,对生成的个性化回答进行反馈,引导大语言模型的生成结果与个性化信息进行对齐。

3) 在前述查询扩展和强化学习方法的基础上,提出基于检索增强生成的个性化答疑框架,通过动态查询教学知识库,为大语言模型提供实时的教学资料作为参考,进一步提升回答结果的准确性。

1  相关工作

1.1 大语言模型及其个性化

LLM通过在大规模数据上进行预训练,能够学习到丰富的自然语言知识与通用领域知识,并且通过指令微调(Instruction Tuning)[5]以及基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)[6]等技术拥有面向多任务的通用求解能力。其中,指令微调利用格式化的训练数据加强LLM的通用任务泛化能力,而基于人类反馈的强化学习通过训练与人类偏好对齐的奖励模型,使得LLM能够更好地遵循用户意图。除此之外,还可以使用检索增强生成(Retrieval-Augmented Generation,RAG)[7]和思维链(Chain of Thought, CoT)[8]等技术增强LLM回答效果。

随着LLM在各类通用任务中大放异彩,个性化大语言模型(Personalized Large Language Model, PLLM)也逐渐受到关注,它旨在根据用户的特定数据、历史交互和上下文信息,生成满足用户独特需求和偏好的响应,对于提高人机交互体验具有重要意义[9]。PLLM的实现路径有显式和隐式两种,前者主要依靠模型强大的上下文学习(In-context Learning)能力,在推理时将用户偏好信息直接注入指令,以引导模型生成个性化内容。例如,Wang等[10]提出的Cue-CoT方法使用思维链技术提取用户情绪和个性等信息,Liu等[11]提出的ONCE方法使用提示调优技术引导闭源LLM总结用户浏览历史,以获得用户的兴趣偏好;相比之下,后者通过调整LLM内部参数或训练目标函数,将用户偏好隐式地嵌入模型中,代表性技术包括参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)[12]和个性化RLHF(P-RLHF)[13]等。

1.2 大语言模型在教育领域中的应用

LLM凭借其出色的专业能力和对话能力,一经发布即引起了教育研究者的关注,并被应用于从儿童教育到高等教育的各个阶段[14-16]。对于教师而言,LLM可以辅助进行课程设计和组织教学活动,从而减轻教学负担。例如,刘佳等[17]提出了一种基于知识图谱和大语言模型协同的数字教育资源内容审查方法,旨在结合大语言模型的语义理解能力和知识图谱的结构化知识表征能力,实现对特定知识点的快速定位与适用性审查。对于学生而言,LLM可以为其提供更加广泛的学习机会,引导学生更加有效地参与学习过程。例如Tabarsi等[18]提出一种名为MerryQuery的大语言模型智能体,通过集成检索增强生成、强化学习和规则控制等技术,能够为学生提供可信赖和个性化的学习支持。

LLM在个性化教育方面也表现出明显优势。例如,Gan等[19]提出LLM可以通过分析学生的学习数据和行为模式,设计个性化的学习路径和资源,从而提升教学准备的针对性。Park等[20]提出一种基于LLM对话的个性化辅导系统,利用一系列问卷和测试建模学生的认知状态、情感状态和学习风格,然后将其融入指令模板中以实现对学生的个性化辅导。Dan等[21]提出了一个名为EduChat的智能教育聊天系统,通过指令微调技术实现个性化的情感支持,并引入互联网语料库来提高开放性问答的准确性。张学飞等[22]指出传统的个性化学习推荐方法面临冷启动、数据稀疏、可解释性差等问题,并探讨了知识图谱和大语言模型的协同及其在个性化学习推荐中的应用。

综上所述,现有研究虽尝试利用知识图谱、学生建模等手段提升个性化能力,但仍存在信息整合深度不足、生成内容准确性和针对性欠佳等问题,其原因在于:一方面,个性化建模依赖规则或浅层特征,难以捕捉用户深层次需求;另一方面,生成模型缺乏对外部知识的有效利用,容易产生幻觉,影响教育场景中的适用性。相比之下,本文提出的方法通过查询扩展与强化学习相结合,更充分地挖掘用户个性化信息,并引入检索增强生成机制以提升回答的可信度,在保障响应质量的同时,更好地契合个性化教学需求,为大语言模型在教育中的应用提供了新的技术路径与实践支撑。

2  本文方法

2.1 整体框架

个性化答疑的核心在于准确把握并满足学生在不同层面的个性化需求,本文根据教育心理学界针对个性化学习的相关研究[23-25],将个性化需求归纳为知识背景、学习风格、学习进度和兴趣导向四个关键维度,具体定义如表1所示。

为了实现多维度的个性化答疑,本文提出了一套由查询扩展、强化学习和检索增强生成三个核心模块组成的整体框架,如图1所示。

1) 查询扩展模块

该模块首先根据学生提问动态检索教学图谱,获取学生背景、课程内容及学生-课程交互等个性化信息。然后,利用LLM对检索结果进行总结与提炼,以生成精简且高效的个性化偏好描述,作为对原始提问的扩展。

2) 强化学习模块

该模块引入了一种创新的辅助任务即学生背景识别,以提升LLM的个性化生成能力。具体地,针对扩展后的提问,首先通过对LLM进行多次采样生成多个回答;随后,利用另一个LLM评估这些回答的有效性,即判断其是否能够识别出学生的背景(如专业、年级),并对回答进行排序。基于该排序结果,采用强化学习方法对LLM进行奖励与惩罚,引导其生成与学生背景更加匹配的回答。通过这一迭代优化过程,模型能够更好地捕捉学生的个性化需求,提升回答与实际场景的契合度。

3) 检索增强生成模块

模型在生成最终答案时还需通过检索教学知识库动态获取相关参考资料。这些资料包含课程内容、教学案例、章节细节等信息,为LLM提供外部知识支撑,从而有效缓解其“幻觉”现象,确保回答的准确性与可靠性。检索到的高相关性资料进一步作为生成答案的上下文输入,与强化学习优化的模型共同作用,提升回答的逻辑性和权威性。

通过上述三大模块的协同作用,本文方法在个性化信息挖掘、回答质量优化以及内容准确性保障等方面实现了有效融合,为复杂教学场景下的精准个性化答疑提供了全新解决方案。

2.2 查询扩展

2.2.1 教学图谱构建

教学图谱是对学生提问进行扩展的基础,目的在于通过结构化的方式组织和表示学生信息、课程信息以及两者之间的交互信息。相对于传统个性化答疑方法大多仅考虑学生单方面的背景信息,本文通过引入教学图谱以扩展个性化信息的覆盖范围,能够为LLM提供更加全面和精准的个性化背景支持。

1) 本体设计。教学图谱采用三元组形式进行本体设计,如图2所示。其中,每个三元组包含头实体和尾实体(节点)及其关系(边),并且实体和关系均可添加属性。

2) 数据获取与预处理。教学图谱的数据来源主要包括学籍管理系统、教务管理系统、在线学习平台以及在线作业管理系统等,由于这些数据大多为结构化类型,因此可直接通过标准化的数据库操作接口进行获取。为了保证数据的一致性与完整性,还需要使用ETL工具对其进行格式化和标准化。

3) 知识抽取与存储。首先通过数据库查询操作将数据中的核心对象抽取并映射到预定义的实体类别及其属性,然后按照本体中实体之间的逻辑关联提取其关系,从而将结构化数据中的关键信息提取并组织为统一的图谱表示形式,最后使用Neo4j图数据库来存储图谱数据。

2.2.2 提问扩展

在构建教学图谱G后,即可将其用于学生提问扩展,具体流程如算法1所示。在学生s输入提问q后,首先检索出学生s已学习或正在学习的所有课程及其章节的标题,然后使用LLM根据这些标题识别出与提问q最相关的课程l和章节c。随后在教学图谱G中检索学生节点s、课程节点l和章节节点c的所有属性,以及学生节点s与课程节点l、学生节点s与章节节点c之间两跳路径上的节点及其属性,作为学生和课程的个性信息p

在获得个性化信息p后,还不能直接将其应用于后续的答案生成,而是需要使用LLM对其进行总结,原因在于:一方面,对个性化信息p进行总结可以减少上下文长度和噪声;另一方面,部分个性化信息可能需要经过简单推理之后才具有实际意义,如果将这部分推理工作放在后续的答案生成阶段执行,会提高其任务复杂度,影响其生成效果。例如由三元组〈张三,学习,《C语言》〉和〈学习,成绩,65分〉推理出“张三的《C语言》课程的掌握不够》”,可指导LLM在答疑时适当降低专业难度。

假设教学图谱包含|V|个节点与|E|条边,节点最大度数为d_max,节点或边最多关联k个属性。则算法1的时间复杂度主要由两部分构成:一是图谱处理,包括遍历所有节点并检查两跳邻接关系,最坏情况O(|V|d_max),以及检索相关节点的属性,最坏情况O(|V|k);二是两次LLM调用,总成本记为C_LLM。因此,算法1的总体时间复杂度为O(C_LLM+|V|(d_max+k)),其中LLM推理成本C_LLM在实践中可能占据主导地位。空间复杂度方面,除了存储图谱本身所需的O(|V|+|E|)以及LLM推理所需的内存M_LLM外,主要的额外开销在于缓存检索到的大量属性三元组,最坏情况下需要O(|V|k)的空间,故总空间复杂度为O(|V|+|E|+|V|k+M_LLM)

2.3 强化学习

在个性化大语言模型领域,现有研究工作大多基于提示工程技术,即将用户的个性化信息嵌入到问题当中,然后通过设计提示模板要求LLM根据个性化信息生成特定的回答。这类方法的问题在于,一方面设计合适的提示模板是极其困难的,另一方面大语言模型的生成结果未必完全遵循提示模板。因此,本节沿着基于人类反馈的强化学习即RLHF的思路,提出一种基于大语言模型反馈的强化学习方法,借助动态持续的反馈来提高大语言模型回答与个性化信息的对齐效果。考虑到传统的RLHF方法需要大量的人工标注样本,提高了成本,因此本节通过引入一种“学生背景识别”辅助任务自动生成反馈,主要包括以下三个步骤:

1) 收集反馈数据。首先,针对问题q,对大语言模型Ma进行多次采样,获得多个答案A=a1,a2,,an。然后,执行学生背景识别,即假定问题q和所有答案均出自同一个学生,要求另一个大语言模型Mb判断哪个答案更有助于识别出该学生的背景p,并对答案进行排序。最后,根据Mb的排序结果构造出数据集D,每个样本的格式均为q,A,choicechoice表示学生背景识别任务的结果,例如choice=[2,1],则表示答案a2优于a1

此外,考虑到有些情况下细粒度的个性化信息难以获得,例如只能获悉某个班级的平均成绩而不能获悉每个学生的具体成绩,此时需要考虑将个性化粒度从个人放宽至班级、专业或学院等级别。为了能够提高本文所提出的个性化答疑模型在不同粒度下的适应性,可以动态调整学生背景识别任务所设置的具体问题来实现。例如,如果问题设置为“哪个回答更有助于识别出该学生来自汉语言文学专业”,那么最终训练出的模型倾向于实现专业粒度的个性化答疑,而如果将问题设置为“哪个回答更有助于识别出该学生来自文法学院”,由于该问题相对来说更加宽松,最终训练出的模型倾向于实现学院粒度的个性化答疑。

2) 训练奖励函数。在获得数据集D后,可以用其来训练奖励模型R。在训练奖励模型的过程中,需要最小化如下的排序损失函数:

L=i=1Ajimax0,1-Rq,ai-Rq,aj

其中,Rq,aiRq,aj分别表示奖励模型在给定问题q的状态下对候选答案aiaj的奖励值,A表示候选答案集合A中的元素个数。

3) 执行强化学习。在训练好奖励函数后,使用基于策略优化的强化学习算法对LLM进行个性化调优,目标是最大化生成回答的奖励值。具体而言,本文采用近端策略优化(Proximal Policy Optimization, PPO)算法,它是一种能够在保证训练稳定性的同时实现高效策略更新的强化学习方法。算法步骤如下:

步骤1 初始化策略模型和奖励模型。初始化未经过强化学习优化的策略模型(LLM)以及前两步训练得到的奖励模型。奖励模型根据“学生背景识别”任务结果对回答进行评分。

步骤2 采样生成回答。对每个扩展后的问题qi'​,策略模型πθ​基于当前策略生成多个回答aik(通过多次采样实现,k为回答编号)。这些回答将作为奖励计算和策略优化的输入。

步骤3 计算奖励值。使用奖励模型评估每个回答的奖励值Rai|qi'。奖励值依据回答在“学生背景识别”任务中的表现确定,具体来说,假设识别任务结果的样本形式为qi',aij,aik,lij,其中,lij0,1表示奖励模型对回答aij的偏好关系,值为1则表示aij优于aik。则奖励值通过以下公式计算:

Raijqi'=kjIlij=1

其中,I为指示函数,表示奖励值累计所有回答对中被认为优于其他回答的次数。

步骤4 更新策略模型。使用PPO算法优化策略模型。首先,计算当前策略πθ(aqi')和旧策略πθold (aqi')的概率比值:

rt=πθa|qi'πθold a|qi'

然后,定义裁剪目标函数:

LCLIPθ=EtminrtA^t,cliprt,1-ϵ,1+ϵA^t

其中,A^t为标准化的优势函数,表示当前回答相对于其他回答的奖励值差异,ϵ为裁剪参数。通过最大化目标函数优化策略参数θ

步骤5 策略评估与迭代。在每轮优化后,通过采样新的问题集和回答集,重新计算奖励值并评估策略性能。如果奖励值收敛或达到预设条件,则停止优化;否则,继续迭代,直至策略模型能够生成高度个性化的回答。

通过上述过程,强化学习调整后的策略模型能够更好地捕捉学生的个性化需求,生成高质量的个性化回答,增强大语言模型在个性化教学中的实用性。

2.4 答案生成

在完成查询扩展和强化学习优化后,本文方法采用检索增强生成框架生成最终的个性化回答,以有效应对大语言模型在生成过程中可能出现的“幻觉”问题,确保回答的准确性和可靠性。

具体而言,答案生成主要包括以下三个步骤:

步骤1 构建教学知识库。教学知识库是实现检索增强生成的关键组成部分,用于存储与课程相关的高质量参考资料。本文通过对电子教材、教学课件、课程大纲、教学案例以及补充参考文献等资源进行文本提取和语义分块,将其构建为结构化知识库。这些文本块通过语义索引方法预先处理,以支持高效检索和动态调用。

步骤2 问题匹配与检索增强。在学生提出问题后,经过查询扩展模块处理的个性化提问被输入到检索模块中。检索模块利用向量语义匹配技术,计算扩展提问与知识库中各文本块的语义相似度,并选取语义相关度最高的前k个文本块作为参考资料。这些参考资料能够为模型提供丰富的背景信息,减少因信息不足导致的“幻觉”问题。

步骤3 最终答案生成。在获得参考资料后,本文利用强化学习优化的大语言模型(经过2.3节的训练)生成最终答案。生成过程中,模型基于扩展后的提问和检索到的参考资料进行多轮语义推理和语言生成,确保生成答案的逻辑性、个性化和准确性。

通过检索增强生成框架,本文的方法能够在动态提取外部知识的基础上生成高质量的个性化答案,有效弥补大语言模型单纯依赖内置知识生成答案的局限性。

3  实验部分

3.1 实验设置

3.1.1 数据集

本文选用清华大学于2021年公开的MOOCCubeX数据集进行实验。该数据集收集了国内最大慕课平台之一学堂在线(https://www.xuetangx.com)的课程资源与学生行为数据,并进行了细粒度的数据治理和标注,一共包含333万名学生和4 216门课程的信息以及2.96亿条行为数据,基本情况如表2所示。

由于MOOCCubeX数据集规模庞大,本文从中随机选择了500名学生的约4万条学习数据开展实验,并按照80%/10%/10%的比例划分训练集/验证集/测试集。此外,在原有数据的基础上,本文额外补充了两类数据,一类是学生的兴趣爱好和学习风格数据,具体地,由LLM为每个学生随机生成0/1/2/3个兴趣爱好,学习风格则根据表1描述为学生随机分配理论型、实用型、反思型、行动型以及“未知”中的一种;另一类补充数据则是针对学生的做题记录,基于习题难度和分值等因子加权计算出的学生课程成绩以及每门课程的学生平均成绩。

3.1.2 评价指标

为系统评估本文方法在个性化答疑任务中的综合性能,我们从生成内容的个性化程度和准确率两个方面构建了实验评价体系。

1) 针对个性化程度的评价指标

为了衡量模型生成内容的个性化程度,我们采用以下两类策略对其进行评价。

一是LLM-as-a-Judge,该方法使用LLM作为评估工具[27-28],减少了人工评估的成本和主观性,能够对大批量的生成内容进行快速客观的打分。因此,本文基于LLM-as-a-Judge策略并结合个性化答疑的4个维度设计了对应的评价指标,如表3所示。

在实际评测过程中,本文选用目前综合性能领先的DeepSeek-R1(671B)模型评估其他LLM在个性化答疑任务的表现,并取所有学生的平均值作为最终结果,如(5)式所示:

Pj=1Ni=1Nscorei,j, j1,2,3,4

其中,scorei,j表示LLM在第i个学生第j个指标上的得分,N表示学生总数。

二是学生背景识别任务得分(Student Background Identification Task Score,SBIT Score)。本文在2.3节中提出的学生背景识别任务可以从侧面反映出LLM回答的个性化程度,因此将该任务得分即SBIT Score纳入评价体系。具体地,首先随机从学生的背景信息中抽取一个特征(如专业为水利工程),然后由DeepSeek-R1针对该特征构造出一个单项选择题(例如A 计算机;B 水利工程;C 法学),由LLM根据原始提问和个性化答案从中选择最符合答案描述的选项,最后通过计算所有样本的平均正确率作为该任务的得分。

2) 针对准确性的评价指标

我们从上述500名学生形成的实验数据集中提取了870道客观题,包括541道单项选择题与329道多项选择题。通过统计各方法的回答正确率Accuracy评价其准确性,如(6)式所示:

Accuracy=CM

其中,M表示题目总数量,C表示模型回答正确的题目数量。对于多项选择题,需与标准答案完全一致才计为正确。

3.1.3 基线方法

为了比较本文方法和其他个性化大语言模型生成方法的性能,本文使用Qwen2.5-72B-Instruct实现所提出的方法,并选取1.2节提到的EduChat和GPT-4o、Llama 3.3 70B、Qwen2.5-72B-Instruct等LLM作为基准,结合指令工程(Prompt Engineering)和少样本学习(Few-Shot Learning)方法设计了10种基线方法,如表4所示。

3.1.4 实验设置

本文基线方法所使用到的LLM的max_tokens统一设置为4 096,temperature设置为0.6,top-p(控制生成结果意外性)设置为0.7,top-k(控制生成结果的多样性)设置为50,frequency_penalty设置为0。

3.2 实验结果与分析

3.2.1 整体实验分析

我们使用3.1.2节提到的3类评价指标,对不同方法的性能进行了全面评估,结果如表5所示。其中,LLM-as-a-Judge涉及的4个指标数值均进行了归一化处理。

表5可以看出,本文方法(Ours)在所有指标上的表现均显著优于所有基线方法,相较于次优方法P1P2P3P4、SBIT Score和准确率提升值分别达0.210 0、0.156 0、0.222 0、0.168 0、0.205 3和0.086 1,说明了结合查询扩展与强化学习对于深度挖掘和对齐学生个性化需求的优势。进一步地,采用指令工程(-P)和少样本学习(-PF)的LLM相较于原始模型在个性化指标上有明显提升,表明在提示中加入调优后的指令以及回答样例能够一定程度引导个性化生成,但是距离本文方法的性能还有明显差距,证明在指令中显式地注入个性化信息还不足以最大化LLM的个性化能力。另外,EduChat方法虽然聚焦于个性化问答,但是在P1P2P3和SBITScore上的表现普遍逊于指令增强的GPT-4o或Qwen2.5模型,仅在P4即兴趣导向匹配度上取得了一定优势,这可能是由于EduChat的个性化策略主要侧重于情感支持,更加贴合学生的兴趣导向而非其他维度。

在回答准确性方面,本文方法(Ours)在Accuracy指标上的表现同样优于所有基线方法。值得注意的是,EduChat在此项指标上进步明显,达到了0.732 3,超过了其余的基线模型。这表明EduChat采用的网络检索机制有利于减少LLM幻觉,能够在一定程度上提高回答的准确率,但仍然低于本文方法的0.818 4,这主要是因为本文所采用的教学知识库的质量和针对性优于网络资源,更适合回答教育领域的问题。

进一步分析可知,相较于知识背景匹配度P1与学习进度匹配度P3,除EduChat外的各类方法在学习风格匹配度P2及兴趣导向匹配度P4上的表现普遍较弱。究其原因,可能在于部分样本中存在学习风格或兴趣爱好信息缺失,从而限制了模型在相关个性化维度上的建模能力与判别精度。

此外,从表5可以看出,在使用指令工程或少样本学习的条件下,GPT-4o和Qwen2.5-72B-Instruct两个LLM在各项指标中均明显优于Llama 3.3 70B,说明GPT-4o和Qwen2.5-72B-Instruct的性能尤其是对指令的理解和遵循能力均强于Llama 3.3 70B。

3.2.2 消融实验分析

为验证本文方法中查询扩展、强化学习和检索增强生成三个核心模块的贡献,我们设计了以下消融实验对照组:

1) Ours-w/o QE:仅移除查询扩展模块,根据原始提问生成回答。

2) Ours-w/o RL:仅移除强化学习模块,即不改变LLM参数。

3) Ours-w/o QE&RL:同时移除查询扩展和强化学习模块,验证两者的叠加效应。

4) Ours-w/o RAG:仅移除检索增强生成模块,依赖LLM内部知识生成回答。

消融实验结果如表6所示。可以看出,在移除查询扩展模块(Ours-w/o QE)后,模型的个性化指标显著下降,只略高于原始的Qwen2.5-72B-Instruct,表明查询扩展模块通过动态融入学生背景与课程信息,为个性化回答提供了关键支持。再考虑到强化学习模块依托于查询扩展模型所输入的个性化信息,因此移除了查询扩展模块后模型的个性化性能必然会受到极大影响。移除强化学习模块(Ours-w/o RL)后,模型的个性化指标平均下降约 0.121 5,说明该模块通过学生背景识别任务的反馈优化,显著提升了模型对齐个性化需求的能力。进一步移除查询扩展与强化学习模块(Ours-w/o QE&RL)后,个性化指标进一步下降至接近原始的Qwen2.5-72B-Instruct水平,验证了二者的协同效应。值得注意的是,上述三种基线方法的准确性指标均未显著变化,表明它们主要作用于个性化适配性能。

而在移除检索增强生成模块(Ours-w/o RAG)后,个性化指标未显著变化,但准确性下降0.186 2,说明该模块通过动态检索外部知识库,有效缓解了LLM的“幻觉”问题,但其对个性化适配的直接影响有限。

完整方法(Ours)在个性化指标和准确性上均达到最优平衡,验证了各模块在提升个性化答疑质量中的必要性及互补性。其中,查询扩展与强化学习模块协同作用,实现了对学生个性化信息的有效建模与利用,有助于激发学生的学习积极性;检索增强生成模块则通过引入外部知识减少了LLM的幻觉,提高了回答的准确性,对于保障教育语境下的信息可信度和知识规范性具有重要意义。

3.3 案例分析

为验证本文方法在真实教学场景中的有效性,本节从MOOCCubeX数据集中选取两个典型问题进行案例分析,分别如表7表8所示。

表7可以看出,针对学生A的理论型学习风格与扎实的学习基础,本文方法生成的回答A聚焦于条件独立性假设的形式化定义,并详细阐释其与贝叶斯定理、最大似然估计的理论关联,符合高阶学习者对严谨数学推导的需求。而针对学生B的实用型学习风格、跨学科背景以及兴趣爱好,回答B以足球运动员的位置判断为例,将特征独立性假设具象化为“速度、力量、身高的独立评估”,通过生活化类比降低理解门槛,同时结合其兴趣领域增强学习动机。

而从表8可以看出,GPT-4o-PF依赖内置知识生成回答,与课程内容存在偏差。而本文方法通过检索增强生成模块,动态定位课程知识库中定义的四大风格,确保回答与教学要求严格一致。此外,回答也结合学生的实用型学习风格补充了具体案例。

4  结 语

本研究提出了一种基于查询扩展和强化学习的大语言模型个性化答疑方法,以解决现有个性化答疑中个性化信息挖掘不足和回答生成质量欠佳的问题。通过教学图谱的动态查询扩展、基于学生背景识别任务的强化学习优化,以及检索增强生成机制的引入,本方法显著提升了生成回答的个性化程度和准确性。

未来研究将进一步优化教学图谱的构建和扩展方法,探索多粒度和多模态个性化信息的整合策略,并提升模型的实际应用效率与适配性,从而为大语言模型在个性化教育中的广泛应用提供更有力的支持。

参考文献

[1]

戴岭, 赵晓伟, 祝智庭. 智慧问学:基于ChatGPT的对话式学习新模式[J]. 开放教育研究202329(6): 42-51, 111. DOI:10.13966/j.cnki.kfjyyj.2023.06.005 .

[2]

DAI LZHAO X WZHU Z T. A new inquiry learning: Conversational learning with ChatGPT[J]. Open Education Research202329(6): 42-51, 111. DOI:10.13966/j.cnki.kfjyyj.2023.06.005(Ch ).

[3]

吴兰岸, 闫寒冰, 黄发良, . 大型语言模型在高等教育中的应用分析与现实挑战[J]. 现代教育技术202333(8): 29-37. DOI:10.3969/j.issn.1009-8097.2023.08.004 .

[4]

WU L AYAN H BHUANG F Let al. The application analysis and realistic challenge of large language models in higher education[J]. Modern Educational Technology202333(8): 29-37. DOI:10.3969/j.issn.1009-8097.2023.08.004(Ch ).

[5]

HUANG LYU W JMA W Tet al. A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions[J]. ACM Transactions on Information Systems202543(2): 1-55. DOI:10.1145/3703155 .

[6]

刘泽垣, 王鹏江, 宋晓斌, . 大语言模型的幻觉问题研究综述[J]. 软件学报202536(3): 1152-1185. DOI: 10.13328/j.cnki.jos.007242 .

[7]

LIU Z YWANG P JSONG X Bet al. Survey on hallucinations in large language models[J]. Journal of Software202536(3): 1152-1185. DOI: 10.13328/j.cnki.jos.007242(Ch ).

[8]

WEI JBOSMA MZHAO V Yet al. Finetuned language models are zero-shot learners[EB/OL]. 2021: 2109.01652.

[9]

OUYANG LWU JJIANG Xet al. Training language models to follow instructions with human feedback[J]. Advances in Neural Information Processing Systems202235: 27730-27744. DOI: 10.5555/3600270.3602281 .

[10]

LEWIS PPEREZ EPIKTUS Aet al. Retrieval-augmented generation for knowledge-intensive NLP tasks[J]. Advances in Neural Information Processing Systems202033: 9459-9474. DOI: 10.5555/3495724.3496517 .

[11]

KOA K J LMA Y S, NG R, et al. Learning to generate explainable stock predictions using self-reflective large language models[C]//Proceedings of the ACM Web Conference 2024. Singapore:ACM, 2024: 4304-4315. DOI:10.1145/3589334.3645611 .

[12]

CHEN JLIU ZHUANG Xet al. When large language models meet personalization: Perspectives of challenges and opportunities[J]. World Wide Web202427(4): 42. DOI:10.1007/s11280-024-01276-1 .

[13]

WANG H RWANG RMI Fet al. Cue-CoT: Chain-of-thought prompting for responding to In-depth dialogue questions with LLMs[EB/OL].[2025-04-11]. DOI: 10.18653/v1/2023.findings-emnlp.806 .

[14]

LIU Q JCHEN NSAKAI Tet al. ONCE: Boosting content-based recommendation with both open- and closed-source large language models[C]//Proceedings of the 17th ACM International Conference on Web Search and Data Mining. New York: ACM, 2024: 10.1145/3616855.3635845. DOI:10.1145/3616855.3635845 .

[15]

LIU XJI K XFU Y Cet al. P-tuning: Prompt tuning can be comparable to fine-tuning across scales and tasks[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers). Stroudsburg: Association for Computational Linguistics, 2022: 61-68. DOI:10.18653/v1/2022.acl-short.8 .

[16]

LI X YZHOU R YLIPTON Z Cet al. Personalized language modeling from personalized human feedback[EB/OL]. 2024: 2402.05133.

[17]

ABDELGHANI RWANG Y HYUAN X Det al. GPT-3-driven pedagogical agents to train children’s curious question-asking skills[J]. International Journal of Artificial Intelligence in Education202434(2): 483-518. DOI:10.1007/s40593-023-00340-7 .

[18]

TSAI M LONG C WCHEN C L. Exploring the use of large language models(LLMs) in chemical engineering education: Building core course problem models with Chat-GPT[J]. Education for Chemical Engineers202344: 71-95. DOI:10.1016/j.ece.2023.05.001 .

[19]

KASNECI ESESSLER KKÜCHEMANN Set al. ChatGPT for good? On opportunities and challenges of large language models for education[J]. Learning and Individual Differences2023103: 102274. DOI:10.1016/j.lindif.2023.102274 .

[20]

刘佳, 孙新, 张宇晴. 知识图谱与大语言模型协同的教育资源内容审查[J]. 华东师范大学学报(自然科学版)2024(5): 57-69. DOI: 10.3969/j.issn.1000-5641.2024.05.006 .

[21]

LIU JSUN XZHANG Y Q. Educational resource content review method based on knowledge graph and large language model collaboration[J]. Journal of East China Normal University (Natural Science)2024(5): 57-69. DOI: 10.3969/j.issn.1000-5641.2024.05.006(Ch ).

[22]

TABARSI B. Developing LLM-powered trustworthy agents for personalized learning support[J]. Proceedings of the AAAI Conference on Artificial Intelligence202539(28): 29301-29302. DOI:10.1609/aaai.v39i28.35228 .

[23]

GAN W SQI Z LWU J Yet al. Large language models in education: Vision and opportunities[C]//2023 IEEE International Conference on Big Data (BigData). New York: IEEE Press, 2023: 4776-4785. DOI:10.1109/BigData59044.2023.10386291 .

[24]

PARK MKIM SLEE Set al. Empowering personalized learning through a conversation-based tutoring system with student modeling[EB/OL]. [2024-12-10]. DOI: 10.1145/3613905.3651122 .

[25]

DAN Y HLEI Z KGU Y Yet al. EduChat: A large-scale language model-based chatbot system for intelligent education[EB/OL]. 2023: 2308.02773. DOI: 10.1007/978-981-96-1809-5_22 .

[26]

张学飞, 张丽萍, 闫盛, . 知识图谱与大语言模型协同的个性化学习推荐[J]. 计算机应用202545(3):773-784. DOI:10.11772/j.issn.1001-9081.2024070971 .

[27]

ZHANG X FZHANG L PYAN Set al. Personalized learning recommendation in collaboration of knowledge graph and large language model[J]. Journal of Computer Applications202545(3):773-784. DOI:10.11772/j.issn.1001-9081.2024070971(Ch ).

[28]

POSCENTE K. Book review-The three dimensions of learning: Contemporary learning theory in the tension field between the cognitive, the emotional and the social [J]. The International Review of Research in Open and Distributed Learning20067(1): 1-3. DOI:10.19173/irrodl.v7i1.305 .

[29]

WALKINGTON CBERNACKI M L. Motivating students by “personalizing” learning around individual interests: A consideration of theory, design, and implementation issues[EB/OL].[2025-05-04]. DOI:10.1108/S0749-742320140000018004 .

[30]

TETZLAFF LSCHMIEDEK FBROD G. Developing personalized education: A dynamic framework[J]. Educational Psychology Review202133(3): 863-882. DOI:10.1007/s10648-020-09570-w .

[31]

HONEY PMUMFORD A. The Manual of Learning Styles[M]. 3rd edition. Maidenhead: Peter Honey Publications, 1992.

[32]

ZHENG L MCHIANG W LSHENG Yet al. Judging LLM-as-a-judge with MT-Bench and Chatbot Arena[EB/OL]. [2024-12-21].

[33]

KAHNG MTENNEY IPUSHKARNA Met al. LLM comparator: Interactive analysis of side-by-side evaluation of large language models[J]. IEEE Transactions on Visualization and Computer Graphics202531(1): 503-513. DOI:10.1109/TVCG.2024.3456354 .

AI Summary AI Mindmap
PDF (892KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/