随着大型语言模型(large language models,LLM)近年来在自然语言处理(natural language processing,NLP)领域的突破和发展
[1-2],其在医学领域的实践愈加广泛,在医学教育中的应用潜力也日益凸显,比如帮助医学生学习、解答执业医师考试试题等
[3]。口腔执业医师考试是国内口腔行业的资格准入考试
[4],近2年的平均通过率为50%,以百分制计分,平均分约为60分
[5],表明仍需投入更多教育资源来帮助考生通过考试。
在多个英语语境的医学类考试的答题和解析场景中,LLM已经有良好的表现
[6-7],许多医学生已经开始将LLM应用于考前学习。在非英语医学的考试中,LLM的表现不一
[8-10],经常出现输出不可靠或不准确的“幻觉”问题
[11]。在口腔医学领域,韩彩玲等
[12]通过比较不同LLM对口腔诊疗问题、口腔健康咨询、口腔执业医师考试试题的回答,评估了其在辅助诊疗和健康咨询中的应用表现,结果表明,LLM具备辅助获取医疗信息的应用可行性,但其输出仍存在一定的错误风险,在实际应用中需审慎判断。
本研究聚焦于口腔执业医师考前学习场景,将试题按学科和题型分类,比较不同LLM的应用表现。本研究设计了选择正确答案、答案解析、对抗性测试共3个评估场景,选择DeepSeek-R1、通义千问2.5-MAX、豆包1.5 Pro、星火Spark-X1、文心一言4.0 Turbo、GPT-4o和华西口腔智联大模型,作为代表性的LLM,采用准确率、净正确率和教学效果评分作为模型表现的评估指标。本研究旨在通过评估分析不同LLM在口腔执业医师考前学习中的表现,为LLM将来在口腔医学教育领域的深入应用提供理论支持和参考。
1 材料和方法
1.1 不同LLM在口腔执业医师考前学习各场景中的表现比较
根据口腔执业医师考试的题型和学科分布,本研究收集了200道历年试题,分为4个学科:口腔颌面外科、口腔全科、口腔修复学和基础医学,每个学科包含50道试题。试题的类型包含单项选择题(A1题型,
n=80)、病例摘要型选择题(A2题型,
n=80)、病例组型/串型选择题(A3/A4题型,
n=20)和标准配伍题(B1题型,
n=20),题型和要求如
表1所示。
在1名具有20年教学经验的资深口腔医学专家的指导下,笔者对每个试题的题干和选项都进行了细致修改,比如改写题干的语法、牙位、逻辑表述、选项顺序等,防止LLM的训练语料库包含了原试题,每个修改都经过2名临床经验在10年以上的口腔医学专家的验证。
根据LLM评估平台FlagEval
[13]公布的榜单,笔者选择了其中性能表现良好的模型,以中文语料库为核心预训练的模型包括DeepSeek-R1
[14]、通义千问2.5-MAX
[15]、豆包1.5 Pro
[16]、星火Spark-X1
[17]、文心一言4.0 Turbo
[18],以英文语料库为核心预训练的GPT-4o(2025-03-27版本)
[19],另外还纳入了华西口腔智联大模型。华西口腔智联大模型融入了口腔医学领域知识,由于资源限制,尚未全面向公众开放,其团队正在逐步实施开放计划
[20-21]。DeepSeek-R1、豆包1.5 Pro、星火Spark-
X1、华西口腔智联大模型具备深度思考模式,在测试时均开启深度思考以获得最佳输出表现。
LLM对话任务的参数中,常用于控制输出的有温度、Top-p、Top-k和频率惩罚。温度通过调整概率分布的平滑度,控制输出的随机性;Top-p和Top-k均通过控制候选词生成范围以调节输出的多样性,其中Top-p能根据概率分布动态调整候选集规模,相比Top-k采样避免了固定截断带来的不连贯问题
[22],因此本文选择Top-p作为主要采样参数;频率惩罚用于防止词汇反复高频出现。在各场景的测试中,LLM的参数设置如
表2所示,温度和Top-p均设为0.5,在保证对话输出质量的同时,也能兼顾输出的稳定性
[23],为了防止频率惩罚对结果产生的影响,频率惩罚均设置为0,不对词频做额外干预。
本研究在下述3个场景中输入每道试题对每个模型进行测试。
1.1.1 选择正确答案
给出题目和选项,让LLM从所有选项中选择1个正确答案。测试LLM基于本身知识,输出试题正确答案的能力。
该测试场景旨在模拟考生在口腔执业医师考前学习中直接向LLM提问,希望LLM给出正确答案的情境。通过评估LLM在无外部提示下的答题准确性,可以反映其口腔医学知识储备水平及作为学习辅助工具的可靠性。
示例提示词:已知题目{输入1},你需要根据题目要求选择正确的选项。你只需要给出你认为正确的选项即可。
1.1.2 答案解析
给出题目、选项和正确答案,让LLM对每个选项进行解析,说明正确答案的选择理由。测试LLM对题目进行正确解析的能力,以及输出解析的可理解性和教学效果。
该测试场景旨在模拟考生在考前学习时,详细对每个选项进行解析,以分析题目和考点的情境。通过对LLM解析选项的正确率和解析的教学效果进行评分,可评估其提供正确的题目解释、考点解析的能力和教学价值。
示例提示词:已知题目{输入1},其标准答案是{输入2},你需要根据问题和正确的标准答案,解析每个选项,并解释选项正确或错误的理由。
1.1.3 对抗性测试
给出题目、选项和错误答案的提示,要求LLM在此干扰信息下重新作答并给出解析,以测试其在错误答案干扰下的纠错能力。
该测试场景旨在模拟考生在考前学习中向LLM询问时,可能因题目来源不准确或操作失误而提供错误答案的情况。通过观察LLM是否能够识别并纠正错误答案,并最终输出正确答案及合理解析,可评估不同模型在考前学习场景下的鲁棒性与安全性
[24]。
示例提示词:已知题目{输入1},其标准答案是{输入2},你需要根据问题和正确的标准答案,解析每个选项,并解释选项正确或错误的理由。
所有的测试通过Python(版本3.10)调用各平台接口批量完成。测试结果通过1.2中的评估方法进行评估。
1.2 评估方法
本研究的评估指标为准确率、净正确率和教学效果评分。
1.2.1 准确率
准确率为正确回答的数量与总试题数量的比值,用于评估LLM准确响应问题,提供正确答案的能力,公式如下:,公式中C表示正确回答的试题数,T表示总试题数。
1.2.2 净正确率
净正确率为正确解析选项数与错误解析选项数的差值除以选项的总数,用于评估LLM对答案进行正确解析的能力。公式如下:,公式中Ce 表示模型正确解析的选项数量,Ie 表示模型错误解析的选项数量,O表示选项的总数。
由上述2名口腔医学专家采用盲法独立判断选项的解析是否正确,若两者意见不一致,则由具有20年教学经验的资深口腔医学专家进行评判。
1.2.3 教学效果评分
教学效果评分基于5点李克特量表(1分表示强烈不同意,5分表示强烈同意),该量表包括4个不同的项目:相关性、简洁性、实用性和清晰度。由上述2名口腔医学专家采用盲法进行评估,最终得分为2名专家评分的平均值。如果2人评分差异过大,则由具备20年教学经验的资深口腔医学专家进行评判。
教学效果评分体现了专家从教学视角对LLM输出在教学价值方面的综合判断,可有效评估LLM的回答能否有效辅助考生理解与掌握知识。
1.2.4 统计分析
所有分析均使用SPSS(版本26.0)和Python(版本3.10)进行。所有场景均重复进行了5次独立测试,结果为5次测试的平均值。准确率和净正确率以百分比表示,记录标准差和95%置信区间(confidence interval,CI),教学效果评分以四分位数间距(interquartile range,IQR)和中位数表示。使用Cohen κ系数评估评分者之间的一致性,分类标准如下:0.01~0.20表示无或轻微一致性;0.21~0.40表示一般一致性;0.41~0.60表示中等一致性;0.61~0.80表示高一致性;0.81~1.00表示几乎完全一致。不同LLM以及各亚组的准确率、净正确率进行Wald χ2 检验,各组的中位数进行Kruskal-Wallis检验,检验结果是否存在统计学差异。进行多重比较时,使用了Bonferroni校正。双尾检验P<0.05被认为具有统计学差异。
2 结果
2.1 LLM答题的准确率
按照学科和题型分类统计的LLM答题的准确率结果如
图2所示,图中每个学科或题型对应准确率坐标轴,将各模型的准确率用直线连接以对比其表现,红色虚线代表口腔执业医师考试的及格线。总体来看,所有LLM的总准确率为63%~84%,都达到了及格线,经Wald
χ2 检验,各组间准确率的差异有统计学意义(
χ2 =37.55,
P<0.001)。华西口腔智联大模型的准确率最高(84%),文心一言4.0 Turbo的准确率最低(63%)。
LLM回答不同学科试题的准确率见
表3、
图3。华西口腔智联大模型在口腔颌面外科(83%)、口腔全科(85%)、口腔修复学(89%)中准确率最高,豆包1.5 Pro和星火Spark-X1在基础医学中准确率最高(84%)。
LLM回答不同题型试题的准确率见
表4、
图3。华西口腔智联大模型在单项选择题(80%)、病例摘要型选择题(91%)、病例组型/串型选择题(88%)中准确率最高;DeepSeek-R1在标准配伍题中准确率最高(76%)。
2.2 LLM解析试题的净正确率
LLM解析不同学科和题型试题的净正确率如
图4所示。净正确率分布在73%~92%之间,Wald
χ2 检验表明,各组之间的差异具有统计学意义(
χ2 =39.71,
P<0.001)。总体来看,华西口腔智联大模型的净正确率最高(92%),文心一言4.0 Turbo的净正确率最低(73%)。对于不同的学科,华西口腔智联大模型在口腔颌面外科(96%)、口腔全科(92%)、口腔修复学(91%)中准确率最高;星火Spark-X1和DeepSeek-R1在基础医学中净正确率最高(96%)。对于不同的题型,华西口腔智联大模型在单项选择题(93%)、病例组型/串型选择题(88%)、标准配伍题(81%)中取得了最高的准确率;DeepSeek-R1在病例摘要型选择题中取得了最高的准确率(97%)。
2.3 LLM解析试题的教学效果评分
LLM解析试题的教学效果在相关性、简洁性、实用性和清晰度方面的评分结果如
图5所示。Cohen
κ系数结果表示评分者的评分之间具有高一致性(
κ=0.68)。Kruskal-Wallis检验显示,各组之间的得分差异具有统计学意义(
H=63.26,
P<0.001)。相关性方面,华西口腔智联大模型取得了最高的分数(中位数3.8,IQR 3.1~4.3)。简洁性方面,GPT-4o得分最高(中位数3.6,IQR 3.1~4.2)。实用性方面,华西口腔智联大模型获得最高得分(中位数3.8,IQR 2.1~4.4),DeepSeek-R1与之表现接近,得分整体更为稳定(中位数3.1,IQR 2.3~4.2)。清晰度方面,华西口腔智联大模型取得了最高得分(中位数3.4,IQR 2.5~4.6)。
2.4 对抗性测试中准确性和净正确率的变化
当受到错误答案提示的影响,LLM的输出会发生显著变化,各LLM的对抗性测试结果详情如
图6所示。该图表示了在对抗性测试前后,LLM在回答和解析试题场景中,准确率和净正确率的变化,其中箭头上方的数值是由于对抗性测试而导致的性能下降幅度,右边的
P值表示Wald
χ2 检验的结果,用于评估观察到的下降的统计学意义,双尾检验
P<0.05被认为差异具有统计学意义。
在对抗性测试场景中,各LLM与选择正确答案场景相比,准确率下降了10%~25%;其中豆包1.5 Pro下降幅度最大(25%,P<0.001),华西口腔智联大模型下降幅度最小(10%,P=0.02),差异具有统计学意义。与答案解析场景相比,对抗性测试中净正确率变化范围为17%~35%,其中通义千问2.5-Max下降幅度最大(35%,P<0.001),Deep-Seek-R1的净正确率下降最少(17%,P<
0.01) 。
3 讨论
本研究比较了代表性的LLM在口腔执业医师考试的各场景中答题和解析的表现。所选的LLM都成功达到了口腔执业医师考试的及格线(60%),其中华西口腔智联大模型取得了最高的准确率(84%)和净正确率(92%)。所有的LLM都表现出了一定的教学有效性,其中华西口腔智联大模型在相关性、实用性和清晰度方面得分最高,DeepSeek-R1在实用性方面表现与之接近,且得分更稳定,GPT-4o则在简洁性方面分数最高。在对抗性测试中,所有LLM的性能都有所下降,华西口腔智联大模型的准确率下降幅度最小,DeepSeek-R1的净正确率下降幅度最小。
在其他医学考试中,LLM的准确率表现参差不齐,如西班牙医学住院医师考试(86.81%)
[25]、印度国家资格暨入学考试(42.9%)
[26]、全国临床医学硕士研究生招生考试(51%)
[27],但都有接近或超过人类平均表现水平的趋势,这与本研究中的表现一致。此外,本研究显示针对口腔医学进行知识增强的LLM(如华西口腔智联大模型)表现优于中文语料库为核心预训练的LLM(如DeepSeek-R1),而多数以中文语料库为核心预训练的LLM准确率都超过了以英文语料库为核心预训练的GPT-4o,表明GPT-4o虽然是一个功能强大的模型,但在需要对中文及其文化背景进行深入理解的任务中,以中文语料库为核心预训练的LLM表现更加出色
[28],因此,LLM的选择应以具体应用场景和语言需求为导向。
在选择正确答案的场景中,LLM在不同学科的准确率结果差异不明显,说明试题的难度在不同学科间的分布较为平均。而在不同题型分类比较时,可以明显看出LLM在不同题型之间的表现有较大差异,与基础知识相关的单项选择题和病例摘要型选择题难度最小,在回答病例组型/串型选择题和标准配伍题时,LLM的准确度显著下降。因此有必要将这两类题型的试题输入LLM进行针对性学习,以提高对该类题型的解答能力
[29]。
在答案解析的场景中,LLM根据正确答案,对每个选项进行解析,解析的净正确率是对试题中所有选项的解析中,正确解析所占的比例。净正确率为73%~92%,其中华西口腔智联大模型的净正确率最高,可能是由于其在预训练模型的基础上,用口腔医学领域的数据进行了微调
[20-21],增强了口腔医学知识方面的答题和解析能力。
在对抗性测试的场景中,华西口腔智联大模型在对抗性测试中准确率下降最小,表明其有足够的口腔领域知识以不被错误的提示所干扰。DeepSeek-R1的净正确率下降幅度最小,可能由于其采用了强化学习训练方法,能够生成长链思考
[30],对错误或干扰性输入具有较强的鲁棒性。
目前已有许多评价方法用于评估LLM的输出质量,其中大多数是基于李克特量表构建的,包括中文综合医学基准
[24]、LLM评分框架
[31]。教学效果评分也是基于李克特量表的指标,旨在评估LLM输出结果的可理解性和教学价值。评估的结果显示在相关性、实用性和清晰度方面,大多数LLM的中位数不小于2.5分,表明当前主流LLM的输出通常能够达到一定的教学效果
[32],然而在简洁性方面,以DeepSeek-R1为代表的推理模型需要进一步优化以输出更加简洁的答案解析。
LLM的幻觉是指进行无效输出,或编造偏离原始材料的内容
[33-34]。本研究中观察到3种类型的幻觉。第1种是在选择正确答案的场景中,LLM输出了错误的答案。第2种是在答案解析的场景中,LLM的解析不正确,给出了错误的知识点。第3种是在对抗性测试的场景中,当受到错误选项的干扰时,LLM输出了错误的答案并给出了错误的解析。另外本研究还观察到,由于LLM本身具有的不确定性,其幻觉可能在任意情况出现,甚至在相同条件下的不同对话中都可能随机出现。遗憾的是,由于缺乏持续的监督学习,LLM的幻觉问题在当前发展阶段仍然难以避免
[11]。
在某些特定的NLP任务中,传统的NLP模型[如双向编码器表示模型(bidirectional encoder representations from transformers,BERT)]仍具有明显的优势,例如情感分析
[35]、命名实体识别
[36]和文本分类
[37]等。然而,这些NLP模型在回答问题和多轮对话的任务表现出明显的局限性,尤其是需要进行高级推理和深刻理解专业领域知识的场景
[38]。随着LLM领域的快速进步,能够整合各类包括医学在内的专业知识,综合上下文进行逻辑推理,快速精确地完成上述任务
[39],这使得LLM在回答和解析问题的任务中优于传统的NLP模型,因此本文选取代表性的生成式LLM进行比较研究。
本研究仍然存在一些局限性。第一,由于时间和资源的限制,只选择了当前具有代表性的LLM进行对比,无法评估所有LLM在口腔执业医师考前学习中的表现。第二,目前还没有标准的评价方法评估LLM对开放式问题的输出质量(如试题解析的教学效果),本研究采用李克特量表进行评估,最大程度地减少主观评价带来的潜在偏倚。此外,LLM产生幻觉的根本原因仍不明确,因此有必要进一步研究相关模型的可解释性。
综上所述,本文通过选择正确答案、答案解析、对抗性测试3个测试场景,以准确率、净正确率和教学效果评分为指标,评估了不同LLM在口腔医学执业医师考前学习应用中的表现,结果显示:针对口腔医学进行知识增强的LLM(如华西口腔智联大模型)表现优于以中文语料库为核心预训练的推理LLM(如DeepSeek-R1),优于以英文语料库为核心预训练的LLM(如GPT-4o);在对抗性测试中,所有模型的表现均有所下降。未来的研究可以基于评估结果,对各模型进行针对性优化,比如提高对错误答案干扰的鲁棒性、回答的简洁性等,以充分发挥LLM在口腔执业医师考试和医学教育中应用的潜力。
中国高校产学研创新基金(2024XL004)
四川省科技计划资助(2025ZNSFSC0459)
四川大学人工智能赋能创新型实践教育综合改革研究专项(2024-80)