大语言模型在无锚题等值中的应用:以阅读素养测评为例

杜君磊 ,  郑勤华 ,  宋义深

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 591 -598.

PDF (537KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 591 -598. DOI: 10.14188/j.1671-8836.2024.0088
智能测评

大语言模型在无锚题等值中的应用:以阅读素养测评为例

作者信息 +

Application of Large Language Models for Test Equating with No Common Items: A Case Study on Reading Literacy Assessment

Author information +
文章历史 +
PDF (549K)

摘要

在实际的教育测评中,针对同一能力的不同测评通常不会使用相同的题目。现有方案在实现无锚题场景下的测评分数等值时,存在依赖额外题目信息或实施成本高昂等问题。本研究提出了一种基于大语言模型的低成本且无需额外题目信息的无锚题等值方案。其主要原理是利用大语言模型在待等值测评之间构建连接组,从而实现等值。本研究以两份小学阅读理解题为例,分别选取GPT3.5、GPT4.0和讯飞星火3.5构建连接组,从提示词工程(zero-shot、one-shot和few-shot)和连接组样本数(500和1 000)两个方面对比其在等值上的成效。研究结果显示,GPT4.0 在大样本连接组的one-shot和few-shot 场景下表现良好,表明以大语言模型智能体作为无锚题连接组的设计方案是可行的。

Abstract

In practical educational assessments, different assessments targeting the same ability usually do not anchor to the same set of questions. Achieving score equating in the absence of anchor questions is currently a challenge that has not been fully overcome. This study proposes a low-cost solution for score equating without anchor questions based on large language models. The main principle is to utilize large language models to construct a linking group between assessments that need to be equated, thereby achieving equating. This study will take two sets of reading comprehension questions as examples, selecting GPT3.5, GPT4.0, and iFlytek Spark 3.5 to construct linking groups, and compare their effectiveness in equating from two aspects: prompt engineering (zero-shot, one-shot, and few-shot) and the number of samples in the linking group (500 and 1 000). The study found that GPT4.0 performs well in the one-shot and few-shot scenarios with a large linking group sample, indicating that the design scheme of using large language model agents as a linking group without anchor items is feasible.

关键词

等值 / 无锚题 / 大语言模型

Key words

test equating / no common item / large language models

引用本文

引用格式 ▾
杜君磊,郑勤华,宋义深. 大语言模型在无锚题等值中的应用:以阅读素养测评为例[J]. 武汉大学学报(理学版), 2025, 71(5): 591-598 DOI:10.14188/j.1671-8836.2024.0088

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

在大规模的教育测评中,无锚题等值一直是一个难题。无锚题等值指的是针对完全不同的测评,将其测评分数转化到同一尺度上的解决方案[1-2]。现有的解决思路主要包括基于题目信息的等值和基于等值设计的等值,等值数据收集设计(Data Collection Design of Equating)[3]是它们的重点。然而,基于这两种思路的方案在实际实施当中均存在诸多缺陷。其中,基于题目信息的等值方案中虽然可选方法众多,但要么需要提前对题目进行精心设计[24],要么需要以一个大型的题目为依托[5-6],构建成本高,且实际等值效果并不理想;基于等值设计的方案,需要组织额外的测评,这往往消耗大量的人力和物力,而当待等值的测评数较多时,该方案将缺乏准确度[7]。因此在实际的无锚题等值场景中,亟需一种成本低且操作简单的等值方案。

人工智能(AI)的发展为攻克无锚题测验难题带来了希望。图灵测试是检验人工智能能力水平的重要手段之一,其主要原理为以人为基准评估人工智能的能力。相应地,解决无锚题等值的思路在于将图灵测试的对象转向人类被试,即以人工智能为基准评估人的能力是否达到了某一水平。这一设想的前提是人工智能技术能达到一定的智能程度。近几年,GPT3.5的横空出世,生成式大语言模型引起了前所未有的关注[8-10]。大语言模型不但在自然语言处理的相关任务上表现出色(文本润色、翻译和内容总结等),也在面向人类考试诸多测评上表现良好[8,11-13]。这表明大语言模型已经具有了成为测评锚点的潜力。

为此,本研究以阅读素养为例,收集近10万小学生在两种不同试题上的表现,对大语言模型在无锚等值中的应用进行验证。本研究从等值设计的角度出发,参考Marengo连接组的设计方案[7],引入大语言模型作为连接组,通过对比GPT3.5、GPT4.0和讯飞星火3.5等大语言模型在该等值方案中的表现,分析大语言模型在无锚题等值方案中的成效和不足,为其在更广泛的等值应用上提供参考和指导。

1  相关研究

1.1 无锚等值

针对无锚题等值的情境,不同的研究者提出了不同的解决方案,大致可以分为基于题目信息(或属性的等值)[3]和基于等值设计的无锚等值[7]

基于题目信息层面的等值主要包括随机等组测验法、构造随机等组样本法、基于题目先验信息法和认知诊断法。1) 随机等组测验法[5]依托一个大型的题库,每个题目都被标注对应的基本信息,如题目难度、题目区分度、题目知识点维度等特征,并且保证该题库中题目在各个属性上的分布良好。依托完备的大型题库,无锚题的两个测验,可基于题目信息形成“平行”测验,最终完成等值。该方法的缺点是在实际的测验中未事先设计这样规格的题库,且构建一个如此大型且题目信息完备的题库成本昂贵。2) 构造随机等组样本法[6]基于样本的人口学统计变量,对无锚题待测的两组基于匹配的算法进行对照组匹配。匹配算法一般是以倾向性得分法[14]或合成预测法[3]进行匹配。当待等值的测评样本量足够时,可以认为匹配的样本消除了人口学变量上的差异。最后两组匹配好的样本近似为两个能力分布相似的被试样本,进而采用等组设计的方法完成等值。该方法的缺点是需要额外收集学生的人口学变量信息,且对人口学变量信息具有较高的匹配要求。3) 基于题目先验信息法由Mislevy等[4]提出,他们利用题目的先验信息构建逻辑回归模型,对题目参数进行估计,进而得到题目参数的先验分布;然后再采用贝叶斯估计拟合期望反应曲线得到被试的期望分数;最后通过项目反应理论实现等值。该方法具有开创性,通过充分利用题目的先验知识提升等值的精准性。但是该方法依赖题目的先验知识,且拟合参数来源于学习者答题数据,因此拟合参数的鲁棒性令人担忧。4) 基于认知诊断模型是从题目属性的层级关系出发进行等值。1983年Tatsuoka等提出了规则空间模型[15-16],近些年认知诊断模型在不同场景中得到发展[17-18]。该类模型可以通过被试的测评数据计算得到被试的认知状态或知识掌握情况。基于认证诊断模型的等值,需要预先对题目的属性及属性的层级关系进行设计,并以此为基础形成可达矩阵 RQ,随后基于 Q 设计符合模型假设的题目,并进行施测。最后基于测评的题目属性参数抽取理想被试组作为“连接组”,使用等组设计方法实现不同测评的等值。该方法在模拟数据上的等值效果较好,但依赖题目属性和层级关系,该关系的判断具有一定的主观性,连接组发生变化时会影响等值的稳定性,而且认证诊断模型的不同模型结果往往存在差异。

基于等值设计的无锚题等值方案,都存在一个类似连接组的设置。这个方案的整体思路与罗照盛[19]在解决锚题的等值问题中提出的“共同组设计”类似。与罗照盛不同的是,在无锚题等值中的连接组往往是与被试无利害关系或者低利害关系的群体。而罗照盛的方案是从被试样本中挑选一些有代表性的样本参加两个待等值测试。Segbers等[20]于2017年在儿童词汇量的测试中引入一个虚拟样本,通过锚定虚拟样本在各年龄段词汇测试中的表现,推理出德国儿童在各年龄段的词汇掌握程度的概率分布。文献[20]的无锚题等值设计本质是通过一个类人工智能构建的连接组,将不同年龄段参加不同词汇测评的儿童群体的测评连接起来。Marengo等[7]2018年提出了连接组的概念,其从连续多年的多套测试中各抽取一定比例的题目形成一个新的测评,并将该测评投放在低利害地区的样本,该测评结果作为原多年测评的锚点,以此达到等值的目的。与罗照盛[19]的“共同组设计”不同,文献[7]的连接组在低利害关系地区开展测评。其研究表明当抽取题目比例在四分之一以上时,可确保等值结果的稳定可靠。但当等值组超过四组样本时,新测评中每一组中抽取的题目平均比例将低于四分之一,等值有效性将难以保证。

由此可见,基于题目信息或题目属性的方案需要更多的辅助的信息,构建成本更高昂,不适合大规模推广。基于等值设计的无锚题等值方案,寻找一个低利害的群体组织开展测评又需要耗费大量的人力和物力。随着生成式人工智能的发展,将无利害关系的AI作为连接组将会是一个低成本的无锚题等值解决方案。

1.2 大语言模型在测评中的应用

大语言模型是一种利用深度学习算法从海量数据中学习,基于提示词生成自然语言文本的计算机程序。2022年底OpenAI发布的ChatGPT具有里程碑式的意义,其在生成文本的逻辑性和流畅性以及与上下文的关联度等方面都步入了一个新的高度,且在文本翻译、文本润色和创意写作等多个自然语言任务上的表现抢眼[8]。随着大语言模型的发展,关于大语言模型的评测不仅局限于自然语言的相关任务,还被应用于面向人类多种能力的测评。Nori等[13]将GPT3.5应用于医生执照的考试,结果显示其在部分作答上接近三年级医学生的水平。Kortemeyer等[21]的研究发现GPT3.5在物理和数学领域的考试表现低于人类平均水平。Talan等[22]针对GPT3.5在多个领域选择题上的表现均低于人类平均水平,包括法律、经济学、物理学和生物学等。2023年3月GPT4.0发布,GPT4.0相比GPT3.5在自然语言处理的多个任务上的表现更加优秀[11]。大量的研究也对GPT4.0在人类考试相关的测评中的表现进行了探究。在计算机学科考试方面,Bordt等[12]的研究发现GPT4.0在计算机学科考试方面要比GPT3.5的分数高出17%,接近人类的平均水平。Katz等[23]的研究发现,GPT3.5在律师资格考试中的平均得分仅为45.1%,而GPT4.0的平均分数高达75.7%。OpenAI针对两个模型在一系列人类的相关测评上进行了对比,结果显示GPT4.0的在几乎所有的测评上的表现均优于GPT3.5[11]。值得注意的是,在GRE的测评方面,口语测试GPT4.0达到99%的水平,而写作测试只达到了54%;在小学数学测评方面GTP4.0达到了92.0%的高分,而GPT3.5仅达到了57.1%的分数。

因此,大语言模型在面向人类多种能力的测评中均达到甚至超越了人类的平均水平。目前,大语言模型在教育考试中的应用是重要的研究方向,近期相关的研究多聚焦如何采用大语言模型生成试题[24],对其在等值场景中的接近方案几乎没有。虽然以ChatGPT为代表的大语言模型在逻辑推理等方面的能力有待提升,但是通过大语言模型在各类测评上的表现可知,其具有作为与人类能力锚点的潜力。

本研究为了验证大语言模型在无锚题等值中应用的可行性,将基于大语言模型构建不同测试之间的连接组,基于大语言模型的表现进一步采用项目反应理论法将不同评测的得分转化到同一尺度上。为了比较不同模型在此应用场景中的表现,本研究选取了几种具有代表性的大型语言模型进行对比分析,包括GPT3.5、GPT4.0和讯飞星火。

2  研究设计

2.1 研究目的

通过利用大语言模型模拟阅读素养测验,探究不同条件下大语言模型在无锚题等值上的适用性。

2.2 基于大语言模型的连接组等值设计

本研究采用Marengo等[7]提出的连接组等值设计方案。通过从不同测验中提取一定比例的题目,形成一个新的测验。通过新的测验可以在没有任何相同题的测验之间建立连接。如表1所示,人类被试组1到组5,分别参与T1至T5五个题目的测试。基于大语言模型构建的连接组CT1到T5形成的新测验。在原有的设计中,面向连接组的新测评是由每组测试中抽取至少四分之一的题目组成。在基于大语言模型的等值设计中,可以忽略题目比例的限制,将每个测评都抽取100%的题目组成新测试。

本研究采用Haebara[25]提出的项目特征曲线法进行等值计算,这是一种基于项目反应理论的方法。本次研究采用双参数逻辑回归模型,其项目反应公式如下:

Pjθ=11+exp-Dajθ-bj

其中,Pjθ代表能力水平为θ的样本答对第j个题的概率,aj表述第j个题的区分度,bj表示第j个题的难度,D为量表的系数。若两个测验(xy)之间存在相同的题k,那么等值的关系可表示为:

Pkθx,ax,bx=Pkθy,ay,by

在基于大语言模型的连接组设计中,连接组C和第i个测试之间的参数线性关系如下所示:

Pkθc,ac,bc=Pkθti,ati,bti
θti=Actiθc+Bcti
ati=acAti
bti=Actibc+Bcti

其中,θti为第i个测评中被试的能力系数,θc为连接组中大语言模型的能力系数,ActiBcti为连接组C和第i个测评之间的等值系数。atibti为第i测评的区分度系数和难度系数,acbc为大语言模型连接组的区分度系数和难度系数。不同测试之间可以通过连接组的系数连接在一起,如测试1和测评3之间被试能力的等值关系如下所示:

θti=Actiθc+Bcti
θt3=Act3θc+Bct3

由以上两式可以得到:

θt3=Act3Act1(θti-Bct1)+Bct3

2.3 基于大语言模型模拟测验

为了增加模拟测验的真实度,本研究采用两份小学阅读素养测评进行等值模拟测验。两份测评分别面向四年级和五年级学生,题目完全不同,每个测评均是先阅读一篇文章,然后完成文章后的4道题目。题型为两个简答题和两个选择题,简答题为等级计分,选择题为0/1计分,每个测评的满分均为7分。

大语言模型模拟作答该测评时需要构建提示词工程,目前构造提示词工程有三种模式,分别是zero-shot,one-shot和few-shot[26]。使用大语言模型模拟测试中zero-shot,指的是未给它任何提示直接对题目进行作答;one-shot指的是告知其扮演何种水平的学生进行作答;few-shot指的是提供一套示例试卷以及不同水平的学生在示例试卷上的答案,让大语言模型学习之后,告知其扮演何种水平的学生进行作答。三种提示词工程的模板如表2所示。

在本研究中将选取GPT3.5,GPT4.0和讯飞星火3.5作为主要的测试大语言模型。其中,GPT3.5是目前主流的、应用范围较广的大语言模型;GPT4.0是目前各个方面表现最优秀的大语言模型;讯飞星火3.5是在中文的语境下,表现较好的大语言模型。

本次研究将对三个大语言模型,从模型类型、提示词工程模式和连接组样本三个方面,对比其不同条件下的等值精度。自变量1为大语言模型类型,设置为:GPT3.5,GPT4.0和讯飞星火3.5;自变量2为提示词工程,设置为:zero-shot,one-shot和few-shot;自变量3为连接组模拟样本数,设置为:500和1 000。

研究过程中对于三种大语言模型的调用与评价均采用Python的外部库实现,其中GPT3.5和GPT4.0采用OpenAI外部库,讯飞星火3.5采用spark_ai_python外部库。基于项目反应理论等值计算采用psy外部库,评价指标计算采用sklean库。

2.4 评价指标

本研究采用模拟参数反真值法进行等值有效性的评价[27],该检验方法是基于参数估计进行等值的主流评价方法[28]。其主要原理是对比等值后参数与真实的参数的差异,差异越小代表效果越好,等值效应越优。主要指标为绝对偏差(MAE)和误差均方根(RMSE),计算如下:

MAE=1Nn=1N1Rr=1Rς^r-ςr
RMSE=1Nn=1N1Rr=1Rς^r-ςr2

其中,N为重复的次数,R为题目数,ς^r为等值后的各个参数,ςr为真实参数估计值。MAE和RMSE值越小,表示参数越接近真值,等值的有效性越高。本次研究将对能力参数θ进行各个条件下的比较。

3  实验结果

3.1 测试的描述性统计分析

两份阅读素养题目各自面向对应年级的学生。其中,测试1面向五年级,共有43 608名学生参与测评;测试2面向四年级,共有41 737名学生参与测评。针对不同条件下的大语言模型,在测试1和测试2上开展测评。采用描述性统计分析方法,对大语言模型和小学生在两份阅读素养上的得分进行描述性统计分析,其结果如表3表4所示。通过对比不同条件下的大语言模型与人类被试的表现,可以验证大语言模型是否有能力担任等值的锚点。

表3可知,43 608名被试学生在测试1中的平均分为3.454分,标准差为2.208,整体平均处于中等水平。对于三个大语言模型来说,在zero-shot的情况下,倾向于回答正确的答案,平均水平皆高于被试学生平均水平。其中,GPT4.0最高,平均分数大于6.0。GPT4.0模型在one-shot和few-shot下达到了接近人类被试的水平,均值在3.5左右,标准差在2.4左右。GPT3.5虽然在one-shot和few-shot的条件下,相对于zero-shot平均水平有所下降,但其标准差偏低,分数相对集中。星火3.5在one-shot和few-shot的平均分比在zero-shot的平均分只有微小的下降,说明调整提示词工程对星火3.5影响非常小。

表4所示,GPT3.5和GPT4.0在one-shot和zero-shot的条件下具有扮演不同水平被试的能力,星火3.5在这方面能力欠佳。在41 373名被试学生中,测试2平均分数为3.387,标准差为2.020,整体处于中等偏下的水平。大语言模型的整体水平在测试2中的水平亦大于人类被试的水平。在多种模拟条件下,依然是GPT4.0的平均水平最接近人类被试。测试2中大语言模型在one-shot和zero-shot与人类水平的差距,相比测试1中要更大一些。GPT3.5在one-shot和zero-shot的平均水平相对zero-shot有明显的下降。

因此,GPT4.0是进行无锚题等值的首选模型。GPT4.0可以根据one-shot或few-shot提示词工程中要求模拟的样本水平进行作答,高水平的样本会尽可能回答对的答案,低水平的样本会给出一定的错误答案,一定程度上呈现了真实的样本表现。

3.2 不同条件下的等值结果对比

采用项目反应理论双参数模型进行不同条件下的等值效果检验,基于评价指标MAE和RMSE对等值之后的能力参数(θ)进行对比。在zero-shot情形下,大语言模型倾向于回答正确的答案,无法扮演不同水平的学生,导致数据结果趋同,蕴含信息量低,因此将zero-shot模式剔除。另外,即使在one-shot和few-shot提示词工程下,星火3.5依然无法有效扮演不同水平的样本,因此将星火3.5也剔除。最终,采用GPT3.5和GPT4.0对两份阅读素养题进行作答,分别从两种连接组样本数和两种提示词工程方面进行考察,结果如表5所示。

表5可知,两个模型中GPT4.0的表现更优秀,其在同等条件下的MAE和RMSE均明显低于GPT3.5,其等值有效性表现良好。在两个提示词场景few-shot和few-shot中,采用GPT4.0进行等值后的MAE和RMSE均小于GPT3.5。由此可见,GPT4.0等值成效优于GPT3.5。GPT3.5在one-shot的场景下,1 000样本组相对于500样本组MAE和RMSE分别降低了7.5%和6.9%;在few-shot场景下分别降低了3.2%和10%。对于GPT4.0而言,在one-shot和few-shot的场景下,1 000样本组的MAE和RMSE值均小于500样本组的。

综上,GPT4.0的无锚题等值表现要优于GPT3.5。其中,采用few-shot提示词工程的1 000样本组GPT4.0表现最好。GPT3.5在few-shot提示词工程以及充足的样本条件下,等值有效性有一定提升,但与GPT4.0的差距依然很大。就提示词工程而言,few-shot相对于one-shot有小幅度的提升。对于连接组的样本数,增加样本可以小幅度提升等值精度。

3.3 等值后的差异性分析

对43 608名被试学生在测试1的得分进行基于大模型的无锚题等值得到等值后的测试2得分,与41 373名被试学生在测试2上的得分进行独立样本t检验,结果如表6所示。

表6t检验结果可知,不同等值条件下,测试1的样本等值后的分数均显著大于测试2的样本(p<0.05)。在等值检验中表现突出的GPT4.0模型(N=1 000,提示词工程为few-shot),其测试1的样本的等值后测试2 得分与原测试2得分相比,差异最小,仅为0.086分。与之最接近的是,one-shot的1 000连接组样本的GPT4.0模型,差值为0.092分。其他条件下,虽然得到的T检验显著性结果一致,但其均值的差值偏大,均高于0.2,GPT3.5模型条件下甚至在0.3以上。结合表5表6可知,不同等值成效的检验指标大小与等值后均值差值相关度较高,等值有效性越高,两组均值的差异越小。在两组测试样本未等值之前,平均得分的差值约为0.667,等值后的这个差值被修正,由基于GPT4.0的等值结果显示,两组样本的实际差异在0.09分左右。由此可见,1 000样本下GPT4.0的one-shot和few-shot等值后两组样本的差异,最接近样本真实的差异。

4  结 语

本研究提出一种解决无锚题等值的方法。研究发现,构建基于GPT4.0的连接组,可以在待等值的两个无锚题的测试之间建立有效连接。特别是在few-shot和较大样本的情况下,其等值的有效性较高。大语言模型能否成为无等值锚点的关键在于其是否可以扮演不同能力的样本去回答问题,GPT4.0在这方面表现突出。此外,研究还发现构建良好的提示词工程和提升连接组的样本数可以小幅度提升等值的有效性。该设计方案的优势在于,不需要对题目的属性进行额外的设计或提供被试作答额外的题目,亦不需要在低利害群体中组织一个新的测评。同时,随着大语言模型的发展其使用成本会越来越低,这将有助于在大规模测评中推广。

在实施大规模的测评时,虽然样本与大语言模型之间也存在差异无法被完全消除,但不同被试对象与AI之间的相对差异依然可以作为等值的依据。通过提示词工程让大语言模型模拟不同水平的样本,可以消除部分大语言模型与人类被试的差异。虽然该差异无法被完全消除,但不同被试对象与AI的差异也是不同的,基于大语言模型的等值正是将这种差异作为不同被试对象间可比的依据。即可以通过大语言模型模拟真实的测评,利用AI与人类被试的相对差异,将不同组的被试对象之间得分转化到同一尺度下,从而实现近似的等值。Marengo等[7]构建新的试卷在低利害地区开展测评时,通过筛选样本消除这种差异,但参与新测评的样本与待等值样本间的差异依然存在。连接组与待等值组的差异如何被用来修正等值的结果,是未来的一个重要的方向。

除此之外,以大语言模型为锚点进行无锚题等值未来还有很多工作值得研究。首先,本次研究选用的是大语言模型比较擅长的阅读素养的题目,GPT4.0模型是否可以在其他能力的测评上进行无锚题等值是一个值得研究的方向。其次,本次研究对比的模型只选取了GPT4.0,GPT3.5和星火3.5这三个具有代表性的模型,然而还有许多其他优秀的模型,如claude3、Gemini、文心一言、智谱AI等,这些模型在无锚题等值上的表现如何,值得在未来的研究中验证。最后,本研究的等值方法是基于项目反应理论的,基于大语言模型的无锚题等值在其他等值方法上的表现也值得研究。

参考文献

[1]

SKAGGS GLISSITZ R W. IRT test equating: Relevant issues and a review of recent research[J]. Review of Educational Research198656(4): 495-529. DOI: 10.3102/00346543056004495 .

[2]

ZHU W M. Test equating: What, why, how?[J]. Research Quarterly for Exercise and Sport199869(1): 11-23. DOI: 10.1080/02701367.1998.10607662 .

[3]

王一波, 杨涛, 辛涛. 无锚题测验等值设计方法研究进展[J]. 考试研究201713(3): 48-54.

[4]

WANG Y BYANG TXIN T. Progress of the study of test equating design methods with no common items[J]. Examinations Research201713(3): 48-54 (Ch).

[5]

MISLEVY R JSHEEHAN K MWINGERSKY M. How to equate tests with little or no data[J]. Journal of Educational Measurement199330(1): 55-78. DOI: 10.1111/j.1745-3984.1993.tb00422.x .

[6]

LIAO C WLIVINGSTON S A. Examining an alternative to score equating: A randomly equivalent forms approach[J]. ETS Research Report Series20082008(1):1-22. DOI: 10.1002/j.2333-8504.2008.tb02100.x .

[7]

LIVINGSTON S A. Demographically adjusted groups for equating test scores[J]. ETS Research Report Series20142014(2): 1-10. DOI: 10.1002/ets2.12030 .

[8]

MARENGO DMICELI RROSATO Ret al. Placing multiple tests on a common scale using a post-test anchor design: Effects of item position and order on the stability of parameter estimates[J]. Frontiers in Applied Mathematics and Statistics20184: 50. DOI: 10.3389/fams.2018.00050 .

[9]

OUYANG LWU JXU Jet al. Training language models to follow instructions with human feedback[EB/OL].[2024-02-03].

[10]

WANG S HSUN YXIANG Yet al. ERNIE 3.0 titan: Exploring larger-scale knowledge enhanced pre-training for language understanding and generation[EB/OL]. 2021arXiv: 2112.12731.

[11]

BAI J ZBAI SYANG S Set al. Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond[EB/OL]. 2023arXiv: 2308.12966.

[12]

OPENAI, ACHIAM JADLER Set al. GPT4.0 technical report[EB/OL]. 2023arXiv: 2303.08774.

[13]

BORDT SVON LUXBURG U. ChatGPT participates in a computer science exam[EB/OL]. 2023arXiv: 2303.09461. DOI: 10.1109/cvprw59228.2023.00378 .

[14]

NORI HKING NMcKINNEY S Met al. Capabilities of GPT4.0 on medical challenge problems[EB/OL]. 2023arXiv:2303.13375.

[15]

ROSENBAUM P RRUBIN D B. The central role of the propensity score in observational studies for causal effects[J]. Biometrika198370(1): 41-55. DOI: 10.1093/biomet/70.1.41 .

[16]

TATSUOKA K K. Rule space: An approach for dealing with misconceptions based on item response theory[J]. Journal of Educational Measurement198320(4): 345-354. DOI: 10.1111/j.1745-3984.1983.tb00212.x .

[17]

BIRENBAUM MKELLY A ETATSUOKA K K. Diagnosing knowledge states in algebra using the rule-space model[J]. Journal for Research in Mathematics Education199224(5): 442-459. DOI: 10.5951/jresematheduc.24.5.0442 .

[18]

LIU QWU R ZCHEN E Het al. Fuzzy cognitive diagnosis for modelling examinee performance[J]. ACM Transactions on Intelligent Systems and Technology20189(4): Article No. 48. DOI: 10.1145/3168361 .

[19]

WANG FLIU QCHEN E Het al. NeuralCD: A general framework for cognitive diagnosis[J]. IEEE Transactions on Knowledge and Data Engineering202335(8): 8312-8327. DOI: 10.1109/TKDE.2022.3201037 .

[20]

罗照盛. 项目反应理论基础[M]. 北京: 北京师范大学出版社, 2012: 71-73.

[21]

LUO Z S. Item Response Theory[M]. Beijing: Beijing Normal University Press, 2012: 71-73 (Ch).

[22]

SEGBERS JSCHROEDER S. How many words do children know? A corpus-based estimation of children’s total vocabulary size[J]. Language Testing201734(3): 297-320. DOI: 10.1177/0265532216641152 .

[23]

KORTEMEYER G. Could an artificial-intelligence agent pass an introductory physics course [J]. Physical Review Physics Education Research202319: 010132. DOI: 10.1103/physrevphyseducres.19.010132 .

[24]

TALAN TKALINKARA Y. The role of artificial intelligence in higher education: ChatGPT assessment for anatomy course[J]. Uluslararası Yönetim Bilişim Sistemleri Ve Bilgisayar Bilimleri Dergisi20237(1): 33-40. DOI: 10.33461/uybisbbd.1244777 .

[25]

KATZ D MBOMMARITO M JGAO Set al. GPT-4 passes the bar exam[J]. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences2024382(2270): 20230254. DOI: 10.1098/rsta.2023.0254 .

[26]

王蕾. 人工智能生成内容技术在教育考试中应用探析[J]. 中国考试2023(8): 19-27. DOI: 10.19360/j.cnki.11-3303/g4.2023.08.003 .

[27]

WANG L. Widening the paths of assessment development via artificial intelligence-generated content: Potential applications of automatic item generation and technology-enhanced items in China[J]. Journal of China Examinations2023(8): 19-27. DOI: 10.19360/j.cnki.11-3303/g4.2023.08.003(Ch ).

[28]

HAEBARA T. Equating logistic ability scales by a weighted least squares method[J]. Japanese Psychological Research198022(3): 144-149. DOI: 10.4992/psycholres1954.22.144 .

[29]

CHEN J YGENG Y XCHEN Zet al. Zero-shot and few-shot learning with knowledge graphs: A comprehensive survey[J]. Proceedings of the IEEE2023111(6): 653-685. DOI: 10.1109/JPROC.2023.3279374 .

[30]

张健, 任杰. 基于共同题非等组设计的等值结果评价标准研究综述[J]. 中国考试2018(3): 32-37. DOI: 10.19360/j.cnki.11-3303/g4.2018.03.008 .

[31]

ZHANG JREN J. A review of evaluation criteria of equating results for the common item nonequivalent groups design[J]. China Examinations2018(3): 32-37. DOI: 10.19360/j.cnki.11-3303/g4.2018.03.008 (Ch ).

[32]

YAO L H. Multidimensional linking for domain scores and overall scores for nonequivalent groups[J]. Applied Psychological Measurement201135(1): 48-66. DOI: 10.1177/0146621610373095 .

基金资助

国家重点研发计划(2021YFC3340800)

AI Summary AI Mindmap
PDF (537KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/