融合行为与情感分析的课堂学习投入智能评估

徐亚萍 ,  李艳燕 ,  郭威彤 ,  唐夕人 ,  单玉刚 ,  李红慧

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 621 -633.

PDF (5627KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 621 -633. DOI: 10.14188/j.1671-8836.2024.0164
智能测评

融合行为与情感分析的课堂学习投入智能评估

作者信息 +

Intelligent Assessment of Classroom Learning Engagement Integrating Behavior and Emotion Analysis

Author information +
文章历史 +
PDF (5761K)

摘要

高效且准确地评估课堂学习投入是动态追踪学习进程和提升教学质量的关键。然而,现有研究面临分析维度单一与模型泛化能力不足等问题。为应对这些挑战,本研究以深度学习技术为核心,提出了一种融合行为和情感分析的课堂学习投入智能评估方法。该方法涵盖数据集构建、深度学习模型训练、模型评估、模型应用及统计分析等全流程。研究结果表明,所训练的深度学习模型在行为与情感分析任务中展现了优异的准确性与鲁棒性。通过对某班级课堂实录视频的案例分析,本研究从个体与班级整体层面进一步揭示了课堂学习投入的动态演变过程,验证了该方法在实际教学中的有效性与可行性。

Abstract

Efficient and accurate assessment of classroom learning engagement is crucial for dynamically tracking learning progress and improving teaching quality. However, existing research faces challenges such as limited analytical dimensions and insufficient model generalizability. To address these issues, this study, leveraging deep learning technologies, proposed an intelligent assessment method for classroom learning engagement that integrates both behavioral and emotional analysis. The method encompasses the entire process, including dataset construction, deep learning model training, model evaluation, application, and statistical analysis. The results demonstrate that the trained deep learning model exhibits exceptional accuracy and robustness in both behavioral and emotional analysis tasks. Through a case study of classroom video recordings from a specific class, this research further revealed the dynamic evolution of classroom learning engagement at both individual and collective levels, validating the method’s effectiveness and feasibility in real-world teaching contexts.

Graphical abstract

关键词

课堂学习投入 / 行为分析 / 情感分析 / 深度学习 / 智能评估

Key words

classroom learning engagement / behavior analysis / emotion analysis / deep learning / intelligent assessment

引用本文

引用格式 ▾
徐亚萍,李艳燕,郭威彤,唐夕人,单玉刚,李红慧. 融合行为与情感分析的课堂学习投入智能评估[J]. 武汉大学学报(理学版), 2025, 71(5): 621-633 DOI:10.14188/j.1671-8836.2024.0164

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

课堂学习投入是指学生在课堂活动中呈现出的心理、行为和情感参与程度,是影响学生学习效果的关键因素之一[1]。研究表明,课堂学习投入与学生学业成就呈正相关 [2]。高水平的课堂学习投入不仅有助于提高学生的学业成绩,还能有效促进学生良好学习习惯的养成,并强化其自主学习能力。因此,及时、准确地测量与分析课堂学习投入对课堂教育教学高质量发展具有重要意义。

传统课堂学习投入的测量方法主要依赖于学生自评、教学观察与人工编码等手段。尽管这些方法能提供一定的参考,但在客观性、实时性和连续性方面存在局限,难以全面捕捉学生课堂学习投入的动态变化。随着计算机视觉技术的快速发展,尤其在深度学习算法的推动下,图像识别、人脸检测、姿态估计等技术取得了突破,为课堂学习投入的分析提供了新机遇。通过对课堂视频中的视觉信息进行分析,计算机视觉技术能够实时捕捉学生的情绪波动、注意力水平和学习行为等,从而为课堂学习投入的量化评估提供客观、可靠的数据支持[3]。然而,基于计算机视觉的课堂学习投入分析研究仍面临一些亟待解决的问题。一方面,多数研究集中于对单一视觉信息的分析,如仅通过面部表情[4]或身体姿势[5]推测学习投入的单一维度,或将学习投入作为整体概念进行分析[6],忽略了其多维度的复杂特性,导致分析结果较为片面。另一方面,现有研究大多未能有效追踪学生个体在课堂学习中的具体表现和变化,从而影响了对课堂学习投入的深入理解。此外,现有研究普遍依赖于较小规模的数据集,导致所训练的模型泛化能力较差,限制了其在实际教学中的广泛应用。

为了突破这些局限,本研究在构建系统化分析指标体系的基础上,创新性地融合了行为分析和情感分析,提出了一种智能化评估课堂学习投入的方法。在此过程中,本研究构建了大规模学习行为与面部表情数据集,并通过应用数据增强等技术,显著提升了模型的准确性和鲁棒性,有效确保了其在多样化教学场景中的广泛适用性。结合目标检测与追踪技术,进一步将该方法应用于课堂实录视频分析,从个体和班级整体层面揭示了课堂学习投入的两个可见维度在不同教学环节中的同步演变过程。通过这一分析,教师能够实时掌握学生的学习状态,为个性化教学设计和优化提供了数据驱动的支持。

1  相关工作

1.1 课堂学习投入的测量方法分类

从学习分析的视角来看,课堂学习投入是一项可以通过多种手段进行测量与评估的指标[7]。随着技术的进步,课堂学习投入的测量方法不断发展演变,逐步向更加客观和自动化的方向迈进。依据技术手段和数据获取方式的不同,课堂学习投入的测量方法可分为三类:一是基于问卷量表的传统测量方法;二是基于编码分析的量化测量方法;三是基于智能技术的自动测量方法。

1) 基于问卷量表的传统测量方法

通过设计标准化的问卷或量表,收集学生自评或教师评价数据,以此了解学生的课堂学习投入情况。此类方法的典型代表是由Fredricks等[1]提出的学习投入量表,它从情感、行为和认知三个维度衡量学生的课堂学习投入。这种方法操作简便,易于推广,广泛应用于教学研究中。然而,由于过度依赖学生的主观反馈,导致其存在一定的偏差和数据不准确性。此外,该方法多在课堂结束后进行数据收集,缺乏对学生投入状态的动态跟踪,无法实现实时反馈。

2) 基于编码分析的量化测量方法

使用既定的编码表或编码框架对课堂视频或对话记录等数据进行编码,进而分析出学生的课堂投入水平。例如,Zhan等[8]对一个班级的课堂过程进行录像,并使用三个编码框架对60节科学课中的学生行为投入、情感投入和认知投入进行编码分析。这种方法能够捕捉到更细致的课堂行为和情绪表现,适用于深度的课堂学习投入研究。但其挑战在于数据分析过程需要大量的时间与人力投入,存在耗时较长和实时性较差的问题,因此在大规模课堂环境中难以高效实施。

3) 基于智能技术的自动测量方法

依赖于各类可穿戴传感器和无感传感器自动采集学习者的相关数据,并结合计算机视觉、自然语言处理和深度学习等智能技术对数据流进行分析,从而精准捕捉并评估学生的情绪、行为和注意力等多维表现,实现课堂学习投入的自动识别。其中,可穿戴传感器可以采集学生的生理信号,如脑电、心率和皮肤电等,这些数据能够真实反映学生的内在生理状态。然而,由于传感器需贴附于学习者的身体部位,容易干扰学习者,从而限制了其在真实课堂环境中的应用效果。相比之下,无感传感器方式能够实现远距离的非接触式数据采集,更适用于实际教学环境。最常用的无感传感器方式为摄像头,研究人员通过计算机视觉技术对采集到的课堂视频进行图像区域的定位与分类,基于身体姿态[9]、面部线索[10]和眼动[11]等图像区域开展课堂学习投入研究。采用这种方式,视频数据不仅易于获取,而且包含了丰富的非语言信息,为课堂学习投入评估提供了多维度的视角,能够帮助教师更全面地理解学生的学习状态。

1.2 基于计算机视觉技术的课堂学习投入识别研究

计算机视觉(Computer Vision,CV)旨在通过处理和分析图像或视频数据,实现对目标的检测、识别、跟踪和多维理解,其核心技术包括人脸识别、姿态估计和行为识别等。基于这些技术,研究人员可以对课堂视频中的学生面部表情、身体动作、头部姿态等进行细致识别,从而实现课堂学习投入的自动化评估。在这一领域,国内外研究者已进行了广泛探索。早期研究多集中于使用传统机器学习方法识别课堂学习投入[12]。例如,Zaletelj等[13]通过视觉数据提取学生面部表情和身体姿态特征,并结合多种传统机器学习算法,构建自动评估学生课堂注意力水平的分类器。结果显示,该三级注意力分类器达到了75.3%的中等准确度。另一项研究中,贾鹂宇等[14]通过提取学生的面部关键点特征,使用支持向量机(SVM)算法对课堂中常见的情绪状态(如平常、困惑和高兴)进行分类。传统机器学习方法的优点在于模型结构相对简单、计算量较小,且适合较小规模数据集,但其对手工特征提取的依赖较高,在处理复杂情绪或动态行为时的效果有限。

近年来,深度学习技术在图像和视频处理领域取得了突破性进展,推动了基于视觉数据的课堂学习投入识别研究的快速发展。与传统机器学习方法相比,深度学习模型端到端的学习过程,简化了识别任务的流程,并能够自动提取出与学习投入相关的高层次语义特征。因此,越来越多的研究选择采用深度学习方法进行学习投入的识别工作。例如,Li等[15]利用智慧教室的课堂视频,生成了一个包含七种典型学习行为的图像数据集,并基于此数据集构建了一个行为预测网络模型。该模型采用了多层次的架构,包括用于特征提取的主干网络(SlowFast R-101)、目标检测器(Faster R-CNN)以及由全连接层组成的动作分类器,从而有效识别并预测学生在课堂中的行为模式。Ikram等[16]提出了基于迁移学习的VGG16模型,并通过增加扩展层和调整超参数,进一步优化了模型性能,旨在计算学生在实际课堂环境中的学习投入水平。此外,Xiong等[17]提出的CNN-Transformer模型,结合了CNN在面部表情细粒度特征提取方面的优势与Transformer在捕捉人体位置粗粒度信息方面的能力,显著提升了课堂情境中学习投入度的识别精度。这些研究通过结合不同的模型架构和技术手段,逐步克服了传统方法在实时性和准确性等方面的局限,为课堂学习投入的自动化测量提供了新的方向和解决方案。

综上所述,基于计算机视觉的课堂学习投入识别研究呈现出由依赖手工浅层特征的传统机器学习方法到深度学习方法的转变态势。虽然深度学习方法广受青睐,实现了更精确的学习投入评估,但其模型的可解释性较低,且通常需要大量标注数据进行训练。现有研究中标注数据集的规模相对有限,容易导致过拟合问题。出于隐私保护等因素,获取其他机构的数据集也面临一些问题。此外,现有研究多通过单一视觉信息识别学习投入的某一维度,或将学习投入视为整体概念,无法同时获取投入的多维度信息,因而难以探究不同维度的同步演变过程。基于此,本研究通过收集真实课堂视频构建了大规模学习行为数据集,并整合公开的面部情感数据集,针对课堂学习投入的情感和行为两个关键可见维度实施深入识别与分析。通过多种视觉信息的融合分析,本文能够动态、全面地呈现学生课堂学习投入的演变过程,从而为实时课堂反馈机制的构建以及个性化教学策略的制定提供坚实的科学依据。

2  研究设计与方法

本研究基于学习投入等相关理论,首先构建了课堂学习投入分析指标体系,为实现课堂学习投入的智能评估奠定了基础。其次,研究提出了一种以深度学习技术为核心的课堂学习投入智能评估方法,并详细阐述了基于多视觉线索分析课堂学习投入的关键步骤。这一方法有助于从教学视频中挖掘课堂学习投入的动态演变规律。

2.1 课堂学习投入的分析指标体系

学习投入是一个多维度的复杂概念,包含行为、情感和认知三个子维度[1]。其中,行为投入和情感投入作为外显的可视维度,通过表情和姿态等特征可以直接观测与量化,而认知投入则较为内隐,难以通过视觉信息直接捕捉。因此,本研究聚焦于通过视觉多模态信息捕捉并量化课堂学习投入的可视维度,即行为投入和情感投入,基于此构建分析指标体系(详见表1)。

行为投入是指学生在课堂上与学习环境(例如学习资源、教师与同伴等)积极互动的行为状态[18]。教育心理学家季清华教授提出的ICAP框架(Interactive,Constructive,Active,Passive),将学生的参与模式分为被动式、主动式、建构式、互动式[19-20]。这一递进式模式明确了学生在课堂中的投入状态:从仅为信息接受的被动行为,到对知识的主动加工和反思,再到通过互动和协作建构知识的行为表现。考虑到建构行为通常发生在互动中,因此本文将学生的建构行为纳入互动行为类别,简化分类结构。此外,为了更全面地评估学生的行为投入,本文增设了“脱离行为”类别。最终,本文将学生行为划分为被动行为、主动行为、互动行为和脱离行为[21],以更精准地反映不同投入水平的课堂表现。具体而言,被动行为指学生在课堂上以接受信息为主的行为表现,如抬头听课或低头看书;主动行为是学生对知识的积极反应,表现为主动参与和自主学习的倾向,如低头写字、举手答问;互动行为强调学生与教师或同伴的互动交流,伴随知识建构和协同学习,如站立回答问题或侧身交流;脱离行为是指学生未能有效参与课堂活动,通常难以产生有效的学习效果,如转头看他人、趴桌睡觉。

情感投入是指学生在课堂学习中对学习活动、教师和同伴所表现出的情感反应。根据Ekman[22]提出的基本情绪理论,学生情感可以被细分为一系列基本的、普遍存在的情绪状态,包括高兴、悲伤、惊讶、愤怒、厌恶和害怕,这些情绪具有跨文化的一致性。为了进一步表征不同情感投入维度,本研究按照情感效价将这些基本情绪划分为积极、消极和中性三个类别。积极情感是指学生在学习过程中产生的正面情绪体验,包括高兴和惊讶。这类情感通常与内在动机、努力、自我调节以及更复杂的学习策略呈正相关[23]。消极情感包括悲伤、害怕、厌恶、愤怒,反映了学生在课堂学习中经历了负面的心理体验,通常伴随着焦虑和无聊,与努力减少、表现不佳、外部调节增加和自我调节策略减少有关[24-25]。中性情感则代表了一种相对平稳、无显著积极或消极偏向的情感状态,学生在课堂活动中的大部分时间可能处于此种状态。这种情感状态虽不直接促进或阻碍学习,但为理解学生情感波动的基线提供了重要参考。

2.2 课堂学习投入智能评估流程

在确定课堂学习投入的分析指标体系后,本研究基于深度学习的技术流程,进一步提出了课堂学习投入的智能评估流程(如图1所示),该流程主要包括5个步骤:构建数据集、训练深度学习模型、评估深度学习模型效果、统计分析以及模型应用。

2.2.1 构建数据集

1) 学习行为数据集

视频数据来源于230节不同课堂,经采集、处理、标签确定和标注4个步骤完成学习行为数据集的构建。具体过程如下:① 数据采集:使用的课堂视频来源于两个渠道,一是利用录播系统录制真实课堂的教学过程,二是通过爬虫工具从国家资源公共服务平台中获取公开课堂视频资源。通过多渠道获取视频资源丰富数据样本,辐射多样化课堂学习场景。② 数据筛选与处理:删除拍摄角度异常(如过高、过低)、画面模糊、过暗的视频,对筛选后的课堂视频每隔一分钟抽取一帧保存,同时删除画面中无学生的图像帧,最终收集7 496张课堂图像。③ 标签确定:统计各课堂场景中出现的学习行为,结合相关研究,确定了10种典型的课堂学习行为作为标注依据。④ 图像标注:使用图像标注工具LabelImg对所有课堂图像进行标注(标签说明见表2),标注完成后生成包含标注框坐标和行为类别标签的txt格式文件。

本研究所构建的数据集包含152 858张标注图像,涵盖了10种典型的课堂行为类别,具体数据如表2。由表2,“上台发言/展示”类别的图像数量远低于其他类别,导致该类别的图像样本过于稀缺,最终未参与到模型的训练过程中。所有图像均来源于不同的真实课堂学习场景,与已有研究中[26-27] 所使用的单一或少数教室场景相比,本研究构建的数据集涵盖了不同的光照条件、背景信息和遮挡因素,具有较高的多样性。这一优势使得数据集更具代表性,为训练具有更强鲁棒性的行为识别模型提供了基础。

2) 面部情感数据集

本研究整合了两个公共数据集,一个是Facial Expression Recognition 2013(FER2013),另一个是The Extended Cohn-Kanade Dataset(CK+),以构建一个规模更大的面部情感数据集。FER2013数据集包含35 887张面部图像,所有图像均为48×48像素的灰度图像。CK+数据集则包括123个对象的327个表情图像序列,本研究从每个图片序列中提取最后三帧,并统一处理为48×48的灰度图像。经过处理得到的合并数据集共包含36 829张面部表情图像,涵盖7种基本情绪,每种情绪的图像数量及占比如表3所示。

从对以上学习行为数据集和面部情感数据集的介绍,不难发现这两个数据集均存在显著的类别不均衡问题。若直接使用这两个数据集进行深度学习模型的训练,模型可能会倾向于预测样本量较多的类别,从而影响少数类别的识别准确性。为解决这一问题,本研究采用了多种数据增强技术,包括旋转、水平翻转、噪声添加和模糊处理等,对样本量不足的类别进行扩展(如图2所示)。经上述处理后,最终用于训练行为识别模型和面部表情识别模型的数据集分别包含312 459张和45 128张图像,各自的样本量标准差分别降至4 235和606,有效缓解了原始数据集的长尾分布问题。

2.2.2 训练深度学习模型

从头构建深度学习模型是一个复杂而具有挑战性的过程,通常需要大量数据集和繁重的超参数调整。迁移学习为此提供了有效解决方案,它通过利用在大规模数据集上预训练的模型,将其所学知识迁移到新任务中应用,从而加速训练并提升模型在小规模数据集上的表现。卷积神经网络(Convolutional Neural Network,CNN)及其变体因特征提取能力强、应用灵活,已成为最受欢迎的深度学习架构之一[28]。CNN包含多种经典的预训练模型,如Inception、ResNet和VGGNet,这些模型在大规模视觉数据集(如ImageNet)上预训练得到的通用图像特征在视觉任务中具有很高的迁移性。本研究在构建数据集上测试了多个预训练模型,结果显示,VGGNet16和ResNet50分别在行为识别和表情识别任务中表现最佳。接下来将重点阐述这两个模型的结构设计。

1) VGGNet16网络模型

VGGNet16是一种经典的卷积神经网络模型,采用“深而窄”的结构设计,通过堆叠小卷积核实现深度特征提取,从而增强了模型的表达能力并有效减少了参数量,具有较强的数据集适应性。如图3所示,VGGNet16网络模型由5个卷积块、3个全连接层和1个Softmax层组成。该模型接受固定尺寸为224×224×3的图像作为输入,因此首先需要对数据集的图像进行规范化处理以符合此要求。接着通过卷积块提取图像特征,每个卷积块包含若干卷积层和一个池化层。其中,卷积层均采用3×3大小的卷积核,以保证在深层次上提取细致的图像特征。每一卷积层后使用ReLU激活函数来增强网络的非线性表征能力。池化层则采用2×2的池化窗口,以逐步缩小特征图的尺寸。卷积块后接入3个全连接层,将卷积层提取的特征映射为一维向量。最终,通过Softmax层进行分类输出,得到各类的概率预测值。

2) Resnet50网络模型

残差网络(Residual Network,ResNet)通过引入残差学习思想,有效解决了网络模型加深时出现的梯度消失和分类准确率降低的问题[29]。自ResNet提出以来,相继产生了多种变体,其中最具代表性的是Resnet50。该模型层数适中,在性能、计算成本和任务需求之间实现了良好的平衡。该模型包括1个卷积块、4个残差块和1个输出。卷积块包含一个7×7的卷积层,一个批标准化操作层(Batch Normalization,BN)、ReLU激活函数,以及一个3×3的最大值池化层。这一阶段将输入图像缩小到原来的1/4。每个残差块包含多个卷积层和一个短路连接(shortcut connection),其结构如图4所示。

图4中,x是残差单元的输入;F(x)表示输入经过卷积、池化、激活等操作后输出的特征图;H(x)是残差单元的输出,其表达式如下:

H(x)=F(x)+x

H(x)经过一个ReLU激活函数处理后,得到最终的输出特征图。在网络模型准确率达到较饱和的情况下,接下来的训练可视为恒等映射,即H(x)=x,此时训练目标转变为使F(x)趋向于0。这样,即使网络层数加深,准确率也不会再下降。在网络的末尾,使用全局平均池化层将特征图转化成一个特征向量,将其输入全连接层,并结合Softmax激活函数输出每个表情类别的概率值。

2.2.3 深度学习模型效果评估

深度学习模型训练完成后,需要通过一定的度量标准评价其泛化性能,以测试模型对新输入样本的判别能力。本研究选择了宏精确率(macro precision,macro-P)、宏召回率(macro recall,macro-R)、宏F1值(macro-F1)和准确率(Accuracy)评估模型的性能。根据评估结果进一步调整超参数,以优化模型性能,直至模型表现达到稳定。评估指标的计算公式如下:

macro_P=1ni=1nTPiTPi+FPi
macro_R=1ni=1nTPiTPi+FNi
macro_F1=2×macro_P×macro_Rmacro_P+macro_R
Accuracy=1mi=1mf(xi)=yi

式中,n是分类的类别数量,m是样本数量;TP i 、FP i 和FN i 分别表示第i类的真阳性、假阳性和假阴性的数量;f (xi )是预测结果,yi 是真实标签。为方便描述以下将宏精确率、宏召回率和宏F1值分别简称为精确率、召回率和F1值。

2.2.4 模型应用

在获得最优的深度学习模型后,将录制的课堂视频作为其输入,进行批量识别,具体过程如图5所示。首先,对待识别的视频进行分帧处理,提取图像序列,然后进行目标检测与追踪等预处理,依次定位每位学生的面部和身体区域位置。接着,将检测到的人脸和人体图像区域分别输入面部表情识别模型和学生行为识别模型,从而获得学习者的情感状态和学习行为识别结果。这些结果为课堂学习投入的计算提供了基础数据。

2.2.5 统计分析

依据表1所示的课堂学习投入分析指标体系,对情感和行为识别结果进行聚合计算,揭示课堂学习投入水平的动态变化。首先,按照每30 s为一个时间片段,对每位学生的情感和行为类型进行统计,并记录每种情感和行为在该时间段内的出现频次。然后,根据构建的分析指标体系,将这些统计结果归入相应的情感和行为投入类别中。进一步地,通过统计所有学生在每个时间段内的具体表现,进而计算班级整体的学习投入水平。最后,将得到的时序数据进行可视化处理,从个人和班级整体两个层次清晰呈现课堂学习投入在情感和行为两个维度上的演变过程。这一分析有助于我们更深入地理解学生在课堂中的学习状态。

3  实验结果与分析

3.1 实验环境与参数设置

实验使用的硬件设备为一台高性能计算机,其操作系统为Windows 10,运行内存为16 GB,配备Intel i7-11700K处理器和NVIDIA GeForce RTX 3070显卡。在软件环境方面,模型训练在Python 3.8.0版本中进行,采用了Keras深度学习框架。该硬件与软件组合提供了强大的计算能力和灵活的开发环境,确保了实验的高效执行。

训练深度学习模型时,数据集按8∶1∶1的比例划分为训练集、验证集和测试集。学生行为识别模型的参数设置如下:批次大小(batch_size)为32,训练轮数(epochs)为50,学习率为0.01;面部表情识别模型的参数设置为:batch_size=32,epochs=100,学习率为0.001。两个模型的损失函数均采用加权交叉熵损失函数,以便为样本较少的类别分配更高的权重,从而确保模型能够更加关注少数类样本,提高其识别精度。同时,两个模型均使用Adam优化算法来调整网络参数,该算法能够有效处理大量参数的复杂问题,并且在训练过程中需要的手动调整较少。

3.2 模型性能分析

3.2.1 学生课堂行为识别结果分析

本研究基于VGGNet16架构构建学生课堂行为识别模型,并在自建教育场景数据集上进行验证,分类准确率结果如图6所示。由图6可看出,大多数行为类别的识别准确率超过了0.90,其中“趴桌睡觉”“举手答问”“站立回答”和“转头看他人”行为的识别准确率尤为突出。这主要归因于这些行为具有明显的外显特征,使得模型能够有效区分并准确识别。相比之下,“低头看书”和“低头写字”两类行为由于在外观表现上具有相似性,导致两者之间存在一定的误识率,从而使得这两类行为的识别准确率相对较低。与已有研究相比[26],本研究通过优化网络架构并结合特定的训练策略,显著提高了整体识别准确率(从0.867提升至0.94)。未来研究可结合时序卷积网络捕捉动态时序特征,进一步优化模型鲁棒性。

图7展示了2张使用训练模型在不同课堂场景中检测学生行为的结果示例图。从图7中可以看出,大多数学生的行为状态能够被准确识别。这表明在理想的光照条件和相对清晰的视野下,模型识别性能表现良好。但当出现遮挡情况时,由于无法捕捉到完整的身体特征,模型的性能则有所下降。尤其是对于教室后排或角落位置的学生,由于视野受限和分辨率降低等因素,模型在对这些目标进行行为识别时面临挑战,这将是我们进一步研究的方向。

3.2.2 面部表情识别结果分析

面部表情识别模型的各项性能指标见表4。在积极情感识别方面,模型的精确率均超过0.80,尤其在“高兴”情绪的识别上表现优异,其精确率、召回率和F1值均超过0.90。对于中性情感,模型的识别表现处于中等水平。然而,在识别“厌恶”“悲伤”“害怕”和“愤怒”4种消极情感时,精确率相对较低。这种跨类别性能差异主要源于FER2013数据集中的标注不确定性,特别是“愤怒-厌恶”和“害怕-惊讶”等易混淆情绪对的标注一致性较差。尽管如此,模型在跨场景测试中依然展现出较强的鲁棒性。在测试集上的平均识别精度达到0.77,略高于现有研究中基于FER2013数据集训练的模型准确率(0.75)[30]。这一提升主要得益于本研究通过整合多个数据集、采用数据增强技术等方法,显著提升了少数类情绪的识别性能。

图8展示了2张不同课堂视频帧的预测结果图。可以看出,在不同背景和光照条件的教室环境中,大多数学生的面部表情能够被成功检测并进行识别,甚至对于部分被遮挡的面部,模型也能够进行准确识别。总体来看,模型展现了较强的泛化能力。

3.3 课堂学习投入的动态演变分析

本研究选取了某中学一节数学课的课堂实录视频进行案例分析。该视频的帧率为30帧/s,时长约40 min,授课内容为“数的估算与应用”。教学环节包括课堂导入(约3 min)、巩固练习(约18 min)、课堂讲授(约17 min)及课堂小结(约2 min)。在采集视频数据之前,研究者已向学生阐明研究目的,并承诺严格保密其个人信息。在数据分析过程中,本研究不仅从个体层面考察了每位学生的行为和情感状态,还从班级整体层面对课堂学习投入的整体水平进行了监测与分析。

3.3.1 个体层面的课堂学习投入演变分析

从个体层面来看,学生在课堂中的行为表现差异显著。图9展示了前排6名学生在课堂中的行为比例。根据图9所示,学生的课堂行为主要集中在“抬头听课”,其次是“低头看书”和“低头写字”。具体而言,学生1、2、4和6的“抬头听课”行为占比均超过了80%,而学生3和5则表现出较多的脱离行为,如频繁转头看他人,这表明他们的课堂投入度相对较低。为了更精细地呈现分析结果,进一步考察了学生1的行为和情感投入随时间的变化。如图10所示,情感投入方面,该学生的情感状态以中性情感为主,偶尔表现出消极情感,整体情感投入较为平稳。积极情感主要出现在课堂的最后阶段,这可能与课堂结束前的轻松氛围及任务完成后的成就感相关。行为投入方面,教师在巩固练习阶段通过引导和互动策略激发了学生的主动参与,增强了其课堂投入。此外,学生在教师讲授环节出现短暂的脱离行为,但很快恢复,显示出良好的自我调节能力。

3.3.2 班级整体层面的课堂学习投入演变分析

通过将每位学生的情感和行为类型按照课堂学习投入指标体系进行聚合与统计分析,能够揭示班级整体课堂学习投入水平的变化趋势。图11展示了课堂中情感投入和行为投入的同步演变过程。整体情感状态以消极和中性情感为主,且两者呈现出“此消彼长”的趋势,而积极情感的出现频率较低,表明课堂氛围较为严肃。情感投入在巩固练习阶段的波动最大,此阶段也出现了高频的主动行为,这表明尽管学生积极参与课堂练习,但任务难度可能引发了负性情感的产生。学生脱离的迹象在讲授阶段最明显,可推测此阶段学生的积极性有所下降。互动行为的出现频率始终较低,反映出学生在课堂上大部分时间处于对教师讲授内容的被动接收状态。总体而言,这节课主要采用以教师讲授为主的教学模式。

4  结 语

本研究提出了一种融合行为与情感分析的课堂学习投入智能评估方法,旨在推动课堂学习投入评估的自动化、实时化与精确化。通过结合视觉多模态信息与计算机视觉技术,实现了课堂学习投入的多维度与动态化评估,有效解决了现有研究中分析维度局限、数据来源单一、主观性强、难以大规模应用等问题。研究结果表明,基于深度学习方法训练的行为识别与情感识别模型具有较高的准确率,这得益于大规模数据集的构建与数据增强等方法的应用。此外,在课堂学习投入的动态演变分析中,本研究根据不同教学环节对学习投入进行细分呈现,有助于教师更清晰地了解学生在课堂各阶段的投入情况,为教学策略的优化提供有力依据。

尽管本研究在课堂学习投入的智能评估方面取得了初步进展,但仍存在一定局限性。首先,虽然情感分析整合了两个公共数据集,提升了模型准确性和泛化能力,但这些数据集主要涵盖基本情绪。未来研究应关注教育场景中涉及的学业情绪(如专注、困惑等),以提升评估的针对性。其次,本研究主要依赖视觉信息分析行为和情感投入,尚未涉及认知投入这一内隐维度。未来应融合课堂对话等多模态数据,进一步完善课堂学习投入的自动评估方法。最后,未来研究还需进一步优化深度学习模型的适应性,并探索如何将该方法更好地融入教学实践,提升教学效率和质量,推动教育信息化和智能化的发展。

参考文献

[1]

FREDRICKS J ABLUMENFELD P CPARIS A H. School engagement: Potential of the concept, state of the evidence[J]. Review of Educational Research200674(1):59-109. DOI: 10.3102/00346543074001059 .

[2]

GUNUC S. The relationships between student engagement and their academic achievement[J]. International Journal on New Trends in Education and their Implications20145(4):216-231. DOI: 10.2224/sbp.7054 .

[3]

JIA M LWU Z XREITER Aet al. Exploring visual engagement signals for representation learning[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 4186-4197. DOI:10.1109/ICCV48922.2021.00417 .

[4]

XU Y PLI Y YCHEN Y Set al. Spontaneous visual database for detecting learning-centered emotions during online learning[J]. Image and Vision Computing2023136: 104739. DOI:10.1016/j.imavis.2023.104739 .

[5]

赵春,舒杭,顾小清.基于计算机视觉技术的学生课堂学习行为投入度测量与分析[J].现代教育技术202131(6):96-103. DOI: 10.3969/j.issn.1009-8097.2021.05.012 .

[6]

ZHAO CSHU HGU X Q. The measurement and analysis of students’ classroom learning behavior engagement based on computer vision technology[J]. Modern Educational Technology202131(6):96-103. DOI: 10.3969/j.issn.1009-8097.2021.05.012(Ch ).

[7]

ASHWIN T SGUDDETI R M R. Unobtrusive behavioral analysis of students in classroom environment using non-verbal cues[J]. IEEE Access20197: 150693-150709. DOI:10.1109/ACCESS.2019.2947519 .

[8]

万昆,饶宸瑞,徐如梦. 国际教育领域学习投入度研究的焦点与转向[J]. 现代教育技术202131(4): 36-43. DOI: 10.3969/j.issn.1009-8097.2021.04.005 .

[9]

WAN KRAO C RXU R M. The focus and shift of the research on learning engagement in the field of international education[J]. Modern Educational Technology202131(4): 36-43. DOI: 10.3969/j.issn.1009-8097.2021.04.005(Ch ).

[10]

ZHAN X HSUN D EWEN Yet al. Investigating students’ engagement in mobile technology-supported science learning through video-based classroom observation[J]. Journal of Science Education and Technology202231(4): 514-527. DOI:10.1007/s10956-022-09970-3 .

[11]

ZHENG Z JLIANG G JLUO H Bet al. Attention assessment based on multi-view classroom behaviour recognition[J]. IET Computer Vision202519(1): e12146. DOI:10.1049/cvi2.12146 .

[12]

WHITEHILL JSERPELL ZLIN Y Cet al. The faces of engagement: Automatic recognition of student engagement from facial expressions[J]. IEEE Transactions on Affective Computing20145(1):86-98. DOI: 10.1109/TAFFC.2014.2316163 .

[13]

KRITHIKA L BLAKSHMI PRIYA GG. Student emotion recognition system (SERS) for e-learning improvement based on learner concentration metric[J]. Procedia Computer Science201685: 767-776. DOI:10.1016/j.procs.2016.05.264 .

[14]

KARIMAH S NHASEGAWA S. Automatic engagement estimation in smart education/learning settings: A systematic review of engagement definitions, datasets, and methods[J]. Smart Learning Environments20229(1): 31. DOI:10.1186/s40561-022-00212-y .

[15]

ZALETELJ JKOŠIR A. Predicting students’ attention in the classroom from Kinect facial and body features[J]. EURASIP Journal on Image and Video Processing20172017(1): 80. DOI:10.1186/s13640-017-0228-8 .

[16]

贾鹂宇,张朝晖,赵小燕,. 基于人工智能视频处理的课堂学生状态分析[J]. 现代教育技术201929 (12): 82-88. DOI: 10.3969/j.issn.1009-8097.2019.12.012 .

[17]

JIA L YZHANG Z HZHAO X Yet al. Analysis of students status in class based on artificial intelligence and video processing[J]. Modern Educational Technology201929 (12): 82-88. DOI: 10.3969/j.issn.1009-8097.2019.12.012(Ch ).

[18]

LI Y TQI XSAUDAGAR A K Jet al. Student behavior recognition for interaction detection in the classroom environment[J]. Image and Vision Computing2023136: 104726. DOI:10.1016/j.imavis.2023.104726 .

[19]

IKRAM SAHMAD HMAHMOOD Net al. Recognition of student engagement state in a classroom environment using deep and efficient transfer learning algorithm[J]. Applied Sciences202313(15): 8637. DOI: 10.3390/app13158637 .

[20]

XIONG YGUO X YXU J J. CNN-Transformer: A deep learning method for automatically identifying learning engagement[J]. Education and Information Technologies202429(8): 9989-10008. DOI:10.1007/s10639-023-12058-z .

[21]

张琪,武法提. 学习行为投入评测框架构建与实证研究[J]. 中国电化教育2018, (09): 102-108. DOI: 10.3969/j.issn.1006-9860.2018.09.015 .

[22]

ZHANG QWU F T. Construction and empirical study of learning behavioral engagement evaluation framework[J]. China Educational Technology2018, (9): 102-108. DOI: 10.3969/j.issn.1006-9860.2018.09.015(Ch ).

[23]

CHI M T H. Active-constructive-interactive: A conceptual framework for differentiating learning activities[J]. Topics in Cognitive Science20091(1): 73-105. DOI:10.1111/j.1756-8765.2008.01005.x .

[24]

CHI M T HWYLIE R. The ICAP framework: Linking cognitive engagement to active learning outcomes[J]. Educational Psychologist201449(4): 219-243. DOI:10.1080/00461520.2014.965823 .

[25]

冷静,易玉何. 智慧教室中学习投入度与教学活动类型的关系[J]. 现代教育技术202030(5): 47-53. DOI: 10.3969/j.issn.1009-8097.2020.05.007 .

[26]

LENG JYI Y H. The relationship between learning engagement and types of teaching activities in smart classroom[J]. Modern Educational Technology202030(5): 47-53. DOI: 10.3969/j.issn.1009-8097.2020.05.007(Ch ).

[27]

EKMAN P. An argument for basic emotions[J]. Cognition and Emotion19926(3/4): 169-200. DOI:10.1080/02699939208411068 .

[28]

PEKRUN RGOETZ TFRENZEL A Cet al. Measuring emotions in students’ learning and performance: The achievement emotions questionnaire (AEQ)[J]. Contemporary Educational Psychology201136(1): 36-48. DOI: 10.1016/j.cedpsych.2010.10.002 .

[29]

DANIELS L MSTUPNISKY R HPEKRUN Ret al. A longitudinal analysis of achievement goals: From affective antecedents to emotional effects and achievement outcomes[J]. Journal of Educational Psychology2009101(4): 948-963. DOI: 10.1037/a0016096 .

[30]

PEKRUN RELLIOT A JMAIER M A. Achievement goals and achievement emotions: Testing a model of their joint relations with academic performance[J]. Journal of Educational Psychology2009101(1): 115-135. DOI: 10.1037/a0013383 .

[31]

谭苏燕,王祖煊,何高大. 基于CA-YOLOv9网络的实时全景多尺度课堂行为识别[J].现代教育技术202434 (7): 123-130. DOI: 10.3969/j.issn.1009-8097.2024.07.013 .

[32]

TAN S YWANG Z XHE G D. Real-time panoramic multi-scale classroom behaviors recognition based on CA-YOLOv9 network[J]. Modern Educational Technology202434 (7): 123-130. DOI: 10.3969/j.issn.1009-8097.2024.07.013(Ch ).

[33]

CHE B LLI X MSUN Y Xet al. A database of students’ spontaneous actions in the real classroom environment[J]. Computers and Electrical Engineering2022101: 108075. DOI: 10.1016/j.compeleceng.2022.108075 .

[34]

SIMONYAN KZISSERMAN A. Very deep convolutional networks for large-scale image recognition[EB/OL]. 2014: 1409.1556. DOI: 10.48550/arXiv.1409.1556 .

[35]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016: 770-778. DOI:10.1109/CVPR.2016.90 .

[36]

SAURAV SSAINI RSINGH S. EmNet: A deep integrated convolutional neural network for facial emotion recognition in the wild[J]. Applied Intelligence202151(8):5543-5570. DOI: 10.1007/s10489-020-02125-0 .

基金资助

国家自然科学基金(62277006)

国家自然科学基金(62267008)

2022年度新一代人工智能国家科技重大专项(2022ZD0115905)

湖北省教育科学规划重点课题(2021GA048)

湖北文理学院教学改革项目(JY2022007)

AI Summary AI Mindmap
PDF (5627KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/