基于平滑性无监督领域自适应的开放世界目标检测

黄正翔 ,  李书玮 ,  齐恺 ,  蔡杰超 ,  徐锲 ,  卢笑 ,  吴成中 ,  王耀南

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 634 -642.

PDF (3227KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 634 -642. DOI: 10.14188/j.1671-8836.2024.0101
智能分析技术

基于平滑性无监督领域自适应的开放世界目标检测

作者信息 +

Smooth Unsupervised Domain Adaptation for Open-World Object Detection

Author information +
文章历史 +
PDF (3304K)

摘要

开放世界目标检测(Open World Object Detection, OWOD)旨在检测环境中的未见目标,是智慧教育领域中诸多问题的上游任务。现有的方法通过选择前K个置信度最高的前景进行预测,直接将在已知类别上训练的检测器泛化到检测其他的未知前景目标上。然而这种方法使检测器偏向检测已知类别,难以识别全部未知目标。对此,提出了一种基于平滑性无监督领域自适应的开放世界目标检测方法。首先,利用两阶段目标检测Faster-RCNN为每一张图像生成候选区域,将目标得分高与目标得分极低的候选区域作为源域,将剩余候选区域作为目标域。然后,采用平滑性无监督领域自适应方法,学习前后景分类器,该方法通过引入平滑域对抗训练过程,能有效地提高域对抗方法在分类任务中的性能,实现对已知和未知类别的前景目标无偏向预测。在MS-COCO数据集以及自行构建的化学实验器材检测数据集上进行模型性能的评估实验。结果表明,相比于直接选择置信度最高的预测,本文提出的方法能更好地平衡已知和未知目标类别的检测,提高检测器的整体性能。

Abstract

Open World Object Detection (OWOD) aims to detect unseen objects in an environment and serves as an upstream task for various issues in intelligent education. Existing methods predict the top K most confident foregrounds by generalizing the detector, which was trained on known categories, to detect other unknown foreground objects. However, this approach tends to bias the detector towards known categories, hindering the identification of all unknown objects. To address this limitation, we propose an open world object detection method based on Smoothness Unsupervised Domain Adaptation. First, we use a two-stage object detector, Faster-RCNN, to generate candidate regions for each image. The regions with the highest and lowest object scores are considered the source domain, while the remaining regions are treated as the target domain. Then, we employ a smoothness unsupervised domain adaptation method to train a foreground-background classifier. This method introduces a smooth domain adversarial training process, enhancing the performance of domain adversarial methods in classification tasks. By utilizing this approach, we achieve unbiased predictions of foreground objects for both known and unknown categories. This article evaluates the performance of the model on the MS-COCO dataset and a self constructed chemical experimental equipment detection dataset. Experiments demonstrate that, compared to directly selecting the highest confidence predictions, the proposed method better balances the detection of known and unknown objects, improving overall detector performance.

Graphical abstract

关键词

开放世界目标检测 / 无监督领域自适应 / 域对抗训练 / 平滑度增强

Key words

open world object detection / unsupervised domain adaptation / domain adversarial training / smoothness enhancement

引用本文

引用格式 ▾
黄正翔,李书玮,齐恺,蔡杰超,徐锲,卢笑,吴成中,王耀南. 基于平滑性无监督领域自适应的开放世界目标检测[J]. 武汉大学学报(理学版), 2025, 71(5): 634-642 DOI:10.14188/j.1671-8836.2024.0101

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

当前,智慧教育技术的应用已经从封闭的教室场景走向更多更开放的环境中。例如,人工智能赋能的综合素质评价更倾向于通过学生在真实世界和自然场景中的表现性活动进行评价[1]。目标检测技术是智慧教育技术应用场景中的上游任务。在真实世界中,需要检测的目标往往是开放并且多样的,任何场景都可能包含目标检测器在训练中未见过的物体,并且要求其识别出新的类别。例如,对于智慧安全教育中,将环境中不熟悉的物体标记为“未知”以采取必要的教育策略或逐步学习环境中的新目标是很重要的。传统的目标检测方法通常局限于有限的已知类别,一旦遇到未知类别就难以正确识别。

检测未知物体是将环境中的未见目标检测出来,并将其类别标记为“未知(unknown)”,它是开放世界目标检测(Open World Object Detection, OWOD)的关键步骤,也是后续步骤的基础[2]。这一问题的难点是缺乏对未知类别的标签作为有效监督信息。现有方法通常采用Top-K选择策略生成标签。然而,Top-K选择策略存在两个缺点:首先,超参数K的选择需要通过手动调整实现,缺乏自适应性;其次,目标得分是使用已知类别训练的检测器计算出来的,计算结果不可避免地会偏向已知类别,同时倾向于为与已知类别相似的目标预测更高的分数。

为了解决以上问题,鉴于未见类别目标与已知类别目标的不同,本文从无监督域自适应(Unsupervised Domain Adaptation, UDA)[3]得到启发,将未知类别目标检测任务视为无监督领域自适应问题。在训练区分前景目标和后景区域的二分类器时,采用无监督领域自适应方法识别未知目标类别与已知类别目标的分布差异,弥补缺乏的标签信息,提升分类器对未见目标的泛化性能。

对抗训练(Adversarial Training)[4]是一种广泛应用的无监督领域自适应方法,通过对抗学习使源域和目标域特征分布趋于一致,从而增强模型在目标域的泛化性能。局部平滑的模型对输入数据小的变化不敏感,能够更好地适应未见数据[5]。尽管如此,对抗训练在实现过程中可能会遇到挑战,例如当源域和目标域的界限不明确时,训练的模型难以在参数空间中找到光滑的局部最优解,这会影响其泛化性能。

针对这一问题,本文引入模型的平滑度分析,通过分析平滑度增强对领域对抗训练的影响,并提出平滑领域对抗训练的方法,促使模型收敛到关于任务损失的平滑最小值,改善了对抗训练过程,避免了泛化性能不佳的问题,从而在未见目标检测上获得更好的性能。

1  相关工作

1.1 开放世界目标检测

Joseph等[2]最早提出了一种基于Faster-RCNN[6]的开放世界目标检测方法,简称ORE方法,ORE算法的贡献在于定义了开放世界目标检测问题,提出了一种新颖的解决方案,并设计了完备的实验衡量算法在开放世界目标检测上的性能。Zhao等[7]采用Faster-RCNN结构,通过增加一个辅助候选区域模块帮助识别未知候选区域。Gupta等[8]提出了基于DETR[9]的开放世界目标检测方法,使用注意激活图对未知类目标进行伪标记。Maaz等[10]提出了一种基于多模态视觉转换器的类无关目标检测方法,该方法可以通过修改输入提示符适应开放世界目标检测。尽管这些方法探索了不同的开放世界检测策略,但在泛化性能以及检测能力方面仍存在挑战和限制,且都未引入域适应方法。

1.2 无监督领域自适应

无监督领域自适应(UDA)可以将有标记的源域学习到的知识迁移到未标记的目标域[3]。UDA的方法主要分为自训练和对抗性学习[1112]。在自训练中,目标域用伪标签进行标记[13]。伪标签可以在离线模式下预先计算,然后用于训练模型[14]。此外,伪标签可以在训练期间在线生成。一些方法使用基于原型的伪标签[15]或基于数据增强[16]或domain-mixup[17]的一致性正则化[18]增强迁移能力。对抗性学习方法中,Ganin等[19]最早提出了域对抗神经网络(Domain Adversarial Neural Networks, DANN),通过对抗训练最小化源域和目标域之间的分布差异。此后,许多工作对DANN进行了改进和扩展。例如,Long等[20]提出的条件域对抗网络(Conditional Adversarial Domain Adaptation, CDAN)引入了分类器的条件信息,以更好地对齐不同类别样本的分布。Saito等[21]提出的最大分类差异(Maximum classifier discrepancy, MCD)方法通过最大化两个分类器在目标域上的差异实现自适应。Zhang等[22]提出了一种基于语义分类器的对抗性学习方法,通过在类内和类间对齐的方式进行语义知识的转移,有效减小了域间差异。AdvMix[23]方法引入了对抗性混合策略,通过全局域判别器进行对抗特征对齐,并结合自监督训练策略,提高了目标检测的准确性。但现有的这些对抗性学习方法仍然未能更有效地最小化域间差异,避免对抗训练的不稳定性等问题。

2  本文方法

2.1 方法原理

图1(a)展示了现有开放世界目标检测方法的Top-K选择策略。首先,利用训练好的已知类别“Apple”检测器对图像进行检测,生成候选区域;接着,对除已知类别(绿色框)以外的候选区域进行检测得分排序;最后,将前K个得分最高的目标标记为未知“Unkown”目标。由图1(a)可见,K个候选区域未能包含所有未知对象(橙色框),并且错误地包含背景区域(蓝色框)。图1(b)展示了检测器对不同目标的预测置信度得分。由图1(b)可见,检测器倾向于给已知类别(苹果)外观相似的未知目标更高的分数,如:“橘子”的得分远高于“香蕉”,而后景区域的得分则低得多。图2(a)则说明Top-K策略既不能保证K个候选区域都是未知目标,也不能覆盖所有未知候选区域。然而,由图2(a)可以得出结论,得分最低的候选区域往往是后景区域。

为了解决以上问题,本文采用无监督领域自适应方法,将未见目标(图2中的黄色部分)从已知前景目标(图2中的绿色部分)和后景区域(图2中的蓝色部分)中区分出来,如图2(b)所示,将有标注的已知前景目标(绿色部分)和高置信度(得分低)的后景区域的作为源域目标,其他目标作为目标域,利用无监督域自适应的方法将区分前景和后景目标的模型泛化到其他目标上。一方面可以避免手动调节超参数K;另一方面可以通过设计合适的域适应方法,减小算法对已知目标的偏见,提升对未见目标的感知能力。

2.2 算法整体框架

本文提出的开放世界目标检测方法整体框架如图3所示。给定输入图片,经过已知类别为“Dog”的两阶段目标检测Faster-RCNN,输出包含已知类别检测结果(绿框)及多个具有物体得分的未知类别候选区域(黄框)。对不匹配的候选区域进行排序,将具有真值标签的目标(绿框)标记为“1”,得分最低的候选区域(最有可能是后景区域)标记为“0”,二者共同构成源域目标;其余候选区域形成目标域。源域和目标域共同输入平滑性无监督领域自适应模块,训练前后景目标分类器,最终得到关于候选区域是否为目标的预测结果。

在平滑性无监督领域自适应模块中,不同于以往的对抗训练方法通过简单的任务损失(分类)和对抗损失实现源域和目标域的特征对齐,本文引入平滑任务损失,促使无监督领域自适应模块学习得到局部光滑的分类模型,有助于模型在目标域上更好地泛化。

2.3 平滑性无监督领域自适应方法

1) 无监督领域自适应问题定义

将有标注的源域数据表示为S={(xis,yis)},无标注的目标域数据表示为T={(xit)}。假设源域数据从输入空间X上定义的源域PS中采样,目标域数据从目标域PT中采样。Y表示标注的目标类别集合{1,2,,k}XY表示从图像到标签的映射。无监督领域自适应的目的是找到一个假设函数hθ,对目标分布具有较低的风险。函数hθ的源域风险,即期望误差,相对于损失函数l定义为:

RSl(hθ)=Ex~PS[l(hθ(x),y(x))]

函数hθ目标域风险RTl(hθ)定义与之类似,源域和目标域经验风险定义为R^Sl(hθ)R^Tl(hθ)[24],源域PS和目标域PT之间的差异定义如下:

Dhθ,Hϕ(PSPT)suph'H[Ex~PS[l(hθ(x),h'(x))]-Ex~PT[ϕ*(l(hθ(x),h'(x)))]

其中,ϕ*是满足ϕ(1)=0的下半连续凸函数ϕ的Fernchel共轭;H是所有可能假设的集合(即假设空间);h'(x)用作量化源域和目标域之间的分布差异,与主假设函数hθ(x)配对,通过上确界寻找能够最大化域差异测量的最优函数。差异距离Dhθ,Hϕ是基于凸函数ϕ的F-divergence[25]的变分公式所定义。基于此差异距离定义目标域风险的边界为[24]

RTl(hθ)RSl(hθ)+Dhθ,Hϕ(PSPT)+λ*

上述的泛化界限表明,目标风险RTl(hθ)受到源风险RSl(hθ)和差异项Dhθ,Hϕ(PSPT)以及一个不可避免的误差λ*的上界限制。(3)式说明减小源风险和差异项会导致目标风险的降低。

为了更好地解释无监督对抗域适应过程,将前后景预测器分解为特征提取模块gψ和分类器fθ两部分,则hθ=fθgψ,可以通过最小化任务损失,即前景目标与后景区域的二分类损失,实现对特征提取模块和分类器的优化;定义域判别器DΦ用于估计PSPT之间的差异,其目的是区分两个域的特征。为了使目标风险最小,结合(3)式的泛化界限,优化问题定义如下:

minθEx~PS[l(hθ(x),y(x))]+Dhθ,Hϕ(PSPT)

根据文献[24],差异项可约束为:

Dhθ,Hϕ(PSPT)maxΦdS,TΦ 

其中,

dS,TΦ=Ex~PS[log(DΦ(gψ(x)))]+Ex~PTlog[1-DΦ(gψ(x))]

因此,无监督对抗领域自适应的优化目标为:

minθmaxΦEx~PS[l(hθ(x),y(x))]+dS,TΦ

在实际应用中,(7)式中的第一项可通过使用有限样本进行经验近似R^Sl(hθ),并作为最小化任务损失;第二项的经验估计是对抗损失,使用梯度反转层(Gradient Reversal Layer, GRL)进行优化,以上过程构成领域对抗训练(Domain Adversarial Training, DAT)。

2) 平滑性对抗领域自适应

为了量化平滑性,分析源经验风险的Hessian矩阵H=θ2R^Sl(hθ),即任务损失的Hessian矩阵,将其迹Tr(H)和最大特征值(λmax)作为平滑性的衡量标准。两者的值越低代表具有更高的平滑度[26]

为了促进域对抗训练过程中学习得到局部平滑的模型,根据文献[26],引入基于锐度感知最小化的损失(Sharpness Aware Minimization, SAM)[27],SAM的基本思想是通过以下目标找到一个更平滑的最小值,即在θ的邻域ε内的较低损失:

minθmaxερLobj(θ+ε)

其中,Lobj是要最小化的目标函数,ρ0是定义ε最大范数的超参数。由于找到内部最大化的精确解很困难,SAM最大化了一阶近似:

ε^(θ)argmaxερLobj(θ)+εTθLobj(θ)=ρθLobj(θ)/θLobj(θ)2

ε^(θ)加到权重θ上;然后计算θ的梯度,更新为θLobj(θ)θ+ε^(θ)。上述过程可以看作是任意Lobj的平滑增强公式。类似地,引入寻找平滑最小值的锐度感知源风险[25]

maxερRSl(hθ+ε)=maxερEx~PS[l(hθ+ε(x),y(x))]

3) 平滑领域对抗训练

在以上分析的基础上,引入平滑域对抗训练,只关注收敛到平滑最小的任务损失,即经验源风险,同时保留原始差异项,将其优化目标定义如下:

minθmaxΦmaxερEx~PS[l(hθ+ε(x),y(x))]+dS,TΦ

第一项为锐度感知风险,第二项为未经过平滑的差异项,dS,TΦ项估计Dhθ,Hϕ(PSPT)差异,通过公式(11),可以有效降低RTl(hθ)

l为损失函数,λ*RSl(h*)+RTl(h*)h*为理想假设函数,则

RTl(hθ)maxερR^Sl(hθ+ε)+Dhθ,Hϕ(PSPT)+
γ(θ22/ρ2)+λ*

其中γ:R+R+是一个严格递增的函数。这个界限类似于域适应的泛化界限[24],(3)式与(12)式的主要区别在于锐化感知风险项maxερR^Sl(hθ+ε)替代了源风险项RSl(hθ),一个额外项取决于权重的范数γ(θ22/ρ2)。不等式右边第一项通过减少经验锐化感知源风险最小化(SAM损失);右边第二项通过减少源域和目标域之间的差异来最小化;右边第三项由于是权重范数的函数,可以通过使用L2正则化或权重衰减来减少,相比于原始的域适应公式,此方法减少了泛化误差。

3  实 验

3.1 实验设置

数据集:本文在MS-COCO(Microsoft Common Objects in Context)[28]数据集以及自行构建的化学实验器材检测数据集上评估模型的性能。MS-COCO是广泛应用的图像识别、分割和物体检测数据集,它包含了大量复杂且多样的日常生活场景图片,每张图片中标注了多个物体类别的信息。MS-COCO的数据划分方式与ORE[2]数据集的相同,将80个MS-COCO图像类别分成4个任务,每个任务有20个类实例,不与其他任务重叠,确保每个类别仅出现在一个任务中,将这4个任务记为{T1,T2,T3,T4}。当学习T1时,将其中包括的所有类别视为已知,其他任务中的类别视为未知,学习其他任务时的情况以此类推。由于T4任务不存在未知类别,本文仅在前三个任务上进行方法性能评估。化学实验器材数据集包含了2 441张图像,涵盖了中学化学实验中需要用到的大部分实验仪器,包括pH试纸、比色卡、玻璃板、木塞、搅拌棒、试管、酒精灯和试剂瓶等(11种)类别,通过在这个数据集上的测试,评估模型的泛化能力,确保其在面对新类别时仍能保持较高的识别准确率。

模型训练:采用Faster-RCNN的架构,遵循ORE[2]的结构,将Faster-RCNN的IoU阈值设置为0.5,只有当预测框和真实框的重叠面积达到或超过50%时,该预测才被视为正样本。Faster-RCNN的骨干网络使用预训练的ResNet-50网络。平滑性无监督域自适应模块采用从头训练ResNet-50的策略作为前后景的分类器,训练过程中,批处理大小设置为2,初始学习率设置为0.002 5,随机梯度下降(Stochastic Gradient Descent, SGD)的动量参数设置为0.9,权重衰减为0.001,温度参数为2.5[29],温度参数用于调整预测的置信度分布,减轻置信度过高的预测所带来的负面影响。所有实验均在1个NVIDIA 2080Ti GPU上进行。

3.2 评价指标

由于未知目标很容易被混淆为已知目标,本文使用混淆程度(Wilderness Impact, WI) [2]指标表示对未知目标的识别准确度,WI定义为:

WI=PKPKU-1

其中,PK为模型在已知类别上的估计精度,PKU为在已知类和未知类别上评估的精度。理想情况下,WI指标应该趋于0,因为当未知对象被加入测试集时,精度应当不会下降。使用绝对开集误差(Absolute Open-Set Error, A-OSE)和未知类别召回率(Unknown Recall, U-Recall)作为衡量指标。A-OSE代表被错误地归类为任何已知类的未知目标的数量。使用U-Recall而不是常用的mAP作为指标是因为数据集中所有可能的未知目标实例都没有标注。

3.3 实验结果

1) 参数敏感性实验

本文进行了两种参数敏感性实验,这两种参数分别是源域数据构建中前后景目标比例θ和平滑性程度ρ。① 通过改变θ,即改变从每张图像中采样的前景与后景候选区域数量的比值,训练不同的模型,得到的性能评估结果如表1所示。由表1可见,前景比例较高时,模型在识别未知物体方面表现较好。因为前景目标通常包含更多的关键信息,有助于模型学习到更具辨识度的特征。后景比例增加时,模型对未知物体的识别能力减弱。这是由于后景区域包含较多的无关信息,增加了模型的学习难度,干扰了对关键特征的捕捉。适当的前后景比例有助于平衡模型对关键信息和背景信息的学习,提高泛化能力。综合考虑,本文采用的θ为1∶1,此时,通过对抗领域自适应学习得到的模型在目标域上有更好的表现。② 测试了不同ρ值对应的算法性能,结果见表1ρ值越大,平滑程度越高。由表1可见,ρ>0值时算法性能均高于ρ=0(无平滑)时的,这表明平滑任务损失在提升模型性能方面起到了重要作用。ρ值过小,平滑度不足,导致模型对训练数据过拟合,泛化能力不足;ρ值过高,过度平滑,导致模型对细节特征的捕捉能力减弱,同样影响泛化性能。因此,本文选取ρ=0.020,此时模型效果最佳。以上参数敏感性实验均在T2上进行训练。

2) 与其他方法性能比较

为了更好地评估本文所提出方法的有效性,将本文的方法与以下3种OWOD方法进行比较,它们分别是:ORE-EBUI[2]、Faster-RCNN+PLU[30]和OW-DETR[8]。其中,ORE-EBUI、Faster-RCNN+PLU是基于Faster-RCNN的检测方法,OW-DETR[8]是基于DETR的模型,且ORE-EBUI以及OW-DETR为Top-K选择策略代表性方法。表2显示了4种方法对未知目标的检测结果。对比WI、A-OSE以及U-Recall指标的结果可见,本文方法基于平滑性无监督域自适应地训练了前后景分类器,其在相同的前三个任务上显著提高了检测器在检测未知目标时的性能,WI、A-OSE指标均优于其他方法,其中T2中U-Recall与T3中A-OSE均显著高于其他方法。在化学实验器材检测数据集上测试结果表明,相比于其他方法,本文所提出的方法增强了泛化能力,在三种评价指标上均有优势。实验结果体现出本文所提出的方法不仅在标准数据集上表现良好,同时也适用于特定的数据集。

3) 消融实验

为了验证平滑任务损失和无监督领域自适应策略对于模型整体的作用,本文进行了消融实验,如表3所示,基础模型(未引入平滑任务损失和无监督领域自适应策略)的WI指标为0.029,当引入平滑任务损失后,WI指标降低到0.027,并且A-OSE数量减少,未知类别召回率上升,这表明平滑任务损失有助于提高模型的稳定性和性能。同样,在没有无监督领域自适应策略的情况下,模型各项指标均劣于引入无监督领域自适应策略。当结合两种方法时,模型性能得到显著提高,这两种策略的结合可以有效提高模型的泛化能力和适应性。以上消融实验模型均在T2上进行训练。

4) 可视化结果及在智慧教育场景中的应用

图4图5为本文方法在智慧教育场景中的应用实例。图4第一行展示了本文所提出的检测器在智慧教室场景中的应用。可以观察到,对于已知类别,检测器检测到了每一位学生和老师、桌上的水瓶以及教室的显示屏;对于未知类别,检测器检测到从未在数据集中出现过的学习用平板。图4第二行展示了检测器在室外活动场景中的应用,检测器检测到已知类别学生和老师,同时检测到未知类别,学生手中的铲子以及远处的垃圾桶。图5展示了本文提出的检测器与其他方法在中学化学实验场景下实验器材检测的对比结果,图5的第一行是本文所提出的检测器在学生进行试剂瓶与试管之间操作时的结果,可以观察到,对比其他方法,本文方法检测出了所有物体,包括试剂瓶、试管、木塞以及学生,第二行是检测学生对试管以及pH试纸进行相关操作时的结果,检测器检测到未在训练时见过的试管以及搅拌棒等物体。由图4图5可知,对比其他方法,本文提出的检测器能够检测出的未知物体数量最多。

本文提出的方法作为人工智能赋能教育领域的基础问题和上游任务,能广泛应用于学生多场景活动数据的伴随式采集的教学评价、学习过程分析、学习风格挖掘等领域,例如对学生数据的检测与跟踪,对学生户外活动数据的采集,检测学生活动时出现的未知危险情况,如持有未知物体的可疑人员等。

4  结 语

本文提出了一种基于平滑性无监督领域自适应的开放世界目标检测方法;通过在两阶段目标检测Faster-RCNN生成的候选区域中引入平滑域对抗训练,有效地提升了已有方法在未知类别检测中的性能;将高得分和极低得分的候选区域视为源域,剩余候选区域视为目标域,并通过引入平滑性的约束,提升领域对抗训练的泛化能力,从而获得更好的检测性能。

实验结果表明,与传统的Top-K选择策略相比,例如ORE-EBUI、OW-DETR,本文方法在平衡已知和未知类别的检测方面具有显著优势,并且提高了检测器的整体性能。这表明,通过将开放世界目标检测任务重新表述为无监督领域自适应问题,并采用平滑域对抗训练,可以更有效地应对复杂环境下的目标检测需求。

未来的工作可以进一步探索如何在更复杂的场景下应用该方法,例如多模态数据融合或跨域检测。同时,考虑到实际应用中的计算资源限制,也可以研究更高效的模型训练和推理方法,以便在资源受限的环境中依然能够保持较高的检测性能。

参考文献

[1]

杨丽萍, 辛涛. 人工智能推动教育测评范式变革的机遇与挑战[J]. 中国考试2022(10): 13-21. DOI: 10.19360/j.cnki.11-3303/g4.2022.10.002 .

[2]

YANG L PXIN T. Artificial intelligence promotes the transformation of educational assessment paradigm: Opportunities and challenges[J]. Journal of China Examinations2022(10): 13-21. DOI: 10.19360/j.cnki.11-3303/g4.2022.10.002(Ch ).

[3]

JOSEPH K JKHAN SKHAN F Set al. Towards open world object detection[DB/OL]. [2024-01-23]. DOI: 10.1109/cvpr46437.2021.00577 .

[4]

GANIN YLEMPITSKY V. Unsupervised domain adaptation by backpropagation[J].Proceedings of Machine Learning Research201537: 1180-1189.

[5]

GOODFELLOW I JPOUGET-ABADIE JMIRZA Met al. Generative adversarial networks[EB/OL]. 2014arXiv: 1406.2661.

[6]

POGGIO TGIROSI F. Networks for approximation and learning[J]. Proceedings of the IEEE199078(9): 1481-1497. DOI: 10.1109/5.58326 .

[7]

REN S QHE K MGIRSHICK Ret al. Faster R-CNN: Towards real-time object detection with region proposal networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201739(6): 1137-1149. DOI: 10.1109/TPAMI.2016.2577031 .

[8]

ZHAO X WMA Y QWANG D Ret al. Revisiting open world object detection[J]. IEEE Transactions on Circuits and Systems for Video Technology202434(5): 3496-3509. DOI: 10.1109/TCSVT.2023.3326279 .

[9]

GUPTA ANARAYAN SJOSEPH K Jet al. OW-DETR: Open-world detection transformer[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 9225-9234. DOI: 10.1109/CVPR52688.2022.00902 .

[10]

CARION NMASSA FSYNNAEVE Get al. End-to-end object detection with transformers[C]//European Conference on Computer Vision. Cham: Springer, 2020: 213-229.10.1007/978-3-030-58452-8_13. DOI: 10.1007/978-3-030-58452-8_13 .

[11]

MAAZ MRASHEED HKHAN Set al. Class-agnostic object detection with multi-modal transformer[C]//European Conference on Computer Vision. Cham: Springer, 2022: 512-531.10.1007/978-3-031-20080-9_30. DOI: 10.1007/978-3-031-20080-9_30 .

[12]

LIU X FYOO CXING F Xet al. Deep unsupervised domain adaptation: A review of recent advances and perspectives[J]. APSIPA Transactions on Signal and Information Processing202211(1):e25. DOI: 10.1561/116.00000192 .

[13]

HOYER LDAI D XVAN GOOL L. DAFormer: improving network architectures and training strategies for domain-adaptive semantic segmentation[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2022: 9914-9925. DOI: 10.1109/CVPR52688.2022.00969 .

[14]

LEE D H. Pseudo-label: The simple and efficient semi-supervised learning method for deep neural networks[DB/OL].[2024-02-21].

[15]

YANG Y CSOATTO S. FDA: Fourier domain adaptation for semantic segmentation[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 408-4094. DOI: 10.1109/CVPR42600.2020.00414 .

[16]

ZHANG PZHANG BZHANG Tet al. Prototypical pseudo label denoising and target structure learning for domain adaptive semantic segmentation[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 12414-12424. DOI: 10.1109/CVPR46437.2021.01223 .

[17]

MELAS-KYRIAZI LMANRAI A K. PixMatch: Unsupervised domain adaptation via pixelwise consistency training[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 12430-12440. DOI: 10.1109/CVPR46437.2021.01225 .

[18]

ZHOU Q YFENG Z YGU Q Qet al. Context-aware mixup for domain adaptive semantic segmentation[J]. IEEE Transactions on Circuits and Systems for Video Technology202333(2): 804-817. DOI: 10.1109/TCSVT.2022.3206476 .

[19]

SOHN KBERTHELOT DLI C Let al. FixMatch: Simplifying semi-supervised learning with consistency and confidence[EB/OL]. 2020arXiv: 2001.07685.

[20]

GANIN YUSTINOVA EAJAKAN Het al. Domain-adversarial training of neural networks[EB/OL]. 2015arXiv: 1505.07818.

[21]

LONG M SCAO Z JWANG J Met al. Conditional adversarial domain adaptation[EB/OL]. 2017arXiv: 1705.10667. DOI: 10.1609/aaai.v32i1.11767 .

[22]

SAITO KWATANABE KUSHIKU Yet al. Maximum classifier discrepancy for unsupervised domain adaptation[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 3723-3732. DOI: 10.1109/CVPR.2018.00392 .

[23]

ZHANG Y MGAO Y JLI H Let al. Crucial semantic classifier-based adversarial learning for unsupervised domain adaptation[C]//2023 International Joint Conference on Neural Networks (IJCNN). New York: IEEE Press, 2023: 1-8. DOI: 10.1109/IJCNN54540.2023.10191498 .

[24]

CHEN R MLV D LDAI Let al. AdvMix: Adversarial mixing strategy for unsupervised domain adaptive object detection[J]. Electronics202413(4): 685. DOI: 10.3390/electronics13040685 .

[25]

ACUNA DZHANG G JLAW M Tet al. F-domain-adversarial learning: Theory and algorithms[EB/OL]. 2021arXiv: 2106.11344.

[26]

NGUYEN XWAINWRIGHT M JJORDAN M I. Estimating divergence functionals and the likelihood ratio by convex risk minimization[J]. IEEE Transactions on Information Theory201056(11): 5847-5861. DOI: 10.1109/TIT.2010.2068870 .

[27]

JASTRZEBSKI SSZYMCZAK MFORT Set al. The break-even point on optimization trajectories of deep neural networks[EB/OL]. 2020arXiv: 2002.09572.

[28]

FORET PKLEINER AMOBAHI Het al. Sharpness-aware minimization for efficiently improving generalization[EB/OL]. 2020arXiv: 2010.01412.

[29]

LIN T YMAIRE MBELONGIE Set al. Microsoft COCO: Common objects in context[M]//Computer Vision—ECCV 2014. Cham: Springer International Publishing, 2014: 740-755. DOI: 10.1007/978-3-319-10602-1_48 .

[30]

JIN YWANG X MLONG M Set al. Minimum class confusion for versatile domain adaptation[M]//Computer Vision—ECCV 2020. Cham: Springer International Publishing, 2020: 464-480. DOI: 10.1007/978-3-030-58589-1_28 .

[31]

LIU X YYUE Z QHUA X S. Proposal-level unsupervised domain adaptation for open world unbiased detector[EB/OL]. 2023arXiv: 2311.02342.

基金资助

国家自然科学基金(62007007)

国家自然科学基金(62277004)

湖南省自然科学基金(2023JJ30415)

湖南省自然科学基金(2022JJ30395)

江西省科技厅重大科技研发专项(20232ACC01007)

江西省科技厅重大科技研发专项(20232ABC03A09)

吉安市科技计划“揭榜挂帅”项目(20233TGV06020)

湖南省学位与研究生教学改革研究重点项目(2022JGZD026)

AI Summary AI Mindmap
PDF (3227KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/