基于时空上下文正则的孪生网络目标跟踪

张文幡 ,  李晶 ,  肖雅夫 ,  常军 ,  洪燕 ,  宋成芳

武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (2) : 177 -189.

PDF (9869KB)
武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (2) : 177 -189. DOI: 10.14188/j.1671-8836.2019.0602
其他

基于时空上下文正则的孪生网络目标跟踪

作者信息 +

Object Tracking via Spatio-Temporal Context Regularized Siamese Network

Author information +
文章历史 +
PDF (10105K)

摘要

在视频目标跟踪任务中,负样本缺乏、背景混杂会造成目标丢失。为解决上述问题,提出一种基于时空上下文正则的孪生网络目标跟踪算法。该算法将空间上下文信息引入到孪生网络中,并利用目标物体正样本以及背景负样本训练跟踪器,通过正则化约束,抑制跟踪器对背景的响应,突出对目标的响应,从而得到鲁棒性更强的目标跟踪器;采用时间序列多组件匹配机制,在目标外观模型受到干扰的情况下动态调整目标模型学习率,从而保证目标模板不受污染。在OTB100标准数据集上的实验表明,在混合干扰条件下,本文算法的准确率(0.885)和成功率(0.615)均优于其他主流跟踪算法。特别是在遮掩、运动模糊、光照变化、背景聚类和快速运动等干扰因素影响情况下,本文算法均具有较强的鲁棒性。

Abstract

In the task of the video object tracking, the lack of negative samples and the complex background will result in loss of objects. To solve the above problems, this paper proposes an object tracking algorithm via spatio-temporal context regularized Siamese network. This algorithm adds spatial context information to the Siamese network and uses the information of target object as the positive samples and the information of background as the negative samples to train a tracker model, which is more robust and can suppress the response to the background and highlight the response to the target through regularization constraint. Moreover, the algorithm proposes the mechanism of multi-component matching of the time series, which can dynamically adjust the target template learning rate when the target appearance characteristics are disturbed, thereby ensuring that the target template is not contaminated. Experiments on OTB100 standard dataset show that our algorithm is not only superior to mainstream tracking algorithms in both accuracy and success rate with scores of 0.885 and 0.615 respectively, but also has strong robustness when it faces interference factors such as occlusion, motion blur, illumination changes, background clustering, and fast motion.

Graphical abstract

关键词

目标跟踪 / 时空上下文 / 孪生网络 / 深度学习

Key words

object tracking / spatio-temporal context / Siamese network / deep learning

引用本文

引用格式 ▾
张文幡,李晶,肖雅夫,常军,洪燕,宋成芳. 基于时空上下文正则的孪生网络目标跟踪[J]. 武汉大学学报(理学版), 2020, 66(2): 177-189 DOI:10.14188/j.1671-8836.2019.0602

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

视频目标跟踪是指对于一组视频图像序列,在初始帧中给定感兴趣目标的坐标,通过算法在后续帧中对目标进行定位[1,2]。在计算机视频系统中,视频目标跟踪对于视频检索、运动分析和视频语义提取起着支撑作用,其跟踪质量对完成任务的成败具有较大影响。

为了使跟踪算法能够更加准确地定位到目标物体,研究人员主要提出了3类算法:生成式跟踪算法、判别式跟踪算法和相关滤波跟踪算法。1) 生成式跟踪算法[3,4,5,6] 。该类算法通过在视频数据中采集的图像信息,学习目标物体的图像表示并得到目标图像的字典,在定位时,利用学习得到的字典重构候选样本,其中具有最小误差的候选样本即被认为是目标物体。2) 判别式跟踪算法[7,8,9,10]。该类算法通过学习视频中初始帧的正样本和负样本,得到一个判别分类器,在后续帧中利用该分类器对各候选样本进行评分,具有最高得分的候选样本即被算法认为是目标图像。3) 相关滤波跟踪算法[11,12]。该类算法的核心思想是通过循环移位生成多个负样本,构建样本的循环矩阵,利用该矩阵在傅里叶域中的性质,得出滤波器的最优解。该类算法由于采用快速傅里叶变换(fast Fourier transform,FFT),计算效率更高,受到了广大研究者的关注。这几类目标跟踪算法中,对于图像的表示主要依赖于手工设计的特征,例如SIFT特征、Haar特征和HOG特征等。这些特征往往是根据特定的使用场景设计的,因此在目标跟踪任务中的一些复杂情况下,上述算法容易发生跟踪漂移和目标丢失。

近几年,基于深度卷积网络的方法在图像检测、识别和分类任务中取得了较大的进展[13,14],这为其在目标跟踪领域中的应用打下了基础。基于传统深度学习的跟踪方法主要利用其他领域中训练的深度网络模型进行跟踪,例如CF2[15]、HDT[16]、C-COT[17]和ECO[18]等。该类方法在跟踪精度上具有一定的优势,但由于这些深层的网络结构原本主要用于图像识别和分类,这些研究领域的实时性要求并不高,因此,若直接将这些网络结构应用于视频目标跟踪任务,难以满足实际需求。

基于上述分析,本文提出基于时空上下文正则的孪生网络目标跟踪算法,并在OTB100[19]和VOT2017[20]两个数据集上,将该算法与其他算法进行对比实验,验证其准确性和鲁棒性。

1  相关工作

1.1 基于孪生网络的目标跟踪

由于卷积神经网络(convolutional neural nets,CNN)在图像特征提取方面优秀的表现,使得其在各类计算机视觉任务方面的应用都取得了巨大成功,尤其是在物体识别与检测方面[21,22],此外一些目标跟踪模型也将CNN嵌入其框架中[23,24]。目前各种基于CNN的目标跟踪算法[25,26,27,28,29]对于CNN的使用思路不尽相同,其中利用现有大规模分类数据集预训练的CNN提取特征的这类方法得到了研究者的广泛关注[30,31,32,33,34,35,36]。这类方式的特点是跟踪之前使用数据集(如ImageNet[29])预先训练网络参数,跟踪过程中不再调整特征提取网络的参数,有效缓解了在线跟踪中的正样本训练数据有限、跟踪速度慢等问题,但对预训练数据集的规模有一定要求。

基于此,2016年,Bertinetto等[30]提出一种基于孪生网络的视频目标跟踪方法——SiamFC算法,它属于判别式跟踪算法的一种。孪生网络是一类包含两个或多个相同子网络的神经网络架构。这里的相同是指它们具有相同的配置即具有相同的参数和权重,并在两个子网上同步进行参数更新。该算法根据目标视频第一帧中真实数据提供目标位置,对目标区域提取深度特征,作为后续跟踪的目标模板,在第一帧之后的视频序列中,候选搜索区域是以上一帧目标位置为中心的更大范围区域,用相同的深度网络提取该区域深度特征,最后通过比较目标模板与候选搜索区域的相似度判断目标位置。相似度的计算公式如下

f(z,x)=ϕ(z)*ϕ(x)+bI

其中,*表示卷积, z 表示目标模板图像, x 表示搜索区域图像,ϕ表示对两个图像进行相同的特征提取操作,b表示偏置系数,I表示单位矩阵。SiamFC算法有效保留了空间信息,但由于模型的正样本信息过少,即使采用大规模数据集预训练网络,依旧会遇到过拟合的问题。

目前研究者在SiamFC算法基础上,提出了许多目标跟踪算法,如EAST[32]、CFNet[32]、SINT[33]、RASNet[34]和GOTURN[35]等。为了克服SiamFC算法的缺点,CFNet[32]将相关滤波算法引入到孪生网络。相关滤波算法的核心思想是设计一个相关滤波器,然后使用相关滤波器与当前帧进行相关性计算,根据计算结果预测目标位置。例如经典的相关滤波跟踪算法KCF[36]就是以目标为正样本,以目标周围的背景为负样本训练一个滤波器模板,使用滤波器模板识别前景与背景。该算法将滤波器的训练过程作为一个求解岭回归的问题

minwifxi-yi2+λw2

其中,λ是用于控制过拟合的参数;(2)式的目标是找到一个函数f(z)=wΤz,使得所有目标样本xi和对应的回归目标yi间的平方误差最小;由(2)式求解得到的w就是相关滤波器矩阵,CFNet不再使用第一帧提供的目标模板进行匹配搜索,而是用求解(2)式得到的w与搜索区域图像特征矩阵进行相似性计算。引入相关滤波算法使得孪生网络模型可以根据当前帧的信息以及之前帧的信息训练出一个相关滤波器,克服了SiamFC正样本信息过少的缺点,能够动态跟踪目标的外观变化,缺点是一旦遇到背景混杂、遮挡、光照变化等情况,由于滤波器的不断更新反而导致过度学习受污染的样本,随着误差的积累,滤波器的定位结果就会产生漂移甚至丢失。

1.2 基于上下文信息的目标跟踪

由上文可知,在目标跟踪领域中,一些算法仅仅利用了目标本身提供的信息,包括边缘、色彩、纹理等,而由于跟踪过程中负样本的缺乏导致这种跟踪算法具有局限性,一旦出现不同强度的干扰,很容易产生漂移甚至丢失跟踪目标[15,36,37]。由于遮挡物或者其他类型的干扰一般属于背景,而跟踪器的任务就是区分目标与背景,如果在跟踪过程中跟踪器能够同时学习目标信息以及目标背景组成的上下文信息,那么跟踪算法面对干扰时的鲁棒性将会更好[37]。因此,利用上下文信息进行跟踪成为了目标跟踪研究中的一个趋势,该类方法(如DSST算法[38]和STC算法[39]等)可以帮助各类跟踪算法获得了更准确的目标定位。

基于以上分析,针对目前孪生网络目标跟踪算法的不足,本文提出基于时空上下文正则的孪生网络目标跟踪算法,以解决在背景混杂、负样本缺乏情境下的目标跟踪问题。其中,时空上下文正则指的是引入背景空间信息作为正则项来训练跟踪器,同时采用时间序列多组件匹配机制以保证目标模板不受污染。

2  本文算法

2.1 算法结构

下文将从以下两方面介绍本文算法:1) 基于空间上下文正则的孪生网络目标跟踪模型;2) 时间序列多组件匹配机制。

图1所示为本文算法的网络结构,主要分为如下两部分。

1) 上下文图像分支和目标模板分支首先会在每一帧中分别采集目标上下文信息图像和目标图像,通过相同的预训练CNN提取这两者的特征;然后,经过特征提取后的上下文信息矩阵与目标特征矩阵将会在正则层进行融合(图中用h()表示),其中正则层的作用是引入上下文信息训练滤波器即相关滤波器,回归矩阵是指值服从高斯分布的矩阵,用于回归计算;再经过矩阵裁剪操作(Crop层)就可以得到同时包含目标以及背景信息的滤波器矩阵。

2) 搜索图像分支将待搜索图像作为输入,同样经过预训练CNN提取特征,再将待搜索图像特征矩阵与滤波器矩阵进行相似性计算就可以得到相似度矩阵,相似度矩阵得分最高的位置即为待搜索图像中目标的位置。

与大多数基于孪生网络的目标跟踪算法相比,本文算法不仅引入目标物体的背景信息,丰富了样本内容,而且提出在目标被干扰的条件下采用下文所述时间序列多组件匹配机制解决目标干扰问题。下面将详细介绍该算法的模型、机制和流程。

2.2 基于空间上下文正则的孪生网络目标跟踪模型

为了使跟踪算法既能够保持对目标外观变化的动态学习能力,同时又能够在强烈干扰因素下具有一定程度的鲁棒性,本文提出将空间上下文信息作为背景负样本,即上下文正则项,引入到孪生网络模型中。在介绍如何引入空间上下文之前,先介绍对其采用的采样策略。

2.2.1 空间上下文信息采样策略

选择合适的上下文信息对于提高本文提出的跟踪模型的性能至关重要,而最简单直接的方法是在目标周围均匀采样以获取上下文图像块。这样做的优势在于随着目标的运动,前若干帧中离目标较远的区域在当前帧中可能已经成为目标的背景,所以如果滤波器能够提前在前若干帧学习到上下文信息,就可以更好地区分当前帧中的目标与背景。

图2所示,滤波器同时学习某帧内的目标信息(正样本信息)和上下文信息(负样本信息)。由图2可知,即使跟踪目标被叶子挡住,由于已经提前把树叶作为背景负样本进行学习,因此滤波器模型依旧可以对目标与背景做出合理的区分。

2.2.2 问题形式化

接下来将详细介绍如何将空间上下文信息作为正则项引入孪生网络模型中。首先,将空间上下文信息作为一个输入嵌入到孪生网络模型中;接着,一方面利用空间上下文信息作为负背景样本(可能包括各种不同的干扰),另一方面把目标本身作为正样本,训练一个滤波器,它能够対目标中心产生极大的响应,同时对上下文信息的响应趋近于零,即能够抑制滤波器对背景的响应。这样,即使在混乱场景下,跟踪算法也能保持一定的鲁棒性。

基于时空上下文正则的孪生网络目标跟踪模型的具体实现方式如下。首先,本文算法在每一帧中都会根据2.2.1节所述采样策略在感兴趣的对象周围采样k个上下文图像块。这里规定目标对象图像矩阵为x0,第i个上下文采样图像矩阵为xii=1,2,…,k)。构建循环矩阵的方程如(3)式所示

x=c(x)=x1x2x3xnxnx1x2xn-1xn-1xnx1xn-2x2x3x4x1

其中,矩阵x的第一行为(x1,x2,,xn)表示目标样本,c表示一种映射,其余的样本则是由 x 循环移位形成,同理,可得到xi,如下式所示

xi=c(xi)=xi1xi2xi3xinxinxi1xi2xin-1xin-1xinxi1xin-2xi2xi3xi4xi1

其中,xin表示xi第一行的第n列。

然后,将包含上下文信息的正则项引入到(2)式的目标函数中,再通过整合上下文信息以及循环移位矩阵所得的目标函数为

minwx0w-y22+λ1w22+λ2i=1kxiw22

其中,λ1表示滤波器项的惩罚系数,λ2表示有关上下文信息的正则化系数, y 为响应矩阵。该目标函数期望有关上下文信息的正则项能够回归到零,也就是抑制滤波器对于背景的响应,突出对目标的响应。在求解(5)式的过程中,通过将目标图像的循环矩阵x0以及上下文图像的循环矩阵xixk重新组合,可以得到新的数据矩阵B

B=x0λ2x1λ2xk

B表示目标特征矩阵以及上下文特征矩阵的集合。

再将响应矩阵 y 改写成与B相同的形式,如(7)式所示

y¯=y00

把(6)式和(7)式同时代入(5)式,可得到目标函数的新表达形式

fp(w,B)=Bw-y¯22+λ1w22

与相关滤波求解岭回归[11]的解法类似,可以令(8)式的梯度为0,求得封闭解

w=(BΤB+λ1I)-1BΤy¯

其中, I 表示单位矩阵。

随着样本数目的增加,由于存在求逆计算,直接计算(9)式的解非常耗时,因此考虑通过循环位移矩阵的性质得到(8)式在傅里叶变换域的近似解[36]

ŵ=x̂0*ŷx̂0*x̂0+λ1+λ2i=1kx̂i*x̂i

其中,^表示傅里叶变换,*表示复共轭,表示矩阵元素之间的点乘。在图1中,ŵ对应空间正则层的结果,也就是目标信息与上下文信息融合后的滤波器。

最后,提取搜索区域图像的特征,如(1)式所示,本文算法中,z表示输入的搜索图像,ϕ表示CNN处理,最后将(10)式作为ϕ(x)代入(1)式,可以得到(11)式,它表示将包含上下文信息的滤波器与搜索区域图像做相似性计算。

f(z,x)=(x̂0*ŷ)*ϕ(z)x̂0*x̂0+λ1+λ2i=1kx̂i*x̂i+bI

式中,x̂0表示目标矩阵, x̂i表示上下文矩阵。

通过(11)式,可以得到整个网络模型的相似性图,也就是响应图,响应得分最高的位置即需要跟踪的目标位置。因此,引入上下文信息后,整个跟踪任务的目标定位过程可以表述为利用前一帧的目标特征和上下文信息特征联合训练出一个滤波器,该滤波器再对后一帧的搜索区域使用(11)式进行相关性计算,根据得到的响应矩阵判断目标在后一帧的新位置。

2.3 时间序列多组件匹配机制

由于本文算法是基于孪生网络框架的,而孪生网络是基于模版匹配的方式判别目标位置,所以目标模板更新策略是决定本文算法跟踪效果的关键。同时,为解决在复杂场景下目标跟踪任务遇到的干扰问题,本文提出了一种时间序列多组件匹配机制,并动态调整学习率进行模板更新。

该机制的工作流程如图3所示。首先,在跟踪的过程中模型会保留每一帧的目标特征,对于本文算法而言,由于使用CNN提取特征,也就是对每一帧目标的深度特征矩阵进行保存。然后,以若干帧数为一个集合对整个视频序列进行编组,整个视频序列被分割为若干个组,每个组内部用(12)式计算该组对应目标的平均外观特征

Ai=i=1l1ng(xi)

其中,l为负样本数量,n表示组内视频序列帧数,g(xi)表示第i帧图片的目标外观特征。最后,当跟踪任务进行到某组内的最后一帧时,模型会自动用(12)式计算该组内的目标平均外观特征,本文模型把第一组序列定义为初始组G1,正在进行跟踪的当前帧所在组为当前组Gi,并分别设定对应的目标平均外观特征矩阵为A1Ai。如果A1Ai的区分度超出一定阈值,则认为该时刻目标位置发生了干扰(如遮挡或形变),因此本文算法会降低目标模型的学习率,并把当前组定义为异常组Gp。经过计算得到的模板学习率

η=η0,A1-Ai<dη0-ξ*A1-Ai,A1-Ai>d

其中,ξ是变形系数;η0是模型的原始模板学习率;d是启动模板学习率动态更新的阈值,如果目标特征变化值小于d,那么η=η0保持不变,如果目标特征变化值大于d,那随着目标受到的干扰越来越剧烈, η会越来越低,直到η降到0,则表示目标模板不再更新。在后续跟踪过程中,如果当前组Gi与原始组G1平均外观特征的差距逐渐减小,那么η根据(13)式逐渐恢复为η0

2.4 算法描述

本文算法将融合空间上下文信息的孪生网络目标跟踪模型以及时间序列多组件匹配机制相结合,具体描述算法1所示。

3  实验结果

3.1 实验配置

为了验证本文算法的有效性,在实验部分,将本文算法与现有的几种主流跟踪算法在OTB100以及VOT2017两个标准数据集上进行实验,比较算法的准确性以及鲁棒性。

实验环境为Windows 10操作系统,MATLAB R2017b,计算机配置为Intel Core i5 3.4 GHz CPU,8 GB RAM,GPU为NVIDIA GeForce GTX 1060。在实验过程中,每段视频序列的第一帧目标位置由数据集提供的标定数据给出,并设置初始目标模板学习率为0.005,正则化常量λ1为10, λ2为0.04,参数设置始终保持不变。

3.2 OTB100数据集上的对比实验

3.2.1 实验数据集及评价标准

OTB100数据集包含100个视频序列,这100个视频具有11种干扰属性:遮挡、形变、光照变化、平面内旋转、超平面旋转、快速运动、背景聚类、目标超出视图、低分辨率、运动模糊以及尺度变化。测试这些不同的干扰对跟踪算法的影响,可以更好地分析以及评估在各种场景下本文算法的性能。

该数据集有两个评判标准,分别是准确率和成功率,分别对应准确率图和成功率图。准确率图的建立是以中心误差为基础的,是指满足中心误差在给定阈值dis以内的帧数占总帧数的百分比。中心误差指的是算法预测的目标位置与人工标注的真实值之间的欧氏距离。一般情况下设置阈值dis=20像素。成功率图的建立是以重叠率为基础的,重叠率的计算公式是

R=mini/mini

其中,mi, ni 分别是由第i帧图像中算法预测的跟踪结果和人工标定值确定的目标矩形框面积。成功率图表示重叠率大于阈值t的帧数占总帧数的百分比。阈值t的取值范围是[0,1],通常取t=0.5。跟踪算法的准确率和成功率均是基于曲线下方面积(area under the curve,AUC)得分计算得到。本实验采取的方式是一次运行评估策略(one-pass evaluation),即所有测试视频只运行一次。

3.2.2 定量分析

为定量分析本文算法的准确性和鲁棒性,在11种混合干扰共同影响情况下以及11种干扰单独影响情况下,测试本文算法(OURS)及12种其他跟踪算法的准确率和成功率。参与对比的12种算法包括DeepSRDCF[27]、SiamFC [30]、SAMF_AT[40]、SRDCFdecon[41]、SRDCF[42]、Staple[43]、HDT[16]、DCFNet[44]、LCT[45]、MEEM[46]、DSST[37]、KCF[36]

1) 混合干扰共同影响情况下算法的性能分析

图4(a)和图5(a)分别显示了在11种混合干扰共同影响情况下上述13种算法的准确率和成功率。由图4(a)和图5(a)可知,本文算法的总体准确率和总体成功率均最高。图4(a)中, 本文算法的准确率是0.885,相比DeepSRDCF和HDT算法分别提高了5.1%和8.0%。在图5(a)中,本文算法的成功率是0.615,相比DeepSRDCF和SiamFC算法分别提高了4.7%和5.6%。

2) 11种干扰单独影响情况下算法的性能分析

为了验证本文算法在各种不利条件下的跟踪效果,分别在11种干扰单独影响情况下,对上述13种跟踪算法的准确率和成功率进行比较。

图4(b)~4(l)可知,在各种干扰单独影响情况下,本文算法的准确率均最高。由图5(b)~5(l)可知,在各种干扰单独影响情况下,除了在包含低分辨率属性的视频中本文算法比SiamFC算法的成功率低7.6%以外,其他干扰情况下,本文算法成功率均高于其他算法。

总体看来,在11种干扰影响情况下,与其他12种算法相比,本文算法目标跟踪的成功率和准确率均较高。 由于本文算法提出引入上下文信息以及时间序列多组件匹配机制,以解决跟踪器的鲁棒性问题以及目标的外观干扰问题,因此遮挡、运动模糊、光照变化、背景聚类和快速运动这几种与本文提出算法的创新点相关的属性是需要着重关注的,而在这些干扰影响情况下,与其他算法相比,本文算法的准确率和成功率均最高,说明本文算法对处理这几类干扰的性能优于其他算法。

3) 跟踪速度

为了测试本文算法的跟踪速度,将本文算法与上述12种算法在OTB100数据集上的平均每秒跟踪帧数进行统计,实验结果如表1所示。由表1可知,算法运行速度前3名分别是KCF[36]、 Staple[43]和 LCT[45]算法。其中,基于手工方式提取特征的KCF算法运行速度达到174.6 fps,这说明目前采取传统手工方式提取特征的跟踪方法仍然比基于CNN提取特征的算法的目标跟踪速度更快。虽然本文算法是基于CNN提取特征,并且需要同时采集上下文信息和目标信息,增加了计算负载,但是相对于DCFNet[44],SRDCF[42],SRDCFdecon[41],SAMF_AT[40]等算法,本文算法的目标跟踪速度仍然有一定的优势。

3.2.3 定性分析

在本节中,将会对本文算法与7种成功率和准确率均较高的跟踪算法在5种不同干扰影响下的跟踪结果进行定性分析,并讨论分析跟踪结果中具有代表性的视频截图。图6展示了本文算法与其他7种算法对OTB100数据集中的10个视频进行目标跟踪的结果。图6中“#0442”表示该视频序列运行到了第442帧,以此类推。

1) 光照变化

本文选择CarDark和Sylvester视频序列分析不同算法在光照变化影响下的目标跟踪性能。如图6(a)所示,在Sylvester视频中,光照变化主要来自于跟踪目标在台灯光源下的位置变化。在第1 081帧中,SiamFC和MEEM算法发生漂移现象,但是在跟踪目标随后的向上移动中(如#1110,#1111),MEEM算法的检测机制又能重新检测到目标(如#1111),在后续跟踪中,Staple、KCF和LCT算法陆续丢失目标(如#1329),而本文算法始终能紧紧跟随目标的变化,这是因为本文算法检测到了外观模型受到的光照干扰,并通过降低目标模板学习率应对这种干扰变化。如图6(b)所示,在CarDark视频中,光照变化主要来自于目标车辆反射左侧的光源,由于光照变化过于剧烈,LCT、SiamFC和KCF算法从第287帧就出现漂移现象,在第332帧时完全丢失跟踪目标,而DCFNet算法以及本文算法的目标跟踪效果较好,能够保持对目标的持续追踪。

2) 遮挡

本文选择Coke和Soccer视频序列分析不同算法在遮挡影响下的目标跟踪性能。在这两个视频序列中跟踪目标会在某些时间段遭受不同程度的遮挡。如图6(c)所示,在Coke视频序列中,当跟踪目标可乐罐经过盆栽时,会被盆栽叶子遮挡(如#0268),当目标重新出现时(如#0283),本文算法能够重新检测到目标。这是因为在经过叶子之前,根据上下文信息得到的滤波器模型会抑制本文算法对叶子区域的响应,而经过叶子时,根据时间序列多组件匹配机制检测到目标外观受到较大干扰,会降低目标模板学习率,因此,经过叶子后,本文算法的滤波器模型依旧可以对目标区域产生较大的响应,从而重新定位到可乐罐上。KCF算法在跟踪Coke视频序列时,由于不断地更新滤波器模型使得后续跟踪过程中滤波器对绿叶区域产生较大响应,因此KCF算法会一直定位在绿叶上(如#0283)。在如图6(d)所示的Soccer视频序列中,由于目标被奖杯严重遮挡(如#0095),MEEM算法的跟踪结果发生轻微的漂移;DCFNet和LCT算法由于未能检测到奖杯被遮挡,一直都在不停地更新目标模型,最终导致跟踪目标丢失(如#0316,#0317);本文算法由于采用了针对遮挡的检测机制并采集了目标周围的上下文信息对滤波器模型进行更新,所以能够始终保持精确的目标定位(如#0324,#0325,#0326)。

3) 运动模糊

本文选择Box和Boy视频序列分析不同算法在运动模糊影响下的目标跟踪性能。运动模糊是指目标区域由于目标或摄像机的运动导致的模糊现象。如图6(e)所示,在Box视频序列中,跟踪目标是盒子。在第20、32和43帧中,由于目标的迅速移动,目标外观明显变得模糊,LCT、 SiamFC和 HDT算法并没有对应的处理机制,所以在第43帧中这3种算法均丢失跟踪目标。

在后续视频帧(如#0431,#0432,#0433)中,由于本文算法的滤波器始终能够抑制对背景的响应并突出对目标的响应,所以能够持续跟踪目标。而在如图6(f)所示的Boy视频序列中,由于跟踪目标做出各种大幅度动作以及摄影机的晃动造成了运动模糊现象,但是目标周围背景简单并且其他干扰因素较少,因此所有算法都取得了不错的跟踪效果(如#0020,#0100,#0200,#0300,#0400,#0500)。

4) 背景聚类

本文选择Basketball和Football1视频序列分析不同算法在背景聚类影响下的目标跟踪性能。如图6(g)所示,在Basketball视频序列中,算法需要追踪的对象是一名穿绿色球衣的球员,他的背景周围存在许多与目标类似的干扰物,但由于视频序列中该球员移动速度过快,导致目标球员容易与他的4名队友混淆,如Staple和SiamFC算法就跟踪到目标的队友身上(如#0707,#0708)。如图6(h)所示,在Football1视频序列中,由于球员之间的对抗更加激烈,背景聚类现象更为明显,此外本序列的跟踪目标还受到平面旋转和超平面旋转的综合干扰因素的影响。受以上干扰影响,DCFNet算法在第46帧开始发生漂移,在第57帧以及后续帧中完全丢失目标,而本文算法以及其余算法均取得了不错的效果。

5) 快速运动

本文选择Couple和Deer视频序列分析不同算法在目标快速运动情况下的跟踪性能。如图6(i)所示,在Couple视频中,运动目标在人行道上快速行走,目标的背景特征变换迅速。KCF算法由于持续更新滤波器模型,因此在跟踪过程中随着误差的积累,很快丢失跟踪目标(如#0035);Staple算法起初发生少量漂移(如#0105),随后也丢失跟踪目标(如#0111);本文算法在更新滤波器模型时,引入周围背景信息作为负样本训练滤波器,因此即使周围背景信息特征发生剧烈的快速变化,滤波器还是能够抑制对背景特征的响应,从而实现准确定位目标(如#0132)。如图6(j)所示,在Deer视频序列中,鹿在河中快速运动,并且伴随着运动模糊和背景聚类因素干扰,Staple和LCT算法很快丢失目标(如#0026,#0042,#0043,即图6(j)第10行2~4列对应截图),而本文算法、HDT以及LCT等算法均能较准确地跟踪目标。

3.3 VOT2017数据集上的对比实验

VOT2017数据集一共有60个视频序列,由于跟踪目标更小,运动速度更快,所以相较于OTB100数据集,对该数据集中视频进行目标跟踪的难度更高。VOT2017数据集将精确度(accuracy)、鲁棒性和平均重叠期望(expect average overlaprate,EAO)作为评估指标。用以衡量算法精确度的参数(accuracy rank)可通过将算法预测的矩阵框与真实值提供的矩阵框的交集面积除以两矩形框的并集面积计算得到,该数值越小,代表算法精确度越高。用以衡量算法鲁棒性的参数(robustness rank) Rs=e-SM,其中,S是通过手工选择的参数,表示可以连续跟踪的帧数;M表示平均失败间隔帧数,可由M=F0/N计算得到,N表示序列长度,F0表示总跟踪失败次数。Rs 越大,表示算法鲁棒性越弱。EAO是指算法在视频序列上无重置平均重叠的期望值。

在VOT2017数据集上,将本文算法与另外7种算法的精确度和鲁棒性实验结果进行了对比。这7种算法分别是CCOT[17],SiamDCF[44],ECOhc[18],SiamFC[30],Staple[43],ASMS[47],MOSSE_CA[39]表2是VOT2017评判标准中的A-R表格。从表2中可以看出,与其他算法相比,本文算法Rs 最小即鲁棒性最高,且精确度仅次于Staple算法。与同样是基于孪生框架的SiamFC以及SiamDCF算法相比,本文算法性能的提升主要体现在鲁棒性上,这是因为本文算法引入上下文信息,并通过背景抑制效应以及采取时间序列多组件匹配机制使得算法的鲁棒性大幅度增强。

EAO是VOT2017数据集判断算法性能的关键指标,主要用以评价一个算法在长时间内的精确度。如表3所示,与其他算法相比,本文算法的EAO最高,说明本文算法不仅鲁棒性较高,而且还能保证一定时间内跟踪的精确度。

4  结 语

基于孪生网络的跟踪算法普遍具有跟踪效率高、网络结构简单等优点,但是由于负样本缺乏以及背景混杂等因素,导致该类算法在面对复杂场景下的跟踪任务时,效果不够理想。本文提出的基于时空上下文正则的孪生网络目标跟踪算法从丰富样本信息以及目标模板动态学习两个角度出发,解决上述问题:一方面,将空间上下文信息引入孪生网络,作为负样本训练滤波器,使得滤波器的鲁棒性更强;另一方面,提出时间序列多组件匹配机制,根据物体受干扰程度动态调节目标模板学习率,防止目标模板外观特征受到污染。

由OTB100和VOT2017两个数据集的测试结果可知,与当前主流跟踪算法相比,本文算法的精确度和鲁棒性均较高,尤其是能够有效应对遮挡、运动模糊、光照变化、背景聚类和快速运动等复杂干扰因素的影响。

参考文献

[1]

YANG H, SHAO L, ZHENG F, et al. Recent advances and trends in visual tracking: A review [J]. Neurocomputing, 2011, 74(18):3823-3831. DOI:10.1016/j.neucom.2011.07.024 .

[2]

YILMA A, JAVED O, SHAH M. Object tracking: A survey [J]. ACM Computing Surveys, 2006, 38(4):1-45. DOI:10.1145/1177352.1177355 .

[3]

HO J, LEE K, YANG M, et al. Visual tracking using learned linear subspaces [C]// IEEE Computer Society Conference on Computer Vision & Pattern Recognition. New York: IEEE Press, 2004:782-789.DOI:10.1109/CVPR.2004.1315111 .

[4]

HU W M, LI X, LUO W H, et al. Single and multiple object tracking using log-euclidean riemannian subspace and block-division appearance model [J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2012, 34(12):2420-2440. DOI:10.1109/TPAMI.2012.42 .

[5]

ROSS D A, LIM J, LIN R S, et al. Incremental learning for robust visual tracking[J]. International Journal of Computer Vision,2008, 77(1): 125-141. DOI:10.1007/s11263-007-0075-7 .

[6]

MEI X, LING H. Robust visual tracking using l1 minimization [C] // Proceedings of the 2009 IEEE International Conference on Computer Vision. New York: IEEE Press, 2009: 1436-1443.DOI:10.1109/ICCV.20 .

[7]

GRABNER H, LEISTNER C, BISCHOF H. Semi-supervised on-line boosting for robust tracking [C]// ECCV 08 Proceedings of the 10th European Conference on Computer Vision. Heidelberg:Springer⁃Verlag, 2008:234-247.DOI: 10.1007/978-3-540-88682-2_19 .

[8]

ZHANG Z, WARRELL J, TORR P H S. Proposal generation for object detection using cascaded ranking SVMs [C]// 2011 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2011:1497-1504.DOI:10.1109/CVPR.2011.5995411 .

[9]

SUN H, LI J, CHANG J, et al. Efficient compressive sensing tracking via mixed classifier decision [J]. Science China Information Sciences, 2016, 59(7):72-102. DOI:10.1007/s11432-015-5424-5 .

[10]

SUN H, LI J, DU B, et al. On combining compressed sensing and sparse representations for object tracking[C]// PCM 2016 17th Pacific⁃Rim Conference on Advances in Multimedia Information Processing. Heidelberg: Springer⁃Verlag, 2016:32-43.DOI: 10.1007/978-3-319-48890-5_4 .

[11]

HENRIQUES J F, RUI C, MARTINS P, et al. High-speed tracking with kernelized correlation filters [J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2015, 37(3):583-596. DOI: 10.1109/tpami.2014.2345390 .

[12]

孙航, 李晶, 杜博,. 基于多阶段学习的相关滤波目标跟踪[J]. 电子学报, 2017, 45(10):2337-2342. DOI: CNKI:SUN:DZXU.0.2017-10-004 .

[13]

SUN H, LI J, DU B, et al. Correlation filtering target tracking based on online multi-lifespan learning [J]. Acta Electronica Sinica, 2017, 45(10):2337-2342. DOI: CNKI:SUN:DZXU.0.2017-10-004(Ch).

[14]

REN S, HE K, GIRSHICK R, et al. Faster R-CNN: Towards real-time object detection with region proposal networks[C]// NIPS 15 Proceedings of the 28th International Conference on Neural Information Processing Systems. Cambridge: MIT Press, 2015:91-99.DOI: 10.1109/TPAMI.2016.2577031 .

[15]

REDMON J, DIVVALA S, GIRSHICK R, et al. You only look once: Unified, real-time object detection [C]// 2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016:779-788.DOI:10.1109/CVPR.2016.91 .

[16]

MA C, HUANG J B, YANG X, et al. Hierarchical convolutional features for visual tracking [C]// ICCV 15 Proceedings of the 2015 IEEE International Conference on Computer Vision. New York: IEEE Press, 2016:3074-3082.DOI:10.1109/ICCV.2015.352 .

[17]

QI Y, ZHANG S, QIN L, et al. Hedged deep tracking[C]// 2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016:4303-4311.DOI: 10.1109/CVPR.2016.466 .

[18]

DANELLJAN M, ROBINSON A, KHAN F S, et al. Beyond correlation filters: Learning continuous convolution operators for visual tracking[C]// European Conference on Computer Vision (LNCS 9909). Heidelberg: Springer⁃Verlag, 2016: 472-488.DOI:10.1007/978-3-319-46454-1_29 .

[19]

DANELLJAN M, BHAT G, KHAN F S, et al. ECO: Efficient convolution operators for tracking [C]// 2017 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2017:6931-6939.DOI:10.1109/CVPR.2017.733 .

[20]

WU Y, LIM J, YANG M H. Object tracking benchmark [J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2015, 37(9):1834-1848. DOI:10.1109/TPAMI.2014.2388226 .

[21]

KRISTAN M, LEONARDIS A, MATAS J, et al. The visual object tracking VOT2017 challenge results[C]// 2017 IEEE International Conference on Computer Vision Workshop. Washington D C: IEEE Computer Society, 2017:1949-1972.DOI:10.1109/ICCVW.2017.230 .

[22]

XU Y Z, YU G Z, WANG Y P, et al. Car detection from low-altitude UAV Imagery with the faster R-CNN[J]. Journal of Advanced Transportation, 2017, 2017:1-10. DOI:10.1155/2017/2823617 .

[23]

REN S, HE K, GIRSHICK R, et al. Object detection networks on convolutional feature maps [J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2017, 39(7):1476-1481. DOI:10.1109/TPAMI.2016.2601099 .

[24]

管皓, 薛向阳, 安志勇. 深度学习在视频目标跟踪中的应用进展与展望[J]. 自动化学报, 2016, 42(6):834-847. DOI:10.16383/j.aas.2016.c150705 .

[25]

GUAN H, XUE X Y, AN Z Y. Advances on application of deep learning for video object tracking [J]. Acta Automatica Sinica, 2016, 42(6):834-847. DOI:10.16383/j.aas.2016.c150705(Ch).

[26]

高君宇, 杨小汕, 张天柱,. 基于深度学习的鲁棒性视觉跟踪方法[J]. 计算机学报, 2016, 39(7):1419-1434.DOI:10.11897/SP.J.1016.2016.01419 .

[27]

GAO J Y, YANG X S, ZHANG T Z, et al. Robust visual tracking method via deep learning [J]. Chinese Journal of Computers, 2016, 39(7):1419-1434. DOI:10.11897/SP.J.1016.2016.01419(Ch).

[28]

WANG N, YEUNG D Y. Learning a deep compact image representation for visual tracking[C]// NIPS 13 Proceedings of the 26th International Conference on Neural Information Processing Systems. New York: ACM Press, 2013:809-817.DOI: http://respository.ust.hk/ir/Record/1783.1-61168 .

[29]

WANG L J, OUYANG W L, WANG X G, et al. Visual tracking with fully convolutional networks[C]//2015 IEEE International Conference on Computer Vision. New York: IEEE Press, 2015:3119-3127.DOI: 10.1109/ICCV.2015.357 .

[30]

DANELLJAN M, HAGER G, KHAN F S, et al. Convolutional features for correlation filter based visual tracking [C]// 2015 IEEE International Conference on Computer Vision Workshop. New York: IEEE Press, 2015:621-629.DOI: 10.1109/ICCVW.2015.84 .

[31]

HOMG S, YOU T, KWAK S, et al. Online tracking by learning discriminative saliency map with convolutional neural network [J]. Computer Science, 2015, 37(5):597-606. DOI: 10.1109/TIP.2015.2510583 .

[32]

RUSSAKOVSKY O, DENG J, SU H, et al. ImageNet large scale visual recognition challenge [J]. International Journal of Computer Vision, 2015, 115(3):211-252.

[33]

BERTINETTO L, VALMADRE J, HENRIQUES J F, et al. Fully-convolutional Siamese networks for object tracking [C]// European Conference on Computer Vision(LNCS 9914). Heidelberg: Springer⁃Verlag, 2016:850-865.DOI: 10.1007/978-3-319-48881-3_56 .

[34]

HELD D, THRUN S, SAVARES S. Learning to track at 100 fps with deep regression networks [C]//European Conference on Computer Vision (LNCS 9905). Heidelberg: Springer⁃Verlag, 2016:749-765.DOI: 10.1007/978-3-319-46448-0_45 .

[35]

CHEN H, LUCRY S, RAMANAN D. Learning policies for adaptive tracking with deep feature cascades[C]// 2017 IEEE International Conference on Computer Vision. Washington D C: IEEE Computer Society, 2017:105-114.DOI:10.1109/ICCV.2017.21 .

[36]

VALMADRE J, BERTINETTO L, HENRIQUES J, et al. End-to-end representation learning for correlation filter based tracking [C]// 2017 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2017:5000-5008.DOI:10.1109/CVPR.2017.531 .

[37]

TAO R, GAVVES E, SMEULDERS A W M. Siamese instance search for tracking [C]// 2016 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2016:1420-1429.DOI: 10.1109/CVPR.2016.158 .

[38]

WANG Q, TENG Z, XING J L, et al. Learning attentions: Residual attentional Siamese network for high performance online visual tracking [C]// 2018 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2018:678-680.DOI: 10.1109/CVPR.2018.00510 .

[39]

HENRIQUES J F, RUI C, MARTINS P, et al. High-speed tracking with kernelized correlation filters [J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2015, 37(3):583-596. DOI: 10.1109/tpami.2014.2345390 .

[40]

MUELLER M, SMITH N, GHANEM B. Context-aware correlation filter tracking [C]// 2017 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2017:1387-1395.DOI:10.1109/CVPR.2017.152 .

[41]

DANELLJAN M, HAGER G, KHAN F S, et al. Accurate Scale Estimation for Robust Visual Tracking [EB/OL]. [2018-01-06].

[42]

ZHANG K H, ZHANG L, YANG M H, et al. Fast Tracking via Spatio-Temporal Context Learning [EB/OL]. [2018-03-05].

[43]

BIBI A, MUELLER M, GHANEM B. Target response adaptation for correlation filter tracking[C]// European Conference on Computer Vision (LNCS 9910). Heidelberg: Springer⁃Verlag, 2017:419-433.DOI: 10.1007/978-3-319-46466-4_25 .

[44]

DANELLJAN M, HAGER G, KHAN F S, et al. Adaptive decontamination of the training set: A unified formulation for discriminative visual tracking [C]// 2016 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2016:1430-1438.DOI:10.1109/CVPR.2016.159 .

[45]

DANELLJAN M, HAGER G, KHAN F S, et al. Learning spatially regularized correlation filters for visual tracking [C]// 2018 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2018:1353-1356.DOI:10.1109/ICCV.2015.490 .

[46]

BERTINETTO L, VALMADRE J, GOLODETZ S, et al. Staple: Complementary learners for real-time tracking[C]// 2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016:1401-1409.DOI: 10.1109/CVPR.2016.156 .

[47]

WANG Q, GAO J, XING J, et al. DCFNet: Discriminant Correlation Filters Network for Visual Tracking [EB/OL].[2017-04-13].

[48]

MA C, YANG X, ZGANG C, et al. Long-term correlation tracking[C]// 2015 IEEE Conference on Computer Vision and Pattern Recognition. Washington D C: IEEE Computer Society, 2015:5388-5396.DOI: 10.1109/CVPR.2015.7299177 .

[49]

ZHANG J, MA S, SCLAROFF S. MEEM: Robust tracking via multiple experts using entropy minimization[C]// 2014 European Conference on Computer Vision. Heidelberg: Springer⁃Verlag, 2014:188-203.DOI: 10.1007/978-3-319-10599-4_13 .

[50]

VOJIR T, NOSKOVA J, MATAS J. Robust scale-adaptive mean-shift for tracking [J]. Pattern Recognition Letters, 2014, 49(3):250-258. DOI:10.1007/978-3-642-38886-6_61 .

基金资助

国家自然科学基金青年科学基金项目(41201404)

中央高校基本科研业务费专项基金(2042018gf0008)

AI Summary AI Mindmap
PDF (9869KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/