一种融合本体与条件随机场的视频语义提取方法

钟忺 ,  黄文心 ,  卢炎生 ,  刘文璇 ,  袁景凌

武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (3) : 268 -276.

PDF (1128KB)
武汉大学学报(理学版) ›› 2020, Vol. 66 ›› Issue (3) : 268 -276. DOI: 10.14188/j.1671-8836.2019.0133
计算机科学

一种融合本体与条件随机场的视频语义提取方法

作者信息 +

A Video Semantic Extraction Method Based on Fusion Ontology and Conditional Random Field

Author information +
文章历史 +
PDF (1154K)

摘要

从时空角度结合条件随机场模型及本体概念,提出了一种视频语义特征提取方法,其中包括视频低层特征模型参数估计(model parameter estimation,MPE)算法和高层对象语义模型更新(model update,MU)算法。该方法可以实现视频语义概念本体的自动提取和标注,为语义特征提取及分析提供支持。实验结果表明,该方法提升了视频语义特征提取的精确率和召回率。

Abstract

This paper proposes a video semantic feature extraction method from the perspective of time-space with conditional random domain model and ontology, which includes video low-level feature model parameter estimation (model parameter estimation,MPE) algorithm and high-level object semantic model update (model update,MU) algorithm. This method can realize the automatic extraction and annotation of video semantic concept ontology. It can provide support for semantic feature extraction and analysis. The experiment’s results show that the method improves the precision and recall rate of video semantic feature extraction.

Graphical abstract

关键词

语义特征提取 / 视频语义分析 / 模型参数估计 / 模型更新 / 条件随机场

Key words

semantic feature extraction / video semantic analysis / model parameter estimation(MPE) / model update(MU) / conditional random field

引用本文

引用格式 ▾
钟忺,黄文心,卢炎生,刘文璇,袁景凌. 一种融合本体与条件随机场的视频语义提取方法[J]. 武汉大学学报(理学版), 2020, 66(3): 268-276 DOI:10.14188/j.1671-8836.2019.0133

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

由于视频具有表现力强、信息量大的特点,因此理解视频信息从而准确检索就显得十分重要。检索视频是建立在语义信息的基础之上的。选取合适的视频语义特征、构造正确的视频语义提取方法,是准确检索视频数据的关键所在,也为实现视频内容分析等工作打下基础[1]

目前,运用较广泛的视频语义提取方法有如下几种。

1) 基于概率统计的方法[2]。这类方法的研究与应用较为广泛,比较成熟的有决策树[3,4](decision tree)、贝叶斯网络[5,6](Bayesian network, BN)、朴素贝叶斯[4,7](naive Bayesian, NB)等。

2) 统计学习法。比较典型的方法有支持向量机[8,9](support vector machine, SVM),高斯混合模型[10,11](Gaussian mixture model, GMM)、隐马尔科夫模型[12,13](hidden Markov model, HMM)等。

3) 规则推理法,它根据视频大数据内容的特点,结合专业知识,制定相关的推理规则,并以此来推导提取视频的语义特征[14,15]。当前,这类方法主要关注于将模糊理论应用在规则的制定中[16]

4) 特定领域知识法,它是通过限定视频的应用领域,来简化视频中相关语义概念和事件的随机性,减少视频低层视觉特征向高层语义映射过程中产生的诸多不足[17],主要应用在如影视制作、目标检测跟踪等特定领域。

由于本体具备较强的语义鉴别能力,即不同的概念本体之间差异性大,且具有不变性,因而在本文的研究中主要采用概念本体来表征视频的语义特征。本文主要针对像素域视频的语义特征提取方法进行研究,即如何有效地提取出适合视频语义检索的特征,并对视频语义的表示进行相关描述。

结合国内外针对视频语义特征提取方法的各类研究[18,19,20],本文针对视频语义检索的实际需要与目标,基于条件随机场[21,22](conditional random field, CRF)方法及相关的概率统计学知识,探索使用机器自动标注视频语义特征概念本体,提出了一个融合本体与条件随机场的视频语义特征提取方法。

1  视频语义特征提取框架

视频语义概念包括对象、场景和事件三类[23,24]。本文主要关注的是视频中视频对象语义的提取方法,并对相关语义概念提出一个可行框架。

条件随机场是给定一组输入随机变量条件下另一组输出随机变量的条件概率分布模型,其特点是假设输出随机变量构成马尔科夫随机场[25,26,27](Markov random field, MRF)。条件随机场适用于时间序列随机变量的标注问题[28],而视频数据的语义提取正好满足这种数据特性和应用目标[29]。因而,本文的研究工作主要是基于条件随机场来构建视频语义特征提取的方法,得到视频语义信息的描述。

图1为基于条件随机场的视频语义特征提取框架。

对给定视频数据进行关键帧提取,按时间顺序组合提取就能得到关键帧的集合序列[30],该序列称为视频关键帧序列。本文提取的关键帧是包含行驶车辆的清晰的监控视频关键帧。

给定一个视频序列,构成某一时刻关键帧的所有像素点的集合,称之为视频图像像素域(video image pixel field),也称之为该时刻视频关键帧的空间域(space domain)。

视频中的低层特征经过视频语义提取之后,生成视频对象本体域(video object ontology field)完成整个映射过程。给定视频中的实物对象的实体语义所构成的一个随机场,即视频对象语义域,在时空域估计标签的概率。这里对视频中对象的语义描述主要基于概念本体来表征,因而视频对象语义域也称为视频对象本体域,即高层对象语义标注本体域,表示为集合O={Oi|iN},其中Ot表示本体域中具体的元素,如“车”“人”“桥”等概念。例如,t时刻视频关键帧序列的视频对象本体域可表示为Ot,令xt时刻视频关键帧Kt上的一个像素点,对应的本体域可标注为Ot(x);又若令st时刻视频关键帧Kt上若干空间相邻像素点所构成的对象区域,对应的本体域可标注为Ot(s)

2  视频语义特征提取方法

2.1 视频低层特征与似然方法

视频语义特征提取框架中,视频关键帧序列中低层的每一像素点都将被映射为高层的对象语义,并以对象概念本体的类别表征。例如,假设x为视频序列中t时刻关键帧域Ft(x)的一个像素点,它将根据视频语义提取方法的语义映射,被标注为高层的具体对象本体Ot(x)。又如,若x呈现为该时刻视频关键帧中语义概念“车”的低层像素点,则Ot(x)被量化为“车”的概念本体向量O

2.1.1 视频低层特征方法

视频低层特征中的随机场Ft由视频关键帧像素点上的灰度与梯度两类信息所构成,梯度域和灰度域分别代表低层特征的形状和颜色特征。

定义1 灰度域:在t时刻视频关键帧像素点x上的灰度模型可表示为

It(x)=i=1kλOI(uOi,t(x)+nOi,t(x))

其中,λOi表示为在t时刻的视频关键帧上,所有语义标注为第i个对象本体Oi的像素点所服从的高斯分布N(μOi,t,σOi,t)在整个灰度模型中的权重。并满足i=1kλOi=10λOi1,这里iNuOi,t(x)表示所有语义归属于第i个对象本体Oi的像素点高斯分布模型的均值,nOi,t(x)表示为第i个对象本体Oi的方差σoi,t所对应的噪声。IOi,t(x)=uOi,t(x)+nOi,t(x)

定义2 梯度域:在时刻t,视频关键帧像素点x上的梯度信息表示为x坐标(xx,yx)对应的一个算子

Gt(x)=f(xx,yx)=[It(xx+Δx,yx)-It(xx,yx),It(xx,yx+Δy)-It(xx,yx)]T

其中,Δx、Δy分别表示像素点x在关键帧横向和纵向坐标轴上的单位增量。

因此,在视频低层特征随机场中,视频序列{Kt}中任意一像素点x上规约为一个随机向量,表示为:Ft(x)=(It(x),Gt(x))

定义3 模型参数估计:假定参数δ表示对象概念本体的类别,δi对应于本体域中第i个对象本体Oi的类别,有p(δi=Oi)=λOi,函数p表示概率函数,将(1)式中模型参数λ、均值μ与方差Σ统一假定为参数θ,即θ=(λ,μ,Σ)m为样本总量。则灰度域It上联合分布p(x,δ)的最大似然估计可表示为

L(θ)=logδpxi|δ;μ,Σp(δ;λ)

(3)式的最大值不能通过求导取零的方法获取,基于Jensen不等式确定函数下界的方法,设计迭代算法(算法1)来估计模型中的参数。

对象概念本体的类别的数量为N时,时间复杂度为

T(M)=O(M)×O(N)=O(NM)

一般对象概念本体的类别的数量远小于对象样本的数量,即N<<M,算法MPE的时间复杂度T(M)=O(M)

下面给出模型参数估计算法MPE收敛性的证明。

定理1 模型参数估计算法MPE是收敛的。

假定θ(k)θ(k+1)分别是模型参数估计算法第k次和第k+1次迭代的结果,根据Jensen不等式中等式成立的条件,在选定θ(k)后有qi(k)(δi):=p(δi|xi;θ(k)),且确保了如下等式

L(θ(k))=i=1mδqi(k)(δi)logp(xi,δi;θ(k))qi(k)(δi)

然后,固定qi(k)(δi),并将θ(k)作为变量,对上述L(θ)表达式求导,可得θ(k+1),最后有

L(θ(k+1))i=1mδqi(k)(δi)logp(xi,δi;θ(k+1))qi(k)(δi)i=1mδqi(k)(δi)logp(xi,δi;θ(k))qi(k)(δi)=L(θ(k))

由此,最大似然估计单调增加,最终可达到最大似然估计的最大值,证毕。

2.1.2 视频低层特征似然方法

视频低层特征似然方法p(Ft|Ot)是统计推导高层对象语义标注方法的前提。首先假设当给定高层对象语义标注本体域Ot后,视频低层特征随机场Ft在视频空间域和灰度、梯度域上满足条件独立性,由此视频低层特征似然方法可分解为

p(Ft|Ot)=xXp(Ft(x)|Ot(x))

同时,假设视频低层特征随机场Ft中灰度域和梯度域Gt也满足条件独立性,则该似然方法又可分解为

p(Ft|Ot)=p(It,Gt|Ot)=p(It|Ot)p(Gt|Ot)

那么,

1) 若t时刻视频关键帧中,像素点x被语义标注为本体Oi时,有

p(It(x)|Ot(x)=Oi)=N(It(x);μOi,t,σOi,t2)

2) 若t时刻视频关键帧中,由若干相邻像素点构成的区域s被语义标注为本体Oi时,有

p(Gt(x)|Ot(s)=Oi)=N(Gt(x);μG,t,ΣG,t)

2.2 视频高层对象语义提取

前面给出的低层特征似然方法只关注视频关键帧中各像素点自身对视频对象语义提取的影响,而未曾考虑视频序列中像素点彼此之间的关联信息。从分析与统计像素点间的空域与时域信息出发,可以为视频语义特征提取框架进一步构建高层对象语义提取方法,这有助于增强视频语义提取的准确度。

2.2.1 空域分析

视频序列中相同关键帧的像素之间存在着相互影响的关系,合理地利用这类信息有助于提高视频语义提取的质量。这里主要关注相同关键帧中像素点x在空间域上与其直接相邻的上下左右四个像素点xu,xd,xl,xr间是有关联性的,令:Nx={xu,xd,xl,xr},假设相同关键帧中像素点彼此间满足马尔科夫属性,即

p(r(x)|r',r(y),yx)=p(r(x)|r',r(y),yNx)

其中rr'分别是视频序列关键帧上的两个随机场。

由此,经过分析视频序列中关键帧的空域信息,在t时刻,高层视频对象的语义提取方法可以建模成一个条件随机场模型,即p(Ot|F1t)。然后,根据Hamersley-Clifford定理,该模型可以因子分解为对应的概率无向图模型(probability undirected graphical model)中若干个最大团(Clique)上的势函数乘积,即

p(Ot|F1,,t)=1Z(Ot|F1,,t)Cψc(Ot|F1,,t)

模型中:

1) Z(Ot|F1,,t)是规范化因子(normalization factor),为

Z(Ot|F1,,t)=OtCψC(Ot|F1,,t)

2) C为模型所对应的概率无向图中的最大团,即视频序列关键帧中像素点x满足马尔科夫属性的空间邻域像素点集合。

3) ψC(Ot|F1,,t)为最大团C上的一个势(potential)。

根据视频序列中关键帧的空域信息,模型表达式中的势函数可进一步表示为像素点上灰度的势与梯度的势之和,即

ψC(Ot|F1,,t)=
exp(-xC(ψIt(x)(Ot(x)|F1,,t(x))+
yNxψGt(x)(Ot(x),Ot(y))))

其中,ψIt(x)(Ot(x)|F1,,t(x))是视频序列关键帧中像素点x上灰度的势,可由视频低层特征方法中的灰度模型It(x)提供数据;ψGt(x)(Ot(x),Ot(y))是视频序列关键帧中像素点x上梯度的势,可由视频低层特征方法中的梯度模型ψGt(x)(Ot(x),Ot(y))提供数据。

2.2.2 时域分析

视频序列中,图像帧的同一位置在相邻关键帧上的像素点之间也存在着相互依赖的关系,合理地利用这类视频序列的时域信息,同样有助于提高视频语义提取的质量。相邻两个关键帧,如KtKt+1,在视频序列中同一位置上像素点xt与像素点xt+1之间具有时域信息关联性,令Mxt={xt,xt+1}。同样假设这样的像素点满足视频序列时间域上的马尔科夫属性,即

p(r(xt)|r',r(y),yxt)=p(r(xt)|r',r(y),yMxt)

其中,rr'分别是视频序列关键帧上的两个随机场,y是视频序列中与像素点xt处于同一位置上的另一个像素点。

由此,高层视频对象的语义提取方法在视频序列的时间域上,可用线性条件随机域(linear conditional random fields, LCRF)模型表示,即

p(Ot+1|Ot)=1Z(Ot+1|Ot)CψC(Ot+1|Ot)=1Z(Ot+1|Ot)exp(xX,tαtωt(xt,xt+1)+yNx(t+1),tβtγt(xt+1,y))

模型中:

1) Z(Ot+1|Ot)是规范化因子

Z(Ot+1|Ot)=Ot+1CψC(Ot+1|Ot)

2) C为该模型所对应的概率无向图中的最大团,即为视频序列中时域相邻的两个像素点构成的集合。

3) ψC(Ot+1|Ot)为最大团C上的一个势,其所有势的积是一个指数函数。

4) 函数ωt(xt,xt+1)指代t时刻视频序列关键帧的时间域上像素点xtxt+1对该点的语义提取的势,可通过视频低层特征方法中的灰度模型It(x)提供数据;函数γt(xt+1,y)指代t时刻视频序列关键帧的时间域上像素点xt对下一帧中对应像素点梯度影响的势,可由视频低层特征方法中的梯度模型Gt(x)提供数据。参数αtβt分别对应函数ωt(xt,xt+1)γt(xt+1,y)的势权重,可通过前面的模型参数估计算法进行样本估计。

2.3 视频高层对象语义标注

结合视频语义特征提取框架中几个基础方法和贝叶斯定理,即可推导出最终的高层视频对象语义标注方法,即p(Ot+1|F1,,t+1)。能在学习一段视频样本数据的基础上,实现后面视频内容的对象语义标注,其整个过程是由基于Jensen不等式的模型更新算法(算法2)来实现的。算法MU的时间复杂度T(N)=O(NeN)

采用训练样本进行训练,针对监控视频关键帧进行检测,结合算法MPE和MU,对视频对象进行标注。

3  实验与性能评估

3.1 实验准备

本文的研究基于2006—2018年的武汉市市政工程项目武汉市隧道智能监控系统(水果湖、汉口火车站、阅马场、拦江大道、武昌火车站、八一路、东湖、武汉理工大学南湖校区等),我们所用的数据来源于项目相关的隧联网监控视频大数据,随机选取其中2018年的部分数据作为本文的数据集。

实验采用的城市交通道路监控视频为基于像素域的原始视频数据,内容是城市交通道路视频监控系统中交通主干道上和隧道中来往行驶的车及穿行的行人。首先,使用关键帧提取算法将各视频分割成几个长度为1 500幅的关键帧序列。由于各视频拍摄的摄像机处于固定状态,因而视频的背景对象较为固定,变化性不大。然后,根据各视频的内容及用途,将视频的对象语义预设成三个概念本体,分别为O,O,O

3.2 开发工具与实验环境

本文所有网络模型的训练与测试都在如下参数的实验平台上完成:操作系统:Ubuntu 16.04 LT,处理器:Intel Xeon E5 2673v,内存:16 GB,众核处理器:NVIDIA Titan V,实验在tensorflow 1.07框架下完成。

3.3 训练样本与性能评估

在对象识别的领域,级联分类器是常用的方法,例如基于梯度方向直方图(HOG)[31,32]特征的级联分类器。这类分类器的功能已由简单的人脸识别扩展到车牌、指纹识别和车辆、行人检测等方面。近几年,比较流行的对象识别算法是基于可变形部件模型(deformable part models,DPM)的Latent SVM [33,34,35]算法。

可变形部件模型包括一个粗糙的包含整个目标的全局模版,以及若干个高分辨率的部件模版,模版即是梯度方向直方图特征向量。在可变形部件模型表示中,将物体对象看作是由若干个部件组成,通过描述物体对象和部件之间的位置关系来表示物体对象本身。基于弹簧模型,物体对象的每个部件之间都通过弹簧相连。定义一个能量函数,度量每一部件的匹配程度和部件之间连接的变化程度,可以将部件之间连接的变化程度想象为弹簧的形变量大小,与模型匹配最好的图像就是使这个能量函数值最小的图像。

Latent SVM算法即是将目标的每个部件的位置看作隐藏变量,同时也将目标的位置看作是隐藏变量,只需要我们的分类器选出一个与已标注的矩形框有大量重叠的窗口。Latent SVM就像之前我们所说的条件随机场一样,是一个非凸训练问题,具体训练步骤如下:

1) 输入对象部件。

2) HOG 特征提取,刻画对象的每个部件,然后按不同等级匹配,在不同的分辨率上提取特征。在进行对象识别检测时利用DPM,检测窗口的得分等于部件的匹配得分减去模型变化的花费。

3) 得到每一个部件的HOG模板并衡量部件位置分布,利用SVM学习,进行迭代计算,不断地对模型进行更新,将模型参数转化。

4) 输出分割超平面。

事实上,考虑到关键帧的语义,车、人等这些对象一般都会出现在所提取的关键帧中,对关键帧使用 Latent SVM算法进行对象识别操作,就可以从视频中提取到相关的语义。

因此,本文的实验引用Latent SVM中的参数λ来评估模型,取λ为0~1分析其对视频语义提取方法性能的影响。文献[32,33]算法是基于DPM的Latent SVM算法,并在交通视频进行了对象识别操作,在隧联网监控视频大数据分析方面有重要贡献,实验中将会用本文算法和文献[32,33]算法作对比。

实验选取关键帧序列中前1 000帧作为视频语义提取模型的训练样本,紧接着的300帧作为模型的校验样本,最后200帧视频数据作为测试样本。同时,根据最后的200帧视频测试数据来估计参数λ对本视频语义提取方法性能的影响。实验方法的性能指标选用精确率(Precision,P)和召回率(Recall,R)来衡量,其分别定义如下:

P=TPTP+FP×100%
R=TPTP+FN×100%

其中,TP表示将测试数据中视频对象语义提取为正确的对象语义的数量;FN表示将测试数据中视频对象语义提取为错误的对象语义的数量;FP表示将测试数据中错误的视频对象语义提取为正确的对象语义的数量。图2给出了参数λ对精确率和召回率的影响。综合评估,λ为0.2时,精确率和召回率可达到较好的平衡。

3.4 实验结果分析

本系统可在对视频中运动车及行人检测与跟踪的基础上,完成视频对象语义的自动概念本体标注,图3给出了本实验系统平台的运行界面。

图4是“车”对象概念本体标注结果的示例图。在图4示例中,以其对应的视频帧上全部像素点(320×240)作为对象语义提取的基本测试单元,故其所对应的精确率和召回率分别如下:

P1=19 20019 200+5 120×100%=78.9%
R1=19 20019 200+7 680×100%=71.4%

这里针对本视频提取的正确的语义对象数量是19 200,将错误的提取为正确的语义对象数量是5 120,提取错误的语义对象数量是7 680。在相同的数据集下,由文献[32,33]方法计算的精确率和召回率如下:

P2=16 80016 800+8 120×100%=67.4%
R2=16 80016 800+10 080×100%=62.5%

由于样本视频帧的选取不同,而使得模型参数估计有所偏差,从而造成对象语义提取过程中出现少量的错误分类。

图5是追踪多辆“车”语义实体的对象概念本体标注结果示例图。该图显示了视频片断中多辆“车”语义实体的跟踪与定位。

图5示例中,语义对象提取方法相同,但精确率和召回率相对较低,分别为:

P1'=9 6009 600+6 400×100%=60.0%
R1'=9 6009 600+4 267100%=69.2%

同样,由文献[24,25]中方法所得的精确率和召回率如下:

P2'=6 4906 490+6 353×100%=50.5%
R2'=6 4906 490+7 377×100%=46.8%

这主要是由于在多对象语义的提取过程中,样本视频帧的选取会更大程度地影响到模型参数的估计,从而产生更多的错误分类。

图4图5以及计算结果可见,本文所提出的方法在对语义实体跟踪定位的同时,能对概念本体进行语义标注,并且对比目前视频语义提取的文献方法,具有较高的精确率和召回率。

4  结 语

本文从时空角度结合条件随机场模型和本体概念,提出了一个视频语义特征提取方法,实现了视频语义特征的概念本体自动标注与提取。通过实验,验证了本研究方法的合理性与有效性,以及本文提出的相关算法的实用性。针对视频语义检索需求建立了视频语义特征提取模型,实现了低层特征到高层语义特征的映射,分析了语义提取的效率,有效地实现了视频语义提取,并和相关算法对比有更优结果。后续需要结合所用的对象语义提取方法,针对场景和事件,将场景、对象和事件结合起来,建立一个分类多层语义模型,设计出精确率更高,效率更高的方法。

参考文献

[1]

王娟, 蒋兴浩,孙锬锋. 视频摘要技术综述[J]. 中国图象图形学报2014,19(12):1685-1695. DOI:10.11834/jig.20141201 .

[2]

WANG J, JIANG X H, SUN T F. Review of video abstraction[J]. Journal of Image and Graphics2014,19(12):1685-1695. DOI:10.11834/jig.20141201(Ch).

[3]

魏维, 游静, 刘凤玉,. 语义视频检索综述[J]. 计算机科学, 2006, 33(2):1-7. DOI: 10.3969/j.issn.1002-137X.2006.02.001 .

[4]

WEI W, YOU J, LIU F Y, et al. A Survey on semantic-based video retrieval techniques[J]. Computer Science, 2006, 33(2):1-7.DOI: 10.3969/j.issn.1002-137X.2006.02.001(Ch).

[5]

QUINLAN J. Induction of decision trees[J]. Machine Learning, 1986,1(1):81-106. DOI: 10.1023/A:10226T4 3204877.

[6]

KIM A, OH K, JUNG J Y,et al. Imbalanced classification of manufacturing quality conditions using cost-sensitive decision tree ensembles[J]. International Journal of Computer Integrated Manufacturing, 2018, 31(8): 701-717. DOI: 10.1080/0951192X.2017.1407447 .

[7]

BISHOP C. Pattern Recognition and Machine Learning[M]. New York:Morgan Kaufmann, 1971.

[8]

MICHAIL T. Bayesian network learning with the PC algorithm: An improved and correct variation[J]. Applied Artificial Intelligence, 2019, 33(2): 101-123. DOI: 10.1080/08839514.2018.1526760 .

[9]

AMJAD M, AKBAR K, ABDUL H H M, et al. ANTSC: An intelligent naïve Bayesian probabilistic estimation practice for traffic flow to form stable clustering in vanet[J]. IEEE Access, 2018, 6: 4452-4461. DOI: 10.1109/ACCESS.2017.2732727 .

[10]

CORINNA C, VLADIMIR V. Support-vector networks[J]. Machine Learning, 1995, 20(3):273-297. DOI: 10.1007/BF00994018 .

[11]

ZHI Q H, YU Z, LEI S, et al. A new bearing fault diagnosis method based on fine-to-coarse multiscale permutation entropy, Laplacian score and SVM [J]. IEEE Access, 2019,7: 17050-17066. DOI: 10.1109/ACCESS.2019.2893497 .

[12]

CHEN Y X, TRYPHON T G, ALLEN T. Optimal transport for Gaussian mixture models[J]. IEEE Access, 2019, 7:6269-6278. DOI: 10.1109/ACCESS.2018.2889 838.

[13]

STAUFFER C, ERIC W, GRIMSON W. Learning patterns of activity using real-time tracking [J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2000, 22(8):747-757. DOI: 10.1109/34.868677 .

[14]

RABINER L, JUANG B H. An introduction to hidden Markov models [J]. IEEE ASSP Magazine, 1986, 3(1):4-16. DOI: 10.1109/MASSP.1986.1165342 .

[15]

KUZNETSOV M A, OSELEDETS I V. Tensor train spectral method for learning of hidden Markov models (HMM)[J]. Computational Methods in Applied Mathematics, 2019, 19(1): 93-99. DOI: 10.1515/cmam-2018 -0027.

[16]

METZE F, DING D, YOUNESSIAN E, et al. Beyond audio and video retrieval: Topic-oriented multimedia summarization [J]. International Journal of Multimedia Information Retrieval, 2013, 2(2):131-144. DOI: 10.1007/s13735-012-0028-y .

[17]

LIU X, SONG M L, ZHANG L M, et al. Joint shot boundary detection and key frame extraction[C]// Proceedings of the International Conference on Pattern Recognition. Piscataway: IEEE, 2012:2565-2568.

[18]

HO S Y, CHEN H M, HO S J, et al. Design of accurate classifiers with a compact fuzzy-rule base using an evolutionary scatter partition of feature space[J]. IEEE Transactions on Systems Man & Cybernetics Part B, 2004, 34(2):1031-1044. DOI:10.1109/TSMCB.2003.819160 .

[19]

WORRING M, SANTINI S, GUPTA A, et al. Content-based image retrieval at the end of the early years [J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2000, 22(12):1349-1380. DOI:10.1109/34.895972 .

[20]

石跃祥, 文华, 龚平,. 基于模糊神经网络的语义映射方法及其在自然图像检索中的应用[J]. 计算机科学, 2013, 40(12):122-126. DOI: 10.3969/j.issn.1002-137X.2013.12.026 .

[21]

SHI Y X, WEN H, GONG P, et al. Projection of semantics and retrieval in natural scenery images based on fuzzy nerve network[J]. Computer Science, 2013, 40(12):122-126.DOI: 10.3969/j.issn.1002-137X.2013.12.026(Ch).

[22]

高文.网络视频服务的关键问题[J]. 中国计算机学会通讯, 2013, 9(1):25-29.

[23]

GAO W. The key issue in the network video service[J]. Communications of the CCF, 2013, 9(1):25-29 (Ch).

[24]

ZHONG X, LI L. Video semantic feature extraction model[C]//Computer Intelligent Computing and Education Technology. Boca Raton:CRC Press, 2014:137-141.

[25]

YANG Z G, YU H S, SUN W, et al. Locally shared features: An efficient alternative to conditional random field for semantic segmentation[J]. IEEE Access, 2019, 7: 2263-2272. DOI: 10.1109/ACCESS.2018.2886524 .

[26]

KOLLER D, FRIEDMAN N. Probabilistic Graphical Models: Principles and Techniques [M]. Cambridge: MIT Press, 2019: 149-151.

[27]

LIN C Y, TSENG B L . Segmentation, classification and watermarking for image/video semantic authentication[C]// 2002 IEEE Workshop on Multimedia Signal Processing. Piscataway:IEEE,2002:359-362. DOI: 10.1109/MMSP.2002.1203320 .

[28]

钟忺.视频图像语义分析及检索方法[M].北京:科学出版社,2017.

[29]

ZHONG X. Semantic Analysis and Search Method in Video Image [M].Beijing:Sciences Press,2017(Ch).

[30]

LI S Z. Markov Random Field Modeling in Computer Vision [M]. Berlin:Springer-Verlag, 1995.

[31]

WANG S F, SARATH K, SHI Let al. Two-stage road terrain identification approach for land vehicles using feature-based and Markov random field algorithm[J]. IEEE Intelligent Systems, 2018, 33(1): 29-39. DOI:10.1109/MIS.2017.2581327 .

[32]

POPOOLA O, WANG K. Video-based abnormal human behavior recognition—A review[J].IEEE Transactions on Systems Man & Cybernetics Part C, 2012, 42(6):865-878. DOI:10.1109/TSMCC.2011.2178594 .

[33]

BERTINI M, BIMBO A, FERRACANI A, et al. Interactive multi-user video retrieval systems[J]. Multimedia Tools & Applications, 2013, 62(1):111-137. DOI: 10.1007/s11042-011-0888-9 .

[34]

柯佳. 基于语义的视频事件检测分析方法研究[D].镇江:江苏大学, 2013.

[35]

KE J. Research on Detection and Analysis Method for Video Semantic Events [D]. Zhenjiang:Jiangsu University, 2013(Ch).

[36]

ZHONG X, LU Y S, LI L. Video key frame extraction for semantic retrieval[C]// Proceedings of the International Conference on Information Computing and Applications(ICICA 2013). Berlin:Springer-Verlag, 2013:531-540.

[37]

SAMSUL S, AZMIN S S. Difference of gaussian oriented gradient histogram for face sketch to photo matching[J]. IEEE Access, 2018, 6: 39344-39352. DOI: 10.1109/ACCESS.2018.2855208 .

[38]

刘哲,陈恳,郑紫微.基于HOG与多实例在线学习的目标跟踪算法[J].计算机工程, 2015,41(1):158-163. DOI: 10.3969/j.issn.1000-3428.2015.01.029 .

[39]

LIU Z, CHEN K, ZHENG Z W. Object tracking algorithm based on HOG and multiple-instance online learning[J].Computer Engineering,2015,41(1):158-163.DOI: 10.3969/j.issn.1000-3428.2015.01.029(Ch).

[40]

FELZENSZWALB P. Object detection grammars[C]// 2011 IEEE International Conference on Computer Vision Workshops(ICCV Workshops). Piscataway: IEEE, 2011: 691~705.

[41]

钟忺.视频语义特征提取方法研究[D]. 武汉:华中科技大学,2013.

[42]

ZHONG X. Research on Video Semantic Feature Extraction Method [D]. Wuhan:Huazhong University of Science and Technology, 2013(Ch).

[43]

THIBAUT D, NICOLAS T, MATTHIEU C. SyMIL: Minmax Latent SVM for weakly labeled data[J]. IEEE Transactions on Neural Networks and Learning Systems, 2018, 29(12): 6099-6112. DOI: 10.1109/TNNLS.2018.2820055 .

基金资助

国家自然科学基金(61303029)

中央高校基本科研业务费专项资金(191010001)

交通物联网技术湖北省重点实验室开放基金(2018IOT003)

湖北省自然科学基金重点项目(2017CFA012)

AI Summary AI Mindmap
PDF (1128KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/