基于多帧聚合的电容屏超分辨率成像方法

朱晓静 ,  乔晓晓 ,  刘芹

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (6) : 715 -724.

PDF (2223KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (6) : 715 -724. DOI: 10.14188/j.1671-8836.2023.0146
人工智能

基于多帧聚合的电容屏超分辨率成像方法

作者信息 +

A Capacitive Screen Super-Resolution Imaging Method Based on Multi-Frame Aggregation

Author information +
文章历史 +
PDF (2276K)

摘要

随着智能终端的推广,电容式触摸屏(以下简称“电容屏”)得到了广泛普及,但受限于硬件设计和成像原理,目前电容屏的成像分辨率较低,该应用的进一步发展受到了限制。为了应对这一挑战,通过采集导电物体运动过程中的电容图像序列,利用基于多帧聚合的电容屏超分辨率方法对该图像序列进行处理,实现高分辨率电容图像的重建。该超分辨率方法包含三个关键阶段:预处理、图像重建和视觉优化。在预处理阶段,通过YOLOv8n进行目标检测并使用Nano跟踪器进行跟踪,去除了背景噪声,得到了干净的低分辨率电容图像序列。随后,通过图像重建步骤对每帧图像进行Lanczos上采样、对齐和合并,最大程度地保持图像细节的完整性和保真性。最后,在视觉优化阶段提出了电容图像去模糊算法,经由实验评估,验证了所提出算法具有最佳去模糊效果,能够有效提升图像的清晰度和边缘细节。为了验证该超分辨率方法的有效性和必要性,在大量数据集上进行了实验。实验结果显示,该方法显著提高了电容图像的分辨率和视觉质量。

Abstract

With the widespread adoption of smart devices, capacitive touchscreens (“capacitive screens”) have become increasingly popular. However, further development is constrained by its relatively low imaging resolution due to the hardware design and imaging principles. To overcome this limitation, we propose a super-resolution imaging method that reconstructs high-resolution capacitive images by aggregating multiple frames captured during the movement of conductive objects. The proposed super-resolution algorithm comprises three essentials procedures: preprocessing, image reconstruction, and visual optimization. In the preprocessing stage, YOLOv8n and Nano tracker are employed respectively for object detection and object tracking, enabling background noise removal, thus resulting in clean low-resolution capacitive image sequences. During the image reconstruction phase, each frame undergoes Lanczos upsampling, alignment, and merging, ensuring the preservation of image detail and fidelity. Finally, the visual optimization stage introduces a capacitive image deblurring algorithm, which, as validated by experiments, exhibits the best deblurring effect, effectively enhancing image clarity and edge details. Extensive experiments are conducted on a large dataset to evaluate the effectiveness and necessity of the super-resolution algorithm proposed in this paper. The experimental results demonstrate significant advantages of the proposed algorithm in terms of imaging performance, and effectively improve the image resolution and visual quality of capacitive images.

Graphical abstract

关键词

电容式触摸屏 / 超分辨率方法 / 电容图像 / 视觉优化

Key words

capacitive touchscreens / super-resolution method / capacitive images / visual optimization

引用本文

引用格式 ▾
朱晓静,乔晓晓,刘芹. 基于多帧聚合的电容屏超分辨率成像方法[J]. 武汉大学学报(理学版), 2024, 70(6): 715-724 DOI:10.14188/j.1671-8836.2023.0146

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着智能终端设备的普及,触控操作[1]逐渐成为人们习以为常的人机交互方式,触摸屏作为触控操作赖以实现的硬件基础也得到了广泛的推广与应用。时至今日,触摸屏已然遍布我们的日常生产生活。触摸屏的诞生不仅催生了现代智能设备简洁紧凑的设计风格,更推动了动态用户界面这一概念的发展,用户通过触摸、移动或旋转界面元素等方式进行人机交互,即可获得更直观便捷的交互体验。

触摸屏技术自20世纪80年代问世以来,经历了数十年的技术演进,并在2007年苹果推出第一代iPhone后迎来了一场蓬勃的技术革命,逐渐演化出了电阻式触摸屏和电容式触摸屏(以下简称“电容屏”)两大分支。电容屏利用导体间的电荷转移引起电容器两极板间电压波动的原理进行工作。它将人视为接地导体,当人与电容屏表面的电极接触时,传感电路捕捉到电荷转移引发的电压信号变化,从而确定触摸位置[2]。电容屏可以识别微小触摸动作,无需物理压力即可感应触摸,且不易受到物理损伤。电容屏凭借其灵敏度高、耐用性能优异和支持多点触控等优点,如今已成为设备制造商的首选触控解决方案。

电容屏能够感知导体电荷变化的工作特性表明它拥有超越反馈触点信息的更多传感潜能。如图1所示,电容屏上下表面均匀分布着相互垂直的电极片,两层电极之间相互绝缘,交叉点处便形成了众多微小的电容器,这些电容器共同构成了电容矩阵。任意一个电容电极由于导体靠近而发生的电荷转移,都会引起其极板两侧电压的变化,进而被传感电路敏感地捕捉到[34]。由此可见,当导电物体同时引起多个电容器极板上的电荷转移时,这些电压产生变化的电容器就能够共同刻画出导电物体的形状;同时,由于导体对电荷的吸附能力受导体与电极之间距离的影响,远离电容器极板的导体引起的电压变化较小,电压数值便能够在一定程度上体现出导体与屏幕之间的距离信息。综上所述,电容屏除了具备传统的触控功能,还能够发挥深度成像的作用。

电容屏的设计初衷是识别触点,过于密集的电极分布会降低识别触点的效率,因此为了保障识别触点的效率,电容屏生产厂商通常不会采用过高的传感器密度。但较低的电容传感器密度导致了电容屏成像的分辨率较低(约为6 dpi)[5],成像的单位像素边长较大,例如Nexus 5智能手机的单位像素边长为4.1 mm[6]、三星 Galaxy Tab S2平板电脑的单位像素边长为4.0 mm[7]、微软55英寸Surface触摸屏的单位像素边长为5.9 mm[8]等,过低的分辨率阻碍了电容屏成像的发展。

针对上述分析,本文提出了一种基于多帧聚合的电容屏超分辨率方法,该算法以导体平移穿越电容网格所产生的低分辨率电容图像序列为初始数据,使用几何法对图像进行配准与去模糊,从而增强电容屏成像分辨率。

1  相关研究

超分辨率(super-resolution)技术旨在提高图像的分辨率,使其超过原生传感器的分辨率。本文将图像分辨率提高方法分为传统的几何方法和基于深度学习的方法。

传统的几何方法依赖于对多帧图像进行对齐和叠加,以削弱传感器噪声并获得更精细的细节。通过对多个图像进行处理,可以提高图像的信噪比,并获得更清晰、更详细的图像细节。Evangelidis等[9]使用优化的相关系数作为图像配准问题的性能指标,并引入正向累加法和逆向组合法两种迭代方案用于最大化相似度度量,其正向算法实现了更准确的配准,且收敛速度更快,而逆向算法在保证准确性的前提下具有更低的计算复杂度。Guizar⁃Sicairos等[10]比较了使用非线性优化和矩阵乘积离散傅里叶变换的三种二维平移图像配准算法,发现它们能够实现像素级别的图像配准,准确度相当于传统的快速傅里叶变换上采样方法,并且内存需求更低。

传统方法依赖于手工设计的特征提取和匹配算法,对于复杂的图像场景和几何变换可能表现不佳。基于深度学习的方法能够从特定领域图像的训练语料库中习得填充细粒度几何细节的能力,弥补了传统方法的不足之处。Xu等[11]利用了相机的重叠拍摄和多帧叠加技术,将多个低分辨率的原始图像进行叠加和拼接,得到高分辨率图像,以弥补超分算法缺乏真实训练数据的缺陷;而后利用深度学习技术,训练了基于残差网络的超分辨率模型,将低分辨率图像映射到高分辨率图像空间中。Dong等[12]利用了大量的低分辨率图像和对应的高分辨率图像对,通过最小化它们之间的均方误差优化网络参数,直接学习低分辨率图像和高分辨率图像之间的端到端映射关系。

2  方法设计

基于深度学习的方法通常需要大量标注数据,并建立相应的语料库进行训练;同时,以往的研究主要采用较高初始分辨率(百万级像素)的下采样-上采样和比较式训练方法[7],但电容图像的分辨率仅为数百像素级别(例如本文所采集的电容图像分辨率为49 px×37 px),这些因素使得深度学习算法在当前阶段并非电容图像分辨率提高的最佳选择。在综合计算消耗与收益等现实因素的考量后,根据多帧信息互补的思想,基于图像间的几何关系,对图像进行对准、配准和叠加,从而获得更高的图像分辨率,增强图像的视觉效果和细节表达能力。

2.1 超分辨率理论基础

当导体在电容矩阵上移动时,通常会产生亚像素级运动,呈现出小于单个像素的图像细节。纵然单帧图像无法展现亚像素细节,但超分辨率技术可以依靠聚合多帧图像来捕捉这种细节。简而言之,通过采集导体穿越电容矩阵时的电容图像序列,便可获取比单帧静态图像更丰富的信息。

设某导体的N帧原始低分辨率运动轨迹图像序列为Yii=1N,该物体的潜在高分辨率图像为X,本算法的目标就是求解得到无限接近真实电容图像的X。则每帧图像都可表示为:

Yi=gfAiX+n

其中,fAi表示由欧几里得变换矩阵Ai定义的运动模式,通过应用欧几里得变换矩阵,可以对几何对象进行位置调整、旋转、缩放和镜像等操作,从而实现对几何形状和图像的变换和处理;g是下采样函数,即把高分辨率的潜在图像X变为低分辨率图像Yi的映射;n是高斯噪声,由于实际应用中高斯噪声的影响并不显著,如果确要排除其影响,使用简单的高通滤波即可去除,因此后文不再对该项进行讨论。

为了解决多帧超分辨率问题,采用后验最大值(Maximum a Posteriori, MAP)算法[13]导出如下非凸优化问题:

minXi=1NYi-gfAiX2+λpX

其中,minXi=1NYi-gfAiX2用于评估X经过变换后与原始低分辨率观测图像序列Yii=1N的相似程度,以确保图像保真度;λpX是描述图像稀疏度的前项[14],用于描述图像中的非零元素或显著特征的数量、能量分布、梯度变化等,以激励算法产生清晰的形状和锐利的边缘。

上述问题可拆分为如下两个优化子问题:

minX'i=1NYi-gfAiX'2
minXi=1NX-X'2+λpX

(3)式着眼于数据保真,并引出了中间项X',计算可得其解为:

X'=1Ni=1NfAi-1g-1Yi

其中,g-1为上采样函数,变换矩阵Ai通过估测各帧g-1Yi与参考帧(也称作种子帧)g-1Ys之间的欧几里得变换所得。而(4)式确保最终解X不仅与中间项X'接近,且具有p(X)所表征的稀疏性。

2.2 超分辨率方法实现

以导体平移穿越电容网格所产生的低分辨率电容图像序列为初始数据,使用几何法对图像进行配准与去模糊,以期获得高保真、高分辨率的电容图像,详细的算法框架如图2所示。该算法包含三个阶段:预处理、图像重建和视觉优化。

2.2.1 预处理

如前所述,当电容屏用于成像时,导体的靠近会引起电容两端的电压变化,电容屏的触控芯片将会输出电容矩阵中每个电容器两极板间的电压与无导体靠近时的背景电压(标准电压)之差。因此在预处理阶段中,需要首先将采集得到的电容器相关数值转化为图像灰度值,继而得到单通道灰度电容图像。由于导体对电荷的吸附能力受其与电极之间距离的影响,远离电容器极板的导体引起的电压变化较小,所以将电压数值的绝对值直接映射为灰度数值,即可令生成的图像具备深度图的效果。

为了减轻后续图像配准步骤的计算负荷并提高配准成功率,预处理阶段还需要基于前述灰度电容图像进行目标检测和目标跟踪,从而仅保留目标、剥除与目标无关的背景及噪声。YOLO系列[15]的目标检测模型速度快、精度高,是一个非常经典的目标检测框架。虽然YOLOv5模型及近期发布的YOLOv8模型目标检测的效率非常可观,但是其计算复杂度仍较高,因而在本场景下需要采用目标检测与跟踪算法结合的方法:当YOLO识别并框选出目标后,将该图像送入跟踪算法,令其学习该目标图像的特征之后切割出其余帧中的目标。由此便能够得到去除无关背景后的目标切片序列。

本文可选用的目标检测模型包括YOLOv5-small模型(以下简称YOLOv5s)和YOLOv8-nano模型(以下简称YOLOv8n)。可选用的目标跟踪算法包括基于滤波算法的跟踪器,如内核相关滤波器(Kernelized Correlation Filter, KCF)跟踪算法[16]、信道和空间可靠性跟踪(Channel and Spatial Reliability Tracking, CSRT)算法[17];以及基于孪生神经网络算法的跟踪器,如DaSiamRPN(Deeper and wider Siamese networks with Region Proposal Network)跟踪算法[18]和在此基础上进行优化的Nano跟踪器(https://github.com/HonglinChu/SiamTrackers/tree/master/NanoTrack)。

2.2.2 图像重建

如(5)式所示,要估测欧几里得变换矩阵序列Aii=1N,必须首先确定作为计算基准的种子帧s,序列中其余帧i才能参考该帧,计算相对它的变换矩阵Ai然后向其对齐。具体地,将低分辨率帧中灰度大于0的活跃像素点作为凸包问题的输入点集,便可得到图像序列中每一帧中目标对象的最小外接矩形。为了最大程度地保留对齐后图像中的信息,选用面积最大的最小外接矩形的一帧作为种子帧。随后,对多帧聚合结果进行上采样,可选用的上采样算法包括最近邻插值、双线性插值、双三次插值和Lanczos插值。

得到上采样结果后,采取增强相关系数最大化(Enhanced Correlation Coefficient maximization, ECC)算法[10]进行图像配准。其核心思想是通过迭代的方式,在每次迭代中计算图像的相似度度量指标(通常是相关系数),并根据度量值的变化优化图像的变换参数,以搜寻最佳的图像变化参数。迭代会持续进行,直至达到收敛条件或最大迭代次数。但是实践发现配准过程中常出现相关性不足而导致迭代提前终止的情形,尤其是目标对象为柔性物体且在运动过程中发生较大扭曲时,此类现象更为频发;然而这些图像从人类肉眼观察的结果来说是相关的,理应被纳入多帧聚合结果,若简单地跳过这些无法对齐的帧将会削弱多帧叠加效果,因此为了最大程度地利用每一帧图像中的信息,本文对算法细节进行了如下改进:

1) 在前述设计中,为了减小计算量,每帧图的欧几里得变换矩阵Ai都是在帧Ai-1的基础上继续迭代的。因此当配准失效发生时,可以认为失效的帧j相较于前帧的变化不大,故而不妨将前帧的变换矩阵Aj-1作为Aj的近似值用于配准。

2) 在完成对失效帧的处理的调整后,重置欧几里得变换矩阵Ai,避免未完全配准的变换矩阵为最终的对齐结果引入不良因素。

根据(5)式进行多帧聚合,将各帧对应像素叠加后求平均值,得到聚合重构后的高分辨率图像。需要注意的是,从电容屏采集的原始数据均为整数,而为避免叠加求均值造成的精度损失,此处需要将矩阵像素值转换成浮点数。

2.2.3 视觉优化

前述步骤已经能够成功得到聚合重构后的高分辨率图像,即(5)式中的X'。但是配准并聚合后会不可避免地产生形如高斯模糊或失焦模糊的效果,如果配准效果不够理想,还会产生运动模糊的现象。因此,采用去模糊的方法进行视觉优化,获得具有清晰、锐利边缘的最终结果,即保留了(4)式中p(X)所表征的稀疏度的图像。

当前的盲去卷积算法主要分为基于滤波和基于神经网络的方法。在传统的基于滤波路线上,本文考察了Shan等[19]提出的一种仅依靠单一图像即可实现运动去模糊的方案,以及Xu等[14]提出的L0稀疏度去除运动模糊的技术;在神经网络实现盲去卷积这方向上,常采用Transformer或生成对抗网络(Generative Adversarial Network, GAN)等方案实现,例如DeblurGAN[20]、DeblurGANv2[21]和MAXIM[22]

然而在实践中,上述算法在对电容图像的去卷积上表现并不十分理想,故而本文提出了电容图像去模糊算法,该算法主要由对比度增强、锐度提高和图像降噪三步组成。在对比度增强步骤中,若取采集聚合重构后高分辨率图像中所有活跃像素点的灰度中位数Gm,则对比度增强后图中各像素的值G'为:

G'=max0,minαG-Gm+Gm,255

其中,GG'所在点对应位置的原始像素值;α为对比度增强系数,其值大于1。通过这样变换后,各像素点与原始图像中的灰度中位数的差值将会扩大,从而起到增强对比度的效果;为了保障图像的正常显示,增强后的灰度值需要截断至[0,255]之间。随后,利用高斯锐化卷积核-1-1-1-19-1-1-1-1对图像进行卷积操作,以提高锐度。由于高斯锐化核锐化处理后的结果通常会产生图像噪点,因此本文采用Zero-shot Noise2Noise算法[23]进行降噪处理,以得到清晰的高分辨率电容图像。Zero-shot Noise2Noise算法仅用一个轻量级的二层卷积神经网络,无需任何训练数据或噪声分布知识,即可以较低的计算成本实现高质量的图像去噪,适用于数据可用性稀缺且有限的场景。

3  实验评估

3.1 数据集

本文数据来源为Sven Mayer发布的电容图像公开数据集(https://github.com/FIGLAB/Super-Resolution-Dataset),该数据集使用部署了自定义内核驱动程序的三星Tab S2 SM-T813平板采集原始电容矩阵数据,帧率约为16.2 FPS,其中囊括了多个尺寸的April Tag、硬币、钥匙、手指、手掌、圆形及矩形几何导电箔片和用于估测分辨率的不同间隔的3×3铁片栅格等物体,以不同轨迹、不同旋转方式在屏幕上移动后产生的电容矩阵数据序列。

3.2 算法对比与筛选

本节将会从多个维度对比前述方案中不同策略对算法产生的影响,并展示具有代表性的例子。为了能够清晰地阐明本算法的效果,在使用灰度图像之余,还采取热力图进行可视化展示,通过反转原始图像灰度,并使用不同的色相反映像素点的灰度值,使得在最终的可视化展示中,灰度值较低的区域(图像中的物体部分)被映射为低明度颜色,而灰度值较高的背景区域被映射为高明度颜色,提升视觉辨认效果。

3.2.1 目标检测与跟踪算法

本文训练了基于YOLOv5s和基于YOLOv8n的模型用于检测目标,随后使用跟踪算法对检测出的目标在后续帧中的位置进行跟踪切片。

目标检测步骤中,仅在YOLO模型的预训练过程中使用了PyTorch等深度学习框架,而在部署时将其导出为onnx格式,之后载入OpenCV的DNN模块进行推理;OpenCV库基于C++开发且留出了Python接口,使用该库的DNN模块能够尽可能减少基于Python的深度学习框架的使用,从而提升算法未来在硬件上的可扩展性。

表1总结了采用不同目标检测模型/跟踪器检测/跟踪包含约450~650帧图像的序列所消耗的时间,检测/跟踪目标包含April Tag、硬币、钥匙、手指、手掌、圆形、矩形以及铁片栅格。图3展示了使用不同目标检测模型/跟踪器对April Tag、手掌、钥匙、旋转后的钥匙、矩形及后续矩形帧进行检测/跟踪的效果对比;其中,采用钥匙的旋转和矩形在帧中的相对位置变化,测试各目标检测模型/跟踪器能否准确检测/跟踪到目标在不同帧中的移动。为了控制变量,所有算法都由CPU进行推理,由表1中数据可见,计算复杂度较高的YOLOv5s耗时远高于其余算法,即便是推理速度更快的YOLOv8n模型耗时也多于所有跟踪算法,因此选用“目标识别+目标跟踪”的策略在时间效率上显著优于使用YOLO算法识别所有帧中的目标;此外,图3表明YOLO的跟踪效果具有鲁棒性,且边界框紧贴目标边缘,冗余信息和遗漏信息均较少,在减轻后续对齐算法负担的同时保障了图像保真度,可作为衡量其余跟踪算法边界框质量的基准。

在列举的算法中,KCF跟踪器的推理速度最快,且对较大目标的跟踪鲁棒性远高于小目标;同时它的跟踪自适应性较差,边界框更新速度慢,难以适应目标形状的变化,当目标旋转时,目标物体的部分像素没被边界框框住,因此遗漏了目标物体的部分信息(如旋转的钥匙);另外,它不易从跟踪失效中恢复,一旦跟丢某帧就会导致一连串后续帧的跟踪失效,例如KCF在跟踪矩形时就丢失了目标。CSRT以相对较低的帧率运行,保障了更高的对象跟踪精度,不易跟踪失效;与KCF类似,CSRT也存在对跟踪模板特征的提取泛化性能不足的情况,且边界框更新缓慢(如对手掌的跟踪),即便跟踪对象变化不剧烈也易出现遗漏部分图像信息的情况。

相较之下,基于神经网络的跟踪器在特征提取上更灵活,能够及时更新目标的特征表示以适应运动和外观变化,DaSiamRPN跟踪器具有较高的准确性和实时性,能够在复杂的场景中稳定地跟踪目标,尽管在小目标(例如矩形)上的边界框不如YOLO模型紧贴目标,目标在边界框的相对位置会发生浮动(见矩形两帧的跟踪效果),但冗余信息量尚在可接受范围内,推理速度也远高于YOLO模型。Nano跟踪器存在与DaSiamRPN相似的缺陷,但是目标在边界框的相对位置的浮动范围较小,且这些问题在算法的后续步骤中都可以克服,更可贵的是它能在与CSRT差不多的时间消耗内获得与DaSiamRPN和YOLO类似的跟踪效果。综合各目标检测算法及跟踪器的表现,“YOLOv8n+Nano跟踪器”的组合无疑是权衡了效果与速度的最佳选择。

3.2.2 插值算法

采用不同的插值算法进行上采样也会影响超分算法的效果。图4展示了由不同插值算法进行上采样的硬币图像。由图4可知,最近邻插值简单高效,但导致锯齿状边缘;双线性插值大大减少了锯齿状边缘,但对细节的处理不够精细,像素间的过渡较为生硬,图4(b)中硬币的内部还留有电容网格的痕迹;双三次上采样插值法能更好地保留细节,但还是能够依稀辨认出网格的形状;Lanczos插值能够更好地保持图像细节和锐利度,且对图像的处理细腻,各像素衔接过渡自然。因此,本文选用效果最好的Lanczos插值实现上采样。

3.2.3 帧数对细节的影响

图5对比了Nano算法跟踪序列取5帧、50帧、500帧对April Tag和手掌图像进行多帧聚合后的效果,所用插值算法为Lanczos;为了清晰地显示灰度之间的区别,本文展示了热力图,用不同的色相表示不同的灰度。可以看到,帧数在50帧左右的图像,细节已经足够丰富。事实上,物体匀速经过电容网格时采集到的图像,可以近似认为以划过单个电容像素时间为单位的周期性变化序列,因此过多的帧数并不一定能够带来细节的增益,相反随着帧数的上升计算量剧增。另外,更多的帧数意味着更多的配准失效,尽管本文已尽可能地提高精度,但配准时的偏移仍难以完全克服,导致叠加重影,最终图像反而变得模糊,如图5(c)中食指的位置。

3.2.4 去模糊策略

本小节横向对比了滤波去卷积、神经网络去卷积以及本文所提出的电容图像去模糊算法,效果如图6所示,这里原图为使用Nano跟踪算法切片图像配准聚合的钥匙图像,上采样算法为Lanczos。由于高分辨率图像是未知的,无法取得足够的训练语料对模型从头训练,因此这里采用的神经网络去卷积模型均为官方仓库公布的预训练模型。各算法得到的去模糊图均不存在明显的振铃现象。图6(c)采用单图去卷积算法,图像具有最锐利的边缘,但是也引入了不属于原目标的一些图像特征,这是算法所不希望的;L0稀疏度去模糊算法失真较为严重;DublurGANv2的图像中钥匙头发生了形变,存在一定程度失真;MAXIM网络克服了失真的问题,但是去模糊效果不够明显。本文方案(此处α取1.25)在最小的计算开销下获得了与MAXIM相近甚至略佳的效果,边缘相较于MAXIM更加锐利,且保障了较高的保真度,因此,本文所提出的电容图像去模糊算法是适用于本场景的最佳方案。

3.3 超分辨率效果评估

3.3.1 分辨率估测

由于衍射现象的存在,光学成像系统形成的图像并非理想的几何点图像,而是具有一定大小的光斑。当两个物体点过于接近时,它们的图像光斑会重叠,致使两个物点所成图像无法被区分。根据瑞利判据(Rayleigh criterion)[24]的定义,能够分辨两个相邻物点图像的最小距离即为分辨率(如图7),该定义可用于衡量超分技术改善分辨率的能力。

本文采用二分法逼近的方式估测超分算法的实际分辨率,若距离为n的两个物体能够被所成之像区分,而距离为m的两个物体的光斑无法区别,测试距离为(m+n)/2的两物体物像能否分辨,若能便测试相距m+n/2+m/2的两物体,否则测试相距n+m+n/2/2,如此周而往复,直至达到目标精度为止。

本文以3×3铁片栅格作为基准物用于估测分辨率,该箔片栅格实物如图8(a)所示,电容图像数据集提供了尺寸为2、3、4和6 mm的基准物,该尺寸表示铁片直径以及贴片之间的间隔。图8(b)~(e)为原始分辨率下基准物的成像效果,图8(f)~(i)为超分辨率处理后的成像效果,4 mm及以上的基准物都能够轻松分辨;3 mm的基准物栅格在原始分辨率下无法辨别,而经过超分处理后,可以分辨出相邻的两个铁片(图8(h)方框部分所示);2 mm的基准物栅格无论超分前后均难以区分。据此可以估测超分辨率处理后的分辨率约为(2+3)/2=2.5 mm。

3.3.2 效果呈现对比

多帧聚合能通过帧间互补,获得单帧图像中无法尽数展现的图像细节,提高信噪比。如图9所示,图9(c)展示了采用Nano跟踪器跟踪原始序列,使用Lanczos上采样算法后,对前50帧进行配准聚合,并采用本文提出的电容图像去模糊算法进行视觉优化后的图像效果;相较于直接对单张种子帧进行插值的图9(b),以多帧聚合为核心思想的超分辨率算法手部电容图像(图9(c))融合了手掌部分更多的细节;钥匙的电容图像中,传统插值法中钥匙胚(图中方框标示部分)位置较为模糊,超分辨率方法结合了多帧的信息后,对该位置的结构有了更加精确的把握,钥匙的边界更加清晰。

4  结 语

电容屏的设计初衷是识别触点,但它同时也具备成像的潜能。本文从当前限制及应用领域等多个角度阐述了提高电容屏成像分辨率的研究意义,并对相关工作进行了总结分析。本文提出一种基于多帧聚合的电容屏超分辨率方法,并依据实际应用进行了改良与优化:对收集到的多帧低分辨率图像序列进行预处理、图像重建和视觉优化,获得了保持图像保真度的同时具有更高锐度的高分辨率电容图像。在预处理阶段选用“YOLOv8n+Nano跟踪器”的策略剥除无关背景噪声;在图像重建阶段通过ECC算法将图像序列中经由Lanczos上采样后的50帧图像进行多帧聚合;随后使用本文提出的电容图像去模糊算法对图像进行视觉优化。最后在公开数据集上从定性和定量的角度对算法进行了评估,实验结果表明本方法显著提高了电容屏成像的效果和性能,使用超分辨率方法处理后的图像相较于单帧原始图像,包含了更多的信息,并具备清晰锐利的边缘。

参考文献

[1]

HOLZ CBAUDISCH P. Understanding touch[C]//Proceedings of the SIGCHI Conference on Human Factors in Computing Systems. New York: ACM, 2011: 2501-2510. DOI: 10.1145/1978942.1979308 .

[2]

JIANG YJI X YWANG Ket al. WIGHT: wired ghost touch attack on capacitive touchscreens[C]//2022 IEEE Symposium on Security and Privacy (SP). New York: IEEE Press, 2022: 984-1001. DOI: 10.1109/SP46214.2022.9833740 .

[3]

RUSU MMAYER S. Deep learning super-resolution network facilitating fiducial tangibles on capacitive touchscreens[C]//Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems. New York: ACM, 2023: 1-16. DOI: 10.1145/3544548.3580987 .

[4]

SHAN H QZHANG B YZHAN Z Het al. Invisible finger: Practical electromagnetic interference attack on touchscreen-based electronic devices[C]//2022 IEEE Symposium on Security and Privacy (SP). New York: IEEE Press, 2022: 1246-1262. DOI: 10.1109/SP46214.2022.9833718 .

[5]

HOLZ CBUTHPITIYA SKNAUST M. Bodyprint: Biometric user identification on mobile devices using the capacitive touchscreen to scan body parts[C]//Proceedings of the 33rd Annual ACM Conference on Human Factors in Computing Systems. New York: ACM, 2015: 3011-3014. DOI: 10.1145/2702123.2702518 .

[6]

LE H VKOSCH TBADER Pet al. PalmTouch: Using the palm as an additional input modality on commodity smartphones[C]//Proceedings of the 2018 CHI Conference on Human Factors in Computing Systems. New York: ACM, 2018: 1-13. DOI: 10.1145/3173574.3173934 .

[7]

MAYER SXU X YHARRISON C. Super-resolution capacitive touchscreens[C]//Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. New York: ACM, 2021: 1-10. DOI: 10.1145/3411764.3445703 .

[8]

XIAO RHUDSON SHARRISON C. CapCam: Enabling rapid, ad-hoc, position-tracked interactions between devices[C]//Proceedings of the 2016 ACM International Conference on Interactive Surfaces and Spaces. New York: ACM, 2016: 169-178. DOI: 10.1145/2992154.2992182 .

[9]

EVANGELIDIS G DPSARAKIS E Z. Parametric image alignment using enhanced correlation coefficient maximization[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence200830(10): 1858-1865. DOI: 10.1109/TPAMI.2008.113 .

[10]

GUIZAR-SICAIROS MTHURMAN S TFIENUP J R. Efficient subpixel image registration algorithms[J]. Optics Letters200833(2): 156-158. DOI: 10.1364/ol.33.000156 .

[11]

XU X YMA Y RSUN W X. Towards real scene super-resolution with raw images[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 1723-1731. DOI: 10.1109/CVPR.2019.00182 .

[12]

DONG CLOY C CHE K Met al. Image super-resolution using deep convolutional networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201638(2): 295-307. DOI: 10.1109/TPAMI.2015.2439281 .

[13]

KALTENBRUNNER MBENCINA R. reacTIVision: A computer-vision framework for table-based tangible interaction[C]//Proceedings of the 1st International Conference on Tangible and Embedded Interaction. New York: ACM, 2007: 69-74. DOI: 10.1145/1226969.1226983 .

[14]

XU LZHENG S CJIA J Y. Unnatural L0 sparse representation for natural image deblurring[C]//2013 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2013: 1107-1114. DOI: 10.1109/CVPR.2013.147 .

[15]

BOCHKOVSKIY AWANG C YLIAO H Y M. YOLOv4: Optimal speed and accuracy of object detection[EB/OL]. 2020arXiv: 2004.10934. DOI: 10.48550/arXiv.2004.10934 .

[16]

HENRIQUES J FCASEIRO RMARTINS Pet al. High-speed tracking with kernelized correlation filters[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201537(3): 583-596. DOI: 10.1109/TPAMI.2014.2345390 .

[17]

LUKEŽIC AVOJÍR TZAJC L Cet al. Discriminative correlation filter with channel and spatial reliability[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2017: 4847-4856. DOI: 10.1109/CVPR.2017.515 .

[18]

ZHU ZWANG QLI Bet al. Distractor-aware Siamese networks for visual object tracking[C]//European Conference on Computer Vision. Cham: Springer, 2018: 103-119.10.1007/978-3-030-01240-3_7. DOI: 10.1007/978-3-030-01240-3_7 .

[19]

SHAN QJIA J YAGARWALA A. High-quality motion deblurring from a single image[J]. ACM Transactions on Graphics27(3): 1-10. DOI: 10.1145/1360612.1360672 .

[20]

KUPYN OBUDZAN VMYKHAILYCH Met al. DeblurGAN: blind motion deblurring using conditional adversarial networks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 8183-8192. DOI: 10.1109/CVPR.2018.00854 .

[21]

KUPYN OMARTYNIUK TWU J Ret al. DeblurGAN-v2: Deblurring (orders-of-magnitude) faster and better[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2020: 8877-8886. DOI: 10.1109/ICCV.2019.00897 .

[22]

TU Z ZTALEBI HZHANG Het al. MAXIM: multi-axis MLP for image processing[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 5759-5770. DOI: 10.1109/CVPR52688.2022.00568 .

[23]

MANSOUR YHECKEL R. Zero-shot Noise2Noise: Efficient image denoising without any data[EB/OL]. 2023arXiv: 2303.11253. DOI: 10.1109/cvpr52729.2023.01347 .

[24]

RAYLEIGH. XXXI. Investigations in optics, with special reference to the spectroscope[J]. The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science18798(49): 261-274. DOI: 10.1080/14786447908639684 .

[25]

RADIO A. Introduction to radio interferometry [EB/OL]. [2020-02-05].

基金资助

国家自然科学基金(62272348)

AI Summary AI Mindmap
PDF (2223KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/