蒙古文脱机手写字识别的轻量化模型设计

刘冲 ,  萨和雅 ,  邬宁琦

内蒙古师范大学学报(自然科学版) ›› 2026, Vol. 55 ›› Issue (03) : 261 -270.

PDF (1071KB)
内蒙古师范大学学报(自然科学版) ›› 2026, Vol. 55 ›› Issue (03) : 261 -270. DOI: 10.3969/j.issn.1001-8735.2026.03.006

蒙古文脱机手写字识别的轻量化模型设计

作者信息 +

Lightweight Model Design for Offline Handwritten Mongolian Character Recognition

Author information +
文章历史 +
PDF (1096K)

摘要

组织1 000余名书写者,构建涵盖10 000个蒙古文字、共计300 000张样本的手写图像数据集。基于该数据集,提出轻量化识别模型MLCNet,该模型以MobileNetV3为主干网络,在高层特征提取阶段引入高效通道注意力模块,以增强关键特征的表达能力,利用双向长短期记忆网络进行时序建模,通过连接时序分类实现从序列到文本映射。在6万张测试样本上验证的结果表明,MLCNet识别准确率达91.57%,相较以ResNet为特征提取网络的基准模型仅下降2.47%,但参数量为基准模型的约1/44,明显提升了在资源受限设备上的部署可行性。研究构建的数据集与轻量化模型,为蒙古文手写字识别任务提供了一种可行的参考方案。

Abstract

A handwritten image dataset comprising over 1 000 writers, covering 10 000 Mongolian characters, and totaling 300 000 samples, was constructed. Based on this dataset, this paper proposed a lightweight recognition model named MLCNet. The model used MobileNetV3 as the backbone network and introduced an efficient channel attention module in the high-level feature extraction stage to enhance the representation capability of key features. It employed a bidirectional long short-term memory network for temporal modeling and realized sequence-to-text mapping via connectionist temporal classification. Validation results on 60,000 test samples show that MLCNet achieves a recognition accuracy of 91.57%, only 2.47% lower than the baseline model using ResNet as the feature extraction network, while the parameter count is approximately 1/44 of that of the baseline model, significantly improving deployment feasibility on resource-constrained devices. The constructed dataset and lightweight model provide a feasible reference solution for the task of handwritten Mongolian character recognition.

Graphical abstract

关键词

蒙古文手写字识别 / ECA-MobileNetV3 / BiLSTM / CTC

Key words

handwritten Mongolian character recognition / ECA-MobileNetV3 / BiLSTM / CTC

引用本文

引用格式 ▾
刘冲,萨和雅,邬宁琦. 蒙古文脱机手写字识别的轻量化模型设计[J]. 内蒙古师范大学学报(自然科学版), 2026, 55(03): 261-270 DOI:10.3969/j.issn.1001-8735.2026.03.006

登录浏览全文

4963

注册一个新账户 忘记密码

蒙古文是承载丰富民族文化内涵的传统文字,利用智能识别技术对蒙古文手写文献进行批量数字化处理,有助于蒙古族历史、文化与艺术资源的保存、研究与传播。目前,相关研究多聚焦于印刷体文字的识别,而针对手写文字的识别研究相对较少,且多依赖于参数量较大的深度学习模型。为此,有必要面向手机、平板等移动终端探索轻量化手写识别模型,为低算力场景提供可供参考的技术路径与实现方案。
在手写文字识别领域,技术演进呈现两条主线。其一是模型架构的持续优化,从早期的隐马尔可夫模型(Hidden Markov model, HMM)1、深度卷积神经网络2到有向无环图卷积神经网络3,模型对书写变体的适应性逐步增强。Wigington等4在卷积循环神经网络中引入双向长短期记忆结构与动态归一化,使上下文建模精度明显提升。其二是空间矫正技术的突破,空间变换网络(spatial transformer network, STN)通过可微分空间变换5实现特征自适应对齐,Duttk等6将其前置到输入端并集成数据增强策略,使模型鲁棒性提升23%。针对手写多样性,Almzán等7提出跨模态金字塔方法,Krishnan8提出卷积神经网络和字符金字塔直方图联合嵌入方法,有效解决了语义对齐难题。在古籍文献数字化方面,Vinciarelli9提出的新型归一化算法使倾斜校正识别率提升10.8%,Yang等10设计的RGD检测器则实现了历史文字的精确定位。
汉字与阿拉伯文场景的识别技术的进步,为蒙古文识别在特征建模、序列学习与端到端训练等方面提供了可复用经验。Yang等11通过路径积分特征图与DropSegment数据增强技术优化卷积神经网络(convolutional neural network,CNN)特征空间,Zhang等12构建的11层深度CNN首次统一脱机、联机识别框架,Wang等13提出基于部首分析的DenseRAN网络将生僻字识别率提升至41%,Melnyk-Net则通过特征可视化技术14在减少49%参数量的同时保持高精度。阿拉伯文与蒙古文在书写特征上具有相似性,Krichen等15提出的序列到序列模型(sequence-to-sequence, Seq2Seq)反馈机制以及Elleuch等1617提出的迁移学习策略与卷积深度置信网络(convolutional deep belief network, CDBN)正则化方法在一定程度上缓解了数据稀缺问题,Amrouch等18结合CNN与HMM构建混合架构实现对手工流程的替代。Rawls等19设计了基于CNN与一维长短期记忆网络的序列识别模型,率先实现端到端的文本识别。Kundu等20创新性地将生成对抗网络(generative adversarial network, GAN)应用于文本行分割,Chakraborty等21结合自动编码器分割与ResNet模型专门解决接触字符干扰,Noubigh等22在卷积循环神经网络(convolutional recurrent neural network,CRNN)与CTC相结合的框架中嵌入密集层模块,将开放词汇识别准确率提升至新高度。
近年来,深度学习方法在蒙古文识别领域广泛应用。Zhang等23首次引入Seq2Seq架构以缓解字符切分难题。在印刷体识别领域,Cui等24融合空间变换网络(spatial transformer network, STN)与 三重注意力机制,提升模型对空间布局和字符特征的感知能力。在数据资源构建方面,Ma等25发布MRG-OHMW数据集,范道尔吉等26构建MHW数据集,并引入语法特征与自动纠错机制,丰富了模型训练信息。在模型方法上,Liu等27基于双层双向长短期记忆网络(double bidirectional long short-term memory, DBLSTM)和滑动窗口策略,将词级识别率提升至89.24%。Wei等28基于BiLSTM与注意力机制,实现了字符分割与整词识别的端到端优化。滕达29融合预训练语言模型与注意力机制,改善了少量样本下的特征提取与上下文建模。Pan等30构建基于Transformer的识别模型,在处理长距离依赖与连写词形上优势明显。此外,李敏31对系统模块进行了结构与参数优化,潘月彩32提出生成式数据增强策略以提升小样本泛化能力。Fan等33通过语言模型与声学模型的端到端融合,验证了多模态信息整合在复杂书写场景中的识别潜力。
综上,蒙古文识别技术已从传统的HMM框架转向基于CNN、RNN的深度学习模型。然而,当前主流的蒙古文手写识别方法仍面临两大核心挑战。其一,模型结构复杂、参数规模庞大,导致存储与计算开销过高,难以适配移动终端等资源受限设备;其二,高质量标注数据集稀缺,样本覆盖范围有限,严重制约了模型的泛化能力与实际应用效果。
针对上述问题,本研究构建了一个包含300 000张手写样本图像的蒙古文数据集,为后续模型训练与评估提供了数据支持。面向资源受限场景提出的轻量化识别模型MLCNet,以深度可分离卷积(depthwise separable convolution, DWConv)、压缩与激励注意力机制(squeeze-and-excitation, SE)以及H-Swish激活函数作为主干,在高层特征阶段加入ECA,并配合BiLSTM、CTC实现端到端序列识别。相较ResNet基准,模型参数量降至约1/44,在60 000张测试集上其准确率仅下降2.47%,提升了模型在资源受限设备上的部署可行性。

1 模型结构

本文提出的MLCNet模型由三个核心模块构成:特征提取模块、序列建模模块和解码机制。其中,特征提取模块采用ECA-MobileNetV3,用于高效提取输入图像的多尺度视觉特征,并兼顾计算效率与表征能力;序列建模模块使用BiLSTM,以捕捉字符级特征序列中的上下文依赖关系及时序动态信息;解码机制基于CTC,实现从特征序列到字符标签的端到端预测,有效缓解输入输出对齐不确定的问题。图1展示了MLCNet的整体网络架构。

1.1 编码器

本研究采用ECA-MobileNetV3作为主干特征提取网络。该网络引入ECA模块,结合深度可分离卷积、SE注意力机制和H-Swish激活函数的协同设计,在模型效率与识别精度之间实现了良好平衡。

ECA-MobileNetV3的核心构建单元为深度可分离卷积,其将标准卷积分解为深度卷积与逐点卷积。若输入与输出通道数均为c,卷积核大小为k×k,则标准卷积的参数量为

Pstan=k2c2,

而深度可分离卷积的参数量为

Pdp=k2c+c2,

其中,k2c对应深度卷积在每个通道上独立进行空间特征提取,c2对应逐点卷积进行跨通道特征融合。由此可见,当通道数c较大时,深度可分离卷积能够明显减少参数规模,降低计算复杂度。为增强特征表达能力,ECA-MobileNetV3引入SE模块。该模块首先通过全局平均池化获得通道级描述符:

zc=1HWi=1Hj=1Wxc(i,j)

其中,xc(i,j)表示第c个通道在位置(i,j)的特征值,HW分别为特征图的高度与宽度。随后,通道描述符经过非线性激活函数变换,得到通道权重sc

sc=σ(W2δ(W1zc))

其中,W1,W2为权重矩阵,δ表示ReLU激活函数,σ表示Sigmoid函数。最终,输入特征在通道维上被重新加权:

x^c=scxc

该机制使模型能够自适应地突出蒙古文字中具有判别性的笔画结构特征,同时抑制冗余信息。由于SE模块依赖全连接操作,导致参数开销较大。为在轻量化与特征表达能力之间取得平衡,本文在模型输出阶段引入ECA模块。该模块的核心思想是以一维卷积替代全连接层以建模通道间为依赖关系,从而避免显式的降维与升维操作,在不显著增加参数量的前提下实现更精细的通道注意力建模。设输入特征的全局描述符为z=[z1,z2,,zc],则ECA的注意力机制可表示为

sc=σk=-K/2K/2wkzc+k

其中,K为局部卷积核大小,w为一维卷积权重。该方式能够有效捕捉相邻通道间的依赖关系,并在保持极低计算开销的前提下,提升特征选择能力。在激活函数设计方面,ECA-MobileNetV3使用Hard Swish(H-Swish),其定义为

f(x)=xReLU6(x+3)6

其中,ReLU6()为分段线性近似函数,既保留了平滑梯度和非单调性特征,又避免了指数运算,使其在移动设备上具备更高的推理效率。

综上所述,本文提出的MLCNet模型主干网络通过深度可分离卷积实现计算复杂度的明显降低,SE与ECA模块联合提升通道特征选择能力,并结合H-Swish激活函数优化推理效率,从而在资源受限的环境下实现蒙古文手写识别任务的准确性与高效性。

蒙古文作为一种竖排书写文字,其字符在垂直方向上具有时序性,书写过程遵循从上至下的顺序,使得其识别任务本质上属于从序列到序列的映射问题。传统基于静态图像特征的识别方法虽能提取局部视觉表征,但难以有效建模字符间的长距离依赖关系与上下文语义信息,尤其在处理连笔、形变及多样化书写风格时表现出局限性。为实现空间特征与序列依赖的联合建模,本文采用“卷积特征提取+双向时序建模”的端到端识别框架。网络输入张量为3×48×100,批量大小为256。首先经过标准卷积层进行初始特征提取与空间下采样,输出特征图尺寸为8×24×50,并通过批量归一化(batch normalization, BN)与H-Swish激活函数稳定训练过程。随后由多个倒残差块(inverted residual)堆叠构成深层特征提取模块。每个倒残差块包含通道扩展、深度可分离卷积、SE注意力机制、H-Swish激活函数及通道压缩操作,并通过跳跃连接缓解梯度消失问题。最终在输出阶段引入ECA模块对通道特征进行再次优化,得到输出维度为288×1×25的特征张量,作为特征序列化模块(Im2Seq)的输入。网络详细结构配置见表1

为适配序列建模需求,设计Im2Seq模块将二维空间特征图转换为一维时序特征序列,保持通道维度作为语义表征,宽度维度作为时间步,最终输出格式为[BTC]。在时序建模阶段,采用双向长短期记忆网络BiLSTM捕捉蒙古文字符序列中的上下文依赖关系。前向LSTM编码历史上下文,后向LSTM建模未来上下文,两者拼接得到128维时序特征向量,有效提升了模型对蒙古文常见连写、形变等复杂书写模式的鲁棒性。Im2Seq与BiLSTM的详细处理过程见表2

1.2 解码器

1.2.1 全连接层与Softmax处理

经过BiLSTM处理,输出张量为[256,25,128],其中256为批次大小,25为时间步长,128为特征维度。该输出作为全连接层的输入,通过线性变换将每个时间步的128维特征映射到字符类别空间。本实验蒙古文字符集包含206个类别(含空白符),全连接层输出的logits张量维度为[256,25,206]。随后,Softmax函数对每个时间步的logits进行归一化处理,沿字符维度计算概率分布

p(k|t)=exp(zt,k)k'=1Kexp(zt,k')(8)

其中p(k|t)代表时间步t预测字符k的概率,zt,k代表时间步t对应字符k的logits值,K代表字符类别总数。

1.2.2 CTC层对齐机制

CTC层的核心任务是解决输入序列与输出文本的长度不对齐问题。在蒙古文识别中,输入图像经过CNN和BiLSTM处理后产生固定长度的时间步序列,而实际文本长度通常远小于此值。

CTC通过引入空白字符实现灵活对齐。模型允许在时间步中插入空白符表示“无字符”状态,并通过动态规划机制寻找最优路径。CTC损失函数定义为

CTC=-lnπB-1(y)P(πx)(9)

其中,B-1(y)为可映射至y的有效路径集合,P(πx)为模型生成路径π的概率。CTC通过最大化联合概率实现端到端训练,损失函数取负对数形式。该机制仅需词级标签即可建模对齐关系,增强对书写变形的鲁棒性。

2 实验设计

2.1 数据集

本文所采用的蒙古文手写数据集包含300 000张手写字图像,涵盖10 000个不同的蒙古文字,每个字对应一个文件夹。与传统纸质书写数据不同,数据由1 000余名书写者在智能手机、平板电脑等电子设备上采集完成,书写风格与笔迹存在多样性。

在数据预处理阶段,首先将原始灰度背景、黑色字符的图像转换为白底黑字格式,以符合光学字符识别模型的标准输入范式,同时减少背景噪声干扰,提升特征提取的稳定性。随后,对图像进行边界裁剪,去除冗余空白区域,增强文字区域的空间占比,有助于降低计算开销并缓解模型过拟合倾向。继而,将裁剪后的图像沿空间维度统一降采样至原始尺寸的1/10。在保留关键笔画结构的前提下明显降低数据存储需求与计算复杂度。

在模型训练阶段,为进一步提升模型对不同书写风格及噪声环境的鲁棒性,本研究在训练集中引入了多种数据增强策略。具体包括:对图像进行随机旋转(最大旋转角度10°)、缩放(比例范围±0.2)、剪切(最大剪切角度5°)和平移(最大平移比例0.1),以模拟书写过程中可能出现的角度偏差与形变情况。此外,还采用了随机擦除操作,在图像局部区域进行随机遮挡,以增强模型在关键笔画缺失或部分遮挡场景下的识别能力。上述增强方法能够有效提升模型的泛化性能,避免过度依赖于训练样本的固定模式。

最终,数据集按6∶2∶2的比例划分为训练集、验证集和测试集,其中,训练集包含10 000个字共180 000张图像,验证集和测试集分别包含10 000个字共60 000张图像。数据示例见图2

2.2 实验设置

2.2.1 训练参数配置

实验参数配置如下:输入图像尺寸为3×48×100,总训练轮数为500个epoch,每50个epoch保存一次模型。初始学习率设定为0.000 5,采用余弦退火学习率调度策略(cosine annealing),使其在训练过程中平滑衰减至零。优化器选用Adam,其通过动态估计梯度的一阶矩(均值)与二阶矩(未中心化方差),实现对各参数自适应调整学习步长,从而提升训练过程的收敛速度与稳定性。

为实现模型轻量化,主干网络采用缩放因子为0.5的轻量级ECA-MobileNetV3架构,BiLSTM 隐藏层维度设置为64。该配置经消融实验验证,在保持识别精度的同时降低模型计算复杂度与内存占用。训练过程中,批量大小(batch size)设为256,每500个迭代步记录一次训练损失与评估指标,并采用8个并行工作线程进行数据加载,以缓解I/O瓶颈,提升整体训练效率。

2.2.2 硬件和软件环境

实验硬件配置如下:CPU为Intel Xeon Silver 4214R @ 2.40 GHz;GPU为3张NVIDIA A100图形处理单元,每张配备40 GB显存。软件环境为:Ubuntu 20.04.6 LTS操作系统;Python 3.8.20编程语言;CUDA 11.8用于支持GPU并行计算。

2.3 评估指标

在本文的蒙古文识别实验中,模型性能评估采用字符准确率(character accuracy, ACC)和字符错误率(character error rate, CER)作为主要指标34

ACC用于量化模型在字符级别上的识别正确性,其定义为正确识别的字符数量与总字符数量之比,公式为

A=NcNt,(10)

其中,Nc表示预测结果与真实标签完全一致的字符数,Nt表示测试集中字符的总数。

CER是基于编辑距离(EditDistance)的评估指标,用于衡量预测序列与真实序列之间的差异。其定义为预测结果与真实标签之间最小编辑操作(插入、删除、替换)的数量与真实标签字符总数之比,公式为

R=i=1NEditDistance(yi,y^i)i=1N|yi|,(11)

其中,yi为第i个真实标签, y^i为第i个预测结果,|yi|为真实标签的字符长度,EditDistance(yi,y^i)表示最小编辑距离。较小的CER值表明模型在字符级别的识别效果更优。

3 结果分析

3.1 模型对比

在BiLSTM与CTC结构下,构建基准模型ResNet、浅层网络模型ShallowCNN以及轻量化模型MobileNetV1Enhance、MobileNetV3和ECA-MobileNetV3。并在180 000张图像训练集上迭代100轮次,用60 000张图像集进行测试,其参数量、模型大小、识别准确率ACC、字符错误率CER及推理速度FPS等核心检测指标见表3

ResNet作为高精度基准模型,在本实验中表现出优异的识别性能,但其庞大的参数量与模型体积限制了其在资源受限设备上的实际部署。为探索轻量化方案,本文构建了ShallowCNN模型,尽管压缩了模型规模,但识别性能明显下降,表明仅通过结构简化的轻量化策略会严重削弱模型的特征提取能力。MobileNetV1Enhance采用深度可分离卷积以降低计算负担,在保持较高精度的同时实现了轻量化设计,然而,该模型的存储与内存需求超出移动端部署的约束3 MB35。相比之下,MobileNetV3在明显降低计算复杂度的同时保持了良好的识别性能,具备更高的推理效率与边缘设备适配性。在此基础上,本文进一步引入高效通道注意力机制ECA,构建了改进模型ECA-MobileNetV3。该方法在几乎不增加额外参数量与计算开销的情况下,有效增强关键特征通道的响应能力,从而提升整体特征判别力。实验结果表明,ECA-MobileNetV3在识别精度、计算效率与模型大小之间实现了更优平衡,因此,选定ECA-MobileNetV3为MLCNet模型的主干网络用于特征提取,并在此基础上展开后续实验分析。

3.2 消融实验

为优化模型结构,对BiLSTM模块的隐藏单元数进行了系统的消融实验。随着隐藏单元数从16增至80,模型准确率由80.3%稳步提升至88.3%,参数量从0.31 M增加至0.68 M,模型体积相应由1.38 MB增长至3.11 MB(表4)。该趋势表明,增加隐藏单元数有助于增强模型对序列特征的建模能力,尤其在捕捉蒙古文手写文本中复杂的连笔结构和长距离上下文依赖关系方面表现更为明显。进一步分析表明,隐藏单元数为64的配置在性能与复杂度之间实现了较优平衡。与隐藏单元数为80的配置相比,该设置下的准确率仅下降0.8个百分点,但模型参数量由0.68 M降至0.57 M,减少了约16.2%,模型大小亦从3.11 MB降低至2.36 MB,减少了0.75 MB。更值得注意的是,当隐藏单元数增至80时,模型大小已超过3 MB,超出了轻量化部署场景下的资源约束阈值35。综合考虑识别精度、模型大小、模型参数量、推理速度,字符错误率5项指标,最终采用BiLSTM隐藏单元数为64的配置作为时序建模的最终方案。

为探究主干网络规模对模型性能的影响,本文在ECA-MobileNetV3基础上开展了通道缩放因子的消融实验。当缩放因子从0.35提升至0.5时,模型准确率提升3.17%,参数量从0.39 M增加到0.57 M,模型体积由1.17 MB增至2.36 MB,增幅较小(表5)。该结果表明,适当扩大网络容量有助于增强特征提取能力。当缩放因子进一步增至0.75时,准确率仅较0.5配置提升2.86个百分点,而参数量增至0.93 M,模型体积增至3.75 MB,模型推理速度变慢,计算与存储开销明显上升。综合考虑各项指标,本文最终选定通道缩放因子为0.5的ECA-MobileNetV3作为主干网络。结合前文通过消融实验确定的BiLSTM隐藏层维度(64),构建了完整的MLCNet模型架构。

3.3 实验结果

本实验在包含180 000张蒙古文手写图像的训练集上,对所提出的MLCNet模型进行了500个epoch的充分训练,并在独立的60 000个样本测试集上评估其性能。为验证方法的有效性,构建以ResNet为主干网络的基线模型,并与文献[36]提出的EGA模型进行对比。各模型均在相同的数据集和训练条件下进行训练和测试,各项指标见表6

本研究选取ResNet作为基准模型,其凭借深层网络结构与强大的特征提取能力,在准确率(94.04%)与字符错误率(1.42%)方面表现最佳。然而,该模型参数量高达24.79 M,模型体积为94.67 MB,推理速度仅为2 793张/秒,计算与存储开销显著,难以适用于资源受限的实际场景。现有研究提出的EGA模型36在特征提取阶段引入高效通道注意力机制,并融合双向门控循环单元(bidirectional gated recurrent unit,BiGRU)与BiLSTM构建编码器-解码器架构,在特征建模方面进行了一定优化。然而,其结构较为复杂,导致计算成本上升,尽管参数量降至1.61 M,准确率为90.09%,但在轻量化与推理效率方面仍存在局限。相比之下,MobileNetV3在模型复杂度与推理效率方面具有明显优势,参数量仅为0.55 M,模型大小为2.32 MB,推理速度达到12 782张/秒,明显优于上述模型,同时保持较高识别准确率,为轻量化研究提供了良好基础。本文提出的MLCNet模型,在MobileNetV3基础上引入ECA模块,在几乎不增加参数量的条件下,进一步将准确率提升至91.57%,字符错误率降低至2.03%,在轻量化与识别性能之间实现了更优平衡。与ResNet相比,MLCNet的参数量降低约44倍,模型体积缩小约40倍,推理速度提升约4.5倍,而准确率仅下降2.47个百分点。这些结果充分表明,MLCNet在保持较高识别精度的同时,具备更低的计算成本与更优的部署适用性,在移动端与嵌入式设备中展现出潜力。

4 结论与讨论

针对传统蒙古文手写字问题,本文提出的MLCNet模型以ECA-MobileNetV3作为主干特征提取网络,通过深度可分离卷积减少空间卷积带来的参数冗余,从而降低模型复杂度。模型融合SE与ECA注意力机制,增强了关键通道特征的响应能力,在不显著增加网络深度或通道宽度的前提下提升了特征表征质量。同时,采用H-Swish激活函数替代Sigmoid函数,在保持非线性建模能力的同时降低了计算开销,进一步提升了模型的推理效率。整体设计为蒙古文手写字识别模型在移动端的轻量化部署提供了可行方案。然而,当前研究仍存在一定局限性:首先,训练数据主要来源于电子设备采集,具有较高的图像质量和书写规范性,缺乏对真实场景中常见的笔画模糊、书写工具差异及图像退化等情况的覆盖;其次,当前模型聚焦于单字识别任务,尚未拓展至行级文本识别。针对上述不足,后续研究可从以下方面展开:一是构建更具多样性的蒙古文手写数据集,涵盖不同书写工具、书写风格及图像退化情形,提升模型适应能力;二是推进识别粒度的扩展,从单字识别向词汇及短句识别过渡。

参考文献

[1]

HEPZI J LMUTHUMANI ISELVABHARATHI S. English cursive hand written character recognition[J]. Advances in Natural and Applied Sciences201711(7): 57-64.

[2]

GUPTA J DSAMANTA SCHANDA B. Ensemble classifier‐based off‐line handwritten word recognition system in holistic approach[J]. IET Image Processing201812(8): 1467-1474.

[3]

BHAGYASREE P VJAMES ASARAVANAN C. A proposed framework for recognition of handwritten cursive English characters using DAG-CNN[C]//Proceedings of the 1st International Conference on Innovations in Information and Communication Technology (ICIICT). Chennai: IEEE, 2019: 1-4.

[4]

WIGINGTON CSTEWART SDAVIS Bet al. Data augmentation for recognition of handwritten words and lines using a CNN-LSTM network[C]//14th IAPR International Conference on Document Analysis and Recognition (ICDAR). Kyoto: IEEE, 2017: 639-645.

[5]

JADERBERG MSIMONYAN KZISSERMAN A. Spatial transformer networks[C]//Advances in Neural Information Processing Systems 28 (NeurIPS 2015). Montréal: Curran Associates, Inc., 2015: 2017-2025.

[6]

DUTTA KKRISHNAN PMATHEW Met al. Improving CNN-RNN hybrid networks for handwriting recognition[C]//16th International Conference on Frontiers in Handwriting Recognition (ICFHR). Niagara Falls: IEEE, 2018: 80-85.

[7]

ALMAZÁN JGORDO AFORNÉS Aet al. Word spotting and recognition with embedded attributes[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201436(12): 2552-2566.

[8]

KRISHNAN PJAWAHAR C V. Generating synthetic data for text recognition[J]. arXiv Preprint arXiv2016:1608.04224.

[9]

VINCIARELLI ALUETTIN J. A new normalization technique for cursive handwritten words[J]. Pattern Recognition Letters200122(9): 1043-1050.

[10]

YANG H LJIN L WHUANG W Get al. Dense and tight detection of Chinese characters in historical documents: Datasets and a recognition guided detector[J]. IEEE Access20186: 30174-30183.

[11]

YANG W XJIN L WLIU M F. DeepWriterID: An end-to-end online text-independent writer identification system[J]. IEEE Intelligent Systems201631(2): 45-53.

[12]

ZHANG X YBENGIO YLIU C L. Online and offline handwritten Chinese character recognition: A comprehensive study and new benchmark[J]. Pattern Recognition201761: 348-360.

[13]

WANG W CZHANG J SDU Jet al. DenseRAN for offline handwritten Chinese character recognition [C]//16th International Conference on Frontiers in Handwriting Recognition (ICFHR). Niagara Falls: IEEE, 2018: 104-109.

[14]

MELNYK PYOU Z QLI K Q. A high-performance CNN method for offline handwritten Chinese character recognition and visualization[J]. Soft Computing202024(11): 7977-7987.

[15]

KRICHEN OCORBILLÉ SANQUETIL Éet al. Combination of explicit segmentation with Seq2Seq recognition for fine analysis of children handwriting[J]. International Journal on Document Analysis and Recognition (IJDAR)202225(4): 339-350.

[16]

ELLEUCH MJRABA SKHERALLAH M. The effectiveness of transfer learning for Arabic handwriting recognition using deep CNN[J]. Journal of Information Assurance & Security202116(2):85-93.

[17]

ELLEUCH MKHERALLAH M. Convolutional deep learning network for handwritten Arabic script recognition[M]//Hybrid Intelligent Systems. Cham: Springer, 2020: 103-112.

[18]

AMROUCH MRABI MES-SAADY Y. Convolutional feature learning and CNN based HMM for Arabic handwriting recognition[M]//Image and Signal Processing. Cham: Springer, 2018: 265-274.

[19]

RAWLS SCAO H GKUMAR Set al. Combining convolutional neural networks and LSTMs for segmentation-free OCR[C]//14th IAPR International Conference on Document Analysis and Recognition (ICDAR). Kyoto: IEEE, 2017: 155-160.

[20]

KUNDU SPAUL SKUMAR BERA Set al. Text-line extraction from handwritten document images using GAN[J]. Expert Systems with Applications2020140: 112916.

[21]

CHAKRABORTY ADE RMALAKAR Set al. Handwritten digit string recognition using deep autoencoder based segmentation and ResNet based recognition approach[C]//25th International Conference on Pattern Recognition (ICPR). Milan: IEEE, 2020: 7737-7742.

[22]

NOUBIGH ZMEZGHANI AKHERALLAH M. Densely connected layer to improve VGGnet-based CRNN for Arabic handwriting text line recognition[J]. International Journal of Hybrid Intelligent Systems202217(3-4): 113-127.

[23]

ZHANG HWEI H XBAO F Let al. Segmentation-free printed traditional Mongolian OCR using sequence to sequence with attention model[C]//14th IAPR International Conference on Document Analysis and Recognition (ICDAR). Kyoto: IEEE, 2017: 585-590.

[24]

CUI S DSU Y LQINGDAOERJI Ret al. An end-to-end network for irregular printed Mongolian recognition[J]. International Journal on Document Analysis and Recognition (IJDAR)202225(1): 41-50.

[25]

MA L LJI LWU J. A new database for online handwritten Mongolian word recognition[C]//23rd International Conference on Pattern Recognition (ICPR). Cancun: IEEE, 2016: 1131-1136.

[26]

范道尔吉,高光来,武慧娟. MHW蒙古文脱机手写数据库及其应用[J].中文信息学报201832(1):89-95.

[27]

LIU JMA L LWU J. Online handwritten Mongolian word recognition using a novel sliding window method with recurrent neural networks[C]//14th IAPR International Conference on Document Analysis and Recognition (ICDAR). Kyoto: IEEE, 2017: 189-194.

[28]

WEI H XLIU CZHANG Het al. End-to-end model for offline handwritten Mongolian word recognition[M]//Natural Language Processing and Chinese Computing. Cham: Springer, 2019: 220-230.

[29]

滕达. 基于融合模型的蒙古文联机手写识别研究[D]. 呼和浩特: 内蒙古大学, 2023.

[30]

PAN Y CFAN DWU H Jet al. A new dataset for Mongolian online handwritten recognition[J]. Scientific Reports202313(1): 26.

[31]

李敏. 基于深度学习的联机蒙古文手写识别系统研究[D]. 呼和浩特: 内蒙古大学, 2019.

[32]

潘月彩. 蒙古文联机手写生成和识别技术研究[D]. 呼和浩特: 内蒙古大学, 2023.

[33]

FAN DSUN Y XWANG Z Xet al. Online Mongolian handwriting recognition based on encoder⁃decoder structure with language model[J]. Electronics202312(20): 4194.

[34]

BAEK Y, NAM D, PARK Set al. CLEval: Character-level evaluation for text detection and recognition tasks[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Seattle: IEEE, 2020: 564-565.

[35]

SHAFIEE M JLI FCHWYL Bet al. Squishednets: Squishing SqueezeNet further for edge device scenarios via deep evolutionary synthesis[J]. arXiv Preprint arXiv2017:1711.07459.

[36]

REN Q D E JWANG L LMA Z Ret al. Offline Mongolian handwriting recognition based on data augmentation and improved ECA-net[J]. Electronics202413(5): 835.

基金资助

国家自然科学基金资助项目“海洋动力学与数据双驱动的内孤立波传播智能预测方法研究”(62161044)

内蒙古自治区科技计划资助项目“手写蒙古文字大数据建设及识别模型研发”(2021GG0140)

内蒙古自治区自然科学基金项目“基于海洋动力学和深度学习的海洋内波遥感智能检测方法研究”(2023MS06003)

AI Summary AI Mindmap
PDF (1071KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/