基于STM32微控制器的MCUVLM⁃RWKV视觉⁃语言模型研究

朱忠诺 ,  邵星灵 ,  李秀源 ,  邓瑞祥 ,  徐悦梅 ,  张强

中北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (1) : 71 -79.

PDF (4379KB)
中北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (1) : 71 -79. DOI: 10.62756/jnuc.issn.1673-3193.2025.09.0014
自动化与计算机

基于STM32微控制器的MCUVLM⁃RWKV视觉⁃语言模型研究

作者信息 +

Research on MCUVLM⁃RWKV Vision⁃Language Model Based on STM32 Microcontroller

Author information +
文章历史 +
PDF (4483K)

摘要

随着人工智能在安防、 工业和农业等领域的广泛应用, 边缘设备在视觉推理任务中的需求不断增长。然而, 受限于硬件资源, 针对STM32的视觉-语言模型部署方案仍相对缺乏。为应对这一问题, 本文提出了一种面向STM32的视觉-语言模型MCUVLM-RWKV。该模型融合了轻量化视觉编码器、 轻量化视觉特征映射器和具备双模式运行机制的RWKV解码器三大核心模块, 可完成图像描述任务。实验结果表明, 在STM32的运行内存与存储限制下, MCUVLM-RWKV在BLEU-4、 ROUGE-L和METEOR等评价指标上均优于多种主流模型, 其中ROUGE-L指标达到55.7, 显著高于其他对比模型, 表明该模型在长序列推理任务中具有更强的建模能力。此外, MCUVLM-RWKV在参数规模与推理内存占用方面表现优异, 进一步验证了其在微控制器场景下的推理性能与部署可行性。

Abstract

With the widespread application of artificial intelligence in fields such as security, industry, and agriculture,the demand for edge devices on vision reasoning tasks continues to grow.However, due to hardware constraints,deployment schemes of vision-language models designed for STM32 microcontrollers remain relatively scarce.To address this problem,this paper proposes an STM32-oriented vision-language model, MCUVLM-RWKV.The model integrates three core modules: a lightweight vision encoder, a lightweight vision feature mapper, and an RWKV decoder with a dual-mode operation mechanism, enabling image captioning tasks.Experimental results show that under the memory and storage limitations of STM32, MCUVLM-RWKV outperforms several mainstream models in evaluation metrics such as BLEU-4, ROUGE-L, and METEOR.Specifically, the ROUGE-L score reaches 55.7, which is significantly higher than that of other comparative models,indicating stronger modeling capability in long-sequence reasoning tasks.In addition, MCUVLM-RWKV demonstrates excellent performance in terms of parameter scale and inference memory consumption, further verifying its reasoning efficiency and deployment feasibility in MCU scenarios.

Graphical abstract

关键词

STM32 / 视觉-语言模型 / 边缘计算 / 内存优化 / RWKV / 图像描述

Key words

STM32 / vision-language model / edge computing / memory optimization / RWKV / image captioning

引用本文

引用格式 ▾
朱忠诺,邵星灵,李秀源,邓瑞祥,徐悦梅,张强. 基于STM32微控制器的MCUVLM⁃RWKV视觉⁃语言模型研究[J]. 中北大学学报(自然科学版), 2026, 47(1): 71-79 DOI:10.62756/jnuc.issn.1673-3193.2025.09.0014

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

随着智能安防、 工业4.0及智慧农业等领域的快速发展, 边缘设备在视觉推理任务中的重要性日益凸显1。视觉-语言模型(Vision Language Model, VLM)融合了视觉模型的精细特征提取能力与语言模型的语义理解和推理能力, 依托其多模态理解与生成的优势, 边缘设备在高阶视觉认知、 复杂场景推理以及智能化人机交互等方面的性能得到显著提升2。因此, 探索微控制器(Microcontroller Unit, MCU)级视觉-语言模型, 不但有助于为资源受限条件下的视觉推理任务提供技术支撑, 而且对于在智能终端与嵌入式系统中部署高效的多模态推理模型具有重要的研究意义。

CLIP等高性能视觉-语言模型具备丰富的先验知识和卓越性能, 但其推理计算复杂度高, 存储需求大, 主要应用于资源充足的平台设计中3。针对视觉-语言模型在边缘设备的应用, 已有一些轻量化探索。Wang等4采用轻量化视觉骨干并结合双阶段蒸馏, 在显著减少参数的同时保持了较高的推理精度; Vasu等5整合高效视觉骨干与多模态强化训练, 确立了设备端 CLIP 的训练与评测范式。Chu等6通过削减视觉序列长度并引入位置增强与可学习插值, 在降低计算复杂度的同时维持了大模型级 VQA 精度; Arif 等7提出了注意力引导的早期视觉 Token丢弃策略, 在固定Token预算下提升了高分辨率推理效率; Farina等8利用无梯度多模态流分析实现了任务无关的一次性剪枝, 显著压缩了模型参数。此外, Rang等9设计了弹性视觉专家机制, 在多模态融合与解码之间取得平衡; Li等10通过仅训练轻量化Q-Former来实现模态桥接, 在极少参数条件下达到大模型级 VQA 性能。同时, Yao等11构建了面向端侧的多模态大模型系列, 在有限算力下实现了高效的视觉-语言理解与生成能力, 验证了轻量化策略的可行性与终端部署价值。

现有研究普遍采用结构压缩、 参数剪枝、 蒸馏及特征优化等方法, 在精度与效率之间实现了一定平衡, 但这些方法多面向搭载系统级芯片的边缘设备的设计, 在MCU场景下的适配性仍显不足。在MCU端的多模态任务中, 编码器与解码器的协同优化依旧有限, 且现有主流Transformer解码器计算复杂度较高。为适配 MCU 设备, 需要显著降低参数量并压缩模型规模, 这不可避免地导致了模型学习能力和推理性能的下降。与此同时, 此类模型主要面向MCU设备部署, 更适用于在特定场景下执行图像描述任务。为了在受限模型容量下保持有效性能, 应采用合理设计的封闭场景数据集进行训练与测试。

针对上述问题, 本文提出了一种面向MCU的视觉-语言模型MCUVLM-RWKV。本文的主要贡献如下:

1) 设计了采用并行训练与串行推理策略的RWKV架构解码器, 实现了在O(1)恒定内存消耗下的长文本图像描述生成;

2) 构建了适用于MCU视觉-语言模型的视觉编码器;

3) 制作了适配MCU设备测试需求的图像描述任务数据集, 以满足实验与验证需求;

4) 验证了模型在真实MCU上的可部署性与有效性, 并依据硬件参数优化模型规模。

1 MCUVLM⁃RWKV模型

1.1 模型总体架构

MCUVLM-RWKV 的整体架构如图 1 所示, 由视觉编码器(Vision Encoder)、 视觉特征映射器(Vision Mapper)和基于 RWKV 的解码器(Decoder)三部分组成。整体架构以“多模态特征提取-特征映射-文本生成”为总体流程: 视觉编码器提取图像特征; 文本提示经词元编码器(Tokenizer Encoder)转换为文本嵌入; 视觉特征映射器实现视觉特征与文本嵌入在特征维度上的对齐与映射; RWKV 解码器结合词元解码器(Tokenizer Decoder)完成多模态特征融合与文本自回归生成。上述模块共同构建了一个从图像-文本对的输入到文本输出的端到端多模态建模体系。

1.2 RWKV解码器构建

RWKV模型融合了Transformer的全局上下文建模能力与RNN的高效递归状态更新机制。其并行计算模式可形式化为累积矩阵运算, 从而将并行计算过程严格等价地转化为逐时间步的递归状态更新12。基于这一特性, 本文构建了并行训练与逐token串行推理相结合的RWKV解码器。凭借其在运算中的低计算复杂度与低内存占用优势, 可有效缓解 MCU 推理阶段的内存瓶颈, 并在恒定内存占用下实现图像描述文本生成。

RWKV解码器的并行计算函数为

St=τ=1tAt,τXτWk, Yt=σ(St)(XtWv)Wo,

式中: Xt 为第t步输入嵌入; Wk/o/v 为可训练权重; At,τ 为时间位置加权矩阵; σ(⋅)为逐位置的门控函数。

串行模式下, 式(1)等价为递归状态更新, 表示为

St=AtSt-1+(XtWk), Yt=σ(St)(XtWv)Wo

St 为累积状态, 仅依赖上一时刻状态St-1与当前输入文本token Xt, 因此内存占用为常数值。

并行模式视觉特征融合方法如图 2 所示, 在并行模式中, 视觉特征序列按预设占位符索引替换文本提示嵌入序列对应位置的向量, 形成多模态输入序列, 并输入RWKV并行计算函数13

由于RWKV递归状态更新仅接收单步特征输入, 推理过程依次将视觉特征向量输入RWKV串行计算函数, 通过递归更新完成视觉信息融合, 实现与并行模式功能等价, 并在推理阶段维持O(1)恒定内存占用。

1.3 视觉编码器轻量化优化方法

视觉编码器轻量化优化方法如图 3 所示, 本文构建了适用于MCU视觉-语言模型的视觉编码器。

1.3.1 低秩分解

将权重矩阵 WRn×m 低秩近似为 WUVT, 其中, 秩r≪min(n,m), 将参数规模由Onm)压缩至Orn+m)),在保证精度的同时显著降低了存储和计算复杂度14

1.3.2 算子分解

将大核卷积分解为若干等效小核卷积, 并在临时缓冲区累加结果。由式(3)可知, 该方法在保持有效感受野的前提下, 将K×K大核卷积分解为K1×KK×1的小核卷积, 将计算复杂度由OK2)降至OK15

ConvK×K(X)大核卷积=i=1KConv1×K(X)水平卷积+j=1KConvK×1(X)垂直卷积

1.4 轻量化视觉特征映射器构建

本文设计的映射器由一个线性层构成。为了最小化参数与计算量, 本节延续了第1.3节中的轻量化优化思想, 对其权重矩阵 WRdvision×dtext 应用了低秩分解。

1.5 模型训练

本文训练分为两个阶段: 第一阶段训练1.3节构建的视觉编码器; 第二阶段对MCUVLM-RWKV模型进行整体训练。

1.5.1 视觉编码器训练方法

视觉编码器训练方法如图 4 所示。

将视觉编码器与预训练语言模型配对进行对比学习, 仅更新视觉编码器参数, 以最大化图文对在共享嵌入空间的余弦相似度, 从而实现视觉特征与文本特征的对齐16

1.5.2 模型整体训练方法

训练分为两个阶段且视觉编码器全程冻结: 第一阶段仅训练视觉特征映射器, 将视觉特征映射至文本嵌入空间17; 第二阶段联合训练RWKV解码器与视觉特征映射器, 以优化多模态建模与文本生成能力18

本文基于线性组合交叉熵(CE), 结合标签平滑(LS)和焦点损失(FL)构建损失函数Total, 以提升模型的鲁棒性与精确性。

1) 标签平滑: 通过平滑因子ϵ将尖锐的one-hot标签分布yi 替换为一个更平滑的分布yi ′, 表示为

yi'=(1-ϵ)yi+ϵC,

式中: C为词汇表大小。

2) 焦点损失: 解决易学与难学样本的不平衡问题, 使训练聚焦于困难样本19, 表示为

FL=-α(1-pi)γlog(pi),

式中: pi 为模型对第i个词元的预测概率; 聚焦参数γ≥0控制的调制因子(1-piγ 能够动态衰减易分类样本的损失贡献。

将上述三种损失函数进行线性加权组合, 形成最终的优化目标

Total=λCECE+λLSLS+λFLFL,

式中: λCE/LS/FL为各自损失分量的加权系数。

2 实 验

2.1 实验设置

2.1.1 硬件设备与训练设置

MCU硬件参数与训练环境设置参数见表 1

为了验证模型在MCU硬件上部署的可行性, 选用STM32H7R7, 并外扩2 MB并行SRAM与4 MB Flash存储器作为参考硬件设备。在此基础上, 将模型规模严格限定在该设备的存储与运行内存范围内, 并据此开展后续实验, 评估模型在目标硬件条件下的性能表现。

模型训练过程中, 迭代次数设为200轮, 批处理大小为16, 初始学习率为1×10⁻⁶, 优化器采用AdamW, 并结合Cosine Decay学习率策略。

2.1.2 数据集设置

由于模型规模较小, MCUVLM-RWKV在COCO等开放域数据集上难以收敛。为此, 构建封闭场景数据集EdgeVLM-RWKV-Cap, 从ImageNet-1K中选取10个目标类别共5万张图像, 并按7∶1.5∶1.5的比例划分为训练集、 验证集和测试集。每张图像由人工标注60 ~ 80字的中文模板化描述文本, 模板遵循“数量→对象→地点→行为”的顺序, 以提升标注一致性与模型收敛性能。训练与推理阶段, 所有图像经尺寸归一化与数据增强后的分辨率统一调整为224×22420

2.1.3 评价指标

1) 部署与资源指标。

为了评估模型在MCU设备上的可部署性, 本实验选取了以下三项核心部署与资源指标21: ① 模型参数量(Parameter), 用于统计网络参数总量, 衡量模型规模; ② 模型存储占用(Flash Size), 是在int8量化策略下计算权重大小, 并结合编译后的固件大小, 测得所需Flash空间; ③ 峰值运行内存(Peak Inference RAM, PIR), 是在推理阶段监测激活矩阵、 计算缓存及中间特征图的内存占用, 以获取最大SRAM使用量。

2) 模型性能指标。

为了评估模型在图像描述任务中的推理性能, 本文选取以下三种主流评价指标22: ① BLEU-4, 用于统计n-gram重叠比例以衡量生成描述的准确性; ② ROUGE-L, 用于计算生成与参考描述在字词及短语层面的重合度; ③ METEOR, 用于评价生成与参考描述的语义一致性与可读性。

2.2 消融实验与结果分析

通过消融实验评估视觉编码器优化、 特征融合机制与损失函数设计对模型资源开销及推理精度的影响。消融实验结果见表 2, 其中视觉特征串行融合对模型性能贡献显著。在不使用该方法的情况下, BLEU-4≤12.5、 ROUGE-L≤18.7、 METEOR≤11.6, 结果表明, 视觉信息显著丢失, 模型在图像语义生成方面性能明显下降。

引入视觉特征串行融合与总损失函数(实验7)后, 性能达到最佳水平(BLEU-4=34.2、 ROUGE-L=55.9、 METEOR=27.8), 其中损失函数尤其提升了ROUGE-L, 显著增强了长文本描述的准确性。在此基础上加入视觉编码器优化(实验8, 即本文方法), 虽然性能略有降低(BLEU-4=33.6、 ROUGE-L=55.7、 METEOR=27.4), 但模型参数量和PIR分别降至1.02×106和1.22 MB, 实现了性能与资源开销的最佳平衡。消融实验结果对比如图 5 所示。

引入视觉特征串行融合与总损失函数显著提升了图像语义生成的性能,尤其是长文本描述的准确性,而视觉编码器优化则在大幅降低参数量与PIR的同时有效维持了模型性能。上述三种策略的有机结合展现出显著的协同增益,实现了模型性能与资源的最佳平衡。

2.3 模型对比实验与结果分析

2.3.1 对比实验设计

目前, 面向MCU部署的视觉-语言模型方案较为有限。对比实验模型参数设置见表 3, 本文在对比实验中选取主流开源模型, 并通过调整深度(Depth)、 嵌入维度(Embedding Dimension)、 剪枝及修改MLP中间层映射倍率等方式, 使其满足目标MCU的SRAM与Flash资源约束, 并与MCUVLM-RWKV进行性能对比。

2.3.2 对比实验结果分析

对比实验结果见表 4。可以看出, 本文方法在模型规模与其他对比模型接近的情况下, 仍保持最低的参数量和存储占用; 同时, 其内存占用在所有对比模型中最低(参数量=1.02×106, PIR=1.22 MB), 充分满足MCU的资源限制。

本文方法在BLEU-4(33.6)、 ROUGE-L(55.7)和METEOR(27.4)三项指标上均位列首位。

实验结果对比如图 6 所示, 可以看出本文模型在生成性能、 语义连贯性及细节准确性方面明显优于其他对比模型, 由其他模型结果可以看出, 仅缩减模型尺寸以适配硬件会显著削弱其学习与生成能力。

2.4 泛化实验与结果分析

2.4.1 泛化实验设计

为了验证模型的泛化能力, 选取在图像尺寸、 分辨率和类别分布上与训练数据集具有相似特征的样本作为泛化实验对象, 并以标准标注文本为参照。该实验设置在控制变量的前提下, 能够客观评估模型在非训练数据上文本生成的准确性, 从而保证实验结果的科学性与可比性。

2.4.2 泛化实验结果分析

泛化实验结果如图 7 所示, 对于包含模型已学习知识类别的图像, 本文方法能够有效地提取视觉特征, 并描述图像中的关键目标及其细节信息, 展现出良好的语义理解与跨模态映射能力。

此外, 在非训练集的图像输入下, 模型依然能够生成与图像内容相关性较高的描述, 表现出一定的泛化适应性。

与对比模型相比, 本文方法在生成结果的一致性与鲁棒性方面略有优势, 泛化能力和稳定性更为突出, 进一步验证了所提出模型结构与轻量化设计策略的有效性。

3 结 论

本文提出的MCUVLM-RWKV由轻量化视觉编码器、 轻量化视觉特征映射器以及具备O(1)恒定推理内存占用的RWKV解码器构成, 结合双模式视觉信息融合, 完成了针对STM32设备的轻量化模型构建。实验表明, 该模型在BLEU-4、 ROUGE-L和METEOR等评价指标上均优于多种主流模型, 同时在资源受限环境中保持稳定的推理内存占用与较低的资源消耗, 验证了其在STM32场景下的推理性能与部署可行性。

参考文献

[1]

SHARSHAR AKHAN L UULLAH Wet al.Vision-language models for edge networks: A comprehensive survey[J].IEEE Internet of Things Journal202512(16): 32701-32724.

[2]

RUAN HLIU YWANG Bet al.Learning semantic-aware representation in visual-language models for multi-label recognition with partial labels[J]. ACM Transactions on Multimedia Computing, Communications, and Applications202521(3): 1-19.

[3]

RADFORD AKIM J WHALLACY Cet al. Learning transferable visual models from natural language supervision[C]//Proceedings of the 38th International Conference on Machine Learning, 2021: 8748-8763.

[4]

WANG J FHU X WZHANG P Cet al.MiniVLM: A smaller and faster vision-language model[DB/OL]. (2021-08-09)[2025-09-23].

[5]

VASU P K APOURANSARI HFAGHRI Fet al. MobileCLIP: Fast image-text models through multi-modal reinforced training[C]//IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), 2024: 15963-15974.

[6]

CHU X XQIAO L MLIN X Yet al. MobileVLM: A fast,strong and open vision language assistant for mobile devices[DB/OL]. (2023-12-28)[2025-09-23].

[7]

ARIF K H IYOON JNIKOLOPOULOS D Set al. HiRED: Attention-guided token dropping for efficient inference of high-resolution vision-language models[J]. Proceedings of the AAAI Conference on Artificial Intelligence202539(2): 1773-1781.

[8]

FARINA MMANCINI MCUNEGATTI Eet al. MULTIFLOW: Shifting towards task-agnostic vision-language pruning[C]//IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), 2024: 16185-16195.

[9]

RANG MBI ZLIU Cet al.Eve: Efficient multimodal vision language models with elastic visual experts[J]. Proceedings of the AAAI Conference on Artificial Intelligence202539(7): 6694-6702.

[10]

LI JLI DSAVARESE Set al. BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models[C]//Proceedings of the 40th International Conference on Machine Learning, 2023: 19730-19742.

[11]

YAO YYU T YZHANG Aet al.Efficient GPT-4V level multimodal large language model for deployment on edge devices[J].Nature Communications202516: 5509.

[12]

PENG BALCAIDE EANTHONY Qet al.RWKV: Reinventing RNNs for the transformer era[C]//Findings of the Association for Computational Linguistics: EMNLP 2023. Singapore: Association for Computational Linguistics, 2023: 14048-14077.

[13]

HOU H WZENG P GMA Fet al. VisualRWKV: Exploring recurrent neural networks for visual language models[C]//Proceedings of the 31st International Conference on Computational Linguistics, 2025: 10423-10434.

[14]

PHAN A HSOBOLEV KSOZYKIN Ket al. Stable low-rank tensor decomposition for compression of convolutional neural network[C]//Computer Vision-ECCV 2020. Cham: Springer, 2020: 522-539.

[15]

CAO Y ZCAO W WWANG Z Yet al.A light-weight rectangular decomposition large kernel convolution network for deformable medical image registration[J].Biomedical Signal Processing and Control202495: 106476.

[16]

SILVA J DMAGALHÃES JTUIA Det al. Multilingual vision-language pre-training for the remote sensing domain[C]//Proceedings of the 32nd ACM International Conference on Advances in Geographic Information Systems, 2024: 220-232.

[17]

LI JLI DXIONG Cet al.BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation[C]//International Conference on Machine Learning, 2022: 12888-12900.

[18]

LIU H TLI C YWU Q Yet al.Visual instruction tuning[DB/OL].(2023-12-11)[2025-09-23].

[19]

孙公凌云, 张靖渝, 连俊博, .基于轻量化卷积神经网络的多肉植物种类识别研究[J].传感技术学报202336(12): 1916-1927.

[20]

SUN GonglingyunZHANG JingyuLIAN Junboet al.Research on identification of succulent based on lightweight convolutional neural network[J].Chinese Journal of Sensors and Actuators202336(12): 1916-1927.(in Chinese)

[21]

WU H XXU J HWANG J Met al.Autoformer: Decomposition transformers with auto-correlation for long-term series forecasting[C]//35th Conference on Neural Information Processing Systems, 2021: 22419-22430.

[22]

DAVID RDUKE JJAIN Aet al.TensorFlow lite micro: Embedded machine learning for TinyML systems[C]//Proceedings of Machine Learning and Systems, 2021: 800-811.

[23]

LUO GCHENG LJING Cet al.A thorough review of models, evaluation metrics, and datasets on image captioning[J].IET Image Processing202216(2): 311-332.

[24]

LIN JCHEN W MLIN Y Jet al.MCUNet: Tiny deep learning on IoT devices[C]//34th International Conference on Neural Information Processing Systems, 2020: 11711-11722.

基金资助

国家自然科学基金资助项目(62203404)

AI Summary AI Mindmap
PDF (4379KB)

436

访问

0

被引

详细

导航
相关文章

AI思维导图

/