点击上方“小白学视觉”,选择加"星标"或“置顶

重磅干货,第一时间送达图片

在计算机视觉领域,如何高效地捕获长距离依赖并实现稳定的模型训练一直是研究的热点。今天要给大家介绍的是一篇来自CVPR 2025的论文——“GroupMamba: Efficient Group-Based Visual State Space Model”,这篇论文提出了一种创新的方法,为解决这些问题带来了新的思路。

一、论文简介

这篇论文的作者包括Abdelrahman Shaker、Syed Talal Wasim、Salman Khan等。论文的源码可以在这里获取。状态空间模型(SSMs)近年来在捕获长距离依赖方面展现出了潜力,但在计算机视觉任务中,纯基于SSM的模型面临着稳定性和实现最先进性能的挑战。本文旨在解决这些问题,提出了一系列创新的方法。

二、论文创新点

1. 调制分组曼巴层

受分组卷积的启发,论文提出了调制分组曼巴层。该层采用多方向扫描方法,将输入通道划分为四组,每个分组独立应用基于状态空间模型的高效视觉单选择性扫描(VSSS)块,在四个空间方向(从左到右、从右到左、从上到下和从下到上)上进行扫描。这种方法增强了状态空间模型的计算效率和交互性,能够有效对局部和全局信息进行建模。

2. 通道亲和调制算子

为了解决分组操作中通道交互有限的问题,作者设计了通道亲和调制(CAM)算子。该算子通过对输入进行平均池化计算通道统计信息,再进行亲和度计算,对分组曼巴算子的输出进行重新校准,增强了通道间的信息交换和特征聚合能力。

3. 蒸馏训练目标

针对基于状态空间模型的架构在大模型训练时不稳定的问题,论文引入了基于蒸馏的训练目标。将标准交叉熵损失与蒸馏损失相结合,使学生模型学习教师模型的行为,稳定了大参数模型的训练,实现了更好的性能和更平滑的损失收敛趋势。

4. 分组曼巴模型系列

基于提出的调制分组曼巴层,作者构建了一系列参数高效的通用分类模型,称为GroupMamba。

三、方法详解

1. 预备知识

状态空间模型(SSMs)如S4和Mamba是受循环神经网络(RNNs)和卷积神经网络(CNNs)组合启发的结构化序列架构,在序列长度上具有线性或接近线性的扩展性。为了用于深度学习中的序列建模任务,需要对其进行离散化,Mamba通过S6选择性扫描机制与S4区分开来。

2. 整体架构

模型使用了类似于Swin - Transformer的分层架构,包含四个阶段,以有效地处理不同分辨率的图像。输入图像首先通过块嵌入层,然后在每个阶段通过调制分组Mamba块和下采样层。整体架构

3. 调制分组Mamba层

调制分组Mamba层的整体操作包括分组Mamba算子、通道亲和调制(CAM)算子和前馈网络(FFN)。分组Mamba算子将输入通道划分为四个组,每个组在不同方向上进行扫描,并应用VSSS块。CAM算子通过平均池化和亲和性计算重新校准分组Mamba算子的输出。调制分组Mamba层

4. 蒸馏损失函数

为了缓解Mamba在扩展到大型模型时训练不稳定的问题,作者在标准交叉熵目标的基础上使用蒸馏目标,联合损失函数由分类损失和蒸馏损失组成。

四、实验结果

1. 图像分类

在ImageNet - 1K数据集上的实验结果表明,GroupMamba模型在准确性和计算效率之间实现了显著的平衡。GroupMamba - T以2300万个参数和4.5 GFLOPs实现了83.3%的top - 1准确率,优于多个最先进的方法。图像分类结果

2. 目标检测和实例分割

在MS - COCO 2017数据集上,GroupMamba - T在目标检测和实例分割任务中超越了ResNet - 50、Swin - T和ConvNeXt - T等模型,并且比VMamba - T使用的参数少20%。目标检测和实例分割结果

3. 语义分割

在ADE20K数据集上,GroupMamba - T在语义分割方面表现良好,超越了多个最先进的方法,包括ResNet - 50、Swin - T和ConvNeXt - T等。语义分割结果

4. 消融研究

消融研究表明,每个创新点都对模型的性能有积极的贡献,如多方向扫描提高了吞吐量,CAM模块提高了准确率,蒸馏损失稳定了训练。消融研究结果

五、结论与未来工作

本文通过引入调制分组Mamba层、多方向扫描方法、通道亲和调制算子和蒸馏训练目标,解决了视觉SSM在计算机视觉任务中面临的计算效率低下和稳定性挑战。实验结果表明,GroupMamba模型优于最近的SSM,同时在参数和吞吐量方面更加高效。未来,作者旨在探索更多的下游任务,如视频识别和时间序列数据应用,以进一步验证和扩展方法的泛化能力。

总之,这篇论文为计算机视觉领域的研究带来了新的突破,相信在未来的研究中,GroupMamba模型将为更多的应用场景提供有力的支持。

下载1:OpenCV-Contrib扩展模块中文版教程

在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。


下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。


下载3:OpenCV实战项目20讲
在「小白学视觉」公众号后台回复:OpenCV实战项目20讲,即可下载含有20个基于OpenCV实现20个实战项目,实现OpenCV学习进阶。


交流群

欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~
Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐