TransNeXt:视觉变换器的强大中央凹视觉感知
摘要
由于残差连接中的深度退化效应,许多依赖于堆叠层进行信息交换的高效 Vision Transformers 模型经常无法形成足够的信息混合,导致不自然的视觉感知。为了解决这个问题,在本文中,我们提出了聚合注意力机制,一种基于仿生设计的 token 混合器,它模拟生物的中央凹视觉和连续的眼球运动,同时使特征图上的每个 token 具有全局感知。此外,我们结合了与常规查询和键交互的可学习 token,这进一步使亲和矩阵的生成变得多样化,而不仅仅是依赖于查询和键之间的相似性。我们的方法不依赖于堆叠进行信息交换,从而有效避免了深度退化并实现了自然的视觉感知。 此外,我们提出了卷积 GLU,一种通道混合器,它弥合了 GLU 和 SE 机制之间的差距,它使每个 token 能够基于其最近邻图像特征进行通道注意,增强了局部建模能力和模型鲁棒性。我们将聚合注意力机制和卷积 GLU 结合起来,创建了一个名为 TransNeXt 的新视觉主干。大量实验表明,我们的 TransNeXt 在多种模型尺寸上均实现了最佳性能。在 2242 的分辨率下,TransNeXt-Tiny 的 ImageNet 准确率达到 84.0%,在参数减少 69% 的情况下超越了 ConvNeXt-B。我们的 TransNeXt-Base 在 3842 的分辨率下实现了 86.2% 的 ImageNet 准确率和 61.6% 的 ImageNet-A 准确率,COCO 对象检测 mAP 为 57.1,ADE20K 语义分割 mIoU 为 54.7。





图1. ImageNet-1K上的性能、ImageNet-A上的鲁棒性、基于Mask R-CNN 1×的COCO检测和实例分割性能、基于UperNet的ADE20K语义分割性能的综合比较。
1.介绍
近年来,视觉变换器 (ViT) [17] 已成为各种计算机视觉任务的流行骨干架构。ViT 模型包含两个关键组件:自注意层(令牌混合器)和 MLP 层(通道混合器)。自注意机制通过查询和键之间的相似性计算动态生成亲和力矩阵,在特征提取中起着至关重要的作用。这种全局信息聚合方法表现出了显著的特征提取潜力,没有像卷积 [31] 那样的归纳偏差,可以构建强大的数据驱动模型。然而,视觉变换器的变换器编码器设计最初是为语言建模 [58] 开发的,在下游计算机视觉任务中表现出固有的局限性。具体而言,自注意中的全局亲和力矩阵的计算由于其二次复杂度和高内存消耗而带来了挑战,这限制了其在高分辨率图像特征上的应用。
为了减轻自注意力机制固有的二次复杂度所带来的计算和内存负担,先前的研究提出了大量稀疏注意力机制。其中一种代表性方法是局部注意力[41],它将注意力限制在特征图上的一个窗口内。然而由于感受野有限,这种方法往往需要与不同类型的token混合器交替堆叠以实现跨窗口的信息交换。另一种代表性方法是对注意力的键和值进行空间下采样(如池化[61,62,64],网格采样[57])。由于牺牲了query对特征图的细粒度感知,这种方法也存在一定的局限性。近期的研究[7,57]将空间下采样注意力与局部注意力交替堆叠,取得了令人称赞的性能结果。
然而,最近的研究[12,59]和实验[28]表明,具有残差块[19]的深度网络表现得像浅层网络的集合,这表明通过堆叠块实现的跨层信息交换可能不如预期那么有效。
另一方面,局部注意力和空间下采样注意力与生物视觉的工作原理有很大不同。生物视觉对视觉焦点周围的特征具有较高的敏锐度,对远处特征的敏锐度较低。此外,随着眼球的移动,生物视觉的这一特性对于图像中任何位置的像素都保持一致,这意味着像素级的平移等方差。然而,在基于窗口划分的局部注意力中,窗口边缘和中心的标记并没有得到同等对待,呈现出明显的差异。
我们观察到,由于深度退化效应,许多高效的 ViT 模型无法通过堆叠形成足够的信息混合。即使有深层的堆叠,它们的窗口分区的轨迹也总是形成不自然的伪影,如图 2 所示。

图 2. 流行的视觉信息聚合机制、我们提出的方法和生物视觉系统的比较(左)以及使用第 3 阶段的输出对我们方法和流行的骨干网络之间的有效感受野 [45] 进行可视化比较(右)。每个 ERF 图像都是通过对 ImageNet-1K 验证集中的 5000 多张 2242 大小的图像进行平均生成的。
为了解决这个问题,我们研究了一种与生物视觉紧密结合的视觉建模方法,以减轻潜在的模型深度退化,并实现更接近人类中央凹视觉的信息感知。为此,我们首先引入了采用双路径设计的像素聚焦注意力。在一条路径上,每个查询对其最近邻特征具有细粒度的注意力,而在另一条路径上,每个查询对空间下采样特征具有粗粒度的注意力,从而实现全局感知。这种方法以像素为基础进行操作,有效地模拟了眼球的连续运动。此外,我们将查询嵌入和位置注意力机制融入到像素聚焦注意力中,从而提出了聚合像素聚焦注意力,我们将其简称为聚合注意力。这种方法进一步丰富了亲和力矩阵的生成方式,而不仅仅是依赖于查询和键之间的相似性,从而实现单个注意层内多种注意机制的聚合。我们还重新评估了视觉转换器中通道混合器的设计要求,并提出了一种名为卷积 GLU 的新型通道混合器。该混合器更适合图像任务,并集成了基于局部特征的通道注意以增强模型鲁棒性。
我们引入了 TransNeXt,这是一个分层视觉主干网络,它结合了聚合注意力作为 token 混合器和卷积 GLU 作为通道混合器。通过对图像分类、对象检测和分割任务的全面评估,我们证明了这些混合组件的有效性。我们的 TransNeXt-Tiny 仅在 ImageNet-1K 上进行了预训练,实现了 84.0% 的 ImageNet 准确率,超过了 ConvNeXt-B。在 COCO 对象检测中,它使用 DINO 检测头实现了 55.1 的框 mAP,比在 3842 分辨率下预训练的 ConvNeXt-L 高出 1.7。我们的TransNeXt-Small/Base模型在3842分辨率下仅经过5个epoch的微调,就达到了86.0%/86.2%的ImageNet准确率,比之前最好的经过30个epoch微调的MaxViT-Base模型高出0.3%/0.5%。此外,在极具挑战性的3842分辨率的ImageNet-A测试集上进行评估时,我们的TransNeXt-Small/Base模型达到了令人印象深刻的58.3%/61.6%的top1准确率,比ConvNeXt-L高出7.6%/10.9%,为ImageNet-1K监督模型的鲁棒性树立了新的标杆。
总而言之,我们的贡献如下:
1. 提出以像素为中心的注意力机制,一种与生物中央凹视觉紧密结合的 token 混合器,可减轻潜在的模型深度退化。这种新颖的注意力机制以像素为基础,有效地模拟眼球的连续运动,与生物视觉的焦点感知模式高度一致。 它具有与卷积相当的视觉先验。
2. 提出聚合注意力机制,这是像素级注意力机制的增强版本,它将两种非 QKV 注意力机制进一步聚合为像素级注意力机制。值得一提的是,我们在此框架内提出了一种高效的方法,额外计算开销仅占整个模型的 0.2%-0.3%,从而以极低的成本将 QKV 注意力机制、LKV 注意力机制和 QLV 注意力机制统一在单个混合器层中。
3. 提出长度尺度余弦注意力机制,增强现有注意力机制对多尺度输入的外推能力,使TransNeXt在大规模图像外推性能上优于纯卷积网络。
4. 提出卷积GLU,结合基于最近邻图像特征的通道注意力,与卷积前馈相比,以更少的FLOP实现通道混合器的注意力,有效提升模型的鲁棒性。
5. 引入TransNeXt,一种视觉主干,在类似规模的模型中,在图像分类、物体检测、语义分割等各种视觉任务中均表现出最佳性能,同时还表现出最佳的鲁棒性。
2.相关工作
视觉变换器:视觉变换器 (ViT) [17] 是第一个将变换器架构引入视觉任务的模型,其中图像被分割成不重叠的块,然后线性投影成标记序列,随后由变换器编码器对其进行编码。当使用大规模预训练数据或精心设计的训练策略进行训练时,ViT 模型的表现优于卷积神经网络 (CNN)[19、30、31],在图像分类和其他下游任务中表现出色。
非 QKV 注意力变体:在自注意力中,动态亲和力矩阵是通过查询和键之间的交互生成的。最近,一些研究 [2, 32, 55, 68] 探索了使用可学习的标记代替原始查询或键来生成动态亲和力矩阵。例如,Involution [32] 和 VOLO [68] 使用可学习的标记替换原始键,从而生成仅与查询相关的动态亲和力矩阵。相比之下,QnA [2] 使用可学习的标记替换查询,从而生成仅与键相关的动态亲和力矩阵。这两种方法都表现出了有效性。
仿生视觉建模:人类视觉对视觉焦点周围的特征表现出较高的敏锐度,而对远处特征的敏锐度较低。这种仿生设计已被集成到多个机器视觉模型中 [46, 66, 67]。 具体来说,Focal Transformer [66] 基于此概念设计了一种视觉注意,但它基于窗口分区进行操作。位于窗口边缘的标记无法获得自然的中央凹视觉,其窗口方式无法模拟人类眼球的连续运动。我们的方法有效地解决了这些缺点。
3. 方法
3.1. 聚合像素注意力机制
3.1.1 像素焦点注意力
受生物视觉系统功能的启发,我们设计了一种以像素为中心的注意力机制,该机制对每个查询附近具有细粒度感知,同时保持对全局信息的粗粒度感知。为了实现眼球运动固有的像素级平移等方差,我们采用了结合以查询为中心的滑动窗口注意力和池化注意力的双路径设计。此外,为了在两个注意力路径之间引起耦合,我们在同一个 softmax 中计算两个路径的查询键相似性结果的重要性。这导致细粒度和粗粒度特征之间的竞争,将以像素为中心的注意力转变为多尺度注意力机制。
给定一个输入 X ∈ R C×H×W ,我们现在关注对输入特征图中单个像素执行的操作。我们将以 (i, j) 处的像素为中心的滑动窗口内的一组像素定义为 ρ(i, j)。对于固定窗口大小 k × k,∥ρ(i, j)∥ = k 2 。同时,我们将从池化特征图中获得的像素集定义为 σ(X)。给定池化大小 Hp ×Wp,∥σ(X)∥ = HpWp。 因此,像素聚焦注意力 (PFA) 可以描述如下:

Activate and Pool:为了后续应用中能将PFA的线性复杂度模式用于大规模图像推理,我们采用无参数自适应平均池化在空间维度上进行下采样。 但平均池化算子信息损失较大,因此我们在特征图池化之前使用单层神经网络进行投影和激活,提前压缩提取有用信息,提高下采样后的信息压缩率。池化之后,我们再次使用层归一化对输出进行归一化,以保证X与σ(X)的方差一致性。我们提出的下采样算子Activate and Pool可以用以下公式表示:

我们用“激活和池化”机制替换了 PVTv2-li [62] 中的下采样模块,并设计了一个 2M 大小的模型用于 CIFAR-100 [29] 上的消融实验。 我们的模块将 PVTv2-li 的 top-1 准确率从 68.1% 提高到了 70.4%,证明了该方法的有效性。
Padding mask:在滑动窗口路径中,位于特征图边缘的像素不可避免地会与边界外的零填充计算相似度。为了防止这些零相似度影响 softmax 操作,我们使用了 padding mask 将这些结果设置为 −∞。
3.1.2 在单个 Mixer 查询嵌入中聚合多种注意力机制:一些视觉语言模型 [33, 34] 利用源自文本模态的查询对源自视觉模态的键进行交叉注意,从而实现跨模态信息聚合以完成视觉问答 (VQA) 任务。此外,在微调这些多模态模型以适应特定子任务时,合并和优化可学习前缀查询标记已被证明是有效且高效的。
这个想法的自然延伸是将这些可学习的查询标记合并到骨干网络的注意力机制中,用于图像分类、对象检测和语义分割等定义明确的任务,并直接对其进行优化。这种方法的有效性已得到先前研究 [2] 的验证。
该方法与传统的 QKV 注意力机制不同,它不使用输入中的查询,而是学习当前任务定义的查询以进行交叉注意力。因此,我们将该方法归类为可学习的键值 (LKV) 注意力机制,与 QKV 注意力机制相对应。我们发现,在传统 QKV 注意力机制中,向所有查询 token 添加可学习的查询嵌入 (QE) 可以实现类似的信息聚合效果,且额外开销几乎可以忽略不计。我们只需要将公式 1 修改如下:

位置注意力:信息聚合的另一种方法是使用一组可学习的键,这些键与来自输入的查询交互以获得注意力权重,即查询可学习值 (QLV) 注意力。此方法不同于传统的 QKV 注意力,因为它破坏了键和值之间的一一对应关系,从而学习了当前查询的更多隐式相对位置信息。因此,它通常与视觉任务中的滑动窗口结合使用 [32, 68]。与卷积或相对位置偏差等静态亲和力矩阵不同,以这种方式生成的亲和力矩阵会考虑当前查询的影响,并可以根据它进行动态调整。我们已经观察到,与静态相对位置偏差相比,这种数据驱动的建模方法表现出更高的鲁棒性,并且可以进一步增强局部性建模能力。 利用这一特性,我们在每个注意力头中引入一组可学习的 token T ∈ R d×k 2 ,让这些 token 与查询进行交互以获得额外的动态位置偏差并将其添加到 A(i,j)∼ρ(i,j) 。使用这种增强功能只需要额外的计算开销 HW k2C 。我们只需要将公式 4 修改如下:

3.1.3 克服多尺度图像输入
长度缩放余弦注意力:与缩放点积注意力相比,利用余弦相似度的缩放余弦注意力被观察到可以产生更适中的注意力权重 [24, 41],并有效增强大型视觉模型的训练稳定性 [13]。缩放余弦注意力通常会在查询和键的余弦相似度结果上乘以一个额外的可学习系数 λ,从而使注意力机制能够有效地忽略不重要的 token [24]。最近的研究 [5, 18] 发现,随着输入序列长度的增加,注意力输出的置信度会降低。因此,注意力机制的缩放因子应该与输入序列的长度相关 [5]。[52] 进一步提出注意力的设计应该具有熵不变性,以便更好地推广到未知长度。[52] 给出了当查询和键被近似为幅度为 √ d 的向量时,序列长度为 n 的缩放点积注意力的熵的估计:
![]()
对于余弦相似度,我们将查询和键沿其头部维度应用 ℓ2 正则化后分别定义为 ˆQ 和 ˆK,它们的量级均为 1。为了保持熵不变并忽略常数项,我们设置 λ ≈ log n 0.24 。鉴于等式 8 仅仅是一个估计值,我们设置 λ = τ log n ,其中 τ 是一个可学习变量,对于每个注意力头,它被初始化为 1 0.24 。我们提出长度尺度的余弦注意力如下:
![]()
这里,N 表示每个查询与之交互的有效键的数量,不包括掩码标记的数量。具体来说,当应用于 Transformer 解码器 [58] 时,因果掩码掩盖的未来标记不应计入 N。 在以像素为中心的注意力背景下,N 计算为 N(i,j) = ∥ρ(i, j)∥+∥σ(X)∥− ∥µ(i, j)∥,其中 µ(i, j) 表示位置 (i, j) 处的填充掩码标记集。
位置偏差:为了进一步增强像素聚焦注意力机制对多尺度图像输入的外推能力,我们采用不同的方法计算两条路径上的 B(i,j)∼ρ(i,j) 和 B(i,j)∼σ(X)。在池化特征路径上,我们使用对数间隔连续位置偏差 (log-CPB) [41],这是一个带有 ReLU [47] 的 2 层 MLP,从 Q(i,j) 和 Kσ(X) 之间的空间相对坐标 ∆(i,j)∼σ(X) 计算 B(i,j)∼σ(X)。在滑动窗口路径上,我们直接使用可学习的 B(i,j)∼ρ(i,j)。一方面,这是因为滑动窗口的大小是固定的,不需要通过 log-CPB 外推未知的相对位置偏差,从而节省计算资源。另一方面,我们观察到使用 log-CPB 计算 B(i,j)∼ρ(i,j) 会导致性能下降。我们认为这是因为 ∆(i,j)∼σ(X) 表示细粒度 token 和粗粒度 token 之间的空间相对坐标,而 ∆(i,j)∼ρ(i,j) 表示细粒度 token 之间的空间相对坐标,它们的数值含义不同。我们将在附录中进一步讨论这些细节。
聚合注意力:通过应用上述多种注意力聚合方法和技术来增强对多尺度输入的外推能力,我们提出了一种增强版的以像素为中心的注意力,称为聚合以像素为中心的注意力,我们将其缩写为聚合注意力(AA)。它可以描述如下:

3.1.4 特征分析
计算复杂度:给定一个输入 X ∈ R C×H×W ,一个池化大小为 Hp×Wp ,一个窗口大小为 k×k ,我们考虑“激活和池化”操作和线性投影的影响。像素级注意力和聚合注意力的计算复杂度为:

我们观察到,当池化大小 Hp × Wp 设置为与输入大小无关的值时,Ω(PFA) 和 Ω(AA) 都与输入序列的长度成线性比例。 这意味着 PFA 和 AA 都可以在线性复杂度模式下执行推理。
最佳准确率-效率权衡:通过实证研究,我们观察到滑动窗口的大小对模型性能的影响可以忽略不计。因此,我们采用 3 × 3 滑动窗口的最小形式来捕获视觉焦点附近的特征,从而显著减少计算和内存消耗。我们将其归因于池化特征路径的存在,它为每个查询赋予一个全局感受野,从而大大减少了扩大滑动窗口大小以扩展感受野的需要。详细的消融研究结果和讨论可在附录中找到。
3.2. 卷积 GLU
3.2.1 动机
ViT时代的门控通道注意力机制:前期工作以Squeeze-and-Excitation (SE)机制[25]为代表,首次将通道注意力机制引入计算机视觉领域,该机制使用一个带有激活函数的分支来门控网络输出。在门控通道注意力机制中,门控分支比值分支拥有更多的决策权,最终决定对应输出元素是否归零。从这个角度来看,SE机制巧妙地利用了全局平均池化后的特征作为门控分支的输入,实现了最大的感受野以便更好地进行决策,同时解决了CNN结构中感受野不足的问题。然而在ViT时代,全局感受野已经不再稀缺,以自注意力为代表的各种全局token混合器都实现了比全局平均池化更高质量的全局信息聚合。 这使得SE机制所采用的全局池化方法表现出一些不足,比如该方法使得特征图上的所有token共享同一个门控信号,使得其通道注意力机制缺乏灵活性且过于粗粒度。尽管如此,值得注意的是,ViT 结构缺乏通道注意力。最近的研究 [74] 发现,将 SE 机制纳入通道混合器可以有效增强模型鲁棒性,如图 4 所示。

图 4. 流行的通道混合器设计与卷积 GLU 的比较
ViT 时代的卷积:最近的研究 [8, 27] 表明,在视觉变换器中引入 3×3 深度卷积 [6] 可以看作是一种条件位置编码 (CPE) [8] 的形式,它可以有效地从零填充中捕获位置信息。
3.2.2 重新思考通道混合器的设计
门控线性单元 (GLU) [11, 51] 是一种通道混合器,在各种自然语言处理任务中,它的表现优于多层感知器 (MLP)。GLU 由两个线性投影组成,它们逐元素相乘,其中一个投影由门控函数激活。与 SE 机制不同,它对每个 token 的门控信号都来自 token 本身,并且没有比值分支更大的接受域。
更优雅的设计:我们发现,只需在GLU门控分支的激活函数前添加一个极简形式的3×3深度卷积,就可以使其结构符合门控通道注意力的设计理念,转化为基于最近邻特征的门控通道注意力机制。我们将这种方法命名为卷积GLU,如图4所示。
特征分析:卷积GLU(ConvGLU)中的每个token都拥有一个独特的门控信号,该信号基于其最近的细粒度特征。这解决了SE机制中全局平均池化过于粗粒度的缺点,也满足了一些没有位置编码设计的ViT模型的需求,这些模型需要深度卷积提供的位置信息。此外,这种设计的值分支仍然保持与MLP和GLU相同的深度,使其有利于反向传播。在保持参数量与扩展率为R、卷积核大小为k×k的卷积前馈(ConvFFN)[62]保持一致时,ConvGLU的计算复杂度为2RHW C2 + 2 3RHW Ck2,小于ConvFFN的2RHW C2 +RHW Ck2。这些属性使ConvGLU成为一个简单但更强大的混合器,满足ViT的多样化要求。
3.3. TransNeXt 的架构设计
为了保证在后续消融实验 4.2 中的一致性,TransNeXt 采用与 PVTv2 [62] 相同的四阶段分层骨干网络和重叠块嵌入。第 1-3 阶段聚合注意力的池化特征大小也设置为 H 32×W 32 ,与 PVTv2 相同。在第 4 阶段,由于特征图大小减小到 H 32×W 32 ,特征池化模块无法正常工作。我们采用了一种改进版本的多头自注意力(MHSA),其应用了查询嵌入和长度缩放余弦注意力。这与 PVTv2 在第四阶段对 MHSA 的使用一致。对于第 1-4 阶段的通道混合器,我们使用带有 GELU [22] 激活的卷积 GLU。扩展比例也遵循 PVTv2 的 [8,8,4,4] 设置。为了与典型的MLP参数保持一致,卷积GLU的隐藏层维度为设定值的2 3倍。此外,我们将头部维度设置为24,以便在通道维度上能被3整除。TransNeXt变体的具体配置可以在附录中找到。
4.实验

表 1. 在 ImageNet-1K 分类和附加稳健性测试集上的全面比较。
ImageNet-1K 分类:我们的代码是基于 PVTv2 [62] 实现的,并遵循 DeiT [56] 训练方法。该模型在 ImageNet1K [14] 数据集上从头开始训练了 300 个时期,利用 8× GPU 上的自动混合精度 (AMP)。附录中详细介绍了训练期间使用的特定超参数。为了对模型的稳健性进行全面评估,我们使用了几个额外的测试集。这些包括 ImageNet-C [21],一个 2242 大小的测试集,将算法扭曲应用于 ImageNet-1K 验证集;ImageNet A [23],一个由对抗性示例组成的测试集;ImageNetR [21],一个扩展测试集,包含 ResNet50 [19] 未能正确分类的样本;ImageNet-Sketch [60],包含手绘图像;以及 ImageNet-V2 [49],一个采用与 ImageNet-1K 相同采样策略的扩展测试集。
实验结果:表 1 中的实验结果表明,我们提出的模型在 ImageNet-1K 准确率和跨尺度鲁棒性方面树立了新的标杆。具体而言,我们的 TransNeXt-Micro 模型在 ImageNet-1K 上实现了 82.5% 的 top-1 准确率,超越了 FocalNet-T(LRF),同时参数减少了 55%。同样,我们的 TransNeXt-Tiny 模型实现了 84.0% 的 top-1 准确率,优于 ConvNeXt-B,参数减少了 69%。值得注意的是,在 3842 的分辨率下,我们的 TransNeXt-Small/Base 模型仅经过 5 个 epoch 的微调就分别超越了更大的 MaxViT-Base 模型 0.3%/0.5%,而 MaxViT-Base 则使用了 30 个 epoch。在鲁棒性方面,我们的模型在另外五个测试集上表现出色。值得注意的是,在最具挑战性的 ImageNet-A 测试集上,随着模型规模的扩大,TransNeXt 表现出了显著的鲁棒性优势。在 2242 分辨率的 ImageNet-A 上,我们的 TransNeXt-Base 比 MaxViT-Base 领先 6.4%。在 3842 分辨率下,我们的 TransNeXt-Small/Base 在 ImageNet-A 上的准确率高达 58.3%/61.6%,远超 ConvNeXt-L 7.6%/10.9%,而它们的参数数量分别仅为 ConvNeXtL 的 25% 和 45%。
目标检测和实例分割:我们使用了按照 1 倍训练计划训练的 Mask R-CNN [20] 检测头,来评估经过 ImageNet1K 预训练的 TransNeXt 在 COCO [37] 数据集上目标检测和实例分割的性能。实验结果如图 1 所示。与之前的最先进的模型相比,我们的模型展示了全面的优势。值得注意的是,即使是我们的微型模型,在 APb 方面也超过了 FocalNet、InternImage 和 CSWin 的基础模型。同样,我们使用了按照 1 倍训练计划训练的 DINO [71] 检测头,来进一步评估我们的模型在目标检测方面的潜力。我们的 TransNeXtTiny 模型在 4 尺度设置下实现了 55.1 的 APb,超过了 ConvNeXt-L(4 尺度设置下的 APb 为 53.4)1.7,而后者的主干参数仅为后者的 14%。我们的 TransNeXt-Base 在 5 尺度设置下实现了 57.1 的 APb,接近在 ImageNet-22K 上预训练的 Swin-L(5 尺度设置下 APb 为 57.2)的性能。
语义分割:我们使用 UperNet [65] 和 Mask2Former [4] 方法对经过 ImageNet-1K 预训练的 TransNeXt 在 5122 的分辨率下进行了 160k 次迭代,并在 ADE20K 上评估了其语义分割性能 [73]。在 UperNet 方法下,如图 1 所示,我们的 TransNeXt 在所有尺寸上都表现出优于以前方法的全面优势。我们的 TransNeXtBase 甚至超越了在 ImageNet-22K 上预训练并在 6402 的分辨率下进一步训练的 ConvNeXt-B(mIoU 52.6)。同样,在 Mask2Former 方法下,我们的 TransNeXt-Small 实现了 54.1 的 mIoU,超越了在 ImageNet-22K 上预训练并在 6402 的分辨率下进一步训练的 Swin-B(mIoU 53.9)。此外,我们的 TransNeXt-Base 实现了 54.7 的 mIoU。这些结果表明,我们的方法有潜力超越模型大小限制并突破数据量障碍。
与分类任务相比,我们的模型在密集预测任务中表现出更明显的性能优势。我们相信这验证了聚合注意力的仿生视觉设计的有效性,与以前的方法相比,它可以在早期阶段实现更自然的视觉感知,如图 2 所示。
4.1. 多尺度推理
在推理过程中,TransNeXt 在正常模式下将 Hp 和 Wp 设置为输入大小的 1 32 ,而在线性模式下,它们固定为 7 × 7 。如图 6 (左)所示,TransNeXt 在正常和线性模式下的表现都优于纯卷积解决方案。大卷积核方案 [15, 39] 也是为解决深度退化问题而提出的,但在大图像尺寸推理过程中性能下降明显。 这揭示了我们的方法在解决这个问题上优于大核方案。例如,RepLKNet31B 在 6402 的分辨率下仅达到 0.9% 的准确率。 传统观点认为,纯卷积模型比 ViT 模型具有更好的多尺度适用性,这样的实验结果意味着这种观点需要重新审视。大核策略的性能下降也值得研究界进一步研究。
图 6(右)说明了长度缩放余弦和使用插值对位置偏差的影响。 长度缩放在 6402 的分辨率下变得显著,表明在 softmax 中超过 8 倍的序列长度变化开始显著降低缩放余弦注意力的置信度。对相对位置偏差应用插值会导致性能大幅下降,强调在多尺度推理中使用外推位置编码 (log-CPB) 的有效性。
4.2. 从 PVT 到 TransNeXt 的路线图
我们方法的有效性:我们提出的卷积 GLU (ConvGLU)、像素聚焦注意力、位置注意力和查询嵌入的有效性通过步骤 4 到 8 的消融实验得到证明。在步骤 4 到 5、步骤 6 和步骤 7 到 8 的阶段中,我们分别用 ConvGLU 替换卷积前馈 (ConvFFN)、用像素聚焦注意力 (PFA) 替换空间缩减注意力 (SRA) 以及用聚合注意力替换像素聚焦注意力。这三种替换分别导致 ImageNet-1K 上的准确率提高了 0.8%、0.9% 和 0.7%,ImageNet-A 测试集上的准确率提高了 4.3%、3.4% 和 3.0%,表明这三个组件对性能的贡献很大。值得注意的是,在像素级注意力机制中引入 QLV 和 LKV 机制只需要额外增加 0.2% 的参数(从 12.78M 到 12.81M)和 0.3% 的计算开销(从 2.65G 到 2.66G),但性能提升却非常显著,从而实现了成本有效的权衡。此外,在步骤 4 中,用 GLU 替换 ConvFFN 会导致性能显著下降,这凸显了 3×3 深度卷积 [6] 作为条件位置编码 (CPE) [8] 的必要性,尤其是因为 PVTv2 的 SRA [62] 在此阶段没有使用任何其他位置编码。因此,步骤 5 也证明了使用 ConvGLU 作为位置编码的有效性。
表 2. 消融实验展示了从 PVTTiny 到 TransNeXt-Micro 的完整路线图。在步骤 1 中,PVTv2 引入了重叠块嵌入和卷积前馈 (ConvFFN)。在步骤 2 中,我们使 PVTv2 在高度和宽度方面与 TransNeXt-Tiny 保持一致,头部尺寸为 48。在步骤 3 中,我们将头部尺寸减小到 24,并增加了注意力头的数量。
5. 结论
在这项工作中,我们提出了一种基于仿生中心凹视觉设计的 token 混合器 Aggregated Attention 和一种具有门控通道注意的通道混合器 Convolutional GLU。 我们将它们结合起来,提出了一个强大且高度稳健的视觉模型 TransNeXt,该模型在分类、检测和分割等各种视觉任务中实现了最先进的性能。TransNeXt 在多尺度推理中的出色性能凸显了其在解决深度退化问题方面优于大核策略的优势。此外,我们提供了一个 CUDA 实现,在训练中实现了高达 103.4% 的加速,在推理中实现了 60.5% 的加速。附录中包含了更详细的实验数据和讨论。
魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)