ResNet网络卷积视觉网络 和 Vit (Vision Transformer)两种网络对比

1. 卷积神经网络

1.1 特点: 卷积+池化 (位置信息)天然携带,具有感知野, 位置信息在特征图上

最终得到的特征图的像素就是 patch 维度就是卷积核数(在vit是隐藏层) , ** 卷积核的数量——>高维信息宽 **,

(图片数量, 高维长度, 特征图宽, 特征图长)

请添加图片描述

请添加图片描述
请添加图片描述

2. ViT

2.1 Vision Transformer 本身不是用卷积核,没有卷积操作,位置信息,在patch的位置编码上

依靠自注意力机制(self-attention),将图片切块——>做映射(高维),在注意力模式中对于每一个图像块 patch 进行联系

请添加图片描述

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐