ResNet网络卷积视觉网络 和 Vit (Vision Transformer)两种网络对比
·
ResNet网络卷积视觉网络 和 Vit (Vision Transformer)两种网络对比
1. 卷积神经网络
1.1 特点: 卷积+池化 (位置信息)天然携带,具有感知野, 位置信息在特征图上
最终得到的特征图的像素就是 patch 维度就是卷积核数(在vit是隐藏层) , ** 卷积核的数量——>高维信息宽 **,
(图片数量, 高维长度, 特征图宽, 特征图长)



2. ViT
2.1 Vision Transformer 本身不是用卷积核,没有卷积操作,位置信息,在patch的位置编码上
依靠自注意力机制(self-attention),将图片切块——>做映射(高维),在注意力模式中对于每一个图像块 patch 进行联系

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐



所有评论(0)