计算机视觉识别任务
在这里插入图片描述

1. 语义分割

  • 语义分割思路
    1)滑动窗口
    在这里插入图片描述
    但是这种方法效率太低了,重叠区域反复被计算
    2)全卷积
    在这里插入图片描述
    但是,如果处理过程中保持原始分辨率,对于显存的需求会非常庞大…
    解决方案
    在这里插入图片描述
    上采样?
    在这里插入图片描述
    第二种方法还原的位置可能不对,引入index pooling方法,如下
    在这里插入图片描述
    可学习的上采样:转置卷积
    在这里插入图片描述
    在这里插入图片描述
    例子
    在这里插入图片描述
    在这里插入图片描述
    左边下采样,右边上采样
    在这里插入图片描述

2. 目标检测

1)单目标(分类+定位)
在这里插入图片描述
2) 目标检测:多目标
在这里插入图片描述
CNN利用滑动窗口对图像中所有可能的区域进行分类,计算量巨大!!

后来改进,用区域建议Selective Search选取候选框
在这里插入图片描述
有了R - CNN
在这里插入图片描述
改进之后,有了Fast-RCNN

在这里插入图片描述
Fast-RCNN能实现端对端的网络,其中最主要的贡献就是在裁剪+缩放特征部分实现可导,ROI Pooling

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐