作家
登录

CNN中的maxpool到底是什么原理?

作者: 来源: 2017-07-13 12:58:04 阅读 我要评论

作者经由过程实验论证了 MOP pooling 这种方法获得的特点必定的不变性。基于这种 MOP pooling 笔者并没有做过具体的实验,所以实验效不雅只能参考论文本身了。

具体地,在 L=1 的标准下,也就是全图,直接 resize 到 256*256 的大年夜小,然后送进收集,获得第七层全连接层 4096 维的特点;在 L=2 时,应用 128*128(步长为 32) 的窗口进行滑窗,因为收集的图像输入最小尺寸是 256*256,所以作者将其上采样到 256256,如许可以获得很多的局部特点,然后对其进行 VLAD 编码,个中聚类中间设置为 100,4096 维的特点降到了 500 维,如许便获得了 50000 维的特点,然后将这 50000 维的特点再降维获得 4096 维的特点;L=3 的处理过程与 L=2 的处理过程一样,只不过窗口的大年夜小编程了 64*64 的大年夜小。

CROW pooling

对于 Object Retrieval,在应用 CNN 提取特点的时刻,我们所欲望的是在有物体的区域进行特点提取,就像提取局部特点比如 SIFT 特点构 BoW、VLAD、FV 向量的时刻,可以采取 MSER、Saliency 等手段将 SIFT 特点限制在有物体的区域。同样基于如许一种思路,在采取 CNN 做 Object Retrieval 的时刻,我们有两种方法来更细化 Object Retrieval 的特点:一种是先做物体检测然后在检测到的物体区域琅绫擎提取 CNN 特点;另一种方法是我们经由过程某种权重自适应的方法,加大年夜有物体区域的权重,而减小风景体区域的权重。CROW pooling ( Cross-dimensional Weighting for Aggregated Deep Convolutional Features ) 等于采取的后一种办法,经由过程构建 Spatial 权重和 Channel 权重,CROW pooling 可以或许在必定程度上加大年夜感兴趣区域的权重,降低风景体区域的权重。其具体的特点表示构建过程如下图所示:

CNN中的maxpool到底是什么道理?

其核心的过程是 Spatial Weight 和 Channel Weight 两个权重。Spatial Weight 具体在计算的时刻,是直接对每个 channel 的 feature map 乞降相加,这个 Spatial Weight 其实可以懂得为 saliency map。我们知道,经由过程卷积滤波,响应强的处所一般都是物体的边沿等,因而将多个通道相加乞降后,那些非零且响应大年夜的区域,也一般都是物体地点的区域,因而我们可以将它作为 feature map 的权重。Channel Weight 借用了 IDF 权重的思惟,即对于一些高频的悼?船比如 “the”,这类词出现的频率异常大年夜,然则它对于信息的表达其实是没多大年夜用处的,也就是它包含的信息量太少了,是以在 BoW 模型中,这类停用词须要降低它们的权重。借用到 Channel Weight 的计算过程中,我们可以想象如许一种情况,比如某一个 channel,其 feature map 每个像素值都长短零的,且都比较大年夜,大年夜视觉上看上去,白色区域占据了全部 feature map,我们可以想到,这个 channel 的 feature map 是晦气于我们去定位物体的区域的,是以我们须要降低这个 channel 的权重,而对于白色区域占 feature map 面积很小的 channel,我们认为它对于定位物体包含有很大年夜的信息,是以应当加大年夜这种 channel 的权重。而这一现象跟 IDF 的思惟特别吻合,所以作者采取了 IDF 这一权重定义了 Channel Weight。

总体来说,这个 Spatial Weight 和 Channel Weight 的设计照样异常奇妙的,不过如许一种 pooling 的方法只能在必定程度上契合感兴趣区域,我们可以看一下 Spatial Weight*Channel Weight 的热力争:

图片来源:cs231n

MAX pooling

大年夜膳绫擎可以看到,权重大年夜的部分重要在塔尖部分,这一部分可以认为是 discriminate 区域,当然我们还可以看到,在图像的其他区域,还有一些比较大年夜的权重分布,这些区域是我们不想要的。当然,大年夜笔者可视化了一些其他的图片来看,这种 crow pooling 方法并不老是成功的,也存在着一些图片,其权重大年夜的区域并不是图像中物体的主体。不过,大年夜切切级图库上跑出来的结不雅来看,crow pooling 这种方法照样可以取得不错的效不雅。

RMAC pooling

RMAC pooling 的池化方法源自于 Particular object retrieval with integral max-pooling of CNN activations,三作是 Hervé Jégou(和 Matthijs Douze 是好基友)。在这篇文┞仿中,作者提出来了一种 RMAC pooling 的池化方法,其重要的思惟照样跟膳绫擎讲过的 MOP pooling 类似,采取的是一种变窗口的方法进行滑窗,只不过在滑窗的时刻,不是在图像长进行滑窗,而是在 feature map 长进行的 (极大年夜的加快了特点提取速度),此外在归并 local 特点的时刻,MOP pooling 采取的是 VLAD 的方法进行归并的,而 RMAC pooling 则处理得更简单 (简单并不代表效不雅不好),直接将 local 特点相加获得最终的 global 特点。其具体的滑窗方法如下图所示:

图片来源:Day 2 Lecture 6 Content-based Image Retrieval

图中示意的是三种窗口大年夜小,图中‘x’代表的是窗口的中间,对于每一个窗口的 feature map,论文中采取的是 MAX pooling 的方法,在 L=3 时,也就是采取图中所示的三种窗口大年夜小,我们可以获得 20 个 local 特点,此外,我们半数个 fature map 做一次 MAX pooling 会获得一个 global 特点,如许对于一幅图像,我们可以获得 21 个 local 特点 (如不雅把获得的 global 特点也视为 local 的话),这 21 个 local 特点直接相加乞降,即获得最终全局的 global 特点。论文中作者比较了滑动窗口数量对 mAP 的影响,大年夜 L=1 到 L=3,mAP 是慢慢晋升的,然则在 L=4 时,mAP 不再晋升了。实际上 RMAC pooling 中设计的窗口的感化是定位物体地位的 (CROW pooling 经由过程权重图定位物体地位)。如上图所示,在窗口与窗口之间,都是必定的 overlap,而最终在构成 global 特点的时刻,是采取乞降相加的方法,是以可以看到,那些重叠的区域我们可以认为是赐与了较大年夜的权重。


  推荐阅读

  揭秘亚马逊玩转仓储分拣技术,智能系统基于大数据

7月11日,亚马逊全球第三届会员日(PrimeDay)正式开启,中国Prime会员初次介入个中,这意味着亚马逊须要调动全球仓储物流的资本,包管中国会员在最短的时光收到海外直邮的担保。 “每次>>>详细阅读


本文标题:CNN中的maxpool到底是什么原理?

地址:http://www.17bianji.com/lsqh/36193.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)