FPN+PAN结构,SPP结构

最新推荐文章于 2026-05-12 09:46:52 发布

原创最新推荐文章于 2026-05-12 09:46:52 发布 · 1.5w 阅读

63 ·

本内容遵循CC 4.0 BY-SA版权协议

标签

#深度学习 #python #pytorch

Computer Vision 专栏收录该内容

34 篇文章

订阅专栏

FPN通过高层特征传递语义信息以增强多尺度检测，而PAN则反向传递底层定位信息，提高小目标识别准确性。SPP网络解决了CNN对固定输入尺寸的需求和R-CNN的重复计算问题，通过ROIAlign提高检测和分割精度。这些技术在fastR-CNN、fasterR-CNN和maskR-CNN等模型中得到应用。

Qwen3-32B-Chat 私有部署镜像 | RTX4090D 24G 显存 CUDA12.4 优化版

本镜像基于 RTX 4090D 24GB 显存 + CUDA 12.4 + 驱动 550.90.07 深度优化，内置完整运行环境与 Qwen3-32B 模型依赖，开箱即用。

一、FPN+PAN

在这里插入图片描述
FPN 高维度向低维度传递语义信息（大目标更明确）
PAN 低维度向高维度再传递一次语义信息（小目标也更明确）
请添加图片描述

二、SPP

深层的feature map携带有更强的语义特征，较弱的定位信息。而浅层的feature map携带有较强的位置信息，和较弱的语义特征。FPN就是把深层的语义特征传到浅层，从而增强多个尺度上的语义表达。而PAN则相反把浅层的定位信息传导到深层，增强多个尺度上的定位能力。

在何恺明2015年《Spatial Pyramid Pooling in Deep ConvolutionalNetworks for Visual Recognition》被提出，改论文主要改进两点：

解决CNN需要固定输入图像的尺寸，导致不必要的精度损失的问题；

因为带有全连接层的网络结构都需要固定输入图像的尺度，当然后期也有直接用conv层代替FC层的，比如SSD网络直接用conv层来计算边界框坐标和置信度的。

解决R-CNN对候选区域进行重复卷积计算，导致计算冗余的问题；

因为R-CNN网络中基于segment seletive输出的2000个候选框都要重新计算feature map较为耗时，因此提出了候选区域到全图的特征(feature map)之间的对应映射，这样图像只需计算一次前向传播即可。
在之后的 fast R-CNN 和 faster R-CNN 都采用这种映射关系，为ROI pooling层。
但在mask R-CNN中，用ROI Align替代了ROI pooling层，其认为两次量化的候选框与最开始的回归候选框有一定偏差，影响检测和分割准确度，ROI Align中不进行float量化，通过双线性内插计算四个坐标点，然后进行max pooling。

您可能感兴趣的与本文相关的镜像