RTMDet:通用单阶段目标检测器

论文:RTMDet: An Empirical Study of Designing Real-Time Object Detectors
代码:https:// github.com/open-mmlab/mmdetection/tree/3.x/configs/rtmdet
RTMDet是一个通用的单阶段目标检测器。通过在主干和颈部的基本构建块中探索大核卷积来提高模型效率,并相应地平衡模型深度、宽度和分辨率。同时进一步探索动态标签分配策略中的软标签以及数据扩充和优化策略的更好组合以提高模型准确性。其架构如图所示:
微信图片_20260805171729_1433_101.png

Backbone:CSPDarkNet

  • 基础结构:CSPDarkNet。
  • 核心改进:在基本构建块中引入 5×5 深度卷积,增大有效感受野,提升上下文建模能力,显著提高精度。
  • 多级特征输出:提取 C3、C4、C5 三个尺度的特征,供后续颈部融合。

Neck, CSP-PAFPN

  • 采用与主干相同的基本块(CSP 结构),构建 CSP-PAFPN 进行多级特征融合。
  • 平衡设计:通过增加颈部基本块的扩展率,使主干与颈部具有相近的容量,将更多参数和计算从主干移至颈部,在计算代价和精度之间取得更优权衡

共享检测头(Heads)

  • 共享参数策略:跨尺度检测头共享卷积权重,但为每个尺度保留独立的批归一化(BN)层,大幅减少参数量,同时保持检测精度

动态标签分配(软标签)

  - 引入软目标替代硬标签,改进动态标签分配策略:
  - 提升代价矩阵对高质量匹配的判别能力;
  - 降低标签分配中的噪声,从而提升模型精度。

两阶段训练

  • 第一阶段:使用强数据增强(Mosaic、MixUp、随机旋转和剪切)。
  • 第二阶段:使用弱数据增强(随机调整大小和翻转)。
  • 优化器:采用 AdamW(通常用于 ViT,较少用于卷积检测器),但在本框架中表现出色。

训练结果:

image.png