DEFORMABLE DETR详解

2023年6月23日下午5:52 • 人工智能 • 阅读 76

1.解决问题

DETR 需要比现有的目标检测器更长的训练时间来收敛。
DETR在检测小物体方面的性能相对较低，并且无法从高分辨率特征地图中检测到小物体。
可变形卷积可以识别重要特征，但是无法学习重要特征之间的联系

transformer组件在处理图像特征图中的不足。在初始化时，注意模块对特征图中的所有像素施加了几乎一致的注意权重。长时间的训练周期是为了学习注意权重，以关注稀疏的有意义的位置。另一方面，transformer编码器中的注意权值计算是二次计算w.r.t.像素数。因此，处理高分辨率的特征映射具有非常高的计算和内存复杂性。

2.核心思想

Deformable DETR， 它的注意模块只关注一个目标周围的一小部分关键采样点。Deformable DETR可以获得比DETR（特别是在小物体上）更好的性能，在训练时间少10×的时期。

3.实施细节

可变形注意模块无论特征图的空间大小如何，都只关注参考点周围的一小组关键采样点（reference point）。通过为每个queries只分配少量固定数量的keys，可以缓解收敛性和特征空间分辨率的问题。

对于初始化，首先初始化采样附近的n个点（默认为4），即认为附近的点的特征对该点的关系最强，但是一定是吗？不一定，那么我们可以通过网络学习，偏移到关系最强的点。但是神经网络学习到的偏移不一定是小数，怎么办呢？那么我们就可以通过周围的点进行插值得到该点的特征。

公式详解：

如下图所示，

表示特征图上的原始特征，经过全连接层做特征映射，同时采样出3个采样点。同时

经过全连接层可得到注意力权重（qk）

Multi-scale Deformable Attention Module.

外部的m表示多头注意力机制，L表示特征金字塔的维度，作者可能认为不同尺度同一位置的特征相似，因此，做相加操作。K表示采样的特征点

4.整体架构

5.预测头的设置

Iterative Bounding Box Refifinement.建立了一种简单有效的迭代边界框细化机制，以提高检测性能。在这里， 每个解码器层根据上一层的预测来细化边界框。

Two-Stage Deformable DETR. 在原始的DETR中，解码器中的对象查询与当前图像无关。受两阶段目标探测器的启发，我们探索了可变形DETR的一种变体，用于生成区域建议作为第一阶段。生成的区域建议将被输入解码器作为对象查询以进一步细化，形成一个两阶段可变形的DETR。
在第一阶段，为了实现高召回率的建议，多尺度特征图中的每个像素都将作为一个对象查询。然而，直接将对象查询设置为像素会给解码器中的自注意模块带来不可接受的计算和内存成本，其复杂度随着查询的数量呈二次增长。为了避免这个问题，我们去掉了解码器，并形成了一个仅限编码器的可变形的DETR，用于区域提案的生成。在它中，每个像素被分配为一个对象查询，它直接预测一个边界框。得分最高的边界框被选为区域提案。在将区域提案提交到第二阶段之前，不应用NMS。

Original: https://blog.csdn.net/qq_52053775/article/details/126468394
Author: 樱花的浪漫
Title: DEFORMABLE DETR详解

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/647633/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

【FPGA】精品FPGA书籍推荐

最近几个月都没上CSDN，下面留言的小兄弟们对不住了，资料就不发了。自行百度吧。。最后，想特别强调一下，支持正版！尊重知识！电子档的阅读效率以及知识获取的效果远远不能与纸质…

人工智能 2023年5月30日
0085
100天精通Python（数据分析篇）——第58天：Pandas读写数据库（read_sql、to_sql）

### 回答1：这个问题的意思是询问一个学习 Python 数据分析_的 _100 天_计划，我的回答如下： _Python 数据分析_是非常重要的技能之一，学习它需要长时间的实…

人工智能 2023年7月16日
0055
selenium+python爬虫全流程教程

python+selenium爬虫全流程详解 selenium+python爬虫简介 * selenium测试脚本 python+selenium 模拟浏览器—-以ch…

人工智能 2023年7月4日
0068
自监督模型—PCL

论文地址: https://openreview.net/pdf?id=KmykpuSrjcq 开源代码： Prototypical Contrastive Learning of…

人工智能 2023年6月2日
0074
RANSAC算法（原理及代码实现+迭代次数参数自适应）

RANSAC算法前言算法流程 Python代码 RANSAC算法迭代参数的自适应前言随机样本一致性 (RANSAC) 是一种迭代方法，用于从一组包含异常值的观察数据中估计数…

人工智能 2023年6月19日
00122
详解Inception结构：从Inception v1到Xception

文章目录 * – 概述 – NiN对Inception的启发 – Inception v1 – Inception v2 &#821…

人工智能 2023年6月25日
0076
第十章文本生成

10.1 文本生成简介 10.2 文本生成方法 10.2.1 传统文本生成方法 10.2.2 神经网络文本生成方法 10.2.2.1 回顾 10.2.2.1 自回归方法 10.2….

人工智能 2023年5月28日
0070
调用云服务实现语音识别合成以及感情分析

人工智能 2023年5月23日
00100
OpenCV-Python实战（番外篇）——利用 SVM 算法识别手写数字

[ OpenCV_是一款非常强大的计算机视觉库，其中包含了很多功能强大的图像处理和计算机视觉 _算法。而在这个系列的第三篇文章中，我们将重点介绍如何在 _OpenCV_中绘制图形和…

人工智能 2023年6月15日
0071
智能优化算法：鹈鹕优化算法-附代码

智能优化算法：鹈鹕优化算法文章目录智能优化算法：鹈鹕优化算法 * 1.鹈鹕优化算法简介 2.鹈鹕优化算法基本原理 – 2.1灵感来源和鹈鹕在狩猎时的行为 2.2算法…

人工智能 2023年6月15日
0085
MMDetection实战：MMDetection训练与测试

文章目录摘要配置文件参数详解环境准备训练 * 制作数据集修改配置文件修改数据集的类别开始训练测试完整代码和数据集：摘要 MMDetection是商汤和港中文大学…

人工智能 2023年6月16日
00105
频繁模式挖掘——概述

频繁模式挖掘(Frequent Pattern Mining) 事务：由事务号和项集组成。事务是一次购买行为。项：最小处理单元，即购买的物品。项集：由一个或多个项组成。支持度计数：…

人工智能 2023年7月17日
0087
论文翻译：2022_PACDNN: A phase-aware composite deep neural network for speech enhancement

论文地址：相似代码：https://github.com/phpstorm1/SE-FCN引用格式：Hasannezhad M，Yu H，Zhu W P，et al. PACDNN…

人工智能 2023年6月6日
0079
Matlab色图处理

色图处理函数命令：colormap,brighten调用格式：colormap(map),brighten(s)解释：colormap为将当前色图设置为系统预定义的map格式。b…

人工智能 2023年6月20日
0085
在Anaconda中升级Python版本（高版本Python无法与spyder兼容）

啊哦~你想找的内容离你而去了哦内容不存在，可能为如下原因导致： ① 内容还在审核中 ② 内容以前存在，但是由于不符合新的规定而被删除 ③ 内容地址错误 ④ 作者删除了内容。可…

人工智能 2023年7月4日
0077
TensorFlow&Keras入门猫狗数据集识别

一、CNN卷积网络神经介绍 1.卷积神经网络结构介绍如果使用完全连接的神经网络来处理大尺寸图像，有三个明显的缺点： [En] If you use fully connected …

人工智能 2023年5月25日
0095

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

DEFORMABLE DETR详解

公式详解：

4.整体架构

大家都在看