DEFORMABLE DETR详解

樱花的浪漫 2023-04-15 原文

1.解决问题

DETR需要比现有的目标检测器更长的训练时间来收敛。
DETR在检测小物体方面的性能相对较低，并且无法从高分辨率特征地图中检测到小物体。
可变形卷积可以识别重要特征，但是无法学习重要特征之间的联系

transformer组件在处理图像特征图中的不足。在初始化时，注意模块对特征图中的所有像素施加了几乎一致的注意权重。长时间的训练周期是为了学习注意权重，以关注稀疏的有意义的位置。另一方面，transformer编码器中的注意权值计算是二次计算w.r.t.像素数。因此，处理高分辨率的特征映射具有非常高的计算和内存复杂性。

2.核心思想

Deformable DETR，它的注意模块只关注一个目标周围的一小部分关键采样点。Deformable DETR可以获得比DETR（特别是在小物体上）更好的性能，在训练时间少10×的时期。

3.实施细节

可变形注意模块无论特征图的空间大小如何，都只关注参考点周围的一小组关键采样点（reference point）。通过为每个queries只分配少量固定数量的keys，可以缓解收敛性和特征空间分辨率的问题。

对于初始化，首先初始化采样附近的n个点（默认为4），即认为附近的点的特征对该点的关系最强，但是一定是吗？不一定，那么我们可以通过网络学习，偏移到关系最强的点。但是神经网络学习到的偏移不一定是小数，怎么办呢？那么我们就可以通过周围的点进行插值得到该点的特征。

公式详解：

表示初始的采样的关键点，表示偏移量，表示特征的权重，即表示特征映射，

表示queries与keys的点乘，即注意力，其中和都是通过 $z_{q}$ 全连接而来。

如下图所示， $z_{q}$ 表示特征图上的原始特征，经过全连接层做特征映射，同时采样出3个采样点。同时 $z_{q}$ 经过全连接层可得到注意力权重（qk）

Multi-scale Deformable Attention Module.

设为输入的多尺度特征映射（特征金字塔），其中。表示尺度信息，为每个queries的参考点的归一化坐标，即因为有多个尺度，需要将绝对坐标转为相对坐标，则应用多尺度可变形注意模块为

外部的m表示多头注意力机制，L表示特征金字塔的维度，作者可能认为不同尺度同一位置的特征相似，因此，做相加操作。K表示采样的特征点

4.整体架构

对于输入图片，首先经过Multi-scale Deformable self-Attention选取特征点，并做特征映射，生成向量，对于位置编码，有两种，一种是在相对位置编码加上绝对level级别编码，另外一种是加入可学习的level编码。然后输入decoder中，对于decoder，首先初始化300个初始化向量，经过self-Attention的处理，然后与ecoder特征做注意力运算，最后做预测。

5.预测头的设置

Iterative Bounding Box Refifinement. 建立了一种简单有效的迭代边界框细化机制，以提高检测性能。在这里，每个解码器层根据上一层的预测来细化边界框。

Two-Stage Deformable DETR. 在原始的DETR中，解码器中的对象查询与当前图像无关。受两阶段目标探测器的启发，我们探索了可变形DETR的一种变体，用于生成区域建议作为第一阶段。生成的区域建议将被输入解码器作为对象查询以进一步细化，形成一个两阶段可变形的DETR。
在第一阶段，为了实现高召回率的建议，多尺度特征图中的每个像素都将作为一个对象查询。然而，直接将对象查询设置为像素会给解码器中的自注意模块带来不可接受的计算和内存成本，其复杂度随着查询的数量呈二次增长。为了避免这个问题，我们去掉了解码器，并形成了一个仅限编码器的可变形的DETR，用于区域提案的生成。在它中，每个像素被分配为一个对象查询，它直接预测一个边界框。得分最高的边界框被选为区域提案。在将区域提案提交到第二阶段之前，不应用NMS。

详解 DEFORMABLE xff0c xff0 xff 人工智能深度学习 transformer 计算机视觉

有关DEFORMABLE DETR详解的更多相关文章

物联网MQTT协议详解 - 2
一、什么是MQTT协议MessageQueuingTelemetryTransport：消息队列遥测传输协议。是一种基于客户端-服务端的发布/订阅模式。与HTTP一样，基于TCP/IP协议之上的通讯协议，提供有序、无损、双向连接，由IBM（蓝色巨人）发布。原理：（1）MQTT协议身份和消息格式有三种身份：发布者（Publish）、代理（Broker）（服务器）、订阅者（Subscribe）。其中，消息的发布者和订阅者都是客户端，消息代理是服务器，消息发布者可以同时是订阅者。MQTT传输的消息分为：主题（Topic）和负载（payload）两部分Topic，可以理解为消息的类型，订阅者订阅（Su
Tcl脚本入门笔记详解（一） - 2
TCL脚本语言简介•TCL（ToolCommandLanguage）是一种解释执行的脚本语言（ScriptingLanguage）,它提供了通用的编程能力：支持变量、过程和控制结构；同时TCL还拥有一个功能强大的固有的核心命令集。TCL经常被用于快速原型开发，脚本编程，GUI和测试等方面。•实际上包含了两个部分：一个语言和一个库。首先，Tcl是一种简单的脚本语言，主要使用于发布命令给一些互交程序如文本编辑器、调试器和shell。由于TCL的解释器是用C\C++语言的过程库实现的，因此在某种意义上我们又可以把TCL看作C库，这个库中有丰富的用于扩展TCL命令的C\C++过程和函数，所以，Tcl是
【详解】Docker安装Elasticsearch7.16.1集群 - 2
开门见山|拉取镜像dockerpullelasticsearch:7.16.1|配置存放的目录#存放配置文件的文件夹mkdir-p/opt/docker/elasticsearch/node-1/config#存放数据的文件夹mkdir-p/opt/docker/elasticsearch/node-1/data#存放运行日志的文件夹mkdir-p/opt/docker/elasticsearch/node-1/log#存放IK分词插件的文件夹mkdir-p/opt/docker/elasticsearch/node-1/plugins若你使用了moba，直接右键新建即可如上图所示依次类推创建
【Elasticsearch基础】Elasticsearch索引、文档以及映射操作详解 - 2
文章目录概念索引相关操作创建索引更新副本查看索引删除索引索引的打开与关闭收缩索引索引别名查询索引别名文档相关操作新建文档查询文档更新文档删除文档映射相关操作查询文档映射创建静态映射创建索引并添加映射概念es中有三个概念要清楚，分别为索引、映射和文档（不用死记硬背，大概有个印象就可以）索引可理解为MySQL数据库；映射可理解为MySQL的表结构；文档可理解为MySQL表中的每行数据静态映射和动态映射上面已经介绍了，映射可理解为MySQL的表结构，在MySQL中，向表中插入数据是需要先创建表结构的；但在es中不必这样，可以直接插入文档，es可以根据插入的文档（数据），动态的创建映射（表结构），这就
最强Http缓存策略之强缓存和协商缓存的详解与应用实例 - 2
HTTP缓存是指浏览器或者代理服务器将已经请求过的资源保存到本地，以便下次请求时能够直接从缓存中获取资源，从而减少网络请求次数，提高网页的加载速度和用户体验。缓存分为强缓存和协商缓存两种模式。一.强缓存强缓存是指浏览器直接从本地缓存中获取资源，而不需要向web服务器发出网络请求。这是因为浏览器在第一次请求资源时，服务器会在响应头中添加相关缓存的响应头，以表明该资源的缓存策略。常见的强缓存响应头如下所述：Cache-ControlCache-Control响应头是用于控制强制缓存和协商缓存的缓存策略。该响应头中的指令如下：max-age：指定该资源在本地缓存的最长有效时间，以秒为单位。例如：Ca
IDEA 2022 创建 Spring Boot 项目详解 - 2
如何用IDEA2022创建并初始化一个SpringBoot项目？目录如何用IDEA2022创建并初始化一个SpringBoot项目？0. 环境说明1. 创建SpringBoot项目 2.编写初始化代码0. 环境说明IDEA2022.3.1JDK1.8SpringBoot1. 创建SpringBoot项目打开IDEA，选择NewProject创建项目。填写项目名称、项目构建方式、jdk版本，按需要修改项目文件路径等信息。选择springboot版本以及需要的包，此处只选择了springweb。此处需特别注意，若你使用的是jdk1
详解Unity中的粒子系统Particle System (二) - 2
前言上一篇我们简要讲述了粒子系统是什么，如何添加，以及基本模块的介绍，以及对于曲线和颜色编辑器的讲解。从本篇开始，我们将按照模块结构讲解下去，本篇主要讲粒子系统的主模块，该模块主要是控制粒子的初始状态和全局属性的，以下是关于该模块的介绍，请大家指正。目录前言本系列提要一、粒子系统主模块1.阅读前注意事项2.参考图3.参数讲解DurationLoopingPrewarmStartDelayStartLifetimeStartSpeed3DStartSizeStartSize3DStartRotationStartRotationFlipRotationStartColorGravityModif
VMware虚拟机与本地主机进行磁盘共享(详解) - 2
VMware虚拟机与本地主机进行磁盘共享前提虚拟机版本为Windows10（专业版，不是可能有问题）本地主机为家庭版或学生版(此版本会有问题，但有替代方式)最好是专业版VMware操作1.关闭防火墙，全部关闭。2.打开电脑属性3.点击共享-》高级共享-》权限4.如果没有everyone，就添加权限选择完全控制，然后应用确定。5.打开cmd输入lusrmgr.msc(只有专业版可以打开)如果不是专业版，可以跳过这一步。点击用户-》administrator密码要复杂密码，否则不行。推荐admaiN@1234类型的密码。设置完密码，点击属性，将禁用解开。6.如果虚拟机的windows不是专业版，可
ElasticSearch之 ik分词器详解 - 2
IK分词器本文分为简介、安装、使用三个角度进行讲解。简介倒排索引众所周知，ES是一个及其强大的搜索引擎，那么它为什么搜索效率极高呢，当然和他的存储方式脱离不了关系，ES采取的是倒排索引，就是反向索引；常见索引结构几乎都是通过key找value，例如Map；倒排索引的优势就是有效利用Value，将多个含有相同Value的值存储至同一位置。分词器为了配合倒排索引，分词器也就诞生了，只有合理的利用Value，才会让倒排索引更加高效，如果一整个Value不进行任何操作直接进行存储，那么Value和key毫无区别。分词器Analyzer通常会对Value进行操作：一、字符过滤，过滤掉html标签；二、分
Educational Codeforces Round 146 (Rated for Div. 2)（B，E详解） - 2
题外话：抑郁场，开局一小时只出A，死活想不来B，最后因为D题出锅ura才保住可怜的分。但咱本来就写不到DB-LongLegs（数论）本题题解法一学自同样抑郁的知乎作者幽血魅影的题解，有讲解原理。法二来着知乎巨佬cup-pyy（大佬说《不难发现》呜呜）题意三种操作：向上走mmm步向右走mmm步给自己一次走的步数加111，即使得m=m+1m=m+1m=m+1问从(0,0)(0,0)(0,0)走到(a,b)(a,b)(a,b)的最小操作次数，值得注意的是操作三不可逆。解析假设我们最终一步的大小增长到mmm，那么在这个过程中我能以[1,m][1,m][1,m]（当步数增长到该数时）之间的任何数字向上或