来源:CVPR 2023

代码:RefCLIP: A Universal Teacher for Weakly Supervised Referring Expression Comprehension

动机

①现有两阶段方法在推理速度上存在局限

②像yolov3这样的一阶段检测器,很难直接利用到弱监督方案中

③每一张图片可以生成无数的标注框,因此特征也是无数的多,那么非常耗费时间,而一个锚点也能包含用于识别的足够特征

创新点

①提出了一种通过锚点的跨模态对比学习、一阶段方法进行弱监督REC任务,大大提升推理速度

②提出一种通用的弱监督训练方案,能为其他的模型生成伪标签增强性能(针对伪标签存在噪音这一问题,本文引入了数据增强、EMA——指数移动平均两种策略进行解决)


摘要

指代表达理解(REC)是基于表达式进行定位的任务,并且其开发受到昂贵的实例级注释的极大限制。大多数现有的弱监督方法都是基于两阶段检测网络构建的,这些检测网络在计算上昂贵。在本文中,我们使用有效的一阶段检测器,并提出了一种新型的弱监督模型,称为RefClip。具体而言,我们将弱监督的REC重新定义为锚点—文本匹配问题,可以避免在现有方法中进行复杂的后处理。为了实现弱监督学习,我们引入了基于锚的对比损失,以通过众多锚式文本对优化RefClip。基于RedClip,我们进一步提出了第一个针对现有REC模型不足的弱监督训练计划,在该计划中,RefClip充当成熟的教师,以生成伪标记,以教授通用REC模型。通过我们仔细的设计,该方案甚至可以帮助现有REC模型获得比RefClip(例如TransVG和SimRec)更好的弱监督性能。为了验证我们的方法,我们对四个REC基准进行了广泛的实验,即Refcoco,Refcoco+,Refcocog和ReferitItgame。实验结果不仅报告了我们对现有弱监督模型的显着性能,例如Refcoco的 +24.87%,而且还显示了更快的推理速度。

1.引言

第一段:首先介绍现在的REC任务是什么,缺陷是什么(昂贵的实例级的标注/注释成本限制了它的发展,所以下面就介绍了弱监督的REC任务)

第二段:首先引入弱监督的REC任务,然后介绍现有的两阶段的模型是怎样的(先抽取区域,然后进行区域匹配),有什么样的缺点(推理速度有限

第三段:为了解决上述问题,本文使用一阶段检测器实现弱监督REC任务。但是一阶段的检测器具有的特点:①像yolov3这样的一阶段检测器推理速度快,但很难直接利用到弱监督方案中②一阶段检测器是通过最后几层卷积的特征(也称锚点)来生成预测框③每一张图片可以生成无数的标注框,因此特征也是无数的多,那么非常耗费时间,而一个锚点也能包含用于识别的足够特征

第四段:基于以上观察,本文就提出了RefClip模型(弱监督模型),主要是锚点-文本匹配;并使用基于锚点的对比学习方案

第五段:介绍本文提出的一种弱监督训练计划,使用RefClip为其他模型生成伪标签,并通过数据增强、指数移动平均策略提升模型性能

第六段:总体介绍实验——模型的性能

2.相关工作

主要介绍了REC任务和弱监督REC任务

3.方法Method【RefClip】

方法概要:在RefClip中,首先是通过视觉和文本编码器分别处理图像和表达式。然后,获取最后一个卷积特征映射的锚点图,选择置信度得分高的锚点(eg,置信度前十个),从而过滤掉低价值的锚点。接着,计算候选锚点与文本表达的相似性,获取相似度得分最高的锚点作为正锚点。最后返回最适合边界框预测的匹配。通过基于锚的对比学习,RefClip是弱监督的。

因为本文不仅提出了refclip模型,还设计了一种训练方案,所以分了两个板块分别介绍这两部分,这一部分主要介绍RefClip的方法细节

3.1问题定义

3.2锚点选择

因为一阶段检测器通常是多尺度的,所以他们有成千上万个候选锚点,其中大多数是背景或者低质量的,使用所有锚点作为候选锚点会阻碍对比学习的效率和质量

3.3基于锚点的对比学习

论文后续的内容包括预训练方案、实验部分和总结,在此不做过多的论述了。

【注意】1.本文是基于yolov3模型进行改进的,而yolov3这样的一级检测器的预测是基于输出特征图的网格特征(锚点)2.最后检测目标框阶段:一个锚点可以有多个目标框,选择置信度最大的那个作为检测结果 3.对伪标签有噪音的处理,这两个方法都是采用的他人论文里的方法,并不是自己的完全创新

更多推荐