分割-tran-3-9-用于大规模图像识别AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE

之前研究存在的问题、论文的出发点:
文章的主要研究内容:
图像分块:将输入图像分割成固定大小的图像块(patches),这些图像块被视为序列中的“tokens”,类似于自然语言处理中的单词。
线性嵌入:将这些图像块展平并进行线性投影,映射到Transformer的隐层维度。
位置嵌入:为了保留图像块的空间位置信息,将位置嵌入(position embeddings)添加到图像块嵌入中。
Transformer编码器:将上述嵌入序列输入到标准的Transformer编码器中,编码器由多层自注意力(self-attention)和多层感知机(MLP)块组成。
分类头:在Transformer编码器的输出上附加一个分类头,用于图像分类任务。
预训练与微调:在大型数据集上进行预训练,然后在下游任务上进行微调。预训练时使用监督学习,微调时根据具体任务调整分类头。
网络架构:
论文摘要与结论:
摘要:
虽然 Transformer 架构已成为自然语言处理任务的事实标准,但它在计算机视觉中的应用仍然有限。在视觉中,注意力要么与卷积网络结合使用,要么用于替换卷积网络的某些组件,同时保持其整体结构。我们表明,这种对cnns的依赖是不必要的,直接应用于图像补丁序列的纯变压器可以在图像分类任务中表现良好。当对大量数据进行预训练并转移到多个中小型或小型图像识别基准(Imagenet、cifar-100、vtab 等)时,与最先进的卷积网络相比,视觉转换器 (vit) 获得了出色的结果,同时需要更少的计算资源来训练
结论:
我们探索了变压器在图像识别中的直接应用。与在计算机视觉中使用自注意力的先前工作不同,除了初始补丁提取步骤之外,我们不会将特定于图像的归纳偏差引入架构中。相反,我们将图像解释为一系列补丁,并通过 nlp 中使用的标准变压器编码器对其进行处理。当与大型数据集的预训练相结合时,这种简单的但可扩展的策略效果很好。因此,视觉转换器在许多图像分类数据集上匹配或超过了最先进的技术,同时预训练相对便宜。虽然这些初步结果令人鼓舞,但仍有许多挑战。一种是将vit应用于其他计算机视觉任务,如检测和分割。我们的结果,加上Carion等人(2020)的结果,表明了这种方法的前景。另一个挑战是继续探索自我监督的预训练方法。我们最初的实验表明自监督预训练有所提高,但自监督预训练和大规模监督预训练之间仍然存在很大差距。最后,vit 的进一步缩放可能会导致性能的提高。
更多推荐



所有评论(0)