ViT:一图胜千言,用于大规模图像识别的Transformer
虽然Transformer架构已经成为NLP任务事实上的标准,但其在计算机视觉中的应用仍然有限。在计算机视觉中,注意力机制要么与卷积网络结合使用,要么用来替换卷积网络的某些组件,同时保持其整体结构不变。我们的研究表明,这种对CNN的依赖是不必要的,直接应用于图像补丁序列的纯Transformer可以很好地执行图像分类任务。当在大量数据上进行预训练并迁移到多个中小型图像识别基准任务时,我们提出的Vision Transformer(ViT)相比最先进的卷积网络取得了优异结果,同时需要的计算资源也更少。

图1:模型概述。我们将图像分割成固定大小的补丁,并且线性嵌入每个补丁,添加位置嵌入,将生成的向量序列输入标准Transformer编码器。为了执行分类,我们使用标准方法,在序列中添加一个额外的可学习的“分类标记”。

表1:Vision Transformer模型变体的详细信息。

表2:图像分类基准上的SOTA结果比较。在JFT-300M数据集上预训练的Vision Transformer模型在所有数据集上都优于基于ResNet的基线,同时预训练所需的计算资源也大大减少。在较小的ImageNet-21k数据集上预训练的ViT也表现良好。

图2:VTAB在Natural、Specialized、Structured任务上的性能。在Natural和Structured任务上,ViT-H/14的性能优于BiT-R152x4和其他方法。在Specialized任务上,前两个模型的性能相似。

图3:迁移到ImageNet上的结果。当在小数据集上进行预训练时,大型ViT模型的性能比BiT ResNets(阴影区域)差,但在较大数据集上进行预训练时,ViT模型表现出色。类似地,随着数据集的增大,较大的ViT变体将超过较小的ViT变体。

图4:ImageNet线性few-shot评估值随预训练规模的变化。ResNet在较小的预训练数据集上表现更好,但比ViT更早稳定,ViT在较大的预训练数据集上表现更好。

图5:ViT、ResNet、Hybrid模型的性能随预训练计算量的变化。在相同的计算量下,ViT的性能通常优于ResNet。


图6展示了注意力图的代表性示例。图14进一步展示了更多注意力图的示例。

图7左:ViT-L/32的RGB值的初始线性嵌入过滤器。中:ViT-L/32位置嵌入的相似性。右:不同Head的平均注意力距离随网络深度的变化。
总结
我们探索了Transformer在图像识别中的直接应用。与以往在计算机视觉中使用自注意力机制不同,除了最初的补丁提取步骤之外,我们不会在架构中引入特定于图像的归纳偏差。相反,我们将图像解释为一系列补丁,并利用NLP中使用的标准Transformer编码器对其进行处理。这种简单但可扩展的策略在与大型数据集的预训练相结合时,效果出人意料地好。因此,Vision Transformer在许多图像分类数据集上都达到或超过了SOTA水平,同时预训练成本相对较低。虽然这些初步结果令人鼓舞,但仍然存在许多挑战。一个挑战是将ViT应用于其他计算机视觉任务,如检测和分割。我们的结果,加上Carion等人的结果,预示了这种方法的前景。另一个挑战是继续探索自监督的预训练方法。我们的初步实验结果表明,自监督预训练效果有所改善,但自监督预训练与大规模监督预训练相比仍存在较大差距。最后,ViT的进一步扩展可能会提高性能。
更多推荐



所有评论(0)