文章:QICA: Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting

代码:https://github.com/zhangda1018/QICA

单位:西北工业大学、中国电信人工智能研究院、中国科学技术大学、复旦大学


一、问题背景

传统目标计数方法聚焦特定类别,需为每个类别构建大量标注数据集,扩展性极差;类无关计数虽实现了跨类别适配,却依赖视觉样本作为参考,实际应用受限。零样本目标计数通过自然语言描述指定计数类别,无需类别专属训练数据和视觉样本,完美解决了上述问题,成为研究主流。

但基于视觉-语言模型(VLM)的现有零样本计数方法仍存在三大核心问题:

  1. 缺乏细粒度数量感知:文本提示仅指定目标类别,未融入数量信息,模型仅能识别目标类别,无法精准区分目标数量差异,密集场景下计数精度大幅下降;

  2. 特征空间失真与过拟合:直接微调预训练VLM编码器易导致特征空间扭曲,对未见过的类别泛化能力骤降,现有方法多选择冻结编码器,牺牲了模型对计数任务的适配性;

  3. 空间敏感性不足:粗粒度的特征聚合机制忽略了细粒度空间细节,无法精准定位目标区域,密度图预测误差较大。

二、方法创新

为解决上述问题,研究团队提出QICA框架,核心围绕协同提示策略(SPS)成本聚合解码器(CAD) 和多级数量对齐损失(LMQA) 三大创新模块展开,实现数量感知与鲁棒空间聚合的协同优化:

1. 协同提示策略(SPS):植入细粒度数量感知

通过数值条件化的可学习提示,联合适配视觉和语言编码器,打破传统单模态提示的独立训练模式。将离散数量值转化为连续嵌入表示,训练时动态生成包含真实数量和反事实数量的文本提示,通过耦合函数实现视觉-语言提示的双向梯度流动,让模型学习细粒度数量区分能力;同时设计双路径策略保证训练-推理一致性,推理时仅需类别文本提示,不依赖数量信息。

2. 成本聚合解码器(CAD):解决空间敏感与特征失真问题

直接在视觉-语言相似度图上操作,而非中间特征,最大程度保留预训练嵌入空间的完整性。先计算视觉特征与类别嵌入的余弦相似度得到相似度图,再通过Swin Transformer块进行空间聚合,抑制噪声激活、增强目标区域的空间连贯性;最后通过多尺度上采样和跳跃连接融合视觉编码器特征,恢复高分辨率密度图,既实现了编码器的鲁棒微调,又提升了空间敏感性。

3. 多级数量对齐损失(LMQA):全流程强制数值一致性

在编码器和解码器两个阶段构建监督信号,通过排序约束和辅助损失实现全管道数量感知。编码器层通过排序约束让真实数量提示的相似度高于反事实数量,且数量越接近真实值相似度越高;解码器层通过损失让预测计数与对应数量假设对齐,同时将密度估计损失与两级数量对齐损失结合,形成完整的训练目标,让模型从特征提取到密度预测全流程保持数量一致性。

三、实验结果

研究团队在FSC-147(通用目标计数)CARPK(无人机车辆计数)ShanghaiTech-A(高密度人群计数) 三大基准数据集开展了全面实验,以MAE(平均绝对误差)、RMSE(均方根误差)为核心评价指标,验证了QICA的性能:

1. 主数据集FSC-147

QICA的ViT-L/14配置实现12.41的测试MAE,相比VLCounter、CLIP-Count、CounTX等主流CLIP基方法,误差分别降低27.2%、30.2%、25.7%;轻量版ViT-B/16配置也达到13.05的测试MAE,优于使用更强骨干的CountGD,验证了成本聚合对预训练知识的有效保留。

2. 跨域泛化(无微调)

  • CARPK数据集:ViT-L/14配置MAE达6.07,相比FSC-147误差降低51%,文本基性能超越T2ICount,逼近DINOv2基方法;

  • ShanghaiTech-A高密度人群数据集:ViT-L/14配置实现140.7的MAE,成为开放集方法中的SOTA,超越CountGD,相比CLIP-Count、CounTX误差分别降低24.1%、33.5%。

3. 消融实验

各模块均实现性能提升,从基线CLIP微调(16.15 MAE)到融合所有模块(12.41 MAE),误差累计降低23.2%,验证了SPS、CAD、LMQA的协同有效性;同时确定了最优超参数:提示深度为编码器前9层、提示长度为2、数量假设K=5、损失权重λ₁=0.1、λ₂=0.05。

4. 效率分析

QICA仅含18.5M/19.7M可训练参数,远少于现有方法的25M-170M;ViT-B/16配置实现20.8G MACs和45.2 FPS的推理速度,在保证高精度的同时,兼顾了计算效率和推理速度,适合实际部署。

四、优势与局限

核心优势

  1. 数量感知能力强:通过数值条件化协同提示,让模型首次实现细粒度的数量区分,解决了传统方法“能识别、不会数”的问题;

  2. 泛化性优异:成本聚合解码器避免了特征空间失真,跨数据集无微调实验验证了其对未见过的类别、场景的强适配能力;

  3. 空间定位精准:基于相似度图的空间聚合机制,有效恢复细粒度空间结构,提升了密度图预测的准确性,高密度场景下表现尤为突出;

  4. 效率与性能平衡:采用冻结预训练编码器+轻量提示调优的方式,大幅减少可训练参数,兼顾了模型性能和计算、推理效率。

现存局限

  1. 依赖离散的数量假设进行训练,无法捕捉连续的数量关系,对数量连续变化的场景适配性不足;

  2. 仅支持单类别目标计数,尚未实现多类别目标的同时计数,无法满足复杂场景下的多目标计数需求;

  3. 虽提升了空间敏感性,但在极端遮挡、小目标密集的场景下,目标定位和计数精度仍有提升空间。

五、一句话总结

QICA框架通过数量感知的协同提示、基于相似度图的成本聚合解码和全流程的多级数量对齐损失,首次实现了零样本目标计数中数量感知与空间感知的双重提升,在通用、跨域、高密度场景下均取得优异性能,同时兼顾了模型效率,为零样本目标计数的实际应用奠定了基础,也为视觉-语言模型在计数类任务中的适配提供了新思路。

更多推荐