TPAMI 2025 | 北理团队提出MGProto:高斯分布原型+自适应剪枝,重构可解释图像识别范式
点击上方“小白学视觉”,选择加"星标"或“置顶”
重磅干货,第一时间送达在计算机视觉领域,深度学习模型的"黑箱"特性一直是阻碍其在医疗、自动驾驶等关键领域深度应用的瓶颈。如何让模型的决策过程可解释、对异常输入更鲁棒?近日发表于TPAMI 2025的研究论文《Mixture of Gaussian-distributed Prototypes with Generative Modelling for Interpretable and Trustworthy Image Recognition》提出了一种创新性的解决方案——高斯分布原型混合模型(MGProto),为可解释AI开辟了新路径。
论文信息
题目:Mixture of Gaussian-distributed Prototypes with Generative Modelling for Interpretable and Trustworthy Image Recognition
基于高斯分布原型混合生成模型的可解释且可靠的图像识别
作者:Chong Wang, Yuanhong Chen, Fengbei Liu, Yuyuan Liu, Davis James McCarthy, Helen Frazer, Gustavo Carneiro
源码:https://github.com/cwangrun/MGProto
传统原型学习的三大痛点
原型学习方法(如ProtoPNet)通过将测试样本与训练集中的"原型"图像块比对来进行分类,这种类人推理的方式本应具有天然的可解释性,但现有方法存在难以克服的缺陷:
原型表示能力有限:基于点的原型无法建模数据分布特性,对分布外(OoD)输入识别能力薄弱
原型投影性能骤降:将抽象原型映射回真实图像空间时,分类准确率大幅下降(见图2)
信息利用不充分:仅关注图像中最显著的区域,忽略了次显著区域包含的关键分类信息
图2:传统方法(ProtoPNet和TesNet)在原型替换后性能显著下降,而MGProto保持稳定
MGProto:用高斯混合模型重构原型学习
MGProto的核心创新在于将单个点原型升级为高斯分布原型集合,通过生成式建模同时实现可解释性与可靠性。其总体架构如图4所示:
图4:MGProto的整体框架,包含特征提取、原型分布建模、记忆库机制和改进的EM学习过程
从点原型到分布原型的飞跃
与传统方法使用固定值表示原型不同,MGProto为每个类别配备多个高斯分布原型,每个原型由均值(代表典型特征)和协方差(代表特征变异范围)描述。这种设计带来两大优势:
更强的表示能力:通过多个高斯分布的组合,能更精准地捕捉类内数据的多样性
天然的OoD检测能力:通过计算输入图像与所有原型分布的匹配概率(图1(b)),可直接判断是否为分布外样本
图1:(a)传统判别式原型学习 vs (b)MGProto的生成式高斯混合原型学习
田忌赛马启发的原型挖掘策略
受经典"田忌赛马"智慧的启发,MGProto提出了创新的原型挖掘方法。传统方法只关注图像中激活最强的区域(类似"上等马"),而MGProto同时挖掘次显著区域的信息("中等马"和"下等马"),通过设计针对性的损失函数,让次要区域的判别能力得到充分训练(图5)。
图5:(a)不同活跃度的图像块区域 (b)田忌赛马策略示意图 (c)原型挖掘的竞争机制
这种策略使得模型能学习到更全面的视觉特征,尤其对细粒度分类任务(如鸟类、汽车识别)帮助显著。
自适应原型剪枝:更小更快更高效
MGProto利用高斯混合模型的固有特性,通过原型的重要性先验(混合权重)实现自适应剪枝。保留重要性高的原型分量,移除冗余分量,在大幅压缩模型规模的同时保持性能(表6)。这种方法无需复杂的阈值调整,实现了模型紧凑性与性能的完美平衡。
实验验证:全面超越现有方法
在四大基准数据集(CUB-200-2011、斯坦福汽车、斯坦福狗、牛津-IIIT宠物)上的实验表明,MGProto在多项关键指标上全面领先:
图像识别准确率
在细粒度图像分类任务中,MGProto无论使用何种骨干网络(VGG、ResNet、DenseNet等),均取得最高的top-1准确率。即使使用更少的原型数量,仍显著优于ProtoPool、ProtoKNN等现有方法(表1、2、3)。
表1:CUB数据集上与现有原型学习方法的性能对比
分布外检测能力
通过建模类别条件密度,MGProto在OoD检测任务中表现出色。以汽车数据集为分布内样本时,能将96.8%的CUB图像正确识别为分布外样本,远超PIP-Net的92.2%(表4)。概率直方图显示ID样本与OoD样本的概率分布界限清晰(图7)。
图7:CUB作为ID样本,汽车和宠物作为OoD样本的概率分布对比
可解释性可视化
MGProto的原型不仅具有优异的分类性能,还能直观展示决策依据。图6的T-SNE可视化显示,原型自然地分布在数据簇中心,重要性高的原型精准定位关键对象部位(如鸟的头部、翅膀)。
图6:CUB数据集上原型的可视化结果,展示了原型在特征空间的分布及其对应的图像区域
图8展示了MGProto的决策案例:对分布内样本(Le Conte Sparrow),模型能正确分类并给出高置信度;对分布外样本(Keeshond狗),模型通过低总体概率识别为异常,避免错误分类。
图8:(a)分布内样本的可信分类 (b)分布外样本的正确识别
结语
MGProto通过将生成式建模引入原型学习,成功解决了传统方法在可解释性、OoD检测和性能稳定性方面的固有缺陷。其创新点包括:
高斯混合原型分布实现更丰富的特征表示
自然的原型投影机制避免性能下降
田忌赛马策略挖掘次显著区域信息
基于重要性的自适应剪枝优化模型效率
该研究不仅推动了可解释AI在计算机视觉领域的发展,更为构建可靠的AI系统提供了新思路。源代码已开源,为相关研究提供了坚实的实验基础。
下载1:OpenCV-Contrib扩展模块中文版教程
在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。
下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。
下载3:人工智能0基础学习攻略手册
在「小白学视觉」公众号后台回复:攻略手册,即可获取《从 0 入门人工智能学习攻略手册》文档,包含视频课件、习题、电子书、代码、数据等人工智能学习相关资源,可以下载离线学习。
交流群
欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~更多推荐


所有评论(0)