摘要

水下声学目标识别是一项极具挑战性的任务,原因在于水下声学信号本身具有高度复杂性。复杂的水下环境、不可预测的传播信道以及目标动态的运动状态,都会显著影响真实场景中的水下声学信号,甚至可能掩盖与目标本身相关的内在特征。因此,水下声学信号的数据分布呈现出严重的类内多样性(intra-class diversity),从而损害了识别系统的准确性和鲁棒性。为解决上述问题,本文提出了一种基于卷积的专家混合模型(Convolution-based Mixture of Experts, CMoE),以细粒度方式实现水下目标识别。该方法引入多个专家层作为独立的学习器,并配备一个路由层,根据输入信号的特征动态分配专家这种设计使模型能够利用多个独立的参数空间,有效学习具有高类内多样性的复杂水下声学信号。此外,本文还通过平衡正则化和可选残差模块对CMoE结构进行了优化。我们在三个水下声学数据库上,针对多种声学特征开展了详尽的实验与可视化分析,结果表明:所提出的CMoE方法在各项指标上均取得显著性能提升,其识别准确率明显优于当前先进的方法。

1. 引言

1.1 背景

水下声学目标识别在海洋声学领域中扮演着至关重要的角色。该任务旨在自动分析水下目标辐射出的声音信号,并预测目标的类别。由于其探测距离远、隐蔽性强且部署成本低,该技术在实际应用中不可或缺,广泛应用于水下监视、海洋资源开发与保护以及国防安全等领域(Irfan 等,2021;Jia 等,2022;Sutin 等,2010)。
为应对日益增长的对鲁棒水下声学识别系统的需求,近年来大量研究致力于该方向(Li 等,2017;Ke 等,2020;Simonović 等,2021;Xie 等,2022c)。典型的水下声学识别系统通常包含两个主要组成部分:声学特征提取与识别模型。为从原始水下声学信号中提取具有判别性的声学特征,研究者提出了多种声学分析策略,包括傅里叶变换(Xie 等,2022c;Liu 等,2021)、希尔伯特-黄变换(Wang & Zeng,2014)、小波变换(Jia 等,2022;Xie 等,2022b)、梅尔滤波(Liu 等,2021;Zhang 等,2016)、LOFAR(低频分析记录)(Chen 等,2021)、倒谱提取(Zhang 等,2016;Das 等,2013)等。这些方法利用目标的声学特性提取低维声学特征。特征提取完成后,识别系统采用各类模型——如经典机器学习模型(Wang & Zeng,2014;Das 等,2013;Erkmen & Yıldırım,2008)或深度神经网络(Xie 等,2022c,b;Liu 等,2021;Zhang 等,2021;Ren 等,2022;Khishe & Mohammadi,2019)——挖掘声学特征中的判别模式并完成目标类别预测。

此外,水下声学目标识别系统高度依赖于水下声学信号数据库。识别系统的性能在很大程度上受所用数据的规模、真实性与多样性等因素影响(Irfan 等,2021)。鉴于真实水下声学数据采集成本高昂且依赖专业设备(Hovem,2012),以往研究多采用合成数据(Das 等,2013)、仿真数据(Zhang 等,2016)或私有录制数据(Wang & Zeng,2014)。近年来,随着实际需求的增长,一些开源水下声学数据库开始发布,例如 Shipsear(Santos-Domínguez 等,2016)和 DeepShip(Irfan 等,2021)。大规模数据库为研究者提供了丰富多样的真实世界信号,有助于提升识别系统在实际场景中的泛化能力。
深度学习算法的快速发展(LeCun, Bengio & Hinton,2015)与开源水下声学数据库的可用性,共同推动了深度神经网络在近年成为识别系统的主流方法(Xie 等,2022c;Saffari 等,2023;Khishe,2022)。深度神经网络凭借其复杂的拓扑结构和大量非线性算子,能够支持高度复杂的建模;而开源数据库则为其提供了充足的训练数据。相较于在处理大规模、高维特征空间数据时表现受限的经典方法(Irfan 等,2021),基于深度学习的识别系统在现有数据库上展现出显著的性能优势(Xie 等,2022b,c)。

1.2 动机

尽管在开源数据集上取得了显著进展,但现有识别模型在真实水下场景中的表现仍不尽人意(Xie 等,2022c)。这主要归因于水下声学信号的复杂性——其受到多种干扰因素的影响,包括复杂的水下环境、不可预测的传播信道以及船舶运动状态的剧烈变化(Erbe 等,2019)。此外,螺旋桨与发动机技术的差异也会进一步影响辐射噪声的声学特性(Khishe & Mosavi,2020)。这些干扰因素导致所采集信号高度复杂且难以区分,使得整体数据分布呈现出显著的类内多样性。图1展示了来自Shipsear数据集中若干样本的语谱图对比,清晰地揭示了不同运动状态(例如No.33表示启停,No.39表示抵达)和不同类型(例如No.33代表“Dud”摩托艇,No.79代表“Zodiac”摩托艇)的摩托艇之间存在显著的类内多样性。相关研究表明(Schutz 等,2013),类内多样性在数据有限的情况下极易引发误识别

在这里插入图片描述
图1:Shipsear数据集中若干样本的语谱图。
Motorboat_33 记录了摩托艇“Dud”的启动与停止过程;
Motorboat_39 记录了摩托艇“Dud”的抵达过程;
Motorboat_79 记录了摩托艇“Zodiac”的经过过程;
Passenger ship_59 记录了客船“Marde Mouro”以较高速度驶向港口的过程;
Sailboat_56 记录了一艘帆船在极近距离经过的情形;
Fishboat_76 记录了一艘渔船经过的过程。

目前,鲜有研究聚焦于水下声学信号中类内多样性和类间相似性的分布特性。对于此类复杂信号,一种自然思路是增加模型参数量以支持更复杂的建模。然而,水下数据的稀缺性对此构成了严重制约——复杂模型反而会加剧过拟合现象。

1.3 本文工作

针对上述挑战,本文提出了一系列创新性技术。为缓解类内多样性带来的影响,有必要构建一种能自适应处理多样化数据的模型。受专家混合(Mixture of Experts, MoE)范式在计算机视觉(Ahmed 等,2016;Riquelme 等,2021)和自然语言处理(Fedus 等,2021;Xie 等,2022a)领域成功应用的启发,我们提出了用于水下声学目标识别的基于卷积的专家混合模型(CMoE)。CMoE包含多个专家层和一个路由层,其中路由层根据输入的高层表征将样本动态分配至最合适的专家层。该机制实现了对多样化数据的自适应解耦,使模型能够利用多个独立参数空间学习水下声学信号。
此外,为应对类间相似性问题,我们将专家层置于模型的最后阶段,使其能够基于高层语义概念进行学习,专注于挖掘在类间相似数据中具有判别性的特征。同时,我们引入平衡正则化(balancing regularization)以解决专家负载不均衡问题,并通过引入可选残差模块进一步优化CMoE结构
实验表明,我们的CMoE在多种水下声学数据库上均能持续取得优越性能。本文的主要贡献总结如下:
揭示了水下声学信号的独特特性——包括类内多样性和类间相似性——并指出现有方法的局限性;
提出了基于卷积的专家混合模型(CMoE),通过高层表征捕捉潜在特征,并利用多个独立参数空间自适应学习多样化数据,以解析复杂的数据多样性;
通过平衡正则化与可选残差模块对CMoE结构进行了优化;
提供了详细的识别结果与专家路由分配的可视化分析及相应解读。

2.相关工作

2.1 水下声学目标识别

水下声学目标识别的研究主要围绕声学特征提取与识别算法的应用展开。早期研究采用经典机器学习方法处理人工设计的低维声学特征。例如,Das 等人(Das et al., 2013)利用倒谱特征结合倒谱 liftering 与高斯混合模型(GMM)进行船舶分类;Wang 与 Zeng(Wang and Zeng, 2014)将 Bark 小波分析与希尔伯特-黄变换相结合对信号进行分析,并采用支持向量机(SVM)作为分类器。此外,源自音频与语音领域的倒谱类声学特征,如梅尔频率倒谱系数(MFCC),在舰船辐射噪声识别任务中也取得了良好效果(Zhang et al., 2016;Khishe and Mohammadi, 2019)。然而,近期研究表明,仅依赖人工设计的低维声学特征,在复杂水下场景中构建的识别系统泛化能力有限(Irfan et al., 2021;Xie et al., 2022c)。同时,面对大规模、高多样性特征空间的数据,经典机器学习模型往往难以取得令人满意的表现(Irfan et al., 2021)。因此,基于这些传统范式的识别系统在实际海洋环境中对未见数据的准确识别面临严峻挑战。

随着深度学习的发展(LeCun et al., 2015)以及开源水下声学数据库的积累(Irfan et al., 2021;Santos-Domínguez et al., 2016),基于深度神经网络的识别算法逐渐成为主流。文献报道显示:Zhang 等人(Zhang et al., 2021)将短时傅里叶变换(STFT)幅度谱、相位谱及双谱特征作为卷积神经网络的输入;Liu 等人(Liu et al., 2021)采用三维梅尔语谱图结合卷积循环神经网络,并辅以数据增强技术进行水下目标识别;Xie 等人(Xie et al., 2022b)利用可学习的细粒度小波语谱图与深度残差网络(ResNet)(He et al., 2016)自适应地识别舰船辐射噪声;Ren 等人(Ren et al., 2022)则结合可学习 Gabor 滤波器与 ResNet 构建智能水下声学分类系统。与经典机器学习范式不同,深度学习方法通常偏好包含丰富信息的声学特征,例如时频语谱图(Liu et al., 2021;Xie, Ren and Xu, 2023;Xu, Xie and Wang, 2023)。神经网络中大量的参数和复杂的非线性结构使其能够有效挖掘综合特征中蕴含的信息。这些方法在现有数据集上表现出的优越性能,使其成为当前水下声学目标识别的主流方案。然而,在数据稀缺且复杂的实际应用场景中,基于深度学习的系统仍表现出鲁棒性不足的问题。为此,许多研究采用了去噪(Li et al., 2017;Ghavidel et al., 2022)和数据增强(Liu et al., 2021;Chen et al., 2022;Xu et al., 2023)等技术,通过提升数据质量或数量来增强识别系统的鲁棒性。
据我们所知,本文首次明确指出水下声学信号中存在的类内多样性与类间相似性问题,并以此为出发点构建鲁棒的识别系统。

2.2 专家混合模型(Mixture of Experts, MoE)

为高效且有效地识别分布复杂的水下信号,本文借鉴了专家混合(MoE)的思想。MoE 能够对多样分布的数据进行判别式处理,同时避免引入过多参数而导致过拟合。MoE 模型最初由 Jacobs 等人(Jacobs et al., 1991)提出,包含若干专家模型和一个门控机制用于融合各专家的输出。随后,Collobert 等人(Collobert, Bengio and Bengio, 2002, 2003)将 MoE 思想应用于 SVM 等经典机器学习算法。近年来,Shazeer 等人(Shazeer et al., 2017)探索了通过稀疏专家激活实现条件计算(conditional computing)的方式,在 LSTM 中仅激活固定数量的专家。Fedus 等人(Fedus et al., 2021)进一步将 MoE 结构扩展至大规模 Transformer(Vaswani et al., 2017),揭示了其在合理计算开销下构建可扩展模型的潜力。随着 MoE 研究的深入,该方法被广泛应用于扩展 Transformer(Fedus et al., 2021;Xie et al., 2022a;Rajbhandari et al., 2022;Riquelme et al., 2021)和卷积神经网络(Gross, Ranzato and Szlam, 2017;Ahmed et al., 2016;Wang et al., 2020)。稀疏门控 MoE 在几乎不增加计算开销的前提下显著提升了模型容量,在自然语言处理和计算机视觉领域取得了显著成果。
在本文中,我们提出了一种专用于水下声学目标识别的、基于卷积且专家稀疏激活的 MoE 模型。据我们所知,这是首次将专家混合机制应用于该领域。

3方法论

本节首先介绍本文采用的声学特征提取方法,随后依次阐述 CMoE 模型的前端主干网络、专家层、路由层以及可选残差模块。最后,介绍为解决 MoE 结构固有的负载不均衡问题而采用的平衡正则化策略。

3.1 声学特征提取

在这里插入图片描述

3.2 前端主干网络

在特征提取之后,我们介绍所提出的 CMoE 模型的整体流程与结构。CMoE 由两个主要部分组成:第一部分是前端主干网络,负责将输入的声学特征转换为固定维度的表征。

在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

3.3 专家层、路由层与残差模块

专家层与路由层的结构及训练流程分别如表 1 和图 3 所示。两者均以前端主干网络的输出表征作为输入。专家层由包含两个线性层的多层感知机(MLP)构成(见表 1)。每个专家具有相同的结构,但参数相互独立。只有当遇到合适的输入时,专家才会被激活,从而实现对多样化水下数据的细粒度、差异化学习。路由层则由一个简单的线性层构成,通过计算路由概率自适应地引导输入分配。该设计使模型能够利用多个独立参数空间对多样化的水下声学数据进行解耦,从而减轻类内多样性的影响。
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

3.4 平衡正则化

在训练过程中,如 Shazeer 等人(Shazeer et al., 2017)所指出,专家之间常出现严重的负载不均衡问题:少数专家接收了大部分输入,而许多专家训练不足。为解决此问题,我们采用 Fedus 等人(Fedus et al., 2021)提出的平衡正则化方法,旨在促进所有专家之间更公平的工作负载分配。
沿用上一小节的符号,平衡损失计算如下:
在这里插入图片描述
在这里插入图片描述

4、实验设置

4.1 数据集

本研究使用了三种不同规模的水下舰船辐射噪声数据集,详细信息见表2及后续段落:
在这里插入图片描述
在这里插入图片描述

4.2 有效频带

为减少声学特征的冗余,我们在特征提取时使用有效频带替代全频带。这涉及在包含最相关频率成分的带宽内进行时频变换,旨在减少输入特征中的冗余分量,同时降低时间和硬件消耗。考虑到Shipsear、DTIL和DeepShip中信号的有用能量主要集中在不同的频率范围,我们为每个数据集建立了独立的有效频带(见表2)。值得注意的是,根据奈奎斯特采样定理,有效频带的上限必须设置在采样率的一半以下。关于确定最佳有效频带选择的实验更多细节见第5.1节。此外,表2还列出了三个数据集上每种声学特征的维度。

4.3 数据划分

本研究将每个信号切割成30秒的片段,并有15秒的重叠。为防止信息泄露,我们确保训练集和测试集的片段不来自同一音频轨道,以保证报告的准确率真实反映系统的识别能力和泛化性能,而非记忆能力。
我们发现几乎所有先前关于水下声学目标识别的工作都未公开其训练-测试划分,这使得建立公平比较变得困难。为解决此问题,我们提供了为Shipsear(见表3)和DeepShip(见表4)精心选择的训练-测试划分。训练集的15%被随机用作验证集。我们的手动选择原则是确保测试数据与训练数据之间的相关性最小。通过发布此基准,我们旨在为未来寻求公平比较的研究提供可靠参考。
在这里插入图片描述

4.4 参数设置

本研究中,帧长设置为50ms,默认帧移为帧长的一半。我们进行了实验以研究帧长对识别结果的影响,详见第5.1节。此外,默认情况下,梅尔或Bark滤波器组的数量设置为300。
训练时,我们采用带权重衰减的AdamW (Loshchilov & Hutter, 2017) 优化器,最大学习率设置为5×10⁻⁴,所有实验的权重衰减设置为10⁻⁵模型在A40 GPU上训练200个epoch

5、结果与分析

针对本研究的多类识别任务,我们统一采用准确率作为评估指标,即正确预测的样本数除以总样本数。此外,鉴于测试集中音频文件数量有限,多组实验可能产生相同的文件级准确率,因此我们呈现的是片段级(30秒)而非文件级的结果。同时,为减少随机性,所有报告的结果均为使用两个不同随机种子(42和123)进行实验的平均值
本节首先对帧长、有效频带和前端主干网络结构进行初步实验。随后进行主要实验,基于四种声学特征验证CMoE的有效性,并与多种先进方法进行比较。本部分还包括关于可选残差模块和平衡正则化的消融实验。接着,我们对专家分配进行综合可视化分析,以进一步证明专家有效捕捉有用信息的能力。最后,我们进行了关于专家层数量和归一化函数选择的相关实验。

5.1 初步实验

在验证CMoE之前,我们对有效频带、帧长和前端主干网络结构进行了初步实验,详细结果见图4。关于有效频带的选择,相关实验统一使用STFT语谱图作为输入特征,ResNet with attention pooling (ResNet-AP) 作为模型,帧长设置为50ms。设置100Hz的高通滤波以滤除低信噪比的频带。实验结果表明,Shipsear、DTIL和DeepShip分别适合使用100-26.36kHz (奈奎斯特频率)、100-2kHz和100-8kHz作为有效频带。关于帧长的选择,我们也统一使用STFT语谱图和ResNet-AP模型,三个数据集在50ms帧长下均取得最佳性能,因此确立默认帧长为50ms。
接下来,我们比较了六种不同的主干模型以选择最佳结构:支持向量机 (SVM)、全卷积网络 (FCN)、MobileNet-v3 (Howard 等, 2019)、ResNet (He 等, 2016)、SE-ResNet (Hu, Shen & Sun, 2018) 和 ResNet with attention pooling (ResNet-AP) (Wang 等, 2018)。其中,ResNet-AP在三个数据集上均表现出最高的识别准确率。因此,后续实验统一采用ResNet-AP作为默认前端主干模型。

在这里插入图片描述

5.2 CMoE的主要结果

随后,我们通过实验验证了CMoE方法的性能。为证明其优越性,我们将结果与几种现有的先进方法(AGNet (Xie 等, 2022b)、smoothness-inducing regularization (Xu 等, 2023)、TDNNWPCS (Ren 等, 2019)、SCAE (Irfan 等, 2021))进行了比较,主要结果见表5。
在这里插入图片描述
观察发现,基础CMoE通常能提高识别准确率。然而,由于负载不均衡问题,CMoE的性能有时会下降(见第3.4小节)。例如,在DeepShip上,基于CQT的CMoE模型准确率比基线模型下降了0.73%。这归因于负载不均衡导致某些专家训练不足。值得注意的是,随着专家数量的增加,此问题有恶化的风险。
引入平衡正则化后,CMoE开始展现出其潜力。特别是在数据来源多样、目标运动状态各异的Shipsear上,增加专家层能帮助模型从多样化数据中有效学习,将识别准确率从75.24%显著提高到86.21%。此外,我们观察到CMoE在基于所有四种特征的识别系统中均有效,证实了其通用性。
此外,我们还进行了一组关于残差模块的消融实验(见表5中的CMoE与RCMoE)。结果显示残差模块并不能始终带来提升。RCMoE引入了一个无门控的残差层,缓解了因路由不当或专家过拟合导致的性能损失。然而,在解决潜在缺陷的同时,它也降低了网络的稀疏性,减弱了多个专家层对多样化数据的解耦效果。因此,CMoE和RCMoE在不同情况下各有优劣。

5.3 可视化分析

我们使用混淆矩阵热力图直观地展示模型对每个类别的识别准确率。混淆矩阵比较了预测标签(x轴)和实际标签(y轴),热力图用颜色表示数值。如图5所示,基线模型的识别性能不理想,部分类别(挖泥船、远洋客轮、滚装船、帆船)的准确率低于50%。对于我们提出的CMoE,模型对先前难以识别的类别(如挖泥船、滚装船、帆船)几乎达到了100%的准确率,表明了显著的改进。
在这里插入图片描述
接着,我们对Shipsear中的专家分配进行了可视化分析。热力图展示了具有4个和8个专家的CMoE模型的专家分配结果(见图6)。热力图中的颜色代表分配给每个专家类别的样本比例。我们的分析揭示了专家分配与目标尺寸之间可能存在关联。根据经验知识,远洋客轮和滚装船属于大型目标,而摩托艇和帆船属于小型目标。如图6所示,8专家CMoE倾向于将远洋客轮和滚装船分配给第5号专家,而摩托艇和帆船主要分配给第1号专家。类似地,4专家CMoE对小目标和大目标也表现出类似的分配模式。这一发现表明,路由模块可能捕捉到了与目标尺寸相关的固有特征
在这里插入图片描述

此外,图7展示了图1中提到的六个样本的专家分配情况。通过比较三个不同运动状态和类型的摩托艇样本,我们观察到其专家分配既有重叠也有差异。在某种程度上,重叠代表了与目标相关的模式,而差异反映了类内多样性。此外,我们比较了语谱图相似但类别不同的样本(例如motorboat 33 vs passenger ship 59)的专家分配,发现语谱图相似的样本具有不同的专家分配。这表明我们的CMoE成功解决了类间相似性问题。
综上所述,负责专家分配的路由模块展示了从高层表征中捕捉目标相关特征和类内多样性的能力。此外,我们还发现CMoE的专家分配受类间相似性影响很小。上述可视化分析为路由分配提供了一定的可解释性。
在这里插入图片描述

5.4 专家数量的影响

本小节深入探讨CMoE模型中专家数量的影响。分析表明,虽然增加专家数量能实现对数据更细粒度的理解,但也会减少分配给每个专家的数据量,从而增加过拟合的风险。因此,选择最佳专家数量是一个复杂的权衡过程。图8展示了在三个数据集上具有2、4和8个专家的CMoE结果。结果表明,专家数量的影响并非简单的正比关系,而是取决于数据规模、数据多样性、输入特征等多种因素。只有部分结果显示出明显的规律。在训练数据相对充足的DeepShip上,具有2个专家的CMoE表现最差,这归因于其有限的容量难以从多样化数据中学习。此外,对于冗余特征(如Shipsear上维度为1200×1318的STFT语谱图),增加专家层数量可以提升性能。对于其他实验组,多种影响因素的耦合使得难以发现清晰的规律。
总而言之,选择最佳专家数量是一个多方面的权衡任务,专家层对性能的影响取决于数据和特征的特性。因此,有必要通过遍历搜索来寻找最佳专家数量。
在这里插入图片描述
在这里插入图片描述

5.5 归一化函数的选择

表6概述了归一化函数对CMoE和RCMoE识别性能的影响。注意待归一化的概率分布为𝑝,两种归一化函数的公式如下:
在这里插入图片描述

结论

本研究揭示了水下声学信号的独特性,即高类内多样性和类间相似性。在此基础上,我们创新性地将专家混合(MoE)机制应用于水下声学识别,提出了CMoE。该技术从高层表征中捕捉潜在特征,并利用多个独立参数空间自适应地学习多样化数据。为优化模型,我们进一步引入了平衡正则化和残差模块。通过综合实验,我们证明了所提方法的优越性,并强调了平衡正则化的必要性。此外,可视化分析验证了我们方法的有效性,并增强了模型的可解释性。
尽管取得了有希望的结果,CMoE仍存在局限。首先,我们展示了专家分配在一定程度上与目标的内在属性(如目标尺寸)相关,但该现象缺乏足够的理论支持。此外,专家层和路由层的结构设计相对简单。我们认为,当前使用简单的线性层作为专家或路由层,并未充分挖掘MoE结构的潜力。在未来的工作中,我们计划探索利用基于物理的目标特征(如螺旋桨叶片数量)作为路由基础,而非仅依赖自动学习的路由层。这种方法能提供更好的可解释性,对我们的研究具有重要意义。

更多推荐