基于动量的对抗训练方法用于水下声学目标识别中的泛化能力提升:以单船视角出发
摘要:
水下被动声学识别(UATR)专注于根据船舶辐射噪声对目标进行分类,是水下声学领域的一项关键挑战。近年来,基于深度学习的方法因其强大的性能而广受欢迎。然而,这些方法在现实场景中往往泛化能力较差。本研究揭示了其中的一个根本性挑战:船舶辐射噪声的特性受到诸如船体结构和推进系统等因素的影响。尽管同类型船舶在这些方面可能表现出不同的模式,但不同类型船舶之间却可能存在相似之处。因此,数据驱动模型往往会过度强调个体特异性特征,从而导致“过拟合”和泛化能力差的问题。
为缓解这一挑战,本文提出了基于动量的对抗训练(Momentum-Based Adversarial Training, MBAT)框架。MBAT 利用一种动量对抗策略,结合类别信息与个体船舶之间的关系,有助于提取更具类别判别性的特征。此外,还引入了同方差不确定性(homoscedastic uncertainty)算法,用于平衡类别相关特征与船舶个体特异性特征的优化目标。这些策略使模型能够更有效地捕捉类别判别性模式,并对未见过的目标实现良好泛化。在 DeepShip 和 ShipsEar 数据集上的实验表明,MBAT 在未见个体船舶上的泛化能力显著优于现有最先进的方法。可视化结果进一步验证了所提方法的有效性与必要性。
© 2025 美国声学学会。https://doi.org/10.1121/10.0036456
一、引言
A. 背景
水下被动声学识别(UATR)是水下声学领域的核心课题之一,主要聚焦于利用船舶辐射噪声对水下目标进行分类。该技术在海洋资源开发、海上安全保障、科学研究以及海洋生态环境保护等方面具有重要作用(Dong 等,2021)。然而,由于船舶辐射噪声具有时变特性,且海洋背景噪声复杂多变(Wang 等,2024),使得 UATR 极具挑战性。
为实现精准识别,研究人员在过去几十年中对此开展了大量分析与研究(Niu 等,2023)。早期的识别系统主要依赖人工设计的声学特征与传统机器学习算法(Hummel 等,2024),严重依赖专家知识,且在真实数据上的表现相对较弱。随着计算硬件的发展和公开数据集的积累,神经网络方法逐渐成为 UATR 的主流,并展现出更优的性能(Niu 等,2023)。
近年来,许多研究致力于缓解船舶辐射信号固有的复杂性,以进一步提升模型的泛化能力。例如,Zeng 等人(2020)采用对抗训练(AT)来应对复杂的海洋环境;Xie 等人(2024)将卷积神经网络(CNN)与混合专家(MoE)结构相结合,以减轻水下信号类内差异带来的影响;Yang 等人(2024a)则采用域自适应(DA)技术提取域不变特征,以解决数据分布不一致的问题。
尽管 UATR 领域已取得显著进展,为后续深入研究奠定了坚实基础,但环境条件的复杂性和多样性对识别算法的泛化能力提出了更高要求,亟需进一步探索以应对复杂现实场景带来的挑战。
B. 动机
尽管对水下声学信号的研究不断深入,但个体船舶之间的关系对识别性能的影响仍是一个尚未被充分探索的问题,尤其是在同一类别内部船舶存在显著差异的情况下。
具体而言,普遍认为船舶辐射噪声的主要成分包括机械噪声、螺旋桨噪声和流体动力噪声(Peng 等,2019a)。其中,机械噪声和螺旋桨噪声尤其受到个体船舶特性(如各类机械设备结构和推进系统)的影响(Peng 等,2019a)。同类型的船舶在这些方面可能存在显著的设计差异,从而产生截然不同的声学模式;而不同类别的船舶反而可能表现出相似的属性。
我们在图1中通过公开数据集 DeepShip(Irfan 等,2021)中的录音及其对应的声学特征展示了这一现象。图1(a) 和 (b) 分别展示了两艘客船 “Bowen Queen” 和 “Coastal Inspiration”,图1© 展示了一艘油轮 “KIRKEHOLMEN”。图1(d)–(f) 为对应录音的梅尔频谱图(Mel-spectrogram)。与 “Bowen Queen” 采用四方位螺旋桨不同,“Coastal Inspiration” 和 “KIRKEHOLMEN” 均使用标准螺旋桨,其推进系统更为相似。这种物理特性直接反映在声学特征上:如图1(d)–(f) 所示,由于推进系统相似(均为标准螺旋桨),“Coastal Inspiration” 和 “KIRKEHOLMEN” 的梅尔频谱图在时间轴上呈现出明显的周期性条纹,而 “Bowen Queen” 则没有这一特征。

考虑到特征特性对分类性能的直接影响(Wang 和 Zeng,2014),一个关键问题随之而来:这些差异与共性是否也会体现在特征分布中,进而影响识别结果?
为探究这一问题,我们在 ShipsEar(Santos-Domínguez 等,2016)和 DeepShip 数据集上进行了实验(详见第二节),目标是在训练集中未包含的新个体船舶(但属于相同类别标签空间)上进行识别。图2展示了测试样本潜在表示的 t-SNE 可视化结果,其中颜色代表类别,形状代表不同个体船舶。

ShipsEar 测试集的潜在表示(图2(a))明显呈现出按个体船舶聚类而非按类别的趋势,表明当数据有限时,模型倾向于过度关注个体船舶的特有特征。尽管 DeepShip 数据集的录音数量更大、多样性更高,这种倾向依然存在(如红色椭圆所示)。可以观察到,这种倾向带来了两个问题:
即使在数据相对充足的情况下(如 DeepShip),也会导致类内差异增大、类间相似性增强,这对准确分类极为不利(Wen 等,2016)。图2(b) 清晰地展示了这一现象:油轮(Tanker)的两个圈出区域在潜在空间中相距甚远,体现出显著的类内变异;而下方区域甚至更接近客船,导致类别边界模糊。
在测试阶段,模型无法获知新个体船舶的身份信息,这种混乱的特征分布使得模型难以泛化到未见过的目标,即使这些目标与训练数据共享相同的标签空间——而这恰恰是实际应用中至关重要的能力(Cao 等,2019)。
C. 本文工作
考虑到嵌入在特征中的个体船舶特性会导致识别任务中潜在表示分布混乱(如图2所示),一个直观的解决思路是在训练过程中削弱这类信息的干扰。
为实现这一目标,本文提出了一种创新的基于动量的对抗训练(Momentum-Based Adversarial Training, MBAT)框架。
MBAT 在传统识别任务的基础上,引入了一个样本对判别任务,并结合梯度反转层(Gradient Reversal Layer, GRL;Ganin 等,2016)以实现对抗训练(AT)。通过显式建模个体船舶之间的关系,所提出的 MBAT 引导模型聚焦于类别层级的判别性特征,而非个体船舶特异性特征,从而重构潜在表示的分布结构,提升识别性能。
受 MoCo(He 等,2020)启发,我们在该框架基础上引入了一种基于动量的更新策略,以增强训练过程的稳定性和一致性。此外,我们采用同方差不确定性算法(homoscedastic uncertainty algorithm;Neilsen 等,2021;Kendall 等,2018)来平衡两个子任务。该方法具有良好的自适应能力,无需人工调整超参数,显著降低了训练成本。
本文的主要贡献如下:
通过观察与实验分析,我们揭示了个体船舶特性会体现在特征分布中,导致类内差异增大、类间相似性增强。这一特性严重损害模型在现实场景中的识别与泛化能力;
针对该问题,我们提出了 MBAT 框架,利用类别信息与个体船舶关系提取类别判别性特征,并采用基于动量的更新策略保障训练稳定性;
为更好地平衡并促进不同任务间的知识交互,我们引入同方差不确定性算法,融合与类别信息和个体船舶关系相关的多目标优化;
我们在公开数据集 DeepShip 和 ShipsEar 上进行了大量实验与可视化分析。结果表明,所提出的 MBAT 能有效规整潜在空间中的特征分布。我们的最优模型在 UATR 任务中全面超越现有先进方法,在四项指标上平均提升 3.45%。此外,该方法在多种骨干网络(backbones)上均持续取得性能提升,充分验证了 MBAT 在性能与泛化能力方面的优越性。
二、相关工作
A. 水下声学目标识别(UATR)
过去几十年,由于其重要性,水下声学目标识别(UATR)领域开展了大量研究。早期方法主要采用手工设计特征结合机器学习分类器。例如:
Das 等人(2013)基于频谱分析设计了倒谱特征,并使用高斯混合模型(GMM)进行分类;
Wang 和 Zeng(2014)将小波分析与希尔伯特-黄变换应用于船舶辐射噪声信号,再用支持向量机(SVM)分类;
Ke 等人(2020)通过小波包分解融合不同子带特征,并采用 K 近邻(KNN)算法分类;
Wu 等人(2018)利用维格纳-维尔分布(WVD)提取特征,并同样采用 SVM 进行识别。
然而,手工设计特征高度依赖专家知识,而传统机器学习分类器在面对大规模、高维异构特征空间时泛化能力较差,难以满足实际应用需求(Irfan 等,2021)。
鉴于上述局限,神经网络的兴起提供了新的可能:
Cao 等人(2019)结合卷积神经网络(CNN;LeCun 等,1998)与二阶池化,以捕获时频(T-F)表示中的相关性;
Liu 等人(2021b)构建了三维梅尔频谱图作为卷积循环神经网络(CRNN)的输入;
Xie 等人(2022a)和 Ren 等人(2022)设计了可学习的前端模块,自动提取特征,避免人工特征工程;
Yang 等人(2024c)提出多特征及其微分信息的融合策略,并与 CNN 结合用于目标分类;
Xie 等人(2022b)引入源距离等辅助信息,通过多模态信息模板提升识别性能;
Zhou 等人(2023b)采用多子带特征与基于注意力机制的多尺度卷积网络构建识别系统;
Xu 等人(2023a)提出局部掩码与复制(LMR)数据增强方法及基于平滑性的正则项以提升泛化能力;
Zhu 等人(2023)分析了不同频段船舶辐射噪声特性,并设计了相应识别算法;
Zhou 等人(2023a)针对低信噪比场景,提出联合去噪与识别的端到端框架;
Feng 和 Zhu(2022)及 Feng 等人(2024)引入基于 Transformer(Vaswani 等,2017)架构与时频 token 聚合模块的识别模型;
Fan 等人(2025)改进强大的 Swin-Transformer(Liu 等,2021c),并结合可学习前端实现目标信号识别;
Yang 等人(2024a)通过拼接梅尔频谱图增强船舶辐射噪声中的低频成分;
Li 和 Yang(2024)将听觉被动注意力机制引入 UATR 系统;
Xie 等人(2024)设计了混合专家(MoE)结构,以应对水下声学信号中的类内差异与类间相似性。
近年来,自监督学习(SSL)因其无需标注的优势在该领域广受关注:
Wang 等人(2022b)在重建任务中采用 fbank 和 gbank 实现 SSL;
Wang 等人(2024)进一步提出基于 Swin-Transformer 的双通道自注意力声学编码器;
Xu 等人(2023b)对对数梅尔频谱图进行掩码与重建,学习通用表示,再在目标任务上微调。
尽管现有研究在特征提取与分类模型方面取得了显著进展,但船舶辐射噪声成分复杂,且水下声学环境噪声高度可变,给算法在真实场景中的稳定性与鲁棒性带来巨大挑战。这种复杂性凸显了进一步提升 UATR 算法性能的必要性,尤其是在面对未见目标时的泛化与适应能力(Cao 等,2019)。
B. 域自适应(DA)与域泛化(DG)
域自适应(Domain Adaptation, DA)与域泛化(Domain Generalization, DG)是计算机视觉、说话人识别等领域的重要课题。尽管问题定义略有不同,二者均旨在解决源域与目标域数据分布不匹配的问题(Wang 等,2022a)。
实现该目标的一种途径是学习域不变且具有判别性的潜在特征。部分研究通过显式对齐特征分布实现此目的:
Li 等人(2018)采用最大均值差异(MMD)对齐特征分布;
Peng 等人(2019b)通过对齐特征分布的各阶矩学习域不变表示。
另一类方法是域对抗训练(Domain-AT):
Ganin 等人(2016)引入梯度反转层(GRL),通过标准反向传播实现对抗训练;
Luu 等人(2020)与 Wang 等人(2018)将该思想应用于说话人识别并取得成功。
由于海洋环境与声传播路径的复杂性,水下声学数据集中普遍存在分布漂移与不匹配现象(Xu 等,2024;Jin 等,2024)。这一特性逐渐受到关注,已有研究将 DA/DG 方法引入 UATR:
Xu 等人(2024)发现水下声学样本的特征分布随时间漂移,并提出两种交叉验证方法用于客观性能评估;
Zeng 等人(2020)开发了广义通道不变网络,以消除船舶辐射噪声中的通道信息;
Yang 等人(2024b)利用预测一致性与极小极大熵(MME)算法处理未对齐数据;
Yang 等人(2024a)进一步引入随机分类器以获得域不变表示。
然而,个体船舶特性对船舶辐射噪声特征分布的影响却鲜有研究。本文在此方向做出补充性贡献:我们指出,水下声学信号中的类内差异与类间共性(Xie 等,2024)部分源于同类船舶个体间的差异。这些差异在面对未见目标时也会加剧分布不匹配问题。为此,我们提出新颖的 MBAT 框架以缓解该问题。加粗样式
三、方法论
所提出的 MBAT 的核心目标是减轻个体船舶特性对特征分布的干扰,从而帮助模型捕获类内不变、类间可分的模式。本节首先介绍梅尔频谱图的提取流程,随后说明我们设计的样本配对算法,最后详细阐述 MBAT 框架,包括对抗训练、动量更新策略、同方差不确定性算法及具体模型架构。
A. 声学特征提取


B. 样本配对算法










C. 针对个体船舶的对抗训练(AT)
图5中黄色区域展示了针对个体船舶的对抗训练(Adversarial Training, AT)框架,MBAT 正是在此基础之上构建的。该框架可分解为三个组成部分:




D. MBAT 框架
在第三节 C 的基础上,我们进一步引入了动量编码器(Momentum Encoder, ME)和同方差不确定性算法,与个体船舶对抗训练相结合,构成了完整的 MBAT 框架(如图6所示)。

1. 动量编码器(ME)
理想的识别模型应在训练过程中保持参数更新的平滑性与一致性(Yang 等,2024b)。然而,如图5所示,共享编码器的参数同时受到识别任务和判别任务的影响,可能导致梯度冲突(Liu 等,2021a)。此外,两个任务需同时处理三个样本(锚点、正样本、负样本),进一步增加了优化难度。这些因素共同导致训练不稳定——这是对抗学习的典型缺陷(Arjovsky 等,2017)。

2. 同方差不确定性算法

3. 推理阶段(Inference
推理阶段的数据流如图7所示。此时动量编码器与判别器被停用,因此不会引入额外的计算开销。

E. 架构细节
MBAT 中各模块的具体结构见表 I。值得注意的是,作为一个通用框架,MBAT 可兼容多种骨干网络(backbones)。本文以 SE-ResNet(Hu 等,2018)为基础构建模型(如图8所示),其通过压缩-激励(Squeeze-and-Excitation, SE)机制动态调整通道间权重(以下简称 MBAT-SE)。
分类器与船舶判别器均采用两层全连接网络。

四、实验设置
A. 数据集
对比实验主要在 DeepShip(Irfan 等,2021)数据集上进行。该水下声学数据集包含总计 47 小时 4 分钟的音频录音,采样率为 32 kHz,分为四类:货船(cargo)、客船(passenger ship)、油船(tanker)和拖船(tugboat)。其中,584 段录音标注了具体的船舶个体信息,总时长约 46 小时 16 分钟。
ShipsEar(Santos-Domínguez 等,2016)是另一个公开的水下声学数据集,包含 90 段录音,涵盖 11 种船舶类型及自然噪声。但仅有四类拥有足够且带船舶标注的录音:摩托艇(motorboat)、远洋客轮(ocean liner)、客船(passenger ship)和滚装船(RoRo)。这四类共包含 47 段录音,总时长约 2 小时。
由于数据稀缺且不平衡,我们在 ShipsEar 子集上仅进行小型实验(toy experiments),以评估 MBAT 对潜在表示分布的规整效果。
B. 数据划分
UATR 中常见的数据划分方法有三种(Liu 等,2021b;Zhou 等,2023b 总结如下):
任务1:样本随机划分。所有录音先切分为样本,再从中随机抽取训练/验证/测试集;
任务2:按时间顺序划分。每段录音的前 70% 作为训练集,剩余部分作为验证/测试集;
任务3:录音级随机划分。先按比例将整段录音分配至训练集或测试集,再切分为样本。
近期,Xu 等人(2024)指出:水下声学目标数据在时间序列上存在相关性,若训练与测试数据存在时间重叠,会导致识别性能被高估。任务3可避免此问题,但仍可能造成个体船舶信息泄露(即同一艘船的录音同时出现在训练与测试集中)。
为深入研究个体船舶特性的影响,并对 MBAT 进行无偏评估,我们在任务3的基础上进一步禁止训练集与测试集之间出现任何相同的船舶个体。
该划分方式还能有效评估模型在面对未见目标时的泛化能力——这对实际应用至关重要(Cao 等,2019)。
具体地:
在 DeepShip 中,20% 带船舶标注的数据被随机选为测试集;
在 ShipsEar 中,因数据有限,测试集占比约为 17%。
表 II 展示了划分后的统计信息。我们已公开数据划分方案以供后续研究使用。

C. 参数设置

五、结果与分析
MBAT 的核心目标是缓解个体船舶特性在识别任务中带来的两大挑战:
特征分布的类内差异大、类间相似性强;
对未见目标缺乏泛化能力。
为验证所提方法的优越性,我们首先将 MBAT 与多种先进方法进行定量性能对比;
其次,通过可视化潜在表示分布,直观展示 MBAT 相较基线模型的改进效果;
最后,开展消融实验,深入剖析 MBAT 中关键组件的作用,以加深对其工作机制的理解。
A. 主要结果
1. 性能对比
为进行定量分析,我们在 UATR(水下声学目标识别)任务中复现了若干现有先进方法作为对比,包括:
带二阶池化的卷积神经网络(CNN-SOP)(Cao 等,2019);
9 层卷积循环神经网络(CRNN9)(Liu 等,2021b);
强调通道注意力、传播与聚合的时延神经网络(ECAPA-TDNN)(Wang 等,2022c);
LMR(Xu 等,2023a);
基于卷积的混合专家模型(CMoE)(Xie 等,2024)。
此外,还引入了 UATR 中广泛应用的模型如 ResNet18(He 等,2016)和 Xception(Chollet,2017)进行比较。
所有实验均在相同设置下进行,每项实验重复三次以提高结果可靠性。
采用准确率(Accuracy)、宏平均精确率(Macro Precision)、宏平均召回率(Macro Recall)和宏平均 F1 分数(Macro F1-score)评估识别性能。实验结果见表 III。

可以观察到,CRNN9、CNN-SOP 和 ECAPA-TDNN 在测试集上的表现相对较差,说明模型在泛化到未见目标方面存在显著挑战。
相比之下,SE-ResNet18、Xception 和 CMoE 在基线模型中表现更优,表明提升模型表达能力有助于增强泛化性能。
本文提出的 MBAT-SE 在所有方法中取得最佳结果,预测准确率达到 79.87%。
与表现最好的基线模型 CMoE 相比,MBAT-SE 在四项指标上平均提升 3.45%;
相较于原始 SE-ResNet,四项指标平均提升 3.78%。
这些结果充分验证了所提方法的有效性。
2. 可视化分析
为加深理解,在定量评估后开展了可视化实验。
对比模型为原始 SE-ResNet18 与对应的 MBAT-SE,数据划分与参数配置均遵循第四节所述。
由于 DeepShip 测试集规模较大,从中随机选取子集用于可视化;ShipsEar 测试集则全部展示。
所有实验使用相同的可视化数据。
将 SE-ResNet18 与 MBAT-SE 编码器的输出作为潜在表示进行可视化:
图 9(a) 和 9© 分别展示了 SE-ResNet18 在 ShipsEar 和 DeepShip 测试集上的特征分布;
图 9(b) 和 9(d) 则对应 MBAT-SE 的可视化结果。


如第一节所述,基线模型的特征分布存在明显的类内差异大、类间相似性强的问题,尤其在红色椭圆标记区域尤为突出。
相比之下,MBAT-SE 显著缩小了 ShipsEar 数据集上的类内距离,类别边界更加清晰。
在 DeepShip 测试数据上,MBAT-SE 的特征按类别(而非具体船舶个体)形成明显聚类,类内紧凑、类间分离度高,有利于提升识别性能。
表 IV 进一步使用轮廓系数(Silhouette Score;Rousseeuw, 1987)对聚类效果进行量化评估,结果显示 MBAT 在两个数据集上均显著优于基线,支持上述可视化结论。

3. 不同编码器下的性能
一个有效的训练框架不应局限于特定模型结构(Yang 等,2024a)。
为验证 MBAT 的广泛适用性,我们在不同编码器结构上进行了对比实验,结果见表 V。

与直接训练相比,所提方法在各种编码器结构下均实现性能提升,证实了其通用性与适应性。
这验证了我们的假设:MBAT 能有效从船舶辐射噪声信号中提取复杂表示,发现具有优良分类特性的潜在分布。
在实际应用中,MBAT 框架允许根据任务特点灵活设计和选择合适的编码器,从而实现更优的识别性能。
B. 消融研究
1. 模块有效性
我们使用多种编码器进行消融实验,以验证 MBAT 中各模块(即对抗训练 AT 与动量编码器 ME)的贡献。
表 VI 所示结果清晰展示了各组件对整体性能的具体影响。

MBAT 的两个核心组件在不同编码器结构下均带来显著性能提升:
AT 模块通过约束隐空间分布,缓解了个体船舶特性带来的负面影响,相比基线直接训练,平均准确率提升 1.29%;
ME 模块进一步稳定了优化过程,帮助网络避免陷入局部极小值或振荡区域,从而更平滑地收敛至鞍点。
总体而言,AT 与 ME 表现出强互补性,联合使用可带来 2.79% 的平均性能提升(见表 VI)。
2. ME 融合策略
尽管动量更新机制在优化过程中具有优势(He 等,2020),但模块融合方式的设计至关重要。
我们实验了四种不同的融合策略(如图 10 所示),主要区别在于判别器输入的正/负样本来自共享编码器还是动量编码器(ME)。

图 11 展示了不同融合策略的实验结果:

版本 I:分类器无法获取正/负样本信息,导致优化受限,性能最差;
版本 II–IV:分类器接收所有样本信息;
版本 III 和 IV 中,判别器分别使用共享编码器或 ME 提供的正/负样本;
版本 II(判别器使用 ME 的正/负样本,分类器使用共享编码器的所有样本)性能最优;
版本 IV 略优于版本 III。
这一现象表明:若同时将锚点、正样本、负样本全部送入分类器和判别器,会增加优化复杂度并引发梯度冲突。
而版本 II 在判别任务中固定正/负样本(不计算梯度),简化了鞍点搜索过程,从而获得最优且最稳定的性能,验证了第三节 D.1 中提出的假设。
因此,最终采用版本 II 的结构进行集成。
3. 动量系数的影响
MBAT 中的动量系数 m至关重要,它控制 ME 保留历史信息的程度: m 越小,更新越快。
本部分聚焦 m对模型性能的影响。由于各项指标变化趋势一致,表 VII 仅展示准确率,便于分析。


C. 同方差不确定性算法


六、结论
本文针对个体船舶物理特性差异所导致的船舶辐射噪声信号类内变异大、类间共性多的问题展开研究。
为缓解这些复杂特性对识别性能的干扰,提出了 MBAT 框架,该框架显式建模了个体船舶之间的关系。
MBAT 在对抗学习基础上创新性地引入动量编码器(ME),使其既能提取类别判别性强的表示,又能在训练过程中保持稳定性。
为进一步提升对特征质量变化的适应能力,我们还提出了同方差不确定性算法,以自动平衡多任务权重。
在两个公开数据集上的大量实验与可视化分析充分证明了 MBAT 的有效性。
尽管 MBAT 相较基线模型取得了一致性提升,但仍存在局限性:
依赖个体船舶标签,增加了数据采集与标注的复杂度和工作量;
面对仅有少量录音的独特船舶个体时,当前的配对算法与网络架构仍有改进空间。
未来工作将聚焦于上述问题的优化。
算法搭建中的思考
为什么alpha从0然后慢慢增长到1对抗越来越强
alpha 决定了“对抗梯度在 encoder 更新中占多大话语权”。
从 0 → 1,就是让对抗信号从“几乎不说话”→“可以和主任务平起平坐”。
更多推荐


所有评论(0)