跳转至

OpenWhistle: A Large-Scale Longitudinal Dataset and Benchmark of Bottlenose Dolphin Vocalizations

会议: NeurIPS 2026 Datasets & Evaluations Track Spotlight(数据集与评估赛道,非普通主赛道)
arXiv: 2609.34839
领域: 音频/语音
关键词: 海豚哨声、生物声学、纵向数据集、自监督学习、线性探测

一句话总结

OpenWhistle 将单一海豚群体的多年水下录音整理为约 18 万声哨声的预训练语料和 8,354 声专家标注子集,用会话级划分与冻结表示线性探测建立类型分类和检测基准,语料内预训练的 Wav2Vec2.0 达到 81.1% 分类准确率和 75.6% 检测 mAP,但不涉及海豚语言意义的解码。

研究背景与动机

大规模生物声学资源已经让动物声音检测和物种分类成为可系统比较的任务,但 Xeno-Canto、BirdSet 等资源主要提供跨物种的广覆盖数据。 一个物种有很多短录音,并不等于拥有同一批个体多年连续交互的记录:研究个体声纹、哨声交换、社会关系和声学漂移,需要知道哪些动物长期共同生活,并保留相邻发声的时间关系。 海豚的标志性哨声(signature whistle,SW)尤其适合这种研究,因为其频率轮廓具有个体相关性,且海豚存在声音学习和模仿行为;然而已有数据往往规模小、获取受限,或者只有孤立片段和粗粒度标签。

OpenWhistle 的机会来自 Dolphin Reef 的半自然观测条件:固定水听器可以长期记录已知群体,海豚仍能进入外海,录音保留真实环境声、重叠发声和可变信噪比。 这并非覆盖全球海豚的新通用语料,而是以一个地点、一组已知个体为中心的深度数据资源;大规模无标签序列服务表示学习,小规模专家标签服务可复现评估。 这种分工使研究者能够检验一个具体问题:直接学习海豚声学结构,是否比迁移一般音频或广覆盖动物声音模型更有利于种内细粒度区分。

因此,本文不以提出新的网络结构为核心,也不把哨声类别当成语义标签。 核心 idea:将长期原始录音、可扩展哨声筛选和专家轮廓标签连接为“无标签预训练语料 + 受控下游基准”,检验领域内自监督表示能否识别细微的哨声类型差异。

方法详解

整体框架

输入是 2019 年 11 月 12 日至 2024 年 3 月 28 日在 Dolphin Reef 采集的水下声音,共 7,495 个录音会话、6,271.78 小时可用音频。 采集使用三个水听器,原始采样率为 96 kHz;群体包含四只常驻的 Tursiops truncatus ponticus,以及间歇来访的 Tursiops aduncus 雌性 Yosefa。 因此,论文反复使用的“五个已知个体”不应理解为五只同种动物始终同时在场。

数据构建先做二元哨声存在检测,再沿两条用途分流。 一条把邻近阳性片段合并成含时间上下文的序列,得到约 114 小时的预训练语料;另一条估计基频轮廓,以 ARTwarp 进行初始类别归属,再由专家检查,形成 8,354 声哨声的标注集。 两条分支对应不同质量要求:预训练保留真实噪声与重叠,专家标签则偏向清晰、少重叠的发声。

评估不是训练一个端到端检测网络,而是比较不同冻结音频表示上的逻辑回归线性探测器。 分类输入已经截出的单声哨声,输出一个类型;检测输入固定 0.5 秒片段,输出各类型是否出现的多标签结果。 Wav2Vec2.0 先在 OpenWhistle 语料上自监督预训练,随后与手工特征、AVES 和 BioLingual 一起接受相同下游探测协议。 这里主要贡献是数据及评估协议,下面按真实处理步骤解释,不将数据集目录或任务清单画成网络结构图。

关键设计

1. 哨声存在检测:从长期录音中筛出可用发声片段

直接给数千小时录音逐声标注成本过高,作者先把“有没有哨声”作为便宜的二元问题解决。 每段非重叠的 0.4 秒音频被转换成对数功率谱:使用 1,024 点 Blackman 窗、1,024 点 FFT 和 512 点步长,裁剪到 2–22 kHz,再做最小—最大归一化和 224×224 像素缩放。 输入复制为三通道,并采用 ImageNet 统计量归一化,以便复用 ImageNet 预训练 VGG16。 原分类头换成隐藏维度为 50 和 20 的轻量全连接头,整个网络微调,而非只训练末端分类器。

检测器只判断窗内至少存在一声哨声,不负责确定哨声类型、发声个体或意义。 它利用谱图中的哨声结构减少后续处理量,但也成为语料的选择门槛:低信噪比声音若被漏检,后续序列和专家集都不会自动恢复它们。 这正是为何 97.99% 的检测召回率仍不能被解释为完整记录了动物所有发声;作者估计约 3,700 声哨声未被捕获。

2. 纵向序列构建:保留发声之间的时间关系而非仅导出孤立样本

相邻阳性检测窗先拼成连续片段,片段之间间隔小于 6 秒时进一步合并为同一序列。 这样保留下来的不只是哨声本身,还包括其前后环境和邻近发声,使无标签预训练可以接触交互中的连续声学变化。 最终报告 33,267 条序列、约 114 小时音频和约 180,000 声哨声;最后一个数字依据时长与平均哨声时长估计,并非人工逐声计数。

正文报告序列平均长度 12.95 秒、标准差 19.9 秒、范围 5–246 秒,片段平均间隔 4.11 秒。 不过附录 B 对“序列级汇总”又写保留 2–20 秒序列,两处适用集合的关系没有说明;不能据此把最终预训练样本统一写成 2–20 秒。 “纵向”也不等于均匀、无中断的五年观测:录音集中于部分时段,2022 年完全缺失,常驻群体外出觅食及人的活动都会影响哪些声音进入数据。

3. 专家轮廓标注:让可扩展分类与人工声学判断相互补充

类型区分依赖细微的频率轮廓,而不只是判断谱图上是否存在一条亮线。 作者采用海豚专用 CREPE 估计基频(F0),先以 compress=20 做频率压缩,再将解码的 F0 乘回相同因子,适配原 CREPE 不覆盖的高频哨声。 每 5 ms 估计一次 F0,使用 weighted_argmax 解码;若置信度超过 0.05 的帧占比不足 5%,轮廓被标为低置信度。 原文说的是标记,未说明所有低置信度轮廓都被剔除。

随后 ARTwarp 将动态时间规整(DTW)与自适应共振网络结合,按轮廓相似性与人工模板建立初始类别归属,vigilance 参数设为 90,其余保持默认。 DTW 有助于比较速度或长度不同但形状相似的轮廓,专家再通过谱图检查修正误分和歧义,而不是把聚类输出直接视为真值。 最终有 10 类:7 类标志性哨声共 7,624 声,占 91.3%;3 类非标志性哨声(NSW)共 730 声,占 8.7%。 七种标志性哨声不等于七个当期在场个体,附录还指出数据包含已不在场个体的标志性哨声;结合模仿现象,类型预测不能直接替代当前发声者识别。

4. 会话级线性探测:把表示质量与下游模型容量分开比较

分类集从标注集抽取最常见的 6 类,共 3,000 个均衡样本;稀有类因数量不足不进入该任务。 检测集则将连续录音切成 0.5 秒窗,覆盖 7 类、每类 400 个实例,再配 2,800 个背景片段。 检测采用各类别独立二元标签,允许一个片段出现多类,背景是全零向量,而不是第八种发声类别;原文未细化多标签实例的采样去重口径。 分类的 6 类、检测的 7 类和完整标注的 10 类是三个不同范围,不能互换。

所有下游数据按录音会话分入训练、验证和测试,比例为 70% / 15% / 15%,并尽量维持相近类别分布。 同一会话的声音不会同时进入线性探测训练和测试,减少设备、背景及连续声学上下文造成的捷径。 但该规则只明确约束下游划分;论文没有说明自监督预训练语料是否排除了下游验证和测试会话或其对应音频。 因此,“下游会话不相交”不等于“预训练未接触测试来源”,领域内模型的优势应保留这一评估边界,而不是直接宣称完全无泄漏的跨会话归纳泛化。

损失函数 / 训练策略

语料筛选 VGG16 使用交叉熵、Adam、学习率 \(10^{-5}\)、批量大小 4、早停及 ReduceLROnPlateau。 附录给出的训练、验证、测试窗数分别为 53,828、5,980、16,708;前两项合计 59,808,与正文所述微调数据规模对应。 这个二元筛选器的监督标签,与后续类型检测基准及自监督预训练目标是不同层面的训练信号。

Wav2Vec2.0 使用标准自监督设置:通过掩码上下文预测量化潜在目标来学习表示,而不是使用专家哨声类型作为预训练监督。 附录明确给出两个大小为 320 的码本,Gumbel-softmax 温度从 2.0 指数下降到 0.5;除适配高采样率的特征编码器外,结构沿用 Wav2Vec2.0 base。 模型音频设置为 44.1 kHz,相较语音常用的 16 kHz 调整编码器以保持相对时间分辨率;原文没有列出具体卷积步长,也没有交代从 96 kHz 采集到该输入的重采样细节。 本文没有完整列出预训练损失公式,故不将通用 Wav2Vec2.0 公式补写为本论文精确定义。

预训练共 400k 步,使用 32 张 V100,每卡批量 4、梯度累积 2 步,有效批量为 256 段音频。 优化器为 AdamW,\(\beta_1=0.9\)、\(\beta_2=0.98\)、\(\epsilon=10^{-6}\),学习率 \(5\times10^{-4}\),线性衰减、32k 步预热、权重衰减 0.01,并使用混合精度。 这套配置展示了语料支持自监督训练,但不是低计算成本方案,也没有与外部模型开展匹配算力的受控比较。

下游逻辑回归使用 lbfgs,最大迭代次数 20,000;逆正则化强度 \(C\in\{0.1,1.0,10.0\}\) 在验证集选择。 分类报告准确率,检测报告各类型平均精确率的均值 mAP,表中统一采用百分数尺度。 测试集有放回重采样 1,000 次,报告均值与标准差;这些误差条不是多次预训练随机种子的波动,也不是 95% 置信区间。

实验关键数据

主实验

表 1 对应原文表 2:相同冻结表示线性探测协议下的结果,均值 ± bootstrap 标准差,单位为百分数。

表示 / 模型 预训练来源 分类准确率 检测 mAP
Chance level 无 16.7 8.3
Spectral features 无 34.9 ± 2.2 26.3 ± 1.1
MFCCs 无 45.6 ± 2.4 33.6 ± 1.8
Mean spectrogram 无 55.6 ± 2.4 47.7 ± 2.1
AVES-core AudioSet、FSD50K 68.0 ± 2.2 57.4 ± 2.1
BioLingual AnimalSpeak 音频—文本 71.3 ± 2.1 66.5 ± 2.2
AVES-bio 原文标为动物声音:AudioSet、VGGSound 75.1 ± 2.1 65.0 ± 2.3
Wav2Vec2.0 OpenWhistle 81.1 ± 1.8 75.6 ± 2.0

Wav2Vec2.0 相比最强手工基线 Mean spectrogram,分类增加 25.5 个百分点、检测增加 27.9 个百分点。 按各任务分别选择最强现成模型,则分类相比 AVES-bio 增加 6.0 个百分点,检测相比 BioLingual 增加 9.1 个百分点。 原文叙述把 AVES-bio 称为两项任务的最强现成模型,但表中 BioLingual 的 66.5 mAP 高于 AVES-bio 的 65.0;这里保留表值并明确这一冲突。 表中 Chance level 的检测值 8.3 按原文列示,文中没有提供其计算细节,不以类别数量自行改写。

消融实验

论文未提供逐模块移除、数据规模或采样率消融;表 2 汇总原文正文、附录 B 和附录 D 的构建质量与误差分析,不能当作受控消融结论。

分析对象 原文证据 对解释结果的意义
语料筛选二元检测器 测试 16,708 窗;precision 96.52%,recall 97.99% 高可靠性筛选,不保证低信噪比哨声完整覆盖
WMMSD 二元片段检查 无重新训练,F1 = 0.904 外部检查针对二元筛选器,不是类型分类模型
WMMSD 海豚科 / 清晰噪声代理检查 无重新训练,F1 = 0.907 代理任务与正式七类检测任务不同
DCLDE 代理子集检查 无重新训练,F1 = 0.966 不足以证明类型表示跨地点迁移
专家子集质量 8,354 声;平均 SNR 13.24 dB;平均时长 0.84 秒 偏向清晰样本,不能代表完整噪声分布
类型混淆 附录 D 指出 Nana 与 Yosefa 的 SW 更易混淆;未给可读数值 相近轮廓和类内变异仍是困难来源

关键发现

  • 一般生物声学表示明显优于手工特征,领域内预训练在此协议下又进一步提升,但模型架构、预训练来源和算力并未被单独控制。
  • AVES-bio 分类强于 BioLingual,检测却弱于 BioLingual;不存在一个现成模型在两项任务上都占优。
  • 高分类准确率不等于正确识别每个发声者,更不等于推断哨声含义;本文评价的是声学类别。
  • 二元检测器的外部 F1 与下游七类检测 mAP 描述不同任务,不能合并成一个跨域性能结论。

亮点与洞察

  • 将“单物种深度”而非“跨物种数量”作为资源价值的核心。序列上下文与已知群体历史使未来研究可以考察时间变化,而不只是给孤立声音分类。
  • 先自动筛选、再轮廓归类、最后专家纠错,把人工判断用在最需要细粒度知识的地方。方法值得迁移到其他高频动物声音,但筛选器的遗漏必须进入数据偏差说明。
  • 冻结表示加简单线性探测降低下游头容量带来的混淆。其结果有助于判断表示是否可直接使用,但不能取代端到端微调或严格未见来源评估。

局限与展望

  • 数据来自一个地点和小群体,含间歇来访个体,且时间覆盖不均、2022 年缺失。跨地点、跨群体和跨年份泛化仍需要独立验证。
  • 专家标签只覆盖约 5 个月,类别高度不平衡,部分不足 100 个样本。六类均衡分类不是对完整十类自然分布的性能评估。
  • 专家集偏向清晰、少重叠声音,而预训练集保留复杂环境。需增加低信噪比、重叠、稀有类及长时连续流的分层评估,才能连接受控分数与实际监测效用。
  • 下游会话级分离是优点,但预训练与测试来源是否重叠未被说明。建议增加严格排除测试会话的预训练设置,与允许无标签目标域音频的设置分别报告。
  • 正文的序列范围 5–246 秒与附录的 2–20 秒保留规则需进一步澄清;44.1 kHz 模型输入的具体处理细节也未完整给出。
  • 作者提出扩充长期专家标签并整合视频和行为上下文;在这些监督与专门评估建立之前,不能将本基准称为海豚语言解码。

相关工作与启发

  • vs BirdSet / BEANS:这些资源强调广覆盖分类或标准化动物声音任务,OpenWhistle 强调已知个体群体的长期种内结构。两者互补,本文并未证明小群体领域预训练普遍优于所有广覆盖模型。
  • vs DOLPHINFREE / DCLDE:已有资源有较小规模的哨声或轮廓数据,OpenWhistle 的优势在于原始音频规模、序列上下文和开放评估。其外部检测检查仍只是代理任务,不是统一标签空间的全面比较。
  • vs AVES / BioLingual:通用动物声音预训练提供有效迁移起点,OpenWhistle 训练的 Wav2Vec2.0 在本基准更强。若要归因于领域数据本身,应使用相同架构与预算,只改变预训练语料。
  • 研究线索:按年份留出并严格排除对应预训练会话,可检验声学漂移而非重复环境记忆;对罕见类型与低信噪比片段开展主动学习,可减少专家标注量。两者是后续实验建议,不是论文已验证的结果。

评分

  • 新颖性: 4/5 — 开放、纵向、单群体深度语料的组合有价值,模型本身主要沿用已有方法。
  • 实验充分度: 4/5 — 有统一线性探测、多种基线及外部筛选器检查,但缺少严格预训练来源隔离与受控消融。
  • 写作质量: 4/5 — 任务边界清楚,附录提供实现信息,仍有最强基线叙述与序列长度口径冲突。
  • 价值: 4/5 — 为海豚声学表示学习提供实用起点,语义理解与跨群体推广仍待建立证据。