今日论文合集:cs.SD语音50篇,eess.AS音频处理50篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】Cross-Attention is Half Explanation in Speech-to-Text Models
标题:交叉注意只是语音到文本模型中的一半解释
链接:https://arxiv.org/abs/2509.18010

摘要:交叉注意是编码器-解码器体系结构中的核心机制,广泛存在于包括语音到文本(S2 T)处理在内的许多领域。它的分数已经被重新用于各种下游应用程序-例如时间戳估计和音频文本对齐-假设它们反映了输入语音表示和生成的文本之间的依赖关系。虽然注意机制的解释性质已经在更广泛的NLP文献中进行了广泛的辩论,但这一假设在言语领域中仍然很大程度上未被探索。为了解决这一差距,我们通过将交叉注意力的分数与从特征属性导出的输入显着性图进行比较,评估S2 T模型中交叉注意力的解释力。我们的分析涵盖了多个尺度的单语和多语言,单任务和多任务模型,并表明注意力得分与基于显着性的解释中度到强烈一致,特别是当跨头部和层聚合时。然而,它也表明,交叉注意力只捕获了大约50%的输入相关性,并且在最好的情况下,只部分反映了解码器如何关注编码器的表示-仅占显着性的52-75%。这些发现揭示了将交叉注意解释为解释性代理的基本局限性,表明它提供了一个信息丰富但不完整的观点,即S2 T模型中驱动预测的因素。


【2】WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
标题:WenetSpeech-Chuan:一个具有丰富注释的大型四川方言语音库
链接:https://arxiv.org/abs/2509.18004

备注:4 pages, 5 figures, 4 tables
摘要:方言的大规模开源数据的稀缺严重阻碍了语音技术的进步,对于广泛使用的四川方言来说,这一挑战尤为严峻。为了解决这一关键差距,我们介绍了WenetSpeech-Chuan,这是一个10,000小时的,使用我们的小说Chuan-Pipeline构建的注释丰富的语料库,这是一个完整的方言语音数据处理框架。为了便于严格的评估和证明语料库的有效性,我们还发布了高质量的ASR和TTS基准测试,WenetSpeech-Chuan-Eval,手动验证transmittance。实验表明,在WenetSpeech-Chuan上训练的模型在开源系统中达到了最先进的性能,并展示了与商业服务相当的结果。作为最大的四川方言开源语料库,文音语音不仅降低了方言语音处理研究的门槛,而且在促进人工智能公平和减轻语音技术偏见方面发挥了至关重要的作用。语料库、基准、模型和收据都可以在我们的项目页面上公开获得。


【3】Does Audio Matter for Modern Video-LLMs and Their Benchmarks?
标题:音频对现代视频法学硕士及其基准很重要吗?
链接:https://arxiv.org/abs/2509.17901

备注:5 pages, 2 figures, under review. Project page: this https URL
摘要:现代多模态大型语言模型通常声称“视频理解”,但大多数评估使用静音视频或简单地丢弃音频。我们提出了一个直接的问题:音频对当代视频LLM和认证它们的基准有多大影响?我们审计了广泛使用的套件,并观察到许多项目甚至可以从单个帧中解决,从而使音频在很大程度上冗余。在LLaVA-OneVision架构的基础上,我们附加了一个语音/音频编码器(例如,Whisper)并分析音频何时起作用,同时使用基于Mamba的轻量级状态空间令牌压缩器解决音频令牌爆炸问题。我们发现,音频在最近的视频基准测试中获得的收益最小,但对策划的音频敏感子集具有决定性作用。为了实现可靠的评估,我们发布了AVQA-Hard和Music-AVQA-Hard,我们的模型和代码。我们的研究结果表明,当前的学术实践与现实世界的期望之间存在越来越大的差距,并为可扩展的视听视频LLM提供了实用的工具。我们将在https://github.com/naver-ai/LLaVA-AV-SSM上完全开源我们的工作。


【4】Brainprint-Modulated Target Speaker Extraction
标题:脑纹调制目标说话人提取
链接:https://arxiv.org/abs/2509.17883

备注:5 pages, 2 figures, conference
摘要:在神经操纵的目标说话人提取(TSE)中实现稳健和个性化的性能仍然是下一代助听器的重大挑战。这主要是由于两个因素:EEG信号跨会话的固有非平稳性,以及限制广义模型功效的高受试者间变异性。为了解决这些问题,我们提出了脑纹调制的目标说话人提取(BM-TSE),个性化和高保真提取的新框架。BM-TSE首先采用具有自适应谱增益(ASG)模块的时空EEG编码器来提取对非平稳性有弹性的稳定特征。我们的框架的核心是一个个性化的调制机制,其中一个统一的脑图嵌入学习主题识别(SID)和听觉注意解码(AAD)任务的联合监督下。这个学习的脑图,编码静态用户特征和动态注意力状态,积极地改进音频分离过程,动态地为每个用户定制输出。对公开的KUL和Cocktail Party数据集的评估表明,BM-TSE实现了最先进的性能,显著优于现有方法。我们的代码可在https://github.com/rosshan-orz/BM-TSE上公开访问。


【5】Convolutional Neural Network Optimization for Beehive Classification Using Bioacoustic Signals
标题:利用生物声学信号进行蜂巢分类的卷积神经网络优化
链接:https://arxiv.org/abs/2509.17800

摘要:蜜蜂的行为是一个重要的生态现象,不仅在蜂蜜和蜂蜡生产方面,而且由于周围的动植物的繁殖,研究这一重要现象的最佳方法是通过非侵入性监测蜂巢,使用各种身体运动产生的声音,发出音频信号,可以用于与上述目标相关的各种预测。本研究探讨了卷积神经网络的应用,以分类和监测不同的蜂巢状态的帮助下,联合时间和频率的图像表示,如频谱图,梅尔频谱图,平滑频谱图,和余弦图。我们的研究结果表明,Coordinagram优于所有其他表示,在看不见的数据上实现了98.31%的准确性。此外,我们采用了各种策略,包括修剪,量化和知识蒸馏来优化网络并防止模型大小的任何潜在问题。通过这些优化,网络规模降低了91.8%,推理时间加快了66%,提高了其对实时应用的适用性。因此,我们的研究强调了使用优化方法来最大限度地减少模型大小,避免部署问题,加快实时应用的推理以及选择适当的时频表示以获得最佳性能的重要性。


【6】AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
标题:AuditoryBench++:语言模型可以在没有听力的情况下理解听觉知识吗?
链接:https://arxiv.org/abs/2509.17641

备注:Preprint
摘要:即使没有直接听到声音,人类也可以毫不费力地推理听觉特性,如音高,响度或声源关联,利用听觉常识。相比之下,语言模型往往缺乏这种能力,限制了它们在多模态交互中的有效性。作为解决这一差距的第一步,我们提出了AuditoryBench++,这是一个用于在纯文本环境中评估听觉知识和推理的全面基准。该基准测试包括从基本的听觉比较到基于上下文的推理的任务,从而能够对模型如何处理和集成听觉概念进行细粒度分析。此外,我们引入了AIR-CoT,一种新的听觉想象推理方法,通过特殊标记和知识注入的跨度检测,在推理过程中产生和整合听觉信息。最近LLM和多模态LLM的广泛实验表明,AIR-CoT通常优于现成的模型和那些增强了听觉知识的模型。该项目的网页可在https://auditorybenchpp.github.io上查阅。


【7】Audio Super-Resolution with Latent Bridge Models
标题:基于潜桥模型的音频超分辨率
链接:https://arxiv.org/abs/2509.17609

备注:Accepted at NeurIPS 2025
摘要:音频超分辨率(SR),即,将低分辨率(LR)波形上采样到高分辨率(HR)版本,最近已经利用扩散和桥接模型进行了探索,而先前的方法由于其先前的无信息生成而经常遭受次优上采样质量。为了实现高质量的音频超分辨率,我们提出了一种具有潜在桥模型(LBM)的新系统,在该系统中,我们将音频波形压缩到连续的潜在空间中,并设计LBM以实现自然匹配LR到HR上采样过程的潜在到潜在生成过程,从而充分利用LR波形中包含的指导性先验信息。尽管HR样本的可用性有限,但为了进一步增强训练结果,我们引入了频率感知的LBM,其中先验和目标频率作为模型输入,使LBM能够在训练阶段显式学习任意到任意的上采样过程。此外,我们设计了级联LBM,并提出了两个先前的增强策略,其中我们首次尝试解锁超过48 kHz的音频上采样,并授权无缝级联SR过程,为音频后期制作提供更高的灵活性。在VCTK、ESC-50、Song-Describer基准数据集和两个内部测试集上评估的综合实验结果表明,我们在语音、音频和音乐信号中实现了任意到48 kHz SR的最先进的客观和感知质量,并创下了任意到192kHz音频SR的第一个记录。https://AudioLBM.github.io/


【8】Attention-based Mixture of Experts for Robust Speech Deepfake Detection
标题:基于注意力的专家混合用于鲁棒的语音深度伪造检测
链接:https://arxiv.org/abs/2509.17585

备注:Accepted @ IEEE WIFS 2025
摘要:人工智能生成的语音越来越多地用于日常生活中,为虚拟助手、辅助工具和其他应用程序提供动力。但是,它也被用于恶意目的,如模仿,错误信息和生物识别欺骗。随着语音深度伪造变得几乎无法与真实的人类语音区分开来,对鲁棒的检测方法和有效的对策的需求变得非常迫切。在本文中,我们介绍了ISPL在IH&MMSec 2025上提交的SAFE挑战,我们的系统在所有任务中排名第一。我们的解决方案引入了一种基于混合专家架构的音频deepfake检测新方法。所提出的系统利用多个国家的最先进的检测器,通过基于注意力的门控网络,动态加权每个专家的输入语音信号的基础上,结合他们的输出。在这种设计中,每个专家通过学习通过归纳偏差捕获相同输入的不同互补方面,从而对共享训练数据形成专业化的理解。实验结果表明,我们的方法优于现有的方法在多个数据集。我们进一步评估和分析我们的系统在安全挑战的性能。


【9】Virtual Consistency for Audio Editing
标题:音频编辑的虚拟一致性
链接:https://arxiv.org/abs/2509.17219

摘要:自由形式的基于文本的音频编辑仍然是一个持续的挑战,尽管基于反转的神经方法取得了进展。目前的方法依赖于缓慢的反演过程,限制了它们的实用性。我们提出了一个基于虚拟一致性的音频编辑系统,通过适应扩散模型的采样过程绕过反转。我们的管道是模型不可知的,不需要微调或架构更改,并且在最近的神经编辑基线上实现了大幅加速。至关重要的是,它在不影响质量的情况下实现了这一效率,这一点已经通过定量基准和涉及16名参与者的用户研究得到了证明。


【10】STAR: Speech-to-Audio Generation via Representation Learning
标题:STAR:通过表示学习生成语音到音频
链接:https://arxiv.org/abs/2509.17164

摘要:这项工作提出了STAR,第一个端到端的语音到音频生成框架,旨在提高效率和解决级联系统中固有的错误传播。与依赖于文本或视觉的先前方法不同,STAR利用语音,因为它构成了一种自然的交互方式。作为验证系统可行性的第一步,我们通过表示学习实验证明,可以有效地从原始语音中提取口语声音事件语义,捕获听觉事件和场景线索。利用语义表示,STAR结合了用于表示映射的桥接网络和两阶段训练策略来实现端到端合成。由于语音处理延迟减少了76.9%,STAR显示出优于级联系统的生成性能。总的来说,STAR将语音建立为音频生成的直接交互信号,从而桥接了表征学习和多模态合成。生成的示例可在https://zeyuxie29.github.io/STAR上获得。


【11】FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
标题:FakeSound 2:可解释和可概括的Deepfake声音检测的基准
链接:https://arxiv.org/abs/2509.17162

摘要:生成音频的快速发展引发了来自伪造数据的道德和安全问题,使得deepfake声音检测成为防止恶意使用此类技术的重要保障。虽然以前的研究已经探讨了这一任务,现有的方法主要集中在二进制分类,并在解释如何操纵发生,追查来源起源,或概括看不见的来源,从而限制了可解释性和可靠性的检测不足。为了解决这些局限性,我们提出了FakeSound2,这是一个旨在将deepfake声音检测提升到二进制精度之外的基准。FakeSound2在三个维度上评估模型:本地化,可追溯性和泛化,涵盖6种操作类型和12种不同的来源。实验结果表明,虽然目前的系统实现了很高的分类精度,他们很难识别伪造的模式分布,并提供可靠的解释。通过强调这些差距,FakeSound2建立了一个全面的基准,揭示了关键挑战,旨在促进可靠的音频认证的强大,可解释和可推广的方法。


【12】RISE: Adaptive music playback for Realtime Intensity Synchronization with Exercise
标题:RISE:自适应音乐播放,实现与锻炼的实时强度同步
链接:https://arxiv.org/abs/2509.17112

备注:ISMIR 2025
摘要:我们提出了一个系统,以适应用户的音乐,以他们的锻炼对齐高能量的音乐片段与激烈的锻炼间隔。在运动时听音乐可以提高动力和表现。然而,音乐的结构可能与用户的自然休息和工作阶段不同,导致用户在等待激励部分时休息的时间比需要的时间长,或者如果部分结束得太快,则在工作中失去动力。为了解决这个问题,我们的系统,称为RISE,自动估计音乐中的激烈片段,并使用基于组件的音乐重排技术来动态扩展和缩短用户歌曲的不同片段,以适应正在进行的锻炼。我们的系统将休息和工作持续时间作为输入来指导适应。目前,这是通过预定义的计划或在锻炼期间手动输入来确定的。我们评估了12名参与者的RISE,并将我们的系统与实验室中锻炼时的非适应性音乐基线进行了比较。参与者发现,我们的重新安排保持了强度估计的准确性,许多人回忆起强度调整帮助他们完成锻炼的时刻。


【13】SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
标题:SVeritas:不同条件下稳健说话人验证的基准
链接:https://arxiv.org/abs/2509.17091

备注:Accepted to EMNLP 2025 Findings
摘要:说话人验证(SV)模型越来越多地集成到安全、个性化和访问控制系统中,但它们对许多现实挑战的鲁棒性仍然没有得到充分的基准测试。这些包括各种自然和恶意创建的条件,导致信号降级或注册和测试数据之间的不匹配,从而影响性能。现有的基准只评估这些条件的子集,完全忽略了其他条件。我们介绍了SVeritas,一个全面的扬声器验证任务基准套件,评估SV系统的压力源,如录音持续时间,自发性,内容,噪声,麦克风距离,混响,通道不匹配,音频带宽,编解码器,扬声器年龄,以及对欺骗和对抗性攻击的敏感性。虽然确实存在几个基准,每个基准都涵盖了其中的一些问题,但SVeritas是第一个全面的评估,不仅包括所有这些问题,而且还包括其他几个全新的,但仍然重要的,以前没有基准的现实生活条件。我们使用SVeritas来评估几个最先进的SV模型,并观察到,虽然一些架构在常见的失真下保持稳定性,但在涉及跨语言试验,年龄不匹配和编解码器引起的压缩的情况下,它们的性能会大幅下降。将我们的分析扩展到人口统计学亚组,我们进一步确定了年龄组,性别和语言背景之间的鲁棒性差异。通过在真实和合成压力条件下对评估进行标准化,SVeritas能够精确诊断模型的弱点,并为推进公平可靠的说话人验证系统奠定基础。


【14】Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
标题:Sidon:快速稳健的开源多语言语音恢复,用于大规模数据集清理
链接:https://arxiv.org/abs/2509.17052

备注:5 pages, 1 figures
摘要:大规模的文本到语音(TTS)系统受到缺乏干净的多语言录音的限制。Sidon是一种快速的开源语音恢复模型,它可以将嘈杂的野外语音转换为工作室质量的语音,并扩展到数十种语言。Sidon由两种型号组成:w2 v-BERT 2.0微调特征预测器,从嘈杂的语音中清除特征,声码器经过训练,从清除的特征中合成恢复的语音。Sidon实现了与Miipher相当的恢复性能:Google的内部语音恢复模型,旨在为语音合成进行数据集清理。Sidon的计算效率也很高,在单个GPU上的运行速度比实时快3,390倍。我们进一步表明,训练TTS模型使用西顿清洗自动语音识别语料库提高了合成语音的质量在zero-shot设置。发布代码和模型,以促进研究社区的可重复数据集清理。


【15】VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
标题:VA Inpaint:具有LLM驱动模块的Zero-Shot视频-音频修复框架
链接:https://arxiv.org/abs/2509.17022

摘要:针对混合视听内容的视频和音频修复已成为多媒体编辑中的一项重要任务。然而,从视频中精确地移除对象及其对应的音频而不影响场景的其余部分仍然是一个重大挑战。为了解决这个问题,我们提出了VAInpaint,这是一种新的管道,它首先利用分割模型来生成遮罩,并引导视频修复模型去除对象。与此同时,LLM然后在全局上分析场景,而特定于区域的模型提供本地化的描述。整体和区域描述都将输入到LLM中,LLM将细化内容并将其转换为文本查询,用于我们的文本驱动音频分离模型。我们的音频分离模型在定制的数据集上进行了微调,该数据集包括分割的MUSIC乐器图像和VGGSound背景,以增强其泛化性能。实验表明,我们的方法达到性能媲美当前的基准在音频和视频修复。


【16】Bridging the gap between training and inference in LM-based TTS models
标题:弥合基于LM的TTC模型中训练和推理之间的差距
链接:https://arxiv.org/abs/2509.17021

备注:5 pages, 4 figures
摘要:文本到语音(TTS)的最新进展表明,基于语言模型(LM)的系统提供了有竞争力的性能相比,传统的方法。然而,在训练中,TTS模型使用地面实况(GT)标记作为前缀来预测下一个标记,而在推理中这些标记不可用,这是训练和推理之间的差距,经常被忽视。在这项研究中,我们提出了一个基于LM-TTS系统的混合训练方案,以减轻曝光偏差。我们的核心思想是采用一种混合训练范式,将教师强迫与自由运行相结合,从而将自我生成的令牌引入训练过程。这使得训练模式与推理更加一致,减少了训练-推理差距。此外,我们在训练过程中加入了EOS预测机制,以检测不正确的序列终止并自适应地控制自由运行过程。实验结果提供了一个全面的评价曝光偏差的影响LM为基础的TTS,并证明我们的方法有效地缩小了训练推理的差距,从而提高合成的长格式语音的质量。


【17】MBCodec:Thorough disentangle for high-fidelity audio compression
标题:MBCodec:彻底理清高保真音频压缩
链接:https://arxiv.org/abs/2509.17006

备注:5 pages, 2 figures
摘要:文本到语音(TTS)中的高保真神经音频编解码器旨在将语音信号压缩为离散表示以进行忠实重建。然而,先前的方法在有效地解开令牌内的声学和语义信息方面面临挑战,导致合成语音中缺乏细粒度的细节。在这项研究中,我们提出了MBCodec,一种新的多码本音频编解码器的基础上残差矢量量化(RVQ),学习分层结构的表示。MBCodec利用来自原始信号的自监督语义标记化和音频子带特征来构建功能上分离的潜在空间。为了鼓励跨编解码器嵌入空间的各个层的全面学习,我们引入自适应丢弃深度来跨层差分训练码本,并且在训练期间采用多通道伪正交镜像滤波器(PQMF)。通过彻底解耦语义和声学特征,我们的方法不仅实现了近乎无损的语音重建,而且还实现了24 kHz音频的170倍压缩,导致低比特率仅为2.2 kbps。实验性评价证实,在所有评价中,该方案的业绩始终大大优于基线。


【18】Advancing Speech Understanding in Speech-Aware Language Models with GRPO
标题:使用GRPO推进语音感知语言模型中的语音理解
链接:https://arxiv.org/abs/2509.16990

摘要:在本文中,我们介绍了一种基于组相对策略优化(GRPO)的方法,用于在开放格式的语音理解任务(如口语提问和自动语音翻译)上训练语音感知大语言模型(SALLM)。SALLM已被证明对于语音理解任务非常有效。GRPO最近因其在培训LLM方面的效率而获得了牵引力,并且先前的工作已经探索了其在SALLM中的应用,主要是在多项选择任务中。在此基础上,我们专注于更好地反映模型生成能力的开放式任务。我们的方法利用GRPO与BLEU作为奖励信号来优化SALLM,并且我们根据经验证明,它在几个关键指标上超过了标准SFT。最后,我们探讨了在GRPO内为这些任务纳入政策外样本的潜力,强调了进一步改进和进一步研究的途径。


【19】Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners
标题:利用多个语音增强器对听力受损的听众进行非侵入性可理解度预测
链接:https://arxiv.org/abs/2509.16979

摘要:听力受损(HI)听众的语音清晰度评估对于评估助听器性能至关重要,传统上依赖于听力测试或HASPI等侵入性方法。然而,这些方法需要干净的参考信号,这在现实世界的条件下往往是不可用的,从而在基于实验室的评估和现实世界的评估之间产生了差距。为了解决这个问题,我们提出了一个非侵入性的可懂度预测框架,该框架利用语音增强器来提供并行的增强信号路径,从而在没有参考信号的情况下实现鲁棒的预测。我们评估了三种最先进的增强子,并证明了预测性能取决于增强子的选择,强增强子的集合产生最好的结果。为了提高跨数据集的泛化能力,我们引入了一个2-clips增强策略,该策略增强了特定于数据集的变异性,提高了对未知数据集的鲁棒性。我们的方法在多个数据集上的性能始终优于非侵入性基线CPC 2 Champion,突出了增强器引导的非侵入性可懂度预测在现实世界应用中的潜力。


【20】Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
标题:通过多模式LLM的思维链差异-共性推理进行可解释音频编辑评估
链接:https://arxiv.org/abs/2509.16975

摘要:自动平均意见评分(MOS)预测为客观指标提供了一种更感性的替代方案,为评估模型提供了更深入的见解。随着多模态大语言模型(MLLM)的快速发展,其增强的感知和推理能力使音频质量评估更加全面和可解释。在这项工作中,我们解决了具有挑战性的任务,音频编辑评估,并提出了第一个基于自然语言的自动化评估框架,建立在MLLM。我们的方法引入了两个微调任务来提高多音频理解,结合思想链提示和轻量级指令调整,以增强逐步推理。实验表明,我们的框架提供了准确的,可解释的,基于文本的编辑评估,与人类的判断和客观指标密切相关,同时大大提高了基线。代码和演示可在https://github.com/NKU-HLT/Eval_Reasoning上获得。


【21】AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
标题:AudioGenie-Reasoner:一个用于从粗到细音频深度推理的免训练多代理框架
链接:https://arxiv.org/abs/2509.16971

摘要:音频深度推理是一项具有挑战性的任务,需要专家级的感知,多步逻辑推理和上下文知识的整合。然而,现有的模型遭受音频感知和推理能力之间的差距,由于缺乏明确的推理链的训练数据和缺乏主动探索和迭代改进的机制。为了应对这些挑战,我们提出了AudioGenie-Reasoner(AGR),这是第一个统一的无训练多智能体系统,它在不断发展的文本证据链上协调感知和推理。我们的关键思想是一种范式转变,从一个新的角度将音频深度推理转换为复杂的文本理解任务,从而释放大型语言模型的全部潜力。具体来说,AGR的设计模仿了人类从粗到精的认知过程。它首先将输入音频转换为粗糙的基于文本的文档。然后,我们设计了一个新的主动迭代文档细化循环,具有工具增强的路线和专门的代理,不断搜索缺失的信息,并以粗到细的方式增强证据链,直到收集到足够的问题相关信息进行最终预测。实验结果表明,AGR在各种基准测试中实现了现有开源音频深度推理模型的最先进(SOTA)性能。该代码将公开提供。


【22】Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
标题:多通道音频对齐的交叉注意和置信加权
链接:https://arxiv.org/abs/2509.16926

备注:Accepted on Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE 2025)
摘要:多通道音频对齐是生物声学监测、空间音频系统和声学定位中的关键要求。然而,现有的方法往往难以解决非线性时钟漂移,缺乏量化不确定性的机制。传统的方法,如互相关和动态时间弯曲假设简单的漂移模式,并提供没有可靠性措施。与此同时,最近的深度学习模型通常将对齐视为二进制分类任务,忽略了通道间的依赖性和不确定性估计。我们介绍了一种方法,结合交叉注意机制与信任加权评分,以提高多通道音频同步。我们扩展了BEAT编码器与交叉注意层,以模拟通道之间的时间关系。我们还开发了一个置信加权评分函数,使用完整的预测分布,而不是二进制阈值。我们的方法在BioDCASE 2025任务1挑战中获得了第一名,测试数据集的MSE平均值为0.30,而深度学习基线为0.58。在单个数据集上,我们在ARU数据上实现了0.14 MSE(减少77%),在斑胸草雀数据上实现了0.45 MSE(减少18%)。该框架支持概率时间对齐,超越点估计。虽然在生物声学背景下进行了验证,但该方法适用于更广泛的多通道音频任务,其中对准置信度至关重要。代码可在:https://github.com/Ragib-Amin-Nihal/BEATsCA上获得


【23】Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
标题:视听导航的音频引导动态模式融合和立体感知注意力
链接:https://arxiv.org/abs/2509.16924

备注:Main paper (14 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025
摘要:在视听导航(AVN)任务中,一个具体的代理必须自主定位声源在未知的和复杂的3D环境的基础上的视听信号。现有的方法往往依赖于静态模态融合策略,忽略了嵌入在立体声音频的空间线索,导致性能下降,在混乱或闭塞的场景。为了解决这些问题,我们提出了一个端到端的基于强化学习的AVN框架,该框架具有两个关键创新:(1)\textbf{S}立体感知\textbf{A}注意力\textbf{M}感知(\textbf{SAM}),它学习并利用左右音频通道之间的空间差异来增强方向性声音感知;以及(2)\textbf{A}udio-\textbf{G}uided \textbf{D}听觉\textbf{F}感知模块(\textbf{AGDF}),其基于音频线索动态地调整视觉和听觉特征之间的融合比率,从而提高对环境变化的鲁棒性。在两个真实的3D场景数据集上进行了大量的实验,证明了我们的方法在导航成功率和路径效率方面显着优于现有的方法。值得注意的是,与性能最佳的基线相比,我们的模型在仅音频条件下实现了超过40%的改进。这些结果突出了从立体声通道明确建模空间线索和执行深度多模态融合以实现鲁棒和高效的视听导航的重要性。


【24】PGSTalker: Real-Time Audio-Driven Talking Head Generation via 3D Gaussian Splatting with Pixel-Aware Density Control
标题:PGSTalker:通过3D高斯飞溅和Pixel-Aware密度控制生成实时音频驱动的说话头
链接:https://arxiv.org/abs/2509.16922

备注:Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025
摘要:音频驱动的说话头部生成对于虚拟现实、数字化身和电影制作中的应用至关重要。虽然基于NeRF的方法能够实现高保真重建,但它们存在渲染效率低和次优视听同步的问题。本文提出了一种基于3DGS(3D Gaussian Splatting)的实时音频驱动的说话头合成框架PGSTalker。为了提高渲染性能,我们提出了一个像素感知的密度控制策略,自适应地分配点密度,增强动态面部区域的细节,同时减少其他地方的冗余。此外,我们引入了一个轻量级的多模态门控融合模块,有效地融合音频和空间特征,从而提高高斯变形预测的准确性。在公共数据集上进行的大量实验表明,PGSTalker在渲染质量、唇同步精度和推理速度方面优于现有的基于NeRF和3DGS的方法。我们的方法具有很强的泛化能力和实际部署的潜力。


【25】Difficulty-Aware Score Generation for Piano Sight-Reading
标题:钢琴视读的难度感知乐谱生成
链接:https://arxiv.org/abs/2509.16913

摘要:使学习材料适应学生的技能水平在教育中很重要。在音乐训练的背景下,一个基本的能力是视奏-第一眼就演奏不熟悉的乐谱-这得益于渐进和水平适当的练习。然而,创建适当难度的练习需要大量的时间和精力。我们解决这一挑战作为一个控制的符号音乐生成任务,旨在产生一个理想的难度水平的钢琴乐谱。通过条件作用控制符号生成通常使用控制令牌来完成,但这些并不总是对全局属性(如难度)有明显的影响。为了改善条件反射,我们引入了一个辅助优化目标来进行难度预测,这有助于防止条件反射崩溃--这是一个常见的问题,在没有明确监督的情况下,模型会忽略控制信号。这个辅助目标帮助模型学习与目标难度一致的内部表示,从而实现更精确和自适应的分数生成。自动度量和专家判断的评估显示出更好的控制难度和潜在的教育价值。我们的方法代表了个性化的音乐教育,通过困难意识的实践材料的生成的一步。


【26】Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
标题:鼓声打击乐声音转换及其评价方法
链接:https://arxiv.org/abs/2509.16862

备注:6 pages, 5 figures, accepted for 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)
摘要:本文定义了鼓到人声打击(VP)的声音转换的新任务。VP通过人类发声来模仿打击乐器,并经常在当代无伴奏合唱音乐中使用。它表现出与语音和歌唱不同的声学特性(例如,非周期性、噪声瞬变和语言结构的缺失),使得传统的语音或歌唱合成方法不适用。因此,我们制定VP合成作为一个从鼓的声音音色转移问题,利用他们的节奏和音色的对应。为了支持这一提法,我们定义了成功转换的三个要求:节奏的保真度,音色的一致性,和自然的VP。我们还提出了相应的主观评价标准。我们实现了两个基线转换方法,使用神经音频合成器,实时音频变分自动编码器(RAVE),有和没有矢量量化(VQ)。主观实验表明,这两种方法产生合理的VP输出,与基于VQ的RAVE模型产生更一致的转换。


【27】The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology
标题:声音的声音:言语病理学语言模型的微调和综合评估
链接:https://arxiv.org/abs/2509.16765

备注:EMNLP 2025 Oral Presentation
摘要:根据美国国立卫生研究院的数据,超过340万儿童患有需要临床干预的言语障碍。言语语言病理学家的人数大约是受影响儿童人数的20倍,这突出表明儿童护理方面存在重大差距,迫切需要技术支持,以提高言语语言病理学家的工作效率。最先进的多模态语言模型(MLM)显示出支持SLP的前景,但它们的使用仍然未被充分探索,主要是由于对它们在高风险临床环境中的性能的了解有限。为了解决这一差距,我们与领域专家合作,开发了一个语音语言病理学中MLMs真实用例的分类。在此分类的基础上,我们引入了第一个全面的基准,用于评估五个核心用例中的MLM,每个用例包含1,000个手动注释的数据点。该基准测试包括各种设置下的鲁棒性和灵敏度测试,包括背景噪音、说话者性别和口音。我们对15个最先进的多层模型的评估表明,没有一个模型在所有任务中始终优于其他模型。值得注意的是,我们发现了系统性的差异,模型在男性说话者身上表现更好,并观察到思维链提示可以降低具有大标签空间和窄决策边界的分类任务的性能。此外,我们研究了对特定领域数据进行微调的MLMs,与基础模型相比,改进了30%以上。这些发现突出了当前MLMs在语音语言病理学应用中的潜力和局限性,强调了进一步研究和有针对性的开发的必要性。


【28】Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
标题:非典型语音识别的独特建模与规范建模:结构障碍案例研究
链接:https://arxiv.org/abs/2509.16718

备注:Will appear in EMNLP 2025 Main Proceedings
摘要:最先进的自动语音识别(ASR)模型,如Whisper,在非典型语音上表现不佳,例如由构音障碍患者产生的语音。过去的作品,非典型语音大多研究完全个性化(或特质)的模型,但建模策略,既可以概括和处理特质可以更有效地捕捉非典型语音。为了研究这一点,我们比较了四种策略:(a)在典型语音上训练的$\textit{normal}$模型(无个性化),(b)完全个性化的$\textit{idiosyncratic}$模型,(c)在其他构音障碍说话者上训练的$\textit{dysarthric-normal}$模型,和(d)$\textit{dysarthric-idiosyncratic}$模型,通过在适应个人语音之前首先建模规范模式来组合策略。在本案例研究中,我们发现构音障碍-特质模型的性能优于特质方法,同时需要不到一半的个性化数据(128个训练大小的WER为36.43,256个为36.99)。此外,我们发现单独调整语音编码器(与LM解码器相反)产生了最好的结果,平均将字错误率从71%降低到32%。我们的研究结果强调了利用规范(跨扬声器)和特质(扬声器特定)模式来改善代表性不足的语音人群的ASR的价值。


【29】Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
标题:Speech-to-See:端到端语音驱动的开放集对象检测
链接:https://arxiv.org/abs/2509.16670

摘要:音频接地或语音驱动的开集对象检测旨在直接从语音中定位和识别对象,从而实现超出预定义类别的泛化。这项任务对于像人机交互这样的应用程序至关重要,因为文本输入是不切实际的。然而,在这一领域的进展面临着一个根本的瓶颈,从大规模的,成对的音频图像数据的稀缺性,并进一步受到以前的方法,依赖于间接的,文本为媒介的管道。在本文中,我们介绍了Speech-to-See(Speech 2See),这是一种建立在预训练和微调范式基础上的端到端方法。具体来说,在预训练阶段,我们设计了一个查询引导的语义聚合模块,该模块采用可学习的查询来将冗余的语音嵌入压缩成紧凑的语义表示。在微调过程中,我们采用了参数高效的LoRA专家混合(MoLE)架构,以实现更深入,更细致的跨模式适应。大量的实验表明,Speech 2See在多个基准测试中具有鲁棒性和自适应性,证明了其强大的泛化能力和广泛的适用性。


【30】On the de-duplication of the Lakh MIDI dataset
标题:关于Lakh Buttons数据集的重复数据消除
链接:https://arxiv.org/abs/2509.16662

备注:The paper has been accepted for publication at ISMIR 2025
摘要:大规模数据集对于训练一个通用的深度学习模型至关重要。大多数这样的数据集是通过从各种互联网资源中抓取来收集的,不可避免地会引入重复的数据。在符号音乐领域,这些重复通常来自多个用户的安排和简单编辑后的元数据更改。然而,尽管存在一些关键问题,例如随机分割期间数据泄漏导致的不可靠的训练评估,但数据集重复在MIR社区中尚未得到广泛解决。本研究调查的数据集重复的问题,在符号音乐领域的最大的公开来源之一,Lakh的数据集(LMD)。为了找到和评估重复数据的最佳检索方法,我们采用了LMD的Clean Rounds子集作为基准测试集,其中相同歌曲的不同版本被分组在一起。我们首先评估了基于规则的方法和以前的符号音乐检索模型的重复数据删除,并研究了基于对比学习的BERT模型与各种增强,以找到重复的文件。因此,我们提出了三种不同版本的LMD过滤列表,在178,561个文件中,在最保守的设置中过滤出至少38,134个样本。


【31】AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
标题:DCASE 2025的AISTA实验室系统Task6:基于语音的音频检索
链接:https://arxiv.org/abs/2509.16649

备注:5 pages, 1 figure, DCASE2025 Task2 technical report
摘要:本报告介绍了AISTAT团队对DCASE 2025任务6中基于语言的音频检索任务的提交。我们提出的系统采用双编码器架构,其中音频和文本模态分别编码,并使用对比学习对齐它们的表示。从前一年挑战的方法学中汲取灵感,我们实施了一种蒸馏方法,并利用大型语言模型(LLM)进行有效的数据增强技术,包括反向翻译和LLM混合。此外,我们还结合了聚类来引入辅助分类任务,以便进一步进行微调。在Clotho开发测试中,我们最好的单个系统达到了46.62的mAP@16,而四个系统的集合达到了48.83的mAP@16。


【32】Barwise Section Boundary Detection in Symbolic Music Using Convolutional Neural Networks
标题:利用卷积神经网络进行符号音乐中的巴氏段边界检测
链接:https://arxiv.org/abs/2509.16566

摘要:目前的音乐结构分析(MSA)方法主要集中在音频数据。虽然符号音乐可以合成到音频中并使用现有的MSA技术进行分析,但这种方法并没有利用符号音乐丰富的音高,计时和乐器的明确表示。MSA的一个关键子问题是部分边界检测-确定是否在一个给定的时间点标记的音乐部分之间的过渡。本文研究了符号音乐的自动分段边界检测问题。首先,我们介绍了一个用于截面边界检测的人工注释的数据集,它由我们从Lakh数据集手动管理的6134个数据文件的元数据组成。第二,我们训练深度学习模型,以分类固定长度音乐窗口内的节边界的存在。我们的数据表示涉及到一种新的编码方案的基础上合成泛音编码成3通道钢琴卷的任意乐器。我们的模型实现了0.77的F1得分,比基于类似音频的监督学习方法和无监督块匹配分割(CBM)音频方法分别提高了0.22和0.31。我们发布数据集、代码和模型。


【33】Etude: Piano Cover Generation with a Three-Stage Approach -- Extract, strucTUralize, and DEcode
标题:练习曲:三阶段方法的钢琴翻唱--提取、结构化和解码
链接:https://arxiv.org/abs/2509.16522

摘要:钢琴翻唱生成的目标是自动将流行歌曲转换为钢琴编曲。虽然已经提出了许多深度学习方法,但现有的模型通常无法与原始歌曲保持结构一致性,这可能是由于缺乏节拍感知机制或难以建模复杂的节奏模式。节奏信息是至关重要的,因为它定义了结构相似性(例如,节奏,BPM),并直接影响所生成的音乐的整体质量。   在本文中,我们介绍了练习曲,一个三阶段的体系结构,包括提取,结构化,和解码阶段。通过预提取节奏信息,并应用一种新颖的,简化的基于REMI的标记化,我们的模型产生的封面,保留适当的歌曲结构,增强流畅性和音乐动态,并通过风格注入支持高度可控的生成。与人类听众的主观评价表明,练习曲大大优于以前的模型,达到了与人类作曲家相当的质量水平。


【34】LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging
标题:LenslessMic:通过Lensless计算成像进行音频加密和认证
链接:https://arxiv.org/abs/2509.16418

备注:Submitted to ICASSP 2026
摘要:随着社会对数字数据共享的日益依赖,敏感信息的保护变得至关重要。加密是保护隐私的方法之一;然而,它在音频领域的实现主要依赖于信号处理或嵌入硬件的软件方法。在本文中,我们介绍了LenslessMic,一种基于硬件的混合光学加密方法,利用无透镜摄像头作为适用于多种类型音频的物理安全层。我们表明,LenslessMic能够实现(1)强大的录音认证和(2)加密强度,可以与256位数字标准的搜索空间相媲美,同时保持高质量的信号和最小的内容信息丢失。该方法通过低成本的Raspberry Pi原型进行了验证,并与数据集一起开源,以促进该领域的研究。


【35】Comparator Loss: An Ordinal Contrastive Loss to Derive a Severity Score for Speech-based Health Monitoring
标题:比较者损失:推导基于言语的健康监测严重性评分的有序对比损失
链接:https://arxiv.org/abs/2509.17661

备注:Submitted to ICASSP 2026. This work is supported by NEURii, a collaborative partnership involving the University of Edinburgh, Gates Ventures, Eisai, LifeArc and Health Data Research UK (HDR UK)
摘要:监测神经退行性疾病的进展在治疗计划和未来药物治疗的评估中具有重要的应用。鉴于目前最先进的语音健康监测技术主要集中在对患者与健康对照进行分类,或预测现实世界的健康指标,我们在这里提出了一种新的疾病进展指标:严重程度评分。这个分数来自一个经过训练的模型,以最小化我们所说的比较器损失。比较器损失确保评分遵循排序关系,该排序关系可以基于诊断、临床注释评分或简单地记录的时间顺序。除了提供比简单的离散分类更详细的情况外,拟议的基于比较损失的系统有可能纳入来自不同健康指标的信息,这对于充分利用小型健康相关数据集至关重要。我们评估了我们提出的模型,基于它们肯定跟踪运动神经元疾病(MND)患者进展的能力,它们的输出与临床注释(如ALSFRS-R)的相关性,以及它们区分MND受试者和健康对照的能力。


【36】SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
标题:SongPrep:全歌曲结构解析和歌词转录的预处理框架和端到端模型
链接:https://arxiv.org/abs/2509.17404

摘要:人工智能生成内容(AIGC)是目前一个热门的研究领域。在其众多的分支中,歌曲生成引起了越来越多的关注。尽管有大量可用的歌曲,有效的数据准备仍然是一个重大挑战。将这些歌曲转换为训练就绪的数据集通常需要大量的手动标记,这既耗时又昂贵。为了解决这个问题,我们提出了SongPrep,一个专门为歌曲数据设计的自动预处理管道。该框架简化了源分离、结构分析和歌词识别等关键过程,产生可直接用于训练歌曲生成模型的结构化数据。此外,我们还介绍了SongPrepE 2 E,这是一个基于预训练语言模型的端到端结构化歌词识别模型。无需额外的源分离,SongPrepE 2 E能够分析整首歌曲的结构和歌词,并提供精确的时间戳。通过利用整首歌曲的上下文以及预训练的语义知识,SongPrepE 2 E在建议的SSLD-200数据集上实现了低的日记错误率(DER)和单词错误率(WER)。下游任务表明,使用SongPrepE 2 E输出的数据训练歌曲生成模型,使生成的歌曲与人类产生的歌曲非常相似。


【37】RADE for Land Mobile Radio: A Neural Codec for Transmission of Speech over Baseband FM Radio Channels
标题:用于陆地移动广播的RADE:用于通过基带FM无线电频道传输语音的神经编解码器
链接:https://arxiv.org/abs/2509.17286

备注:6 pages, 9 figures
摘要:在20世纪90年代,陆地移动无线电(LMR)系统从模拟调频(FM)发展到标准化的数字系统。数字和模拟FM系统现在共存于各种服务中,并表现出类似的语音质量。许多数字无线电的架构保留了传统模拟无线电的模拟FM调制器和解调器,但由多级数字脉冲训练而不是模拟语音信号驱动。我们表示这种架构基带FM(BBFM)。在本文中,我们描述了一种现代机器学习方法,该方法使用自动编码器通过BBFM信道发送高质量的8 kHz带宽语音。的语音质量被证明是优于模拟FM在模拟LMR信道中存在的衰落,和商品UHF无线电系统运行的演示


【38】BeepBank-500: A Synthetic Earcon Mini-Corpus for UI Sound Research and Psychoacoustics Research
标题:BeepBank-500:用于UI声音研究和心理声学研究的合成Earcon迷你数据库
链接:https://arxiv.org/abs/2509.17277

备注:Data note; 6 to 8 pages; 1 to 2 figures; dataset: CC0-1.0; code: MIT
摘要:我们介绍BeepBank-500,一个紧凑的,完全合成的耳标/警报数据集(300-500个剪辑),旨在进行人机交互和音频机器学习的快速,正确的实验。每个片段都是从控制波形族(正弦、方波、三角波、FM)、基频、持续时间、幅度包络、幅度调制(AM)和轻量级Schroeder风格混响的参数配方生成的。我们使用三种混响设置:干燥,两个合成房间表示为“小”(“小”)和“中等”(“中等”)。我们发布了单声道48 kHz WAV音频(16位),丰富的元数据表(信号/频谱特征)和微小的可重现基线,用于(i)波形族分类和(ii)单音f0回归。语料库的目标任务,如耳标分类,音色分析和发病检测,明确规定的许可和限制。音频通过CC 0 -1.0专用于公共领域;代码在MIT下。Data DOI:https://doi.org/10.5281/zenodo.17172015.代码:https://github.com/mandip42/earcons-mini-500。


【39】Reference-aware SFM layers for intrusive intelligibility prediction
标题:用于侵入式可懂度预测的参考感知SFM层
链接:https://arxiv.org/abs/2509.17270

备注:Preprint; submitted to ICASSP 2026. 5 pages. CPC3 system: Dev RMSE 22.36, Eval RMSE 24.98 (ranked 1st)
摘要:利用显式参考信号的侵入式语音可懂度预测器现在很普遍,但它们并没有始终超过非侵入式系统。我们认为,一个主要原因是有限的开发语音基础模型(SFM)。这项工作通过将参考条件与多层SFM表示相结合来重新审视侵入式预测。我们最终的系统在开发集上达到RMSE 22.36,在评估集上达到24.98,在CPC 3上排名第一。这些研究结果为构建基于SFM的侵入式可懂度预测器提供了实际指导。


【40】DeepASA: An Object-Oriented One-for-All Network for Auditory Scene Analysis
标题:DeepASA:一个面向对象的一对多听觉场景分析网络
链接:https://arxiv.org/abs/2509.17247

备注:26 pages, 13 figures, 8 tables, accepted in NeurIPS 2025
摘要:我们提出了DeepASA,这是一种用于听觉场景分析的一对多模型,它在统一的框架内执行多输入多输出(MIMO)源分离,去混响,声音事件检测(SED),音频分类和到达方向估计(DoAE)。DeepASA专为复杂的听觉场景而设计,其中多个通常相似的声源在时间上重叠并在空间上动态移动。为了实现跨任务的鲁棒性和一致性推理,我们引入了面向对象的处理(OOP)策略。这种方法将不同的听觉特征封装到以对象为中心的表示中,并通过推理链(CoI)机制对其进行细化。该流水线包括基于动态时间内核的特征提取器、基于变换器的聚合器和产生每个对象特征的对象分离器。这些特性输入到多个特定于任务的解码器中。我们以对象为中心的表示自然地解决了传统跟踪处理中固有的参数关联模糊性。但是,早期的对象分离可能会导致下游ASA任务失败。为了解决这个问题,我们在推理链中实现了时间相干匹配(TCM),使用估计的听觉参数实现了对象特征的多任务融合和迭代细化。我们在代表性的空间音频基准数据集上评估了DeepASA,包括ASA 2,MC-FUSS和STARSS 23。实验结果表明,我们的模型在所有评估任务中都达到了最先进的性能,证明了它在不同空间听觉场景下的源分离和听觉参数估计的有效性。


【41】DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
标题:DroFiT:一种轻量级的频段融合频率关注实时无人机语音增强
链接:https://arxiv.org/abs/2509.16945

摘要:本文提出了DroFiT(Drone Frequency Lightweight Transformer for Speech Enhancement,DroFiT是一种针对严重无人机自噪声的单麦克风语音增强网络。DroFit集成了一个频率方面的Transformer,一个全/子带混合编码器-解码器和一个TCN后端,用于节省内存的流。具有组合频谱-时间损失的可学习跳门融合进一步细化重建。该模型在VoiceBank-DEMAND上与记录的无人机噪声(-5至-25 dB SNR)混合进行训练,并使用标准语音增强指标和计算效率进行评估。实验结果表明,DroFiT实现了具有竞争力的增强性能,同时显著降低了计算和内存需求,为资源受限的无人机平台上的实时处理铺平了道路。音频演示样本可在我们的演示页面上找到。


【42】Automotive Sound Quality for EVs: Psychoacoustic Metrics with Reproducible AI/ML Baselines
标题:电动汽车的汽车音质:具有可再现AI/ML基线的心理声学测试
链接:https://arxiv.org/abs/2509.16901

摘要:我们为汽车音质提供了一个开放的、可复制的参考,将标准化的心理声学指标与轻量级的AI/ML基线联系起来,特别关注电动汽车(EV)。我们实现了响度(ISO 532-1/2),音调(DIN 45681)和基于调制的描述符(粗糙度,波动强度),并记录了可靠重用的假设和参数化。对于建模,我们使用固定的分割和种子,在合成的EV类病例上提供简单,完全可重复的基线(逻辑回归,随机森林,SVM),报告准确性和等级相关性作为端到端工作流程的示例,而不是比较基准。程序级标准化通过ITU-R BS.1770在LUFS中报告,而心理声学分析使用ISO-532响度(Sones)。所有的图和表都是通过固定环境的脚本重新生成的;代码和最小的音频刺激是在许可证下发布的,以支持教学、复制和扩展到EV特定的噪声现象(例如,逆变器呜呜声、减少的掩蔽)。


【43】Feature Selection via Graph Topology Inference for Soundscape Emotion Recognition
标题:基于图布局推理的声景情感识别特征选择
链接:https://arxiv.org/abs/2509.16760

摘要:对声景的研究已经将环境声学的重点从噪声水平转移到声音的感知上,并结合了上下文因素。声景情感识别(SER)使用一组特征对感知进行建模,唤醒和效价通常被认为是情感的充分描述符。在这项工作中,我们混合\xAE {图学习}技术与一种新的\xAE {信息标准},以开发一个功能选择框架SER。具体来说,我们估计一个稀疏的图形表示的功能关系使用线性结构方程模型(SEM)定制的广泛使用的EST-Soundscapes数据集。由此产生的图捕捉输入特征和两个情感输出之间的关系。为了确定适当的稀疏性水平,我们提出了一种新的\emdash {广义肘检测器},它提供了一个点估计和一个不确定性区间。我们对我们的方法进行了广泛的评估,包括推断关系的可视化。虽然我们的一些发现与以前的研究一致,但图形表示也揭示了唤醒和效价之间的强烈联系,挑战了常见的SER假设。


【44】Reverse Attention for Lightweight Speech Enhancement on Edge Devices
标题:边缘设备上轻量级语音增强的反向注意力
链接:https://arxiv.org/abs/2509.16705

摘要:本文介绍了一种用于实时语音增强的轻量级深度学习模型,旨在在资源受限的设备上高效运行。所提出的模型利用了一个紧凑的架构,便于快速推理,而不影响性能。主要贡献包括在U-Net架构中注入基于注意力的软注意力门,该架构在分割任务中表现良好,并针对GPU进行了优化。实验评估表明,该模型实现了有竞争力的语音质量和可懂度指标,如PESQ和字错误率(WER),提高了类似大小的基线模型的性能。与未增强波形相比,我们能够实现6.24%的WER改善和0.64的PESQ评分改善。


【45】Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
标题:用于ASB和审议处理的音频调节扩散LLM
链接:https://arxiv.org/abs/2509.16622

摘要:基于扩散的大型语言模型(DLLM)最近吸引了越来越多的兴趣作为自回归解码器的替代方案。在这项工作中,我们提出了一个基于扩散的大语言模型LLaDA自动语音识别(ASR)的实证研究。我们首先调查它的使用作为一个外部的审议为基础的处理模块耳语LLaMA成绩单。通过利用LLaDA的双向注意力和去噪能力,我们探索了随机掩蔽、低置信掩蔽和半自回归策略,表明Whisper-LLaDA与基线相比大幅降低了WER。在LibriSpeech上,最好的级联系统在测试-清洁/测试-其他上实现了2.25%/4.94%的WER,在测试-其他分割上比Whisper-LLaMA基线相对提高了12.3%。相比之下,没有声学特征的纯文本LLaDA无法提高准确性,突出了音频条件嵌入的重要性。我们进一步评估了Whisper-LLaDA作为具有基于扩散和半自回归解码的ASR独立解码器。大多数实验配置比Whisper-LLaMA基线实现更快的推理,尽管识别精度略低。这些发现提供了一个经验的观点扩散为基础的LLM ASR和点有前途的改进方向。


【46】An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
标题:用于基于扩散的音频生成的基于Octave的多分辨率CQT架构
链接:https://arxiv.org/abs/2509.16603

备注:accepted at IEEE International Symposium on the Internet of Sounds
摘要:本文介绍了MR-CQTdiff,一种新的神经网络架构的扩散为基础的音频生成,利用多分辨率常数$Q$变换(C$Q$T)。所提出的架构采用了一个高效的,可逆的CQT框架,调整的倍频程倍频程的基础上的时间-频率分辨率。该设计解决了低频时的低时间分辨率问题,从而实现了更灵活和更具表现力的音频生成。我们使用Fr\'echet音频距离(FAD)度量在各种架构和两个数据集上进行评估。实验结果表明,MR-CQTdiff实现了最先进的音频质量,优于竞争对手的架构。


【47】TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
标题:TF-CorrNet:利用空间相关性实现连续语音分离
链接:https://arxiv.org/abs/2509.16481

备注:Accepted in SPL
摘要:通常,多通道源分离利用了与时频域中的幅度信息级联的麦克风间相位差(IPD),或者沿通道轴堆叠的实部和虚部。然而,声源的空间信息基本上包含在麦克风之间的差异中,特别是在它们之间的相关性中,而每个麦克风的功率也提供了关于源频谱的有价值的信息,这就是为什么幅度也包括在内。因此,我们提出了一个网络,直接利用相位变换(PHAT)-β的相关输入来估计分离滤波器。此外,建议TF-CorrNet处理的功能交替跨越时间和频率轴作为一个双路径战略的空间信息。此外,我们增加了一个频谱模块来模拟源相关的直接时间-频率模式,以改善语音分离。实验结果表明,所提出的TF-CorrNet有效地分离语音的声音,表现出高性能与低计算成本的LibriCSS数据集。


【48】Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
标题:有噪和回响环境下基于调和的鲁棒音调估计
链接:https://arxiv.org/abs/2509.16480

摘要:准确的基音估计对于许多语音处理应用是必不可少的,但在高失真环境中仍然具有挑战性。本文提出了一种鲁棒的基音周期估计方法,在具有挑战性的噪声环境中提供鲁棒的基音周期估计。我们的方法计算归一化平均幅度差函数(NAMDF),将其转换为一个似然函数,并在每个样本移位帧生成概率音高状态。为了提高噪声鲁棒性,我们聚合的整数倍的基音周期和相邻帧的似然值。此外,我们引入了一个简单而有效的维特比算法中的连续性约束,以改善多个候选人之间的音高选择。实验结果表明,我们的方法始终实现较低的总基音误差(GPE)和浊音判决错误(VDE)在各种SNR水平,优于现有的方法在噪声和混响条件。


【49】Similarity-Guided Diffusion for Long-Gap Music Inpainting
标题:相似性引导的长间隙音乐修复扩散
链接:https://arxiv.org/abs/2509.16342

备注:5 pages, 2 figures. Submitted to IEEE ICASSP 2026. Audio examples and supplementary material are available at: this https URL
摘要:音乐修复旨在重建受损录音的缺失片段。虽然基于扩散的生成模型改善了中等长度间隙的重建,但它们通常难以在多秒间隙上保持音乐的可重复性。我们介绍了相似性指导的扩散后验采样(SimDPS),一种混合方法,结合了基于扩散的推理与相似性搜索。候选片段首先从语料库检索的上下文相似性的基础上,然后纳入一个修改后的可能性,引导扩散过程的上下文一致的重建。主观评价钢琴音乐修复与2秒的差距表明,所提出的SimDPS方法相比,无指导的扩散,增强了感知的可扩展性和经常优于相似性搜索时,只有适度相似的候选人。这些结果表明,混合相似性方法的扩散为基础的音频增强与长间隙的潜力。


【50】Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds
标题:研究多语言言语基金会模型以学习人群的集体情感
链接:https://arxiv.org/abs/2509.16329

备注:Accepted to APSIPA-ASC 2025
摘要:本文研究了用于人群情感识别的多语言语音基础模型。我们假设,在不同的语言,口音和语音模式上预先训练的多语言SFM特别擅长于导航人群环境中嘈杂和复杂的声学环境,从而为CER提供了显着的优势。为了证实这一点,我们进行了全面的分析,比较多语种,单语,说话人识别SFM通过广泛的实验在不同的音频持续时间(1秒,500毫秒,250毫秒)的基准CER数据集。结果一致证明了多语言SFM的优越性,在所有音频长度上都优于同行,即使在极短的输入时间内也表现出色。这些研究结果铺平了道路,适应可持续森林管理办法,建立新的基准CER。


eess.AS音频处理


【1】Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
标题:Nord-Parl-TTC:来自议会演讲的芬兰和瑞典TTC数据集
链接:https://arxiv.org/abs/2509.17988

摘要:文本到语音(TTS)的发展是有限的,缺乏高质量的,公开可用的语音数据的大多数语言以外的一些高资源的语言。我们提出了Nord-Parl-TTS,这是一个开放的TTS数据集,基于芬兰语和瑞典语在野外发现的语音。使用北欧议会程序的录音,我们提取900小时的芬兰语和5090小时的瑞典语演讲适合TTS培训。该数据集使用Emilia数据处理管道的改编版本构建,包括统一的评估集,以支持模型开发和基准测试。通过提供芬兰语和瑞典语的开放、大规模数据,Nord-Parl-TTS缩小了高资源语言和低资源语言之间的TTS资源差距。


【2】Benchmarking Humans and Machines on Complex Multilingual Speech Understanding Tasks
标题:在复杂的多语言语音理解任务上对人类和机器进行基准测试
链接:https://arxiv.org/abs/2509.17965

备注:5 Pages, 1 Figure
摘要:听觉注意力和选择性锁相是人类在复杂声学场景和鸡尾酒会环境中理解语音的核心,但对多语言受试者的这些能力仍然知之甚少。虽然近年来自然语音的机器理解取得了进展,但对重叠和混合通道语音的理解仍然存在问题。我们提出了一个系统的范式,用于研究人类和机器在多语言环境中的语音问答任务,具有干净和混合通道的语音。对于人类听众来说,对目标说话者的选择性注意在他们的母语(L1)中比在他们的第二语言(L2)中明显更好。对于机器听力,基于语音的大型语言模型(LLM)在干净的单扬声器条件下匹配或超过人类表现,但在双扬声器环境中通常难以选择性地参加。这些结果揭示了一个关键的分歧:人类依赖于在母语中更精简的注意力线索,而LLM默认为超过人类技能的并行信息提取。


【3】GAN-Based Multi-Microphone Spatial Target Speaker Extraction
标题:基于GAN的多麦克风空间目标说话人提取
链接:https://arxiv.org/abs/2509.17741

摘要:空间目标说话人提取使用空间信息(诸如到达方向(DoA))在多说话人环境中分离期望说话人的语音。尽管最近基于深度神经网络(DNN)的判别方法已经显示出显着的性能改进,但生成对抗网络(GANs)等生成方法在解决这个问题方面的潜力在很大程度上仍未得到探索。在这项工作中,我们证明了GAN可以有效地利用噪声混合物和空间信息来提取和生成目标说话人的语音。除了DoA之外,通过将GAN调节在判别空间滤波模型的中间特征上,我们能够以5度的高空间分辨率进行可操纵目标提取,在基于感知质量的客观度量中优于最先进的判别方法。


【4】Comparator Loss: An Ordinal Contrastive Loss to Derive a Severity Score for Speech-based Health Monitoring
标题:比较者损失:推导基于言语的健康监测严重性评分的有序对比损失
链接:https://arxiv.org/abs/2509.17661

备注:Submitted to ICASSP 2026. This work is supported by NEURii, a collaborative partnership involving the University of Edinburgh, Gates Ventures, Eisai, LifeArc and Health Data Research UK (HDR UK)
摘要:监测神经退行性疾病的进展在治疗计划和未来药物治疗的评估中具有重要的应用。鉴于目前最先进的语音健康监测技术主要集中在对患者与健康对照进行分类,或预测现实世界的健康指标,我们在这里提出了一种新的疾病进展指标:严重程度评分。这个分数来自一个经过训练的模型,以最小化我们所说的比较器损失。比较器损失确保评分遵循排序关系,该排序关系可以基于诊断、临床注释评分或简单地记录的时间顺序。除了提供比简单的离散分类更详细的情况外,拟议的基于比较损失的系统有可能纳入来自不同健康指标的信息,这对于充分利用小型健康相关数据集至关重要。我们评估了我们提出的模型,基于它们肯定跟踪运动神经元疾病(MND)患者进展的能力,它们的输出与临床注释(如ALSFRS-R)的相关性,以及它们区分MND受试者和健康对照的能力。


【5】Audiobook-CC: Controllable Long-context Speech Generation for Multicast Audiobook
标题:Audiobook-CC:多播Audiobook-CC:可控制的长上下文语音生成
链接:https://arxiv.org/abs/2509.17516

摘要:现有的文本到语音的系统主要集中在单句合成和缺乏足够的上下文建模以及细粒度的性能控制能力,以产生连贯的多播有声读物。为了解决这些限制,我们提出了一个上下文感知和情感可控的语音合成框架,专门为多播有声读物设计,具有三个关键的创新:上下文一致性的上下文机制,一个解纠缠范式,从语音提示中解耦风格控制,以实现语义一致性,以及自我升华,以提高情感表达能力和指令可控性。实验结果表明,在生成叙述,对话和整个章节的性能优越,显着优于现有的基线。消融研究进行验证我们提出的方法的有效性。演示示例可以在https://everest-ai.github.io/上找到。


【6】FUN-SSL: Full-band Layer Followed by U-Net with Narrow-band Layers for Multiple Moving Sound Source Localization
标题:FUN-SSL:全频段层后加上U-Net,具有窄频段层,用于多个移动声音源定位
链接:https://arxiv.org/abs/2509.17490

备注:Submitted to ICASSP 2026
摘要:沿时间和频谱维度的双路径处理已被证明在各种语音处理应用中是有效的。虽然利用双路径处理的声源定位(SSL)模型(如FN-SSL和IPDnet)在定位多个移动源方面表现出令人印象深刻的性能,但它们需要大量的计算。在本文中,我们提出了一种SSL的架构,它引入了一个U-网进行窄带处理,在多个分辨率,以减少计算复杂度。所提出的模型将IPDnet中的全窄网络块替换为FUN块,该全窄网络块由一个全带LSTM层组成,该全带LSTM层沿着频谱维度,然后是一个窄带LSTM层,该窄带LSTM层沿着时间维度,该FUN块由一个全带层组成,然后是一个具有多个尺度窄带层的U-网络。在每个U-Net内的跳过连接之上,我们还引入了FUN块之间的跳过连接以丰富信息。实验结果表明,所提出的FUN-SSL优于以前提出的方法,计算复杂度远低于IPDnet。


【7】Neural acoustic multipole splatting for room impulse response synthesis
标题:神经声学多极飞溅用于房间脉冲响应合成
链接:https://arxiv.org/abs/2509.17410

备注:5 pages, 5 figures
摘要:任意接收器位置的房间脉冲响应(RIR)预测对于空间音频渲染等实际应用至关重要。我们提出了神经声学多极子溅射(NAMS),它通过学习神经声学多极子的位置并使用神经网络预测其发射信号和方向性来合成在看不见的接收器位置处的RIR。通过多极的组合表示声场提供了足够的灵活性来表达复杂的声学场景,同时遵守诸如亥姆霍兹方程之类的物理约束。我们还引入了一种修剪策略,该策略从神经声学多极的密集飞溅开始,并在训练过程中逐步消除多余的多极。在真实数据集和合成数据集上进行的实验表明,该方法在大多数指标上都优于以前的方法,同时保持快速推理。烧蚀研究表明,多极溅射修剪实现更好的性能比只有20%的极点的模型。


【8】SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
标题:SongPrep:全歌曲结构解析和歌词转录的预处理框架和端到端模型
链接:https://arxiv.org/abs/2509.17404

摘要:人工智能生成内容(AIGC)是目前一个热门的研究领域。在其众多的分支中,歌曲生成引起了越来越多的关注。尽管有大量可用的歌曲,有效的数据准备仍然是一个重大挑战。将这些歌曲转换为训练就绪的数据集通常需要大量的手动标记,这既耗时又昂贵。为了解决这个问题,我们提出了SongPrep,一个专门为歌曲数据设计的自动预处理管道。该框架简化了源分离、结构分析和歌词识别等关键流程,产生可直接用于训练歌曲生成模型的结构化数据。此外,我们还介绍了SongPrepE 2 E,这是一个基于预训练语言模型的端到端结构化歌词识别模型。无需额外的源分离,SongPrepE 2 E能够分析整首歌曲的结构和歌词,并提供精确的时间戳。通过利用整首歌曲的上下文以及预训练的语义知识,SongPrepE 2 E在建议的SSLD-200数据集上实现了低的日记错误率(DER)和单词错误率(WER)。下游任务表明,使用SongPrepE 2 E输出的数据训练歌曲生成模型,使生成的歌曲与人类产生的歌曲非常相似。


【9】Improving Active Learning for Melody Estimation by Disentangling Uncertainties
标题:通过理清不确定性来改善旋律估计的主动学习
链接:https://arxiv.org/abs/2509.17375

备注:This work has been submitted to the IEEE ICASSP 2026 for possible publication
摘要:估计基频或旋律是音乐信息检索(MIR)的核心任务。各种研究探索了信号处理,机器学习和基于深度学习的方法,最近的重点是利用主动学习设置中的不确定性进行旋律估计。然而,这些方法没有调查不同的不确定性的相对有效性。在这项工作中,我们遵循一个框架,解开任意性和认知的不确定性,以指导主动学习旋律估计。在源数据集上进行训练,我们的模型仅使用少量标记样本就能适应新的领域。实验结果表明,认知不确定性是更可靠的领域适应减少标记工作相比,任意的不确定性。


【10】RADE for Land Mobile Radio: A Neural Codec for Transmission of Speech over Baseband FM Radio Channels
标题:用于陆地移动广播的RADE:用于通过基带FM无线电频道传输语音的神经编解码器
链接:https://arxiv.org/abs/2509.17286

备注:6 pages, 9 figures
摘要:在20世纪90年代,陆地移动无线电(LMR)系统从模拟调频(FM)发展到标准化的数字系统。数字和模拟FM系统现在共存于各种服务中,并表现出类似的语音质量。许多数字无线电的架构保留了传统模拟无线电的模拟FM调制器和解调器,但由多级数字脉冲训练而不是模拟语音信号驱动。我们表示这种架构基带FM(BBFM)。在本文中,我们描述了一种现代机器学习方法,该方法使用自动编码器通过BBFM信道发送高质量的8 kHz带宽语音。的语音质量被证明是优于模拟FM在模拟LMR信道中存在的衰落,和商品UHF无线电系统运行的演示。


【11】BeepBank-500: A Synthetic Earcon Mini-Corpus for UI Sound Research and Psychoacoustics Research
标题:BeepBank-500:用于UI声音研究和心理声学研究的合成Earcon迷你数据库
链接:https://arxiv.org/abs/2509.17277

备注:Data note; 6 to 8 pages; 1 to 2 figures; dataset: CC0-1.0; code: MIT
摘要:我们介绍BeepBank-500,一个紧凑的,完全合成的耳标/警报数据集(300-500个剪辑),旨在进行人机交互和音频机器学习的快速,正确的实验。每个片段都是从控制波形族(正弦、方波、三角波、FM)、基频、持续时间、幅度包络、幅度调制(AM)和轻量级Schroeder风格混响的参数配方生成的。我们使用三种混响设置:干燥,两个合成房间表示为“小”(“小”)和“中等”(“中等”)。我们发布了单声道48 kHz WAV音频(16位),丰富的元数据表(信号/频谱特征)和微小的可重现基线,用于(i)波形族分类和(ii)单音f0回归。语料库的目标任务,如耳标分类,音色分析和发病检测,明确规定的许可和限制。音频通过CC 0 -1.0专用于公共领域;代码在MIT下。Data DOI:https://doi.org/10.5281/zenodo.17172015.代码:https://github.com/mandip42/earcons-mini-500。


【12】Reference-aware SFM layers for intrusive intelligibility prediction
标题:用于侵入式可懂度预测的参考感知SFM层
链接:https://arxiv.org/abs/2509.17270

备注:Preprint; submitted to ICASSP 2026. 5 pages. CPC3 system: Dev RMSE 22.36, Eval RMSE 24.98 (ranked 1st)
摘要:利用显式参考信号的侵入式语音可懂度预测器现在很普遍,但它们并没有始终超过非侵入式系统。我们认为,一个主要原因是有限的开发语音基础模型(SFM)。这项工作通过将参考条件与多层SFM表示相结合来重新审视侵入式预测。我们最终的系统在开发集上达到RMSE 22.36,在评估集上达到24.98,在CPC 3上排名第一。这些研究结果为构建基于SFM的侵入式可懂度预测器提供了实际指导。


【13】DeepASA: An Object-Oriented One-for-All Network for Auditory Scene Analysis
标题:DeepASA:一个面向对象的一对多听觉场景分析网络
链接:https://arxiv.org/abs/2509.17247

备注:26 pages, 13 figures, 8 tables, accepted in NeurIPS 2025
摘要:我们提出了DeepASA,这是一种用于听觉场景分析的一对多模型,它在统一的框架内执行多输入多输出(MIMO)源分离,去混响,声音事件检测(SED),音频分类和到达方向估计(DoAE)。DeepASA专为复杂的听觉场景而设计,其中多个通常相似的声源在时间上重叠并在空间上动态移动。为了实现跨任务的鲁棒性和一致性推理,我们引入了面向对象的处理(OOP)策略。这种方法将不同的听觉特征封装到以对象为中心的表示中,并通过推理链(CoI)机制对其进行细化。该流水线包括基于动态时间内核的特征提取器、基于变换器的聚合器和产生每个对象特征的对象分离器。这些特性输入到多个特定于任务的解码器中。我们以对象为中心的表示自然解决了传统跟踪处理中固有的参数关联模糊性。但是,早期的对象分离可能会导致下游ASA任务失败。为了解决这个问题,我们在推理链中实现了时间相干匹配(TCM),使用估计的听觉参数实现了对象特征的多任务融合和迭代细化。我们在代表性的空间音频基准数据集上评估了DeepASA,包括ASA 2,MC-FUSS和STARSS 23。实验结果表明,我们的模型在所有评估任务中都达到了最先进的性能,证明了它在不同空间听觉场景下的源分离和听觉参数估计的有效性。


【14】MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances
标题:MaskVCT:用于Zero-Shot语音转换的掩蔽语音编解码器Transformer,通过多种引导提高可控制性
链接:https://arxiv.org/abs/2509.17143

摘要:我们介绍了MaskVCT,一个zero-shot语音转换(VC)模型,通过多个无分类器的指导(CFGs)提供多因素的可控性。虽然以前的VC模型依赖于固定的调节方案,但MaskVCT在单个模型中集成了不同的条件。为了进一步增强鲁棒性和控制性,该模型可以利用连续或量化的语言特征来增强可重复性和说话人相似性,并且可以使用或省略音高轮廓来控制韵律。这些选择允许用户在zero-shot VC设置中无缝地平衡说话者身份、语言内容和韵律因素。大量的实验表明,MaskVCT实现了最好的目标说话人和口音的相似性,同时获得有竞争力的单词和字符的错误率相比,现有的基线。音频样本可在https://maskvct.github.io/上获得。


【15】Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
标题:专注的AV-FusionNet:混合注意力的视听质量预测
链接:https://arxiv.org/abs/2509.16994

备注:Pre-review version submitted to ICASSP 2026
摘要:我们引入了一种新的基于深度学习的视听质量(AVQ)预测模型,该模型利用了最先进的单峰预测器的内部特征。与依赖于简单融合策略的先前方法不同,我们的模型采用混合表示,将学习的生成机器学习(GML)音频特征与手工制作的视频多方法评估融合(VMAF)视频特征相结合。注意力机制捕捉跨模态交互和模态内关系,产生上下文感知的质量表示。模态相关性估计器量化每个内容的每个模态的贡献,潜在地实现自适应比特率分配。实验表明,AVQ预测的准确性和鲁棒性在不同的内容类型。


【16】DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
标题:DroFiT:一种轻量级的频段融合频率关注实时无人机语音增强
链接:https://arxiv.org/abs/2509.16945

摘要:本文提出了DroFiT(Drone Frequency Lightweight Transformer for Speech Enhancement,DroFiT是一种针对严重无人机自噪声的单麦克风语音增强网络。DroFit集成了一个频率方面的Transformer,一个全/子带混合编码器-解码器和一个TCN后端,用于节省内存的流。具有组合频谱-时间损失的可学习跳门融合进一步细化重建。该模型在VoiceBank-DEMAND上与记录的无人机噪声(-5至-25 dB SNR)混合进行训练,并使用标准语音增强指标和计算效率进行评估。实验结果表明,DroFiT实现了具有竞争力的增强性能,同时显著降低了计算和内存需求,为资源受限的无人机平台上的实时处理铺平了道路。音频演示样本可在我们的演示页面上找到。


【17】Automotive Sound Quality for EVs: Psychoacoustic Metrics with Reproducible AI/ML Baselines
标题:电动汽车的汽车音质:具有可再现AI/ML基线的心理声学测试
链接:https://arxiv.org/abs/2509.16901

摘要:我们为汽车音质提供了一个开放的、可复制的参考,将标准化的心理声学指标与轻量级的AI/ML基线联系起来,特别关注电动汽车(EV)。我们实现了响度(ISO 532-1/2),音调(DIN 45681)和基于调制的描述符(粗糙度,波动强度),并记录了可靠重用的假设和参数化。对于建模,我们使用固定的分割和种子,在合成的EV类病例上提供简单,完全可重复的基线(逻辑回归,随机森林,SVM),报告准确性和等级相关性作为端到端工作流程的示例,而不是比较基准。程序级标准化通过ITU-R BS.1770在LUFS中报告,而心理声学分析使用ISO-532响度(Sones)。所有的图和表都是通过固定环境的脚本重新生成的;代码和最小的音频刺激是在许可证下发布的,以支持教学、复制和扩展到EV特定的噪声现象(例如,逆变器呜呜声、减少的掩蔽)。


【18】Feature Selection via Graph Topology Inference for Soundscape Emotion Recognition
标题:基于图布局推理的声景情感识别特征选择
链接:https://arxiv.org/abs/2509.16760

摘要:对声景的研究已经将环境声学的重点从噪声水平转移到声音的感知上,并结合了上下文因素。声景情感识别(SER)使用一组特征对感知进行建模,唤醒和效价通常被认为是情感的充分描述符。在这项工作中,我们混合\xAE {图学习}技术与一种新的\xAE {信息标准},以开发一个功能选择框架SER。具体来说,我们估计一个稀疏的图形表示的功能关系使用线性结构方程模型(SEM)定制的广泛使用的EST-Soundscapes数据集。由此产生的图捕捉输入特征和两个情感输出之间的关系。为了确定适当的稀疏性水平,我们提出了一种新的\emdash {广义肘检测器},它提供了一个点估计和一个不确定性区间。我们对我们的方法进行了广泛的评估,包括推断关系的可视化。虽然我们的一些发现与以前的研究一致,但图形表示也揭示了唤醒和效价之间的强烈联系,挑战了常见的SER假设。


【19】QASTAnet: A DNN-based Quality Metric for Spatial Audio
标题:QASTAnet:基于DNN的空间音频质量指标
链接:https://arxiv.org/abs/2509.16715

摘要:在空间音频技术的发展中,可靠和共享的音频质量评估方法是必不可少的。听力测试是目前的标准,但在时间和资源方面仍然昂贵。已经提出了几种预测主观分数的模型,但它们不能很好地推广到现实世界的信号。在本文中,我们提出了QASTAnet(空间音频网络质量评估),这是一种基于深度神经网络的新度量,专门用于空间音频(立体声和双耳)。由于训练数据稀缺,我们的目标是用少量数据训练模型。要做到这一点,我们建议依靠专家建模的低级别的听觉系统,并使用神经网络模型的高层次的认知功能的质量判断。我们将其性能与两个参考指标进行了比较,这些指标针对广泛的内容类型(语音,音乐,氛围,消声,混响)并专注于编解码器工件。结果表明,QASTAnet克服了现有方法的上述局限性。所提出的度量预测和主观分数之间的强相关性使其成为在开发中比较编解码器的良好候选者。


【20】Reverse Attention for Lightweight Speech Enhancement on Edge Devices
标题:边缘设备上轻量级语音增强的反向注意力
链接:https://arxiv.org/abs/2509.16705

摘要:本文介绍了一种用于实时语音增强的轻量级深度学习模型,旨在在资源受限的设备上高效运行。所提出的模型利用了一个紧凑的架构,便于快速推理,而不影响性能。主要贡献包括在U-Net架构中注入基于注意力的软注意力门,该架构在分割任务中表现良好,并针对GPU进行了优化。实验评估表明,该模型实现了有竞争力的语音质量和可懂度指标,如PESQ和字错误率(WER),提高了类似大小的基线模型的性能。与未增强波形相比,我们能够实现6.24%的WER改善和0.64的PESQ评分改善。


【21】Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
标题:用于ASB和审议处理的音频调节扩散LLM
链接:https://arxiv.org/abs/2509.16622

摘要:基于扩散的大型语言模型(DLLM)最近吸引了越来越多的兴趣作为自回归解码器的替代方案。在这项工作中,我们提出了一个基于扩散的大语言模型LLaDA自动语音识别(ASR)的实证研究。我们首先调查它的使用作为一个外部的审议为基础的处理模块耳语LLaMA成绩单。通过利用LLaDA的双向注意力和去噪能力,我们探索了随机掩蔽、低置信掩蔽和半自回归策略,表明Whisper-LLaDA与基线相比大幅降低了WER。在LibriSpeech上,最好的级联系统在测试-清洁/测试-其他上实现了2.25%/4.94%的WER,在测试-其他分割上比Whisper-LLaMA基线相对提高了12.3%。相比之下,没有声学特征的纯文本LLaDA无法提高准确性,突出了音频条件嵌入的重要性。我们进一步评估Whisper-LLaDA作为ASR的独立解码器,具有基于扩散和半自回归解码。大多数实验配置比Whisper-LLaMA基线实现更快的推理,尽管识别精度略低。这些发现提供了一个经验的观点扩散为基础的LLM ASR和点有前途的改进方向。


【22】An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
标题:用于基于扩散的音频生成的基于Octave的多分辨率CQT架构
链接:https://arxiv.org/abs/2509.16603

备注:accepted at IEEE International Symposium on the Internet of Sounds
摘要:本文介绍了MR-CQTdiff,一种新的神经网络架构的扩散为基础的音频生成,利用多分辨率常数$Q$变换(C$Q$T)。所提出的架构采用了一个高效的,可逆的CQT框架,调整的倍频程倍频程的基础上的时间-频率分辨率。该设计解决了低频时的低时间分辨率问题,从而实现了更灵活和更具表现力的音频生成。我们使用Fr\'echet音频距离(FAD)度量在各种架构和两个数据集上进行评估。实验结果表明,MR-CQTdiff实现了最先进的音频质量,优于竞争对手的架构。


【23】TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
标题:TF-CorrNet:利用空间相关性实现连续语音分离
链接:https://arxiv.org/abs/2509.16481

备注:Accepted in SPL
摘要:通常,多通道源分离利用了与时频域中的幅度信息级联的麦克风间相位差(IPD),或者沿通道轴堆叠的实部和虚部。然而,声源的空间信息基本上包含在麦克风之间的差异中,特别是在它们之间的相关性中,而每个麦克风的功率也提供了关于源频谱的有价值的信息,这就是为什么幅度也包括在内。因此,我们提出了一个网络,直接利用相位变换(PHAT)-β的相关输入来估计分离滤波器。此外,建议TF-CorrNet处理的功能交替跨越时间和频率轴作为一个双路径战略的空间信息。此外,我们增加了一个频谱模块来模拟源相关的直接时间-频率模式,以改善语音分离。实验结果表明,所提出的TF-CorrNet有效地分离语音的声音,表现出高性能与低计算成本的LibriCSS数据集。


【24】Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
标题:有噪和回响环境下基于调和的鲁棒音调估计
链接:https://arxiv.org/abs/2509.16480

摘要:准确的基音估计对于许多语音处理应用是必不可少的,但在高失真环境中仍然具有挑战性。本文提出了一种鲁棒的基音周期估计方法,在具有挑战性的噪声环境中提供鲁棒的基音周期估计。我们的方法计算归一化平均幅度差函数(NAMDF),将其转换为一个似然函数,并在每个样本移位帧生成概率音高状态。为了提高噪声鲁棒性,我们聚合的整数倍的基音周期和相邻帧的似然值。此外,我们引入了一个简单而有效的维特比算法中的连续性约束,以改善多个候选人之间的音高选择。实验结果表明,我们的方法始终实现较低的总基音误差(GPE)和浊音判决错误(VDE)在各种SNR水平,优于现有的方法在噪声和混响条件。


【25】Sound field estimation with moving microphones using kernel ridge regression
标题:使用核岭回归估计移动麦克风的电场
链接:https://arxiv.org/abs/2509.16358

摘要:与使用固定麦克风相比,使用移动麦克风的声场估计可以增加灵活性,减少测量时间,并减少设备限制。提出了一种基于核岭回归(KRR)的运动传声器声场估计方法。建议的KRR方法构造使用离散时间连续的空间声场模型的基础上离散傅立叶变换和Herglotz波函数。所提出的方法允许包含先验知识作为正则化惩罚,类似于具有固定麦克风的基于核的方法,这对于移动麦克风是新颖的。使用方向加权所提出的方法,改善了声场估计,这是证明了模拟和真实数据。针对运动传声器声场估计计算量大的问题,提出了一种利用随机傅立叶特征(RFF)近似核函数的近似KRR方法。RFF方法被证明可以降低计算成本,同时获得不太准确的估计相比,KRR,提供成本和性能之间的权衡。


【26】Similarity-Guided Diffusion for Long-Gap Music Inpainting
标题:相似性引导的长间隙音乐修复扩散
链接:https://arxiv.org/abs/2509.16342

备注:5 pages, 2 figures. Submitted to IEEE ICASSP 2026. Audio examples and supplementary material are available at: this https URL
摘要:音乐修复旨在重建受损录音的缺失片段。虽然基于扩散的生成模型改善了中等长度间隙的重建,但它们通常难以在多秒间隙上保持音乐的可重复性。我们介绍了相似性指导的扩散后验采样(SimDPS),一种混合方法,结合了基于扩散的推理与相似性搜索。候选片段首先从语料库检索的上下文相似性的基础上,然后纳入一个修改后的可能性,引导扩散过程的上下文一致的重建。主观评价钢琴音乐修复与2秒的差距表明,所提出的SimDPS方法相比,无指导的扩散,增强了感知的可扩展性和经常优于相似性搜索时,只有适度相似的候选人。这些结果表明,混合相似性方法的扩散为基础的音频增强与长间隙的潜力。


【27】Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds
标题:研究多语言言语基金会模型以学习人群的集体情感
链接:https://arxiv.org/abs/2509.16329

备注:Accepted to APSIPA-ASC 2025
摘要:本文研究了用于人群情感识别的多语言语音基础模型。我们假设,在不同的语言,口音和语音模式上预先训练的多语言SFM特别擅长于导航人群环境中嘈杂和复杂的声学环境,从而为CER提供了显着的优势。为了证实这一点,我们进行了全面的分析,比较多语种,单语,说话人识别SFM通过广泛的实验在不同的音频持续时间(1秒,500毫秒,250毫秒)的基准CER数据集。结果一致证明了多语言SFM的优越性,在所有音频长度上都优于同行,即使在极短的输入时间内也表现出色。这些研究结果铺平了道路,适应可持续森林管理办法,建立新的基准CER。


【28】Qwen3-Omni Technical Report
标题:Qwen 3-Omni技术报告
链接:https://arxiv.org/abs/2509.17765

备注:his https URL
摘要:我们提出了Qwen 3-Omni,一个单一的多模态模型,第一次在文本,图像,音频和视频中保持最先进的性能,而没有任何相对于单模态模型的退化。Qwen 3-Omni与Qwen系列中相同尺寸的单模态型号的性能相匹配,尤其在音频任务方面表现出色。在36个音频和视听基准测试中,Qwen 3-Omni在32个基准测试中实现了开源SOTA,在22个基准测试中实现了整体SOTA,表现优于Gemini-2.5-Pro、Seed-ASR和GPT-4 o-Transcribe等强大的闭源模型。Qwen 3-Omni采用Thinker-Talker MoE架构,统一了文本、图像、音频和视频的感知和生成,生成流畅的文本和自然的实时语音。它支持119种语言的文本交互,19种语言的语音理解和10种语言的语音生成。为了减少流合成中的第一包延迟,Talker使用多码本方案自回归预测离散语音编解码器。利用这些码本的代表能力,我们用轻量级的因果ConvNet取代了计算密集型的逐块扩散,从而从第一个编解码器帧开始进行流式传输。在冷启动设置中,Qwen 3-Omni实现了234 ms的理论端到端第一个数据包延迟。为了进一步加强多模态推理,我们引入了一个思维模型,该模型可以明确地对来自任何模态的输入进行推理。由于研究界目前缺乏通用的音频字幕模型,我们对Qwen 3-Omni-30 B-A3 B进行了微调,以获得Qwen 3-Omni-30 B-A3 B-Captioner,它可以为任意音频输入生成详细的低幻觉字幕。Qwen 3-Omni-30 B-A3 B、Qwen 3-Omni-30 B-A3 B-Thinking和Qwen 3-Omni-30 B-A3 B-Captioner在Apache 2.0许可下公开发布。


【29】Enhancing the NAO: Extending Capabilities of Legacy Robots for Long-Term Research
标题:增强NAO:扩展传统机器人的长期研究能力
链接:https://arxiv.org/abs/2509.17760

摘要:许多研究小组面临的挑战时,遗留(不支持)的机器人平台失去制造商的支持,不能适应现代传感,语音和交互功能。我们介绍了增强型NAO,这是Aldebaran NAO机器人的复兴版本,它使用升级的麦克风,RGB-D和热成像摄像机,以及完全独立的软件包中的额外计算资源。该系统结合了云和本地模型进行感知和对话,同时保留了NAO的表达身体和行为。在一项试点验证研究中,与NAO AI版相比,增强型NAO提供了更高的会话质量和更强的用户偏好,而不会增加响应延迟。关键升级,如波束成形麦克风和低延迟音频处理,减少了自听等伪像,并改善了多方分离。扩展的视觉和热传感为未来的交互能力奠定了基础。除了NAO之外,我们的框架还提供了一种与平台无关的策略,用于延长传统机器人的寿命和研究效用,确保它们仍然是人机交互的宝贵工具。


【30】Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
标题:利用视听数据缩小自我监督语音模型中的多语言差距
链接:https://arxiv.org/abs/2509.17523

备注:5 pages, 2 figures
摘要:自监督学习(SSL)在语音表征学习方面取得了重大进展。像wav2vec 2.0和HuBERT这样的模型已经在语音识别等任务中取得了最先进的成果,特别是在单语环境中。然而,多语言SSL模型往往在每种语言上表现不佳,特别是在语言较少的多语言场景中,如双语设置。在这项工作中,我们研究了一种新的方法来减少这种性能差距,通过引入有限的视觉接地双语语音SSL模型。我们的研究结果表明,视觉接地有利于单语和双语模型,特别是后者的收益显着,减少多语言性能差距的zero-shot语音歧视从31.5%的纯音频模型的8.04%接地。


【31】STAR: Speech-to-Audio Generation via Representation Learning
标题:STAR:通过表示学习生成语音到音频
链接:https://arxiv.org/abs/2509.17164

摘要:这项工作提出了STAR,第一个端到端的语音到音频生成框架,旨在提高效率和解决级联系统中固有的错误传播。与依赖于文本或视觉的先前方法不同,STAR利用语音,因为它构成了一种自然的交互方式。作为验证系统可行性的第一步,我们通过表示学习实验证明,可以有效地从原始语音中提取口语声音事件语义,捕获听觉事件和场景线索。利用语义表示,STAR结合了用于表示映射的桥接网络和两阶段训练策略来实现端到端合成。由于语音处理延迟减少了76.9%,STAR显示出优于级联系统的生成性能。总的来说,STAR将语音建立为音频生成的直接交互信号,从而桥接了表征学习和多模态合成。生成的示例可在https://zeyuxie29.github.io/STAR上获得。


【32】FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
标题:FakeSound 2:可解释和可概括的Deepfake声音检测的基准
链接:https://arxiv.org/abs/2509.17162

摘要:生成音频的快速发展引发了来自伪造数据的道德和安全问题,使得deepfake声音检测成为防止恶意使用此类技术的重要保障。虽然以前的研究已经探讨了这一任务,现有的方法主要集中在二进制分类,并在解释如何操纵发生,追查来源起源,或概括看不见的来源,从而限制了可解释性和可靠性的检测不足。为了解决这些局限性,我们提出了FakeSound2,这是一个旨在将deepfake声音检测提升到二进制精度之外的基准。FakeSound2在三个维度上评估模型:本地化,可追溯性和泛化,涵盖6种操作类型和12种不同的来源。实验结果表明,虽然目前的系统实现了很高的分类精度,他们很难识别伪造的模式分布,并提供可靠的解释。通过强调这些差距,FakeSound2建立了一个全面的基准,揭示了关键挑战,旨在促进可靠的音频认证的强大,可解释和可推广的方法。


【33】Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
标题:Sidon:快速稳健的开源多语言语音恢复,用于大规模数据集清理
链接:https://arxiv.org/abs/2509.17052

备注:5 pages, 1 figures
摘要:大规模的文本到语音(TTS)系统受到缺乏干净的多语言录音的限制。Sidon是一种快速的开源语音恢复模型,它可以将嘈杂的野外语音转换为工作室质量的语音,并扩展到数十种语言。Sidon由两种型号组成:w2 v-BERT 2.0微调特征预测器,从嘈杂的语音中清除特征,声码器经过训练,从清除的特征中合成恢复的语音。Sidon实现了与Miipher相当的恢复性能:Google的内部语音恢复模型,旨在为语音合成进行数据集清理。Sidon的计算效率也很高,在单个GPU上的运行速度比实时快3,390倍。我们进一步表明,训练TTS模型使用西顿清洗自动语音识别语料库提高了合成语音的质量在zero-shot设置。发布代码和模型,以促进研究社区的可重复数据集清理。


【34】VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
标题:VA Inpaint:具有LLM驱动模块的Zero-Shot视频-音频修复框架
链接:https://arxiv.org/abs/2509.17022

摘要:针对混合视听内容的视频和音频修复已成为多媒体编辑中的一项重要任务。然而,从视频中精确地移除对象及其对应的音频而不影响场景的其余部分仍然是一个重大挑战。为了解决这个问题,我们提出了VAInpaint,这是一种新的管道,它首先利用分割模型来生成遮罩,并引导视频修复模型去除对象。与此同时,LLM然后在全局上分析场景,而特定于区域的模型提供本地化的描述。整体和区域描述都将输入到LLM中,LLM将细化内容并将其转换为文本查询,用于我们的文本驱动音频分离模型。我们的音频分离模型在定制的数据集上进行了微调,该数据集包括分割的MUSIC乐器图像和VGGSound背景,以增强其泛化性能。实验表明,我们的方法达到性能媲美当前的基准在音频和视频修复。


【35】Bridging the gap between training and inference in LM-based TTS models
标题:弥合基于LM的TTC模型中训练和推理之间的差距
链接:https://arxiv.org/abs/2509.17021

备注:5 pages, 4 figures
摘要:文本到语音(TTS)的最新进展表明,基于语言模型(LM)的系统提供了有竞争力的性能相比,传统的方法。然而,在训练中,TTS模型使用地面实况(GT)标记作为前缀来预测下一个标记,而在推理中这些标记不可用,这是训练和推理之间的差距,经常被忽视。在这项研究中,我们提出了一个基于LM-TTS系统的混合训练方案,以减轻曝光偏差。我们的核心思想是采用一种混合训练范式,将教师强迫与自由运行相结合,从而将自我生成的令牌引入训练过程。这使得训练模式与推理更加一致,减少了训练-推理差距。此外,我们在训练过程中加入了EOS预测机制,以检测不正确的序列终止并自适应地控制自由运行过程。实验结果全面评估了暴露偏差对基于LM的TTS的影响,并证明我们的方法有效缩小了训练-推理差距,从而提高了合成长形式语音的质量。


【36】MBCodec:Thorough disentangle for high-fidelity audio compression
标题:MBCodec:彻底理清高保真音频压缩
链接:https://arxiv.org/abs/2509.17006

备注:5 pages, 2 figures
摘要:文本到语音(TTS)中的高保真神经音频编解码器旨在将语音信号压缩为离散表示以进行忠实重建。然而,先前的方法在有效地解开令牌内的声学和语义信息方面面临挑战,导致合成语音中缺乏细粒度的细节。在这项研究中,我们提出了MBCodec,一种新的多码本音频编解码器的基础上残差矢量量化(RVQ),学习分层结构的表示。MBCodec利用来自原始信号的自监督语义标记化和音频子带特征来构建功能上分离的潜在空间。为了鼓励跨编解码器嵌入空间的各个层的全面学习,我们引入自适应丢弃深度来跨层差分训练码本,并且在训练期间采用多通道伪正交镜像滤波器(PQMF)。通过彻底解耦语义和声学特征,我们的方法不仅实现了近乎无损的语音重建,而且还能够对24 kHz音频进行出色的170倍压缩,从而实现仅2.2 kbps的低比特率。实验性评价证实,在所有评价中,该方案的业绩始终大大优于基线。


【37】Advancing Speech Understanding in Speech-Aware Language Models with GRPO
标题:使用GRPO推进语音感知语言模型中的语音理解
链接:https://arxiv.org/abs/2509.16990

摘要:在本文中,我们介绍了一种基于组相对策略优化(GRPO)的方法,用于在开放格式的语音理解任务(如口语提问和自动语音翻译)上训练语音感知大语言模型(SALLM)。SALLM已被证明对于语音理解任务非常有效。GRPO最近因其在培训LLM方面的效率而获得了牵引力,并且先前的工作已经探索了其在SALLM中的应用,主要是在多项选择任务中。在此基础上,我们专注于更好地反映模型生成能力的开放式任务。我们的方法利用GRPO与BLEU作为奖励信号来优化SALLM,并且我们根据经验证明,它在几个关键指标上超过了标准SFT。最后,我们探讨了在GRPO内为这些任务纳入政策外样本的潜力,强调了进一步改进和进一步研究的途径。


【38】Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners
标题:利用多个语音增强器对听力受损的听众进行非侵入性可理解度预测
链接:https://arxiv.org/abs/2509.16979

摘要:听力受损(HI)听众的语音清晰度评估对于评估助听器性能至关重要,传统上依赖于听力测试或HASPI等侵入性方法。然而,这些方法需要干净的参考信号,这在现实世界的条件下往往是不可用的,从而在基于实验室的评估和现实世界的评估之间产生了差距。为了解决这个问题,我们提出了一个非侵入性的可懂度预测框架,该框架利用语音增强器来提供并行的增强信号路径,从而在没有参考信号的情况下实现鲁棒的预测。我们评估了三种最先进的增强子,并证明了预测性能取决于增强子的选择,强增强子的集合产生最好的结果。为了提高跨数据集的泛化能力,我们引入了一个2-clips增强策略,该策略增强了特定于数据集的变异性,提高了对未知数据集的鲁棒性。我们的方法在多个数据集上的性能始终优于非侵入性基线CPC 2 Champion,突出了增强器引导的非侵入性可懂度预测在现实世界应用中的潜力。


【39】Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
标题:通过多模式LLM的思维链差异-共性推理进行可解释音频编辑评估
链接:https://arxiv.org/abs/2509.16975

摘要:自动平均意见评分(MOS)预测为客观指标提供了一种更感性的替代方案,为评估模型提供了更深入的见解。随着多模态大语言模型(MLLM)的快速发展,其增强的感知和推理能力使音频质量评估更加全面和可解释。在这项工作中,我们解决了具有挑战性的任务,音频编辑评估,并提出了第一个基于自然语言的自动化评估框架,建立在MLLM。我们的方法引入了两个微调任务来提高多音频理解,结合思想链提示和轻量级指令调整,以增强逐步推理。实验表明,我们的框架提供了准确的,可解释的,基于文本的编辑评估,与人类的判断和客观指标密切相关,同时大大提高了基线。代码和演示可在https://github.com/NKU-HLT/Eval_Reasoning上获得。


【40】AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
标题:AudioGenie-Reasoner:一个用于从粗到细音频深度推理的免训练多代理框架
链接:https://arxiv.org/abs/2509.16971

摘要:音频深度推理是一项具有挑战性的任务,需要专家级的感知,多步逻辑推理和上下文知识的整合。然而,现有的模型遭受音频感知和推理能力之间的差距,由于缺乏明确的推理链的训练数据和缺乏主动探索和迭代改进的机制。为了应对这些挑战,我们提出了AudioGenie-Reasoner(AGR),这是第一个统一的无训练多智能体系统,它在不断发展的文本证据链上协调感知和推理。我们的关键思想是一种范式转变,从一个新的角度将音频深度推理转换为复杂的文本理解任务,从而释放大型语言模型的全部潜力。具体来说,AGR的设计模仿了人类从粗到精的认知过程。它首先将输入音频转换为粗糙的基于文本的文档。然后,我们设计了一个新的主动迭代文档细化循环,具有工具增强的路线和专门的代理,不断搜索缺失的信息,并以粗到细的方式增强证据链,直到收集到足够的问题相关信息进行最终预测。实验结果表明,AGR在各种基准测试中实现了现有开源音频深度推理模型的最先进(SOTA)性能。该代码将公开提供。


【41】Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
标题:多通道音频对齐的交叉注意和置信加权
链接:https://arxiv.org/abs/2509.16926

备注:Accepted on Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE 2025)
摘要:多通道音频对齐是生物声学监测、空间音频系统和声学定位的关键要求。然而,现有的方法往往难以解决非线性时钟漂移,缺乏量化不确定性的机制。传统的方法,如互相关和动态时间弯曲假设简单的漂移模式,并提供没有可靠性措施。与此同时,最近的深度学习模型通常将对齐视为二进制分类任务,忽略了通道间的依赖性和不确定性估计。我们介绍了一种方法,结合交叉注意机制与信任加权评分,以提高多通道音频同步。我们扩展了BEAT编码器与交叉注意层,以模拟通道之间的时间关系。我们还开发了一个置信加权评分函数,使用完整的预测分布,而不是二进制阈值。我们的方法在BioDCASE 2025任务1挑战中获得了第一名,测试数据集的MSE平均值为0.30,而深度学习基线为0.58。在单个数据集上,我们在ARU数据上实现了0.14 MSE(减少77%),在斑胸草雀数据上实现了0.45 MSE(减少18%)。该框架支持概率时间对齐,超越点估计。虽然在生物声学背景下进行了验证,但该方法适用于更广泛的多通道音频任务,其中对准置信度至关重要。代码可在:https://github.com/Ragib-Amin-Nihal/BEATsCA上获得


【42】Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
标题:鼓声打击乐声音转换及其评价方法
链接:https://arxiv.org/abs/2509.16862

备注:6 pages, 5 figures, accepted for 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)
摘要:本文定义了鼓到人声打击(VP)的声音转换的新任务。VP通过人类发声来模仿打击乐器,并经常在当代无伴奏合唱音乐中使用。它表现出与语音和歌唱不同的声学特性(例如,非周期性、噪声瞬变和语言结构的缺失),使得传统的语音或歌唱合成方法不适用。因此,我们制定VP合成作为一个从鼓的声音音色转移问题,利用他们的节奏和音色的对应。为了支持这一提法,我们定义了成功转换的三个要求:节奏的保真度,音色的一致性,和自然的VP。我们还提出了相应的主观评价标准。我们实现了两个基线转换方法,使用神经音频合成器,实时音频变分自动编码器(RAVE),有和没有矢量量化(VQ)。主观实验表明,这两种方法产生合理的VP输出,与基于VQ的RAVE模型产生更一致的转换。


【43】The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology
标题:声音的声音:言语病理学语言模型的微调和综合评估
链接:https://arxiv.org/abs/2509.16765

备注:EMNLP 2025 Oral Presentation
摘要:根据美国国立卫生研究院的数据,超过340万儿童患有需要临床干预的言语障碍。言语语言病理学家的人数大约是受影响儿童人数的20倍,这突出表明儿童护理方面存在重大差距,迫切需要技术支持,以提高言语语言病理学家的工作效率。最先进的多模态语言模型(MLM)显示出支持SLP的前景,但它们的使用仍然未被充分探索,主要是由于对它们在高风险临床环境中的性能的了解有限。为了解决这一差距,我们与领域专家合作,开发了一个语音语言病理学中MLMs真实用例的分类。在此分类的基础上,我们引入了第一个全面的基准,用于评估五个核心用例中的MLM,每个用例包含1,000个手动注释的数据点。该基准测试包括各种设置下的鲁棒性和灵敏度测试,包括背景噪声,说话者性别和口音。我们对15个最先进的多层模型的评估表明,没有一个模型在所有任务中始终优于其他模型。值得注意的是,我们发现了系统性的差异,模型在男性说话者身上表现更好,并观察到思维链提示可以降低具有大标签空间和窄决策边界的分类任务的性能。此外,我们研究了对特定领域数据进行微调的MLMs,与基础模型相比,改进了30%以上。这些发现突出了当前MLMs在语音语言病理学应用中的潜力和局限性,强调了进一步研究和有针对性的开发的必要性。


【44】Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
标题:非典型语音识别的独特建模与规范建模:结构障碍案例研究
链接:https://arxiv.org/abs/2509.16718

备注:Will appear in EMNLP 2025 Main Proceedings
摘要:最先进的自动语音识别(ASR)模型,如Whisper,在非典型语音上表现不佳,例如由构音障碍患者产生的语音。过去的作品,非典型语音大多研究完全个性化(或特质)的模型,但建模策略,既可以概括和处理特质可以更有效地捕捉非典型语音。为了研究这一点,我们比较了四种策略:(a)在典型语音上训练的$\textit{normal}$模型(无个性化),(b)完全个性化的$\textit{idiosyncratic}$模型,(c)在其他构音障碍说话者上训练的$\textit{dysarthric-normal}$模型,和(d)$\textit{dysarthric-idiosyncratic}$模型,通过在适应个人语音之前首先建模规范模式来组合策略。在本案例研究中,我们发现构音障碍-特质模型的性能优于特质方法,同时需要不到一半的个性化数据(128个训练大小的WER为36.43,256个为36.99)。此外,我们发现单独调整语音编码器(与LM解码器相反)产生了最好的结果,平均将字错误率从71%降低到32%。我们的研究结果强调了利用规范(跨扬声器)和特质(扬声器特定)模式来改善代表性不足的语音人群的ASR的价值。


【45】Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
标题:Speech-to-See:端到端语音驱动的开放集对象检测
链接:https://arxiv.org/abs/2509.16670

摘要:音频接地或语音驱动的开集对象检测旨在直接从语音中定位和识别对象,从而实现超出预定义类别的泛化。这项任务对于像人机交互这样的应用程序至关重要,因为文本输入是不切实际的。然而,在这一领域的进展面临着一个根本的瓶颈,从大规模的,成对的音频图像数据的稀缺性,并进一步受到以前的方法,依赖于间接的,文本为媒介的管道。在本文中,我们介绍了Speech-to-See(Speech 2See),这是一种建立在预训练和微调范式基础上的端到端方法。具体来说,在预训练阶段,我们设计了一个查询引导的语义聚合模块,该模块采用可学习的查询来将冗余的语音嵌入压缩成紧凑的语义表示。在微调过程中,我们采用了参数高效的LoRA专家混合(MoLE)架构,以实现更深入,更细致的跨模式适应。大量的实验表明,Speech 2See在多个基准测试中具有鲁棒性和自适应性,证明了其强大的泛化能力和广泛的适用性。


【46】On the de-duplication of the Lakh MIDI dataset
标题:关于Lakh Buttons数据集的重复数据消除
链接:https://arxiv.org/abs/2509.16662

备注:The paper has been accepted for publication at ISMIR 2025
摘要:大规模数据集对于训练一个通用的深度学习模型至关重要。大多数这样的数据集是通过从各种互联网资源中抓取来收集的,不可避免地会引入重复的数据。在符号音乐领域,这些重复通常来自多个用户的安排和简单编辑后的元数据更改。然而,尽管存在一些关键问题,例如随机分割期间数据泄漏导致的不可靠的训练评估,但数据集重复在MIR社区中尚未得到广泛解决。本研究调查的数据集重复的问题,在符号音乐领域的最大的公开来源之一,Lakh的数据集(LMD)。为了找到和评估重复数据的最佳检索方法,我们采用了LMD的Clean Rounds子集作为基准测试集,其中相同歌曲的不同版本被分组在一起。我们首先评估了基于规则的方法和以前的符号音乐检索模型的重复数据删除,并研究了基于对比学习的BERT模型与各种增强,以找到重复的文件。因此,我们提出了三种不同版本的LMD过滤列表,在178,561个文件中,在最保守的设置中过滤出至少38,134个样本。


【47】AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
标题:DCASE 2025的AISTA实验室系统Task6:基于语音的音频检索
链接:https://arxiv.org/abs/2509.16649

备注:5 pages, 1 figure, DCASE2025 Task2 technical report
摘要:本报告介绍了AISTAT团队对DCASE 2025任务6中基于语言的音频检索任务的提交。我们提出的系统采用双编码器架构,其中音频和文本模态分别编码,并使用对比学习对齐它们的表示。从前一年挑战的方法学中汲取灵感,我们实施了一种蒸馏方法,并利用大型语言模型(LLM)进行有效的数据增强技术,包括反向翻译和LLM混合。此外,我们还结合了聚类来引入辅助分类任务,以便进一步进行微调。在Clotho开发测试中,我们最好的单个系统的mAP@16达到了46.62,而四个系统的集合达到了48.83的mAP@16。


【48】Barwise Section Boundary Detection in Symbolic Music Using Convolutional Neural Networks
标题:利用卷积神经网络进行符号音乐中的巴氏段边界检测
链接:https://arxiv.org/abs/2509.16566

摘要:目前的音乐结构分析(MSA)方法主要集中在音频数据。虽然符号音乐可以合成到音频中并使用现有的MSA技术进行分析,但这种方法并没有利用符号音乐丰富的音高,计时和乐器的明确表示。MSA的一个关键子问题是部分边界检测-确定是否在一个给定的时间点标记的音乐部分之间的过渡。本文研究了符号音乐的自动分段边界检测问题。首先,我们介绍了一个用于截面边界检测的人工注释的数据集,它由我们从Lakh数据集手动管理的6134个数据文件的元数据组成。第二,我们训练深度学习模型,以分类固定长度音乐窗口内的节边界的存在。我们的数据表示涉及到一种新的编码方案的基础上合成泛音编码成3通道钢琴卷的任意乐器。我们的模型实现了0.77的F1得分,比基于类似音频的监督学习方法和无监督块匹配分割(CBM)音频方法分别提高了0.22和0.31。我们发布数据集、代码和模型。


【49】Etude: Piano Cover Generation with a Three-Stage Approach -- Extract, strucTUralize, and DEcode
标题:练习曲:三阶段方法的钢琴翻唱--提取、结构化和解码
链接:https://arxiv.org/abs/2509.16522

摘要:钢琴翻唱生成的目标是自动将流行歌曲转换为钢琴编曲。虽然已经提出了许多深度学习方法,但现有的模型通常无法与原始歌曲保持结构一致性,这可能是由于缺乏节拍感知机制或难以建模复杂的节奏模式。节奏信息是至关重要的,因为它定义了结构相似性(例如,节奏,BPM),并直接影响所生成的音乐的整体质量。   在本文中,我们介绍了练习曲,一个三阶段的体系结构,包括提取,结构化,和解码阶段。通过预提取节奏信息,并应用一种新颖的,简化的基于REMI的标记化,我们的模型产生的封面,保留适当的歌曲结构,增强流畅性和音乐动态,并通过风格注入支持高度可控的生成。与人类听众的主观评价表明,练习曲大大优于以前的模型,达到了与人类作曲家相当的质量水平。


【50】LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging
标题:LenslessMic:通过Lensless计算成像进行音频加密和认证
链接:https://arxiv.org/abs/2509.16418

备注:Submitted to ICASSP 2026
摘要:随着社会对数字数据共享的日益依赖,敏感信息的保护变得至关重要。加密是保护隐私的方法之一;然而,它在音频领域的实现主要依赖于信号处理或嵌入硬件的软件方法。在本文中,我们介绍了LenslessMic,一种基于硬件的混合光学加密方法,利用无透镜摄像头作为适用于多种类型音频的物理安全层。我们表明,LenslessMic能够实现(1)强大的录音认证和(2)加密强度,可以与256位数字标准的搜索空间相媲美,同时保持高质量的信号和最小的内容信息丢失。该方法通过低成本的Raspberry Pi原型进行了验证,并与数据集一起开源,以促进该领域的研究。


机器翻译由腾讯交互翻译提供,仅供参考