今日论文合集:cs.SD语音52篇,eess.AS音频处理70篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】 Efficient Speech Translation through Model Compression and Knowledge  Distillation
标题: 通过模型压缩和知识蒸馏实现高效语音翻译
链接:https://arxiv.org/abs/2505.20237
作者: Yasmin Moslem 
备注:IWSLT 2025
摘要:用于语音翻译的大型音频语言模型的有效部署仍然具有挑战性,因为它们具有显著的计算要求。在本文中,我们通过我们的系统提交到国际口语翻译会议(IWITH 2025)的“模型压缩”轨道来解决这一挑战。我们实验的方法组合,包括迭代层修剪层重要性评估的基础上,低秩自适应与4位量化(QLoRA),和知识蒸馏。在我们的实验中,我们使用Qwen 2-Audio-7 B-Instruct进行德语和汉语的语音翻译。我们修剪后的(学生)模型在模型参数和存储空间方面都减少了50%,同时保留了域内(教师)模型的97-100%的翻译质量。

【2】 Automated data curation for self-supervised learning in underwater  acoustic analysis
标题: 水下声学分析中自我监督学习的自动化数据策展
链接:https://arxiv.org/abs/2505.20066
作者: Hilde I Hummel,  Sandjai Bhulai,  Burooj Ghani,  Rob van der Mei 
摘要:海洋生态系统的可持续性受到日益严重的声音污染的威胁,因此监测对于了解其可变性和影响至关重要。被动声监测(PAM)系统收集大量的水下声音记录,但大量的数据使得手动分析变得不可能,从而产生了自动化的需求。虽然机器学习提供了一个潜在的解决方案,但大多数水下声学记录都是未标记的。自监督学习模型在计算机视觉、自然语言处理和音频等各个领域的大规模未标记数据学习中取得了成功。然而,这些模型需要大型、多样和平衡的数据集进行训练,以便很好地推广。为了解决这个问题,提出了一个完全自动化的自我监督数据管理管道,以从原始PAM数据创建多样化和平衡的数据集。它将自动识别系统(AIS)数据与美国水域中各种水听器的记录相结合。使用分层k-means聚类,对原始音频数据进行采样,然后与AIS样本相结合,以创建平衡和多样化的数据集。由此产生的策划数据集可以开发自我监督学习模型,促进各种任务,如监测海洋哺乳动物和评估声音污染。

【3】 Towards Video to Piano Music Generation with Chain-of-Perform Support  Benchmarks
标题: 通过表演链支持基准迈向视频到钢琴音乐生成
链接:https://arxiv.org/abs/2505.20038
作者: Chang Liu,  Haomin Zhang,  Shiyu Xia,  Zihao Chen,  Chaofan Ding,  Xin Yue,  Huizhe Chen,  Xinhan Di 
备注:4 pages, 1 figure, accepted by CVPR 2025 MMFM Workshop
摘要:从视频中生成高质量的钢琴音频需要视觉提示和音乐输出之间的精确同步,以确保准确的语义和时间对齐。然而,现有的评估数据集无法完全捕获钢琴音乐生成所需的复杂同步。一个全面的基准是必不可少的,主要有两个原因:(1)现有的指标未能反映视频到钢琴音乐交互的复杂性,(2)专用的基准数据集可以提供有价值的见解,以加速高质量钢琴音乐生成的进展。为了应对这些挑战,我们引入了CoP Benchmark Dataset,这是一个完全开源的多模式基准测试,专为视频引导钢琴音乐生成而设计。建议的Chain-of-Perform(CoP)基准提供了几个引人注目的功能:(1)详细的多模态注释,通过逐步的Chain-of-Perform指导实现视频内容和钢琴音频之间的精确语义和时间对齐;(2)通用的评估框架,用于严格评估通用和专用的视频到钢琴生成任务;以及(3)数据集、注释和评估协议的完全开源。该数据集可在https://github.com/acappemin/Video-to-Audio-and-Piano上公开获取,并不断更新排行榜,以促进该领域的持续研究。

【4】 DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
标题: DeepDialogue:一个多话轮、语义丰富的口语对话数据集
链接:https://arxiv.org/abs/2505.19978
作者: Alkis Koudounas,  Moreno La Quatra,  Elena Baralis 
备注:Currently under review. See the official website: this https URL
摘要:会话人工智能的最新进展在单轮响应方面表现出令人印象深刻的能力,但即使是最复杂的语言模型,多轮对话仍然具有挑战性。目前的对话数据集在情感范围、领域多样性、转向深度方面都有局限,而且主要是纯文本的,这阻碍了开发更人性化的跨模式对话系统的进展。为了解决这些局限性,我们提出了DeepDialogue,这是一个大规模的多模态数据集,包含40,150个高质量的多回合对话,跨越41个领域,并将20种不同的情绪与连贯的情绪进展相结合。我们的方法将9种不同的语言模型(4 B-72 B参数)配对,生成65,600个初始对话,然后通过人工注释和基于LLM的质量过滤相结合进行评估。由此产生的数据集揭示了基本的见解:较小的模型无法保持超过6个对话回合的连贯性;具体领域(例如,“汽车”,“旅行”)比抽象的对话(例如,“哲学”);跨模型交互比同模型对话产生更多连贯的对话。DeepDialogue的一个关键贡献是它的语音组件,我们为所有40,150个对话合成了情感一致的声音,创建了第一个大规模开源多模态对话数据集,忠实地保留了多轮对话中的情感背景。

【5】 Novel Loss-Enhanced Universal Adversarial Patches for Sustainable  Speaker Privacy
标题: 新型损失增强通用对抗补丁,可持续发言人隐私
链接:https://arxiv.org/abs/2505.19951
作者: Elvir Karimov,  Alexander Varlamov,  Danil Ivanov,  Dmitrii Korzh,  Oleg Y. Rogov 
备注:5 pages, 3 figures, 1 table; Submitted to Interspeech 2025
摘要:目前,深度学习语音模型已被广泛使用,但个人数据(如人类身份和语音内容)的安全处理仍然值得怀疑。为了防止恶意用户识别,提出了说话人匿名方法。目前的方法,特别是基于通用对抗补丁(UAP)的应用程序,有缺点,如音频质量显着下降,语音识别质量下降,跨不同的语音生物识别模型的可转移性低,和性能依赖于输入音频长度。为了减轻这些缺点,在这项工作中,我们引入并利用新的指数总方差(TV)损失函数,并提供实验证据表明它对UAP强度和不可感知性产生积极影响。此外,我们提出了一种新的可扩展的UAP插入过程,并证明其一致的高性能为各种音频长度。

【6】 ALAS: Measuring Latent Speech-Text Alignment For Spoken Language  Understanding In Multimodal LLMs
标题: ALAS:多模态LLM口语理解的潜在语音-文本对齐测量
链接:https://arxiv.org/abs/2505.19937
作者: Pooneh Mousavi,  Yingzhi Wang,  Mirco Ravanelli,  Cem Subakan 
摘要:大语言模型在口语理解中有着广泛的应用。最近的SLU模型通过将语音输入适配到LLM中来直接处理音频,以实现更好的多模态学习。这些模型的一个关键考虑因素是文本和音频模态之间的跨模态对齐,这是LLM是否能够将语义与音频片段相关联的一个标志。虽然存在用于融合这些模态的各种方法,但是没有标准度量来评估LLM中的对准质量。在这项工作中,我们提出了一个新的度量,ALAS(自动潜在对齐分数)。我们的研究探讨了音频和文本表示之间的相关性,跨Transformer层,两个不同的任务(口语提问和情感识别)。我们展示了我们的指标在不同的层和不同的任务中的表现。

【7】 EmoSphere-SER: Enhancing Speech Emotion Recognition Through Spherical  Representation with Auxiliary Classification
标题: 球面-SER:通过辅助分类的球面表示增强语音情感识别
链接:https://arxiv.org/abs/2505.19693
作者: Deok-Hyeon Cho,  Hyung-Seok Oh,  Seung-Bin Kim,  Seong-Whan Lee 
备注:Proceedings of Interspeech 2025
摘要:语音情感识别使用离散标签或连续维度(如唤醒、效价和支配(VAD))从语音信号中预测说话人的情感状态。我们提出了一个联合模型,它集成了球形VAD区域分类来指导VAD回归,以改善情感预测。在我们的框架中,VAD值被转换为球坐标,球坐标被划分为多个球形区域,辅助分类任务预测每个点属于哪个球形区域,指导回归过程。此外,我们还结合了动态加权方案和具有多头自注意力的风格池层,以捕获频谱和时间动态,进一步提高性能。这种组合训练策略加强了结构化学习,提高了预测一致性。实验结果表明,我们的方法超过基线方法,证实了所提出的框架的有效性。

【8】 DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised  Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
标题: Difference-TTS:通过自监督蒸馏的分离情感表示用于文本到语音的跨说话人情感传递
链接:https://arxiv.org/abs/2505.19687
作者: Deok-Hyeon Cho,  Hyung-Seok Oh,  Seung-Bin Kim,  Seong-Whan Lee 
备注:Proceedings of Interspeech 2025
摘要:语音合成中的跨说话人情感传递依赖于提取与说话人无关的情感嵌入,以便在不保留说话人特征的情况下进行准确的情感建模。然而,现有的音色压缩方法不能完全分离说话人和情感特征,导致说话人泄漏和合成质量下降。为了解决这一问题,我们提出了一种自我监督的蒸馏方法,以最大限度地减少情感信息的损失,并保持扬声器的身份。我们引入聚类驱动的采样和信息扰动,以保持情感,同时删除无关因素。为了促进这一过程,我们提出了一种情感聚类和匹配方法,使用情感属性预测和说话人嵌入,使泛化到未标记的数据。此外,我们设计了一个双调节Transformer,以更好地集成风格功能。实验结果证实了我们的方法在学习与说话人无关的情感嵌入的有效性。

【9】 Automated evaluation of children's speech fluency for low-resource  languages
标题: 低资源语言儿童言语流利度的自动评估
链接:https://arxiv.org/abs/2505.19671
作者: Bowen Zhang,  Nur Afiqah Abdul Latiff,  Justin Kan,  Rong Tong,  Donny Soh,  Xiaoxiao Miao,  Ian McLoughlin 
备注:5 pages, 2 figures, conference
摘要:在教育中对儿童的口语流利程度的评估对于大多数语言来说是很好的研究,但对于低资源语言来说仍然具有高度挑战性。本文提出了一个系统,自动评估流利性相结合的微调多语言ASR模型,客观指标提取阶段,和生成预训练Transformer(GPT)网络。客观指标包括语音和单词错误率,语音速率和语音暂停持续时间比。这些由一个基于GPT的分类器进行解释,该分类器由一小组人类评估的地面真实示例指导,以获得流畅性。我们在两种低资源语言泰米尔语和马来语的儿童语音数据集上评估了所提出的系统,并将分类性能与随机森林和XGBoost进行了比较,并使用ChatGPT-4 o直接从语音输入中预测流畅度。结果表明,所提出的方法实现了显着更高的精度比多模态GPT或其他方法。

【10】 Reshaping Representation Space to Balance the Safety and Over-rejection  in Large Audio Language Models
标题: 重塑表示空间以平衡大型音频语言模型中的安全性和过度拒绝
链接:https://arxiv.org/abs/2505.19670
作者: Hao Yang,  Lizhen Qu,  Ehsan Shareghi,  Gholamreza Haffari 
摘要:大型音频语言模型(LALM)通过支持基于音频的人类交互扩展了大型语言模型(LLM)的功能。然而,最近的研究表明,LALM仍然容易受到有害的查询,由于不充分的安全对齐。尽管文本和视觉LLM的防御措施取得了进展,但特别针对LALM的有效安全对齐策略和音频安全数据集明显缺乏。与此同时,基于监督微调(SFT)的防御措施努力解决安全改进问题,同时避免过度拒绝问题,从而显着影响有用性。在这项工作中,我们提出了一种无监督的安全微调策略作为补救措施,重塑模型的表示空间,以提高现有的LALM安全对齐,同时平衡过度拒绝的风险。我们在三代Qwen LALM上进行的实验表明,我们的方法在三种模态输入条件下(音频文本,纯文本和纯音频)显着提高了LALM的安全性,同时平均只增加了0.88%的过度拒绝率。警告:本文包含有害的示例。

【11】 A Comprehensive Real-World Assessment of Audio Watermarking Algorithms:  Will They Survive Neural Codecs?
标题: 音频水印算法的全面现实评估:它们能在神经编解码器中生存吗?
链接:https://arxiv.org/abs/2505.19663
作者: Yigitcan Özer,  Woosung Choi,  Joan Serrà,  Mayank Kumar Singh,  Wei-Hsiang Liao,  Yuki Mitsufuji 
备注:5 pages; 5 tables; accepted at INTERSPEECH 2025
摘要:我们提出了一个框架,以促进基于深度学习的音频水印算法的评估,建立一个标准化的基准,并允许系统的比较。为了模拟真实世界的使用,我们引入了一个全面的音频攻击管道,具有各种失真,如压缩,背景噪声和混响,并提出了一个多样化的测试数据集,包括语音,环境声音和音乐录音。通过评估我们框架上四种现有水印算法的性能,有两个主要见解脱颖而出:(i)神经压缩技术构成了最重大的挑战,即使算法是使用此类压缩进行训练的;(ii)使用音频攻击进行训练通常可以提高鲁棒性,尽管在某些情况下还不够。此外,我们发现,特定的失真,如极性反转,时间拉伸,或混响,严重影响某些算法。我们的贡献加强了音频水印算法在广泛应用中的鲁棒性和感知评估,同时确保了公平和一致的评估方法。评估框架(包括攻击管道)可在github.com/SonyResearch/wm_robustness_eval上访问。

【12】 SACM: SEEG-Audio Contrastive Matching for Chinese Speech Decoding
标题: SACM:用于中文语音解码的SEEG-音频对比匹配
链接:https://arxiv.org/abs/2505.19652
作者: Hongbin Wang,  Zhihong Jia,  Yuanzhong Shen,  Ziwei Wang,  Siyang Li,  Kai Shu,  Feng Hu,  Dongrui Wu 
摘要:言语障碍,如构音障碍和构音障碍,可严重损害病人的口头沟通能力。语音解码脑机接口(BCI)提供了一个潜在的替代方案,直接将语音意图翻译成口语,作为语音神经假体。本文提出了一种汉语语音解码BCI的实验方案和相应的解码算法。立体脑电图(SEEG)和同步音频数据收集从8个耐药癫痫患者,因为他们进行了一个字级的阅读任务。所提出的SEEG和音频对比匹配(SACM),一个基于对比学习的框架,实现了解码精度显着超过机会水平的语音检测和语音解码任务。电极方面的分析表明,一个单一的感觉运动皮层电极实现的性能与全电极阵列。这些发现为开发更准确的在线语音解码BCI提供了有价值的见解。

【13】 STOPA: A Database of Systematic VariaTion Of DeePfake Audio for Open-Set  Source Tracing and Attribution
标题: STOPA:一个用于开集源追踪和归因的Deepfake音频系统变异数据库
链接:https://arxiv.org/abs/2505.19644
作者: Anton Firc,  Manasi Chibber,  Jagabandhu Mishra,  Vishwanath Pratap Singh,  Tomi Kinnunen,  Kamil Malinka 
备注:Accepted to Interspeech 2025 conference
摘要:Deepfake语音检测的一个关键研究领域是源跟踪-确定合成话语的起源。所述方法可涉及识别声学模型(AM)、声码器模型(VM)或其它世代特定参数。然而,由于缺乏专门的、系统化的数据集,进展受到限制。为了解决这个问题,我们引入了STOPA,这是一个系统多样且元数据丰富的数据集,用于deepfake语音源跟踪,涵盖了来自13个不同合成器的70万个样本的8个AM,6个VM和各种参数设置。与现有的数据集不同,这些数据集通常具有有限的变化或稀疏的元数据,STOPA提供了一个系统控制的框架,涵盖了更广泛的生成因素,例如声码器模型,声学模型或预训练权重的选择,以确保更高的归因可靠性。这种控制提高了归因准确性,有助于法医分析,deepfake检测和生成模型透明度。

【14】 Decoding Speaker-Normalized Pitch from EEG for Mandarin Perception
标题: 从脑电中解码说话者标准化音调以实现普通话感知
链接:https://arxiv.org/abs/2505.19626
作者: Jiaxin Chen,  Yiming Wang,  Ziyu Zhang,  Jiayang Han,  Yin-Long Liu,  Rui Feng,  Xiuyuan Liang,  Zhen-Hua Ling,  Jiahong Yuan 
摘要:同一语音内容由不同说话人发出时,其音高轮廓有显著差异,但听者的语义感知却不受影响。这种现象可能源于大脑对音高轮廓的感知与个体扬声器的音高范围无关。在这项工作中,我们记录了脑电图(EEG),而受试者听汉语单音节词与不同的音调,音素,和扬声器。CE-ViViT模型被提出来直接从EEG解码原始或说话者归一化的基音轮廓。实验结果表明,该模型可以解码音高轮廓与适度的错误,实现性能媲美国家的最先进的脑电回归方法。此外,说话人归一化基音轮廓解码更准确,支持相对音高的神经编码。

【15】 Training-Free Multi-Step Audio Source Separation
标题: 免训练多步骤音频源分离
链接:https://arxiv.org/abs/2505.19534
作者: Yongyi Zang,  Jingyi Li,  Qiuqiang Kong 
摘要:音频源分离的目的是将混合信号分离成目标源。以往的音频源分离系统通常进行一步推理,没有充分挖掘模型的分离能力。在这项工作中,我们揭示了预训练的一步音频源分离模型可以用于多步分离,而无需额外的训练。我们提出了一个简单而有效的推理方法,迭代应用分离最佳混合输入混合与前一步的分离结果。在每一步中,我们通过最大化度量来确定最佳混合比例。我们证明了我们的方法总是比一步推理得到改进,提供基于模型平滑性和度量鲁棒性的误差界,并提供理论分析,将我们的方法与噪声和干净分布之间的线性插值路径去噪连接起来,这是我们与去噪扩散桥模型联系起来的一个属性。我们的方法有效地提供了改进的分离性能,作为现有模型的“免费午餐”。我们的实证结果表明,我们的多步分离方法在语音增强和音乐源分离任务中始终优于一步推理,并且可以实现类似于训练更大模型的缩放性能,使用更多数据,或者在某些情况下采用多步训练目标。这些改进不仅出现在多步推理期间的优化度量上,而且还扩展到几乎所有非优化度量(有一个例外)。我们还讨论了我们的方法的局限性和未来的研究方向。

【16】 Multi-Channel Acoustic Echo Cancellation Based on Direction-of-Arrival  Estimation
标题: 基于到达方向估计的多通道声学回声抵消
链接:https://arxiv.org/abs/2505.19493
作者: Fei Zhao,  Xueliang Zhang,  Zhong-Qiu Wang 
备注:Accepted by Interspeech 2025
摘要:声学回声消除(AEC)是一种重要的语音信号处理技术,它可以消除麦克风信号中的回声,使语音通信听起来更自然。虽然单通道AEC被广泛采用,但多通道AEC可以利用多个麦克风提供的空间线索来实现更好的性能。现有的多通道AEC方法通常将波束成形与深度神经网络(DNN)相结合。这项工作提出了一个两阶段的算法,提高多通道AEC,通过将声源方向线索。具体地,首先训练轻量级DNN来预测声源方向,然后将预测的方向信息、多通道麦克风信号和单通道远端信号联合馈送到AEC网络中以估计近端信号。评估结果表明,该算法优于基线方法,并在不同的声学环境中表现出强大的泛化能力。

【17】 Room Impulse Response as a Prompt for Acoustic Echo Cancellation
标题: 作为声学回声消除提示的房间脉冲响应
链接:https://arxiv.org/abs/2505.19480
作者: Fei Zhao,  Shulin He,  Xueliang Zhang 
备注:Accepted by Interspeech 2025
摘要:数据驱动的声学回声消除(AEC)方法主要在合成或受约束的真实世界数据集上训练,在看不见的回声场景中遇到性能下降,特别是在回声路径不可直接观察的真实环境中。我们提出的方法通过将房间脉冲响应(RIR)作为关键的训练提示来克服这一限制,旨在提高AEC模型在这种不可预见条件下的泛化能力。我们还探讨了四种RIR快速融合方法。全面的评估,包括在未知条件下的模拟RIR和真实记录的RIR,表明所提出的方法显着提高性能相比,基线模型。这些结果证实了我们的RIR指导的方法在加强模型的泛化能力的有效性。

【18】 RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive  Language-Audio Pretraining For Speech Retrieval
标题: RA-CLAP:语音检索的语音增强情感说话风格对比语音音频预训练
链接:https://arxiv.org/abs/2505.19437
作者: Haoqin Sun,  Jingguang Tian,  Jiaming Zhou,  Hui Wang,  Jiabei He,  Shiwan Zhao,  Xiangyu Kong,  Desheng Hu,  Xinkang Xu,  Xinhui Hu,  Yong Qin 
摘要:对比存储-音频预训练(CLAP)模型在一般的音频预处理相关任务(如音频检索)中表现出出色的性能。然而,在新兴的情感说话风格描述(ESSD)领域,跨模态对比预训练仍然在很大程度上未被探索。在本文中,我们提出了一种新型的语音检索任务,称为情感说话风格检索(ESSR),以及ESS-CLAP,这是一种为学习语音和自然语言描述之间的关系而量身定制的情感说话风格CLAP模型。此外,我们进一步提出了关系增强CLAP(RA-CLAP),以解决传统方法的局限性,假设一个严格的二元关系之间的字幕和音频。该模型利用自蒸馏学习语音和描述之间潜在的局部匹配关系,从而提高泛化能力。实验结果验证了RA-CLAP算法的有效性,为ESSD算法提供了有价值的参考。

【19】 GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style  Adaptor
标题: GSA-TTC:基于渐变风格适配器的Zero-Shot语音合成
链接:https://arxiv.org/abs/2505.19384
作者: Seokgi Lee,  Jungjun Kim 
备注:7 pages, 3 figures
摘要:我们提出了带有新型风格编码器的渐进风格适配器TTS(GSA-TTS),该编码器可以从声学参考逐渐编码说话风格,以进行零触发语音合成(zero-shot speech synthesis)。GSA首先捕获每个语义声音单元的本地风格。然后通过自注意将局部风格进行组合,得到全局风格条件。这种语义和分层编码策略为声学模型提供了鲁棒且丰富的风格表示。我们测试GSA-TTS看不见的扬声器,并获得有关自然度,扬声器相似性和可懂度有希望的结果。此外,我们探讨了潜在的GSA的可解释性和可控性,这源于其层次结构。

【20】 Towards Reliable Large Audio Language Model
标题: 迈向可靠的大型音频语言模型
链接:https://arxiv.org/abs/2505.19294
作者: Ziyang Ma,  Xiquan Li,  Yakun Song,  Wenxi Chen,  Chenpeng Du,  Jian Wu,  Yuanzhe Chen,  Zhuo Chen,  Yuping Wang,  Yuxuan Wang,  Xie Chen 
备注:ACL 2025 Findings
摘要:大型音频语言模型(LALM)的最新进展在语音、音乐和一般声音的普遍理解和推理方面展示了令人印象深刻的结果和广阔的前景。然而,这些模型仍然缺乏识别其知识边界的能力,并拒绝主动回答他们不知道的问题。虽然已经有成功的尝试,以提高可靠性的激光测距仪,可靠的激光测距仪仍然在很大程度上未经探索。在本文中,我们系统地研究了实现可靠LALM的各种方法,包括无需训练的方法,如多模态思想链(MCoT),以及基于训练的方法,如监督微调(SFT)。此外,我们发现以前的评估指标的局限性,并提出了一个新的度量,可靠性增益指数(RGI),以评估不同的可靠方法的有效性。我们的研究结果表明,无需训练和基于训练的方法都在不同程度上提高了LALM的可靠性。此外,我们发现,可靠性的意识是一种“Meta能力”,它可以跨不同的音频模态,虽然存在显着的结构和内容差异之间的声音,音乐和语音。

【21】 Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech  Representations Using a Simple Linear Equation
标题: Eta-WavLM:使用简单线性方程在自我监督语音表示中高效去除说话者身份
链接:https://arxiv.org/abs/2505.19273
作者: Giuseppe Ruggiero,  Matteo Testa,  Jurgen Van de Walle,  Luigi Di Caro 
备注:Full paper accepted at ACL 2025
摘要:自监督学习(SSL)通过从未注释的数据中学习有意义的表示,减少了对语音技术中昂贵的标记的依赖。由于大多数基于SSL的下游任务优先考虑语音中的内容信息,因此理想的表示应该将内容与SSL表示中的扬声器特性等不需要的变化分开。然而,去除说话人信息往往会降低其他语音成分,现有的方法要么无法完全解开说话人身份或需要资源密集型模型。在本文中,我们提出了一种新的解纠缠方法,线性分解成特定于扬声器和扬声器独立的组件的SSL表示,有效地产生扬声器解纠缠表示。综合实验表明,我们的方法实现了说话人独立性,因此,当应用于语音转换等内容驱动的任务时,我们的表示方法比最先进的方法有了显着的改进。

【22】 SpeakStream: Streaming Text-to-Speech with Interleaved Data
标题: SpeakStream:使用交织数据流传输文本到语音
链接:https://arxiv.org/abs/2505.19206
作者: Richard He Bai,  Zijin Gu,  Tatiana Likhomanenko,  Navdeep Jaitly 
摘要:传统文本到语音(TTS)系统的延迟瓶颈从根本上阻碍了会话AI中流式传输大型语言模型(LLM)的潜力。这些TTS系统通常在完整的话语上进行训练和推理,当与流式LLM输出耦合时,即使具有优化的推理速度,也会引入不可接受的延迟。这对于创建响应式会话代理尤其成问题,其中低第一令牌延迟是关键的。在本文中,我们提出了SpeakStream,流TTS系统,使用解码器的架构,从流文本增量生成音频。SpeakStream使用交织文本语音数据的下一步预测损失进行训练。在推理过程中,它在吸收流输入文本的同时增量地生成语音,使其特别适合于级联会话AI代理,其中LLM将文本流传输到TTS系统。我们的实验表明,SpeakStream在第一个令牌延迟方面实现了最先进的延迟结果,同时保持了非流式TTS系统的质量。

【23】 EnvSDD: Benchmarking Environmental Sound Deepfake Detection
标题: EnvSDD:环境声音Deepfake检测基准
链接:https://arxiv.org/abs/2505.19203
作者: Han Yin,  Yang Xiao,  Rohan Kumar Das,  Jisheng Bai,  Haohe Liu,  Wenwu Wang,  Mark D Plumbley 
备注:Accepted by Interspeech 2025
摘要:音频生成系统现在可以创建非常逼真的音景,可以增强媒体制作,但也会带来潜在风险。一些研究已经检查了语音或歌声中的deepfake。然而,环境声音具有不同的特征,这可能使得用于检测语音和唱歌的方法对真实世界的声音不那么有效。此外,现有的环境声音deepfake检测数据集在规模和音频类型方面受到限制。为了解决这一差距,我们引入了EnvSDD,这是第一个为这项任务设计的大规模策划数据集,包括45.25小时的真实音频和316.74小时的假音频。测试集包括各种条件来评估泛化能力,例如看不见的生成模型和看不见的数据集。我们还提出了一个基于预训练音频基础模型的音频深度伪造检测系统。EnvSDD的结果表明,我们提出的系统优于国家的最先进的系统从语音和歌唱领域。

【24】 BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual  Biasing ASR in Speech LLM
标题: BR-ASB:用于语音LLM中上下文偏置ASB的高效且可扩展的偏置检索框架
链接:https://arxiv.org/abs/2505.19179
作者: Xun Gong,  Anqi Lv,  Zhiming Wang,  Huijia Zhu,  Yanmin Qian 
备注:Accepted by InterSpeech 2025
摘要:虽然语音大语言模型(SpeechLLM)具有先进的标准自动语音识别(ASR),但命名实体和稀有词的上下文偏置仍然具有挑战性,特别是在规模上。为了解决这个问题,我们提出了BR-ASR:一个大规模上下文偏置(高达20万个条目)的偏置检索框架,通过两个创新:(1)语音和偏置对比学习检索语义相关的候选人;(2)动态课程学习,减轻同音混淆,这对最终的表现产生负面影响。这是一个通用框架,允许将检索到的候选项无缝集成到不同的ASR系统中,而无需进行微调。LibriSpeech test-clean/-other的实验在2000个偏置词的情况下实现了2.8%/7.1%的最先进的(SOTA)偏置词错误率(B-WER),与现有方法相比,相对提高了45%。BR-ASR还展示了高可扩展性:当将偏置列表扩展到200 k时,传统方法通常会失败,它仅引起0.3 / 2.9%的绝对WER / B-WER降级,修剪率为99.99%,每个查询的测试延迟仅为20 ms。

【25】 CloneShield: A Framework for Universal Perturbation Against Zero-Shot  Voice Cloning
标题: CloneShield:针对Zero-Shot语音克隆的普遍扰动框架
链接:https://arxiv.org/abs/2505.19119
作者: Renyuan Li,  Zhibo Liang,  Haichuan Zhang,  Tianyu Shi,  Zhiyuan Cheng,  Jia Shi,  Carl Yang,  Mingjie Tang 
备注:10pages, 4figures
摘要:最近文本到语音(TTS)语音克隆的突破引起了严重的隐私问题,允许从几秒钟的参考音频中高度准确地复制声音身份,同时保留说话者的声音真实性。在本文中,我们介绍克隆盾,一个通用的时域对抗扰动框架,专门设计用于防御zero-shot语音克隆。我们的方法提供了保护,是强大的扬声器和话语,而不需要任何先验知识的合成文本。我们将扰动生成归结为一个多目标优化问题,并提出了多梯度下降算法(MGDA),以确保对不同话语的鲁棒保护。为了保持用户的自然听觉感知,我们通过Mel频谱图表示分解对抗扰动,并对每个样本进行微调。这种设计确保了不可感知性,同时保持了对zero-shot克隆输出的强烈降级效果。三个国家的最先进的zero-shot TTS系统,五个基准数据集和60个人类听众的评价实验表明,我们的方法保留了近原始的音频质量在受保护的输入(PESQ = 3.90,SRS = 0.93),而大大降低了扬声器的相似性和语音质量在克隆样本(PESQ = 1.07,SRS = 0.08)。

【26】 WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
标题: WHISTRASS:通过句子压力检测丰富Transit
链接:https://arxiv.org/abs/2505.19103
作者: Iddo Yosha,  Dorin Shteyman,  Yossi Adi 
备注:Accepted to Interspeech2025
摘要:口语不仅通过单词,而且通过语调、情感和强调来传达意思。句子重音是对句子中特定单词的强调,对于表达说话者的意图至关重要,在语言学中得到了广泛的研究。在这项工作中,我们介绍了WHISTRESS,一种无干扰的方法,用于增强具有句子重音检测的转录系统。为了支持这一任务,我们提出了TINYSTRESS-15 K,这是一种可扩展的合成训练数据,用于句子重音检测任务,该任务来自全自动数据集创建过程。我们在TINYSTRESS-15 K上对WHISTRESS进行训练,并根据几个竞争基准对其进行评估。我们的研究结果表明,WHISTRESS优于现有的方法,同时在训练或推理过程中不需要额外的输入先验。值得注意的是,尽管是在合成数据上训练的,但WHISTRESS在不同的基准测试中表现出强大的zero-shot泛化能力。项目页面:https://pages.cs.huji.ac.il/adiyoss-lab/whistress。

【27】 Self-supervised learning method using multiple sampling strategies for  general-purpose audio representation
标题: 使用多种采样策略进行通用音频表示的自我监督学习方法
链接:https://arxiv.org/abs/2505.18984
作者: Ibuki Kuroyanagi,  Tatsuya Komatsu 
备注:5 pages, 1 figure, 2 tables, ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
摘要:我们提出了一种自监督学习方法,使用多个采样策略,以获得通用的音频表示。在所提出的方法中使用多个采样策略来从不同的角度构造对比损失,并基于它们来学习表示。在这项研究中,除了广泛使用的剪辑级采样策略,我们引入了两个新的策略,帧级策略和特定任务的策略。所提出的多个策略提高了帧级分类和其他任务(如基音检测)的性能,这些任务不是传统的单限幅级采样策略的重点。我们在Audioset的一个子集上预训练了该方法,并将其应用于具有冻结权重的下游任务。该方法将剪辑分类、声音事件检测和基音检测性能分别提高了25%、20%和3.6%。

【28】 Serial-OE: Anomalous sound detection based on serial method with outlier  exposure capable of using small amounts of anomalous data for training
标题: Serial-OE:基于具有异常值暴露的序列方法的异常声音检测,能够使用少量异常数据进行训练
链接:https://arxiv.org/abs/2505.18982
作者: Ibuki Kuroyanagi,  Tomoki Hayashi,  Kazuya Takeda,  Tomoki Toda 
备注:39 pages, 5 figures, 5 tables, APSIPA Transactions on Signal and Information Processing
摘要:我们介绍Serial-OE,一种新的异常声音检测(ASD)方法,利用少量的异常数据来提高性能。由于从各种可能类型的设备故障中收集异常数据的成本,传统的ASD方法主要依赖于正常数据的建模。我们的方法通过实现一个离群值暴露框架来改进现有的ASD系统,该框架利用正常和伪异常数据进行训练,并且还能够使用少量的真实异常数据。使用DCASE 2020 Task 2数据集进行的综合评估表明,我们的方法优于最先进的ASD模型。我们还研究了在训练过程中使用少量异常数据、使用没有机器ID信息的数据以及使用受污染的训练数据对性能的影响。我们的实验结果揭示了在训练过程中使用非常有限的异常数据的潜力,以解决由于异常数据的稀缺而仅使用正常数据进行训练的现有方法的局限性。这项研究有助于该领域提出了一种方法,可以动态地适应,包括异常数据在ASD系统的操作阶段,铺平了道路,更准确的ASD。

【29】 Improving Anomalous Sound Detection through Pseudo-anomalous Set  Selection and Pseudo-label Utilization under Unlabeled Conditions
标题: 在无标签条件下通过伪异常集选择和伪标签利用提高异常声音检测
链接:https://arxiv.org/abs/2505.18980
作者: Ibuki Kuroyanagi,  Takuya Fujimura,  Kazuya Takeda,  Tomoki Toda 
备注:33 pages, 3 figures, 7 tables, APSIPA Transactions on Signal and Information Processing
摘要:本文讨论了性能下降时,既没有足够相似的机器数据,也没有运行状态标签异常声音检测(ASD)。我们提出了一个集成的管道,结合了三个互补的组件来自以前的工作,并将它们扩展到未标记的ASD设置。首先,我们采用基于异常分数的选择器来策划类似于目标机器的正常声音的外部音频数据。其次,我们利用三元组学习为未标记的数据分配伪标签,从而实现对操作声音的更精细分类和对细微异常的检测。第三,我们采用迭代训练来改进伪异常集选择和伪标签分配,逐步提高检测准确性。在DCASE 2022 -2024任务2数据集上的实验表明,在未标记的设置中,与传统方法相比,我们的方法实现了平均AUC增加超过6.6个点。在标记的设置中,结合来自伪异常集的外部数据进一步提高性能。这些结果突出了我们的方法在机器数据和标签稀缺的情况下的实用性和鲁棒性,以最小的注释工作促进了ASD在不同工业环境中的部署。

【30】 Audio Geolocation: A Natural Sounds Benchmark
标题: 音频地理定位:自然声音基准
链接:https://arxiv.org/abs/2505.18726
作者: Mustafa Chasmai,  Wuao Liu,  Subhransu Maji,  Grant Van Horn 
摘要:我们能仅仅从他们听到的声音来确定某人的地理位置吗?声学信号是否足以在一个国家、州甚至城市内进行定位?我们解决了全球范围内的音频地理定位的挑战,将问题形式化,并对来自iNatSounds数据集的野生动物音频进行了深入分析。采用视觉启发的方法,我们将音频记录转换为频谱图,并对现有的图像地理定位技术进行基准测试。我们假设,物种发声提供强大的地理定位线索,由于其定义的地理范围,并提出了一种方法,将物种范围预测与检索为基础的地理定位。我们进一步评估地理定位是否改善时,分析物种丰富的记录或跨时空的邻居聚合。最后,我们介绍了从电影的案例研究,探索多模态地理定位使用音频和视觉内容。我们的工作突出了整合音频和视觉线索的优势,并为音频地理定位的未来研究奠定了基础。

【31】 MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song  Translation
标题: MAGL:用于动画歌曲翻译的多语言音视频歌词数据集
链接:https://arxiv.org/abs/2505.18614
作者: Woohyun Cho,  Youngmin Kim,  Sunghyun Lee,  Youngjae Yu 
备注:28 pages, 8 figures
摘要:歌词翻译既要准确地传递语义,又要保持音乐节奏、音节结构和诗歌风格。在动画音乐剧中,由于视觉和听觉线索的一致性,挑战加剧。我们介绍了多语言音频视频歌词基准动画歌曲翻译(MAVL),第一个多语言,多模式的可唱歌词翻译基准。通过集成文本、音频和视频,MAVL可以实现比纯文本方法更丰富、更富有表现力的翻译。在此基础上,我们提出了音节约束的音频-视频LLM与思想链Sylvl-CoT,它利用音频-视频线索,并强制执行音节约束,以产生自然的歌词。实验结果表明,SylAVL-CoT显着优于基于文本的模型在唱性和上下文的准确性,强调多模态,多语言方法的歌词翻译的价值。

【32】 LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
标题: Listen:神经音频LLM的学习软令牌嵌入
链接:https://arxiv.org/abs/2505.18517
作者: Pooneh Mousavi,  Shubham Gupta,  Cem Subakan,  Mirco Ravanelli 
摘要:基于大型语言模型(LLM)的基础模型在处理各种任务和模态方面取得了巨大的成功。然而,由于声学环境和任务变化的差异,使这些模型适应通用的音频语言任务是具有挑战性的。在这项工作中,我们介绍了用于神经音频LLM的LiSTEN学习软令牌嵌入,这是一个用于使LLM适应语音和音频任务的框架。LiSTEN使用动态提示选择策略和可学习的键值对,允许模型平衡一般和特定于任务的知识,同时避免在多任务设置中过度拟合。我们的方法减少了对大规模ASR或字幕数据集的依赖,用更少的可训练参数实现了有竞争力的性能,并通过使用单阶段过程简化了训练。此外,LiSTEN通过分析不同任务中所选提示的多样性和重叠性来增强可解释性。

【33】 Learning Emotion-Invariant Speaker Representations for Speaker  Verification
标题: 用于说话人确认的不变性说话人表示学习方法
链接:https://arxiv.org/abs/2505.18498
作者: Jingguang Tian,  Xinhui Hu,  Xinkang Xu 
摘要:近年来,基于深度学习的说话人表征提取技术推动了说话人确认(SV)技术的快速发展。然而,这种表示仍然容易受到情绪变化的影响。为了解决这个问题,我们提出了多项改进训练扬声器编码器,以增加情感鲁棒性。首先,我们利用基于CopyPaste的数据增强来收集额外的并行数据,其中包括来自同一说话者的不同情感表达。其次,我们应用余弦相似性损失来限制平行样本对,并最大限度地减少说话人表示的类内变化,以减少其与情感信息的相关性。最后,我们使用情感感知掩蔽(EM)的基础上的语音信号能量的输入并行样本,以进一步加强说话人表示,使其情感不变。我们进行了全面的消融研究,以证明这些不同组件的有效性。实验结果表明,该方法与基线系统相比,EER降低了19.29%.

【34】 Token-Level Logits Matter: A Closer Look at Speech Foundation Models for  Ambiguous Emotion Recognition
标题: 令牌级日志很重要:仔细研究模糊情感识别的语音基础模型
链接:https://arxiv.org/abs/2505.18484
作者: Jule Valendo Halim,  Siyi Wang,  Hong Jia,  Ting Dang 
备注:Accepted at INTERSPEECH 2025
摘要:会话AI中的情商在人机交互等领域至关重要。虽然已经开发了许多模型,但它们往往忽略了人类情感固有的复杂性和模糊性。在大型语音基础模型(SFM)时代,了解其识别模糊情感的能力对于开发下一代情感感知模型至关重要。本研究探讨了SFM在模糊情绪识别中的有效性。我们设计了模糊的情感预测提示,并介绍了两种新的方法来推断模糊的情感分布:一个分析生成的文本响应和其他检查的内部处理的SFM通过令牌级logits。我们的研究结果表明,虽然SFM可能无法始终如一地为模糊的情绪生成准确的文本响应,但它们可以根据先验知识在令牌级别解释这些情绪,从而在不同的提示中表现出鲁棒性。

【35】 MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal  Prompt
标题: MPE-TTC:使用多模式提示的自定义情感Zero-Shot文本到语音
链接:https://arxiv.org/abs/2505.18453
作者: Zhichao Wu,  Yueteng Kang,  Songjun Cao,  Long Ma,  Qiulin Li,  Qun Yang 
备注:Accepted by InterSpeech
摘要:现有的Zero-Shot文本到语音(Zero-Shot Text-To-Speech,简称ZTTS)系统大多基于单一提示(如参考语音或文本描述)生成不可见的语音,这限制了它们的灵活性。提出了一种基于多模态提示的个性化情感语音合成系统。该系统将语音分解为内容、音色、情感和韵律,允许以文本、图像或语音的形式提供情感提示。为了从不同的提示中提取情感信息,我们提出了一种多模态提示情感编码器。此外,我们还引入了一个韵律预测器来拟合韵律的分布,并提出了一个情感一致性损失来保留预测韵律中的情感信息。采用基于扩散的声学模型来生成目标梅尔谱图。客观和主观的实验表明,我们的系统优于现有的系统在自然度和相似性。样本可在https://mpetts-demo.github.io/mpetts_demo/上获得。

【36】 ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic  Conditions Challenge
标题: ABHINAYA --自然条件挑战中的语音情感识别系统
链接:https://arxiv.org/abs/2505.18217
作者: Soumya Dutta,  Smruthi Balaji,  Varada R,  Viveka Salinamakki,  Sriram Ganapathy 
备注:5 pages, 2 figures, 4 tables, accepted at Interspeech 2025
摘要:自然环境下的语音情感识别(SER)仍然是一个挑战,由于固有的可变性,不同的记录条件,和类的不平衡。作为参与者的Interspeech自然SER挑战,专注于这些复杂性,我们提出了Abhinaya,一个系统集成语音为基础的,基于文本的,和语音文本模型。我们的方法微调自监督和语音大语言模型(SLLM)的语音表示,利用大语言模型(LLM)的文本上下文,并采用语音文本建模与SLLM捕捉细微差别的情感线索。为了对抗类别不平衡,我们应用定制的损失函数,并通过多数投票生成分类决策。尽管有一个模型没有经过完全训练,但Abhinaya系统在166个提交的数据中排名第四。在完成培训后,它在已发表的结果中实现了最先进的性能,证明了我们的方法在现实世界条件下的SER的有效性。

【37】 Discovering Interpretable Concepts in Large Generative Music Models
标题: 在大生成音乐模型中发现可解释的概念
链接:https://arxiv.org/abs/2505.18186
作者: Nikhil Singh,  Manuel Cherep,  Pattie Maes 
备注:16 pages, 9 figures
摘要:神经网络现在可以生成音乐等内容的保真度提供了一个科学机会:这些系统似乎已经通过统计学习学习了这些内容结构的隐含理论。这可以为人类生成媒体的理论提供一个新的视角。当这些表示与传统结构(例如音乐中的和弦进行)相一致时,它们展示了如何从统计数据中推断出这些结构。在它们出现分歧的地方,它们突出了我们理论框架中的潜在局限性--我们可能忽略了这些模式,但它们仍然具有重要的解释力。在本文中,我们专注于音乐生成器的具体情况。我们介绍了一种方法来发现音乐的概念,使用稀疏自动编码器(SAE),提取可解释的功能,从残余流激活的Transformer模型。我们通过提取大量特征并为它们生成自动标记和评估管道来评估这种方法。我们的研究结果揭示了熟悉的音乐概念和违反直觉的模式,在现有的理论或自然语言中缺乏明确的对应物。除了提高模型的透明度,我们的工作提供了一个新的经验工具,可能有助于发现组织原则的方式,逃避传统的分析和综合方法。

【38】 From Alignment to Advancement: Bootstrapping Audio-Language Alignment  with Synthetic Data
标题: 从一致到进步:利用合成数据引导音频语言一致
链接:https://arxiv.org/abs/2505.20166
作者: Chun-Yi Kuan,  Hung-yi Lee 
备注:Project Website: this https URL
摘要:音频感知的大型语言模型(ALLM)最近在理解和处理音频输入方面取得了很大进展。这些模型通常通过对音频相关任务的额外训练,从基于文本的大型语言模型(LLM)中改编而来。然而,这一适应过程存在两大局限性。首先,ALLM经常遭受灾难性的遗忘,其中重要的文本功能,如在音频数据上训练后的注意力跟随,会丢失。在某些情况下,模型甚至可能产生输入音频中不存在的声音,从而引发对其可靠性的担忧。其次,实现音频和语言之间的跨模态对齐通常依赖于用于指令调整的大量特定于任务的问答对,使得该过程资源密集型。为了解决这些问题,我们利用骨干LLM从ALLM合成通用标题风格的对齐数据。我们将此过程称为通过从骨干LLM(BALSa)生成合成数据的自举音频语言对齐。在BALSa的基础上,我们引入了LISTEN(通过扩展负样本学习识别声音),这是一种类似对比的训练方法,旨在提高ALLM区分存在和不存在声音的能力。我们进一步将BALSa扩展到多音频场景,其中该模型要么解释音频输入之间的差异,要么产生描述它们的统一标题,从而增强音频语言对齐。实验结果表明,我们的方法有效地减轻了音频幻觉,同时可靠地保持强大的性能,音频理解,推理和推理以下技能。此外,结合多音频训练进一步增强了模型的理解和推理能力。总的来说,BALSa为ALLM的开发提供了一种高效且可扩展的方法。

【39】 Improving Speech Emotion Recognition Through Cross Modal Attention  Alignment and Balanced Stacking Model
标题: 通过跨模式注意力对齐和平衡堆叠模型提高语音情感识别
链接:https://arxiv.org/abs/2505.20007
作者: Lucas Ueda,  João Lima,  Leonardo Marques,  Paula Costa 
备注:Accepted by INTERSPEECH 2025
摘要:情感在人类交互中起着重要作用,因此能够识别语音中情感的系统在人机交互中至关重要。语音情感识别(SER)是一个具有挑战性的问题,特别是在自然语音中,当可用的数据是不平衡的情绪。本文在2025年自然条件下语音情感识别挑战赛的背景下介绍了我们提出的系统。我们提出的架构利用跨模态,利用跨模态的注意力融合表示从不同的模态。为了解决类别不平衡问题,我们采用了两种训练设计:(i)加权交叉熵损失(WCE);(ii)WCE与额外的中性表达软边缘损失和平衡。我们总共训练了12个多模态模型,这些模型使用平衡堆叠模型进行组合。我们所提出的系统实现了MacroF 1得分为0.4094和准确率为0.4128的8类语音情感识别。

【40】 Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned  Step Sampling
标题: 通过经验修剪步骤采样加速基于流匹配的文本到语音
链接:https://arxiv.org/abs/2505.19931
作者: Qixi Zheng,  Yushen Chen,  Zhikang Niu,  Ziyang Ma,  Xiaofei Wang,  Kai Yu,  Xie Chen 
摘要:近年来,基于流匹配的文本到语音(TTS)模型,如Voicebox,E2 TTS和F5-TTS,引起了人们的极大关注。这些模型需要多个采样步骤来从噪声中重建语音,这使得推理速度成为一个关键挑战。减少采样步数可以大大提高推理效率。为此,我们引入了Fast F5-TTS,这是一种无需训练的方法,可以加速基于流匹配的TTS模型的推理。通过考察F5-TTS的采样轨迹,识别出冗余步长,并提出经验剪枝步长采样(EPSS),这是一种非均匀时间步长采样策略,有效地减少了采样步长。我们的方法在NVIDIA RTX 3090 GPU上实现了7步生成,推理RTF为0.030,比原来的F5-TTS快4倍,同时保持相当的性能。此外,EPSS在E2 TTS模型上表现良好,表现出较强的泛化能力。

【41】 Deep learning based spatial aliasing reduction in beamforming for audio  capture
标题: 基于深度学习的音频捕获束形成中的空间混叠减少
链接:https://arxiv.org/abs/2505.19781
作者: Mateusz Guzik,  Giulio Cengarle,  Daniel Arteaga 
备注:5 pages, 4 figures; accepted for presentation in Interspeech 2025
摘要:空间混叠影响间隔开的麦克风阵列,导致在某些频率以上的方向模糊,降低波束形成器的空间和频谱精度。鉴于传统信号处理的局限性和深度学习方法在空间混叠缓解方面的稀缺性,我们提出了一种新的方法,使用U-Net架构来预测信号相关的去混叠滤波器,该滤波器可以减少传统波束成形中的混叠,以实现空间捕获。考虑两种类型的多通道滤波器,一种是独立处理通道,另一种是模拟跨通道依赖关系。所提出的方法进行评估,在两个常见的空间捕获的情况下:立体声和一阶高保真度立体声。结果表明,一个非常显着的改善,客观和感性的,相对于传统的波束形成。这项工作显示了深度学习减少波束成形中混叠的潜力,从而改善了多麦克风设置。

【42】 Accelerating Diffusion-based Text-to-Speech Model Training with Dual  Modality Alignment
标题: 通过双语气对齐加速基于扩散的文本到语音模型训练
链接:https://arxiv.org/abs/2505.19595
作者: Jeongsoo Choi,  Zhikang Niu,  Ji-Hoon Kim,  Chunhui Wang,  Joon Son Chung,  Chen Xie 
备注:Interspeech 2025
摘要:本文的目标是优化基于扩散的文语转换模型的训练过程。虽然最近的研究取得了显着的进步,他们的训练需要大量的时间和计算成本,主要是由于在学习复杂的中间表示的扩散模型的隐式指导。为了解决这个问题,我们提出了A-DMA,这是一种有效的双模态对齐加速训练的策略。我们的方法引入了一种新的对齐管道,利用文本和语音模态:文本引导对齐,它结合了上下文表示,语音引导对齐,它细化了语义表示。通过将隐藏状态与判别特征对齐,我们的训练方案减少了对学习复杂表示的扩散模型的依赖。大量的实验表明,A-DMA的收敛速度提高了一倍,同时实现了优于基线的性能。代码和演示示例可在https://github.com/ZhikangNiu/A-DMA上获得

【43】 MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous  Decoding
标题: MFA-KWS:利用多头帧同步解码的有效关键字发现
链接:https://arxiv.org/abs/2505.19577
作者: Yu Xi,  Haoyu Li,  Xiaoyu Gu,  Yidi Jiang,  Kai Yu 
备注:TASLP under review
摘要:关键字定位(KWS)对于语音驱动的应用程序至关重要,要求准确性和效率。传统的基于ASR的KWS方法,如贪婪和波束搜索,探索整个搜索空间,而没有显式地优先考虑关键字检测,通常导致次优性能。在本文中,我们提出了一个有效的关键字特定的KWS框架,通过引入面向流媒体的CTC-传感器结合帧异步系统与多头帧异步解码(MFA-KWS)。具体来说,MFA-KWS采用关键字特定的语音同步解码CTC,并取代传统的RNN-T与令牌和持续时间转换器,以提高性能和效率。此外,我们还探索了各种分数融合策略,包括基于单帧和基于一致性的方法。大量的实验证明了MFA-KWS的优越性能,它在固定关键字和任意关键字数据集上都取得了最先进的结果,如Snips,MobvoiHotwords和LibriKWS-20,同时在嘈杂的环境中表现出很强的鲁棒性。在融合策略中,基于一致性的CDC-Last方法提供了最好的性能。此外,MFA-KWS在各种数据集的帧同步基线上实现了47%至63%的加速。大量的实验结果证实,MFA-KWS是一个有效的和高效的KWS框架,使其非常适合在设备上部署。

【44】 Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech  Enhancement
标题: Mel-McNet:在线多通道语音增强的Mel-Scale框架
链接:https://arxiv.org/abs/2505.19576
作者: Yujie Yang,  Bing Yang,  Xiaofei Li 
备注:Accepted by Interspeech 2025
摘要:在线多通道语音增强是近年来语音增强领域的研究热点。尽管Mel尺度频率比线性频率更符合人的听觉感知并且计算效率更高,但是在Mel频率域中实现的工作很少。为此,本工作提出了一个梅尔规模的框架(即梅尔-McNet)。它通过两个关键组件来处理频谱和空间信息:一个有效的STFT到Mel模块,将多通道STFT特征压缩到Mel频率表示中,以及一个修改后的McNet主干,直接在Mel域中操作,以生成增强的LogMel频谱。频谱可以直接输入声码器进行波形重建或输入ASR系统进行转录。在CHiME-3上的实验表明,Mel-McNet可以将计算复杂度降低60%,同时保持与原始McNet相当的增强和ASR性能。Mel-McNet也优于其他SOTA方法,验证了Mel尺度语音增强的潜力。

【45】 VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and  Extrapolation
标题: VoiceStar:具有持续时间控制和外推的稳健Zero-Shot自回归TTC
链接:https://arxiv.org/abs/2505.19462
作者: Puyuan Peng,  Shang-Wen Li,  Abdelrahman Mohamed,  David Harwath 
摘要:我们提出了VoiceStar,第一个zero-shot TTS模型,实现了输出持续时间控制和外推。VoiceStar是一种自回归编码器-解码器神经编解码器语言模型,它利用了一种新的进度监控旋转位置嵌入(PM-RoPE),并使用连续提示混合(CPM)训练进行训练。PM-RoPE使模型能够更好地对齐文本和语音标记,指示所生成语音的目标持续时间,并且还允许模型生成持续时间比期间看到的语音波形长得多的语音波形。CPM训练还有助于减轻训练/推理不匹配,并在说话人相似性和可懂度方面显着提高生成语音的质量。VoiceStar在短格式基准测试(如Librispeech和Seed-TTS)上的表现优于或与当前最先进的模型相当,在可理解性和自然度方面,在长格式/外推基准测试(20- 50秒)上的表现明显优于这些模型。代码和型号重量:https://github.com/jasonppy/VoiceStar

【46】 SoloSpeech: Enhancing Intelligibility and Quality in Target Speech  Extraction through a Cascaded Generative Pipeline
标题: SoloSpeech:通过级联生成管道增强目标语音提取的可理解性和质量
链接:https://arxiv.org/abs/2505.19314
作者: Helin Wang,  Jiarui Hai,  Dongchao Yang,  Chen Chen,  Kai Li,  Junyi Peng,  Thomas Thebaud,  Laureano Moro Velazquez,  Jesus Villalba,  Najim Dehak 
摘要:目标语音提取(TSE)旨在通过利用说话者特定的线索(通常作为辅助音频(a.k.a.提示音频)。尽管TSE的最新进展主要采用了提供高感知质量的判别模型,但这些模型通常会引入不需要的伪影,降低自然度,并且对训练和测试环境之间的差异很敏感。另一方面,TSE的生成模型在感知质量和可理解性方面滞后。为了解决这些挑战,我们提出了SoloSpeech,一种新型的级联生成流水线,集成了压缩,提取,重建和校正过程。SoloSpeech具有一个无说话者嵌入的目标提取器,该提取器利用来自线索音频的潜在空间的条件信息,将其与混合音频的潜在空间对齐,以防止不匹配。在广泛使用的Libri2Mix数据集上进行评估后,SoloSpeech在目标语音提取和语音分离任务中实现了最先进的可懂度和质量,同时在域外数据和真实场景中表现出出色的泛化能力。

【47】 Evaluating the Usefulness of Non-Diagnostic Speech Data for Developing  Parkinson's Disease Classifiers
标题: 评估非诊断语音数据的有用性以开发帕金森病分类器
链接:https://arxiv.org/abs/2505.18722
作者: Terry Yi Zhong,  Esther Janse,  Cristian Tejedor-Garcia,  Louis ten Bosch,  Martha Larson 
备注:Accepted for Interspeech 2025 (Camera-Ready)
摘要:基于语音的帕金森病(PD)检测因其自动化、成本效益和非侵入性而受到关注。由于研究通常依赖于诊断性语音任务的数据,这项工作探讨了诊断PD的语音数据的基础上,最初不打算用于诊断目的的可行性,使用话轮转换(TT)数据集。我们的研究结果表明,TT可以作为诊断为导向的PD数据集,如PC-GITA一样有用。我们还研究了哪些特定的数据集特征影响PD分类性能。结果表明,连接音频记录和平衡参与者的性别和地位分布可能是有益的。跨数据集评估显示,在PC-GITA上训练的模型对TT的泛化能力较差,而在TT上训练的模型在PC-GITA上的表现更好。此外,我们还提供了跨折叠的高可变性的见解,这主要是由于单个扬声器性能的巨大差异。

【48】 Enhancing Generalization of Speech Large Language Models with Multi-Task  Behavior Imitation and Speech-Text Interleaving
标题: 通过多任务行为模仿和语音文本交织增强语音大型语言模型的概括
链接:https://arxiv.org/abs/2505.18644
作者: Jingran Xie,  Xiang Li,  Hui Wang,  Yue Yu,  Yang Xiang,  Xixin Wu,  Zhiyong Wu 
备注:Accepted by Interspeech 2025
摘要:大型语言模型(LLM)在任务中表现出显着的泛化能力,导致人们对将语音与LLM集成的兴趣增加。这些语音LLM(SLLM)通常使用监督微调来将语音与基于文本的LLM对齐。然而,在广泛的任务中缺乏带注释的语音数据阻碍了对齐效率,导致泛化能力差。为了解决这些问题,我们提出了一种新的多任务的“行为模仿”方法与语音文本交织,称为MTBI,它只依赖于配对的语音和成绩单。通过确保LLM解码器对成对的语音和文本生成等效的响应,我们实现了更通用的SLLM。交错用于进一步提高对准效率。我们引入了一个简单的基准来评估不同模型之间的提示和任务泛化。实验结果表明,我们的MTBI优于SOTA SLLM的提示和任务的泛化,同时需要较少的监督语音数据。

【49】 Acoustic and Machine Learning Methods for Speech-Based Suicide Risk  Assessment: A Systematic Review
标题: 基于言语的自杀风险评估的声学和机器学习方法:系统性评论
链接:https://arxiv.org/abs/2505.18195
作者: Ambre Marie,  Marine Garnier,  Thomas Bertin,  Laura Machart,  Guillaume Dardenne,  Gwenolé Quellec,  Sofian Berrouiguet 
备注:Preprint version of a manuscript submitted to Computers in Biology and Medicine. 25 pages, 7 figures, 8 tables
摘要:自杀仍然是一个公共卫生挑战,需要改进检测方法,以促进及时干预和治疗。这篇系统性综述评估了人工智能(AI)和机器学习(ML)在通过语音声学分析评估自杀风险中的作用。根据PRISMA指南,我们分析了从PubMed、Cochrane、Scopus和Web of Science数据库中选择的33篇文章。这些研究主要探讨了有自杀风险(RS)和无自杀风险(NRS)的个体之间的声学差异,并评估了ML分类器的性能。研究结果一致显示RS和NRS人群之间的显着声学特征的变化,特别是涉及抖动,基频(F0),梅尔频率倒谱系数(MFCC),功率谱密度(PSD)。分类器的有效性根据算法,模态和语音启发方法而变化,多模态方法集成了声学,语言和元数据特征,表现出优越的性能。然而,诸如方法的可变性、样本量小、缺乏纵向数据以及有限的语言和人口多样性等局限性限制了普遍性。未来的研究应该专注于标准化方法,扩展多模态分析,并利用更大,更多样化的数据集来支持临床自杀风险评估中的AI整合。

【50】 On the Relevance of Clinical Assessment Tasks for the Automatic  Detection of Parkinson's Disease Medication State from Speech
标题: 从言语自动检测帕金森病用药状态的临床评估任务的相关性
链接:https://arxiv.org/abs/2505.15378
作者: David Gimeno-Gómez,  Rubén Solera-Ureña,  Anna Pompili,  Carlos-D. Martínez-Hinarejos,  Rita Cardoso,  Isabel Guimarães,  Joaquim J. Ferreira,  Alberto Abad 
备注:Accepted to Interspeech 2025
摘要:帕金森病(PD)患者的药物状态的自动识别可以帮助临床医生监测和安排个性化治疗,以及研究药物在缓解疾病特征的运动症状方面的作用。本文探讨了语音作为一种非侵入性和可访问的生物标志物,用于识别PD药物状态,介绍了一种新的方法,从说话者独立的角度来解决这一任务。虽然传统的机器学习模型取得了有竞争力的结果,但自我监督的语音表示被证明对最佳性能至关重要,显着超过基于知识的声学描述符。不同的语音评估任务的实验突出了韵律和连续语音在区分药物状态方面的相关性,达到了88.2%的F1分数。这些发现可能会简化临床医生的工作,并减少患者在语音记录方面的努力。


eess.AS音频处理


【1】 FT-Boosted SV: Towards Noise Robust Speaker Verification for English  Speaking Classroom Environments
标题: FT增强SV:面向英语课堂环境的噪音稳健说话者验证
链接:https://arxiv.org/abs/2505.20222
作者: Saba Tabatabaee,  Jing Liu,  Carol Espy-Wilson 
备注:Accepted to be presented at Interspeech 2025
摘要:为教室环境创建说话者验证(SV)系统,这些系统对教室噪音(如串音噪音)具有鲁棒性,这对于开发辅助教育环境的AI工具至关重要。在这项工作中,我们研究了使用增强儿童数据集进行微调以使x向量和ECAPA-TDNN适应课堂环境的有效性。我们证明,在这方面,使用增强的儿童数据集进行微调是强大的,并降低了教室数据集和儿童语音数据集的x向量和ECAPA-TDNN模型的等错误率(EER)。值得注意的是,与ECAPA-TDNN基线模型相比,该方法将MPT数据集中教室的ECAPA-TDNN模型的EER平均降低了一半(5%的改善)。x向量模型显示,与基线相比,NCTE数据集中教室的平均改善率为8%。.

【2】 Continuous Learning for Children's ASR: Overcoming Catastrophic  Forgetting with Elastic Weight Consolidation and Synaptic Intelligence
标题: 儿童ASD的持续学习:通过弹性体重巩固和突触智力克服灾难性遗忘
链接:https://arxiv.org/abs/2505.20216
作者: Edem Ahadzi,  Vishwanath Pratap Singh,  Tomi Kinnunen,  Ville Hautamaki 
备注:Accepted at INTERSPEECH 2025. 5 pages
摘要:在这项工作中,我们提出了第一个研究解决自动语音识别(ASR)的儿童在网上学习设置。这对于以儿童为中心的应用程序和未成年人的隐私保护尤为重要,其中具有顺序到达数据的训练模型至关重要。传统的模型微调方法经常遭受灾难性的遗忘。为了解决这个问题,我们探索了两种成熟的技术:弹性重量巩固(EWC)和突触智能(SI)。使用MyST语料库上的自定义协议,针对在线学习设置,与微调基线相比,EWC和SI的相对单词错误率(WER)分别降低了5.21%和4.36%。

【3】 From Alignment to Advancement: Bootstrapping Audio-Language Alignment  with Synthetic Data
标题: 从一致到进步:利用合成数据引导音频语言一致
链接:https://arxiv.org/abs/2505.20166
作者: Chun-Yi Kuan,  Hung-yi Lee 
备注:Project Website: this https URL
摘要:音频感知的大型语言模型(ALLM)最近在理解和处理音频输入方面取得了很大进展。这些模型通常通过对音频相关任务的额外训练,从基于文本的大型语言模型(LLM)中改编而来。然而,这一适应过程存在两大局限性。首先,ALLM经常遭受灾难性的遗忘,其中重要的文本功能,如在音频数据上训练后的注意力跟随,会丢失。在某些情况下,模型甚至可能产生输入音频中不存在的声音,从而引发对其可靠性的担忧。其次,实现音频和语言之间的跨模态对齐通常依赖于用于指令调整的大量特定于任务的问答对,使得该过程资源密集型。为了解决这些问题,我们利用骨干LLM从ALLM合成通用标题风格的对齐数据。我们将此过程称为通过从骨干LLM(BALSa)生成合成数据的自举音频语言对齐。在BALSa的基础上,我们引入了LISTEN(通过扩展负样本学习识别声音),这是一种类似对比的训练方法,旨在提高ALLM区分存在和不存在声音的能力。我们进一步将BALSa扩展到多音频场景,其中该模型要么解释音频输入之间的差异,要么产生描述它们的统一标题,从而增强音频语言对齐。实验结果表明,我们的方法有效地减轻了音频幻觉,同时可靠地保持强大的性能,音频理解,推理和推理以下技能。此外,结合多音频训练进一步增强了模型的理解和推理能力。总的来说,BALSa为ALLM的开发提供了一种高效且可扩展的方法。

【4】 MVP: Multi-source Voice Pathology detection
标题: MVP:多源语音病理学检测
链接:https://arxiv.org/abs/2505.20050
作者: Alkis Koudounas,  Moreno La Quatra,  Gabriele Ciravegna,  Marco Fantini,  Erika Crosetti,  Giovanni Succo,  Tania Cerquitelli,  Sabato Marco Siniscalchi,  Elena Baralis 
备注:Accepted at Interspeech 2025
摘要:语音障碍显著影响患者的生活质量,但由于病理语音数据的稀缺性和记录源的可变性,非侵入性自动诊断仍然未得到充分探索。这项工作介绍MVP(多源语音病理检测),一种新的方法,利用Transformers直接对原始语音信号进行操作。我们探讨了三种融合策略,结合句子阅读和持续元音记录:波形连接,中间特征融合,决策层组合。在德语,葡萄牙语和意大利语的经验验证表明,中间功能融合使用Transformers最好的捕捉两种记录。

【5】 Improving Speech Emotion Recognition Through Cross Modal Attention  Alignment and Balanced Stacking Model
标题: 通过跨模式注意力对齐和平衡堆叠模型提高语音情感识别
链接:https://arxiv.org/abs/2505.20007
作者: Lucas Ueda,  João Lima,  Leonardo Marques,  Paula Costa 
备注:Accepted by INTERSPEECH 2025
摘要:情感在人类交互中起着重要作用,因此能够识别语音中情感的系统在人机交互中至关重要。语音情感识别(SER)是一个具有挑战性的问题,特别是在自然语音中,当可用的数据是不平衡的情绪。本文在2025年自然条件下语音情感识别挑战赛的背景下介绍了我们提出的系统。我们提出的架构利用跨模态,利用跨模态的注意力融合表示从不同的模态。为了解决类别不平衡问题,我们采用了两种训练设计:(i)加权交叉熵损失(WCE);(ii)WCE与额外的中性表达软边缘损失和平衡。我们总共训练了12个多模态模型,这些模型使用平衡堆叠模型进行组合。我们所提出的系统实现了MacroF 1得分为0.4094和准确率为0.4128的8类语音情感识别。

【6】 Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned  Step Sampling
标题: 通过经验修剪步骤采样加速基于流匹配的文本到语音
链接:https://arxiv.org/abs/2505.19931
作者: Qixi Zheng,  Yushen Chen,  Zhikang Niu,  Ziyang Ma,  Xiaofei Wang,  Kai Yu,  Xie Chen 
摘要:近年来,基于流匹配的文本到语音(TTS)模型,如Voicebox,E2 TTS和F5-TTS,引起了人们的极大关注。这些模型需要多个采样步骤来从噪声中重建语音,这使得推理速度成为一个关键挑战。减少采样步数可以大大提高推理效率。为此,我们引入了Fast F5-TTS,这是一种无需训练的方法,可以加速基于流匹配的TTS模型的推理。通过考察F5-TTS的采样轨迹,识别出冗余步长,并提出经验剪枝步长采样(EPSS),这是一种非均匀时间步长采样策略,有效地减少了采样步长。我们的方法在NVIDIA RTX 3090 GPU上实现了7步生成,推理RTF为0.030,比原来的F5-TTS快4倍,同时保持相当的性能。此外,EPSS在E2 TTS模型上表现良好,表现出较强的泛化能力。

【7】 Deep learning based spatial aliasing reduction in beamforming for audio  capture
标题: 基于深度学习的音频捕获束形成中的空间混叠减少
链接:https://arxiv.org/abs/2505.19781
作者: Mateusz Guzik,  Giulio Cengarle,  Daniel Arteaga 
备注:5 pages, 4 figures; accepted for presentation in Interspeech 2025
摘要:空间混叠影响间隔开的麦克风阵列,导致在某些频率以上的方向模糊,降低波束形成器的空间和频谱精度。鉴于传统信号处理的局限性和深度学习方法在空间混叠缓解方面的稀缺性,我们提出了一种新的方法,使用U-Net架构来预测信号相关的去混叠滤波器,该滤波器可以减少传统波束成形中的混叠,以实现空间捕获。考虑两种类型的多通道滤波器,一种是独立处理通道,另一种是模拟跨通道依赖关系。所提出的方法进行评估,在两个常见的空间捕获的情况下:立体声和一阶高保真度立体声。结果表明,一个非常显着的改善,客观和感性的,相对于传统的波束形成。这项工作显示了深度学习减少波束成形中混叠的潜力,从而改善了多麦克风设置。

【8】 DuRep: Dual-Mode Speech Representation Learning via ASR-Aware  Distillation
标题: DuRep:通过SVR感知蒸馏的双模式语音表示学习
链接:https://arxiv.org/abs/2505.19774
作者: Prabash Reddy Male,  Swayambhu Nath Ray,  Harish Arsikere,  Akshat Jaiswal,  Prakhar Swarup,  Prantik Sen,  Debmalya Chakrabarty,  K V Vijay Girish,  Nikhil Bhave,  Frederick Weber,  Sambuddha Bhattacharya,  Sri Garimella 
摘要:语音编码器的最新进展由于其与用于各种语音任务的大型语言模型的集成而引起关注。虽然大多数研究都集中在因果或全上下文语音编码器上,但在有效处理流媒体和非流媒体应用的同时实现最先进性能的探索有限。我们介绍了DuRep,一种双模式语音表示学习设置,它使单个语音编码器能够在离线和在线模式下有效地运行,而无需额外的参数或特定于模式的调整,跨下游任务。DuRep-200 M是我们的200 M参数双模编码器,在流和非流模式下实现了12%和11.6%的改进,超过了多语言ASR的基线编码器。将这种方法扩展到2B参数,DuRep-2B为ASR和非ASR任务设置了新的性能基准。我们的分析揭示了有趣的权衡声学和语义信息之间的编码器层。

【9】 Navigating PESQ: Up-to-Date Versions and Open Implementations
标题: 导航PEPQ:最新版本和开放实施
链接:https://arxiv.org/abs/2505.19760
作者: Matteo Torcoli,  Mhd Modar Halimeh,  Emanuël A. P. Habets 
摘要:语音质量感知评价(PESQ)是一种客观的质量指标,尽管被国际电信联盟(ITU)撤销,但仍被广泛使用。PESQ已经发展了二十多年,在此期间出现了多个版本和公开可用的实现。众多的版本及其更新可能会令人不知所措,特别是对于新的PESQ用户。这项工作为PESQ的不同版本和实现提供了实际指导。我们发现,差异可能是显着的,特别是PESQ版本之间。我们强调指定用于计算PESQ的确切版本和实现的重要性,并可能详细说明如何处理多通道信号。这些做法将有助于解释结果,并允许比较不同研究之间的PESQ评分。我们还提供了一个存储库,它实现了对PESQ的最新更正,即,勘误表2,它没有被任何其他公开可用的发行版实现:https://github.com/audiolabs/PESQ。

【10】 A Lightweight Hybrid Dual Channel Speech Enhancement System under  Low-SNR Conditions
标题: 低SNR条件下的轻量级混合双通道语音增强系统
链接:https://arxiv.org/abs/2505.19597
作者: Zheng Wang,  Xiaobin Rong,  Yu Sun,  Tianchi Sun,  Zhibin Lin,  Jing Lu 
备注:Accepted by Interspeech 2025
摘要:虽然基于深度学习的多通道语音增强已经取得了显著的进步,但其实际部署通常受到有限的计算资源的限制,特别是在低信噪比(SNR)条件下。在本文中,我们提出了一个轻量级的混合双通道语音增强系统,它结合了独立向量分析(IVA)的双通道分组时间卷积递归网络(GTCRN)的修改版本。IVA作为一个粗略的估计器,提供语音和噪声的辅助信息,而修改后的GTCRN进一步细化语音质量。我们调查了几个修改,以确保综合利用原始和辅助信息。实验结果表明,该系统的有效性,实现增强语音与最小的参数和低的计算复杂度。

【11】 Accelerating Diffusion-based Text-to-Speech Model Training with Dual  Modality Alignment
标题: 通过双语气对齐加速基于扩散的文本到语音模型训练
链接:https://arxiv.org/abs/2505.19595
作者: Jeongsoo Choi,  Zhikang Niu,  Ji-Hoon Kim,  Chunhui Wang,  Joon Son Chung,  Chen Xie 
备注:Interspeech 2025
摘要:本文的目标是优化基于扩散的文语转换模型的训练过程。虽然最近的研究取得了显着的进步,他们的训练需要大量的时间和计算成本,主要是由于在学习复杂的中间表示的扩散模型的隐式指导。为了解决这个问题,我们提出了A-DMA,这是一种有效的双模态对齐加速训练的策略。我们的方法引入了一种新的对齐管道,利用文本和语音模态:文本引导对齐,它结合了上下文表示,语音引导对齐,它细化了语义表示。通过将隐藏状态与判别特征对齐,我们的训练方案减少了对学习复杂表示的扩散模型的依赖。大量的实验表明,A-DMA的收敛速度提高了一倍,同时实现了优于基线的性能。代码和演示示例可在https://github.com/ZhikangNiu/A-DMA上获得

【12】 MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous  Decoding
标题: MFA-KWS:利用多头帧同步解码的有效关键字发现
链接:https://arxiv.org/abs/2505.19577
作者: Yu Xi,  Haoyu Li,  Xiaoyu Gu,  Yidi Jiang,  Kai Yu 
备注:TASLP under review
摘要:关键字定位(KWS)对于语音驱动的应用程序至关重要,要求准确性和效率。传统的基于ASR的KWS方法,如贪婪和波束搜索,探索整个搜索空间,而没有显式地优先考虑关键字检测,通常导致次优性能。在本文中,我们提出了一个有效的关键字特定的KWS框架,通过引入面向流媒体的CTC-传感器结合帧异步系统与多头帧异步解码(MFA-KWS)。具体来说,MFA-KWS采用关键字特定的语音同步解码CTC,并取代传统的RNN-T与令牌和持续时间转换器,以提高性能和效率。此外,我们还探索了各种分数融合策略,包括基于单帧和基于一致性的方法。大量的实验证明了MFA-KWS的优越性能,它在固定关键字和任意关键字数据集上都取得了最先进的结果,如Snips,MobvoiHotwords和LibriKWS-20,同时在嘈杂的环境中表现出很强的鲁棒性。在融合策略中,基于一致性的CDC-Last方法提供了最好的性能。此外,MFA-KWS在各种数据集的帧同步基线上实现了47%至63%的加速。大量的实验结果证实,MFA-KWS是一个有效的和高效的KWS框架,使其非常适合在设备上部署。

【13】 Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech  Enhancement
标题: Mel-McNet:在线多通道语音增强的Mel-Scale框架
链接:https://arxiv.org/abs/2505.19576
作者: Yujie Yang,  Bing Yang,  Xiaofei Li 
备注:Accepted by Interspeech 2025
摘要:在线多通道语音增强是近年来语音增强领域的研究热点。尽管Mel尺度频率比线性频率更符合人的听觉感知并且计算效率更高,但是在Mel频率域中实现的工作很少。为此,本工作提出了一个梅尔规模的框架(即梅尔-McNet)。它通过两个关键组件来处理频谱和空间信息:一个有效的STFT到Mel模块,将多通道STFT特征压缩到Mel频率表示中,以及一个修改后的McNet主干,直接在Mel域中操作,以生成增强的LogMel频谱。频谱可以直接输入声码器进行波形重建或输入ASR系统进行转录。在CHiME-3上的实验表明,Mel-McNet可以将计算复杂度降低60%,同时保持与原始McNet相当的增强和ASR性能。Mel-McNet也优于其他SOTA方法,验证了Mel尺度语音增强的潜力。

【14】 FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
标题: FlowSE:通过流匹配实现高效、高质量的语音增强
链接:https://arxiv.org/abs/2505.19476
作者: Ziqian Wang,  Zikai Liu,  Xinfa Zhu,  Yike Zhu,  Mingshuai Liu,  Jun Chen,  Longshuai Xiao,  Chao Weng,  Lei Xie 
备注:Accepted to InterSpeech 2025
摘要:生成模型在使用语言模型、扩散和流匹配等方法的音频任务中表现出色。然而,现有的语音增强(SE)生成方法面临着显着的挑战:基于语言模型的方法遭受量化损失,导致说话人相似性和可理解性受损,而扩散模型需要复杂的训练和高推理延迟。为了解决这些挑战,我们提出了FlowSE,一个基于流匹配的SE模型。流匹配在单次通过中学习噪声和干净语音分布之间的连续转换,显著减少推理延迟,同时保持高质量的重建。具体而言,FlowSE在有噪声的mel频谱图和可选的字符序列上进行训练,以地面实况mel频谱图作为监督来优化条件流匹配损失。它隐式地学习语音的时间-频谱结构和文本-语音对齐。在推理过程中,FlowSE可以在有或没有文本信息的情况下运行,在两种情况下都能取得令人印象深刻的结果,当有转录本时,还能进一步改进。大量的实验表明,FlowSE显着优于国家的最先进的生成方法,建立了一个新的范例,为基于生成的SE,并展示了流匹配的潜力,以推进该领域。我们的代码,预训练的检查点和音频样本都是可用的。

【15】 VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and  Extrapolation
标题: VoiceStar:具有持续时间控制和外推的稳健Zero-Shot自回归TTC
链接:https://arxiv.org/abs/2505.19462
作者: Puyuan Peng,  Shang-Wen Li,  Abdelrahman Mohamed,  David Harwath 
摘要:我们提出了VoiceStar,第一个zero-shot TTS模型,实现了输出持续时间控制和外推。VoiceStar是一种自回归编码器-解码器神经编解码器语言模型,它利用了一种新的进度监控旋转位置嵌入(PM-RoPE),并使用连续提示混合(CPM)训练进行训练。PM-RoPE使模型能够更好地对齐文本和语音标记,指示所生成语音的目标持续时间,并且还允许模型生成持续时间比期间看到的语音波形长得多的语音波形。CPM训练还有助于减轻训练/推理不匹配,并在说话人相似性和可懂度方面显着提高生成语音的质量。VoiceStar在短格式基准测试(如Librispeech和Seed-TTS)上的表现优于或与当前最先进的模型相当,在可理解性和自然度方面,在长格式/外推基准测试(20- 50秒)上的表现明显优于这些模型。代码和型号重量:https://github.com/jasonppy/VoiceStar

【16】 Beyond Manual Transcripts: The Potential of Automated Speech Recognition  Errors in Improving Alzheimer's Disease Detection
标题: 超越手动文字记录:自动语音识别错误在改善阿尔茨海默病检测方面的潜力
链接:https://arxiv.org/abs/2505.19448
作者: Yin-Long Liu,  Rui Feng,  Jia-Xin Chen,  Yi-Ming Wang,  Jia-Hong Yuan,  Zhen-Hua Ling 
备注:Accepted by Interspeech 2025
摘要:自动语音识别(ASR)的最新突破使得能够使用ASR转录本进行完全自动化的阿尔茨海默病(AD)检测。然而,ASR错误对AD检测的影响仍然知之甚少。本文填补了这一空白。我们进行了全面的研究,AD检测使用各种ASR模型和他们的合成语音的ADReSS数据集上的成绩单。实验结果表明,某些ASR成绩单(ASR合成语音)优于手动成绩单(手动合成语音)的检测准确性,这表明ASR错误可以提供有价值的线索,提高AD检测。此外,我们提出了一个基于交叉注意力的可解释性模型,不仅可以识别这些线索,而且还可以实现优于基线或与基线相当的性能。此外,我们利用这个模型来揭示预训练嵌入中的AD相关模式。我们的研究为ASR模型用于AD检测的潜力提供了新的见解。

【17】 Leveraging Cascaded Binary Classification and Multimodal Fusion for  Dementia Detection through Spontaneous Speech
标题: 利用级联二进制分类和多模式融合通过自发言语进行痴呆症检测
链接:https://arxiv.org/abs/2505.19446
作者: Yin-Long Liu,  Yuanchao Li,  Rui Feng,  Liu He,  Jia-Xin Chen,  Yi-Ming Wang,  Yu-Ang Chen,  Yan-Han Peng,  Jia-Hong Yuan,  Zhen-Hua Ling 
备注:Accepted by Interspeech 2025
摘要:本文介绍了我们提交的过程挑战2025年,专注于自发语音分析早期痴呆症检测。对于三类分类任务(健康对照、轻度认知障碍和痴呆),我们提出了一个级联的二进制分类框架,该框架可以微调预训练的语言模型,并结合暂停编码以更好地捕捉不流利。这种设计简化了多类分类,并通过重构决策过程来解决类别不平衡问题。对于迷你精神状态检查分数回归任务,我们开发了一个增强的多模态融合系统,结合了不同的声学和语言特征。独立的回归模型在各个特征集上进行训练,通过得分平均应用集成学习。测试集上的实验结果优于组织者提供的基线,在这两个任务中,证明了我们的方法的鲁棒性和有效性。

【18】 Stack Less, Repeat More: A Block Reusing Approach for Progressive Speech  Enhancement
标题: 少栈,多重复:渐进语音增强的块重用方法
链接:https://arxiv.org/abs/2505.19401
作者: Jangyeon Kim,  Ui-Hyeop Shin,  Jaehyun Ko,  Hyung-Min Park 
备注:Accepted to Interspeech 2025
摘要:本文提出了一种有效的语音增强(SE)的方法,重复使用的处理块,而不是传统的堆栈。与增加用于学习深度潜在表示的块的数量不同,重复单个块会导致渐进式细化,同时减少参数冗余。我们还通过保持编码器和解码器浅和重用单个序列建模块来最小化域变换。实验结果表明,处理阶段的数量比具有不同权重的块的数量对性能更关键。此外,我们观察到,所提出的方法在单个块内逐渐细化噪声输入。此外,通过块重用方法,我们证明了加深编码器和解码器对于学习深度复杂表示可以是冗余的。因此,实验结果证实,所提出的块重用,使渐进式学习,并提供了一个有效的替代SE。
摘要:This paper presents an efficient speech enhancement (SE) approach that reuses a processing block repeatedly instead of conventional stacking. Rather than increasing the number of blocks for learning deep latent representations, repeating a single block leads to progressive refinement while reducing parameter redundancy. We also minimize domain transformation by keeping an encoder and decoder shallow and reusing a single sequence modeling block. Experimental results show that the number of processing stages is more critical to performance than the number of blocks with different weights. Also, we observed that the proposed method gradually refines a noisy input within a single block. Furthermore, with the block reuse method, we demonstrate that deepening the encoder and decoder can be redundant for learning deep complex representation. Therefore, the experimental results confirm that the proposed block reusing enables progressive learning and provides an efficient alternative for SE.

【19】 SoloSpeech: Enhancing Intelligibility and Quality in Target Speech  Extraction through a Cascaded Generative Pipeline
标题: SoloSpeech:通过级联生成管道增强目标语音提取的可理解性和质量
链接:https://arxiv.org/abs/2505.19314
作者: Helin Wang,  Jiarui Hai,  Dongchao Yang,  Chen Chen,  Kai Li,  Junyi Peng,  Thomas Thebaud,  Laureano Moro Velazquez,  Jesus Villalba,  Najim Dehak 
摘要:目标语音提取(TSE)旨在通过利用说话者特定的线索(通常作为辅助音频(a.k.a.提示音频)。虽然TSE的最新进展主要采用了提供高感知质量的判别模型,但这些模型通常会引入不必要的伪影,降低自然度,并且对训练和测试环境之间的差异敏感。另一方面,TSE的生成模型在感知质量和可理解性方面滞后。为了解决这些挑战,我们提出了SoloSpeech,一种新型的级联生成流水线,集成了压缩,提取,重建和校正过程。SoloSpeech具有一个无说话者嵌入的目标提取器,该提取器利用来自线索音频的潜在空间的条件信息,将其与混合音频的潜在空间对齐,以防止不匹配。在广泛使用的Libri2Mix数据集上进行评估后,SoloSpeech在目标语音提取和语音分离任务中实现了新的最先进的可懂度和质量,同时在域外数据和现实场景中表现出出色的泛化能力。

【20】 Speech-IFEval: Evaluating Instruction-Following and Quantifying  Catastrophic Forgetting in Speech-Aware Language Models
标题: Speech-IFEval:评估言语感知语言模型中的指令遵循和量化灾难性遗忘
链接:https://arxiv.org/abs/2505.19037
作者: Ke-Han Lu,  Chun-Yi Kuan,  Hung-yi Lee 
备注:Accecpted by Interspeech 2025; this https URL
摘要:我们介绍了Speech-IFeval,一个评估框架,旨在评估语音感知语言模型(SLM)中的预防能力和量化灾难性遗忘。最近的SLM将语音感知与大型语言模型(LLM)集成在一起,由于以语音为中心的训练,通常会降低文本功能。现有的基准混淆了言语感知与预防跟踪,阻碍了对这些不同技能的评估。为了解决这个差距,我们提供了一个基准诊断的预防以下能力的SLM。我们的研究结果表明,大多数SLM甚至连基本的指令都很难处理,比基于文本的LLM性能差得多。此外,这些模型对即时变化高度敏感,往往产生不一致和不可靠的输出。我们强调了核心挑战,并提供了指导未来研究的见解,强调了超越任务级指标的评估需求。

【21】 Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis
标题: 语音复兴:多模式可控文本到语音合成
链接:https://arxiv.org/abs/2505.18972
作者: Minsu Kim,  Pingchuan Ma,  Honglie Chen,  Stavros Petridis,  Maja Pantic 
备注:Interspeech 2025
摘要:本文探讨了多模态可控的文本到语音合成(TTS),其中可以从人脸图像生成语音,以及输出语音的特性(例如,节奏、噪声水平、距离、音调、地点)可以用自然文本描述来控制。具体来说,我们的目标是减轻以下三个面临的挑战驱动的TTS系统。1)为了克服有限的音频质量的视听语音语料库,我们提出了一种训练方法,另外利用高质量的纯音频语音语料库。2)为了不仅从真实的人脸而且从艺术肖像中生成语音,我们提出用风格化来增强输入的人脸图像。3)为了考虑一对多的可能性,在面对语音映射,并确保一致的语音生成在同一时间,我们建议首先采用基于采样的解码,然后使用提示与生成的语音样本。实验结果验证了该模型在人脸驱动语音合成中的有效性。

【22】 Physics-Informed Deep Learning for Nonlinear Friction Model of  Bow-string Interaction
标题: 弦相互作用非线性摩擦模型的物理知情深度学习
链接:https://arxiv.org/abs/2505.18950
作者: Xinmeng Luan,  Gary Scavone 
备注:8 pages, 7 figures, the 28th International Conference on Digital Audio Effects (DAFx25)
摘要:本研究探讨了使用无监督的、基于物理学的深度学习框架来建模一个单自由度的质量弹簧系统,该系统受到非线性摩擦力的作用,并由一组常微分方程控制。具体来说,它研究了物理信息神经网络(PINN)和物理信息深度运算符网络(PI-DeepONets)的应用。我们的研究结果表明,PINN成功地解决了不同弓力场景下的问题,而PI-DeepONets在低弓力下表现良好,但在更高的力下遇到困难。此外,我们还分析了Hessian特征值密度并可视化了损失情况。总体而言,大的Hessian特征值和尖锐最小值的存在表明高度病态优化。这些结果强调了基于物理学的深度学习在音乐声学非线性建模中的前景,同时也揭示了仅依赖基于物理学的方法来捕获复杂非线性的局限性。我们证明了PI-DeepONets能够在不同参数下进行概括,非常适合声音合成。此外,我们还证明了PI-DeepONets在更高力量下的局限性可以通过在混合监督-无监督框架内整合观察数据来减轻。这表明,混合监督-无监督DeepONets框架可能是未来实际应用的一个有希望的方向。

【23】 Context-Driven Dynamic Pruning for Large Speech Foundation Models
标题: 大型语音基础模型的上下文驱动动态修剪
链接:https://arxiv.org/abs/2505.18860
作者: Masao Someki,  Shikhar Bharadwaj,  Atharva Anand Joshi,  Chyi-Jiunn Lin,  Jinchuan Tian,  Jee-weon Jung,  Markus Müller,  Nathan Susanj,  Jing Liu,  Shinji Watanabe 
备注:Accepted at Interspeech 2025
摘要:语音基础模型实现了跨语言和声学条件的强大泛化,但需要大量的计算资源进行推理。在语音基础模型的上下文中,已经研究了基于利用外部上下文的目标音频来动态优化模型结构的修剪技术。在这项工作中,我们扩展了这条线的研究,并提出了上下文驱动的动态修剪,一种技术,优化模型计算取决于不同的输入帧和额外的上下文之间的上下文在推理。我们采用开放式耳语风格的语音模型(OWSM),并将扬声器嵌入,声学事件嵌入和语言信息作为额外的上下文。通过将扬声器嵌入,我们的方法实现了56.7 GFLOPs的减少,同时提高了相对25.7%的BLEU分数相比,完全微调的OWSM模型。

【24】 Evaluating the Usefulness of Non-Diagnostic Speech Data for Developing  Parkinson's Disease Classifiers
标题: 评估非诊断语音数据的有用性以开发帕金森病分类器
链接:https://arxiv.org/abs/2505.18722
作者: Terry Yi Zhong,  Esther Janse,  Cristian Tejedor-Garcia,  Louis ten Bosch,  Martha Larson 
备注:Accepted for Interspeech 2025 (Camera-Ready)
摘要:基于语音的帕金森病(PD)检测因其自动化、成本效益和非侵入性而受到关注。由于研究通常依赖于诊断性语音任务的数据,这项工作探讨了诊断PD的语音数据的基础上,最初不打算用于诊断目的的可行性,使用话轮转换(TT)数据集。我们的研究结果表明,TT可以作为诊断为导向的PD数据集,如PC-GITA一样有用。我们还研究了哪些特定的数据集特征影响PD分类性能。结果表明,连接音频记录和平衡参与者的性别和地位分布可能是有益的。跨数据集评估显示,在PC-GITA上训练的模型对TT的泛化能力较差,而在TT上训练的模型在PC-GITA上的表现更好。此外,我们还提供了跨折叠的高可变性的见解,这主要是由于单个扬声器性能的巨大差异。

【25】 Enhancing Generalization of Speech Large Language Models with Multi-Task  Behavior Imitation and Speech-Text Interleaving
标题: 通过多任务行为模仿和语音文本交织增强语音大型语言模型的概括
链接:https://arxiv.org/abs/2505.18644
作者: Jingran Xie,  Xiang Li,  Hui Wang,  Yue Yu,  Yang Xiang,  Xixin Wu,  Zhiyong Wu 
备注:Accepted by Interspeech 2025
摘要:大型语言模型(LLM)在任务中表现出显着的泛化能力,导致人们对将语音与LLM集成的兴趣增加。这些语音LLM(SLLM)通常使用监督微调来将语音与基于文本的LLM对齐。然而,在广泛的任务中缺乏带注释的语音数据阻碍了对齐效率,导致泛化能力差。为了解决这些问题,我们提出了一种新的多任务的“行为模仿”方法与语音文本交织,称为MTBI,它只依赖于配对的语音和成绩单。通过确保LLM解码器对成对的语音和文本生成等效的响应,我们实现了更通用的SLLM。交错用于进一步提高对准效率。我们引入了一个简单的基准来评估不同模型之间的提示和任务泛化。实验结果表明,我们的MTBI优于SOTA SLLM的提示和任务的泛化,同时需要较少的监督语音数据。

【26】 TS-URGENet: A Three-stage Universal Robust and Generalizable Speech  Enhancement Network
标题: TS-URGENet:三级通用鲁棒且可推广的语音增强网络
链接:https://arxiv.org/abs/2505.18533
作者: Xiaobin Rong,  Dahan Wang,  Qinwen Hu,  Yushi Wang,  Yuxiang Hu,  Jing Lu 
备注:Accepted by Interspeech 2025
摘要:通用语音增强旨在处理具有不同失真和输入格式的输入语音。为了应对这一挑战,我们提出了TS-URGENet,一个三阶段的通用,鲁棒和可推广的语音增强网络。为了解决各种失真,所提出的系统采用了一种新的三级架构,包括一个填充阶段,一个分离阶段,和一个恢复阶段。填充阶段通过在噪声干扰下初步填充丢失区域来减轻分组丢失,确保信号连续性。分离级抑制噪声、混响和限幅失真,以提高语音清晰度。最后,恢复阶段补偿带宽限制、编解码器伪像和残余分组丢失失真,从而改善整体语音质量。我们提出的TS-URGENet在Interspeech 2025 URGENT Challenge中表现出色,在Track 1中排名第二。

【27】 Distinctive Feature Codec: Adaptive Segmentation for Efficient Speech  Representation
标题: 独特的特征编解码器:自适应分段以实现高效的语音表示
链接:https://arxiv.org/abs/2505.18516
作者: Xiangyu Zhang,  Fuming Fang,  Peng Gao,  Bin Qin,  Beena Ahmed,  Julien Epps 
摘要:使用神经语音编解码器模型对语音进行标记化是为语音理解和生成而设计的AI系统的一个重要方面。虽然基于文本的系统自然受益于离散符号之间的令牌边界,但由于重要声学变化的不可预测定时,使连续语音信号令牌化更复杂。大多数当前的神经语音编解码器通常通过在固定的时间间隔使用统一处理来解决这个问题,这忽略了语音中固有的变化的信息密度。在本文中,我们介绍了一种独特的基于特征的方法,动态分配令牌的感知意义的语音内容的基础上。通过学习识别和优先处理语音信号中的不同区域,我们的方法实现了一个显着更有效的语音表示相比,传统的基于帧的方法。这项工作标志着传统的基于信号处理的独特特征首次成功扩展到深度学习框架中。通过严格的实验,我们证明了我们的方法的有效性,并提供理论见解如何对齐段边界与自然声学过渡提高码本利用率。此外,我们通过为可变长度段开发分组标量量化方法来增强标记化稳定性。我们独特的基于特征的方法为传统的基于帧的处理提供了一种有前途的替代方案,并在现代深度学习语音处理框架中推进了可解释的表示学习。
摘要:The tokenization of speech with neural speech codec models is a crucial aspect of AI systems designed for speech understanding and generation. While text-based systems naturally benefit from token boundaries between discrete symbols, tokenizing continuous speech signals is more complex due to the unpredictable timing of important acoustic variations. Most current neural speech codecs typically address this by using uniform processing at fixed time intervals, which overlooks the varying information density inherent in speech. In this paper, we introduce a distinctive feature-based approach that dynamically allocates tokens based on the perceptual significance of speech content. By learning to identify and prioritize distinctive regions in speech signals, our approach achieves a significantly more efficient speech representation compared with conventional frame-based methods. This work marks the first successful extension of traditional signal processing-based distinctive features into deep learning frameworks. Through rigorous experimentation, we demonstrate the effectiveness of our approach and provide theoretical insights into how aligning segment boundaries with natural acoustic transitions improves codebook utilization. Additionally, we enhance tokenization stability by developing a Group-wise Scalar Quantization approach for variable-length segments. Our distinctive feature-based approach offers a promising alternative to conventional frame-based processing and advances interpretable representation learning in the modern deep learning speech processing framework.

【28】 CHSER: A Dataset and Case Study on Generative Speech Error Correction  for Child ASR
标题: CHBER:儿童SVR生成性语音错误纠正的数据集和案例研究
链接:https://arxiv.org/abs/2505.18463
作者: Natarajan Balaji Shankar,  Zilai Wang,  Kaiyuan Zhang,  Mohan Shi,  Abeer Alwan 
备注:Accepted in Interspeech 2025
摘要:自动语音识别(ASR)系统由于其独特的声学和语言可变性以及儿童语音数据集的有限可用性而难以处理儿童语音,从而导致高转录错误率。虽然ASR纠错(AEC)方法已经改善了成人语音转录,但其对儿童语音的有效性在很大程度上尚未探索。为了解决这个问题,我们引入了CHSER,一个用于儿童语音的生成语音纠错(GenSEC)数据集,包括跨越不同年龄组和说话风格的20万个假设转录对。结果表明,CHSER数据集上的微调在zero-shot设置中实现了高达28.5%的相对WER降低,并且当应用于微调的ASR系统时实现了13.3%的降低。此外,我们的错误分析表明,虽然GenSEC改善了替换和删除错误,但它与插入和儿童特定的不流畅性作斗争。这些发现强调了GenSEC改善儿童ASR的潜力。

【29】 ATMM-SAGA: Alternating Training for Multi-Module with Score-Aware Gated  Attention SASV system
标题: ATMM-SAGA:采用分数感知门控注意SASV系统进行多模块交替训练
链接:https://arxiv.org/abs/2505.18273
作者: Amro Asali,  Yehuda Ben-Shimol,  Itshak Lapidot 
备注:Submitted to Interspeech 2025
摘要:说话人自动确认系统的目标是确定一个给定的测试语音是否对应于一个声称登记的说话人。这些系统具有广泛的应用,确保其可靠性至关重要。在本文中,我们提出了一个欺骗鲁棒自动说话人确认(SASV)系统采用分数感知门控注意(SAGA)融合方案,集成分数从预先训练的对策(CM)与说话人嵌入从预先训练的ASV。具体来说,我们采用AASIST和ECAPA-TDNN模型。SAGA充当自适应门控机制,其中CM得分确定ASV嵌入对最终SASV决策的影响程度。在ASVspoof 2019逻辑访问数据集上的实验表明,所提出的SASV系统实现了SASV等错误率(SASV-EER)和不可知检测成本函数(a-DCF),对于开发集为2.31%,0.0603,对于评估集为2.18%,0.0480。

【30】 Acoustic and Machine Learning Methods for Speech-Based Suicide Risk  Assessment: A Systematic Review
标题: 基于言语的自杀风险评估的声学和机器学习方法:系统性评论
链接:https://arxiv.org/abs/2505.18195
作者: Ambre Marie,  Marine Garnier,  Thomas Bertin,  Laura Machart,  Guillaume Dardenne,  Gwenolé Quellec,  Sofian Berrouiguet 
备注:Preprint version of a manuscript submitted to Computers in Biology and Medicine. 25 pages, 7 figures, 8 tables
摘要:自杀仍然是一个公共卫生挑战,需要改进检测方法,以促进及时干预和治疗。这篇系统性综述评估了人工智能(AI)和机器学习(ML)在通过语音声学分析评估自杀风险中的作用。根据PRISMA指南,我们分析了从PubMed、Cochrane、Scopus和Web of Science数据库中选择的33篇文章。这些研究主要探讨了有自杀风险(RS)和无自杀风险(NRS)的个体之间的声学差异,并评估了ML分类器的性能。研究结果一致显示RS和NRS人群之间的显着声学特征的变化,特别是涉及抖动,基频(F0),梅尔频率倒谱系数(MFCC),功率谱密度(PSD)。分类器的有效性根据算法,模态和语音启发方法而变化,多模态方法集成了声学,语言和元数据特征,表现出优越的性能。然而,诸如方法的可变性、样本量小、缺乏纵向数据以及有限的语言和人口多样性等局限性限制了普遍性。未来的研究应该专注于标准化方法,扩展多模态分析,并利用更大,更多样化的数据集来支持临床自杀风险评估中的AI整合。

【31】 Efficient Speech Translation through Model Compression and Knowledge  Distillation
标题: 通过模型压缩和知识蒸馏实现高效语音翻译
链接:https://arxiv.org/abs/2505.20237
作者: Yasmin Moslem 
备注:IWSLT 2025
摘要:用于语音翻译的大型音频语言模型的有效部署仍然具有挑战性,因为它们具有显著的计算要求。在本文中,我们通过我们的系统提交到国际口语翻译会议(IWITH 2025)的“模型压缩”轨道来解决这一挑战。我们实验的方法组合,包括迭代层修剪层重要性评估的基础上,低秩自适应与4位量化(QLoRA),和知识蒸馏。在我们的实验中,我们使用Qwen 2-Audio-7 B-Instruct进行德语和汉语的语音翻译。我们修剪后的(学生)模型在模型参数和存储空间方面都减少了50%,同时保留了域内(教师)模型的97-100%的翻译质量。

【32】 "KAN you hear me?" Exploring Kolmogorov-Arnold Networks for Spoken  Language Understanding
链接:https://arxiv.org/abs/2505.20176
作者: Alkis Koudounas,  Moreno La Quatra,  Eliana Pastor,  Sabato Marco Siniscalchi,  Elena Baralis 
备注:Accepted at INTERSPEECH 2025
摘要:Kolmogorov-Arnold网络(KANs)最近成为传统神经结构的一个有前途的替代方案,但它们在语音处理中的应用仍处于探索阶段。这项工作提出了第一次调查的KAN口语理解(SLU)任务。我们在两个数据集上使用2D-CNN模型进行了实验,将KAN层集成到密集块内的五种不同配置中。性能最佳的设置,即在两个线性层之间放置一个KAN层,直接应用于基于transformer的模型,并在复杂性不断增加的五个SLU数据集上进行评估。我们的研究结果表明,KAN层可以有效地取代线性层,在大多数情况下实现可比或更好的性能。最后,我们提供的见解如何KAN和Transformers上的线性层不同地出席原始波形的输入区域。

【33】 Exploring Generative Error Correction for Dysarthric Speech Recognition
标题: 探索合成障碍语音识别的生成性错误纠正
链接:https://arxiv.org/abs/2505.20163
作者: Moreno La Quatra,  Alkis Koudounas,  Valerio Mario Salerno,  Sabato Marco Siniscalchi 
备注:Accepted at INTERSPEECH 2025
摘要:尽管端到端自动语音识别(ASR)引擎取得了显着进展,但准确转录构音障碍语音仍然是一个重大挑战。在这项工作中,我们为INTERSPEECH 2025的语音无障碍项目挑战提出了一个两阶段框架,该框架将尖端的语音识别模型与基于LLM的生成纠错(GER)相结合。我们评估模型规模和训练策略的不同配置,并结合特定的假设选择来提高转录准确性。在Speech Accessibility Project数据集上的实验证明了我们的方法在结构化和自发语音上的优势,同时突出了单字识别中的挑战。通过全面的分析,我们提供了见解的互补作用,声学和语言建模在构音障碍的语音识别

【34】 Automated data curation for self-supervised learning in underwater  acoustic analysis
标题: 水下声学分析中自我监督学习的自动化数据策展
链接:https://arxiv.org/abs/2505.20066
作者: Hilde I Hummel,  Sandjai Bhulai,  Burooj Ghani,  Rob van der Mei 
摘要:海洋生态系统的可持续性受到日益严重的声音污染的威胁,因此监测对于了解其可变性和影响至关重要。被动声监测(PAM)系统收集大量的水下声音记录,但大量的数据使得手动分析变得不可能,从而产生了自动化的需求。虽然机器学习提供了一个潜在的解决方案,但大多数水下声学记录都是未标记的。自监督学习模型在计算机视觉、自然语言处理和音频等各个领域的大规模未标记数据学习中取得了成功。然而,这些模型需要大型、多样和平衡的数据集进行训练,以便很好地推广。为了解决这个问题,提出了一个完全自动化的自我监督数据管理管道,以从原始PAM数据创建多样化和平衡的数据集。它将自动识别系统(AIS)数据与美国水域中各种水听器的记录相结合。使用分层k-means聚类,对原始音频数据进行采样,然后与AIS样本相结合,以创建平衡和多样化的数据集。由此产生的策划数据集可以开发自我监督学习模型,促进各种任务,如监测海洋哺乳动物和评估声音污染。

【35】 Towards Video to Piano Music Generation with Chain-of-Perform Support  Benchmarks
标题: 通过表演链支持基准迈向视频到钢琴音乐生成
链接:https://arxiv.org/abs/2505.20038
作者: Chang Liu,  Haomin Zhang,  Shiyu Xia,  Zihao Chen,  Chaofan Ding,  Xin Yue,  Huizhe Chen,  Xinhan Di 
备注:4 pages, 1 figure, accepted by CVPR 2025 MMFM Workshop
摘要:从视频中生成高质量的钢琴音频需要视觉提示和音乐输出之间的精确同步,以确保准确的语义和时间对齐。然而,现有的评估数据集无法完全捕获钢琴音乐生成所需的复杂同步。一个全面的基准是必不可少的,主要有两个原因:(1)现有的指标未能反映视频到钢琴音乐交互的复杂性,(2)专用的基准数据集可以提供有价值的见解,以加速高质量钢琴音乐生成的进展。为了应对这些挑战,我们引入了CoP Benchmark Dataset,这是一个完全开源的多模式基准测试,专为视频引导钢琴音乐生成而设计。建议的Chain-of-Perform(CoP)基准提供了几个引人注目的功能:(1)详细的多模态注释,通过逐步的Chain-of-Perform指导实现视频内容和钢琴音频之间的精确语义和时间对齐;(2)通用的评估框架,用于严格评估通用和专用的视频到钢琴生成任务;以及(3)数据集、注释和评估协议的完全开源。该数据集可在https://github.com/acappemin/Video-to-Audio-and-Piano上公开获取,并不断更新排行榜,以促进该领域的持续研究。

【36】 Multi-modal brain encoding models for multi-modal stimuli
标题: 多通道刺激的多通道大脑编码模型
链接:https://arxiv.org/abs/2505.20027
作者: Subba Reddy Oota,  Khushbu Pahwa,  Mounika Marreddy,  Maneesh Singh,  Manish Gupta,  Bapi S. Raju 
备注:26 pages, 15 figures, The Thirteenth International Conference on   Learning Representations, ICLR-2025, Singapore.   https://openreview.net/pdf?id=0dELcFHig2
摘要:尽管参与者参与单峰刺激,如观看图像或无声视频,但最近的工作表明,多模态Transformer模型可以很好地预测视觉大脑活动,即使是不一致的模态表示。这就提出了一个问题,即当参与者参与多模态刺激时,这些多模态模型可以准确地预测大脑活动。随着这些模型越来越受欢迎,它们在研究神经活动中的使用为我们的大脑如何响应这种多模态自然主义刺激提供了见解,即,在那里,它通过早期感觉区域到更高认知的层次来分离和整合跨模态的信息。我们通过使用多个单模态和两种类型的多模态模型(跨模态和联合预训练)来研究这个问题,以确定当参与者观看电影时哪种类型的模型与fMRI大脑活动更相关。我们观察到,这两种类型的多模态模型在几个语言和视觉区域中显示出改进的对齐。这项研究还有助于确定哪些大脑区域处理单模态和多模态信息。我们进一步研究了每种模态对多模态对齐的贡献,通过仔细地从多模态表征中逐个去除单峰特征,发现除了在视觉和语言区域处理的单峰嵌入之外,还有额外的信息。基于这项研究,我们发现,对于跨模态模型,它们的大脑对齐部分归因于视频模态;对于联合预训练模型,它部分归因于视频和音频模态。这为神经科学界研究这些模型的可解释性提供了强大的动力,以加深我们对大脑多模态信息处理的理解。

【37】 DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
标题: DeepDialogue:一个多话轮、语义丰富的口语对话数据集
链接:https://arxiv.org/abs/2505.19978
作者: Alkis Koudounas,  Moreno La Quatra,  Elena Baralis 
备注:Currently under review. See the official website: this https URL
摘要:会话人工智能的最新进展在单轮响应方面表现出令人印象深刻的能力,但即使是最复杂的语言模型,多轮对话仍然具有挑战性。目前的对话数据集在情感范围、领域多样性、转向深度方面都有局限,而且主要是纯文本的,这阻碍了开发更人性化的跨模式对话系统的进展。为了解决这些局限性,我们提出了DeepDialogue,这是一个大规模的多模态数据集,包含40,150个高质量的多回合对话,跨越41个领域,并将20种不同的情绪与连贯的情绪进展相结合。我们的方法将9种不同的语言模型(4 B-72 B参数)配对,生成65,600个初始对话,然后通过人工注释和基于LLM的质量过滤相结合进行评估。由此产生的数据集揭示了基本的见解:较小的模型无法保持超过6个对话回合的连贯性;具体领域(例如,“汽车”,“旅行”)比抽象的对话(例如,“哲学”);跨模型交互比同模型对话产生更多连贯的对话。DeepDialogue的一个关键贡献是它的语音组件,我们为所有40,150个对话合成了情感一致的声音,创建了第一个大规模开源多模态对话数据集,忠实地保留了多轮对话中的情感背景。

【38】 Novel Loss-Enhanced Universal Adversarial Patches for Sustainable  Speaker Privacy
标题: 新型损失增强通用对抗补丁,可持续发言人隐私
链接:https://arxiv.org/abs/2505.19951
作者: Elvir Karimov,  Alexander Varlamov,  Danil Ivanov,  Dmitrii Korzh,  Oleg Y. Rogov 
备注:5 pages, 3 figures, 1 table; Submitted to Interspeech 2025
摘要:目前,深度学习语音模型已被广泛使用,但个人数据(如人类身份和语音内容)的安全处理仍然值得怀疑。为了防止恶意用户识别,提出了说话人匿名方法。目前的方法,特别是基于通用对抗补丁(UAP)的应用程序,有缺点,如音频质量显着下降,语音识别质量下降,跨不同的语音生物识别模型的可转移性低,和性能依赖于输入音频长度。为了减轻这些缺点,在这项工作中,我们引入并利用新的指数总方差(TV)损失函数,并提供实验证据表明它对UAP强度和不可感知性产生积极影响。此外,我们提出了一种新的可扩展的UAP插入过程,并证明其一致的高性能为各种音频长度。

【39】 ALAS: Measuring Latent Speech-Text Alignment For Spoken Language  Understanding In Multimodal LLMs
标题: ALAS:多模态LLM口语理解的潜在语音-文本对齐测量
链接:https://arxiv.org/abs/2505.19937
作者: Pooneh Mousavi,  Yingzhi Wang,  Mirco Ravanelli,  Cem Subakan 
摘要:大语言模型在口语理解中有着广泛的应用。最近的SLU模型通过将语音输入适配到LLM中来直接处理音频,以实现更好的多模态学习。这些模型的一个关键考虑因素是文本和音频模态之间的跨模态对齐,这是LLM是否能够将语义与音频片段相关联的一个标志。虽然存在用于融合这些模态的各种方法,但是没有标准度量来评估LLM中的对准质量。在这项工作中,我们提出了一个新的度量,ALAS(自动潜在对齐分数)。我们的研究探讨了音频和文本表示之间的相关性,跨Transformer层,两个不同的任务(口语提问和情感识别)。我们展示了我们的指标在不同的层和不同的任务中的表现。

【40】 EmoSphere-SER: Enhancing Speech Emotion Recognition Through Spherical  Representation with Auxiliary Classification
标题: 球面-SER:通过辅助分类的球面表示增强语音情感识别
链接:https://arxiv.org/abs/2505.19693
作者: Deok-Hyeon Cho,  Hyung-Seok Oh,  Seung-Bin Kim,  Seong-Whan Lee 
备注:Proceedings of Interspeech 2025
摘要:语音情感识别使用离散标签或连续维度(如唤醒、效价和支配(VAD))从语音信号中预测说话人的情感状态。我们提出了一个联合模型,它集成了球形VAD区域分类来指导VAD回归,以改善情感预测。在我们的框架中,VAD值被转换为球坐标,球坐标被划分为多个球形区域,辅助分类任务预测每个点属于哪个球形区域,指导回归过程。此外,我们还结合了动态加权方案和具有多头自注意力的风格池层,以捕获频谱和时间动态,进一步提高性能。这种组合训练策略加强了结构化学习,提高了预测一致性。实验结果表明,我们的方法超过基线方法,证实了所提出的框架的有效性。

【41】 DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised  Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
标题: Difference-TTS:通过自监督蒸馏的分离情感表示用于文本到语音的跨说话人情感传递
链接:https://arxiv.org/abs/2505.19687
作者: Deok-Hyeon Cho,  Hyung-Seok Oh,  Seung-Bin Kim,  Seong-Whan Lee 
备注:Proceedings of Interspeech 2025
摘要:语音合成中的跨说话人情感传递依赖于提取与说话人无关的情感嵌入,以便在不保留说话人特征的情况下进行准确的情感建模。然而,现有的音色压缩方法不能完全分离说话人和情感特征,导致说话人泄漏和合成质量下降。为了解决这一问题,我们提出了一种自我监督的蒸馏方法,以最大限度地减少情感信息的损失,并保持扬声器的身份。我们引入聚类驱动的采样和信息扰动,以保持情感,同时删除无关因素。为了促进这一过程,我们提出了一种情感聚类和匹配方法,使用情感属性预测和说话人嵌入,使泛化到未标记的数据。此外,我们设计了一个双调节Transformer,以更好地集成风格功能。实验结果证实了我们的方法在学习与说话人无关的情感嵌入的有效性。

【42】 Automated evaluation of children's speech fluency for low-resource  languages
标题: 低资源语言儿童言语流利度的自动评估
链接:https://arxiv.org/abs/2505.19671
作者: Bowen Zhang,  Nur Afiqah Abdul Latiff,  Justin Kan,  Rong Tong,  Donny Soh,  Xiaoxiao Miao,  Ian McLoughlin 
备注:5 pages, 2 figures, conference
摘要:在教育中对儿童的口语流利程度的评估对于大多数语言来说是很好的研究,但对于低资源语言来说仍然具有高度挑战性。本文提出了一个系统,自动评估流利性相结合的微调多语言ASR模型,客观指标提取阶段,和生成预训练Transformer(GPT)网络。客观指标包括语音和单词错误率,语音速率和语音暂停持续时间比。这些由一个基于GPT的分类器进行解释,该分类器由一小组人类评估的地面真实示例指导,以获得流畅性。我们在两种低资源语言泰米尔语和马来语的儿童语音数据集上评估了所提出的系统,并将分类性能与随机森林和XGBoost进行了比较,并使用ChatGPT-4 o直接从语音输入中预测流畅度。结果表明,所提出的方法实现了显着更高的精度比多模态GPT或其他方法。

【43】 Reshaping Representation Space to Balance the Safety and Over-rejection  in Large Audio Language Models
标题: 重塑表示空间以平衡大型音频语言模型中的安全性和过度拒绝
链接:https://arxiv.org/abs/2505.19670
作者: Hao Yang,  Lizhen Qu,  Ehsan Shareghi,  Gholamreza Haffari 
摘要:大型音频语言模型(LALM)通过支持基于音频的人类交互扩展了大型语言模型(LLM)的功能。然而,最近的研究表明,LALM仍然容易受到有害的查询,由于不充分的安全对齐。尽管文本和视觉LLM的防御措施取得了进展,但特别针对LALM的有效安全对齐策略和音频安全数据集明显缺乏。与此同时,基于监督微调(SFT)的防御措施努力解决安全改进问题,同时避免过度拒绝问题,从而显着影响有用性。在这项工作中,我们提出了一种无监督的安全微调策略作为补救措施,重塑模型的表示空间,以提高现有的LALM安全对齐,同时平衡过度拒绝的风险。我们在三代Qwen LALM上进行的实验表明,我们的方法在三种模态输入条件下(音频文本,纯文本和纯音频)显着提高了LALM的安全性,同时平均只增加了0.88%的过度拒绝率。警告:本文包含有害的示例。

【44】 A Comprehensive Real-World Assessment of Audio Watermarking Algorithms:  Will They Survive Neural Codecs?
标题: 音频水印算法的全面现实评估:它们能在神经编解码器中生存吗?
链接:https://arxiv.org/abs/2505.19663
作者: Yigitcan Özer,  Woosung Choi,  Joan Serrà,  Mayank Kumar Singh,  Wei-Hsiang Liao,  Yuki Mitsufuji 
备注:5 pages; 5 tables; accepted at INTERSPEECH 2025
摘要:我们提出了一个框架,以促进基于深度学习的音频水印算法的评估,建立一个标准化的基准,并允许系统的比较。为了模拟真实世界的使用,我们引入了一个全面的音频攻击管道,具有各种失真,如压缩,背景噪声和混响,并提出了一个多样化的测试数据集,包括语音,环境声音和音乐录音。通过评估四种现有水印算法在我们框架上的性能,两个主要的见解脱颖而出:(i)神经压缩技术构成了最重大的挑战,即使算法是用这种压缩训练的;(ii)用音频攻击训练通常可以提高鲁棒性,尽管在某些情况下还不够。此外,我们发现,特定的失真,如极性反转,时间拉伸,或混响,严重影响某些算法。我们的贡献加强了音频水印算法在广泛应用中的鲁棒性和感知评估,同时确保了公平和一致的评估方法。评估框架,包括攻击管道,可在github.com/SonyResearch/wm_robustness_eval上访问。

【45】 SACM: SEEG-Audio Contrastive Matching for Chinese Speech Decoding
标题: SACM:用于中文语音解码的SEEG-音频对比匹配
链接:https://arxiv.org/abs/2505.19652
作者: Hongbin Wang,  Zhihong Jia,  Yuanzhong Shen,  Ziwei Wang,  Siyang Li,  Kai Shu,  Feng Hu,  Dongrui Wu 
摘要:言语障碍,如构音障碍和构音障碍,可严重损害病人的口头沟通能力。语音解码脑机接口(BCI)通过将语音意图直接翻译成口语,提供了一种潜在的替代方案,充当语音神经假体。本文提出了一种汉语语音解码BCI的实验方案和相应的解码算法。立体脑电图(SEEG)和同步音频数据收集从8个耐药癫痫患者,因为他们进行了一个字级的阅读任务。所提出的SEEG和音频对比匹配(SACM),一个基于对比学习的框架,实现了解码精度显着超过机会水平的语音检测和语音解码任务。电极方面的分析表明,一个单一的感觉运动皮层电极实现的性能与全电极阵列。这些发现为开发更准确的在线语音解码BCI提供了有价值的见解。

【46】 STOPA: A Database of Systematic VariaTion Of DeePfake Audio for Open-Set  Source Tracing and Attribution
标题: STOPA:一个用于开集源追踪和归因的Deepfake音频系统变异数据库
链接:https://arxiv.org/abs/2505.19644
作者: Anton Firc,  Manasi Chibber,  Jagabandhu Mishra,  Vishwanath Pratap Singh,  Tomi Kinnunen,  Kamil Malinka 
备注:Accepted to Interspeech 2025 conference
摘要:Deepfake语音检测的一个关键研究领域是源跟踪-确定合成话语的起源。所述方法可涉及识别声学模型(AM)、声码器模型(VM)或其它世代特定参数。然而,由于缺乏专门的、系统化的数据集,进展受到限制。为了解决这个问题,我们引入了STOPA,这是一个系统多样且元数据丰富的数据集,用于deepfake语音源跟踪,涵盖了来自13个不同合成器的70万个样本的8个AM,6个VM和各种参数设置。与现有的数据集不同,这些数据集通常具有有限的变化或稀疏的元数据,STOPA提供了一个系统控制的框架,涵盖了更广泛的生成因素,例如声码器模型,声学模型或预训练权重的选择,以确保更高的归因可靠性。这种控制提高了归因准确性,有助于法医分析,deepfake检测和生成模型透明度。
摘要:A key research area in deepfake speech detection is source tracing - determining the origin of synthesised utterances. The approaches may involve identifying the acoustic model (AM), vocoder model (VM), or other generation-specific parameters. However, progress is limited by the lack of a dedicated, systematically curated dataset. To address this, we introduce STOPA, a systematically varied and metadata-rich dataset for deepfake speech source tracing, covering 8 AMs, 6 VMs, and diverse parameter settings across 700k samples from 13 distinct synthesisers. Unlike existing datasets, which often feature limited variation or sparse metadata, STOPA provides a systematically controlled framework covering a broader range of generative factors, such as the choice of the vocoder model, acoustic model, or pretrained weights, ensuring higher attribution reliability. This control improves attribution accuracy, aiding forensic analysis, deepfake detection, and generative model transparency.

【47】 Decoding Speaker-Normalized Pitch from EEG for Mandarin Perception
标题: 从脑电中解码说话者标准化音调以实现普通话感知
链接:https://arxiv.org/abs/2505.19626
作者: Jiaxin Chen,  Yiming Wang,  Ziyu Zhang,  Jiayang Han,  Yin-Long Liu,  Rui Feng,  Xiuyuan Liang,  Zhen-Hua Ling,  Jiahong Yuan 
摘要:同一语音内容由不同说话人发出时,其音高轮廓有显著差异,但听者的语义感知却不受影响。这种现象可能源于大脑对音高轮廓的感知与个体扬声器的音高范围无关。在这项工作中,我们记录了脑电图(EEG),而受试者听汉语单音节词与不同的音调,音素,和扬声器。CE-ViViT模型被提出来直接从EEG解码原始或说话者归一化的基音轮廓。实验结果表明,该模型可以解码音高轮廓与适度的错误,实现性能媲美国家的最先进的脑电回归方法。此外,说话人归一化基音轮廓解码更准确,支持相对音高的神经编码。
摘要:The same speech content produced by different speakers exhibits significant differences in pitch contour, yet listeners' semantic perception remains unaffected. This phenomenon may stem from the brain's perception of pitch contours being independent of individual speakers' pitch ranges. In this work, we recorded electroencephalogram (EEG) while participants listened to Mandarin monosyllables with varying tones, phonemes, and speakers. The CE-ViViT model is proposed to decode raw or speaker-normalized pitch contours directly from EEG. Experimental results demonstrate that the proposed model can decode pitch contours with modest errors, achieving performance comparable to state-of-the-art EEG regression methods. Moreover, speaker-normalized pitch contours were decoded more accurately, supporting the neural encoding of relative pitch.

【48】 Training-Free Multi-Step Audio Source Separation
标题: 免训练多步骤音频源分离
链接:https://arxiv.org/abs/2505.19534
作者: Yongyi Zang,  Jingyi Li,  Qiuqiang Kong 
摘要:音频源分离的目的是将混合信号分离成目标源。以往的音频源分离系统通常进行一步推理,没有充分挖掘模型的分离能力。在这项工作中,我们揭示了预训练的一步音频源分离模型可以用于多步分离,而无需额外的训练。我们提出了一个简单而有效的推理方法,迭代应用分离最佳混合输入混合与前一步的分离结果。在每一步,我们通过最大化指标来确定最佳混合比。我们证明了我们的方法总是比一步推理得到改进,提供基于模型平滑性和度量鲁棒性的误差界,并提供理论分析,将我们的方法与噪声和干净分布之间的线性插值路径去噪连接起来,这是我们与去噪扩散桥模型联系起来的一个属性。我们的方法有效地提供了改进的分离性能,作为现有模型的“免费午餐”。我们的实证结果表明,我们的多步分离方法在语音增强和音乐源分离任务中始终优于一步推理,并且可以实现类似于训练更大模型的缩放性能,使用更多数据,或者在某些情况下采用多步训练目标。这些改进不仅出现在多步推理期间的优化度量上,而且还扩展到几乎所有非优化度量(有一个例外)。我们还讨论了我们的方法的局限性和未来的研究方向。

【49】 Multi-Channel Acoustic Echo Cancellation Based on Direction-of-Arrival  Estimation
标题: 基于到达方向估计的多通道声学回声抵消
链接:https://arxiv.org/abs/2505.19493
作者: Fei Zhao,  Xueliang Zhang,  Zhong-Qiu Wang 
备注:Accepted by Interspeech 2025
摘要:声学回声消除(AEC)是一种重要的语音信号处理技术,它可以消除麦克风信号中的回声,使语音通信听起来更自然。虽然单通道AEC被广泛采用,但多通道AEC可以利用多个麦克风提供的空间线索来实现更好的性能。现有的多通道AEC方法通常将波束成形与深度神经网络(DNN)相结合。这项工作提出了一个两阶段的算法,提高多通道AEC,通过将声源方向线索。具体地,首先训练轻量级DNN来预测声源方向,然后将预测的方向信息、多通道麦克风信号和单通道远端信号联合馈送到AEC网络中以估计近端信号。评估结果表明,该算法优于基线方法,并在不同的声学环境中表现出强大的泛化能力。

【50】 Room Impulse Response as a Prompt for Acoustic Echo Cancellation
标题: 作为声学回声消除提示的房间脉冲响应
链接:https://arxiv.org/abs/2505.19480
作者: Fei Zhao,  Shulin He,  Xueliang Zhang 
备注:Accepted by Interspeech 2025
摘要:数据驱动的声学回声消除(AEC)方法主要在合成或受约束的真实世界数据集上训练,在看不见的回声场景中遇到性能下降,特别是在回声路径不可直接观察的真实环境中。我们提出的方法通过将房间脉冲响应(RIR)作为关键的训练提示来克服这一限制,旨在提高AEC模型在这种不可预见条件下的泛化能力。我们还探讨了四种RIR快速融合方法。全面的评估,包括在未知条件下的模拟RIR和真实记录的RIR,表明所提出的方法显着提高性能相比,基线模型。这些结果证实了我们的RIR指导的方法在加强模型的泛化能力的有效性。

【51】 RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive  Language-Audio Pretraining For Speech Retrieval
标题: RA-CLAP:语音检索的语音增强情感说话风格对比语音音频预训练
链接:https://arxiv.org/abs/2505.19437
作者: Haoqin Sun,  Jingguang Tian,  Jiaming Zhou,  Hui Wang,  Jiabei He,  Shiwan Zhao,  Xiangyu Kong,  Desheng Hu,  Xinkang Xu,  Xinhui Hu,  Yong Qin 
摘要:对比存储-音频预训练(CLAP)模型在一般的音频预处理相关任务(如音频检索)中表现出出色的性能。然而,在新兴的情感说话风格描述(ESSD)领域,跨模态对比预训练仍然在很大程度上未被探索。在本文中,我们提出了一种新的语音检索任务,称为情感说话风格检索(ESSR),和ESS-CLAP,一个情感说话风格CLAP模型,专门用于学习语音和自然语言描述之间的关系。此外,我们进一步提出了关系增强CLAP(RA-CLAP),以解决传统方法的局限性,假设一个严格的二元关系之间的字幕和音频。该模型利用自蒸馏学习语音和描述之间潜在的局部匹配关系,从而提高泛化能力。实验结果验证了RA-CLAP算法的有效性,为ESSD算法提供了有价值的参考。

【52】 GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style  Adaptor
标题: GSA-TTC:基于渐变风格适配器的Zero-Shot语音合成
链接:https://arxiv.org/abs/2505.19384
作者: Seokgi Lee,  Jungjun Kim 
备注:7 pages, 3 figures
摘要:我们提出了带有新型风格编码器的渐进风格适配器TTS(GSA-TTS),该编码器可以从声学参考逐渐编码说话风格,以进行零触发语音合成(zero-shot speech synthesis)。GSA首先捕获每个语义声音单元的本地风格。然后通过自注意将局部风格进行组合,得到全局风格条件。这种语义和分层编码策略为声学模型提供了鲁棒且丰富的风格表示。我们测试GSA-TTS看不见的扬声器,并获得有关自然度,扬声器相似性和可懂度有希望的结果。此外,我们探讨了潜在的GSA的可解释性和可控性,这源于其层次结构。

【53】 Towards Reliable Large Audio Language Model
标题: 迈向可靠的大型音频语言模型
链接:https://arxiv.org/abs/2505.19294
作者: Ziyang Ma,  Xiquan Li,  Yakun Song,  Wenxi Chen,  Chenpeng Du,  Jian Wu,  Yuanzhe Chen,  Zhuo Chen,  Yuping Wang,  Yuxuan Wang,  Xie Chen 
备注:ACL 2025 Findings
摘要:大型音频语言模型(LALM)的最新进展在语音、音乐和一般声音的普遍理解和推理方面展示了令人印象深刻的结果和广阔的前景。然而,这些模型仍然缺乏识别其知识边界的能力,并拒绝主动回答他们不知道的问题。虽然已经有成功的尝试,以提高可靠性的激光测距仪,可靠的激光测距仪仍然在很大程度上未经探索。在本文中,我们系统地研究了实现可靠LALM的各种方法,包括无需训练的方法,如多模态思想链(MCoT),以及基于训练的方法,如监督微调(SFT)。此外,我们发现以前的评估指标的局限性,并提出了一个新的度量,可靠性增益指数(RGI),以评估不同的可靠方法的有效性。我们的研究结果表明,无论是基于训练和训练的方法,提高LALM的可靠性在不同程度上。此外,我们发现,可靠性的意识是一种“Meta能力”,它可以跨不同的音频模态,虽然存在显着的结构和内容差异之间的声音,音乐和语音。

【54】 Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech  Representations Using a Simple Linear Equation
标题: Eta-WavLM:使用简单线性方程在自我监督语音表示中高效去除说话者身份
链接:https://arxiv.org/abs/2505.19273
作者: Giuseppe Ruggiero,  Matteo Testa,  Jurgen Van de Walle,  Luigi Di Caro 
备注:Full paper accepted at ACL 2025
摘要:自监督学习(SSL)通过从未注释的数据中学习有意义的表示,减少了对语音技术中昂贵的标记的依赖。由于大多数基于SSL的下游任务优先考虑语音中的内容信息,因此理想的表示应该将内容与SSL表示中的扬声器特性等不需要的变化分开。然而,去除说话人信息往往会降低其他语音成分,现有的方法要么无法完全解开说话人身份或需要资源密集型模型。在本文中,我们提出了一种新的解纠缠方法,线性分解成特定于扬声器和扬声器独立的组件的SSL表示,有效地产生扬声器解纠缠表示。综合实验表明,我们的方法实现了说话人独立性,因此,当应用于语音转换等内容驱动的任务时,我们的表示方法比最先进的方法有了显着的改进。

【55】 SpeakStream: Streaming Text-to-Speech with Interleaved Data
标题: SpeakStream:使用交织数据流传输文本到语音
链接:https://arxiv.org/abs/2505.19206
作者: Richard He Bai,  Zijin Gu,  Tatiana Likhomanenko,  Navdeep Jaitly 
摘要:传统文本到语音(TTS)系统的延迟瓶颈从根本上阻碍了会话AI中流式传输大型语言模型(LLM)的潜力。这些TTS系统通常在完整的话语上进行训练和推理,当与流式LLM输出耦合时,即使具有优化的推理速度,也会引入不可接受的延迟。这对于创建响应式会话代理尤其成问题,其中低第一令牌延迟是关键的。在本文中,我们提出了SpeakStream,流TTS系统,使用解码器的架构,从流文本增量生成音频。SpeakStream使用交织文本语音数据的下一步预测损失进行训练。在推理过程中,它在吸收流输入文本的同时增量地生成语音,使其特别适合于级联会话AI代理,其中LLM将文本流传输到TTS系统。我们的实验表明,SpeakStream在第一个令牌延迟方面实现了最先进的延迟结果,同时保持了非流式TTS系统的质量。

【56】 EnvSDD: Benchmarking Environmental Sound Deepfake Detection
标题: EnvSDD:环境声音Deepfake检测基准
链接:https://arxiv.org/abs/2505.19203
作者: Han Yin,  Yang Xiao,  Rohan Kumar Das,  Jisheng Bai,  Haohe Liu,  Wenwu Wang,  Mark D Plumbley 
备注:Accepted by Interspeech 2025
摘要:音频生成系统现在可以创建非常逼真的音景,可以增强媒体制作,但也会带来潜在风险。一些研究已经检查了语音或歌声中的deepfake。然而,环境声音具有不同的特征,这可能使得用于检测语音和唱歌的方法对真实世界的声音不那么有效。此外,现有的环境声音deepfake检测数据集在规模和音频类型方面受到限制。为了解决这一差距,我们引入了EnvSDD,这是为这项任务设计的第一个大规模策划数据集,包括45.25小时的真实音频和316.74小时的假音频。测试集包括各种条件来评估泛化能力,例如看不见的生成模型和看不见的数据集。我们还提出了一个基于预训练音频基础模型的音频深度伪造检测系统。EnvSDD的结果表明,我们提出的系统优于国家的最先进的系统从语音和歌唱领域。

【57】 BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual  Biasing ASR in Speech LLM
标题: BR-ASB:用于语音LLM中上下文偏置ASB的高效且可扩展的偏置检索框架
链接:https://arxiv.org/abs/2505.19179
作者: Xun Gong,  Anqi Lv,  Zhiming Wang,  Huijia Zhu,  Yanmin Qian 
备注:Accepted by InterSpeech 2025
摘要:虽然语音大语言模型(SpeechLLM)具有先进的标准自动语音识别(ASR),但命名实体和稀有词的上下文偏置仍然具有挑战性,特别是在规模上。为了解决这个问题,我们提出了BR-ASR:一个大规模上下文偏置(高达20万个条目)的偏置检索框架,通过两个创新:(1)语音和偏置对比学习检索语义相关的候选人;(2)动态课程学习,减轻同音混淆,这对最终的表现产生负面影响。这是一个通用框架,允许将检索到的候选项无缝集成到不同的ASR系统中,而无需进行微调。LibriSpeech test-clean/-other的实验在2000个偏置词的情况下实现了2.8%/7.1%的最先进的(SOTA)偏置词错误率(B-WER),与现有方法相比,相对提高了45%。BR-ASR还展示了高可扩展性:当将偏置列表扩展到200 k时,传统方法通常会失败,它仅引起0.3 / 2.9%的绝对WER / B-WER降级,修剪率为99.99%,每个查询的测试延迟仅为20 ms。

【58】 CloneShield: A Framework for Universal Perturbation Against Zero-Shot  Voice Cloning
标题: CloneShield:针对Zero-Shot语音克隆的普遍扰动框架
链接:https://arxiv.org/abs/2505.19119
作者: Renyuan Li,  Zhibo Liang,  Haichuan Zhang,  Tianyu Shi,  Zhiyuan Cheng,  Jia Shi,  Carl Yang,  Mingjie Tang 
备注:10pages, 4figures
摘要:最近文本到语音(TTS)语音克隆的突破引起了严重的隐私问题,允许从几秒钟的参考音频中高度准确地复制声音身份,同时保留说话者的声音真实性。在本文中,我们介绍克隆盾,一个通用的时域对抗扰动框架,专门设计用于防御zero-shot语音克隆。我们的方法提供了保护,是强大的扬声器和话语,而不需要任何先验知识的合成文本。我们将扰动生成归结为一个多目标优化问题,并提出了多梯度下降算法(MGDA),以确保对不同话语的鲁棒保护。为了保持用户的自然听觉感知,我们通过Mel频谱图表示分解对抗扰动,并对每个样本进行微调。这种设计确保了不可感知性,同时保持了对zero-shot克隆输出的强烈降级效果。三个国家的最先进的zero-shot TTS系统,五个基准数据集和60个人类听众的评价实验表明,我们的方法保留了近原始的音频质量在受保护的输入(PESQ = 3.90,SRS = 0.93),而大大降低了扬声器的相似性和语音质量在克隆样本(PESQ = 1.07,SRS = 0.08)。

【59】 WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
标题: WHISTRASS:通过句子压力检测丰富Transit
链接:https://arxiv.org/abs/2505.19103
作者: Iddo Yosha,  Dorin Shteyman,  Yossi Adi 
备注:Accepted to Interspeech2025
摘要:口语不仅通过单词,而且通过语调、情感和强调来传达意思。句子重音是对句子中特定单词的强调,对于表达说话者的意图至关重要,在语言学中得到了广泛的研究。在这项工作中,我们介绍了WHISTRESS,一种无干扰的方法,用于增强具有句子重音检测的转录系统。为了支持这一任务,我们提出了TINYSTRESS-15 K,这是一种可扩展的合成训练数据,用于句子重音检测任务,该任务来自全自动数据集创建过程。我们在TINYSTRESS-15 K上对WHISTRESS进行训练,并根据几个竞争基准对其进行评估。我们的研究结果表明,WHISTRESS优于现有的方法,同时在训练或推理过程中不需要额外的输入先验。值得注意的是,尽管是在合成数据上训练的,但WHISTRESS在不同的基准测试中表现出了强大的零次(zero-shot)泛化能力。项目页面:https://pages.cs.huji.ac.il/adiyoss-lab/whistress。

【60】 Self-supervised learning method using multiple sampling strategies for  general-purpose audio representation
标题: 使用多种采样策略进行通用音频表示的自我监督学习方法
链接:https://arxiv.org/abs/2505.18984
作者: Ibuki Kuroyanagi,  Tatsuya Komatsu 
备注:5 pages, 1 figure, 2 tables, ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
摘要:我们提出了一种自监督学习方法,使用多个采样策略,以获得通用的音频表示。在所提出的方法中使用多个采样策略来从不同的角度构造对比损失,并基于它们来学习表示。在这项研究中,除了广泛使用的剪辑级采样策略,我们引入了两个新的策略,帧级策略和特定任务的策略。所提出的多个策略提高了帧级分类和其他任务(如基音检测)的性能,这些任务不是传统的单限幅级采样策略的重点。我们在Audioset的一个子集上预训练了该方法,并将其应用于具有冻结权重的下游任务。该方法将剪辑分类、声音事件检测和基音检测性能分别提高了25%、20%和3.6%。

【61】 Serial-OE: Anomalous sound detection based on serial method with outlier  exposure capable of using small amounts of anomalous data for training
标题: Serial-OE:基于具有异常值暴露的序列方法的异常声音检测,能够使用少量异常数据进行训练
链接:https://arxiv.org/abs/2505.18982
作者: Ibuki Kuroyanagi,  Tomoki Hayashi,  Kazuya Takeda,  Tomoki Toda 
备注:39 pages, 5 figures, 5 tables, APSIPA Transactions on Signal and Information Processing
摘要:我们介绍Serial-OE,一种新的异常声音检测(ASD)方法,利用少量的异常数据来提高性能。由于从各种可能类型的设备故障中收集异常数据的成本,传统的ASD方法主要依赖于正常数据的建模。我们的方法通过实现一个离群值暴露框架来改进现有的ASD系统,该框架利用正常和伪异常数据进行训练,并且还能够使用少量的真实异常数据。使用DCASE 2020 Task 2数据集进行的综合评估表明,我们的方法优于最先进的ASD模型。我们还研究了在训练过程中使用少量异常数据、使用没有机器ID信息的数据以及使用受污染的训练数据对性能的影响。我们的实验结果揭示了在训练过程中使用非常有限的异常数据的潜力,以解决由于异常数据的稀缺而仅使用正常数据进行训练的现有方法的局限性。这项研究有助于该领域提出了一种方法,可以动态地适应,包括异常数据在ASD系统的操作阶段,铺平了道路,更准确的ASD。

【62】 Improving Anomalous Sound Detection through Pseudo-anomalous Set  Selection and Pseudo-label Utilization under Unlabeled Conditions
标题: 在无标签条件下通过伪异常集选择和伪标签利用提高异常声音检测
链接:https://arxiv.org/abs/2505.18980
作者: Ibuki Kuroyanagi,  Takuya Fujimura,  Kazuya Takeda,  Tomoki Toda 
备注:33 pages, 3 figures, 7 tables, APSIPA Transactions on Signal and Information Processing
摘要:本文讨论了性能下降时,既没有足够相似的机器数据,也没有运行状态标签异常声音检测(ASD)。我们提出了一个集成的管道,结合了三个互补的组件来自以前的工作,并将它们扩展到未标记的ASD设置。首先,我们采用基于异常分数的选择器来策划类似于目标机器的正常声音的外部音频数据。其次,我们利用三元组学习为未标记的数据分配伪标签,从而实现对操作声音的更精细分类和对细微异常的检测。第三,我们采用迭代训练来改进伪异常集选择和伪标签分配,逐步提高检测准确性。在DCASE 2022 -2024任务2数据集上的实验表明,在未标记的设置中,与传统方法相比,我们的方法实现了平均AUC增加超过6.6个点。在标记的设置中,结合来自伪异常集的外部数据进一步提高性能。这些结果突出了我们的方法在机器数据和标签稀缺的情况下的实用性和鲁棒性,以最小的注释工作促进了ASD在不同工业环境中的部署。

【63】 Audio Geolocation: A Natural Sounds Benchmark
标题: 音频地理定位:自然声音基准
链接:https://arxiv.org/abs/2505.18726
作者: Mustafa Chasmai,  Wuao Liu,  Subhransu Maji,  Grant Van Horn 
摘要:我们能仅仅从他们听到的声音来确定某人的地理位置吗?声学信号是否足以在一个国家、州甚至城市内进行定位?我们解决了全球范围内的音频地理定位的挑战,将问题形式化,并对来自iNatSounds数据集的野生动物音频进行了深入分析。采用视觉启发的方法,我们将音频记录转换为频谱图,并对现有的图像地理定位技术进行基准测试。我们假设,物种发声提供强大的地理定位线索,由于其定义的地理范围,并提出了一种方法,将物种范围预测与检索为基础的地理定位。我们进一步评估地理定位是否改善时,分析物种丰富的记录或跨时空的邻居聚合。最后,我们介绍了从电影的案例研究,探索多模态地理定位使用音频和视觉内容。我们的工作突出了整合音频和视觉线索的优势,并为音频地理定位的未来研究奠定了基础。


【64】 MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song  Translation
标题: MAGL:用于动画歌曲翻译的多语言音视频歌词数据集
链接:https://arxiv.org/abs/2505.18614
作者: Woohyun Cho,  Youngmin Kim,  Sunghyun Lee,  Youngjae Yu 
备注:28 pages, 8 figures
摘要:歌词翻译既要准确地传递语义,又要保持音乐节奏、音节结构和诗歌风格。在动画音乐剧中,由于视觉和听觉线索的一致性,挑战加剧。我们介绍了多语言音频视频歌词基准动画歌曲翻译(MAVL),第一个多语言,多模式的可唱歌词翻译基准。通过集成文本、音频和视频,MAVL可以实现比纯文本方法更丰富、更富有表现力的翻译。在此基础上,我们提出了音节约束的音频-视频LLM与思想链Sylvl-CoT,它利用音频-视频线索,并强制执行音节约束,以产生自然的歌词。实验结果表明,SylAVL-CoT显着优于基于文本的模型在唱性和上下文的准确性,强调多模态,多语言方法的歌词翻译的价值。

【65】 LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
标题: Listen:神经音频LLM的学习软令牌嵌入
链接:https://arxiv.org/abs/2505.18517
作者: Pooneh Mousavi,  Shubham Gupta,  Cem Subakan,  Mirco Ravanelli 
摘要:基于大型语言模型(LLM)的基础模型在处理各种任务和模态方面取得了巨大的成功。然而,由于声学环境和任务变化的差异,使这些模型适应通用的音频语言任务是具有挑战性的。在这项工作中,我们介绍了LiSTEN Learning Soft Token Embeddings for Neural Audio LLM),这是一个用于使LLM适应语音和音频任务的框架。LiSTEN使用动态提示选择策略和可学习的键值对,允许模型平衡一般和特定于任务的知识,同时避免在多任务设置中过度拟合。我们的方法减少了对大规模ASR或字幕数据集的依赖,用更少的可训练参数实现了有竞争力的性能,并通过使用单阶段过程简化了训练。此外,LiSTEN通过分析不同任务中所选提示的多样性和重叠性来增强可解释性。

【66】 Learning Emotion-Invariant Speaker Representations for Speaker  Verification
标题: 用于说话人确认的不变性说话人表示学习方法
链接:https://arxiv.org/abs/2505.18498
作者: Jingguang Tian,  Xinhui Hu,  Xinkang Xu 
摘要:近年来,基于深度学习的说话人表征提取技术推动了说话人确认(SV)技术的快速发展。然而,这种表示仍然容易受到情绪变化的影响。为了解决这个问题,我们提出了多项改进训练扬声器编码器,以增加情感鲁棒性。首先,我们利用基于CopyPaste的数据增强来收集额外的并行数据,其中包括来自同一说话者的不同情感表达。其次,我们应用余弦相似性损失来限制平行样本对,并最大限度地减少说话人表示的类内变化,以减少其与情感信息的相关性。最后,我们使用情感感知掩蔽(EM)的基础上的语音信号能量的输入并行样本,以进一步加强说话人表示,使其情感不变。我们进行了全面的消融研究,以证明这些不同组件的有效性。实验结果表明,该方法与基线系统相比,EER降低了19.29%.

【67】 Token-Level Logits Matter: A Closer Look at Speech Foundation Models for  Ambiguous Emotion Recognition
标题: 令牌级日志很重要:仔细研究模糊情感识别的语音基础模型
链接:https://arxiv.org/abs/2505.18484
作者: Jule Valendo Halim,  Siyi Wang,  Hong Jia,  Ting Dang 
备注:Accepted at INTERSPEECH 2025
摘要:会话AI中的情商在人机交互等领域至关重要。虽然已经开发了许多模型,但它们往往忽略了人类情感固有的复杂性和模糊性。在大型语音基础模型(SFM)时代,了解其识别模糊情感的能力对于开发下一代情感感知模型至关重要。本研究探讨了SFM在模糊情绪识别中的有效性。我们设计了模糊的情感预测提示,并介绍了两种新的方法来推断模糊的情感分布:一个分析生成的文本响应和其他检查的内部处理的SFM通过令牌级logits。我们的研究结果表明,虽然SFM可能无法始终如一地为模棱两可的情绪生成准确的文本响应,但它们可以根据先验知识在令牌级别解释此类情绪,从而在不同的提示中表现出鲁棒性。

【68】 MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal  Prompt
标题: MPE-TTC:使用多模式提示的自定义情感Zero-Shot文本到语音
链接:https://arxiv.org/abs/2505.18453
作者: Zhichao Wu,  Yueteng Kang,  Songjun Cao,  Long Ma,  Qiulin Li,  Qun Yang 
备注:Accepted by InterSpeech
摘要:现有的Zero-Shot文本到语音(Zero-Shot Text-To-Speech,简称ZTTS)系统大多基于单一提示(如参考语音或文本描述)生成不可见的语音,这限制了它们的灵活性。提出了一种基于多模态提示的个性化情感语音合成系统。该系统将语音分解为内容、音色、情感和韵律,允许以文本、图像或语音的形式提供情感提示。为了从不同的提示中提取情感信息,我们提出了一种多模态提示情感编码器。此外,我们还引入了一个韵律预测器来拟合韵律的分布,并提出了一个情感一致性损失来保留预测韵律中的情感信息。采用基于扩散的声学模型来生成目标梅尔谱图。客观和主观的实验表明,我们的系统优于现有的系统在自然度和相似性。样本可在https://mpetts-demo.github.io/mpetts_demo/上获得。

【69】 ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic  Conditions Challenge
标题: ABHINAYA --自然条件挑战中的语音情感识别系统
链接:https://arxiv.org/abs/2505.18217
作者: Soumya Dutta,  Smruthi Balaji,  Varada R,  Viveka Salinamakki,  Sriram Ganapathy 
备注:5 pages, 2 figures, 4 tables, accepted at Interspeech 2025
摘要:自然环境下的语音情感识别(SER)仍然是一个挑战,由于固有的可变性,不同的记录条件,和类的不平衡。作为参与者的Interspeech自然SER挑战,专注于这些复杂性,我们提出了Abhinaya,一个系统集成语音为基础的,基于文本的,和语音文本模型。我们的方法微调自监督和语音大语言模型(SLLM)的语音表示,利用大语言模型(LLM)的文本上下文,并采用语音文本建模与SLLM捕捉细微差别的情感线索。为了对抗类别不平衡,我们应用定制的损失函数,并通过多数投票生成分类决策。尽管有一个模型没有经过完全训练,但Abhinaya系统在166个提交的数据中排名第四。在完成培训后,它在已发表的结果中实现了最先进的性能,证明了我们的方法在现实世界条件下的SER的有效性。

【70】 Discovering Interpretable Concepts in Large Generative Music Models
标题: 在大生成音乐模型中发现可解释的概念
链接:https://arxiv.org/abs/2505.18186
作者: Nikhil Singh,  Manuel Cherep,  Pattie Maes 
备注:16 pages, 9 figures
摘要:神经网络现在可以生成音乐等内容的保真度提供了一个科学机会:这些系统似乎已经通过统计学习学习了这些内容结构的隐含理论。这可以为人类生成媒体的理论提供一个新的视角。当这些表示与传统结构(例如音乐中的和弦进行)相一致时,它们展示了如何从统计数据中推断出这些结构。在它们出现分歧的地方,它们突出了我们理论框架中的潜在局限性--我们可能忽略了这些模式,但它们仍然具有重要的解释力。在本文中,我们专注于音乐生成器的具体情况。我们介绍了一种方法来发现音乐的概念,使用稀疏自动编码器(SAE),提取可解释的功能,从残余流激活的Transformer模型。我们通过提取大量特征并为它们生成自动标记和评估管道来评估这种方法。我们的研究结果揭示了熟悉的音乐概念和违反直觉的模式,在现有的理论或自然语言中缺乏明确的对应物。除了提高模型的透明度,我们的工作提供了一个新的经验工具,可能有助于发现组织原则的方式,逃避传统的分析和综合方法。


机器翻译由腾讯交互翻译提供,仅供参考