今日论文合集:CS.SD语音与音频 | 共 30 篇。
本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
快速导航
1. 语音识别与关键词检测 2 篇
2. 语音合成与声音生成 5 篇
3. 音频事件检测与场景理解 2 篇
4. 音乐信息检索与音乐生成 2 篇
5. 语音翻译与语音语言模型 2 篇
6. 数据集、基准与评测 3 篇
7. 安全、隐私与深度伪造音频 2 篇
8. 其他/综合语音音频 12 篇
1. 语音识别与关键词检测 | 2 篇
1. A New Transformer-Based Approach for Audio-Based Kinship Verification and a New Uncontrolled Mandarin Kinship Speech Dataset
一种基于Transformer的音频亲属关系验证新方法及一个新的非受控普通话亲属语音数据集
AI 总结:本文提出基于Transformer的音频亲属关系验证新架构CONVTRAP-TN,并构建非受控普通话数据集ARKIN,通过基线实验证明现有方法跨数据集不鲁棒。
链接:https://arxiv.org/abs/2609.14145
机构:Imperial College London(帝国理工学院); TUM University Hospital(慕尼黑工业大学附属医院)
作者:Qiyang Sun, Langqing Zhang, Yupei Li, Björn Schuller
2. Grounded in Sound: Reinforcement Learning with a Frozen Acoustic Judge to Curb ASR Insertion Hallucinations
以声音为锚:利用冻结声学评判器进行强化学习以抑制ASR插入幻觉
AI 总结:针对ASR后训练中RL奖励仅基于文本导致插入幻觉的问题,提出用冻结的wav2vec2-CTC声学评判器增强GRPO奖励,在AMI上减少插入错误28.3%并降低WER,且推理时无需额外开销。
链接:https://arxiv.org/abs/2609.14455
机构:Tencent(腾讯)
作者:Tingzhen Xiong, Rilin Chen, Weiwei Li, Wentao Zhang, Qicong Xie
2. 语音合成与声音生成 | 5 篇
3. The Limits of Reference-Free Speech Quality Metrics as Evaluators and Rewards on Modern Text-to-Speech
无参考语音质量指标作为现代文语转换系统评估器与奖励的局限性
AI 总结:本研究检验无参考TTS质量指标作为评估器与奖励的可靠性,发现其在干净音频上无法可靠追踪人类偏好,而组合指标作为奖励更稳健,并诊断了单一分数失效的原因。
链接:https://arxiv.org/abs/2609.13150
作者:Antonis Asonitis, Juan Pablo Zuluaga Gomez, Francesco Verdini, Aref Farhadipour, Marzieh Razavi, Pierre-Edouard Honnet, Vijeta Avijeet
4. The VoiceMOS Challenge 2026: Evaluating Speech Enhancement, Emotional TTS and Accented TTS Systems
VoiceMOS 挑战赛2026:评估语音增强、情感文本转语音和带口音文本转语音系统
AI 总结:VoiceMOS挑战赛2026评估语音增强、情感TTS和带口音TTS系统,设三个赛道,吸引18支队伍,多数超越基线,并总结结果与未来方向。
链接:https://arxiv.org/abs/2609.13792
机构:Nagoya University(名古屋大学); Shanghai Jiao Tong University(上海交通大学); Technische Universität Braunschweig(布伦瑞克工业大学); The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); University of Edinburgh(爱丁堡大学); National Institute of Information and Communications Technology(日本国立信息通信技术研究所)
作者:Wen-Chin Huang, Wei Wang, Marvin Sach, Xiaoxue Gao, Nicholas Sanders, Erica Cooper, Toda Tomoki
5. DiTAR+: Dual Optimization for Robust Autoregressive Diffusion Speech Synthesis
DiTAR+:面向鲁棒自回归扩散语音合成的双重优化
AI 总结:DiTAR+通过膨胀上下文采样与分层声学掩蔽双重优化,解决自回归扩散语音合成中的解码不稳定问题,降低词错误率并提升长语句说话人相似度。
链接:https://arxiv.org/abs/2609.13909
机构:Northwestern Polytechnical University(西北工业大学)
作者:Ziyu Zhang, Tianlun Zuo, Hanzhao Li, Haoyu Zhang, Lei Xie
6. Tracing the Origins: Legacy Codec Identification in Neural Audio Transcoding
追溯起源:神经音频转码中的遗留编解码器识别
AI 总结:本研究针对神经音频转码掩盖遗留压缩痕迹的取证空白,提出基于Transformer的框架,利用RVQ序列的层次与时间依赖,实现97%以上准确率的编解码器识别,证明神经转码后传统痕迹仍可追溯。
链接:https://arxiv.org/abs/2609.14916
机构:DGIST(大邱庆北科学技术院)
作者:Wonje Heo, Shinee Youn, Yooshin Kim, Chuck Chae, Donghoon Shin
7. Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning
跨语言 F5-TTS 2:用于语言无关语音克隆的简化框架
AI 总结:本文提出跨语言F5-TTS 2,一种无需强制对齐和转录文本的跨语言语音克隆简化框架,通过预训练模型构造配对数据并微调,增强语速预测器鲁棒性,实现更高说话人相似度。
链接:https://arxiv.org/abs/2609.15184
机构:Johns Hopkins University(约翰霍普金斯大学); Shanghai Jiao Tong University(上海交通大学); Shanghai Innovation Institute(上海创智学院); Geely(吉利); Zhejiang University(浙江大学); Fudan University(复旦大学)
作者:Qingyu Liu, Rixi Xu, Yushen Chen, Zhikang Niu, Haitao Li, Pengcheng Zhu, Bowen Zhang, Jian Zhao, Yunting Yang, Qinyuan Cheng, Xipeng Qiu, Berrak Sisman, Kai Yu, Xie Chen
3. 音频事件检测与场景理解 | 2 篇
8. Predictive audio representations for early detection and tracking of hidden dynamic objects
用于早期检测和跟踪隐藏动态对象的预测性音频表示
AI 总结:本文提出一个基于JEPA自监督预训练和LSTM多任务微调的音频系统,同时估计隐藏车辆的数量、类型和到达方向,在非视距多智能体场景中优于现有方法。
链接:https://arxiv.org/abs/2609.13595
机构:University of Parma(帕尔马大学); Fraunhofer Institute for Digital Media Technology IDMT(弗劳恩霍夫数字媒体技术研究所)
作者:Katerina Vinciguerra, Moritz Brandes, Danilo Hollosi, Letizia Marchegiani
9. MAST: Label-Efficient, Robust, and Generalizable Sound Detection for Biodiversity Monitoring via Masked Audio Pretraining and Self-Training
MAST:通过掩码音频预训练和自训练实现生物多样性监测的标签高效、鲁棒且可泛化的声音检测
AI 总结:提出MAST框架,结合掩码音频预训练、对比学习和自训练,在无需额外标注下提升跨域声学检测的鲁棒性,在雨林和鸟类数据集上分别实现+0.22/+0.24和+0.12/+0.10的mAP/F1提升。
链接:https://arxiv.org/abs/2609.15221
机构:University of Wisconsin--Madison(威斯康星大学麦迪逊分校)
作者:Tianyi Xu, Daniel Pimentel-Alarcón, Zuzana Buřivalová, Claudia Solís-Lemus
4. 音乐信息检索与音乐生成 | 2 篇
10. ScorePrompts: Natural-Language Exploration of Symbolic Music Scores through Analysis
ScorePrompts:通过分析对符号音乐乐谱进行自然语言探索
AI 总结:ScorePrompts是一个交互式系统,通过专业MIR组件和模式约束语言模型,将符号音乐乐谱分析结果转化为自然语言描述,支持问答检索和可视化,用于探索性乐谱分析。
链接:https://arxiv.org/abs/2609.13291
作者:Emmanouil Karystinaios, Gerhard Widmer
11. Sectional Structure and Emotional Dynamics in Chinese Pop Songs: An Empirical Analysis of Valence-Arousal Trajectories across 100 Songs
中国流行歌曲的段落结构与情感动态:对100首歌曲的效价-唤醒轨迹的实证分析
AI 总结:本研究通过分析100首中文流行歌曲的段落结构与连续效价-唤醒轨迹,揭示了段落间情感差异主要体现在唤醒度上,并提出了“局部循环-整体累积”的情感组织经验框架。
链接:https://arxiv.org/abs/2609.15675
作者:Jingyi Lyu
5. 语音翻译与语音语言模型 | 2 篇
12. Bridging the Modality Gap in Long-Form Clinical Audio: A Comparative Study of Lightweight and Heavyweight End-to-End SOAP Generation
弥合长时临床音频中的模态鸿沟:轻量级与重量级端到端SOAP生成对比研究
AI 总结:本研究提出一种完全端到端的多模态系统,直接从长时临床音频生成SOAP笔记,通过多阶段训练和规模扩展,在BeTraC 2026挑战中超越级联ASR+LLM基线,验证了直接多模态优化的有效性。
链接:https://arxiv.org/abs/2609.14467
机构:Northwestern Polytechnical University(西北工业大学)
作者:Ziyu Zhang, Mingchen Shao, Wenjie Tian, Tianlun Zuo, Longhao Li, Lei Xie
13. Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception
增强大型音频-语言模型与帧级定位能力以实现细粒度时间感知
AI 总结:本研究通过为大型音频-语言模型增加帧级定位模型,利用语义查询与细粒度音频特征结合,显著提升事件时间定位的精度和可靠性。
链接:https://arxiv.org/abs/2609.15215
机构:University of Science and Technology of China(中国科学技术大学); Singapore Institute of Technology(新加坡理工大学)
作者:Yanfeng Shi, Yan Song, Junhui Li, Tinggan Huang, Wu Guo, Haoyu Song, Ian McLoughlin
6. 数据集、基准与评测 | 3 篇
14. UniqueShip: Mitigating Data Leakage in Acoustic Ship Classification Benchmark Datasets
UniqueShip:缓解声学船舶分类基准数据集中的数据泄漏
AI 总结:针对水下声学目标识别中数据泄漏导致性能虚高的问题,提出UniqueShip基准数据集,通过严格控制划分,证明船舶多样性比总时长更重要,并提供基线与分析。
链接:https://arxiv.org/abs/2609.13659
机构:Kitware, Inc.(Kitware公司)
作者:Connor Hashemi, Trevor Stout, Anthony Hoogs, Jason Parham
15. CCMAN: Cognitive Instability-Aware Cross-Modal Attention Network for Interpretable Temporal Biomarkers of Verbal Fluency Speech
CCMAN:面向言语流畅性任务可解释时间生物标志物的认知不稳定性感知跨模态注意力网络
AI 总结:本文提出CCMAN跨模态注意力网络,融合语义、声学和语言信息,利用时间言语不稳定性作为可解释生物标志物,在843人言语数据上实现优于基线的认知衰退早期检测。
链接:https://arxiv.org/abs/2609.14764
机构:University of Sheffield(谢菲尔德大学)
作者:Madhurananda Pahar, Caitlin Illingworth, Dorota Braun, Daniel Blackburn, Heidi Christensen
16. Building a Dataset for Music Sample Identification
构建音乐样本识别数据集
AI 总结:针对样本识别任务缺乏大规模数据的问题,构建了一个比现有基准大近三个数量级的数据集,并提出了基于图连通分量划分的防泄漏流水线,以促进该领域研究。
链接:https://arxiv.org/abs/2609.15465
作者:R. Oguz Araz, Xavier Lizarraga, Xavier Serra, Dmitry Bogdanov
7. 安全、隐私与深度伪造音频 | 2 篇
17. CRAF: Cross-View Residual-Aware Fusion for Deepfake Speech Detection
CRAF:用于深度伪造语音检测的跨视图残差感知融合
AI 总结:CRAF框架利用听觉大语言模型引导的跨视图注意力与残差融合,提升深度伪造语音检测对未见攻击的泛化能力,在ASVspoof 5上取得5.96%的EER。
链接:https://arxiv.org/abs/2609.13842
机构:Japan Advanced Institute of Science and Technology(日本先端科学技术大学院大学)
作者:Minh-Xuan Phan, Khalid Zaman, Candy Olivia Mawalim, Masashi Unoki
18. Graph Attention Design Choices Matter: A Controlled Study of LoRA-Adapted Audio Anti-Spoofing
图注意力设计选择至关重要:LoRA自适应音频防欺骗的受控研究
AI 总结:本研究通过受控实验分解图注意力层为三个设计维度,发现可学习温度分支显著提升音频防欺骗性能,且设计维度间存在非加性交互。
链接:https://arxiv.org/abs/2609.15650
机构:Southwestern University of Finance and Economics(西南财经大学); Xiaomi Inc.(小米公司); Wuhan University(武汉大学); Hubei Luojia Laboratory(湖北珞珈实验室)
作者:Haoyu Wang, Jing Yang, Chenyu Liu, Yushan Du, Yifan Liao, Ningning Pan, Gongping Huang, Yu Zhao, Gang Li, Jian Luan
8. 其他/综合语音音频 | 12 篇
19. From Masking to Merging: Rethinking SpecAugment for Efficient Audio Spectrogram Transformer
从掩蔽到合并:重新思考SpecAugment以实现高效的音频频谱图Transformer
AI 总结:本文提出SpecAugment-Patch Merging方法,通过掩蔽并合并补丁对减少AST处理的令牌数,在几乎不损失准确率(AudioSet mAP 34.07→34.08)的情况下提升吞吐量13.9%,实现高效训练。
链接:https://arxiv.org/abs/2609.13260
机构:Korea University(高丽大学)
作者:Minhee Park, Hyowon Ahn, Chanwoo Kim
20. Musical Timing in Studio Recordings
录音室录音中的音乐时间感
AI 总结:本研究通过分析391个多轨录音,发现共享声学空间和声音泄漏的录音比隔离录音具有更紧密的时间协调,而配音则增加时间变异性。
链接:https://arxiv.org/abs/2609.13881
机构:Athens University of Economics and Business(雅典经济与商业大学)
作者:Konstantinos Tsioutas, George Xylomenos
21. StepAudio 3 Realtime Technical Report
StepAudio 3 实时技术报告
AI 总结:本文提出 StepAudio 3 Realtime,一种基于听-说-思-行循环的音频语言模型,通过边说边想机制实现实时深度推理,在多个基准上取得领先性能。
链接:https://arxiv.org/abs/2609.14005
作者:Bin Lin, Bo Zhao, Boyang Zhang, Boyong Wu, Chao Yan, Chen Geng, Chen Wu, Cheng Yi, Chengli Feng, Chenglin Zhu, Chengting Feng, Chengyuan Yao, Daijiao Liu, DanNi Wan, Daxin Jiang, Dongjian Li, Dongqing Pang, Fei Tian, Feng Tian, Future Li, Gang Yu, Guanglong Yang, Haoyang Zhang, Hongyuan Wang, Jia Peng, Jiahao Song, Jialong Xue, Jiamin Fan, Jiangjie Zhen, Jianzheng Gao, Jincheng Wen, Jinghua Liang, Jinglan Gong, Jun Chen, Li Xie, Liang Zhao, Lifang Zhang, Lingli Ji, Lun Cai, Min Xu, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Qinxin Du, Ruijie Xiong, Runze Li, Shenghua Hu, Shengqian Qin, Shi Qiu, Siqi Tu, Siyi Zhou, Tianjiao Deng, Wanying Lu, Weiming Niu, Wen Sun, WenWen Qu, Xiangyu Zhang, Xianwei Zhang, Xiaosu Su, Xing Chen, Xinyu Liu, Xuerui Yang, Yan Wu, Yang Li, Yang Yang, Yechang Huang, Yibo Zhu, Yifan Zhang, Yinuo Yan, Youjun Chen, Yu Fu, Yu Luo, Yu Zhou, Yujie Chen, Yumang Wang, Yunzhou Ju, Yuxiang Yang, Yuxin Li, Yuxin Zhang, Zekai Liu, Zengwei Yao, Zhaoxin Yuan, Zhenwei Mou, Zhiquan Zhang, Zhiyue Wu, Zichao Li, Zichao Zhou, Ziqi Ren, Zixuan Wang
22. Robust Cross-Domain Speech-Based Alzheimer's Disease Detection via Iterative Adversarial Self-Training
基于迭代对抗自训练的鲁棒跨域语音阿尔茨海默病检测
AI 总结:针对语音AD检测跨域性能退化问题,提出迭代对抗自训练(IAST)无监督域适应方法,学习域不变特征,显著提升跨域泛化与鲁棒性。
链接:https://arxiv.org/abs/2609.14139
机构:Johns Hopkins University(约翰斯·霍普金斯大学); University of Michigan(密歇根大学); Carnegie Mellon University(卡内基梅隆大学)
作者:Luqi Sun, Shreeram Suresh Chandra, Aurosweta Mahapatra, Emily Mower Provost, Brian MacWhinney, Berrak Sisman
23. AURA: Unified Multimodal Framework for Conversational Music Editing
AURA:面向对话式音乐编辑的统一多模态框架
AI 总结:AURA提出统一多模态框架,利用多模态大语言模型和概念令牌实现对话式音乐编辑,仅优化9100万参数,在Slakh2100和MoisesDB上显著提升编辑正确性与内容保留。
链接:https://arxiv.org/abs/2609.14344
机构:Aalto University(阿尔托大学); Technical University of Denmark(丹麦技术大学); University of South Dakota(南达科他大学); OpenRB Lab(OpenRB实验室)
作者:Quoc-Huy Trinh, Minh-Van Nguyen, Debesh Jha
24. Differentiable Digital Signal Processing Mixture Model-Guided Diffusion for Synthesis Parameter Estimation from Harmonic Sound Mixtures
可微数字信号处理混合模型引导的扩散方法用于谐波声音混合中的合成参数估计
AI 总结:针对DDSP混合模型估计合成参数时缺乏时间平滑性的问题,提出用DDPM引导反向扩散过程,以重建误差为条件,实现时间合理的参数轨迹估计,并在木管和弦乐合奏实验中验证了改进效果。
链接:https://arxiv.org/abs/2609.14427
机构:The University of Tokyo(东京大学); National Institute of Advanced Industrial Science and Technology (AIST)(产业技术综合研究所)
作者:Kengo Takemoto, Tomohiko Nakamura, Hiroshi Saruwatari
25. Exploiting Speech LLM Representations for Multilingual and Cross-Lingual Parkinson's Disease Detection
利用语音大语言模型表示进行多语言和跨语言帕金森病检测
AI 总结:本文研究语音大语言模型内部表示用于多语言和跨语言帕金森病检测,发现编码器表示优于解码器,并提出基于挤压-激励的动态层聚合框架以提升检测性能。
链接:https://arxiv.org/abs/2609.14431
机构:Kyoto University(京都大学)
作者:Sarthak Giri, Zi Haur Pang, Tatsuya Kawahara
26. POLARIS: Training-Free Audio Fingerprinting with Saliency-Based Landmarks and Delaunay Grouping
POLARIS:基于显著性地标与Delaunay分组的免训练音频指纹识别
AI 总结:POLARIS是一种免训练的音频指纹系统,利用显著性地标和Delaunay分组生成稀疏指纹,通过自适应两跳邻域扩展应对失真,在合成和真实重录基准上优于现有免训练方法及神经基线。
链接:https://arxiv.org/abs/2609.14820
机构:Vanderbilt University(范德堡大学)
作者:Jiheng Li
27. CAL-MOS: Bridging Layers with Adapters for Robust MOS Prediction Across Speech Foundation Models
CAL-MOS:通过适配器桥接层以实现跨语音基础模型的稳健MOS预测
AI 总结:本研究提出CAL-MOS方法,通过在各层池化前应用适配器进行层校准聚合,以提升跨语音基础模型的MOS预测稳健性,并缩小与完全微调的差距。
链接:https://arxiv.org/abs/2609.14956
机构:AKCIT; Federal University of Goiás (UFG)(戈亚斯联邦大学); Federal University of Rio Grande do Norte (UFRN)(北里奥格兰德联邦大学); Federal University of Technology (UTFPR)(联邦理工大学)
作者:Alef Iury Siqueira Ferreira, Pedro Lustosa Rege Botelho, Fernanda Silva, Daniel Casanova, Rafael Faustino, Frederico Oliveira, Arlindo Galvão Filho, Anderson da Silva Soares
28. Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation
重新思考程序化音频预训练:源规模与目标适配
AI 总结:本文重新思考程序化音频预训练,区分公式类覆盖度与类内渲染多样性两种规模,发现其益处依赖学习范式与任务,并揭示程序化音频偏好低掩码率,提出源感知预训练方法。
链接:https://arxiv.org/abs/2609.15067
机构:University of Science and Technology of China(中国科学技术大学); East China Normal University(华东师范大学); Shanghai Jiao Tong University(上海交通大学)
作者:Jiajun Peng, Fengrui Liu, Xinyu Liu, Feng Liu
29. Generating the Unheard: Phylogeny-Guided Latent Generation for Ancestral Sound Reconstruction
生成未曾听闻的声音:系统发育引导的潜在生成用于祖先声音重建
AI 总结:提出首个系统发育引导的潜在生成框架,通过VAE编码、性状投影和锚定逆提升,为鸟类祖先节点生成全新且合理的发声,并在两个支系上验证了生成质量与系统发育一致性。
链接:https://arxiv.org/abs/2609.15240
机构:University of Wisconsin–Madison(威斯康星大学麦迪逊分校); Massachusetts Institute of Technology(麻省理工学院)
作者:Tianyi Xu, Shrinaath Narasimhan, Evan Gorstein, Santiago Perea, Yunyi Shen, Claudia Solís-Lemus
30. Listening for Airway Stenosis: A Foundation Model-Based Method for Rapid and Accessible Detection
倾听气道狭窄:基于基础模型的快速可及检测方法
AI 总结:本研究利用声学基础模型分析语音记录,实现快速可及的气道狭窄检测,在748人队列中达到0.952的AUROC,证明其可补充现有诊断流程。
链接:https://arxiv.org/abs/2609.15453
机构:University Hospital Aachen(亚琛大学医院); Télécom Paris(巴黎电信学院)
作者:Jean Groeninger, Zihao Zhao, Juliana de Castilhos, Sven Nebelung, Daniel Truhn
