今日论文合集:CS.SD语音与音频 | 共 15 篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准

快速导航

1. 语音识别与关键词检测 1 篇

2. 语音合成与声音生成 1 篇

3. 语音增强、降噪与音频修复 1 篇

4. 音频事件检测与场景理解 1 篇

5. 音乐信息检索与音乐生成 2 篇

6. 语音翻译与语音语言模型 1 篇

7. 安全、隐私与深度伪造音频 2 篇

8. 其他/综合语音音频 6 篇

1. 语音识别与关键词检测 | 1 篇

1. SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces

SoniSpeech:面向可穿戴静默语音接口的大规模开放词汇三模态数据集

AI 总结:针对可穿戴静默语音接口词汇量受限的问题,提出首个基于声学传感眼镜的大规模开放词汇三模态数据集SoniSpeech,构建了该任务的首个基准并取得26.3%的词错误率。

链接:https://arxiv.org/abs/2608.00803

机构:Cornell University(康奈尔大学)

作者:Ruidong Zhang, Jiacheng Liu, François Guimbretière, Cheng Zhang

2. 语音合成与声音生成 | 1 篇

2. JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

JoyAI-Talker:面向共情语音智能体的全双工语音交互大模型

AI 总结:JoyAI-Talker采用Thinker-Talker架构等技术,实现兼具强推理能力与共情交互的全双工语音对话系统,在基准测试及用户打断、背景语音场景下表现优异。

链接:https://arxiv.org/abs/2608.01119

作者:Yinhao Bai, Jinming Chen, Yafeng Chen, Wei Deng, Boya Dong, Nan Duan, Yu Gu, Weisheng Han, Yankun Huang, Ming Ke, Hao Li, Jingdong Li, Xiangyu Liang, Ning Liu, Yuan Liu, Ji Miao, Jiaqi Wang, Qi Wang, Wenchao Wang, Yuxuan Wang, Zhenfang Wang, Zhangyu Xiao, Chao Xue, Hongfei Xue, Fan Yu, Tianyi Zhang, Yuan Zhang, Yuqi Zhang, Lin Zhu

3. 语音增强、降噪与音频修复 | 1 篇

3. DRONEAUDIONET: Noise Suppression for Drone Audition-based Search and Rescue

DRONEAUDIONET:基于无人机听觉的搜救任务中的噪声抑制

AI 总结:本研究针对无人机听觉场景中旋翼噪声主导混合信号的问题,提出DRONEAUDIONET噪声抑制方法,引入可学习掩码缩放机制与残差校正项,经实验验证可提升下游声音分类性能,凸显其在无人机辅助搜救中的应用潜力。

链接:https://arxiv.org/abs/2608.00875

机构:School of Computing, National University of Singapore(新加坡国立大学计算机学院)

作者:Chitralekha Gupta, Soundarya Ramesh, Yifei Luo, Suranga Nanayakkara

4. 音频事件检测与场景理解 | 1 篇

4. An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing

基于分布式光纤声波传感(DAS)的长须鲸歌声检测、音符特征表征与定位的端到端工作流程

AI 总结:该研究提出基于分布式光纤声波传感(DAS)的端到端工作流程,实现长须鲸歌声的检测、特征表征与定位,经实测精度与召回率表现良好,为长须鲸监测提供了集成框架。

链接:https://arxiv.org/abs/2608.02387

机构:Institut de Ciències del Mar (ICM-CSIC)(海洋科学研究所(ICM-CSIC)); Institut de Física Corpuscular (IFIC), Centre Mixte Universitat de València (UV-CSIC)(粒子物理研究所(IFIC),瓦伦西亚大学-西班牙高等科研理事会混合中心(UV-CSIC))

作者:Dídac Diego-Tortosa, Miriam Romagosa, Arantza Ugalde, Hugo Latorre, Sergi Ventosa, Jose Enrique García, Antonio Villaseñor

5. 音乐信息检索与音乐生成 | 2 篇

5. UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations

UOT-IR:将多声部符号音乐结构化路由为固定预算表示

AI 总结:本研究提出UOT-IR框架,将多声部符号音乐压缩转化为固定预算结构化路由问题,在两种设置下均表现优异,为符号音乐压缩建立了原则性范式。

链接:https://arxiv.org/abs/2608.00576

作者:Ziyue Kang, Nan Nan, Chenhao Lin, Xiaohong Guan

6. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

P-MUSE:用于统一器乐合成与编辑的提示-MIDI可选模型

AI 总结:P-MUSE是统一器乐合成与编辑的MIDI-to-Music框架,通过多阶段课程学习整合两种生成范式,提出相位感知引导策略与尾端丢弃法,并建立含四类乐器的综合基准。

链接:https://arxiv.org/abs/2608.01920

作者:Chong Jing, Junan Zhang, Jing Yang, Yulun Wu, Fan Fan, Zhizheng Wu

6. 语音翻译与语音语言模型 | 1 篇

7. Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试

AI 总结:本研究构建涵盖11种音频分类方法的分层基准,在2242个音频片段的闭集声源识别任务中评估性能,发现Gemini-3.1-Pro-Preview表现最优,还分析了Gemini模型的思维链特性并给出方法选择指导。

链接:https://arxiv.org/abs/2608.02397

机构:Perle(珀尔)

作者:Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad

7. 安全、隐私与深度伪造音频 | 2 篇

8. Hidden-Domain Routing for All-Type Audio Deepfake Detection

用于全类型音频深度伪造检测的隐藏域路由

AI 总结:针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。

链接:https://arxiv.org/abs/2608.00493

机构:OPPO AI Center(OPPO人工智能中心)

作者:Yifan Gao, Yao Tian, Hongbin Suo, Haonan Lu

9. Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

用于音频深度伪造检测的多主干自监督集成模型及生成-检测不对称性的跨赛道分析

AI 总结:该研究构建多主干自监督集成模型完成ImageCLEF 2026音频深度伪造检测任务并夺冠生成子任务,分析发现生成-检测不对称性,指出部署的主要挑战是11.25%的误报差距。

链接:https://arxiv.org/abs/2608.01796

机构:Soonchunhyang University(顺天乡大学)

作者:Seunghyun Kim, Junghyun Kim, Jiyoung Woo

8. 其他/综合语音音频 | 6 篇

10. Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation

超越提示词依从性:语音生成中属性级语音控制的审计

AI 总结:本文针对三种语音生成系统开展属性级语音控制审计,发现目标响应常伴随非目标变化,提出无训练候选选择器VoDER-Cal,提升了目标响应联合成功率并降低非目标偏差。

链接:https://arxiv.org/abs/2608.00545

作者:Xianhao Zhou, Jianghao Wu

11. AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling

AnyBand:基于频率感知上下文频谱补全的统一多带宽语音扩展

AI 总结:该研究提出统一多带宽语音扩展框架AnyBand,采用频率感知扩散Transformer等技术,可在连续输入带宽范围实现高质量语音带宽扩展,性能优于现有基准。

链接:https://arxiv.org/abs/2608.00572

作者:Junchuan Zhao, Minh Duc Vu, Bowen Zhang, Ye Wang

12. Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

分离与检测:通过潜在扩散实现统一鼓转录与音轨生成

AI 总结:本文提出分离与检测框架,以5音轨潜在扩散模型为前端,结合起始点分支等辅助训练,实现鼓转录与音轨生成,性能优于基线,兼具分离音轨能力。

链接:https://arxiv.org/abs/2608.01093

作者:Wei-Han Hsu, Chih-Cheng Chang, Bo-Yu Chen, Li Su, Yi-Hsuan Yang

13. Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

AI 总结:本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

链接:https://arxiv.org/abs/2608.01783

机构:Sejong University(世宗大学); Ewha Womans University(梨花女子大学)

作者:Baicheng Lin, Lingxi Jin, Kyung-Seok Min

14. Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior

面向动物行为分类的不确定性感知跨模态融合方法

AI 总结:针对动物声学监测录音受不受控条件影响导致的分类挑战,本文提出不确定性感知融合双流框架,在跨物种身份评估的两类数据集上均显著优于静态拼接融合。

链接:https://arxiv.org/abs/2608.02104

机构:Weihenstephan-Triesdorf University of Applied Sciences(魏恩施蒂芬-特里尔多夫应用科学大学)

作者:Ehsan Yaghoubi, Florian Haselbeck

15. Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art

声音画布:将算法嵌入网络化、具感官的声音艺术中

AI 总结:本研究将算法嵌入声音艺术装置,通过离线视觉-声音映射与在线模型实现触摸响应的多模态交互,引发算法艺术相关问题。

链接:https://arxiv.org/abs/2608.02219

作者:Luciano Ciamarone, Dora Motèque, Marco Giordano