今日论文合集:CS.SD语音与音频 共 15 篇,本文展示前 8 篇
本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
快速导航
1. 语音合成与声音生成 1 篇
2. 说话人识别、验证与分离 1 篇
3. 音频事件检测与场景理解 1 篇
4. 语音翻译与语音语言模型 3 篇
5. 多模态音频与视听学习 1 篇
6. 其他/综合语音音频 1 篇
1. 语音合成与声音生成 | 1 篇
1. AutoSynth: Learning to Generate Editable Synthesizer Programs from Audio and Text
AutoSynth:从音频和文本生成可编辑合成器程序的学习方法
AI 总结:AutoSynth是一种从音频或文本生成可编辑合成器程序的模型,经两阶段训练后,在合成器逆问题和文本驱动生成任务中表现具竞争力,无需配对标注或可微分合成器。
链接:https://arxiv.org/abs/2610.10774
机构:The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)); New York University Shanghai(上海纽约大学); The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
作者:Tristan Wu, Daniel Chin, Liwei Lin, Junan Zhang, Gus Xia
2. 说话人识别、验证与分离 | 1 篇
2. Cross-Lingual Speaker Verification with Self-Supervised Pre-Trained Models
基于自监督预训练模型的跨语言说话人验证
AI 总结:针对跨语言说话人验证的语言不匹配性能下降问题,利用自监督预训练模型提取通用声学特征训练解耦说话人嵌入网络,在TidyVoice2026基准上取得2.21%和2.99%的等错误率。
链接:https://arxiv.org/abs/2610.11099
机构:Ant Group(蚂蚁集团)
作者:Jinghan Peng, Yu Zheng, Weiqiang Wang, Jian Liu
3. 音频事件检测与场景理解 | 1 篇
3. BEANS-Next and ROOTS: Broadening Audio-Language Capabilities for Bioacoustics
BEANS-Next与ROOTS:拓展生物声学的音频-语言能力
AI 总结:本研究推出生物声学音频-语言任务基准BEANS-Next与训练资源ROOTS,发现现有模型在该领域窄任务外表现有限,经ROOTS训练的模型在BEANS-Next所有任务组均有显著进展,相关资源已开源。
链接:https://arxiv.org/abs/2610.10663
机构:Earth Species Project(地球物种项目); Queen Mary University of London(伦敦大学玛丽皇后学院)
作者:Christos Plachouras, David Robinson, Marius Miron, Gagan Narula, Paul Laisné, Anthony L. T. Fine, Benno Weck, Ellen Gilsenan-McMahon, Diane Kim, Laura Hay Mack, Maddie Cusimano, Sara Keen, Lukas Rauch, Benjamin Hoffman, Emmanuel Chemla, Emmanouil Benetos, Johan Pauwels, Milad Alizadeh, Matthieu Geis
4. 语音翻译与语音语言模型 | 3 篇
4. Listen-to-Reason: Listen with Experts, Retrieve over a Graph, Reason with LLMs
Listen-to-Reason:借助专家聆听、基于图检索、用大语言模型推理
AI 总结:本文提出可解释的Listen-to-Reason流水线,用冻结专家编码器映射音频到语义节点、纯文本LLM推理,在SAKURA等数据集上表现优异,新领域适配成本低且可通过强阅读器缩小性能差距。
链接:https://arxiv.org/abs/2610.10749
机构:Concordia University(康考迪亚大学); Mila – Quebec AI Institute(米拉-魁北克人工智能研究所); Laval University(拉瓦尔大学)
作者:Pooneh Mousavi, Mirco Ravanelli, Cem Subakan
5. MiDashengLM-Spatial: Unifying General Audio Understanding and Spatial Awareness
MiDashengLM-Spatial:统一通用音频理解与空间感知
AI 总结:MiDashengLM-Spatial是首个开源端到端统一音频-语言模型,通过新增Spatial-Dasheng空间音频编码器,在不损害通用音频理解的前提下实现了优异的空间感知能力,在相关基准上表现突出。
链接:https://arxiv.org/abs/2610.11156
机构:Xiaomi Inc.(小米公司)
作者:Jinbo Hu, Hang Su, Lichun Fan, Heinrich Dinkel, Gang Li, Zhanchen Dai, Yiru Zhang, Chang Liu, Peng Wang, Junnan Wu, Jian Luan, Cong Zou, Heng Qu
6. Selective Listening: Mechanism-Guided Control of Audio Influence in Large Audio-Language Models
选择性聆听:大型音频-语言模型中音频影响的机制引导控制
AI 总结:该研究针对大型音频-语言模型中无关音频干扰导致的推理偏差问题,提出ICAP-Gate机制引导控制方法,在多任务、多干扰场景下降低了配对漂移,且延迟远低于自一致性,为鲁棒多模态推理提供了新设计原则。
链接:https://arxiv.org/abs/2610.11196
机构:College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院); State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室)
作者:Yulin Sun, Kele Xu, Yong Dou
5. 多模态音频与视听学习 | 1 篇
7. SAVU-BENCH: A Real-World Benchmark for Spatial Audio-Visual Understanding
SAVU-BENCH:用于空间视听理解的真实世界基准
AI 总结:本文推出真实世界空间视听理解基准SAVU-Bench及配套诊断集SAVU-Diag,评估发现音频相关空间感知是瓶颈,提出无需训练的基线SAVU-EA可提升空间接地与匹配能力,凸显跨模态空间关系整合的重要性。
链接:https://arxiv.org/abs/2610.10624
机构:University of Western Australia(西澳大利亚大学); University of Science and Technology Beijing(北京科技大学); Monash University(莫纳什大学)
作者:Yu Chen, Ruihang Liu, Yangguang Xu, Xinyue Jiang, Mohammed Bennamoun, Farid Boussaid, Xinyuan Qian, Qiuhong Ke
6. 其他/综合语音音频 | 1 篇
8. A computational framework for the acoustic characterization of Suikinkutsu (water harp cave)
水琴窟(水竖琴洞穴)声学特征的计算框架
AI 总结:本研究提出一种计算框架,通过FFT、MFCCs等音频特征分析水琴窟的声学轮廓,对日本关西9处水琴窟的录音分析显示其各有独特特征,为水琴窟的系统表征与数字保存提供了实用基础。
链接:https://arxiv.org/abs/2610.11219
机构:Ritsumeikan University(立命馆大学)
作者:Paul Haimes, Alarith Uhde, Daniel Moritz Marutschke
受公众号正文长度限制,本文展示前 8 篇,当天共更新 15 篇。完整列表请访问 arXivDaily。
