今日论文合集:CS.SD语音与音频 共 14 篇,本文展示前 8 篇

本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily

[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准


快速导航

1. 语音识别与关键词检测 2 篇

2. 语音合成与声音生成 1 篇

3. 音乐信息检索与音乐生成 1 篇

4. 数据集、基准与评测 2 篇

5. 其他/综合语音音频 2 篇


1. 语音识别与关键词检测 | 2 篇

1. JoyAI-Voice 2.0: A Full-Continuous Autoregressive Speech Generation Model with Semantic-Acoustic Joint Representation

JoyAI-Voice 2.0:具有语义-声学联合表示的全连续自回归语音生成模型

AI 总结:JoyAI-Voice 2.0是一种全连续自回归语音生成模型,采用语义-声学双编码器联合表示,通过流匹配和强化学习优化,在词错误率和感知保真度上达到最先进水平。

链接:https://arxiv.org/abs/2610.08834

作者:Yafeng Chen, Boya Dong, Yankun Huang, Hao Li, Jingdong Li, Xiangyu Liang, Hao Ni, Wenchao Wang, Yuxuan Wang, Zhangyu Xiao, Wei Deng, Nan Duan, Yu Gu, Wenhao Guan (Intern), Weisheng Han, Yabin Li, Yuan Liu, Jiaxin Ye (Intern), Fan Yu, Lin Zhu


2. Backdooring Acoustic Foundation Models for Physically Realizable Triggers

声学基础模型的后门攻击:物理可实现触发器

AI 总结:本研究提出FAB攻击,证明声学基础模型在最小假设下易受物理可实现后门影响,该后门保持良性性能、经受微调,并在多种下游任务中造成显著性能下降,凸显了安全风险。

链接:https://arxiv.org/abs/2610.09819

机构:Tel Aviv University(特拉维夫大学)

作者:Zebin Yun, Eyal Ronen, Mahmood Sharif


2. 语音合成与声音生成 | 1 篇

3. BanglaBox: A Phonetically-Balanced Corpus and Data-Efficient Foundation-Model Adaptation for Bangla Text-to-Speech with Zero-Shot Voice Cloning

BanglaBox:面向孟加拉语文本到语音的语音平衡语料库与数据高效基础模型适配,支持零样本声音克隆

AI 总结:本文提出BanglaBox,一个语音和性别平衡的孟加拉语语料库及三项微调改进,实现英语预训练TTS模型对孟加拉语的高效适配,在零样本声音克隆中达到接近自然的自然度并优于基线,且微调音频减少约7倍。

链接:https://arxiv.org/abs/2610.09211

作者:Emtiaz Uddin Ahmed, Araf Mahmud, Sajib Hossain, Tarikul Islam Tamiti, Sajid Fardin Dipto, Anomadarshi Barua


3. 音乐信息检索与音乐生成 | 1 篇

4. Tracing Inputs, Verifying Outputs: Validating Attribution in Music Generation

追踪输入,验证输出:音乐生成中的归因验证

AI 总结:本文提出通过输入追踪与输出验证相结合的方法,为AI音乐生成提供可验证的归因证据,并利用MixAudio和musicDNA模型验证了该方法在归因与记忆化检测上的有效性。

链接:https://arxiv.org/abs/2610.09637

机构:Neutune; KAIST(韩国科学技术院)

作者:Taejun Kim, Wonil Kim, Jongmin Jung, Hyeongseok Wi, Sangeun Kum, Keunhyoung Luke Kim, Taehyoung Kim, Dongjoo Moon, Seungsoon Park, Taewan Kim, Virginie Berger, Juhan Nam, Jongpil Lee


4. 数据集、基准与评测 | 2 篇

5. Towards AI-Generated Music Plagiarism Detection as a Version Identification Problem

面向AI生成音乐抄袭检测:作为版本识别问题

AI 总结:本研究将AI音乐抄袭检测视为版本识别问题,提出COPYCAT基准并验证坐标级嵌入偏移监督框架,将F0.5从0.612提升至0.803。

链接:https://arxiv.org/abs/2610.09075

机构:National Technical University of Athens(雅典国立技术大学); Athens University of Economics and Business(雅典经济与商业大学); Orfium; Archimedes/Athena R.C.(Archimedes/Athena 研究中心)

作者:Fotis Koutsikos, Ioannis Prokopiou, Spyridon Kantarelis, Vassilis Lyberatos, Pantelis Vikatos, Athanasios Aidinis, Themos Stafylakis, Athanasios Voulodimos, Giorgos Stamou


6. A multi-scenario EEG dataset for auditory attention decoding in naturalistic multi-talker environments

多场景脑电图数据集:用于自然多说话人环境中的听觉注意解码

AI 总结:该研究提出SoundBubble-EEG多场景脑电数据集,包含128通道、30人、超25小时记录,用于在自然多说话人环境中解码听觉注意,支持神经助听技术发展。

链接:https://arxiv.org/abs/2610.09539

机构:The Hong Kong Polytechnic University(香港理工大学)

作者:Shu Peng, Rui Liu, Yufei Zhang, Wenlong You, Zhige Chen, Jiachen Xi, Qiyuan Sun, Yan Liu, Kay Chen Tan, Jibin Wu


5. 其他/综合语音音频 | 2 篇

7. SwinDS-BWE: A Parameter-Efficient Swin-1D Lattice Generator with Decision-Science Discriminators for Speech Bandwidth Extension

SwinDS-BWE:一种参数高效的Swin-1D晶格生成器,结合决策科学判别器用于语音带宽扩展

AI 总结:提出SwinDS-BWE,结合Swin-1D晶格生成器与三种决策科学判别器,将生成器参数降至17M、判别器降至1.36M,并在英法数据集上提升带宽扩展保真度。

链接:https://arxiv.org/abs/2610.09189

机构:George Mason University(乔治梅森大学)

作者:Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Baja-Ricketts, David Vergano, Anomadarshi Barua


8. Lyapunov-Inspired LyRIC Activation and GLARE Attention in Chaos-Guided State Space Modeling for EMG-To-Speech (ETS) Synthesis

Lyapunov启发的LyRIC激活与GLARE注意力在混沌引导的状态空间建模用于肌电到语音(ETS)合成

AI 总结:首次将混沌物理引入ETS合成,提出LyRIC激活与GLARE注意力,以更少参数大幅提升可懂度与频谱重建质量。

链接:https://arxiv.org/abs/2610.09225

机构:George Mason University(乔治梅森大学)

作者:Sajid Fardin Dipto, Tarikul Islam Tamiti, Luke Baja-Ricketts, David Vergano, Anomadarshi Barua

受公众号正文长度限制,本文展示前 8 篇,当天共更新 14 篇。完整列表请访问 arXivDaily。