微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
快速导航
1. 语音识别与关键词检测 1 篇
2. 语音合成与声音生成 1 篇
3. 语音增强、降噪与音频修复 1 篇
4. 音频事件检测与场景理解 1 篇
5. 音乐信息检索与音乐生成 2 篇
6. 语音翻译与语音语言模型 1 篇
7. 安全、隐私与深度伪造音频 2 篇
8. 其他/综合语音音频 6 篇
1. 语音识别与关键词检测 | 1 篇
1. SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces
SoniSpeech:面向可穿戴静默语音接口的大规模开放词汇三模态数据集
AI 总结:针对可穿戴静默语音接口词汇量受限的问题,提出首个基于声学传感眼镜的大规模开放词汇三模态数据集SoniSpeech,构建了该任务的首个基准并取得26.3%的词错误率。
链接:https://arxiv.org/abs/2608.00803
2. 语音合成与声音生成 | 1 篇
2. JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents
JoyAI-Talker:面向共情语音智能体的全双工语音交互大模型
AI 总结:JoyAI-Talker采用Thinker-Talker架构等技术,实现兼具强推理能力与共情交互的全双工语音对话系统,在基准测试及用户打断、背景语音场景下表现优异。
链接:https://arxiv.org/abs/2608.01119
3. 语音增强、降噪与音频修复 | 1 篇
3. DRONEAUDIONET: Noise Suppression for Drone Audition-based Search and Rescue
DRONEAUDIONET:基于无人机听觉的搜救任务中的噪声抑制
AI 总结:本研究针对无人机听觉场景中旋翼噪声主导混合信号的问题,提出DRONEAUDIONET噪声抑制方法,引入可学习掩码缩放机制与残差校正项,经实验验证可提升下游声音分类性能,凸显其在无人机辅助搜救中的应用潜力。
链接:https://arxiv.org/abs/2608.00875
4. 音频事件检测与场景理解 | 1 篇
4. An End-to-End Workflow for Fin Whale Song Detection, Note Characterization, and Localization with Distributed Acoustic Sensing
基于分布式光纤声波传感(DAS)的长须鲸歌声检测、音符特征表征与定位的端到端工作流程
AI 总结:该研究提出基于分布式光纤声波传感(DAS)的端到端工作流程,实现长须鲸歌声的检测、特征表征与定位,经实测精度与召回率表现良好,为长须鲸监测提供了集成框架。
链接:https://arxiv.org/abs/2608.02387
5. 音乐信息检索与音乐生成 | 2 篇
5. UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations
UOT-IR:将多声部符号音乐结构化路由为固定预算表示
AI 总结:本研究提出UOT-IR框架,将多声部符号音乐压缩转化为固定预算结构化路由问题,在两种设置下均表现优异,为符号音乐压缩建立了原则性范式。
链接:https://arxiv.org/abs/2608.00576
6. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing
P-MUSE:用于统一器乐合成与编辑的提示-MIDI可选模型
AI 总结:P-MUSE是统一器乐合成与编辑的MIDI-to-Music框架,通过多阶段课程学习整合两种生成范式,提出相位感知引导策略与尾端丢弃法,并建立含四类乐器的综合基准。
链接:https://arxiv.org/abs/2608.01920
6. 语音翻译与语音语言模型 | 1 篇
7. Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification
基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试
AI 总结:本研究构建涵盖11种音频分类方法的分层基准,在2242个音频片段的闭集声源识别任务中评估性能,发现Gemini-3.1-Pro-Preview表现最优,还分析了Gemini模型的思维链特性并给出方法选择指导。
链接:https://arxiv.org/abs/2608.02397
7. 安全、隐私与深度伪造音频 | 2 篇
8. Hidden-Domain Routing for All-Type Audio Deepfake Detection
用于全类型音频深度伪造检测的隐藏域路由
AI 总结:针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。
链接:https://arxiv.org/abs/2608.00493
9. Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry
用于音频深度伪造检测的多主干自监督集成模型及生成-检测不对称性的跨赛道分析
AI 总结:该研究构建多主干自监督集成模型完成ImageCLEF 2026音频深度伪造检测任务并夺冠生成子任务,分析发现生成-检测不对称性,指出部署的主要挑战是11.25%的误报差距。
链接:https://arxiv.org/abs/2608.01796
8. 其他/综合语音音频 | 6 篇
10. Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation
超越提示词依从性:语音生成中属性级语音控制的审计
AI 总结:本文针对三种语音生成系统开展属性级语音控制审计,发现目标响应常伴随非目标变化,提出无训练候选选择器VoDER-Cal,提升了目标响应联合成功率并降低非目标偏差。
链接:https://arxiv.org/abs/2608.00545
11. AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling
AnyBand:基于频率感知上下文频谱补全的统一多带宽语音扩展
AI 总结:该研究提出统一多带宽语音扩展框架AnyBand,采用频率感知扩散Transformer等技术,可在连续输入带宽范围实现高质量语音带宽扩展,性能优于现有基准。
链接:https://arxiv.org/abs/2608.00572
12. Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion
分离与检测:通过潜在扩散实现统一鼓转录与音轨生成
AI 总结:本文提出分离与检测框架,以5音轨潜在扩散模型为前端,结合起始点分支等辅助训练,实现鼓转录与音轨生成,性能优于基线,兼具分离音轨能力。
链接:https://arxiv.org/abs/2608.01093
13. Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias
GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差
AI 总结:本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。
链接:https://arxiv.org/abs/2608.01783
14. Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior
面向动物行为分类的不确定性感知跨模态融合方法
AI 总结:针对动物声学监测录音受不受控条件影响导致的分类挑战,本文提出不确定性感知融合双流框架,在跨物种身份评估的两类数据集上均显著优于静态拼接融合。
链接:https://arxiv.org/abs/2608.02104
15. Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art
声音画布:将算法嵌入网络化、具感官的声音艺术中
AI 总结:本研究将算法嵌入声音艺术装置,通过离线视觉-声音映射与在线模型实现触摸响应的多模态交互,引发算法艺术相关问题。
链接:https://arxiv.org/abs/2608.02219
