今日论文合集:cs.SD语音8篇,eess.AS音频处理3篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】Spatial Audio Rendering for Real-Time Speech Translation in Virtual Meetings

标题:虚拟会议中实时语音翻译的空间音频渲染

作者:Margarita Geleta, Hong Sodoma, Hannes Gamper

备注:17 pages, 5 figures

链接:https://arxiv.org/pdf/2511.09525


【2】End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

标题:长形式口语问答的端到端对比语音预训练模型

作者:Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

备注:12 pages, 7 figures, accepted by AAAI 2026

链接:https://arxiv.org/pdf/2511.09282


【3】POTSA: A Cross-Lingual Speech Alignment Framework for Low Resource Speech-to-Text Translation

标题:POTSA:用于低资源语音到文本翻译的跨语言语音对齐框架

作者:Xuanchen Li, Chenrui Cui, Tianrui Wang, Meng Ge, Zikang Huang, Jin Li, Yizhou Peng, Longbiao Wang, Jianwu Dang, Nyima Tashi

备注:5 pages, 3 figures, submitted to ICASSP 2026

链接:https://arxiv.org/pdf/2511.09232


【4】Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation

标题:迪夫-V2 M:一个具有显式节奏建模的分层条件扩散模型,用于视频到音乐生成

作者:Shulei Ji, Zihao Wang, Jiaxing Yu, Xiangyuan Yang, Shuyu Li, Songruoyao Wu, Kejun Zhang

备注:AAAI 2026

链接:https://arxiv.org/pdf/2511.09090


【5】Sound impact of simple viscoelastic damping changes due to aging and the role of the double bentside on soundboard tension in a 1755 Dulcken harpsichord

标题:由于老化而导致的简单粘弹衰减变化的声音影响以及1755年杜尔肯羽管键琴中双波纹边对音板张力的作用

作者:Rolf Bader, Niko Plath, Patrick Kontopidis

链接:https://arxiv.org/pdf/2511.09037


【6】Non-verbal Perception of Room Acoustics using Multi Dimensional Scaling Metho

标题:使用多维缩放方法对房间声学的非言语感知

作者:Leonie Böhlke, Tim Ziemer, Rolf Bader

链接:https://arxiv.org/pdf/2511.09029


【7】Chord-conditioned Melody and Bass Generation

标题:和弦条件旋律与低音生成

作者:Alexandra C Salem, Mohammad Shokri, Johanna Devaney

备注:To appear at NeurIPS 2025 Workshop on AI for Music (AI4Music)

链接:https://arxiv.org/pdf/2511.08755


【8】Robust Multi-modal Task-oriented Communications with Redundancy-aware Representations

标题:具有冗余感知表示的鲁棒多模态面向任务通信

作者:Jingwen Fu, Ming Xiao, Zhonghao Lyu, Mikael Skoglund, Celimuge Wu

链接:https://arxiv.org/pdf/2511.08642


eess.AS音频处理


【1】Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask

标题:使用基于块的注意力屏蔽为Conformer和基于LLM的ASB开发有效且高效的非自回归解码器

作者:Tianzi Wang, Xurong Xie, Zengrui Jin, Mengzhe Geng, Jiajun Deng, Zhaoqing Li, Shoukang Hu, Shujie Hu, Guinan Li, Mingyu Cui, Helen Meng, Xunying Liu

备注:Accepted by regular paper in the IEEE Transactions on Audio, Speech and Language Processing (TASLP)

链接:https://arxiv.org/pdf/2511.09084


【2】ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

标题:ParaS 2S:为副语言感知的语音交互进行基准测试和调整口语模型

作者:Shu-wen Yang, Ming Tu, Andy T. Liu, Xinghua Qu, Hung-yi Lee, Lu Lu, Yuxuan Wang, Yonghui Wu

链接:https://arxiv.org/pdf/2511.08723


【3】Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation

标题:迪夫-V2 M:一个具有显式节奏建模的分层条件扩散模型,用于视频到音乐生成

作者:Shulei Ji, Zihao Wang, Jiaxing Yu, Xiangyuan Yang, Shuyu Li, Songruoyao Wu, Kejun Zhang

备注:AAAI 2026

链接:https://arxiv.org/pdf/2511.09090


机器翻译由腾讯交互翻译提供,仅供参考