微信公众号:arXiv_Daily
cs.SD语音
【1】Spatial Audio Rendering for Real-Time Speech Translation in Virtual Meetings
标题:虚拟会议中实时语音翻译的空间音频渲染
作者:Margarita Geleta, Hong Sodoma, Hannes Gamper
备注:17 pages, 5 figures
链接:https://arxiv.org/pdf/2511.09525
【2】End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering
标题:长形式口语问答的端到端对比语音预训练模型
作者:Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang
备注:12 pages, 7 figures, accepted by AAAI 2026
链接:https://arxiv.org/pdf/2511.09282
【3】POTSA: A Cross-Lingual Speech Alignment Framework for Low Resource Speech-to-Text Translation
标题:POTSA:用于低资源语音到文本翻译的跨语言语音对齐框架
作者:Xuanchen Li, Chenrui Cui, Tianrui Wang, Meng Ge, Zikang Huang, Jin Li, Yizhou Peng, Longbiao Wang, Jianwu Dang, Nyima Tashi
备注:5 pages, 3 figures, submitted to ICASSP 2026
链接:https://arxiv.org/pdf/2511.09232
【4】Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation
标题:迪夫-V2 M:一个具有显式节奏建模的分层条件扩散模型,用于视频到音乐生成
作者:Shulei Ji, Zihao Wang, Jiaxing Yu, Xiangyuan Yang, Shuyu Li, Songruoyao Wu, Kejun Zhang
备注:AAAI 2026
链接:https://arxiv.org/pdf/2511.09090
【5】Sound impact of simple viscoelastic damping changes due to aging and the role of the double bentside on soundboard tension in a 1755 Dulcken harpsichord
标题:由于老化而导致的简单粘弹衰减变化的声音影响以及1755年杜尔肯羽管键琴中双波纹边对音板张力的作用
作者:Rolf Bader, Niko Plath, Patrick Kontopidis
链接:https://arxiv.org/pdf/2511.09037
【6】Non-verbal Perception of Room Acoustics using Multi Dimensional Scaling Metho
标题:使用多维缩放方法对房间声学的非言语感知
作者:Leonie Böhlke, Tim Ziemer, Rolf Bader
链接:https://arxiv.org/pdf/2511.09029
【7】Chord-conditioned Melody and Bass Generation
标题:和弦条件旋律与低音生成
作者:Alexandra C Salem, Mohammad Shokri, Johanna Devaney
备注:To appear at NeurIPS 2025 Workshop on AI for Music (AI4Music)
链接:https://arxiv.org/pdf/2511.08755
【8】Robust Multi-modal Task-oriented Communications with Redundancy-aware Representations
标题:具有冗余感知表示的鲁棒多模态面向任务通信
作者:Jingwen Fu, Ming Xiao, Zhonghao Lyu, Mikael Skoglund, Celimuge Wu
链接:https://arxiv.org/pdf/2511.08642
【1】Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
标题:使用基于块的注意力屏蔽为Conformer和基于LLM的ASB开发有效且高效的非自回归解码器
作者:Tianzi Wang, Xurong Xie, Zengrui Jin, Mengzhe Geng, Jiajun Deng, Zhaoqing Li, Shoukang Hu, Shujie Hu, Guinan Li, Mingyu Cui, Helen Meng, Xunying Liu
备注:Accepted by regular paper in the IEEE Transactions on Audio, Speech and Language Processing (TASLP)
链接:https://arxiv.org/pdf/2511.09084
【2】ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
标题:ParaS 2S:为副语言感知的语音交互进行基准测试和调整口语模型
作者:Shu-wen Yang, Ming Tu, Andy T. Liu, Xinghua Qu, Hung-yi Lee, Lu Lu, Yuxuan Wang, Yonghui Wu
链接:https://arxiv.org/pdf/2511.08723
【3】Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation
标题:迪夫-V2 M:一个具有显式节奏建模的分层条件扩散模型,用于视频到音乐生成
作者:Shulei Ji, Zihao Wang, Jiaxing Yu, Xiangyuan Yang, Shuyu Li, Songruoyao Wu, Kejun Zhang
备注:AAAI 2026
链接:https://arxiv.org/pdf/2511.09090
机器翻译由腾讯交互翻译提供,仅供参考
