今日论文合集:CS.SD语音与音频 | 共 13 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. Motion-Omni: End…
声浪
在安静环境里,语音识别的问题很直接:用户说什么,模型就转录什么。但在会议、车内或咖啡厅里,用户的声音经常会和旁人交谈一起进入麦克风。 假设用户说“打开导航”,旁边的人同时说“我们明天几点出发”。一种常见错误不是把“导航”识别成别的词,而是把…
感谢各位作者对 NCMMSC 2026 的关注与支持,也感谢程序委员会、Meta Reviewer 和 Reviewer 为论文评审工作付出的时间与努力。第二十一届全国人机语音通讯学术会议(NCMMSC 2026)论文录用结果于2026年9…
EMNLP(Conference on Empirical Methods in Natural Language Processing)是自然语言处理领域顶级国际会议之一,其涉及领域包括但不限于机器翻译、文本生成、文本分类、信息抽取、问答…
随着听力健康需求日益增长,助听器已成为改善听障人士生活质量的关键设备。传统封闭式助听器虽能有效隔绝外界噪声,但长期佩戴易产生“堵耳效应”,佩戴体验较差。 开放式助听器凭借佩戴舒适、聆听自然的优势备受关注。然而其泄压通风孔会带来声学泄漏问题:…
今日论文合集:CS.SD语音与音频 | 共 12 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. Compressing Stre…
论文题目:SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision 会议名称:EMNL…
今日论文合集:CS.SD语音与音频 | 共 6 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. Removing Speech,…
心理学研究证明,人的情绪是一个随时间连续演化的动态过程:会上扬、会回落、可以在几秒内完成从一种情绪到另一种情绪的过渡。然而当下的情感语音合成(TTS)系统,大多只能给一整句话贴上一个离散标签或一个静态情绪向量,与情绪的时间本质错位。本文提出…
今日论文合集:CS.SD语音与音频 | 共 12 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. Soft Posterior S…
