技术解读|复杂人声干扰下,如何让 ASR “听对人”
转载a month ago
技术解读|复杂人声干扰下,如何让 ASR “听对人”

在安静环境里,语音识别的问题很直接:用户说什么,模型就转录什么。但在会议、车内或咖啡厅里,用户的声音经常会和旁人交谈一起进入麦克风。 假设用户说“打开导航”,旁边的人同时说“我们明天几点出发”。一种常见错误不是把“导航”识别成别的词,而是把…

121 0 0
内蒙古大学团队提出ABSE-NET:为开放式助听器语音增强提供轻量化方案
转载a month ago
内蒙古大学团队提出ABSE-NET:为开放式助听器语音增强提供轻量化方案

随着听力健康需求日益增长,助听器已成为改善听障人士生活质量的关键设备。传统封闭式助听器虽能有效隔绝外界噪声,但长期佩戴易产生“堵耳效应”,佩戴体验较差。 开放式助听器凭借佩戴舒适、聆听自然的优势备受关注。然而其泄压通风孔会带来声学泄漏问题:…

82 0 0
EMNLP 2026 | EmoTra-TTS:让语音的情绪“流动”起来
原创a month ago
EMNLP 2026 | EmoTra-TTS:让语音的情绪“流动”起来

心理学研究证明,人的情绪是一个随时间连续演化的动态过程:会上扬、会回落、可以在几秒内完成从一种情绪到另一种情绪的过渡。然而当下的情感语音合成(TTS)系统,大多只能给一整句话贴上一个离散标签或一个静态情绪向量,与情绪的时间本质错位。本文提出…

64 0 0