INTERSPEECH 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。本次论文预讲会按照技术领域投稿和实验室专场两种形式进行招募,欢迎大家投稿报名。

INTERSPEECH 2024 论文预讲会第五期邀请到南开大学人类语言技术实验室做本次会议的专场分享,欢迎大家观看。


实验室概况

南开大学人类语言技术实验室依托于南开大学、数据与智能系统安全教育部重点实验室DISSec和天津市媒体计算工程中心TMCC。在南开大学杰出人才引进项目的有力支持下,建立了一支以秦勇教授为核心,定位于高水平创新型研究的团队。该团队目前有教授2人、高级研究员1人、硕博士生15人。团队聚焦于智能交互技术、智能音频分析技术、自动语音质量评测技术、语音及相关多模态基础模型评测技术等。团队目前承担科技部科技创新2030新一代人工智能重大项目;国基金面上项目;南开-联想、南开-零犀、南开-马上消费校企合作项目;南开大学交叉研究中心项目等。


第五期

南开大学人类语言技术实验室【专场】

时间:7月27日(周六)19:00 ~ 20:00

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:王卉,南开大学计算机学院人类语言技术实验室,二年级博士生,导师为秦勇教授。主要研究方向语音质量评估。

报告题目 :Uncertainty-Aware Mean Opinion Score Prediction

摘要:平均意见得分(Mean Opinion Score, MOS)预测已取得显著进展。然而,MOS 预测模型在不同样本中的表现不稳定,仍然是这些系统在实际应用中面临的挑战。在本文中,我们指出,缺乏不确定性建模是阻碍 MOS 预测系统在现实和开放世界中应用的一个重要限制。我们分析了 MOS 预测任务中不确定性的来源,并提出建立一个不确定性感知的 MOS 预测系统,通过异方差回归和蒙特卡罗 dropout 分别建模偶然性不确定性和认知不确定性。实验结果表明,该系统能够很好地捕捉不确定性,并具备选择性预测和域外检测的能力。这些能力显著增强了 MOS 系统在多样化的现实和开放世界环境中的实际应用价值。


嘉宾简介:王诗瑶,南开大学计算机学院人类语言技术实验室,一年级硕士生,导师为秦勇教授。主要研究方向构音障碍语音识别。
报告题目:Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation

摘要:由于说话人之间固有的可变性,构音障碍语音识别(DSR)面临着巨大的挑战,当将DSR模型应用于新的构音障碍说话人时,会有严重的性能下降。传统的说话人适应方法通常涉及对每个说话人的模型进行微调,但这种策略成本高昂,需要大量的数据收集,对构音障碍说话人来说不方便。为了解决这个问题,我们引入了一种基于原型的方法,该方法在没有额外微调的情况下显著提高了未见过的构音障碍说话人的DSR性能。我们的方法使用微调后的HuBERT作为特征提取器来产生每个单词的原型,这些原型封装了未见过说话人的发音特征,是分类的基础。此外,我们结合了监督对比学习来改进特征提取。通过提高表示质量,我们进一步提高了DSR的性能,实现了有效的个性化DSR。


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇

讨论群

扫码添加语音小管家,进入语音之家讨论群


预讲论文征集
INTERSPEECH 2024 论文预讲会按照技术领域投稿和实验室专场两种形式进行招募。


为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信