
2020年11月21日,第二届声纹识别研究与应用学术研讨会在线成功举办。本次会议由清华大学、新疆大学与中国计算机学会语音对话与听觉专业组联合举办,厦门大学协办,北京智源人工智能研究院提供平台与社区支持。清华大学电子工程系副研究员、新疆大学信息科学与工程学院副院长何亮老师,厦门大学副教授、天聪智能创始人洪青阳老师共同担任大会主席。
上午9:00,清华大学电子工程系主任汪玉教授参加开幕式并致辞:希望本届研讨会进一步促进面向经济主战场的产学合作,共同解决国家与社会共同关注问题,概要介绍电子系在该领域的工作与安排,并预祝大会圆满成功。
随后,中国计算机学会语音对话与听觉专业组副主任郑方老师致辞:感谢各位参会嘉宾对本次会议的支持,呼吁语音界团结合作,举办更多的高水平学术活动。
视频回放
本次会议分为四个环节,每个环节有三位嘉宾老师交流分享,每位嘉宾演讲后均有问答环节。

本次会议主席何亮老师分享的主题是《声纹识别技术发展前沿与研究团队工作进展》。报告回顾声纹识别及衍生技术的近期工作,介绍了联合识别、深度神经网络改进和对抗学习等,分享了研究团队在联合学习、对抗学习和潜在类别分析方向上的工作进展,展望超大规模说话人识别、自训练与预训练、图神经网络等方向的技术发展路线,探讨应用落地的难点问题。
视频回放

公安部物证鉴定中心语音及心理分析技术处副处长康锦涛老师讨论的内容是《面向诉讼的说话人鉴定技术》。虽然说话人自动识别技术的发展日新月益,但面向诉讼的说话人鉴定技术仍然以专家鉴定为根柢。两者面临的困难与挑战大致相似,但在理论基础、技术路线和结果表示等方面都是不同的。这些差别最根本的原因在于,声纹鉴定的鉴定意见将被法庭作为证据使用,是定罪量刑的依据。报告介绍了当前面向诉讼的说话人鉴定技术的基本情况,认为听感分析与特征价值量化将是重要的两个方向。
视频回放

清华大学语音语言中心副研究员王东老师讨论的题目是《Remarks on optimal scores in speaker recognition》。他认为说话人识别是假设检验任务,最佳评分方法与最低贝叶斯风险(MBR)密切相关。王东老师分享了团队工作成果:如果分布是线性高斯分布,则PLDA是MBR最优的,余弦距离可以视为PLDA的近似值。同时,王东老师还证明了,在某些约束条件下PLDA是最优判别方法,并讨论了一些有用的属性和扩展。

西北工业大学计算机学院教授、博导谢磊老师演讲的题目是《复杂场景下的多通道说话人分离与声纹对抗攻击研究进展》。报告介绍了西工大音频语音与语言处理研究组(ASLP@NPU)在复杂场景下的多通道说话人分离与声纹对抗攻击方面的研究进展:首先,提出了一种端到端神经网络建模的多通道说话人分离方法,而后在该方法的基础上扩展成一个同时去混、增强和说话人分离的建模方案,解决实际挑战场景下说话人语音质量的增强问题。最后,介绍了实验室近期在基于心理声学模型的声纹对抗攻击方法的研究进展。
视频回放
西北工业大学教授、博导张晓雷老师讨论的内容是《端到端声纹识别技术》。报告介绍了基于深度学习的声纹识别的核心问题之一:训练目标。围绕基于分类的代理损失函数与面向端到端训练的确认损失函数两类训练目标,通过对比两类损失函数的性能和复杂度,分析技术的发展趋势。

昆山杜克大学电子与计算机工程副教授、武汉大学计算机学院兼职教授、博导李明老师的分享主题是《基于深度学习的说话人日志技术》。复杂场景下,比如会议记录、访谈对话等,由于包含说话人数量不确定、多人语音混叠、噪声干扰、录音设备信道复杂等,使得说话人日志研究极具挑战性。李老师从模块化方法和端到端框架这两个方面来分享了近一年来在基于深度学习的说话人日志方向上的工作。
视频回放

中国科学技术大学语音及语言信息处理国家工程实验室副教授杜俊老师的演讲题目是《多人交互场景下的说话人分割和语音分离研究》。随着深度学习技术的不断发展以及语音技术应用的不断普及,说话人分割和语音分离的研究逐步从简单场景转向实际多人交互复杂场景,同时存在环境噪声、房间混响和多人自由对话的诸多挑战,报告结合CHiME-6评测、JSALT 2020研讨会以及DIHARD-III评测这几个重要事件,和大家共同探讨了说话人分割和语音分离目前的研究进展以及未来趋势。
视频回放

中国科学院声学研究所研究员、博导张鹏远老师介绍的主题是《面向会议场景的声纹识别技术》。针对会议场景的多说话人、远场和跨领域等导致声纹识别系统性能大幅下降问题,张老师介绍了近期在说话人聚类和跨领域声纹识别方面的研究进展。在说话人聚类方面,提出了一种基于密度峰值的说话人音频片段聚类方法。在跨领域声纹识别方面,提出一种孪生对抗网络,通过语音的成对输入和领域异同判决,得到了与领域无关的说话人鉴别性特征,显著提升了跨领域任务中的声纹识别性能。
视频回放
4、演讲嘉宾:洪青阳、张姗姗、李琳



厦门大学副教授李琳老师做了以《声纹和语种识别中多任务学习》为主题的研究报告。她认为由声音辨认说话人的身份或者所使用的语言种类,关键点是寻找本质的说话人特征或语种特征。说话人特征不仅受说话人本身声道结构影响,一定程度上也依赖于文本作为信息传达的载体,不论是与文本相关还是与文本无关的说话人识别任务中,引入文本信息(如音素)辅助训练说话人特征提取网络,可以改善识别性能。同样地,引入音素识别任务用于训练提取语种特征,也有助于提升语种识别性能。报告重点分析了在声纹/语种特征提取流程(包括帧级别和段级别)中音素信息所起到的作用效果。特别地,针对语种识别任务中,对比分析了不同语种音素识别模型的选择对多任务系统性能的影响。
视频回放

在这四个演讲环节结束后,赞助公司海天瑞声与希尔贝壳分别介绍了公司业务,何亮老师对本次会议进行了总结,洪青阳老师展望了下一届声纹识别研究与应用学术研讨会。嘉宾们讨论了下次会议的相关事宜并提出了宝贵的意见。
至此,本次会议圆满结束。
本次会议在线观看直播的人数高达几千人。在每个环节中,听众们都进行了非常激烈的讨论,同学们积极踊跃的进行提问,嘉宾们学识渊博,不厌其烦地解答相关技术问题,在线的听众们都受益匪环节环。
2020年声纹研讨会嘉宾PPT下载:
链接: https://pan.baidu.com/s/1sgcRbOF91MmEmQ-JYD2q5w
提取码: 3ju2

