2021年7月10日,由CCF语音对话与听觉专委会 、AIIA 中国人工智能产业发展联盟评估组 、北京希尔贝壳科技有限公司、语音之家(北京)科技有限公司共同主办的【语音之家】AI技术沙龙——说话人日志,成功举办!
【语音之家】AI技术沙龙第一期以说话人日志为主题,以线上形式举办,并邀请了中国科学技术大学电子工程与信息科学系副教授杜俊、昆山杜克大学电子与计算机工程副教授李明、AISHELL & SpeechHome 创始人兼CEO卜辉在会上进行了分享。
直播回放链接
https://www.bilibili.com/video/BV16h411h7mK?share_source=copy_web

简要回顾了说话人日志近二十年来在数据、场景以及算法层面的发展概况。同时就不同场景下,尤其是针对不匹配场景下现有相关算法的一些问题,介绍了基于Scenario-Dependent的相关解决策略。其次回顾了下实验室在DIHARD比赛中的一些系统框架与细节,着重介绍了Iterative Speaker Diarization系统框架的细节。
将Diarization算法归类为聚类和端到端,就聚类方法以及评测结果方法做了简要介绍,同时对端到端[End-to-end]主要讲述了EEND和TS-VAD两个系统框架。

由DIHARDIII赛事的结果可见在不同场景下取得的结果差异较大,尤其针对非正常的说话人特性如小孩的声音,交互多(overlap较多)以及恶劣的背景环境等效果很不理想。因此针对Scenario-Dependentde的方案是一个较好的思路,Scenario可以以说话人人数、语音重叠率以及环境为划分做不同的解决方案,其主要思想是Divide-and-conquer 策略,即先对domain进行分类,针对不同的domain采取不同的方案从而得到最优结果。

简要介绍了下neural speaker diarization的框架以及缺点,即不匹配场景下效果不理解,针对该缺点提出了 Iterative 策略。Iterative的主要思想是基于当前段的一些信息,做完一遍diarization之后,基于这个结果重新训练一个ts-vad模型,即类似在当前结果上做一个adaptation来提高性能。

主要针对团队内相关算法的一些简介,以及关于日志方向的难点和挑战的探讨。针对模块化的方法在diarization上的应用做了系统话的介绍,包括模块、说话人embedding提取以及后处理都做了非常详细的说明,并说明了不同算法和不同的评测方法在DIHARDII上的结果。并在DIHARDIII结果的基础上,对TS-VAD结构做了详细讲解,以及阐述了TS-VAD的系统在diarization上的不同运用方案。

另外探讨了一个方向是自监督声纹提取相关,并从两个方法层面对该方向做了详细介绍,包括Generative和Discriminative。两个方向的一般处理方法,包括数据处理、Representation提取以及loss函数三个层面做了介绍。最后针对Iterative Training with Pseudo-Labels的主要思想与方法做了详细说明。

介绍了当下人工智能数据开源环境以及目前语音数据的开源状况,卜辉表示AISHELL会持续投入做开源项目,同时也希望更多的学者和业界从业者可以加入到AISHELL的开源项目中,相信中文的10000小时开源数据库也将离我们不远。

另外回顾了AISHELL-1、AISHELL-2、AISHELL-WakeUp-1、AISHELL-DMASH、AISHELL-3等开源项目,对会议场景多通道中文会议开源语音数据库AISHELL-4的发布进行了详细的介绍。其中西北工业大学音频语音与语言处理研究组的付艺辉和程路遥对于AISHELL-4数据库在会议场景里实现ASR、Speaker Diarization等相关技术的Baseline进行了系统讲解。

最后,卜辉对未来语音数据开源的进行了展望,也表示AISHELL会持续投入做开源,为实现人工智能民主化希尔贝壳还需要更努力。
本次沙龙的成功举办离不开大家的支持和关注,同时【语音之家】AI技术沙龙,第二期 · 声纹识别,将于2021年7月17日 9:30开启,期待大家参与!

下面奉上嘉宾的PPT:
在语音之家公众号后台的对话框中回复“说话人日志”,即可获取三位嘉宾的演讲PPT。
