为促进最新研究成果的传播与交流,CCF语音对话与听觉专委在专委会微信公众号启动论文导读栏目,定期分享最新语音、对话与听觉相关研究方向论文。本期分享一篇发表在INTERSPEECH2024上的关于构音障碍语音数据库的文章。

CDSD: Chinese Dysarthria Speech Database


论文作者:王俨,孙梦依,康新晨,李婧婷,郭鹏飞,高铭,王甦菁
论文单位:中国科学院心理学研究所行为科学重点实验室;中国科学院大学心理学系;北京联合大学;江苏科技大学;中国科学技术大学
作者邮箱:avaswani@google.com; sunmy@psych.ac.cn; kxc4088@163.com; lit@psych.ac.cn; justyjsy@just.edu.cn; vivigreeeen@mail.ustc.edu.cn; wangsujing@psych.ac.cn
论文链接:https://www.isca-archive.org/interspeech_2024/wan24b_interspeech.pdf
本数据库申请链接:http://melab.psych.ac.cn/CDSD.html
本数据库申请二维码:


论文亮点:
我们发布了中文构音障碍数据库(CDSD),是目前公开最大的中文构音障碍语音数据库,包含来自44位构音障碍志愿者的133小时构音障碍数据。基于 CDSD 数据库,我们进行了多项基线实验和构音障碍语音识别研究。结果显示,通过广泛的模型预训练并微调特定个体数据,在说话人相关的语音识别中取得了优异表现。然而,我们也观察到不同发音障碍个体的识别结果存在显著差异。通过将不同规模数据的训练结果进行对比分析,我们确定了个性化语音识别的最佳数据规模,为未来的研究提供了有价值的参考。


引 言

尽管自动语音识别 (ASR) 技术得到了广泛应用,但由于构音障碍语音数据的局限性,准确识别此类语音仍然是一个艰巨的任务。为解决目前中文构音障碍语音数据规模较少的问题,我们构建了中文构音障碍语音数据库(Chinese Dysarthria Speech Database,CDSD),是目前最大规模的中文构音障碍数据库,本数据库包括44名构音障碍患者的构音语音数据,分为A和B两个部分。A部分包括了44名参与者每人提供的1小时构音障碍录音,共44小时;B部分包括了8名参与者额外提供的10小时录音,共80小时;本数据库总共包括124小时的构音障碍语音数据。另外,由于参与者的录音形式不同,本数据库还包括9位参与者的9小时录音视频数据。经过本数据库的基线测试,得到最佳字符错误率(Character Error Rate, CER)为16.4%。与我们进行的人工识别实验的20.45% CER相比,表明构音障碍语音识别(Dysarthric Speech Recognition, DSR)是解决构音障碍交流问题的有效途径。
CDSD数据库将公开发布于:http://melab.psych.ac.cn/CDSD.html


研究背景

由于构音障碍患者在言语表达上存在困难,收集其语音数据十分具有挑战性。此外,对构音障碍患者语音数据进行标注也特别困难,进一步增加了构建此类数据库的难度。因此,与普通语音数据库相比,构音障碍语音数据库相对稀缺。
现有的构音障碍语音数据库,如Whitaker [1]、UA-Speech [2]、Torgo [3]、EasyCall [4]和Euphonia [5]语料库,主要是英语构音障碍语音数据库。由于汉语与英语的差异大,英语构音障碍语音数据库难以满足中文DSR任务的需求。推动中文DSR的发展迫切需要一个规模较大的中文构音障碍语音数据集训练。
目前已有的中文构音障碍语音数据库包括粤语构音障碍语料库和普通话亚急性脑卒中构音障碍多模态数据库。然而,这些现有的中文构音障碍语音数据库规模均不超过10小时,相对较小。
为填补这些资源上的空白,我们构建了中文构音障碍语音数据库CDSD,是为数不多的中文构音障碍语音数据库之一,在规模上也是现有中文构音构音语音数据库中最大的。该数据库的总时长达133小时,为中文环境下复杂语音的研究提供了更广泛的样本。


CDSD数据库描述

CDSD数据库收集了44名说话者的语音数据,总计124小时的音频和9小时的视频数据。根据每位受试者的录音时长,将数据库分为两个部分:
  • A部分:包含44名说话者的音频数据,共44小时,每人录制1小时。此外,还包括9名说话者的音视频同步录制。

  • B部分:由A部分中的8名说话者组成,录制了80小时的音频数据,每人录制10小时。

表1:CDSD数据库规模



数据库构建

一、录音志愿者

在数据收集的准备阶段,每位录音志愿者在录音前签署了知情同意书。共招募了44名录音志愿者,其中39人年龄超过18岁,另外5人为未成年人。对于未成年人,获得了父母或监护人的同意,并征求了未成年人的同意。此外,参与视频录制的9名说录音志愿者签署了额外的知情同意书。录音志愿者被告知,他们有权随时中止参与,而不会产生任何后果。

表2:CDSD数据库录音志愿者的总体信息


二、文本池

考虑到成年与未成年录音志愿者在识字水平上的差异,CDSD数据库的文本池包括两种类型。

AISHELL-1数据库文本:涵盖语言多样性,代表日常言语,包含常用中文词汇和字符,增强了数据库的普遍性和模型鲁棒性,并已清除敏感或不当内容。

儿童文本:包括小学和中学演讲稿及童话故事,以适应儿童的阅读习惯和知识水平。


三、采集设备

为适应不同的录音场景,CDSD数据库的数据收集使用了两种录音设备。

ZOOM F8n现场录音机:部分说话者在约10平方米的录音室中使用该专业录音设备录制音频,提供高规格的音频录制质量,减少了后续数据分析中的潜在干扰。

智能手机:构音障碍录音志愿者可以在舒适的家庭环境中使用智能手机录制音频。智能手机录音有效模拟了说话者的日常语音识别任务,提高了音频数据的生态有效性,增强了语音识别模型的鲁棒性。


四、录制过程

环境要求:确保录音环境安静。

录制要求:麦克风距口部约20-40厘米。设备保持稳定,音量一致。视频录制时,面部保持屏幕中央,肩膀和嘴唇清晰可见。


基线与实验

实验使用了CDSD的A部分和B部分进行评估。A部分包括44名说话者的总计44小时音频数据,B部分包含7名说话者的70小时数据。数据被分为训练集、开发集和测试集,切分比例为8:1:1。实验采用Fbank和Wav2vec特征,其中Wav2vec显著提升了DSR性能。模型基于ESPnet工具包训练,分别在CDSD和AISHELL-1、AISHELL-2、WenetSpeech等预训练数据库上进行。

结果显示,Wav2vec特征在CDSD上的直接建模效果较好,但未超越使用Fbank特征的AISHELL数据库。人机比较实验表明,有经验的参与者识别构音障碍语音的平均字符错误率(CER)为20.45%,而无经验者为35.71%。计算机的语音识别能力优于人类,体现了DSR在提升构音障碍患者社会互动中的潜力。

在表3中,A部分的平均语音识别性能优于B部分。尽管B部分的录音时长长于A部分(70小时/7名说话者对44小时/44名说话者),但A部分的说话者数量更多。这表明,在说话者数量受限的情况下,模型的泛化能力较差,无法学习更多样的语音特征。

表3:不同预训练模型下 Fbank 和 Wav2vec 的 CER。[D/T] 表示开发集(D)和测试集(T)的CER。箭头“→”表示在前述数据库上进行预训练后,再在CDSD的A或B部分上进行微调


为了探究模型在单一说话者环境下的表现,我们将B部分用于说话者依赖模型训练,使用Fbank特征,并计算了每位说话者样本的CER(开发集和测试集)。实验结果见表4。

表4:B部分中每位说话者的计算机和人工转录的CER


我们将计算机的DSR结果与有构音障碍交流经验的参与者的识别结果进行了比较。结果如表4所示,计算机在大多数情况下优于参与者。然而,由于构音障碍患者的语音特征差异,计算机的识别性能存在波动。长时间的停顿和音节间的不连贯增加了模型训练的难度,导致模型可能过度依赖预训练特征,从而在处理这些不规则语音时出现较高的CER。

低资源语音识别旨在用最少的数据实现最佳性能。我们比较了表4中CER最低的说话者在不同训练时长下的DSR性能。

结果如图1所示,当训练数据时长达到4小时或更多时,性能提升有限。因此,针对构音障碍说话者的语音识别微调,使用来自大规模数据集的预训练模型时,大约需要5小时的数据。这可以降低数据收集和标注的成本。


图1:确定最佳训练数据量


结论与展望

我们构建了中文构音障碍语音数据库CDSD,该数据库包含了来自44名构音障碍者的133小时数据。CDSD是目前最大的中文构音障碍语音数据库。数据在不同场景和设备下收集,以确保音频质量并更好地模拟构音障碍语音的日常使用。CDSD的构建旨在提升中文构音障碍语音识别的性能,为中国的构音障碍患者群体提供更实用的语音识别技术。


参考文献

[1] J. Deller Jr, M. Liu, L. Ferrier, and P. Robichaud, “The Whitaker database of dysarthric (cerebral palsy) speech,” The Journal of the Acoustical Society of America, vol. 93, no. 6, pp. 3516–3518,1993.

[2] H. Kim, M. Hasegawa-Johnson, A. Perlman, J. Gunderson, T. S. Huang, K. Watkin, and S. Frame, “Dysarthric speech database for universal access research,” in Ninth Annual Conference of theInternational Speech Communication Association, 2008.

[3] F. Rudzicz, A. K. Namasivayam, and T. Wolff, “The TORGO database of acoustic and articulatory speech from speakers with dysarthria,” Language Resources and Evaluation, vol. 46, pp. 523–541, 2012.

[4] R. Turrisi, A. Braccia, M. Emanuele, S. Giulietti, M. Pugliatti, M. Sensi, L. Fadiga, and L. Badino, “EasyCall Corpus: A Dysarthric Speech Dataset,” in Proc. Interspeech 2021, 2021, pp. 41–45.

[5] R. L. MacDonald, P.-P. Jiang, J. Cattiau, R. Heywood, R. Cave,K. Seaver, M. A. Ladewig, J. Tobin, M. P. Brenner, P. C. Nelson et al., “Disordered speech data collection: Lessons learned at 1 million utterances from project Euphonia.” in Proc. Interspeech,2021, pp. 4833–4837.