作者ASLPer


作为语音相关研究领域的旗舰国际会议,INTERSPEECH2022(Annual Conference of the International Speech Communication Association)将于9月18-22日在韩国仁川举办,会议以线上和线下混合形式进行。会议官方网址为:https://interspeech2022.org。

西工大音频语音与言处理研究组(ASLP@NPU)本届会议将携合作伙伴宣读论文14篇,涉及智能语音处理领域的众多研究方向,包括语音识别、说话人识别、关键词检出、语音与歌声合成、语音增强、语音转换等。论文的合作单位包括:腾讯、网易、地平线、出门问问、马上金融等。以下是本届会议发表论文的相关信息,附带论文原文链接,与大家分享。



#1 

CaTT-KWS: A Multi-stage Customized Keyword Spotting Framework based on Cascaded Transducer-Transformer


作者列表:杨展恒,孙思宁,李晋,张笑铭,王雄,马龙,谢磊
合作单位:腾讯CSIG
论文摘要:自定义关键词唤醒(KWS)技术在端侧设备上具有很大的应用潜力。然而在实际应用中,如果同时存在几十个甚至数百个候选关键词,虚警(FA)将是一个严重的问题,这将极大地影响用户体验。为了解决这一问题,本文中基于最近流行的transducer和transformer声学模型提出了一种新的多阶段定制KWS框架,名为级联transducer-transformer关键词识别框架(CaTT-KWS),它包括一个基于transducer的关键词检测器,一个基于帧级音素判别器的强制对齐模块和一个基于transformer的校验解码器。首先流式transducer模块用于识别音频流中的候选关键词。然后对音素判别器预测的音素后验进行强制对齐,完成第一阶段的校验并细化关键词的触发时间戳。最后,transformer解码器进一步校验所触发的关键词。本文提出的CaTT-KWS框架在不明显影响关键字识别精度的前提下,有效地降低了虚警率。在一个具有挑战性的实录数据集上得到了0.13次误唤醒/小时的结果,与基于transducer的识别模型基线相比,误唤醒相对降低了90%以上,而关键词识别精度下降了不到2%。
论文网址:https://arxiv.org/abs/2207.01267


(扫码看论文)


#2

Minimizing Sequential Confusion Error in Speech Command Recognition

作者列表:杨展恒,吕航,王雄,张奥,谢磊
论文摘要:语音指令识别(SCR)已经广泛应用于资源有限的端侧设备上以实现用户的hands-free体验。然而在实际应用中,由于端侧设备上部署的模型大小受限,发音相近的指令词之间经常发生混淆,极大地影响了用户体验。本文受语音识别中区分性训练的启发,提出了一种新的最小化序列混淆错误(MSCE)的训练准则,旨在解决指令词的混淆识别问题。我们的方法基于最小分类错误(MCE)判别准则,在此基础上提高目标指令与其他易混淆指令之间的区分性。通过CTC来定义不同指令的似然。在训练过程中,我们设计并比较了三种利用先验知识为相似指令创建混淆序列集合的策略,这些策略可以节省训练资源,有效地减少指令混淆错误。通过使用本文提出的区分性训练准则,在语音指令测试集合上,可以在0.01虚警率(FAR)的情况下相对降低33.7%的误拒绝率(FRR)和18.28%的混淆错误。
论文网址:https://arxiv.org/abs/2207.01261


(扫码看论文)



#3

Personalized Acoustic Echo Cancellation for Full-duplex Communications

作者列表:张是民, 王子腾, 琚雨恺, 付艺辉, 纳跃跃, 付强, 谢磊
论文摘要:深度神经网络 (DNN) 在声学回声消除 (AEC)应用上已经获得优异的效果。但是目前基于DNN 的 AEC 模型会保留所有说话人,包括干扰说话人。本文研究了在全双工通信中个性化声学回声消除(PAEC)的可行性。PAEC是关于个性化语音增强工作的扩展探索,并且考察背景噪声、干扰人语音以及声学回声同时存在的复杂情况。具体来说,我们结合门控卷积和TCN,引入GTCNN,首先在性能上优于基于DNN的主流AEC 模型。此外,我们进一步采用说话人表征作为辅助信息,以指导 GTCNN 提取目标说话人的语音。PAEC 区别于PSE的一个特点是:可能获得对讲双端的注册语音。实验结果表明,使用对讲双端的注册语音作为辅助信息,可以提高基于 DNN 的 AEC 性能。如何更有效地利用说话人表征是值得深入探讨的问题。
论文网址:https://arxiv.org/abs/2205.15195


(扫码看论文)


#4

Leveraging Acoustic Contextual Representation by Audio-textual Cross-modal Learning for Conversational ASR

作者列表:魏坤,张一珂,孙思宁,谢磊,马龙
合作单位:腾讯CSIG
论文摘要:语境(Context)是诸如对话等长语音识别中可以有效利用的信息。当前方案通常采用上文的解码结果作为历史信息,历史识别错误对当前的识别结果可能产生负面影响。为了避免这个问题,本文提出一种用于学习语境的文本-语音跨模态表示提取器,直接从上文语音中学习语境表征。具体来说,模型由两个模态相关编码器以及一个跨模态编码器构成,其目的是学习语音和文本之间的联系。我们随机屏蔽一些输入字符和每个模态的完整输入序列,然后通过CTC和对比学习损失来训练模型。因此,模型捕捉到的不仅是特定模态中的双向上下文依存关系,还包括不同模态之间的关系。然后,在对话语音识别系统的训练过程中,提取器的参数将被冻结以提取前一语音序列的文本信息表示。这种表示被用作通过注意机制反馈给语音识别解码器,作为语境信息。本文在多个普通话对话语料库上验证了该方法的有效性,包括在MagicData数据集上实现了最高的16%的字符错误率降低。
论文网址:https://arxiv.org/abs/2207.01039


(扫码看论文)


#5

Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism

作者列表:魏坤,郭鹏程,蒋宁
合作单位:马上金融
论文摘要:Transformer模型在语音识别(ASR)任务中具有出色的表现,甚至显示出优于传统混合框架的性能。其主要思想是通过自注意力层捕捉语音中的全局信息。然而对于对话语音识别等场景,常规句级建模势必忽略了跨句的语境依赖关系。为此,本文基于Transformer的端到端架构,提出一种显式建模句上下文信息的方法,用于提升对话语音识别性能。具体来说,对于编码器网络,我们保存先前语音的声学上下文,并通过上下文感知的残差注意力机制将这些历史信息融合到当前输入中。对于解码器网络,当前文本的预测也以历史文本信息为输入,通过条件解码器框架学习到更长的文本信息。本文在几个开源的对话语料库上证明了提出方法的有效性,提高了对话场景基于Transformer语音识别模型的性能。
论文网址:https://arxiv.org/abs/2207.00883


(扫码看论文)


#6

Linguistic-Acoustic Similarity Based Accent Shift for Accent Recognition

作者列表:邵琪杰,颜京豪,康健,郭鹏程,石宪,胡鹏飞,谢磊
合作单位:腾讯TEG
论文摘要:常见的口音识别(AR)模型往往直接从语谱中提取低级别特征,这会导致严重的说话人或信道过拟合。考虑到口音可以被视为一系列的相对标准发音的偏移,若以此类口音偏移作为输入有望使口音分类任务变得更容易。但是,由于缺乏标准发音作为基准,口音偏移量的评估面临困难。本文提出了基于语言-声学相似度的口音偏移(LASAS)度量方法,并将其用于口音分类任务。对于一个带口音的语句,在映射其相应文本向量到口音相关空间作为基准后,我们通过评估声学嵌入和该基准的相似度,实现对口音偏移的度量。然后,我们将口音偏移和文本向量拼在一起,以获得语言-声学双模态表征。相比于纯声学嵌入,这种双模态表征充分利用了语言和声学信息,物理意义更加丰富和清晰,从而显著改善了口音分类性能。在口音英语识别挑战赛(AESRC)数据集上的相关实验证明了本文方法的有效性。在测试集上实现了77.42%的分类正确率,相比于一个有竞争力的基线获得了6.94%的相对提升。
论文网址:https://arxiv.org/abs/2204.03398v2


(扫码看论文)


#7

Learn2Sing 2.0: Diffusion and Mutual Information-Based Target Speaker SVS by Learning from Singing Teacher

作者列表:薛鹤洋,王新升,张雍茂,谢磊,朱鹏程,毕梦霄
合作单位:网易伏羲
论文摘要:为一个不擅长唱歌的人构建一个高质量的歌唱语料库并不容易,因此,为这个人创建一个歌唱声音合成器是极具挑战的。Learn2Sing致力于通过从他人(即老师)录制的高质量歌唱数据中进行学习,在仅有目标发音人(即学生)讲话语音数据而没有其歌唱数据的情况下合成其歌唱声音。基于音高是区分唱歌和说话的关键风格因素的事实,本文提出Learn2Sing 2.0,首先生成具有平均音高值的音素级的初步声学特征,这允许对不同的风格(即说话或唱歌)共享相同的除了说话者的信息的条件。而后在特定风格(即说话或唱歌)的条件下,采用扩散(Diffusion)解码器,在推理阶段通过快速采样算法,逐步恢复最终的声学特征。同时在训练过程中,为了避免说话人嵌入和风格嵌入的信息混淆,Learn2Sing2.0 采用了互信息来准则来约束说话人嵌入和风格嵌入的学习。实验表明,Learn2Sing2.0能够在没有目标发音人歌唱数据的情况下,通过10个解码步为目标说话人快速合成高质量的歌唱声音。
论文网址:https://arxiv.org/abs/2203.16408


(扫码看论文)


#8

Learning Noise-independent Speech Representation for High-quality Voice Conversion for Noisy Target Speakers

作者列表:薛浏蒙,阳珊,胡娜,苏丹,谢磊
合作单位:腾讯 AI Lab
论文摘要:语音转换的目的是将源说话人语音中的音色转成目标说话人音色,同时保持源语音中的语言内容不变。在实际应用中,目标说话人所处的环境可能是嘈杂的,导致录制的目标说话人语音数据带噪。直接使用带噪数据建模语音转换模型必然会降低语音转换的质量。如何在目标说话人只有带噪数据的“低质”场景下构建高质量的语音转换系统是一个具有挑战性的任务。本文针对这一任务,提出一种与噪声无关的语音表示学习方法,实现对带噪目标说话人的高质量语音转换。具体来说,在我们之前提出的Glow-WaveGAN基础上,本文进一步提出噪声可控的WaveGAN (noise-controllable WaveGAN)。NC-WaveGAN中的编码器直接从波形中提取噪声无关的语音潜在表征,基于Flow的转换模型在说话人身份条件的控制下将音素后验映射到由NC-WaveGAN提取的噪声无关的语音表征上,然后NC-WaveGAN的解码器在FiLM模块的噪声属性控制下将语音表征重构成干净语音。实验表明,所提出的NC-WaveGAN可以有效地学习到噪声无关的语音表示,FiLM模块可以灵活地控制干净波形的重构。同时主客观实验表明,无论是在模拟的带噪数据上还是在真实的带噪数据上,所提出的方法对带噪目标说话人实现了高音质和高音色相似度的语音转换结果。
论文网址:https://arxiv.org/abs/2207.00756v1


(扫码看论文)


#9

A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings


作者列表:俞帆,杜志浩,张仕良,林宇箫,谢磊
论文摘要:本文针对多方会议场景下的说话人相关语音识别(SA-ASR)任务进行了系统性对比研究。该任务在会议转录场景中越来越受到重视,成为当前语音识别中一个炙手可热的研究热点。本文主要对比研究了三种方法。第一种方法是帧级别的说话人日志结合基于SOT的语音识别模型(FD-SOT),它由一个用于确定说话人身份的帧级说话人日志模型和一个用于识别语句的多说话人ASR模型组成。FD-SOT是通过对齐说话人日志模型的预测结果和ASR模型的预测文本来获取带有说话人标签的预测文本。但是,由于各个模块是独立的,这种对齐策略很容易因为错误的时间戳影响模型的识别性能。因此,为了消除模型对于时间戳对齐的过度依赖性,本文提出了第二种方法——字级别的说话人日志结合基于SOT的语音识别模型(WD-SOT)。该方法引入了字级别的说话人日志模型,基于SOT的预测文本来确认对应语句的说话人身份,从而有效解决错误对齐的问题。为了进一步解决对齐问题,本文进而提出了第三种方法——目标说话人分离和ASR模型的联合优化(TS-ASR),也就是前端目标说话人分离模块根据相应的说话人表征提取对应说话人的高维表示来给后端的单说话人ASR模型识别解码。在真实会议场景语料库AliMeeting上,本文对上述三种SA-ASR方法进行了对比。实验结果表明WD-SOT方法相比FD-SOT方法在说话人相关字符错误率(SD-CER)上相对降低了10.7%;TS-ASR方法相比FD-SOT方法在SD-CER上也相对降低了16.5%。
论文网址:https://arxiv.org/abs/2203.16834


(扫码看论文)


#10

Glow-WaveGAN 2: High-quality Zero-shot Text-to-speech Synthesis and Any-to-any Voice Conversion


作者列表:雷怡,阳珊,从坚,谢磊,苏丹
合作单位:腾讯 AI Lab
论文摘要:基于零资源的语音生成任务旨在利用一句话生成系统未见过的目标说话人的语音。尽管在零资源语音生成场景中,声学模型和声码器两个阶段中都存在着适应新说话人的挑战,但之前的工作通常只从其中一个阶段来考虑这个问题。本文在先前提出的Glow-WaveGAN的基础上进行扩展,提出了Glow-WaveGAN 2,旨在从声学模型和声码器两个阶段共同解决高质量零资源语音合成和语音转换的问题。我们首先建立一个通用的WaveGAN模型,来提取语音的隐层分布p(z),并从该隐层分布重建波形。然后利用一个基于流的声学模型从文本中学习相同的p(z),这避免了声学模型和声码器之间的不匹配,从而在不进行模型微调的情况下就可以生成高质量的语音。在此基础上,我们构建了一个连续的说话人空间,利用流的可逆性获得任意说话人语音的条件分布,从而无需从训或微调模型,即可为新说话人生成高质量的语音。我们研究了两种构建说话人空间的方法,即预训练说话人编码器和联合训练说话人编码器。在LibriTTS和VTCK语料库上进行的TTS和VC实验证明了Glow-WaveGAN 2的优越性。
论文网址:http://arxiv.org/abs/2207.01832


(扫码看论文)


#11

Backend Ensemble for Speaker Verification and Spoofing Countermeasure

作者列表:张丽,李越,赵欢,王晴,谢磊
论文摘要:本文是我们提交到2022年欺骗感知说话人验证挑战赛(SASV)的系统描述。本文主要从三个方面研究了说话人确认系统与反欺骗对策系统的后端融合。首先,除了简单的说话人表征与反欺骗对抗表征的拼接之外,我们提出了用于说话人表征和反欺骗对抗表征的循环矩阵变换和堆叠。其次,我们尝试使用不同的卷积神经网络选择性地将说话人表征和反欺骗对抗表征的显著区域融合到卷积核的通道中。最后,我们在一维卷积神经网络中设计并行注意力机制,以学习通道维度的全局相关性以及特征维度的重要部分。同时,我们在二维卷积神经网络中嵌入了squeeze-and-excitation注意力,以学习说话人表征和反欺骗对抗表征之间的全局依赖性。实验验证了上述方法的有效性。通过上述方法增强的四个的模型进行融合后,我们在比赛评估集上实现的最佳 SASV-EER、SPF-EER 和 SV-EER 分别为 0.559%、0.354% 和 0.857%。基于上述贡献,我们的提交系统在本次挑战赛中获得了第五名。
论文网址:https://arxiv.org/abs/2207.01802


(扫码看论文)


#12

WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit

作者列表:张彬彬,吴迪,彭震东,宋星辰,姚卓远,吕航,谢磊,杨超,潘复平,牛建伟
合作单位:地平线、WeNet开源社区
论文摘要:最近我们研发并发布了一款面向产业化的端到端语音识别工具——WeNet。它通过新提出的统一化两遍框架 (U2) 和内置的运行时生态,用一个模型同时完成流式和非流式解码模式的处理。为了进一步提升语音识别效果,并促进和满足多种多样的产业化需求,本文提出了WeNet 2.0版本。它主要有四点重要更新:(1) U2++结构,它在统一两遍框架的基础上,使用了双向注意力解码器。通过一个从右到左的注意力解码器,进一步考虑了未来的上下文信息,从而有效的提升了共享编码器的表达能力和重打分阶段的准确率。(2) 为WeNet 2.0提供了一个基于N元语言模型 (n-gram language model) 和加权有限状态转换器 (WFST) 的解码器,从而促进了产业化场景中更丰富的纯文本内容的利用。(3) 设计了一个统一的热词增强 (contextual biasing)框架,它利用用户指定的热词上下文 (如联系人列表) 为产品提供快速自适应的能力,并且在有语言模型和无语言模型的场景下,都可以有效提升语音识别的准确率。(4) 设计了一个统一的读写 (UIO) 框架用以支持进行有效的大规模模型训练。总的来说,全新的WeNet 2.0相对于原始的WeNet,在多数据集测试中可以获得多达10%的相对识别性能提升。并且,WeNet2.0为大家提供了更多面向产品的行之有效的新特性。
论文网址:https://arxiv.org/abs/2203.15455


(扫码看论文)

相关文章

迷途小书僮,公众号:语音之家[开源代码]WeNet2.0:提高端到端ASR的生产力

#13

Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis


作者列表:王玉,王新升,朱鹏程,吴洁,李函昭,薛鹤洋,张雍茂,谢磊,毕梦霄
合作单位:同济大学设计创意学院,上海视觉艺术学院流行音乐舞蹈学院,网易伏羲
论文摘要:本文介绍了一个用于歌唱语音合成(SVS)的开源高质量中文歌唱语料库。该语料库由一位职业女歌手演唱的100首中文流行歌曲组成。音频文件的录制采样率为 44100 Hz,并提供相应的歌词和乐谱。所有歌唱音频使用音素边界和音节(音符)边界进行了语音标注。为了证明发布数据的可靠性,并为未来的研究提供基线,我们构建了基于深度神经网络的 SVS 模型,并通过客观指标和主观平均意见得分(MOS) 对其进行评估。实验结果表明,在本语料库上训练的 SVS 模型 MOS 分最高可达 3.70,这表明了所提供的语料库的可靠性。Opencpop已发布到WeNet 开源社区中,语料库和合成 demo 都可以在项目主页中找到。
论文网址:https://arxiv.org/abs/2201.07429


(扫码看论文)

相关文章

朱鹏程,公众号:语音之家全球首个中文精标歌声合成开源数据Opencpop正式发布


#14

Cross-speaker Emotion Transfer Based on Prosody Compensation for End-to-End Speech Synthesis


作者列表:李涛,王新升,谢启聪,王智超,江明奇,谢磊
合作单位:出门问问
论文摘要:语音合成中的跨说话人情感迁移任务旨在通过从另一个(源)说话人的参考语音中转移情感来合成目标说话人的情感语音。在这项任务中,从参考语音中提取与说话人无关的情感嵌入起着重要作用。然而,在消除源说话人音色信息的过程中,这种情感嵌入所迁移的情感信息往往会被削弱。针对这一问题,本文提出了一种韵律补偿模块(PCM)来补偿情感信息的损失。具体来说,PCM试图从预先训练的ASR模型的中间特征中获取与说话人无关的情感信息。为此,引入了一种具有全局上下文(GC)块的韵律补偿编码器,以从ASR模型的中间特征中获取全局情感信息。实验表明,该方法可以有效地补偿情感信息丢失对情感嵌入的影响,同时保持目标说话人的音色。与现有模型的对比表明,该方法在跨说话人情感迁移任务中具有明显的优势。
论文网址:https://arxiv.org/abs/2207.01198


(扫码看论文)


后续会对每篇论文进行解读分享,敬请关注。