Recent Advances on Speech Dialogue and Auditory Processing (RASDAP2024)Technical Report为了更好地推动语音对话与听觉处理领域的深入交流与前沿研究,由中国计算机学会(CCF)语音对话与听觉专委会发起的第一届语音对话与听觉处理前沿进展研讨会(RASDAP2024,Recent Advances on Speech Dialogue and Auditory Processing)于2024年4月21日在江苏苏州CCF业务总部&学术交流中心顺利举办。本次研讨会在上海交通大学俞凯教授和中国科学技术大学凌震华教授的共同组织下,邀请了名古屋大学Tomoki Toda教授、小米语音首席科学家Daniel Povey博士、香港中文大学(深圳)李海洲教授、中国科学技术大学袁家宏教授、微软亚洲研究院刘树杰研究员、NVIDIA陈哲怀研究员、三星中国研究院高级技术总监朱璇博士、阿里巴巴通义语音实验室鄢志杰博士、昆山杜克大学李明副教授、香港中文大学(深圳)武执政副教授、上海交通大学陈谐副教授、中国科学技术大学张结副研究员等国内外语音技术领域专家,围绕“大模型时代语音技术研究的挑战与机遇” (Challenges and Opportunities of Speech Technology Research in the Era of Large Models)主题展开了深入探讨。研讨会采用全英文形式,吸引了来自国内高校和企业的100余位语音同行报名参会,研讨会详情见活动预告和RASDAP2024新闻稿。为期半天的研讨会,通过引导发言和开放讨论两种形式,对齐了学术界和工业界语音大模型研究的前沿进展,进一步挖掘了语音大模型研究的一系列挑战性问题以及可能的解决方案。RASDAP这种小规模、精品化、主题高度聚焦形式的研讨会对团结和组织我国语音、对话与听觉相关领域的专业人士开展学术交流活动,强化各研究方向的融合,促进学术界与工业界的合作,提升我国语音、对话与听觉领域的科研、教学、应用水平以及国际影响力具有重要意义。
引导发言(Introdutory talks)
1)Tomoki Toda: Challenges in Leveraging Large Models for Augmented Speech Production对于建立在人类语音生成基础上的增强式语音生成(augmented speech production)任务,如语音转换(voice conversion, VC)等,物理功能、深度学习和交互方式是其三个重要要素。大模型的涌现有助于大幅提升深度学习框架的建模能力。Toda教授在IEEE SLT2021上的特邀报告中指出语音转换任务的发展方向包括:1)结合序列到序列建模与无监督学习的语音转换,包括研究高质量可控的话者转换方法、基于自监督预训练和迁移学习等技术灵活应用海量语音数据、实现语音转换从“谁说”(who speaks)到“怎么说”(how to speak)的发展(如适用于任意语言的通用表征学习、长时特征嵌入、风格情感转换等);2)语音转换任务定义的拓展,即从“保留语言(linguistic)信息的同时转换话者(speaker)信息”修改为“保留概念(conceptual)信息的同时转换任意(arbitrary)信息”,其中基于高层嵌入表征的序列到序列语音转换是保留概念信息的关键;3)增强式语音生成应使用低延时/实时的语音转换技术,结合额外输入信号和交互指令创造用户与系统之间的协同作业功能。 随着大模型的涌现,语音转换领域出现了一些新的代表性研究工作,如基于识别-合成框架的任意到任意(any-to-any)语音转换、神经编解码器语言模型(如VALL-E)、基于大模型的增强式语音生成(面向嗓音缺陷人士)。因此,现阶段增强式语音生成领域面临的三方面挑战可以概括如下:1)强化自监督表征学习能力,一方面提升自监督表征学习的可控性和通用性,例如学习相对音素更鲁棒的表征结构、单独控制不同音频属性、与低资源语音的表征共享等,另一方面结合语音之外的信号表征,例如包含面部图像/手势/姿态等多模态信号的自监督表征学习、学习数据之中本源特征、挖掘潜在的其他输入信号等;2)学习概念表征(Conceptual Representation),包括挖掘文本之外的表征(如从text-to-speech到concept-to-speech、学习高层级表征、生成更多的语音信号种类、灵活生成条件等)、挖掘语音与多模态信号之间的联系(如控制语音表达方式、学习不同模态之间可共享的概念性表征);3)挖掘人类适应能力(Human Adaption Capability),基于大模型的增强式语音生成需要满足低延时、实时、因果性、低计算成本、高效预测等要求,同时还应最大化人类适应性能(如设计系统内部状态的有效反馈机制、个性化和共享信息的分解、增强学习、高效获取用户评价等)。
2)Daniel Povey:Challenges of Speech Research in the Era of Large ModelsPovey博士表示引导发言上,他不会过多谈论技术趋势,因为他没有预言未来的“魔法水晶球”(crystal ball),而是更关注影响我们在大模型时代快速取得进展的因素。首先,取得技术进展的形式可以是多样化的,包括新的建模方法,(如历史上的回退语言模型和基于高斯混合模型的隐马尔可夫模型)、模型的逐步改进、有效的实践经验(如划分训练和测试集和数据集标准化)、收集相关数据集和发掘新任务、开发工具、复现先进性能水平(SOTA)算法的公开recipe、工具和指标的评价机制、模型诊断和可视化工具、程序调试工具等。其次,研究进展具有一种“遗传进化模型”,如果将每组的recipe集合视为一个遗传谱系,那么其中某个recipe通常经过微小的变化从另一个recipe中派生出来,有时也有“交叉”,问题在于需要仔细分析实验的周转时间(例如大模型通常较慢)、研究跟进速度、实验设置条件等影响进展速度的因素。另外,增加更多的资源(如数据量、训练时间)通常可以提升模型性能,但这并不一定能帮助我们学到任何东西。从长远角度来看,改进模型recipe更有趣,学术界希望向左下移动曲线,而工业界通常只关心曲线是否向下移动,因此使用海量数据开展研究存在着严重缺陷。为了训练庞大的模型,研究团队通常使用专有数据集,这意味着实验并不是真正可重复的,以及调整模型结构等因素的机会不多。不幸的是,有些方法只适用于“足够大”的数据,开发出在小规模数据上发挥作用的技术显然更有意义。
3)刘树杰:Towards Speech Large Language Model for Zero-shot Speech Synthesis and Translation从语音和语言这两种模态的区别入手,刘树杰博士着重介绍了微软亚洲研究院团队如何利用编解码器(Codec)得到的token构建语音大语言模型的一系列探索。为了将连续的语音信号转换为离散的token,从而可以像构建语言大模型那样构建语音大模型,VALL-E模型通过神经网络编解码器(Neural Codec)将语音信号转换为token,并基于此构建大模型。基于独立解码器(decoder-only) 框架和大规模多样的训练数据,VALL-E展现出了强大的上下文学习(In-context learning)能力,能够基于极短的语音片段复制未曾在训练数据中出现过的任意说话人的声音。然而,自回归模型结构和采样解码过程导致VALL-E的效率不高,且鲁棒性有待加强。VALL-E 2模型采用了基于组的建模方法和自适应的贪心搜索算法,显著提升了合成语音的自然度、语调相似度和鲁棒性等指标。进而,他们将单语言的VALL-E扩展为多语言的VALL-E X,任务类型也从单纯的语音生成拓展至语音识别和机器翻译,即VioLA模型。另外,他们提出的SpeechX模型,能够处理降噪、语音移除、提取目标说话人语音、语音编辑等多项任务。
4)陈哲怀:A Journey towards Speech Foundational Model and Speech Augmented Large Language Model构建大规模语音基础模型的动机包括使用无标签语音数据学习获得更好性能、利用大量多语种数据处理低资源任务以及多任务语音处理需求等,挑战之处在于可拓展的(scalable)模型架构、训练损失函数和可拓展的数据收集和清洗方式。USM模型是第一个将语音-文本联合自训练提升到超大规模的一个尝试。为了降低训练USM的代价,Canary模型采用了一个完全开源的大规模多任务监督训练方案,该模型利用128张A100(80GB)GPU训练,每个epoch耗时6分钟,总共12.8小时,每天训练85K小时数据,已集成在NVIDIA NeMo 工具包。