
AI语音生成的特点就是呆板,没有情绪的起伏。最近Meta AI连发了三篇Textless NLP的论文,不仅开源了textlesslib库,还展示了AI对话在语音情感转换的惊人能力!
在日常交流的时候,人们往往会使用一些「非语言」的信号,比如语调、情感表达、停顿、口音、节奏等来强化对话互动的效果。

AI语音生成的特点就是呆板,没有情绪的起伏。最近Meta AI连发了三篇Textless NLP的论文,不仅开源了textlesslib库,还展示了AI对话在语音情感转换的惊人能力!
在日常交流的时候,人们往往会使用一些「非语言」的信号,比如语调、情感表达、停顿、口音、节奏等来强化对话互动的效果。
像开心、愤怒、失落、困倦时说同一句话,虽然内容都一样,但听起来的感觉肯定是非常不同的,而AI的发声则比较死板。

目前AI语音生成系统大部分还是根据书面文本来学习发声,也就是说,模型只能知道说话的内容,却不知道人类以何种语速、情感来说,对于文本之外富有表现力的语音信号根本捕捉不到。
所以AI虽然能当主持人播新闻,但在一些特殊的应用场景里,比如小品、相声、脱口秀这些语言艺术领域,人工智能还没法取代人类来说话。


开源textlesslib
开源textlesslib

论文链接:
https://arxiv.org/pdf/2202.07359.pdf
代码链接:
https://github.com/facebookresearch/textlesslib
语音情感转换
语音情感转换

论文链接:
https://arxiv.org/pdf/2111.07402.pdf
演示链接:
https://speechbot.github.io/emotion/
语音情感转换(Speech Emotion Conversion)是指在保留词汇内容和说话人身份的情况下修改语音语料的可感知情感的任务。在这篇论文中,研究人员把情感转换的问题作为一项口语翻译任务,将语音分解成离散的、不相干的,由内容单元、音调(f0)、说话人和情绪组成的学习表征。
模型先通过将内容单元翻译成目标情感来修改语音内容,然后根据这些单元来预测声音特征,最后通过将预测的表征送入一个神经声码器来生成语音波形。
这种范式使得模型不止能发现信号的频谱和参数变化,还可以对非语言发声进行建模,如插入笑声、消除哈欠等。论文在客观上和主观上证明了所提出的方法在感知情感和音频质量方面优于基线。实验部分严格评估了这样一个复杂系统的所有组成部分,并以广泛的模型分析和消融研究作为结论,以更好地强调拟议方法的架构选择、优势和劣势。


有情感的AI对话
有情感的AI对话

论文链接:
https://arxiv.org/pdf/2203.16502.pdf
演示链接:
https://speechbot.github.io/dgslm/
文中提出的dGSLM模型是第一个能够生成自然口语对话音频样本的Textless模型。模型的开发上利用了最近在无监督口语单元发现方面的工作,加上一个带有交叉注意力的双塔Transformer架构,在2000小时的双通道原始对话音频(Fisher数据集)上训练,没有任何文字或标签数据。dGSLM能够在两个通道中同时产生语音、笑声和其他副语言信号,让谈话的转折非常自然。

下面是一段模型生成的对话。
颠覆传统NLP
颠覆传统NLP



参考资料:
https://ai.facebook.com/blog/generating-chit-chat-including-laughs-yawns-ums-and-other-nonverbal-cues-from-raw-audio
