TASLP MSStyleTTS:面向表现力语音合成的多尺度风格建模 本工作由清华大学与元象唯思控股(深圳)有限公司和香港中文大学合作,研究了表现力语音合成中的多尺度说话风格建模方法。现有的说话风格建模方法主要是根据当前句子中的信息预测单一…
声浪
TASLP|MSStyleTTS:面向表现力语音合成的多尺度风格建模
30 0 0
INTERSPEECH2024丨Single-Codec: 面向高性能语音合成的单码本语音编解码器
大语言模型(LLM)在语音合成领域得到广泛应用,它将语音合成任务视为简单的下一个语音离散单元预测。其中,寻找合适的语音编解码器(Codec)来进行语音离散化和波形重建是首要问题。多码本编解码器由于其卓越的重建质量而被广泛采用。然而,多个码本…
21 0 0
6种语言超过10万小时语音生成数据集Emilia
港中大(深圳)联合中科院声学所、上海人工智能实验室等机构发布了超过10万小时包含6种语言的多样化的语音生成数据集——Emilia!更重要的是,Amphion直接开源了Emilia-Pipe数据预处理框架,学术界也能众筹数据了,也能玩大模型了…
66 0 0
普强信息 | 招聘高级TTS研发工程师(北京)
普强信息 普强于2009年在美国硅谷成立全球研发中心,主要从事智能语音和语言技术的研究,2010年设立中国运营公司,是金融科技创新和智能汽车AI服务提供商,在硅谷和中关村、上海,深圳均建设有技术研发中心,在南京拥有声学实验室,专注于金融大数…
25 0 0
阿里通义音频生成大模型 FunAudioLLM 开源!
人类对自身的研究和模仿由来已久,在我国2000多年前的《列子·汤问》里就描述了有能工巧匠制作出会说话会舞动的类人机器人的故事。声音包含丰富的个体特征及情感情绪信息,对话作为人类最常使用亲切自然的交互模式,是连接人与智能世界至关重要的环节。…
72 0 0
