INTERSPEECH2024丨Single-Codec: 面向高性能语音合成的单码本语音编解码器
INTERSPEECH2024丨Single-Codec: 面向高性能语音合成的单码本语音编解码器

大语言模型(LLM)在语音合成领域得到广泛应用,它将语音合成任务视为简单的下一个语音离散单元预测。其中,寻找合适的语音编解码器(Codec)来进行语音离散化和波形重建是首要问题。多码本编解码器由于其卓越的重建质量而被广泛采用。然而,多个码本…

21 0 0
6种语言超过10万小时语音生成数据集Emilia
转载2 years ago
6种语言超过10万小时语音生成数据集Emilia

港中大(深圳)联合中科院声学所、上海人工智能实验室等机构发布了超过10万小时包含6种语言的多样化的语音生成数据集——Emilia!更重要的是,Amphion直接开源了Emilia-Pipe数据预处理框架,学术界也能众筹数据了,也能玩大模型了…

66 0 0
普强信息 | 招聘高级TTS研发工程师(北京)
转载2 years ago
普强信息 | 招聘高级TTS研发工程师(北京)

普强信息 普强于2009年在美国硅谷成立全球研发中心,主要从事智能语音和语言技术的研究,2010年设立中国运营公司,是金融科技创新和智能汽车AI服务提供商,在硅谷和中关村、上海,深圳均建设有技术研发中心,在南京拥有声学实验室,专注于金融大数…

25 0 0
阿里通义音频生成大模型 FunAudioLLM 开源!
原创2 years ago
阿里通义音频生成大模型 FunAudioLLM 开源!

人类对自身的研究和模仿由来已久,在我国2000多年前的《列子·汤问》里就描述了有能工巧匠制作出会说话会舞动的类人机器人的故事。声音包含丰富的个体特征及情感情绪信息,对话作为人类最常使用亲切自然的交互模式,是连接人与智能世界至关重要的环节。…

72 0 0