来源丨AIGC开放社区 近日,微软研究院开源了创新音频模型 VibeVoice-1.5B。 VibeVoice-1.5B开创了语音界多个重大技术突破:一次性可连续合成90分钟超长逼真语音,之前多数模型只能合成60分钟以内语音,并且30分钟后…
声浪
语音界Sora!微软开源新模型,一次生成90分钟语音、3200倍压缩率
25 0 0
EMNLP 2025丨VersBand:基于提示控制的多功能歌曲生成框架
歌曲生成的核心是基于各种提示生成可控的高质量歌曲。然而,现有方法难以生成具有提示控制的人声和伴奏,且不能实现两者间很好的对齐。此外,它们在支持多种歌曲相关的任务方面,如歌声风格迁移,人声配伴奏,也存在不足。 为解决这些挑战,来自浙江大学的学…
16 0 0
在大模型时代,机器翻译有哪些新变化?
大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…
15 0 0
【交我学-8】在大模型时代,机器翻译有哪些新变化?
大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…
11 0 0
EMNLP2025丨南京大学自然语言处理研究组六篇录用论文分享
EMNLP(Conference on Empirical Methods in Natural Language Processing)是自然语言处理领域顶级国际会议之一,其涉及领域包括但不限于机器翻译、文本生成、文本分类、信息抽取、问答…
22 0 0
首个接入GPT-5的视频Agent!一句话生成商业级广告大片,分镜配音字幕等全包了
来源丨新智元 一句话即生爆款AI视频的时代来临!全球首个接入GPT-5的视频智能体——Video Ocean正颠覆创作领域,轻松hold各种素材,全流程AI自主完成,一键解锁好莱坞级大片。 一句话生成分钟级爆款视频的时代已经到来! 在软件领…
11 0 0
理想同学发布 MindGPT 3.1:极速推理的智能体语言模型
来源丨AI理想同学 近日,理想同学发布了基座模型 MindGPT 3.1 ,是具备极速推理能力的智能体语言模型。 MindGPT 3.1 具备如下能力: 极速响应:每秒出字速度最高可达 200 Tokens,相比上一代模型 MindGPT…
14 0 0
