音乐作为艺术表达的重要形式,蕴含深厚的文化内涵。近年来,随着深度学习技术的快速发展,音乐生成领域取得了显著进展。在众多方法中,非自回归框架因其高效生成能力备受关注。例如,音频语音与语言处理研究组(ASLP Lab)年初开源的DiffRhyt…

最新声浪
查看全部 →DiffRhythm 2:非自回归的高效 × 自回归的灵魂,AI音乐创作的新纪元
24 0 1
字节Seed团队发布循环语言模型Ouro,在预训练阶段直接「思考」,Bengio署名
现代 LLM 通常依赖显式的文本生成过程(例如「思维链」)来进行「思考」训练。这种策略将推理任务推迟到训练后的阶段,未能充分挖掘预训练数据中的潜力。 为解决这一问题,字节 Seed 团队联合多家机构推出了Ouro,一类被称为循环语言模型(L…
23 0 0
抖音SAIL团队联合港中文MMLab推出SAIL-Embedding:打通「视、文、音」的全模态嵌入
来源丨机器之心 近日,字节跳动抖音 SAIL 团队联合香港中文大学 MMLab 提出 SAIL-Embedding——一款专为大规模推荐场景设计的全模态嵌入基础模型。 SAIL-Embedding 不仅实现了视觉、文本、音频的统一表征,更在…
20 0 0
ACM MM 2025丨北邮人工智能学院智能语音与情感交互实验室获奖项目分享
来源丨智能语音与情感交互实验室 本期分享北京邮电大学人工智能学院智能语音与情感交互实验室在ACM MM 2025会议组织的基于虚拟人的多模态共情响应生成挑战赛AvaMERG上获奖项目。 论文地址:https://dl.acm.org/doi…
21 0 0
上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型
来源丨机器之心 程爽,上海人工智能实验室和浙江大学联培博士生一年级;卞一涵,美国马里兰大学硕士生二年级,上海人工智能实验室实习生;刘大卫,上海人工智能实验室和上海交通大学联培博士生一年级;齐弼卿,上海人工智能实验室研究员(指导老师) 大模型…
22 0 0
WEST来了,一站式搞定语音理解、生成与对话
大语言模型(LLM)的爆发式发展彻底改变了人工智能的学习与应用范式。如今,这股变革力量又延伸到了语音领域,由西北工业大学、南京大学和WeNet社区研发的WEST(WE Speech Toolkit)正式开源,它以LLM为核心,打通语音识别、…
21 0 0
ElevenLabs CEO:AI语音模型几年内会被商品化
在AI语音正火热的当下,ElevenLabs的联合创始人兼CEOMati Staniszewski却抛出一个冷静的判断——他认为,AI模型最终会被“商品化”。 他在周二的TechCrunch Disrupt 2025大会上说,公司现在仍在专…
21 0 0
