阶跃星辰是行业领先的通用大模型创业公司,坚定探索实现通用人工智能的道路。公司于2023年4月成立,聚集人工智能领域的顶尖人才,已对外发布 Step 系列通用大模型矩阵,覆盖了从语言、多模态到推理的全面能力,并面向开发者连续开源多个业内领先的…
声浪
阶跃星辰是行业领先的通用大模型创业公司,坚定探索实现通用人工智能的道路。公司于2023年4月成立,聚集人工智能领域的顶尖人才,已对外发布 Step 系列通用大模型矩阵,覆盖了从语言、多模态到推理的全面能力,并面向开发者连续开源多个业内领先的…
快手科技、天津大学、中科院自动化所与清华大学联合发布了SecoustiCodec,一种跨模态对齐的流式单码本语音Codec。支持语义信息、副语言信息、声学信息的独立编码与重构。可以应用于语音合成、语音对话模型等生成式语音任务。 论文题目:S…
来源丨本原智数、HyperAI超神经 近日,谷歌DeepMind正式发布并开源了全新的生物声学模型Perch 2.0。相较于前代,Perch 2.0 以物种分类为核心训练任务,不仅纳入了更多非鸟类类群的训练数据,还采用了全新的数据增强策略与…
近年来,语音对话模型(Spoken Dialogue Models, SDMs)——如GPT-4o-Audio-Preview等,因能直接对用户的处理语音输入,并以语音形式做出回应而备受关注。尽管这类模型日益流行,关于它们在处理人类对话中复…
来源丨新智元 GitHub变天了!今天起,它不再独立。它再也不是那个为开发者的自由而生的平台,而成了微软AI代理工厂的一部分。CEO宣布辞职,出走创业。终于,一个时代落幕了。 一觉醒来,独立的GitHub没了!CEO也没了!这也太戏剧性了。…
来自大连理工大学等机构的研究团队近日在Advanced Electronic Materials期刊上发表了一项研究,该团队通过电喷雾和3D微直接墨水书写等增材微制造技术,制备出一种可检测声波振幅与方向的仿生纤毛传感器,成功实现了360°方…
大家好,欢迎来到「AudioCC交我学」专栏! 在本期文章中,我们将带您了解一个新兴而富有挑战性的跨模态研究方向:视觉生成音乐(Vision-to-Music Generation, V2M)。该任务旨在从图像、视频或人体动作等视觉信号中自…
