面向听觉智能与物理AI的
人机交互开发者社区

发现模型、参与赛事、分享实践、连接同行,共创数据、模型与评测驱动的人机交互生态。

50k+
注册开发者
5.8k+
技术文章
268+
开源数据集
300+
技术课程

最新声浪

查看全部 →
豆包大模型2.0发布
转载8 months ago
豆包大模型2.0发布

今天,豆包大模型正式进入2.0阶段。 随着Agent时代到来,大模型将在现实世界发挥更大作用。豆包2.0(Doubao-Seed-2.0)围绕大规模生产环境下的使用需求做了系统性优化,依托高效推理、多模态理解与复杂指令执行能力,更好地完成真…

26 0 0
融声向善语音资源开源计划丨AISHELL-6 系列特殊声学特征语音语料库全面开放,助力人机交互向善发展
原创8 months ago
融声向善语音资源开源计划丨AISHELL-6 系列特殊声学特征语音语料库全面开放,助力人机交互向善发展

为促进语音技术的多元化与包容性发展,推动人工智能真正惠及每一位用户,希尔贝壳秉持“技术向善”的理念,联合西北工业大学、中国科学技术大学、南开大学、昆山杜克大学、新加坡南洋理工大学、佐治亚理工学院、StammerTalk、WeNet等顶尖学术…

24 0 0
清华和盛大东京团队提出Hive数据集:以数据质量取代规模,实现高效通用声音分离
原创8 months ago
清华和盛大东京团队提出Hive数据集:以数据质量取代规模,实现高效通用声音分离

基于查询的通用声音分离(USS)技术旨在通过文本、音频等多模态提示从混合信号中分离出目标声音。这项技术能够应用于沉浸式音频渲染、智能音频编辑和辅助听力设备等应用,实现对复杂声学环境中任意声源的精准提取。 尽管近年来方法架构不断演进,现有基于…

33 0 0

为语音开发者而生