面向听觉智能与物理AI的
人机交互开发者社区

发现模型、参与赛事、分享实践、连接同行,共创数据、模型与评测驱动的人机交互生态。

50k+
注册开发者
5.8k+
技术文章
268+
开源数据集
300+
技术课程

最新声浪

查看全部 →
谷歌Gemini 3.1 Pro增加音乐生成功能
转载8 months ago
谷歌Gemini 3.1 Pro增加音乐生成功能

来源丨新智元、AI音频时代 谷歌在 7.5 亿月活的 Gemini 中上线了 AI 音乐生成功能,输入一句话或一张照片,几秒就能得到一首带人声和歌词的完整歌曲。背后是 DeepMind 最新的 Lyria 3 模型,训练数据超 200 万首…

19 0 0
从“黑盒”到“透明”:Interspeech 2026音频推理挑战赛结果公布与方案分享
原创8 months ago
从“黑盒”到“透明”:Interspeech 2026音频推理挑战赛结果公布与方案分享

从多人对话中的语调起伏与逻辑重心,到环境音背后隐藏的空间几何与物体运动轨迹,再到复杂音乐中演奏技法与艺术情感的深层关联,音频理解不应止于结果的预测。为了透明评估音频模型的推理过程质量,避免通过语言偏见、训练数据偏见或错误的方法“猜中”答案,…

26 0 0

为语音开发者而生