面向听觉智能与物理AI的
人机交互开发者社区

发现模型、参与赛事、分享实践、连接同行,共创数据、模型与评测驱动的人机交互生态。

50k+
注册开发者
5.8k+
技术文章
268+
开源数据集
300+
技术课程

最新声浪

查看全部 →
超越级联系统:端到端语音大模型设计解析
转载a year ago
超越级联系统:端到端语音大模型设计解析

虽然文本大语言模型最近取得了很多的关注,但是对于人类而言,语音交互是更自然的方式。在语音交互常见中一个直接的方法是直接级联ASR-LLM-TTS这三个模型,然而这种直接的方式存在诸多问题。为了解决级联系统的问题端到端的语音大模型(Speec…

29 0 0
如何给AI一双“懂节奏”的耳朵?
转载a year ago
如何给AI一双“懂节奏”的耳朵?

如何将一段连续的、信息密度不均的波形,变成一串 AI 能够理解和处理的“密码”?关键在于语音分词器——它就像是 AI 的“语音耳朵”,负责将声音信号转换成离散的符号序列。 然而,现有的语音分词器大多采用固定帧率,比如每秒生成 75 个 to…

19 0 0

为语音开发者而生