
最新声浪
查看全部 →语音大模型对齐思路创新: TASU仅通过纯文本数据,大幅提升SLM的语音零样本性能
论文题目:《TASU: Text-Only Alignment for Speech Understanding》 原文链接:https://arxiv.org/pdf/2511.03310 这篇论文是上交大和思必驰等合作,提出了一个叫TA…
21 0 0
关于未来语音技术和应用趋势的10点看法
来源丨AI语音AI思考 任何一项新技术,都是螺旋式上升的。技术产生→催生应用创新→反哺技术→ 应用迭代→技术再升级……。语音技术,从2013年前的HMM-GMM为主导的语音识别(HTK上古工具包)和语音合成(HTS),到DNN的时代的Kal…
22 0 0
Maya1:开源语音合成模型,支持20+情绪,免费可商用
Maya1由 Maya Research 团队 推出的开源语音模型,一个专为生成富有情感和精确语音设计的语音模型。它能够通过自然语言描述进行语音设计,支持超过20种情感表达,如笑、哭、低语、愤怒等。 Hugging Face:https:/…
27 0 0
【交我学-16】一文了解几种不同的前沿流式语音翻译架构
AudioCC交我学 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。…
14 0 0
语音大模型综述:全面解读口语语音大模型(SLM)的发展历程与未来挑战
前言:今天arxiv发消息,CS板块不再接收未经同行评审的综述类文章,不好评论,只记得十年前,综述都是顶刊邀请,IEEE Fellow坐镇,再加上几个Senior,几年才有一篇,当宝贝一样来回读,近几年综述是挺多的。。。以后既然不再接收新的…
22 0 0
