WenetSpeech 家族就像是一场前赴后继的饕餮盛宴。前赴后继是指 WeNet 社区的小伙伴们在数据的投入上前赴后继,不断探索新的边界,你方唱罢我登场;而饕餮盛宴,不是一道菜,而是源源不断的菜品,是社区给开发者、公司、研究人员不断的献礼…
声浪
近日,上海交通大学听觉认知与计算声学实验室关于音乐编辑方面的论文被本次IJCAI会议收录并做展示。该论文首次提出音乐编辑任务,并尝试将潜在扩散模型应用于解决该问题。同时提出了一系列策略提升了音乐编辑中的和谐性和一致性问题,以及长时音乐编辑带…
什么样的事情最有价值?难且正确的事情。把 1B 级别的大模型优化到和 200M级别模型相同水平的 RTF 同时 WER 维持代差,难道不是一件该令人亢奋的事情吗? --向前看,别回头 在两个月前的年度总结中,WeNet 社区已经开始向着更“…
Wespeaker 是wenet社区联合学界(上海交通大学、西北工业大学、深圳市大数据研究院)、业界(腾讯、地平线、思必驰、NVIDIA)面向研究和产品的说话人表征学习框架,wespeaker 具有高质量,轻量级,面向产品,支持工业级数据训…
上海声通信息科技股份有限公司作为交互式人工智能市场的领导者,具有极强的技术优势和突出的产品特点。公司基于自研的融合通信及人工智能两项核心技术,打造了丰富的、高度标准化的产品模块,为客户提供高效、稳定的产品体验。公司主要的业务场景为智慧城市、…
目 录 1.模型介绍 2.模型实现 3.流式推理 4.实验结果 2022年8月,58同城TEG-AI Lab语音技术团队完成了WeNet端到端语音识别的大规模落地,替换了此前基于Kaldi的系统,并针对业务需求对识别效果和推理速度展开优化,…
为了改进 Noisy Student Training 在非目标领域 ASR 上的性能,英伟达提出新型数据筛选方法 LM Filter。其利用不同解码方式的识别文本之间的差异来作为数据筛选条件,是一个完全无监督的筛选过程。在 AIShell…
本文是由张彬彬在第二届SH语音技术研讨会和第七届Kaldi技术交流会上对WeNet开源社区的一些工作上的整理,内容涵盖了 WeNet 的最新进展、新项目WeKws,WeSpeeker和WeTextProcessing的介绍,以及去年发布的两…
音识别是智能音箱、智能会议等 AIoT 应用的基石 ,在机器人生态中也同样发挥着举足轻重的作用。打造高准确率、高性能的语音识别引擎,才能给语音用户带来良好的体验。 在 AIoT 场景下,端侧(on-device)语音识别具有极致的安全性(隐…
继杭州云栖大会,阿里达摩院携手 CCF 开源发展委员会共同推出 AI 模型社区“魔搭” ModelScope 以来,达摩院率先向魔搭社区贡献 300 多个经过验证的优质 AI 模型,进行了全面开源开放。澜舟科技、深势科技、智谱 AI 等合作…
