为促进语音技术多元化发展、推动AI在特殊语音场景下的研究与落地,希尔贝壳联合昆山杜克大学正式开源“AISHELL-6-Whisper 语料库”。作为稀缺的耳语—正常音平行对齐资源,本数据集的发布旨在填补相关领域开源数据的空白,为学术界与工业…

最新声浪
查看全部 →标题:IndexTTS 2.5 Technical Report 链接:https://arxiv.org/pdf/2601.03888 发表日期:2026年1月9日 作者团队:bilibilidemo 页面:https://index-t…
近日,教育部官网更新了《职业教育专业目录(2021年)(更新时间:2025年12月)》,其中正式设立“开源技术应用”(高等职业教育专科专业 510220)和“开源技术开发与应用”(高等职业教育本科专业 310216)专业,标志着开源教育正式…
论文题目:Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation 作者:赛尔达尔·玉…
标题:TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding 链接:https://arxiv.org/pdf…
来源丨机器之心 以人工智能技术闻名的 OpenAI,终于也要搞硬件了,而且一上来就是和苹果正面对标。 最近,有关 OpenAI 硬件的消息越来越多。 今天一早,数码博主 @智慧皮卡丘透露了关于 OpenAI「To-go」硬件项目的最新细节。…
今天要分享的项目绝对是视频创作者和出海玩家的“年度福音”! 如果你做过视频本地化,你一定知道这个流程有多痛苦: 你要先分离音轨,再用 ASR 识别字幕,然后翻译,最后用 TTS 配音。 中间还会用到一些 API 高质量的服务,结果下来是不仅…
无论是语音产品的用户,比如经常使用语音输入法、语音转文字或语音聊天功能,还是开发者,都会面临一个问题:各家语音识别 API 都声称自己的识别准确率达到了 98% 以上,可为什么实际用起来感觉识别错误还是很多?“做了这么久,老板的名字都识别不…
