2025年4月,《语音识别:原理与应用》第3版出版,在京东、当当等平台均有销售。本书由洪青阳与李琳编著,第1版和第2版先后于2020年6月和2023年2月出版,内容涵盖声学特征提取、隐马尔科夫模型(HMM)、语言模型、加权有限状态转换器(W…
声浪
虽然扩散模型在视频生成领域展现出了卓越的性能,但是视频扩散模型通常需要大量的推理步骤对高斯噪声进行去噪才能生成一个视频。这个过程既耗时又耗计算资源。例如,HunyuanVideo [1] 需要3234 秒才能在单张 A100 上生成 5 秒…
比亚迪上周公开了一项名为"一种降噪裙板的制造方法、降噪裙板及车辆"的专利(CN119749612A),旨在提升裙板对宽频噪音的隔音降噪效果。 比亚迪在专利文件中指出,车辆(尤其是轨道车辆)运行时因车轮摩擦、撞击等情况产生较大的噪音,给附近居…
语音大语言模型(Spoken Language Model, SLM)正在引领人工智能领域的新一轮革新浪潮。正如文本自然语言处理从任务特定模型迈向通用大语言模型的演进,语音领域也正在经历类似转型。 为填补该领域系统性综述的空白,芝加哥大学、…
Orpheus TTS 是基于 Llama-3b 骨干网络的 SOTA 开源文本到语音系统。Orpheus 展示了使用 LLMs 进行语音合成的涌现能力。 项目链接:https://github.com/canopyai/Orpheus-T…
慧言科技(天津)有限公司是一家业内领先的言语交互高新技术企业。公司基于自主可控“海河·谛听”言语交互意图理解大模型,研发语音识别、语音生成、语义理解、文本生成、知识问答、机器翻译、声纹识别等全链路言语交互技术,支持中英日韩法西俄德维藏泰越等…
深圳路知音科技有限公司,是一家专注于CarPlay/Android Auto/MirrorLink手机与车机互联解决方案出海的公司,从2009年香港公司创立到2014年深圳公司成立,我们一直致力于车载影音导航的资源整合,研发及销售,为全球区…
汉王科技股份有限公司成立于1998年,作为国内人工智能产业的先行者,汉王科技潜心深耕二十余载,始终致力于多领域智能交互技术的研究与应用。在手写识别、光学字符识别(OCR)、人脸识别、笔迹输入等领域拥有多项具有自主知识产权的核心技术,其中手写…
