CTC常用解码方式 CTC常用的解码方式有以下几种: Greedy Search:贪心搜索,每一帧选择输出最大值,随后对结果进行规整处理。 CTC字符串上的Beam Search:束搜索,在CTC解码中进行Beam Search,输出nn个…
声浪
拾音汽车科技 拾音,以丰富客户的感知体验技术为使命,致力于提供的新技术及声学领域的服务、方案和产品。 我们是一家高新技术企业,是国内拥有仿真分析、试验测试和软件算法能力最为完备的供应商之一。真诚用心的服务和前瞻性的科技专长,使拾音成为汽车性…
知存科技 知存科技是一家专注于边缘人工智能的创业公司,成立于2017年10月,获得行业内巨头企业的近6亿元战略投资。公司自主开发了存算一体人工智能芯片,拥有强大性能和超低功耗。公司产品布局智能语音、智慧城市、可穿戴、智能家居等领域。 公司创…
中科信利 北京中科信利技术有限公司于2002年依托中国科学院声学研究所合作成立,是以开发语音技术为核心的高新技术公司。 公司专注于语音识别和音频信号处理相关技术和产品的研发,具有国际一流水平的语音识别/处理引擎、语音云系统和语音分析应用产品…
北京远鉴信息技术有限公司 北京远鉴信息技术有限公司(下称“远鉴”或“公司”)是一家高科技创新型企业,是国内领先的声纹技术及人工智能服务企业。公司发展始于为公安部、国家网信办等部委提供人工智能技术服务,具备成熟的实战经验。在多个核心技术远鉴拥…
慧言科技 慧言科技(天津)有限公司是一家业内领先的言语交互高新技术企业。公司基于自主可控“海河·谛听”言语交互意图理解大模型,研发语音识别、语音生成、语义理解、文本生成、知识问答、机器翻译、声纹识别等全链路言语交互技术,支持中英日韩法西俄德…
华控智加科技 北京华控智加科技有限公司由清华大学作为控股股东主导成立,是清华大学打造的人工智能产业化平台。首席科学家刘加教授是清华大学电子系知名人工智能学者,公安部国家重点研发计划专家组组长、全国刑事技术标准化委员会智能语音技术组委员,由其…
近期,大型语言模型(LLMs)在生成文本和执行各种自然语言处理任务方面展现出了卓越的能力,成为了强大的AI驱动语言理解和生成的基础模型。然而,仅依赖于基于文本模态的模型存在显著局限性。这促使了基于语音的生成模型的发展,使其能够更自然、直观地…
FunASR是由通义实验室开源的语音识别框架,集成了语音端点检测、语音识别、标点预测等领域的工业级模型的训练和部署,吸引了众多开发者参与体验和开发。 为了支持用户便捷高效的集成语音AI能力,FunASR社区推出了服务部署社区软件包,支持Do…
端到端语音到语音翻译的研究兴趣和趋势日益高涨。然而,大多数端到端模型都难以超越级联模型,即通过串联语音识别、机器翻译和文本到语音模型的层级式框架。主要挑战来自直接翻译任务的内在复杂性和数据的稀缺性。在本工作中,我们介绍了一种新颖的模型框架…
