
最新声浪
查看全部 →AudioCC交我学 在最近的一次技术分享中,我们深入探讨了语音翻译(Speech Translation)领域的最新研究趋势 。从最初追求准确率的语音到文本(S2T)翻译,到如今追求生动性(Expressiveness)和实时性(Imme…
Qwen3-TTS是由Qwen开发的一系列功能强大的语音生成,全面支持音色克隆、音色创造、超高质量拟人化语音生成,以及基于自然语言描述的语音控制,为开发者与用户提供最全面的语音生成功能。 依托创新的Qwen3-TTS-Tokenizer-1…
近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享小米中稿的7篇论文。 1、ACAVCAPS: ENABLING LARGE-SCALE
在AI语音合成领域,能精准听懂自然语言指令、实现细粒度控制的开源工具一直是行业痛点。近期,西工大音频语音与语言处理研究组(ASLP@NPU)与语图智能技术公司(Yutu Zhineng)、上海灵光乍现技术团队(Shanghai Linggu…
近日,由复旦邱锡鹏担任首席科学家的模思智能发布了多说话人自动语音识别(ASR)模型 MOSS-Transcribe-Diarize,不但可以语音转文字,还可以将音频片段与对话中不同的说话者关联起来,性能超过了 GPT-4o、Gemini、豆…
标题:Unifying Speech Recognition, Synthesis And Conversion With Autoregressive Transformers 链接地址:https://arxiv.org/pdf/260…
科达,引领视讯与安防 苏州科达科技股份有限公司(以下简称“科达”)是领先的视讯与安防产品及解决方案提供商。 公司成立于1995年,2016年12月1日在上海证券交易所主板挂牌上市(股票简称:苏州科达,股票代码603660)。目前,公司拥有3…
