声浪
ICASSP 2026丨智能语音信息处理团队18篇录用论文分享
近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享语音及语言信息处理国家工程研究中心智能语音信息处理团队中稿的18篇论文,论文方向涵盖语音识别、语音合成、话者识别、语音增强、情感识别、声音事件…
29 0 0
Qwen3-TTS全家桶开源上线!
Qwen3-TTS是由Qwen开发的一系列功能强大的语音生成,全面支持音色克隆、音色创造、超高质量拟人化语音生成,以及基于自然语言描述的语音控制,为开发者与用户提供最全面的语音生成功能。 依托创新的Qwen3-TTS-Tokenizer-1…
24 0 0
ICASSP 2026丨小米录用论文分享
近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享小米中稿的7篇论文。 1、ACAVCAPS: ENABLING LARGE-SCALE
18 0 0
VoiceSculptor——音色设计、风格可控的语音生成模型,技术报告来啦!
在AI语音合成领域,能精准听懂自然语言指令、实现细粒度控制的开源工具一直是行业痛点。近期,西工大音频语音与语言处理研究组(ASLP@NPU)与语图智能技术公司(Yutu Zhineng)、上海灵光乍现技术团队(Shanghai Linggu…
18 0 0
AutoArk开源GPA模型:一个架构搞定TTS、ASR和VC,0.3B 参数跑多语音任务
标题:Unifying Speech Recognition, Synthesis And Conversion With Autoregressive Transformers 链接地址:https://arxiv.org/pdf/260…
21 0 0
FlashLabs开源Chroma 1.0:实时、高保真语音克隆与对话的端到端模型
标题:FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning 链接:https://arxiv.o…
18 0 0
