
最新声浪
查看全部 →标题:《RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS》 链接:https://arxiv.org/pdf/2512.04552 作者单位:阿里通义实验…
语音识别(ASR)作为高效转录语音的技术,在当今社会中扮演着越来越重要的角色。借助大语言模型的语音识别(LLM-ASR)性能出色,但通常会产生高昂的计算成本。探索LLM-ASR的高效训练策略以及扩展方法具有重要意义,以便获得给定计算成本(F…
最近 TTS 领域是真的越来越卷了,国内外各个互联网大厂轮番上阵。 阿里通义(Qwen)团队最近在开源界简直是“劳模”级别的存在,这边又悄悄上新了全新的Qwen3-TTS。 而且一出手就明显是冲着「自然度 + 多音色 + 多语言」这一代标准…
这篇论文主要想解决全双工口语对话系统(SDS)的核心难题——怎么让系统同时“听、说、思考”还不混乱,重点提出了一个“语义 VAD”当对话管理器(DM),用轻量级 LLM 搞定轮次切换,平衡了交互流畅度和计算效率。 原文链接:https://…
作为语音相关研究领域的旗舰国际会议,ASRU2025(IEEE Workshop on Automatic Speech Recognition and Understanding)将于12月6-10日在夏威夷檀香山举办。IEEE ASRU…
论文题目:《SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models》 论文地址:ht…
在具身智能迈向真实世界应用的关键阶段,大规模、高质量、多平台兼容的机器人操作数据已成为制约技术突破的核心瓶颈。 为破解这一难题,北京智源人工智能研究院联合蚂蚁天玑实验室、银河通用、乐聚、软通天擎、松灵、星海图、智平方、睿尔曼等产业先锋,以及…
