语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
腾讯AI Lab开源音乐生成大模型SongGeneration
语音小管家语音小管家
转载a year ago
腾讯AI Lab开源音乐生成大模型SongGeneration

来源丨机器之心 6 月 16 日,腾讯 AI Lab 推出并开源 SongGeneration 音乐生成大模型。 SongGeneration主要解决音乐 AIGC 中音质、音乐性与生成速度这三大共性难题,基于 LLM-DiT 的融合架构,…

语音合成
31 0 0
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
语音小管家语音小管家
转载a year ago
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练

GUIRoboTron-Speech团队投稿, 来源丨量子位 由美团和浙江大学联合推出的GUIRoboTron-Speech——让用户解放双手,直接对计算机“发号施令”。 这是首个能够直接利用语音指令和设备屏幕截图进行端到端(End-to-…

语音交互
23 0 0
INTERSPEECH2025|多语种语音识别的选择性调用方法
语音小管家语音小管家
转载a year ago
INTERSPEECH2025|多语种语音识别的选择性调用方法

当前全球现存超 7000 种语言,学术界和工业界对多语种语音识别(Multilingual Automatic Speech Recognition)的研究热度持续攀升,核心目标在于扩大语种覆盖范围并提升跨语言识别性能[1][2]。然而,基…

语音识别
18 0 0
RFWave:基于多频带Rectified Flow的高效音频波形重建
语音小管家语音小管家
转载a year ago
RFWave:基于多频带Rectified Flow的高效音频波形重建

本文介绍清华大学人机语音交互实验室(THUHCSI)在ICLR 2025发表的论文:RFWave:基于多频带Rectified Flow的高效音频波形重建。 本文由来自传音控股TEX AI的刘朋、独立研究员代东洋以及清华大学深圳国际研究生院…

大模型
14 0 0
电影声音剪辑师协会禁止使用AI生成式人工智能的电影参奖
语音小管家语音小管家
转载a year ago
电影声音剪辑师协会禁止使用AI生成式人工智能的电影参奖

来源丨电影声音网 在上周四发布的官方声明中,MPSE(电影声音剪辑师协会) 正式发布 2025 年度奖项将不受理任何使用生成式人工智能制作声音的成品作品,此举划定了奥斯卡、艾美奖及其他主要机构尚未实施的界限。 金卷轴奖主要表彰电影、电视和游…

8 0 0
Interspeech2025|基于LLM与自监督训练模型的中文方言语音识别对比研究
语音小管家语音小管家
转载a year ago
Interspeech2025|基于LLM与自监督训练模型的中文方言语音识别对比研究

大规模训练语料库极大地提高了语音识别(ASR)模型的性能。然而由于数据相对匮乏,口音和方言仍然是大多数ASR模型面临的挑战。自监督学习的最新进展表明,其与大型语言模型(LLM)相结合,可以有效提高低资源场景下的 ASR 性能。 近期,西工大…

语音识别
18 0 0
上线 3 天破 500 星,TEN VAD 与 Turn Detection 让 Voice Agent 对话更拟人
语音小管家语音小管家
转载a year ago
上线 3 天破 500 星,TEN VAD 与 Turn Detection 让 Voice Agent 对话更拟人

在真实对话里,插话、停顿、甚至讲话重叠都很常见。如果语音 AI 的回应太早、太晚、或者干脆没有回应,整个用户体验就会变得很“出戏”。对话中的“怎么说”往往比“说了什么”更重要。一段停顿可能代表犹豫、礼貌、自信等不同含义。为了让语音 AI 真…

大模型
19 0 0
语音/音频处理学术速递[6.18]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[6.18]

语音合成语音识别
12 0 0
语音/音频处理学术速递[6.17]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[6.17]

语音合成语音识别
10 0 0
21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!
语音小管家语音小管家
转载a year ago
21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!

在 AI 语音模型领域,不论开源还是闭源模型,能在全球排上前十的屈指可数,而 FishAudio 团队语音模型就在其列,每每有新模型上线,总能排进TTS-Arena TOP3之内。 近期,Fish Audio 推出了新一代的 TTS 语音模…

大模型语音合成
15 0 0
‹1…979899100101…479›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号