语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
Emilia-NV:让ASR/TTS有“人味儿”的秘诀 | ICASSP2026
语音小管家语音小管家
转载7 months ago
Emilia-NV:让ASR/TTS有“人味儿”的秘诀 | ICASSP2026

我们平时说话,信息不只在“字面内容”里,还藏在各种副语言声音里:笑、喘气、叹气、咳嗽,以及“嗯/啊/哦”这类带态度的语气词。它们在真实对话里承担了大量功能: 表达情绪与态度:开心的笑、无奈的叹气、不耐烦的“哼” 组织对话节奏:思考时的“呃/…

语音合成语音识别
35 0 0
中国科研团队开发DBMIF框架实现骨导与气导语音的智能融合
语音小管家语音小管家
转载7 months ago
中国科研团队开发DBMIF框架实现骨导与气导语音的智能融合

来源丨21db声学人 在极低信噪比环境下,传统语音增强系统性能急剧下降,气导麦克风常被环境噪音淹没。近日,来自军事科学院国防科技创新研究院、中国科学院声学研究所和计算技术研究所的研究团队提出了一种名为深度平衡多模态迭代融合框架(DBMIF)…

语音增强
17 0 0
语音/音频处理学术速递[3.11]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.11]

语音识别语音合成
17 0 0
一个模型,搞定所有音频生成任务!多项基准SOTA | ICLR'26
语音小管家语音小管家
转载7 months ago
一个模型,搞定所有音频生成任务!多项基准SOTA | ICLR'26

来源丨新智元 港科大团队提出音频生成统一模型AudioX,只需一个模型,就能从文本、视频、图像等任意模态生成高质量音效和音乐,在多项基准上超越专家模型。团队同时开源了700万样本的细粒度标注数据集IF-caps与可控T2A评测基准T2A-b…

音频生成
18 0 0
可穿戴超声技术:从实验室原型到实际应用的技术演进与未来展望
语音小管家语音小管家
转载7 months ago
可穿戴超声技术:从实验室原型到实际应用的技术演进与未来展望

来源丨21db声学人 近年来,可穿戴超声技术正在从实验室原型走向真实应用场景。这项技术能够实现连续、无创、深层次的组织监测,在医疗健康、人机交互、康复训练等领域展现出巨大潜力。 近日发表于IEEE Reviews in Biomedical…

可穿戴音频设备
16 0 0
语音/音频处理学术速递[3.10]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.10]

语音合成语音识别
17 0 0
【交我学-27】多语种 ASR 技术2025 顶会论文汇总
语音小管家语音小管家
原创7 months ago
【交我学-27】多语种 ASR 技术2025 顶会论文汇总

AudioCC交我学 在全球化浪潮下,多语种语音识别(Multilingual ASR)技术成为打破语言壁垒的关键支撑。从低资源语种适配到零资源场景突破,从模型效率优化到实际场景落地,近期 Interspeech、ICASSP 等顶会涌现出…

语音识别
35 0 0
阿里开源 Mobile-Agent-v3.5:一套真正“多平台可用”的原生 GUI Agent 基座模型
语音小管家语音小管家
转载7 months ago
阿里开源 Mobile-Agent-v3.5:一套真正“多平台可用”的原生 GUI Agent 基座模型

通义实验室这次带来的是Mobile-Agent-v3.5以及最新的原生 GUI Agent 模型家族GUI-Owl-1.5:面向桌面 / 移动 / 浏览器等多端统一的基础模型与训练范式,并已全面开源。 模型链接: GUI-Owl-1.5-2…

大模型
18 0 0
语音/音频处理学术速递[3.9]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.9]

语音合成语音识别
17 0 0
【语音技术和应用趋势分享系列(8)】龙虾时代的语音智能体
语音小管家语音小管家
转载7 months ago
【语音技术和应用趋势分享系列(8)】龙虾时代的语音智能体

以下文章来源于AI语音AI思考 本系列共十篇文章,旨在深入剖析之前提到的十大趋势。 关于未来语音技术和应用趋势的10点看法 文章将穿插科普知识、技术综述、发展路线,以及我个人和其他行业专家的思考。无论读者此前对语音技术与应用了解多少,都希望…

语音合成
19 0 0
‹1…4142434445…479›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号