语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
语音/音频处理学术速递[3.16]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.16]

语音合成语音识别
21 0 0
腾讯推出Covo-Audio:7B 参数打通听 - 说 - 思,全双工对话 + 情感共情拉满
语音小管家语音小管家
转载7 months ago
腾讯推出Covo-Audio:7B 参数打通听 - 说 - 思,全双工对话 + 情感共情拉满

论文标题:Covo-Audio Technical Report 论文链接:https://arxiv.org/pdf/2602.09823v1 当语音助手能听懂指令、生成语音时,却常陷入 “逻辑脱节、交互僵硬、音色难定制” 的困境,要么只…

语音合成语音识别
44 0 0
语音/音频处理学术速递[3.13]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.13]

语音识别语音合成
23 0 0
Fish Audio 开源 S2 文本转语音模型,支持1.5万种情感控制,单卡100ms极速推理!
语音小管家语音小管家
转载7 months ago
Fish Audio 开源 S2 文本转语音模型,支持1.5万种情感控制,单卡100ms极速推理!

来源丨RET开发者社区 传统的AI语音合成往往因缺乏情感表达而显得机械生硬。Fish Audio最新开源的文本转语音模型Fish Audio S2,致力于解决这一痛点。该模型能够生成包含清嗓、叹息、笑场等细微人类声学特征的语音。 模型权重、…

语音合成
31 0 0
AI生成同步音频的进化,声音制作人真正受到威胁的开始
语音小管家语音小管家
转载7 months ago
AI生成同步音频的进化,声音制作人真正受到威胁的开始

来源丨AI音频时代 AI似乎已经无处不在,而我们身处的内容产业,AI内容生成技术也像极了即将到来的暴风骤雨,但无论是否还要继续坚持,我们都应该去了解这里面发生了什么。而多年来,视频生成和音频生成一直像两个陌生人,分别待在不同的制造车间里。当…

AI生成同步音频
22 0 0
语音/音频处理学术速递[3.12]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.12]

语音合成语音识别
20 0 0
Emilia-NV:让ASR/TTS有“人味儿”的秘诀 | ICASSP2026
语音小管家语音小管家
转载7 months ago
Emilia-NV:让ASR/TTS有“人味儿”的秘诀 | ICASSP2026

我们平时说话,信息不只在“字面内容”里,还藏在各种副语言声音里:笑、喘气、叹气、咳嗽,以及“嗯/啊/哦”这类带态度的语气词。它们在真实对话里承担了大量功能: 表达情绪与态度:开心的笑、无奈的叹气、不耐烦的“哼” 组织对话节奏:思考时的“呃/…

语音合成语音识别
39 0 0
中国科研团队开发DBMIF框架实现骨导与气导语音的智能融合
语音小管家语音小管家
转载7 months ago
中国科研团队开发DBMIF框架实现骨导与气导语音的智能融合

来源丨21db声学人 在极低信噪比环境下,传统语音增强系统性能急剧下降,气导麦克风常被环境噪音淹没。近日,来自军事科学院国防科技创新研究院、中国科学院声学研究所和计算技术研究所的研究团队提出了一种名为深度平衡多模态迭代融合框架(DBMIF)…

语音增强
21 0 0
语音/音频处理学术速递[3.11]
每日语音速递每日语音速递
原创7 months ago
语音/音频处理学术速递[3.11]

语音识别语音合成
21 0 0
一个模型,搞定所有音频生成任务!多项基准SOTA | ICLR'26
语音小管家语音小管家
转载7 months ago
一个模型,搞定所有音频生成任务!多项基准SOTA | ICLR'26

来源丨新智元 港科大团队提出音频生成统一模型AudioX,只需一个模型,就能从文本、视频、图像等任意模态生成高质量音效和音乐,在多项基准上超越专家模型。团队同时开源了700万样本的细粒度标注数据集IF-caps与可控T2A评测基准T2A-b…

音频生成
23 0 0
‹1…3536373839…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6语音信号处理论文优选:Handling Background Noise in Neural Speech Generation7TIOBE 场景测试:汽车之家 汽车评测8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号