语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
ICASSP 2026 | MEANSE: 基于平均速度流的高效生成式语音增强
语音小管家语音小管家
转载6 months ago
ICASSP 2026 | MEANSE: 基于平均速度流的高效生成式语音增强

语音增强(Speech Enhancement, SE)旨在提升降质语音的质量,其中流匹配(Flow Matching)等生成模型因其卓越的感知质量而备受关注。然而,基于流的模型需要多次函数评估(Number of Function Eva…

语音增强
31 0 0
语音/音频处理学术速递[4.2]
每日语音速递每日语音速递
原创6 months ago
语音/音频处理学术速递[4.2]

语音合成语音识别
25 0 0
突破零样本TTS音色克隆上限:LongCat-AudioDiT 的声音克隆艺术
语音小管家语音小管家
转载6 months ago
突破零样本TTS音色克隆上限:LongCat-AudioDiT 的声音克隆艺术

来源:龙猫LongCat 音频生成技术正在经历一场全新的范式迁移——从传统级联架构,逐步向端到端生成范式演进。长期以来,主流的做法是“曲线救国”:合成系统先将音频压缩成梅尔频谱图等中间表征,再依赖神经声码器“翻译”回波形。每一次转换都带来信…

语音合成
26 0 0
阿里发布图像生成与编辑统一模型 Wan2.7-Image
语音小管家语音小管家
转载6 months ago
阿里发布图像生成与编辑统一模型 Wan2.7-Image

来源丨千问大模型 今天,阿里发布图像生成与编辑统一模型 Wan2.7-Image 正式发布。 针对当前AI生图中的审美疲劳、色彩失控等痛点,Wan2.7-Image带来了更具“活人感”的人物生成、精准的色彩控制以及超长文本渲染能力。 体验…

图像生成
20 0 0
美团开源 LongCat-Next,仅3B参数实现文本到图像再到语音全模态统一处理
语音小管家语音小管家
转载6 months ago
美团开源 LongCat-Next,仅3B参数实现文本到图像再到语音全模态统一处理

来源丨AIGC Studio 近日,美团开源了一款名为 LongCat-Next 的原生全模态模型,该模型能够接受文本、语音、图像的输入,并生成相应的文本、语音、图像输出。 LongCat-Next不仅简化了多模态建模的复杂性,还在图像理解…

原生全模态模型
43 0 0
ICASSP2026 | WenetSpeech-Chuan:用于方言语音处理的多维标注大规模四川话语音语料库
语音小管家语音小管家
转载6 months ago
ICASSP2026 | WenetSpeech-Chuan:用于方言语音处理的多维标注大规模四川话语音语料库

语音理解与生成的飞速发展离不开大规模高质量语音数据集的推动。其中,语音识别(ASR)和语音合成(TTS)被公认为最首要的任务。但对于拥有约 1.2亿 母语使用者的川渝方言而言,受限于标注资源匮乏,研究进展缓慢,ASR 与 TTS 的表现始终…

语音合成语音语料库
28 0 0
语音/音频处理学术速递[4.1]
每日语音速递每日语音速递
原创6 months ago
语音/音频处理学术速递[4.1]

语音识别语音合成
26 0 0
NCMMSC被列入CCF推荐C类国际学术会议目录
语音小管家语音小管家
原创6 months ago
NCMMSC被列入CCF推荐C类国际学术会议目录

近日,中国计算机学会(CCF)正式发布了第七版《中国计算机学会推荐国际学术会议和期刊目录》(https://www.ccf.org.cn/Academic_Evaluation/By_category/)。 值得关注的是,全国人机语音通讯学…

NCMMSC学术会议
19 0 0
语音/音频处理学术速递[3.31]
每日语音速递每日语音速递
原创6 months ago
语音/音频处理学术速递[3.31]

语音合成语音识别
26 0 1
ICASSP 2026|MeanVC:基于平均流的轻量级流式零样本语音转换
语音小管家语音小管家
转载6 months ago
ICASSP 2026|MeanVC:基于平均流的轻量级流式零样本语音转换

零样本语音转换(Zero-shot VC)旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。日益丰富的应用场景对模型的流式推理能力提出迫切需求,亟需兼具快速、轻量与高保真特性的解决方案。然而现有流式方法依赖自回归(AR…

语音转换
22 0 0
‹1…3132333435…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6语音信号处理论文优选:Handling Background Noise in Neural Speech Generation7TIOBE 场景测试:汽车之家 汽车评测8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号