语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
语音/音频处理学术速递[1.30]
每日语音速递每日语音速递
转载8 months ago
语音/音频处理学术速递[1.30]

语音合成语音识别
21 0 0
创智+模思发布开源版Sora2,电影级音视频同步生成,打破闭源技术垄断
语音小管家语音小管家
转载8 months ago
创智+模思发布开源版Sora2,电影级音视频同步生成,打破闭源技术垄断

来源丨机器之心 昨天,上海创智学院 OpenMOSS 团队联合初创公司模思智能(MOSI),正式发布了端到端音视频生成模型 —— MOVA(MOSS-Video-and-Audio)。 作为中国首个高性能开源音视频模型,MOVA 实现了真正…

端到端音视频生成模型
22 0 0
Qwen3-ASR开源:够稳定,能流式,多语言!
语音小管家语音小管家
转载8 months ago
Qwen3-ASR开源:够稳定,能流式,多语言!

来源丨千问Qwen 昨天,阿里正式开源Qwen3-ASR系列模型! Qwen3-ASR是由Qwen开发的一系列功能强大的语音识别模型,包括两个强大且全面的语音识别模型 Qwen3-ASR-1.7B 与 Qwen3-ASR-0.6B,以及一个…

语音识别
28 0 0
SpeechMedAssist | 健康咨询从“打字”走向“对话”,如何让语音大模型听懂病人?
语音小管家语音小管家
转载8 months ago
SpeechMedAssist | 健康咨询从“打字”走向“对话”,如何让语音大模型听懂病人?

项目资源 代码 & 语音样例:https://github.com/SirryChen/SpeechMedAssist 论文链接:https://arxiv.org/abs/2601.04638v1 Demo:https://speech.…

语音大模型
19 0 0
AI音乐生成模型MiniMax Music 2.5发布:段落级控制 + 物理级高保真
语音小管家语音小管家
转载8 months ago
AI音乐生成模型MiniMax Music 2.5发布:段落级控制 + 物理级高保真

来源丨新智元 今天,MiniMax Music 2.5 震撼发布,凭借「格莱美级」音质和极致拟真人声,开创 AI 音乐新天花板。它不仅彻底消除中文演唱的「洋味儿」,更支持 14 种以上的结构标签精准控制。懂中文、懂音乐、更懂人性,这一波中国…

语音合成
15 0 0
语音/音频处理学术速递[1.29]
每日语音速递每日语音速递
原创8 months ago
语音/音频处理学术速递[1.29]

语音识别语音合成
16 0 0
VoxPrivacy发布: 首个面向语音大模型的交互隐私评测基准
语音小管家语音小管家
转载8 months ago
VoxPrivacy发布: 首个面向语音大模型的交互隐私评测基准

本文来源丨Amphion 当语音大模型(SLM)从“个人设备”走向“智能家居/车载/公共服务”等多人共享场景时,新的风险出现了:模型可能将用户A的私密日程、隐私信息,误传给用户B。简单来说,语音助手需要明确 “哪些话能说、该对谁说”,团队称…

语音大模型
19 0 0
蚂蚁开源最大具身智能基座模型Lingbot-VLA,20000小时真机数据、性能吊打英伟达GR00T和π0.5
语音小管家语音小管家
转载8 months ago
蚂蚁开源最大具身智能基座模型Lingbot-VLA,20000小时真机数据、性能吊打英伟达GR00T和π0.5

本文来源丨蚂蚁灵波科技 从3000小时到整整20000小时。真实世界数据里的Scaling Law,直接喂出了个最强VLA(Vision-Language-Action)基座模型! 这就是蚂蚁灵波今天开源的具身智能基座模型——LingBot…

开源数据
25 0 0
语音/音频处理学术速递[1.28]
每日语音速递每日语音速递
原创8 months ago
语音/音频处理学术速递[1.28]

语音识别语音合成
16 0 0
ICASSP 2026|墨尔本大学 HEART AI LAB 5篇录用论文分享
语音小管家语音小管家
转载8 months ago
ICASSP 2026|墨尔本大学 HEART AI LAB 5篇录用论文分享

在即将举行的 ICASSP 2026 中,墨尔本大学 HEART AI LAB 共有五篇论文被正式录用,系统展示了在 Test-Time 自适应与增强策略以及多模态健康智能方向上的最新研究进展。 研究方向概览:Test-Time 自适应与增…

语音识别语音合成
15 0 0
‹1…4243444546…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6语音信号处理论文优选:Handling Background Noise in Neural Speech Generation7TIOBE 场景测试:汽车之家 汽车评测8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号