语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
谷歌 Magenta RealTime 2 开源:一台 MacBook 本地玩转实时音乐生成,附手把手部署教程
语音小管家语音小管家
转载4 months ago
谷歌 Magenta RealTime 2 开源:一台 MacBook 本地玩转实时音乐生成,附手把手部署教程

Google Magenta 团队发布并开源了Magenta RealTime 2(MRT2),一个 24 亿参数的实时音乐模型——你可以像演奏乐器一样使用它,并直接在 MacBook(Apple Silicon)本地运行。与"把提示词离线…

语音合成
16 0 0
AI编辑音频,全军覆没?上海交通大学等多机构联合发布MMAE基准测试
语音小管家语音小管家
原创4 months ago
AI编辑音频,全军覆没?上海交通大学等多机构联合发布MMAE基准测试

近年来,AI编辑技术取得了显著进展,推动生成模型从单一元素的编辑能力迈向更加灵活的交互式操作范式。在视觉领域,图像编辑模型(如 Nano-banana 2)已逐步走向成熟并进入实际生产流程,而以 Gemini-Omni 为代表的视频编辑模型…

AI编辑音频
26 0 0
基于机器学习的被动声学监测,智能识别贝类捕食行为
语音小管家语音小管家
转载4 months ago
基于机器学习的被动声学监测,智能识别贝类捕食行为

来源丨21db声学人 蛤蜊、海螺这类带壳海洋软体动物和天敌的捕食互动,深刻影响着海岸生态系统,但这类过程大多藏在水下,很难直接观察。贝类能够稳固岸线、净化海水、维系区域生物多样性,是海岸生态平稳运转的关键。可如今受海洋酸化、碎壳型捕食生物活…

被动声学监测
17 0 0
语音/音频处理学术速递[6.8]
每日语音速递每日语音速递
原创4 months ago
语音/音频处理学术速递[6.8]

语音合成语音识别
21 0 0
ICML 2026 | SwanSphere: 基于自回归的流式同步空间音频生成
语音小管家语音小管家
原创4 months ago
ICML 2026 | SwanSphere: 基于自回归的流式同步空间音频生成

空间音频生成要求模型同时处理声源语义、时间同步和三维方位关系。现有方法通常在生成质量、推理延迟和空间条件建模之间存在取舍:非流式扩散模型依赖较长上下文,难以用于实时场景;通用视频编码器主要关注语义内容,对全景视频中的朝向、运动轨迹和声源位置…

音频生成
24 0 0
INTERSPEECH 2026 | WhispEar: 把你的悄悄话转成正常语音
语音小管家语音小管家
原创4 months ago
INTERSPEECH 2026 | WhispEar: 把你的悄悄话转成正常语音

以下文章来源于Amphion 在隐私通话、声带受损恢复等场景中,耳语转正常语音(Whisper-to-Normal, W2N) 技术至关重要。但这一领域长期被一个“死结”困住:数据极度匮乏。 耳语缺乏声带振动和基频,声学线索严重退化,导致转…

语音转换
27 0 0
Foley-Omni:从单任务合成到一次生成完整视频音轨
语音小管家语音小管家
转载4 months ago
Foley-Omni:从单任务合成到一次生成完整视频音轨

以下文章来源丨NJU语音实验室 南京大学与Video Rebirth 等单位联合提出并开源 Foley-Omni。区别于仅同时支持多种单任务的通用生成模型,Foley-Omni 进一步面向完整视频音轨生成,在统一框架中联合建模语音、音效与音…

语音合成
25 0 0
语音/音频处理学术速递[6.5]
每日语音速递每日语音速递
原创4 months ago
语音/音频处理学术速递[6.5]

语音合成语音识别
18 0 0
从单模态迈向下一代多模态生成:港科大提出Talker-T2AV,将 TTS 拓展到音视频生成
语音小管家语音小管家
原创4 months ago
从单模态迈向下一代多模态生成:港科大提出Talker-T2AV,将 TTS 拓展到音视频生成

近日,HKUST Audio 团队推出新一代联合音视频生成模型 Talker-T2AV。该模型面向talking head 场景,将传统 TTS 从单一语音生成进一步拓展到 文本到音频+视频联合生成,能够同时生成自然语音与同步的人脸运动,为…

语音合成
26 0 0
CCF语音对话与听觉专委会论文导读(2026年第7期)
语音小管家语音小管家
转载4 months ago
CCF语音对话与听觉专委会论文导读(2026年第7期)

本期分享中国科学技术大学语音及语言信息处理国家工程研究中心研究团队近期发表在IEEE Transactions on Audio, Speech and Language Processing期刊上的2篇关于超低码率语音编解码器的研究。 0…

语音合成语音识别
27 0 0
‹1…1819202122…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号