语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
SkyReels-Audio:让肖像"动"起来 - Skywork AI开创全能音频驱动的人像视频生成技术
语音小管家语音小管家
转载a year ago
SkyReels-Audio:让肖像"动"起来 - Skywork AI开创全能音频驱动的人像视频生成技术

来源丨AI音频时代 SkyReels-Audio 是 Skywork AI 团队开发的一款创新框架,能够将静态图像或视频与语音输入相结合,生成高度逼真且唇形同步的说话人像视频。 该框架基于预训练的视频扩散变换器构建,支持无限长度的视频生成和…

大模型
13 0 0
ICME 2025 | MM-TTS:一种多阶段的多模态可控语音合成框架
语音小管家语音小管家
转载a year ago
ICME 2025 | MM-TTS:一种多阶段的多模态可控语音合成框架

本文由清华大学与腾讯优图实验室合作,研究基于多模态数据的可控语音合成。现有的面部驱动的语音合成方法由于数据质量限制,在鲁棒性和泛化性方面存在缺陷;而文本描述驱动的语音合成方法则存在多样性有限和精细控制不足的问题。另一方面,尽管多模态驱动的语…

语音合成
25 0 0
ACL 2025丨首个端到端语音大模型知识理解基准 VoxEval 发布
语音小管家语音小管家
原创a year ago
ACL 2025丨首个端到端语音大模型知识理解基准 VoxEval 发布

随着ChatGPT、Claude等文本大模型的爆火,人们开始期待更自然的语音交互方式。然而,当前的语音大模型在知识理解方面表现如何?它们能否像人类一样通过纯语音进行复杂的知识问答? 来自香港中文大学的研究团队在ACL 2025主会上发表了一…

语音大模型
22 0 0
语音/音频处理学术速递[7.1]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[7.1]

语音识别语音识别
19 0 0
AutoStyle-TTS:基于检索增强的自动风格匹配语音合成
语音小管家语音小管家
转载a year ago
AutoStyle-TTS:基于检索增强的自动风格匹配语音合成

本文由清华大学与腾讯AI Lab合作,研究基于大语言模型与检索增强生成(RAG)技术的自动语音风格匹配文本转语音合成(TTS)系统。当前主流TTS方法虽已实现高保真语音合成,但在语音风格控制方面仍依赖人工设定的提示语,难以自适应待合成文本内…

语音合成
28 0 0
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
语音小管家语音小管家
转载a year ago
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练

GUIRoboTron-Speech团队 投稿 来源 |量子位 由美团和浙江大学联合推出的GUIRoboTron-Speech——让用户解放双手,直接对计算机“发号施令”。 联系方式:wenkangh@zju.edu.cn 论文链接:htt…

语音识别大模型
16 0 0
语音/音频处理学术速递[6.30]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[6.30]

语音合成语音识别
16 0 0
AI眼镜——下一代交互与私人助理入口之战,高质量数据推动AI眼镜的智能跃迁
语音小管家语音小管家
原创a year ago
AI眼镜——下一代交互与私人助理入口之战,高质量数据推动AI眼镜的智能跃迁

AI眼镜的爆发与挑战 AI眼镜正从科技概念迅速走向大众消费市场,其作为穿戴式智能设备的独特优势,使其有望成为每个独立个体的私人助理,重塑人机交互的入口。近期,随着AI大模型与增强现实技术的深度融合,智能眼镜市场迎来了新的发展机遇。Meta与…

数据集
17 0 0
高效多语种ASR新方法:以音素连接语音与语言,用大语言模型替代WFST
语音小管家语音小管家
转载a year ago
高效多语种ASR新方法:以音素连接语音与语言,用大语言模型替代WFST

语音与语言如何连接,机器耳朵与大脑如何高效协同?本文工作给出了探索回答。在自动语音识别(ASR)中,基于音素的多语种预训练与跨语言微调因其出色的数据利用效率和相较于基于子词模型的性能优势,正受到越来越多的关注。然而,传统的加权有限状态转换器…

语言模型
29 1 0
谷歌杀疯!百万token神器免费开源,Claude和Codex都顶不住了?
语音小管家语音小管家
转载a year ago
谷歌杀疯!百万token神器免费开源,Claude和Codex都顶不住了?

来源丨新智元 谷歌扔下重磅炸弹:AI编程工具Gemini CLI,开源!免费!权限拉满!百万token上下文、千次调用额度、VS Code+终端全打通,谷歌彻底掀桌子:开发者的终端,要定了! 编程智能体,风云突变:编程智能体Gemini C…

资讯
10 0 0
‹1…9596979899…479›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号