语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
阿里亲身入局具身智能!Qwen内部组团,通义千问技术负责人带队
语音小管家语音小管家
转载a year ago
阿里亲身入局具身智能!Qwen内部组团,通义千问技术负责人带队

来源丨机器之心 已经成为开源模型领头羊的 Qwen,终于要开始做机器人了。 昨天,阿里通义千问大语言模型负责人林俊旸在社交媒体上官宣,他们在 Qwen 内部组建了一个小型机器人、具身智能团队,同时表示「多模态基础模型正转变为基础智能体,这些…

资讯
28 0 0
NovaFlow从生成视频中提取动作流,实现零样本操控
语音小管家语音小管家
转载a year ago
NovaFlow从生成视频中提取动作流,实现零样本操控

来源丨机器之心 本文共同第一作者为李鸿宇(布朗大学博士生)和孙凌峰(Robotics and AI Institute 研究员,博士毕业于加州大学伯克利分校)。通讯作者付佳慧在 Robotics and AI Institute 任研究员,…

大模型
15 0 0
语音/音频处理学术速递[10.9]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[10.9]

语音合成语音识别
20 0 0
蚂蚁 Ling-1T 开源:基础语言模型、1T参数、MoE架构|所有信息都在这了
语音小管家语音小管家
转载a year ago
蚂蚁 Ling-1T 开源:基础语言模型、1T参数、MoE架构|所有信息都在这了

蚂蚁的 Ling-1T终于发了,大半夜的 中文叫百灵,1T 参数,Instruct 版本、非推理、MoE架构 HuggingFace:https://huggingface.co/inclusionAI/Ling-1T GitHub:htt…

语言模型
19 0 0
开源AI教育视频生成神器,3Blue1Brown风教学动画一键搞定!
语音小管家语音小管家
转载a year ago
开源AI教育视频生成神器,3Blue1Brown风教学动画一键搞定!

在互联网教育的浪潮中,教学视频已经成为知识传播的重要媒介。从数学、物理到计算机科学,优秀的动画讲解往往能让复杂知识瞬间变得清晰易懂。 比如大家熟知的 3Blue1Brown,通过精美的数学动画,把抽象的概念变得直观而优雅。 最近,新加坡国立…

视频生成
15 0 0
吴恩达执教的深度学习课程CS230秋季上新,新增GPT-5专题
语音小管家语音小管家
转载a year ago
吴恩达执教的深度学习课程CS230秋季上新,新增GPT-5专题

来源丨机器之心 吴恩达 (Andrew Ng) 执教的斯坦福 CS230 深度学习旗舰课程已更新至 2025 秋季版,首讲视频现已公开! 课程采用翻转课堂模式,学生需提前观看 Coursera 上的 deeplearning.ai 专项课程…

深度学习
15 0 0
语音/音频处理学术速递[10.8]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[10.8]

语音合成语音识别
12 0 0
南洋理工&腾讯最新 Rolling Forcing 解决流视频生成长期误差累积,连贯如一且长达数分钟!
语音小管家语音小管家
转载a year ago
南洋理工&腾讯最新 Rolling Forcing 解决流视频生成长期误差累积,连贯如一且长达数分钟!

论文链接:https://arxiv.org/pdf/2509.25161 项目链接:https://kunhao-liu.github.io/Rolling_Forcing_Webpage/ 图 1:Rolling Forcing 可在单…

大模型
15 0 0
语音/音频处理学术速递[10.7]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[10.7]

语音合成语音识别
15 0 0
语音“PS”来了!蚂蚁又放大招,ASR+TTS+编辑的全能语音模型开源了!
语音小管家语音小管家
转载a year ago
语音“PS”来了!蚂蚁又放大招,ASR+TTS+编辑的全能语音模型开源了!

在大模型的浪潮下,语音领域也正迎来“整合与统一”的趋势。 过去我们往往需要分别调用不同的模型来完成语音识别(ASR)、语音生成(TTS)和语音编辑等任务,不仅开发成本高,而且在真实业务中很难实现流畅的衔接。 而这一次,阿里蚂蚁团队直接给出了…

语言模型
26 0 0
‹1…7475767778…479›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:经济 金融 货币10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号