声浪
来源丨机器之心 昨天,上海创智学院 OpenMOSS 团队联合初创公司模思智能(MOSI),正式发布了端到端音视频生成模型 —— MOVA(MOSS-Video-and-Audio)。 作为中国首个高性能开源音视频模型,MOVA 实现了真正…
来源丨千问Qwen 昨天,阿里正式开源Qwen3-ASR系列模型! Qwen3-ASR是由Qwen开发的一系列功能强大的语音识别模型,包括两个强大且全面的语音识别模型 Qwen3-ASR-1.7B 与 Qwen3-ASR-0.6B,以及一个…
项目资源 代码 & 语音样例:https://github.com/SirryChen/SpeechMedAssist 论文链接:https://arxiv.org/abs/2601.04638v1 Demo:https://speech.…
来源丨新智元 今天,MiniMax Music 2.5 震撼发布,凭借「格莱美级」音质和极致拟真人声,开创 AI 音乐新天花板。它不仅彻底消除中文演唱的「洋味儿」,更支持 14 种以上的结构标签精准控制。懂中文、懂音乐、更懂人性,这一波中国…
本文来源丨Amphion 当语音大模型(SLM)从“个人设备”走向“智能家居/车载/公共服务”等多人共享场景时,新的风险出现了:模型可能将用户A的私密日程、隐私信息,误传给用户B。简单来说,语音助手需要明确 “哪些话能说、该对谁说”,团队称…
本文来源丨蚂蚁灵波科技 从3000小时到整整20000小时。真实世界数据里的Scaling Law,直接喂出了个最强VLA(Vision-Language-Action)基座模型! 这就是蚂蚁灵波今天开源的具身智能基座模型——LingBot…
在即将举行的 ICASSP 2026 中,墨尔本大学 HEART AI LAB 共有五篇论文被正式录用,系统展示了在 Test-Time 自适应与增强策略以及多模态健康智能方向上的最新研究进展。 研究方向概览:Test-Time 自适应与增…
