作者|吴翰林 审校| 段旭峰 王书琪 文章结尾有大消息! 传统的神经语言学方法通常将语言拆解为语音、词汇、句法、语义等独立的加工模块,并在高度控制的实验环境下分别进行研究。这种方法有助于我们理解语言认知的各个方面,但往往也因此缺少一个统一的…
声浪
语音识别模型Whisper可全面预测人脑自然语言活动
15 0 0
南洋理工大学丨AI驱动的空间感知型ANC算法
最近,南洋理工大学、西北工业大学、浙江大学联合在TASLP上发表了空间感知的多通道选择性主动噪声控制(Frequency-Direction Aware Multichannel Selective Fixed-Filter Active…
32 0 0
开源!OSUM-EChat — 语音理解驱动的端到端共情口语对话生成模型
共情(Empathetic)能力是实现自然人机语音交互的核心要素,其核心在于使机器能够感知并理解用户输入语音中的各类副语言信息(如年龄特征、性别相关语音特质、情绪状态及声音事件等),进而作出贴合用户状态的共情回应。近年来,端到端语音语言模型…
18 0 0
美团开源 Meeseeks 评测集:揭秘大模型的 “听话”能力
来源丨美团技术团队 针对大模型知识推理能力与指令遵循能力存在表现差异的现象,为推进指令遵循能力的系统化研究与精准评估,美团 M17 团队推出全新评测基准 Meeseeks,并在魔搭社区、GitHub、Huggingface等开源平台上线。…
24 0 0
台大李宏毅与微软合作提出STITCH:能够边说话边深度思考的口语语言模型
ChatGPT、DeepSeek 等语言模型具备「深度推理」(Reasoning)能力,这类模型会在回答问题前先进行一段较长的推论过程,使回答的品质大幅提升。 不过,这种「先停下来思考再作答」的方式,虽然能产生更高品质的回应,却不太适用于需…
32 0 0
Meta推出AI翻译功能,“短视频”迎来自动配音与口型同步
来源丨AI音频时代 近日,Meta 公司最新推出的Reels短视频AI音频翻译功能有了创造性突破。同一时间Meta正式为Facebook和Instagram的Reels功能推出了AI语音翻译功能。 Meta AI翻译功能最大亮点在于,它采用…
16 0 0
完全离线!开源实时语音识别神器,本地实时语音转文字,秒级延迟+说话人识别!
实时语音转文字(ASR)和说话人识别(Diarization)在多人会议、字幕生成和无障碍辅助中需求日益增长,但传统工具常需云端处理,存在隐私风险和延迟问题。 最近 GitHub 上出现了一款开源项目WhisperLiveKit,提供了完全…
30 1 0
