昨天,火山引擎旗下豆包团队推出的豆包·语音播客模型,以三大核心技术突破重塑播客内容生产逻辑。这一模型基于流式技术实现文本到双人对话式播客的即时转换,生成的自然语音在流畅度、情感表现和语义连贯性上均达到专业录制水准,甚至能通过深度搜索功能在5…
声浪
已构建了200人规模(今年规划到三百)、兼具丰富的研究与落地经验的AI团队,曾在多个行业大模型有着落地商用经验,曾在ACL等顶会发表若干论文。核心成员毕业于或来自于剑桥大学,清华大学、哥大、华为、亚马逊、腾讯等顶尖机构和企业,团队短期内在机…
在复杂环境中保持清晰语音感知一直是助听设备与消费级耳机的核心挑战。传统主动降噪(ANC)技术虽能抑制环境噪声,但会无差别削弱所有声音,导致用户难以听清目标方向的语音(如对话者)。近年来,开放式耳机因佩戴舒适、减少耳道堵塞效应等优势备受关注,…
超星集团是我国专业的数字教育解决方案提供商和数字图书馆产品提供商,研发了数十个产品,成功地树立了多个优秀品牌。已数字化280万种中文电子图书,年数字化加工能力超过30万种,授权作者超过35万人,合作出版社超过300家,是目前国内最大的中文电…
字节跳动豆包大模型团队成立于 2023 年,致力于开发业界最先进的 AI 大模型技术,成为世界一流的研究团队,为科技和社会发展作出贡献。 豆包大模型团队在AI领域拥有长期愿景与决心,研究方向涵盖NLP、CV、语音等,在中国、新加坡、美国等地…
2025年IEEE国际声学语音与信号处理会议(International Conference on Acoustics, Speech, and Signal Processing,ICASSP 2025)苏州卫星会议即将于5月23日-2…
来源丨新智元 AI能写论文、画图、考高分,但连「看表读时间」「今天是星期几」都错得离谱?最新研究揭示了背后惊人的认知缺陷,提醒我们:AI很强大,但精确推理还离不开人类。 有些任务对人类来说轻而易举,但AI频频出错。比如,单词「strawbe…
当置身于一场音乐会,闭上眼睛,我们仍能凭借声音判断乐器的位置;在电影院,环绕音效让我们仿佛置身于电影场景之中。空间音频,作为一种能够模拟真实听觉环境的技术,正逐渐成为提升沉浸式体验的关键。然而,现有的技术大多基于固定的视角视频,缺乏对 36…
