来源:AI随想录,作者:William 论文标题: DashengTokenizer: One layer is enough for unified audio understanding and generation 论文链接: htt…
声浪
小米重磅突破:DashengTokenizer 用一层网络打通音频理解与生成,打破 VAE 垄断
19 0 0
创作一首新歌只需2秒!阶跃星辰开源音乐生成模型 ACE-Step 1.5
由阶跃星辰和ACE Studio联合发布的开源音乐生成模型ACE-Step 1.5,制作一首商业歌曲仅需 2-10 秒。 ACE-Step 1.5能“一人”包揽从创作端的作词、作曲、编曲,到制作端的制作人、录音师、混音师、母带师,再到前台歌…
15 0 0
语音降噪风雨六十载(上)——传统信号处理黄金时代
语音降噪是语音信号处理里面的一个经典领域,距离Schroeder在1965年首次提出语音降噪概念,距今已经60多年。在这60多年里,语音降噪从信号处理走向深度学习,对语音质量提升了一次又一次。语音降噪的目标是从麦克风接收的信号提取干净的语音…
18 0 0
小红书开源FireRed-OCR,2B 参数登顶文档解析榜单
来自小红书超级智能团队的FireRed-OCR,以仅 20 亿参数的轻量模型,在权威文档解析基准 OmniDocBench v1.5 上拿下端到端方案第一,综合得分 92.94%,超越 Gemini 3.0 Pro、DeepSeek-OCR…
22 0 0
美的AI研究院丨招聘端到端语音交互大模型算法研究实习生
美的集团(上海)有限公司-AI研究院 美的集团 AI 研究院成立于 2020 年初,是美的集团旗下一级专业研发平台单位。作为美的集团(世界 500 强企业)数智化转型的核心布局,AI 研究院的创立旨在汇聚全球顶尖人工智能人才,推动 AI 技…
155 0 0
面向聋人和听障人士的AI音频字幕技术发展
来源丨AI音频时代 新泽西理工学院(NJIT)和纽约大学(NYU)的研究人员正在通过一项新资助的项目,共同在数字无障碍领域取得突破性进展,该项目旨在让在线视频内容对聋人和听力障碍(DHH)观众更具包容性。 在未来三年内,凭借美国国家科学基金…
14 0 0
【交我学-26】门控注意力、线性注意力与扩散语言模型
AudioCC交我学 在当前大模型飞速发展的背景下,我们正在见证一系列基础架构的创新突破。本文将从技术角度深入解析门控注意力、线性注意力和扩散语言模型三大创新,探讨其设计动机、实现路径与发展趋势。 一、架构创新的共同驱动力 随着模型规模不断…
27 0 0
