12月3日,在澳门举办的IEEE SLT旗舰会议上成功举办了Codec-SUPERB Challenge。此次活动聚焦于Codec及语音语言模型(speech LM)领域学者之间的交流,特别邀请了五位领域内的专家学者(Moshi、Uniaudio、SemantiCodec、VoiceCraft和BNN的作者们),为大家带来了精彩的学术分享。
所有的投影片以及演讲视频都已经在以下网站公开:
github:https://github.com/ga642381/speech-trident/
youtube:https://www.youtube.com/playlist?list=PLJV_el3uVTsNnC37JYD8kBcNDI7CNJgum
bilibili:https://space.bilibili.com/335817915/video


以下是每位讲者分享的主题与亮点回顾:
🌟演讲人:Dr. Neil Zeghidour(https://lienz.github.io/)
🌟演讲亮点:我们将探讨音频语言模型的前沿创新,这种方法通过神经音频编解码器将音频信号离散化,统一音频生成与理解为自回归序列任务。我们将展示这一模型在无文本语音建模、零镜头语音转换、文本到音乐生成和实时口语对话等领域的突破,同时探讨如何在单一模型中整合分析与合成功能,解决多样化音频任务的潜力。最后,我们将展望其广阔的应用前景,并探讨推动发展面临的挑战。


Neil Zeghidour(Kyutai)


🌟演讲人:Dr.Shang-Wen Li(https://swdanielli.github.io/)

🌟演讲亮点:在本演讲中,我们将介绍VoiceCraft的关键技术突破。通过结合因果掩码和延迟堆叠的标记重排程序,利用变压器解码器架构,Encodec实现了高效的语音信号标记化。在语音编辑任务中,VoiceCraft 生成的语音自然度几乎与未经编辑的录音无异。在zero-shot TTS任务中,我们的模型在多样化的挑战性数据集上超越了 SOTA 模型(如 VALLE 和 XTTS-v2),表现始终优异。特别是在语音编辑评估方面,我们引入了高质量、真实的RealEdit数据集,推动了领域的发展。


Shang-Wen Li(Meta)

🌟演讲人:Dr.Dongchao Yang(https://dongchaoyang.top/)

🌟演讲亮点:本演讲将聚焦于通用音频基础模型的构建,涵盖文本到语音、文本到音频、歌唱语音合成、语音转换和语音对话 等多样化任务。我们将回顾 音频编解码器 和 音频建模策略 的发展历程,并展示我们在这些领域的最新研究进展。最后,将探讨构建通用音频基础模型所面临的挑战与未来潜在的发展方向,为音频生成任务开辟新路径。


Dongchao Yang(CUHK)


🌟演讲人:Prof.Wenwu Wang(https://www.surrey.ac.uk/people/wenwu-wang/)

🌟演讲亮点:本演讲将聚焦神经音频编解码器的最新进展,重点介绍新型超低比特率音频压缩技术 SemantiCodec。SemantiCodec 采用双编码器架构,通过自监督的 AudioMAE 语义编码器和声学编码器相结合,实现音频的高效压缩与标记化,每秒生成不到 100 个词块,同时保持高质量输出。与传统编解码器相比,它能够更好地保留语音和其他音频类型中的语义信息,适用于多语言音频处理。我们将通过基准测试展示其优越性能,并探讨未来研究方向。


Wenwu Wang(University of Surrey)


🌟演讲人:Prof.Minje Kim(https://minjekim.com/)

🌟演讲亮点:本讲座将探讨神经语音编解码器在低比特率条件下实现高质量语音的创新解决方案。我们提出LaDiffCodec,结合端到端编解码器与潜在扩散模型,通过解耦表示学习和信息重构,采用“中途填充”技术防止语音过于平滑,显著提升性能。此外,我们还探讨个性化编解码器,利用扬声器嵌入和感知相似性聚类,降低模型复杂性并提升语音质量。主观测试表明,这些方法在低比特率条件下实现了更高效的语音编码,为神经语音编解码器的发展开辟了新方向。


Minje Kim(UIUC)


Host: Hung-yi Lee(National Taiwan University)


Host: Haibin Wu(Microsoft)


🌟Codec-SUPERB Challenge论文汇报环节:


Yihan Wu(Renmin University)


Haohan Guo(CUHK)


Xiaohang Jiang(University of Science and Technology of China)


Jiaqi Li(CUHK Shenzhen)
💡 本次活动的成功离不开每一位讲者和参与者的热情投入!