Xmart青年论坛由上海交通大学跨媒体语言智能实验室(SJTU X-LANCE lab)创办,中国计算机学会语音对话专委会主办,语音之家协办,旨在邀请国内外优秀的青年学者分享其最新科研工作和成果,促进多元且深入的交流与合作。Xmart学生论坛作为其中一个系列,致力于邀请国内外知名高校有成体系工作的研究生,主要通过线上分享的方式,系统地介绍其科研成果和心得,为青年学生打造一个学术探讨,思维碰撞和多学科交叉融合的平台。
Xmart•学生论坛丨季圣鹏:端到端语音对话时代的机遇和挑战
形式:线上
时间:3月26日(周三) 14:00 ~ 16:00
报告嘉宾

季圣鹏,浙江大学DCD实验室赵洲老师的二年级硕士生。研究方向为离散化表征学习,可控语音合成,端到端多模态对话大模型。以第一作者身份在机器学习顶级会议ICLR,ACL,AAAI,ICASSP上发表主会长文多篇,以共同一作等身份在CCFA类/清华A类会议上发表论文十余篇,累计引用400+。长期担任ICML/ICLR/NeurIPS/ACL等会议审稿人。参与过工业界多个著名的多模态大模型工作,例如阿里巴巴语音实验室(原达摩院)的FunAudioLLM系列,通义千问基模团队的Qwen-Omni系列。个人代表作WavTokenizer在开源平台GitHub上作为独立项目累计获得1.1k Star,开启了统一声学表征离散化的单量化器时代。
报告摘要
以GPT-4o高级语音模式和Moshi为代表的端到端对话模型在最近吸引了大家的大量关注。随着语音模态和文本模态进一步深入对齐和融合,以及端到端对话模型智商和情商的涌现,我们坚信AGI的时代离我们并不遥远。本次分享将聚焦我们最近在这一方面的探索,包括Survey,Tokenizer,Models,Benchmark和Reasoning。具体来说,我将从WavChat出发,介绍端到端语音对话模型的基本定义。随后以WavTokenizer和UniCodec为例,重点介绍统一语音离散表征正式迈入低比特率和单VQ时代,并将结合计算机视觉领域的工作,探讨离散Codec范式未来潜在的挑战。随后进一步展示文本级联形式下,副语言信息的理解和生成模型-OmniChat, TextrolSpeech和ControlSpeech。最后将介绍首个可以评测语音对话模型理解情商的工作VoxDialogue和首个在推理端将RAG赋能语音对话模型的工作WavRAG。
参加方式
①
直播将通过语音之家微信视频号进行直播
手机端、PC端可同步观看
👇👇👇

②
腾讯会议参加
会议号:286-218-735

