作为清华大学深圳国际研究生院20周年院庆系列学术活动之一,中国计算机学会(CCF)语音对话与听觉专委会2021年学术年会12月17日在清华大学深圳国际研究生院召开,并通过语音之家微信视频号进行线上直播。


本次年会向全国语音相关领域的研究人员展示学术界和工业界的最新成果和发展趋势,致力于促进学术界和工业界之间的交流,共同创建学科发展的新方向。国家万人计划领军人才、中科院自动化所陶建华;中科院核心骨干特聘研究员,中科院声学所颜永红;全国劳动模范、百度语音部门负责人及首席架构师贾磊;北京信息科学与技术国家研究中心智能科学研究部常务副主任、清华大学郑方;上海交通大学人工智能研究院语音及语言处理中心主任、思必驰公司首席科学家俞凯应邀作特邀报告。120余人现场参会、校内外5500多人在线参会。



大会现场


一 会议开幕

会议由清华大学深圳国际研究生院人机语音交互实验室吴志勇副研究员主持。CCF语音对话与听觉专委会主任党建武教授,副主任俞凯教授先后致辞。清华大学深圳国际研究生院执行院长高虹代表深圳国际研究生院欢迎各位嘉宾莅临,并预祝年会成功举行。


高虹、党建武、俞凯致辞,吴志勇主持



嘉宾现场讨论


二 特邀报告

01 陶建华作特邀报告


中科院自动化所陶建华研究员作题为《个性化语音生成和分析》的特邀报告。他介绍了当前个性化语音合成领域遇到的主要挑战及解决方案,并分享了中科院自动化所近年来在个性化语音合成方向的研究进展,包括内容与音色分离的少样本生成、韵律与音色分解的极少样本合成、一句话语音合成等工作。此外,针对合成语音可能遇到的不良使用的问题,陶建华研究员还介绍了在生成语音鉴别领域做出的工作。



02 颜永红作特邀报告


中科院声学所颜永红研究员以《声学所语音识别最新进展及应用》为题,分享了声学所近年来的学术和工业成果。他指出当前语音大规模预训练模型的出现一方面推动行业发展、降低应用门槛,另一方面也给从事人员带来新挑战。声学所一直致力于构建完全自主的技术路线,其自研的语音平台已赋能多项学术研究和业界解决方案。在近年的新冠疫情中,声学所也利用语音技术提出基于咳嗽音的新冠检测方案,虽不能作为医学标准,但在大规模快速筛查方面具有优势。


03 贾磊作特邀报告


百度时代网络技术有限公司贾磊博士作《百度语音在建模技术、多模态和芯片方面的最新进展》主题报告。贾磊博士介绍了百度研发的基于流式Conformer的大规模语音识别模型SMLITA2,结合引入语言先验的PTR解码技术,实现了低延时的精准语音识别系统。贾博士还介绍了百度在自定义语音合成方向的进展,通过端到端对抗解耦技术,实现了对说话人、情感和阅读模式的定制化语音合成。在多模态领域,百度团队实现了利用视觉信息辅助人声分离、语音识别和语音唤醒等任务。此外,百度还将算法与硬件结合,新一代鸿鹄2代芯片内置全套百度语音的全双工交互技术,可以实现智能设备的语音交互。


04 郑方作特邀报告


清华大学郑方教授作题为《声纹识别应用的技术挑战》的主题报告。郑方教授提出学术界要关注场景驱动,融合创新,将目光从技术侧转向应用侧,在应用中发现问题,再尝试使用技术去解决问题。首先针对录音重放攻击检测的问题,郑方教授提出使用单分类模型替代二分类模型,通过仅对正常语音进行建模,解决重放语音模型区分性和泛化性弱的风险。针对声纹掩蔽与还原的问题,郑方教授提出通过学习掩蔽参数的方法恢复原始音频,大大提高了验证系统的准确率。最后,郑方教授对多模态认证的问题进行了展望。


05 俞凯作特邀报告


上海交通大学俞凯教授以《语音合成中的自然韵律多样性建模》为题,系统地介绍了在韵律建模方向做出的成果。俞凯教授首先介绍了语音韵律建模的常见思路,即使用韵律语义标签和基于参照语音的韵律模仿两种方法;接着分析了两者的优劣,并结合二者所长提出使用混合密度网络进行数据驱动的无监督韵律结构聚类,从而获得解耦出的韵律信息。俞凯教授提出的方法在跨说话人韵律克隆和韵律控制生成方向取得了显著的效果。


三 实验室&企业参观

嘉宾特邀报告结束后,在吴志勇副研究员的带领下,与会的老师同学们参观了北京大学深圳研究生院现代信号与数据处理实验室,实验室主任邹月娴教授向同学们展示了实验室在多媒体信息技术处理研究方向的一系列创新成果。随后,线下参会的老师和同学们前往深圳市北科瑞声科技股份有限公司参观。期间,公司副总经理程刚、黄石磊分别介绍了公司发展历史和产学研合作情况,展示了北科瑞声的全链条音频交互技术在医疗、交通、政务和金融等行业的应用,让参观的老师和同学们感受到了智能语音科技“赋能”多种行业的无限可能。

北科瑞声公司参观与交流


四 大会合影


查看和下载更多年会照片


链接:

https://pan.baidu.com/s/1GdBTwRrfxtqyNeAIOPNHBw

(提取码:8lv2)