10月21日,2023声纹识别研究与应用学术研讨会在天津海河假日酒店成功举办,本次会议为后疫情时代的第一次线下声纹识别研究与应用学术研讨会。会议由天津大学和中国科学院声学研究所共同主办,天津大学认知计算与应用天津市重点实验室和中国科学院声学研究所语音与智能信息处理实验室协办。标贝(青岛)科技有限公司、语音之家(北京)科技有限公司以及慧言科技(天津)有限公司提供赞助支持。


图一:与会专家合影


图二:全体参会人员合影
会议于21日上午9:00正式开幕,由天津大学智能与计算学部党委书记魏建国教授,大会主席天津大学王龙标教授先后致辞。对各位参会专家、学者和嘉宾表示热烈欢迎,对此次会议召开给予积极评价。开幕式由天津大学助理研究员王晓宝老师主持。


图三:会议开幕式
本次研讨会共安排了13场报告,其中包括2个主旨报告、11个特邀报告、1个专题讨论以及1个海报展示,共吸引了90余位参会者。本次会议围绕说话人语音特征的编解码与识别,时变与非言语语音声纹识别,鲁棒声纹识别,多模态声纹识别,声纹伪造检测等主题,大家分享各自最新成果和研究心得。本次研讨会做了一些创新尝试:第一次邀请了语音领域以外的专家分享视听觉研究相关技术;第一次邀请多位优秀青年教师做特邀报告;第一次组织海报展示。


图四:主旨报告
天津大学教授、慧言科技(天津)有限公司首席科学家党建武老师和中国科学院计算技术研究所研究员山世光老师出席研讨会,并做主旨报告。
党建武老师分享的题目是《说话人语音特征的编解码与识别》,党建武老师在报告中介绍了说话人的自然属性和社会属性编解码的侧面阐述和展望说话人识别的关键技术问题。
山世光老师分享的题目是《视觉讲话人检测与唇语识别研究》,山世光老师在报告中介绍了对唇语分析任务所面临的输入信息不确定、优化策略选择、标注数据获取困难、特定人自适应等问题上的探索,并对其在有效说话人检测、唇语识别、语音增强等下游任务上的应用效果进行介绍。


图五:环节1特邀报告
清华大学副研究员何亮老师分享的题目是《稳定学习与可解释的声纹识别》,何亮老师在报告中介绍了稳定学习与可解释的声纹识别,研究标签预测和数据加权,通过标签信息反向传播绘制声纹特征热力图,定量验证该因素的识别贡献。
中国科学院声学研究所研究员张鹏远老师分享的题目是《基于一致性的伪造语音检测技术》,张鹏远老师在报告中介绍了通过分析真假语音在声纹时序特征、音素发音和节奏信息等方面的差异,解决鉴伪系统的局限性和数据依赖性问题,以及提升检测系统的鲁棒性和泛化性。
清华大学副研究员王东老师分享的题目是《Target speech extraction: Attributing to Speaker or Content》,王东老师在报告中介绍了利用关键词语义从混合信号中分离出目标语音的方法,为混合语音在深度神经网络中的模式表达提供了新的视角。
中国科学技术大学副教授杜俊老师分享的题目是《多设备多场景远场说话人日志研究》,杜俊老师在报告中介绍了团队在CHiME-7评测中获得第一名的说话人日志方案,即多说话人编码记忆模块的说话人日志核心算法,然后通过跨通道注意力机制和麦克风阵列技术进行多轮迭代优化,提高算法面对不同应用场景的鲁棒性。


图六:环节2特邀报告
昆山杜克大学副教授李明老师报告的题目是《时变与非言语语音声纹识别》,李明老师在报告中介绍了时变声纹数据集Vox-CA和一种年龄解耦对抗学习方法以构建年龄不变的说话人表征,以及对非言语声音(笑声)用于说话人识别的初期探索。
上海交通大学教授钱彦旻老师报告的题目是《Build a Strong Speaker Identification System: Lessons from SV Challenges》钱彦旻老师在报告中根据团队参加近几年VoxSRC和CNSRC的心得,详细介绍了构建一个健壮说话人验证系统的一般流程和每个阶段所应用的关键性技术。
西北工业大学教授张晓雷老师报告的题目是《噪声与对抗环境下的鲁棒声纹识别》,张晓雷老师在报告中介绍了复杂声场环境和人造恶意攻击下的声纹识别仍然存在脆弱性,报告探索了自然噪声和远场环境下的分布式自组织阵列声纹识别以及声纹识别的对抗样本攻击与防御技术。
西北工业大学教授谢磊老师报告的题目是《说话人识别对抗攻击与说话人匿名化前沿进展》,谢磊老师在报告中介绍了说话人识别对抗攻击和说话人匿名化方面的研究,提出了音色保留的对抗攻击方法,并探索了两种说话人匿名化方案。


图七:环节3特邀报告
厦门大学副教授洪青阳老师报告的题目是《基于图结构建模的说话人日志研究》,洪青阳老师在报告中介绍了使用图卷积神经网络聚类方法,结合社区发现算法,实现了更精确的说话人日志系统,能够在多人会话中准确预测说话人人数并解决重叠语音问题。
香港中文大学(深圳)副教授武执政老师分享的题目是《基于深度学习的物理攻击模拟方法研究》,武执政老师在报告中介绍了声音伪造与物理攻击相结合为声纹验证带来了巨大挑战,该报告介绍了基于深度学习的物理攻击模拟方法,为增强物理攻击检测技术提供潜在帮助。
中国科学院自动化研究所副研究员易江燕老师分享的题目是《面向跨域数据的生成语音检测方法》,易江燕老师在报告中介绍了近年来,深度生成语音检测技术在封闭环境下表现出色,但在开放环境中应对未知类型音频性能大幅下降,讨论了潜在解决思路和未来挑战。
会议期间,与会代表还就16个海报报告进行了交流,在报告提问及茶歇环节,与会人员积极参与讨论,处处激发思维碰撞与火花,整个会场洋溢浓厚的学术氛围。


图八:海报报告交流
专题讨论环节由清华大学副研究员何亮老师担任主持人,同时还邀请了西北工业大学教授谢磊老师、中国科学院声学研究所研究员张鹏远老师、昆山杜克大学副教授李明老师、厦门大学副教授洪青阳老师、标贝(青岛)科技有限公司副总裁穆向禹先生和慧言科技(天津)有限公司首席技术官王宇光先生等6位学术界与工业界嘉宾就“声纹识别的机遇与挑战”进行专题讨论,共同探讨声纹识别及相关领域的前沿进展及未来趋势,对各位专家学者及产业界同仁后续开展科研攻关及企业产品落地提供了新的解决思路。


图九:专题讨论
会议闭幕式进行了会旗交接仪式并同步公布了2024声纹识别研究与应用学术研讨会将由中国科学院声学研究所主办,期待下一次的盛会!


图十:会议闭幕式