SLT(Spoken Language Technology)是由IEEE信号处理学会(IEEE Signal Processing Society)语音与语言处理技术委员会(Speech and Language Processing Technical Committee,SLTC)主办的语音与语言处理研究领域的顶级国际会议。特定主题的挑战赛(Challenge)是 SLT 大会议程的精彩部分,每年从全球学者的提案(Proposal)中遴选。SLT 2024将于今年12月在澳门召开,在SLT 2024官方公布的Challenge Proposal收录结果中,由中国移动和清华大学联合承办的 FutureDial-RAG Challenge “Dialog Systems with Retrieval Augmented Generation”名列其中。
赛事背景


赛事亮点
FutureDial-RAG挑战赛基于第二版中国移动客服对话数据(Mobile Customer-Service Dialog,MobileCS2),具有以下鲜明特点:
1. 双语种知识密集型人人对话数据集发布
MobileCS2数据集来源于现实世界的真实对话场景,包含数据安全过滤后超六千通用户与运营商客服间的咨询类对话日志、基于多源数据库(含API、Knowledge Base、FAQ)的知识查询动作标签以及查询结果,是真实场景公开的业界首个知识密集型人人对话数据集,涵盖丰富的产品信息和常见用户问题。该数据集将提供中英文双语版本,为促进对话大模型、口语化人人对话系统、数据驱动的体系化AI等研究目标提供有力的数据支撑。
2. 助力人机对话模型及研究范式突破
目前,常见的人机对话系统无法有效融合最新与特定领域的知识,在高度专业化应用时缺乏准确性与及时性。检索增强生成(RAG)通过及时纳入来自外部数据库的最新知识来提高内容生成的质量,特别是在知识密集型任务中,可以纳入持续更新的知识并整合领域特定的信息,进一步提升对话系统的可靠性和用户体验满意度。各类人工智能方法,包括信息检索(Information Retrieval)、大语言模型(Large Language Model)、体系化人工智能(Holistic Artificial Intelligence)、半监督学习(Semi-supervised Learning)、强化学习 (Reinforcement Learning) 等,孕育着重要的技术发展趋势。本次公开的MobileCS2数据集不仅服务于竞赛任务,更有助于人机对话模型的创新及研究范式的突破。
3. 双赛道竞赛任务面向实际需求
本挑战赛聚焦对话系统,不仅关注任务相关知识的检索——对话数据的信息检索;还关注对话系统本身的构建——信息服务场景任务型对话系统的构建。
挑战赛具体分为两条赛道:
赛道一(Track 1)
基于知识库和对话上下文的信息检索
此赛道要求构建一个基于知识库和对话上下文的检索模型。在真实客服对话中给定上下文的情况下,检索出多源数据库中和当前上下文中最相关的知识片段,进行基于测试语料的离线客观评估。
赛道二(Track 2)
检索增强对话系统构建
此赛道要求构建一个检索增强对话系统,进行基于测试语料的离线客观评估和人工交互式评估。
赛事时间节点

参赛方式
第二届FutureDial-RAG挑战赛报名通道已正式开启!
1. 点击文末“阅读原文”链接下载并填写报名表,将填写完毕的报名表发送到指定邮箱;
邮箱:FutureDialRAG@gmail.com
报名截止日期:2024年5月9日
2. 组委会将对参赛队伍的资质进行审核,通过审核的队伍将有资格参加挑战;
3. 挑战赛相关数据下载方式,将提供给通过审核的队伍。
FutureDialRAG挑战赛组委会
冯俊兰 中国移动九天人工智能研究院
欧智坚 清华大学
黄 毅 中国移动九天人工智能研究院
赵江江 中国移动在线营销服务中心
陈 思 中国移动九天人工智能研究院
蔡予诚 清华大学
