2022年AIWIN春季竞赛由SMG融媒体中心、SMG技术中心(上海东方传媒技术有限公司)、AR/VR技术及应用国家工程实验室和AIWIN携手,带来了文本语音驱动数字人表情口型竞赛,已正式开赛。语音之家作为本次竞赛的支持单位,欢迎大家报名参加。
竞赛官网详情:http://ailab.aiwin.org.cn/competitions/69


赛题描述

随着AI技术的发展,越来越多人开始用AI来控制数字人的动态行为。通过对接AI大脑(知识库),让AI数字人具备了特定场景下的识别信息、理解信息、反馈信息的智能人机交互能力。

然而在实际应用中,让数字人能够模拟真人情感和行为细节仍然是正在不断优化的行业研究课题。本次的赛题即为实际应用中的研究课题之一:如何让数字人可以基于对文本语音的理解,有更真实的表情和口型的表现力 。本次赛题将以SMG新闻主播“申䒕雅”数字人为虚拟主角,提供其中之人大量动捕数据的供机器学习,形成一套AI算法来通过文本语音驱动数字人表情口型。


竞赛关键要点



赛题背景

随着元宇宙的兴起,越来越多的厂商将战略资源投入到元宇宙和数字人。作为人机交互的重要组成部分,表情和口型驱动广泛用于游戏、电影、人机对话、虚拟主播等。不同于传统的动画和游戏,元宇宙的世界对表情和口型有更高的要求,从而使数字人(digital human)表情更加丰富、细腻;口型与表达的内容更加吻合,以提升元宇宙情感体验。

表情(expression)可被视作由无数个表情基准通过线性组合而计算得到,用公式来说就是e=Bd+b,其中e是expression,B是一组表情基准(即blendshape,可以是皱眉、闭合眼皮、嘴角扬起等,越细分表情约细腻),d是对应的系数(在这一组里面的权重),b是neutral。当下,Maya 等软件在制作数字人动画时均需通过 blendshape 参数来实现表情动画的定义。
我们的竞赛任务即希望通过给定的语音文本,通过 AI 算法生成对应的 blendshape 参数,从而在 Maya 等软件中可以驱动对应人物表情。
为便于选手快速了解 Blendshape,可参考以下短视频的演示,视频中左侧的参数列表例如“Jaw Open”等都代表了脸部某一细节如唇角上扬、口型开闭、眼睛张闭等程度,通过对这一系列参数(统称为 blendshape)的数值(0-1 之间)予以控制,将能刻画一个数字人某一帧的口型表情,而当多帧连续放映就形成了动画效果:



开赛时间
2022年7月5日

赛题任务

本次赛题将提供语音以及所对应的文本和blendshape参数,语音通过真人朗读文本获得,blendshape参数通过人脸面部捕捉设备获得。

参赛选手通过端对端训练语音/文本—blendshape参数,得到人脸表情驱动模型。在测试阶段,输入为语音或文本数据,输出为blendshape参数,通过blendshape参数,将用于驱动虚拟数字人面部表情。比赛任务即:
  • 输入:语音/文本数据
  • 输出:blendshape参数(要求25FPS,即1秒音频输出25个blendshape,训练集按同样要求采集生成)


赛题数据

A. 数据规模和内容覆盖


“1.wav”示例内容:略
B. 数据内容示例:

“1.txt”示例内容:床前明月光,疑是地上霜
“1.csv”示例内容:csv 格式文件,请具体参见「下载」-「数据示例」

赛题赛程和提交要求
线上比赛(A、B 榜)——成绩复核——终选答辩。

线上比赛阶段采用 A、B 榜模式,并在 PPT 和代码核验后挑选前 10 名进入终选答辩。(详细赛题信息请查看竞赛官网:http://ailab.aiwin.org.cn/competitions/69)


扫码加入选手社群


AIWIN世界人工智能创新大赛是世界人工智能大会(WAIC)的官方赛事品牌,配套世界人工智能大会开展已度过了5个春秋。作为上海市人工智能生态营造和数字化人才高地建设的重要活动,AIWIN已在国内外具备了一定的号召力和影响力,在2021春秋两个赛季,AIWIN吸引了来自美国、英国、德国、俄罗斯、加拿大、澳大利亚、马来西亚、捷克、法国等9个国家和国内29个省级行政区的5000余AI人才参与赛事,共有近两百家媒体4000多篇相关报道,点击阅读过千万。


AIWIN大赛官网

(http://ailab.aiwin.org.cn)

与全球人工智能企业和团队同台竞技吧!

更多赛事资讯请关注

世界人工智能创新大赛(AIWIN)

官方微信(微信ID:AIWINnovation)